DeepMind データベースには、科学的に知られているほぼすべてのタンパク質が含まれていました。約2億

昨年、DeepMind は数十万の 3D 構造を含むオープンソース データベースをリリースしました。

タンパク質(20,000 個の既知のタンパク質すべてを含む)人体。現在、この AlphaFold タンパク質構造データベースは 2 億個の構造にまで拡張され、科学的に知られているほぼすべてのタンパク質が含まれています。

タンパク質は、アミノ酸の鎖で構成されています。それらの機能を決定する複雑な三次元形状に折り畳まれます。タンパク質の構造をマッピングすることは、タンパク質が何をし、どのように機能し、どのようにうまくいかないかを理解するために重要です.しかし、構成アミノ酸に基づいてタンパク質の正確な構造を計算することは依然として困難です。これには通常、膨大な計算能力と工数が必要です。

アルファベットまではそうだった強力な人工知能 DeepMind は、この問題を解決するよう指示しました。最初に 100,000 の既知のタンパク質構造でトレーニングされたこのシステムは、何百万もの他のタンパク質の構造を予測する能力を開発しました。それぞれの決定には、数か月または数年ではなく、数分または数秒かかります。

最近、DeepMind は新しい大規模なデータベースを更新すると、現在、100 万種の約 2 億 1,400 万の構造が含まれています。これは、科学的に知られているほぼすべてのタンパク質をカバーしており、病気、ワクチン、抗生物質耐性、さらにはプラスチック汚染の治療に関する研究に大きな助けとなります.

25 テラバイトを超えるデータのタンパク質構造データベース全体は、Google Cloud Public Datasets からダウンロードできます。