Databáza DeepMind zahŕňala takmer každý proteín známy vede. Okolo 200 miliónov

Minulý rok DeepMind vydala open-source databázu obsahujúcu státisíce 3D štruktúr

proteíny, vrátane všetkých 20 000 známych proteínovĽudské telo. Teraz bola táto databáza proteínových štruktúr AlphaFold rozšírená na 200 miliónov štruktúr, vrátane takmer všetkých proteínov známych vede.

Proteíny sa skladajú z reťazcov aminokyselín, ktoréskladať do zložitých trojrozmerných tvarov, ktoré určujú ich funkciu. Mapovanie štruktúr proteínov je dôležité pre pochopenie toho, čo robia a ako fungujú a ako sa veci môžu pokaziť. Je však stále ťažké vypočítať presnú štruktúru proteínu na základe jeho základných aminokyselín. To si zvyčajne vyžaduje obrovské množstvo výpočtového výkonu a človekohodín.

Tak to bolo až do Alphabetunasmerovala svoju výkonnú umelú inteligenciu DeepMind na vyriešenie tohto problému. Systém, ktorý bol pôvodne trénovaný na 100 000 známych proteínových štruktúrach, vyvinul schopnosť predpovedať štruktúry mnohých miliónov iných proteínov, pričom určenie každej trvá minúty alebo sekundy, a nie mesiace alebo roky.

Nedávno DeepMind vydal nový veľký rozsahaktualizácia databázy, ktorá teraz obsahuje asi 214 miliónov štruktúr z milióna druhov. To zahŕňa takmer každý proteín, ktorý veda pozná, čo je obrovskou pomocou pre výskum liečby chorôb, vakcín, rezistencie na antibiotiká a dokonca aj znečistenia plastmi.

Celú databázu proteínovej štruktúry s viac ako 25 terabajtmi údajov je možné stiahnuť z Google Cloud Public Datasets.