Il database DeepMind includeva quasi tutte le proteine ​​conosciute dalla scienza. Circa 200 milioni

L'anno scorso, DeepMind ha rilasciato un database open source contenente centinaia di migliaia di strutture 3D

proteine, comprese tutte le 20.000 proteine ​​conosciutecorpo umano. Ora questo database delle strutture proteiche AlphaFold è stato ampliato a 200 milioni di strutture, comprese quasi tutte le proteine ​​conosciute dalla scienza

Le proteine ​​sono costituite da catene di aminoacidi chepiegarsi in intricate forme tridimensionali che ne determinano la funzione. La mappatura delle strutture delle proteine ​​è importante per capire cosa fanno e come funzionano e come le cose possono andare storte. Tuttavia, è ancora difficile calcolare l'esatta struttura di una proteina in base ai suoi aminoacidi costituenti. Questo di solito richiede un'enorme quantità di potenza di calcolo e ore di lavoro.

Questo è stato il caso fino a Alphabetha diretto la sua potente intelligenza artificiale DeepMind per risolvere questo problema. Inizialmente addestrato su 100.000 strutture proteiche conosciute, il sistema ha sviluppato la capacità di prevedere le strutture di molti milioni di altre proteine, ciascuna delle quali impiega minuti o secondi per essere determinata, anziché mesi o anni.

Di recente, DeepMind ha rilasciato una nuova versione su larga scalaaggiornamento del database, che ora comprende circa 214 milioni di strutture di un milione di specie. Questo copre quasi tutte le proteine ​​note alla scienza, il che è un enorme aiuto per la ricerca sui trattamenti per malattie, vaccini, resistenza agli antibiotici e persino inquinamento da plastica.

L'intero database della struttura proteica di oltre 25 terabyte di dati può essere scaricato da Google Cloud Public Datasets.