L'anno scorso, DeepMind ha rilasciato un database open source contenente centinaia di migliaia di strutture 3D
Le proteine sono costituite da catene di aminoacidi chepiegarsi in intricate forme tridimensionali che ne determinano la funzione. La mappatura delle strutture delle proteine è importante per capire cosa fanno e come funzionano e come le cose possono andare storte. Tuttavia, è ancora difficile calcolare l'esatta struttura di una proteina in base ai suoi aminoacidi costituenti. Questo di solito richiede un'enorme quantità di potenza di calcolo e ore di lavoro.
Questo è stato il caso fino a Alphabetha diretto la sua potente intelligenza artificiale DeepMind per risolvere questo problema. Inizialmente addestrato su 100.000 strutture proteiche conosciute, il sistema ha sviluppato la capacità di prevedere le strutture di molti milioni di altre proteine, ciascuna delle quali impiega minuti o secondi per essere determinata, anziché mesi o anni.
Di recente, DeepMind ha rilasciato una nuova versione su larga scalaaggiornamento del database, che ora comprende circa 214 milioni di strutture di un milione di specie. Questo copre quasi tutte le proteine note alla scienza, il che è un enorme aiuto per la ricerca sui trattamenti per malattie, vaccini, resistenza agli antibiotici e persino inquinamento da plastica.
L'intero database della struttura proteica di oltre 25 terabyte di dati può essere scaricato da Google Cloud Public Datasets.