L'année dernière, DeepMind a publié une base de données open source contenant des centaines de milliers de structures 3D.
Les protéines sont constituées de chaînes d'acides aminés quiplier en formes tridimensionnelles complexes qui déterminent leur fonction. Cartographier les structures des protéines est important pour comprendre ce qu'elles font, comment elles fonctionnent et comment les choses peuvent mal tourner. Cependant, il est encore difficile de calculer la structure exacte d'une protéine en fonction de ses acides aminés constitutifs. Cela nécessite généralement une énorme quantité de puissance de calcul et d'heures de travail.
C'était le cas jusqu'à Alphabeta dirigé sa puissante intelligence artificielle DeepMind pour résoudre ce problème. Initialement formé sur 100 000 structures protéiques connues, le système a développé la capacité de prédire les structures de plusieurs millions d'autres protéines, chacune prenant des minutes ou des secondes à déterminer, plutôt que des mois ou des années.
Récemment, DeepMind a publié une nouvelle version à grande échellemise à jour de la base de données, qui comprend maintenant environ 214 millions de structures d'un million d'espèces. Cela couvre presque toutes les protéines connues de la science, ce qui est d'une grande aide pour la recherche sur les traitements des maladies, les vaccins, la résistance aux antibiotiques et même la pollution plastique.
L'intégralité de la base de données sur la structure des protéines de plus de 25 téraoctets de données peut être téléchargée à partir des ensembles de données publics Google Cloud.