Imaginez une encyclopédie en plusieurs volumes où le déplacement d’une simple virgule dans le premier tome modifierait le sens d’un chapitre entier situé dans le dernier. C’est, en substance, la complexité vertigineuse du génomeGénome Génome désigne l'ensemble du matériel génétique d'un organisme vivant, constitué de longues molécules d'ADN (ou d'ARN pour certains virus) qui contiennent toutes les instructions biologiques nécessaires à son développement, son… humain. Pour tenter de déchiffrer cette structure tridimensionnelle et dynamique, Google DeepMind vient de franchir une nouvelle étape avec AlphaGenome, un modèle d’intelligence artificielle présenté le 28 janvier dans la revue Nature.
- AlphaGenome peut analyser 1 million de bases d’ADN simultanément, doublant la capacité du précédent modèle de référence.
- L’IA prédit comment une mutation d’une seule lettre peut altérer 11 processus biologiques distincts, y compris l’épissage de l’ARN.
- Bien qu’il surpasse les outils actuels pour la recherche fondamentale, le modèle n’est pas encore adapté au diagnostic clinique individuel.
Ce nouvel outil promet de changer la manière dont les généticiens interprètent notre patrimoine génétique, en reliant des mutations ponctuelles à leurs conséquences fonctionnelles, parfois situées à grande distance sur le brin d’ADN.
Une vision élargie du « livre de la vie »
Jusqu’à récemment, le modèle de référence dans ce domaine, nommé Borzoi, était capable d’analyser des séquences d’ADN longues de 500 000 bases. AlphaGenome repousse cette limite en prenant en compte un contexte d’un million de blocs de construction (bases) à la fois. Selon les chercheurs, cette capacité accrue permet de mieux saisir les interactions à longue distance qui régissent l’expression des gènes.
Anshul Kundaje, biologiste computationnel à l’Université de Stanford, souligne que cette avancée n’est pas uniquement quantitative. « AlphaGenome n’est pas seulement un modèle plus gros en termes de longueur de contexte, c’est véritablement un bond en avant dans son utilité globale », explique-t-il.
Le génome humain, fort de ses 3 milliards de bases, ne se lit pas comme un texte linéaire. Il s’apparente davantage à un livre « pop-up » complexe, où les pages se replient sur elles-mêmes. Une instruction située à une extrémité peut, par le jeu des repliements tridimensionnels de l’ADN, contrôler un gène situé physiquement très loin sur la chaîne linéaire. AlphaGenome est conçu pour repérer ces relations spatiales souvent invisibles pour les modèles précédents.
Décrypter la grammaire biologique
Le défi est colossal. Les gènes, qui codent pour les protéines, ne représentent qu’une fraction de l’histoire. Entre ces séquences se trouvent de vastes étendues d’ADN non codant, longtemps qualifiées à tort d’ADN poubelle. Ces zones contiennent en réalité une grammaire biologique essentielle : ponctuation, instructions de régulation et marques structurelles qui dictent quand et comment les gènes doivent être activés, un mécanisme étroitement lié à l’épigénétique.
AlphaGenome a été entraîné sur 5 930 points de données issus d’études sur l’ADN humain et 1 128 sur l’ADN de souris. Sa mission : prédire comment les variations de séquence affectent 11 processus biologiques distincts, tels que les niveaux d’activité des gènes ou l’épissage de l’ARN (le processus de découpage et recollage des molécules messagères).
Peter Koo, biologiste computationnel au Cold Spring Harbor Laboratory, note que le modèle atteint une résolution impressionnante, capable de cibler des points biologiquement importants à la base près, là où Borzoi travaillait par blocs de 32 bases.
L’intelligence collective distillée
Pour atteindre ce niveau de performance, AlphaGenome ne repose pas sur une innovation unique, mais sur une ingénierie astucieuse combinant plusieurs techniques éprouvées. L’une d’elles est la « distillation d’ensemble » (ensemble distillation).
Le principe consiste à pré-entraîner plusieurs copies du modèle sur de l’ADN ayant subi des mutations informatiques. Ces modèles agissent comme des « enseignants » pour un modèle étudiant unique, qui fait la moyenne de leurs résultats. Peter Koo compare cette méthode à un panel de 60 professeurs d’histoire relatant le même événement : « Si vous considérez le consensus sur lequel tous les historiens s’accordent, ce qui se recoupe dans leurs récits est probablement ce qui se rapproche le plus de la vérité. » Ce consensus tend à être plus fiable que n’importe quel modèle individuel.
Des applications prometteuses mais encadrées
Les résultats sont là : AlphaGenome identifie les changements d’activité génique dans certains types de cellules avec une précision 14,7 % supérieure à celle de Borzoi2. Cette polyvalence est saluée par Judit García González, généticienne à la Ichan School of Medicine au Mont Sinaï. Selon elle, l’outil simplifie considérablement la tâche des chercheurs qui devaient auparavant jongler avec plusieurs logiciels, chacun ayant ses propres biais, pour prédire les conséquences fonctionnelles d’une variation génétique.
Les applications potentielles sont vastes : identification de mutations motrices de cancers, compréhension des maladies rares, ou encore conception de séquences d’ADN synthétiques, un domaine qui bénéficie déjà des avancées des ciseaux génétiques CRISPR.
Pour Anshul Kundaje, l’architecture actuelle de ce type de modèle a atteint son plafond de verre. Le prochain grand saut ne viendra pas nécessairement d’algorithmes plus complexes, mais de la génération de nouveaux types de données biologiques pour nourrir ces intelligences artificielles.
Questions fréquentes
Qu’est-ce qu’un alphagénome ?
AlphaGenome : l’IA de Google décrypte la grammaire de l’ADN grâce à une architecture de deep learning de pointe conçue par les chercheurs de DeepMind. Ce dispositif innovant possède la capacité d’analyser des fragments génomiques d’une longueur phénoménale, pouvant s’étendre jusqu’à un million de paires de bases, afin d’en identifier les fonctions biologiques. Les résultats obtenus lors des tests comparatifs sont impressionnants : l’outil a atteint ou dépassé le niveau d’excellence des technologies actuelles dans 25 des 26 scénarios d’évaluation. En traitant des séquences aussi vastes avec une telle précision, cette solution logicielle marque un tournant majeur dans la compréhension de nos codes génétiques complexes. Grâce à cette puissance de calcul, la recherche en génomique bénéficie désormais d’un allié de taille pour explorer les mystères du vivant. Cette avancée technologique promet d’accélérer considérablement les découvertes médicales et biologiques dans les années à venir.
Quelle est la définition d’un métagénome ?
AlphaGenome : l’IA de Google décrypte la grammaire de l’ADN, ouvrant la voie à une meilleure compréhension de la complexité biologique, notamment à travers l’étude du métagénome. Ce concept scientifique fait référence à la totalité du matériel génétique récupéré directement depuis un échantillon environnemental spécifique. Il regroupe les séquences d’ADN de l’ensemble des microbes, qu’il s’agisse de bactéries, de virus ou de champignons, cohabitant dans un même habitat comme le sol, les océans ou même l’intestin humain. Plutôt que de se limiter à l’analyse d’un seul organisme cultivé isolément en laboratoire, cette approche globale permet d’appréhender la diversité et les fonctions d’une communauté microbienne entière dans son état naturel. En examinant ce vaste réservoir de gènes, les chercheurs peuvent identifier des espèces jusqu’alors inconnues et mieux saisir les interactions vitales au sein d’un écosystème. Il s’agit donc d’une cartographie génétique collective qui révèle la richesse biologique invisible de notre monde. Cette méthode transforme notre vision de la biodiversitéBiodiversité La biodiversité désigne l'intégralité du tissu vivant de notre planète, englobant la diversité génétique au sein des populations, la variété des espèces animales, végétales et microbiennes, ainsi que la multiplicité… microscopique.
Quels sont les 3 types de mutations génétiques ?
AlphaGenome : l’IA de Google décrypte la grammaire de l’ADN pour identifier les trois types fondamentaux de variations génétiques. La première catégorie regroupe les substitutions, qui consistent en l’échange d’une unité chimique par une autre au sein de la séquence. Ensuite, les phénomènes d’insertion ou de délétion correspondent au gain ou à la perte de quelques maillons de la chaîne moléculaire. La troisième classe concerne les modifications structurelles massives, souvent appelées remaniements chromosomiques de grande envergure. Au-delà de ces piliers classiques, la science répertorie également des anomalies plus atypiques et moins récurrentes. Cette compréhension approfondie du code génétique est essentielle pour la recherche médicale moderne.
Quel est l’ADN des Français ?
AlphaGenome : l’IA de Google décrypte la grammaire de l’ADN, et cette avancée technologique résonne avec l’expérience d’un individu dont les croyances ont été bouleversées en 2021. Suite à un présent reçu de ses camarades, il a réalisé un examen génétique révélant une lignée bien plus diverse qu’il ne l’imaginait. Bien que son profil soit intégralement européen, la segmentation géographique a suscité l’étonnement. Les statistiques indiquent une prédominance de l’Europe centrale avec 42,4 %, complétée par une influence italienne s’élevant à 29,3 %. Le reste de son code génétique, soit 28,3 %, prend sa source en Grande-Bretagne. Cette découverte inattendue a été perçue de manière très positive par l’intéressé. Elle prouve que les analyses biologiques modernes permettent de redéfinir notre propre histoire avec une précision remarquable.









La discussion