IA & santéIA & Science

AlphaGenome Atlas : ce que la cartographie de 9 milliards de variants change réellement

Lancé par Google DeepMind le 8 septembre 2026, AlphaGenome Atlas met à disposition des prédictions sur les effets moléculaires de neuf milliards de substitutions possibles d’une seule lettre dans le génome humain. Il ne s’agit ni de neuf milliards de mutations observées chez des patients, ni d’un catalogue de diagnostics, mais d’une carte calculée à partir du génome de référence. L’enjeu est donc moins de célébrer son volume que de comprendre ce que cette infrastructure permet de prioriser, ce qu’elle ne démontre pas et dans quelles conditions ses résultats peuvent être utilisés de manière responsable.

01

Ce que Google DeepMind a réellement publié

AlphaGenome Atlas est une base de prédictions pré-calculées à partir d’AlphaGenome, le modèle de génomique de Google DeepMind. Pour chaque position du génome humain de référence, l’équipe a simulé les trois substitutions possibles d’une base de l’ADN par une autre. Cet espace théorique produit environ neuf milliards de variants mononucléotidiques, souvent abrégés SNV. Le mot « atlas » désigne donc une exploration systématique de possibilités, pas un recensement de variants réellement présents dans la population.[1][2]

La ressource représente environ un pétaoctet de données. Elle est accessible aux chercheurs par un portail Web gratuit pour les usages académiques, ainsi que par une interface de programmation dédiée. Google DeepMind annonce aussi une intégration à Google Antigravity et prévoit un accès commercial par Google Cloud, sans calendrier détaillé au moment de la vérification.[1][4]

L’Atlas associe aux variants plusieurs prédictions d’effets moléculaires et un score synthétique, nommé AlphaGenome Variant Impact ou AVI. Ce score combine des informations issues d’AlphaGenome et d’AlphaMissense afin de classer des variants dans les régions codantes et non codantes. Un score élevé signale une priorité d’examen, mais ne constitue pas à lui seul une preuve de causalité ni un diagnostic.[1][2]

La prudence clinique est explicite dans la documentation de Google DeepMind. AlphaGenome et l’Atlas ne sont ni validés ni approuvés pour un usage clinique. Ils ne doivent pas remplacer un avis médical, une analyse génétique réglementée ou une validation expérimentale.[1][4]

02

Ce qui est réellement nouveau

Le modèle AlphaGenome n’est pas apparu avec l’Atlas. Il avait déjà été décrit dans un article de Nature publié en janvier 2026. Cet article présente un modèle capable de traiter jusqu’à un million de paires de bases et de prédire des milliers de signaux fonctionnels, notamment l’expression des gènes, l’épissage de l’ARN, l’accessibilité de la chromatine, la fixation de facteurs de transcription et certains contacts entre régions du génome.[3]

La nouveauté principale réside dans le changement d’échelle et d’accès. Au lieu de lancer une prédiction pour chaque variant étudié, les chercheurs peuvent interroger une base où les effets de chaque substitution possible ont déjà été calculés. Ce pré-calcul réduit le coût d’exploration initial et facilite la comparaison de variants sur l’ensemble du génome.

L’autre apport est l’ambition de relier les régions codantes, qui servent directement à produire des protéines, aux régions non codantes, qui participent notamment à la régulation. Ces dernières concentrent une grande part de la variation humaine et restent difficiles à interpréter. L’AVI propose une mesure commune pour les prioriser, mais sa portée doit être évaluée séparément de celle du modèle sous-jacent, car l’étude consacrée à l’Atlas était encore une prépublication au 6 octobre 2026.[2][3]

Cette distinction est essentielle. L’article de Nature apporte une évaluation par les pairs du modèle AlphaGenome. Il ne constitue pas une validation indépendante de toutes les fonctions de l’Atlas, du score AVI ou de chaque prédiction contenue dans la base.

Executive MBA AI & Business Transformation aivancity
aivancity

Executive MBA AI & Business
Transformation

Le MBA repensé pour l’ère de l’IA. Pour dirigeants expérimentés qui veulent piloter la transformation de leur organisation. Paris, Nice & Dubai.

12 mois — Part-time 10 ans d’expérience min. Early bird 20 000 € Paris · Nice · Dubai
03

Comment fonctionne AlphaGenome Atlas

AlphaGenome appartient à la famille des modèles « séquence vers fonction ». Il reçoit une séquence d’ADN et prédit des mesures biologiques que des expériences de laboratoire pourraient observer dans certains tissus ou types cellulaires. Pour estimer l’effet d’un variant, le système compare les prédictions obtenues avec la séquence de référence et avec la séquence modifiée.

Le modèle analyse un contexte pouvant atteindre un million de paires de bases. Cette longueur vise à tenir compte de relations qui ne se trouvent pas immédiatement à côté du variant. Son architecture combine des couches convolutives, adaptées aux motifs locaux, et des mécanismes de type transformer, utilisés pour représenter des dépendances plus lointaines. Les sorties couvrent 5 930 pistes génomiques humaines et 1 128 pistes murines, réparties entre onze types de signaux.[3]

L’Atlas applique ce mécanisme à très grande échelle. Il stocke les différences prédites entre la séquence de référence et chaque substitution possible, puis propose des outils pour rechercher un variant, comparer ses effets selon les tissus et repérer des motifs réglementaires récurrents. Google DeepMind indique avoir identifié plus de 2 500 motifs de séquence dans cette analyse.[2]

L’AVI ajoute une couche de classement. Il agrège des signaux issus d’AlphaGenome et, pour les variants qui touchent les protéines, d’AlphaMissense. Cette agrégation peut accélérer le tri de listes très longues. Elle peut aussi masquer des divergences entre les signaux si le score est lu sans examiner les prédictions détaillées.

Référentiel technologique

Capacité ou contrainte Ce qu’il faut comprendre
Périmètre Environ neuf milliards de substitutions possibles d’une seule base, calculées à partir du génome humain de référence. Ce ne sont pas neuf milliards de mutations observées.
Contexte du modèle Jusqu’à un million de paires de bases en entrée afin de représenter des effets locaux et certaines relations réglementaires plus éloignées.
Sorties biologiques 5 930 pistes humaines, 1 128 pistes murines et onze types de signaux, dont expression, épissage, chromatine et contacts génomiques.
Score AVI Score de priorisation combinant AlphaGenome et AlphaMissense. Il classe des variants, sans prouver leur causalité ni leur caractère pathogène.
Volume Environ un pétaoctet de prédictions pré-calculées, soit plus de trente fois la taille annoncée de la base AlphaFold.
Accès Portail académique gratuit, API pour les usages non commerciaux et intégration annoncée à Antigravity. Accès commercial prévu sur Google Cloud.
Statut scientifique Le modèle AlphaGenome est publié dans Nature. L’étude propre à l’Atlas et au score AVI était une prépublication au 6 octobre 2026.
Usage clinique Aucune validation ni approbation clinique annoncée. Les prédictions doivent rester des hypothèses à examiner et à valider.

Google DeepMind qualifie certaines performances de l’Atlas de référence. Cette formulation reste une affirmation des auteurs tant que des équipes indépendantes n’ont pas reproduit les comparaisons avec les mêmes données, les mêmes partitions et des critères définis à l’avance. La taille de la base ne constitue pas non plus un indicateur de précision.

Une analyse indépendante rapportée par Live Science souligne cette différence entre accessibilité et rupture scientifique. Plusieurs experts voient dans l’interface un outil utile, tout en rappelant que les modèles de séquence vers fonction existaient déjà et que la validation en laboratoire reste indispensable. La valeur actuelle de l’Atlas se situe donc dans l’échelle, l’unification et la facilité d’exploration, plus que dans la démonstration d’une compréhension complète du génome.[5][6][7]

MSc Data Management aivancity
aivancity

MSc Data Management

Pilotez la gestion stratégique et opérationnelle de la donnée : acquisition, analyse, gouvernance. Titre RNCP niveau 7 (Bac+5).

1 à 2 ans — Bac+5 Bac+3 à Bac+5 Alternance ou initiale Campus Paris-Villejuif
Découvrir le programme → Titre RNCP niveau 7

04

Pourquoi cette infrastructure compte pour la recherche

L’intérêt immédiat de l’Atlas est la priorisation. Un séquençage peut faire apparaître un grand nombre de différences par rapport au génome de référence. Les biologistes doivent ensuite identifier celles qui méritent une expérimentation, une étude familiale ou une analyse clinique complémentaire. Une base pré-calculée peut réduire cet espace de recherche en faisant remonter les variants dont les effets moléculaires prédits sont les plus cohérents avec l’hypothèse étudiée.

Cette approche est particulièrement utile pour le génome non codant. Une variation située en dehors d’un gène peut modifier l’activation d’un promoteur, la fixation d’un facteur de transcription, l’épissage d’un ARN ou l’accessibilité d’une région de chromatine. L’Atlas rassemble ces effets potentiels dans une même interface, là où plusieurs outils spécialisés étaient auparavant nécessaires.

Dans les maladies rares, la valeur potentielle tient à la vitesse de tri. Google DeepMind présente un cas lié au gène DNM1 dans lequel l’Atlas a aidé à identifier un variant non codant créant un site d’épissage incorrect. L’effet moléculaire a ensuite été confirmé expérimentalement. Ce cas montre une utilité possible dans une chaîne de recherche, mais une observation réussie ne mesure pas la sensibilité, la spécificité ou le taux d’erreur dans l’ensemble des maladies rares.[1][2]

À l’échelle des cohortes, l’équipe rapporte une analyse de plus de 54 000 génomes de la UK Biobank. Le regroupement de variants rares selon leurs effets moléculaires prédits aurait permis d’identifier 22 % d’associations non codantes supplémentaires. Une autre analyse centrée sur l’indice de masse corporelle a fait ressortir 19 régions génétiques en se limitant au 1 % de variants non codants les mieux classés. Ces résultats suggèrent un gain de puissance statistique et de priorisation, pas un lien clinique démontré pour chaque variant. [1][2]

Pour les organisations scientifiques, l’enjeu est aussi celui de la gouvernance des données. Un pétaoctet de prédictions peut accélérer l’accès à l’information, mais exige des versions stables, des identifiants traçables, des métadonnées sur les tissus, des règles de citation et des mécanismes permettant de reproduire une analyse lorsque le modèle ou la base évoluent.

05

Ce que les résultats permettent réellement d’affirmer

Les preuves disponibles sont de nature différente. L’article de Nature évalue AlphaGenome sur des tâches techniques. La prépublication consacrée à l’Atlas évalue le score AVI et présente plusieurs applications. Les exemples de maladie rare et de cohorte montrent des usages possibles. Ils ne répondent pas tous à la même question et ne doivent pas être additionnés comme une preuve générale de validité clinique.

Évaluation Résultat publié Lecture prudente
Pistes génomiques AlphaGenome atteint le meilleur résultat rapporté dans 22 des 24 tâches de prédiction de pistes génomiques. Évaluation publiée dans Nature sur des jeux de test définis par les auteurs. Une bonne prédiction moléculaire ne garantit pas une interprétation clinique correcte.
Effets de variants Le modèle égale ou dépasse les meilleurs modèles externes dans 25 des 26 évaluations présentées. Les comparateurs varient selon la tâche. Des modèles spécialisés peuvent rester préférables dans certains contextes et les résultats ne couvrent pas tous les variants humains.
Cas DNM1 Un variant non codant priorisé est associé à un épissage anormal, puis confirmé par une expérimentation. Étude de cas informative, mais insuffisante pour estimer le taux de succès dans d’autres maladies, gènes ou populations.
UK Biobank Plus de 54 000 participants et 22 % d’associations non codantes supplémentaires selon l’analyse publiée par l’équipe. Gain statistique rapporté dans une prépublication. Il ne démontre ni causalité biologique générale ni bénéfice clinique.
Indice de masse corporelle Dix-neuf régions génétiques sont mises en évidence après sélection du 1 % de variants non codants les mieux classés. Résultat de priorisation sur un caractère complexe, influencé aussi par de nombreux mécanismes biologiques et environnementaux.
Analyse indépendante Une prépublication indépendante décrit une sous-estimation fréquente de l’amplitude des effets et des difficultés pour relier certains éléments distants à leurs gènes cibles. Ce travail critique n’était pas encore évalué par les pairs. Il confirme néanmoins un point déjà reconnu dans l’article de Nature : la régulation à longue distance reste difficile.

Google DeepMind qualifie certaines performances de l’Atlas de référence. Cette formulation reste une affirmation des auteurs tant que des équipes indépendantes n’ont pas reproduit les comparaisons avec les mêmes données, les mêmes partitions et des critères définis à l’avance. La taille de la base ne constitue pas non plus un indicateur de précision.

Une analyse indépendante rapportée par Live Science souligne cette différence entre accessibilité et rupture scientifique. Plusieurs experts voient dans l’interface un outil utile, tout en rappelant que les modèles de séquence vers fonction existaient déjà et que la validation en laboratoire reste indispensable. La valeur actuelle de l’Atlas se situe donc dans l’échelle, l’unification et la facilité d’exploration, plus que dans la démonstration d’une compréhension complète du génome.[5][6][7]

MSc Data Management aivancity
aivancity

MSc Data Management

Pilotez la gestion stratégique et opérationnelle de la donnée : acquisition, analyse, gouvernance. Titre RNCP niveau 7 (Bac+5).

1 à 2 ans — Bac+5 Bac+3 à Bac+5 Alternance ou initiale Campus Paris-Villejuif
Découvrir le programme → Titre RNCP niveau 7

06

Ce que l’Atlas ne permet pas encore de conclure

AlphaGenome prédit des conséquences moléculaires à partir de l’ADN. Il ne prédit pas directement l’apparition d’une maladie chez une personne. Entre un effet sur l’expression d’un gène et un phénotype clinique interviennent le développement, les interactions entre gènes, l’environnement, les traitements, l’âge et de nombreux facteurs encore mal compris.[3]

Le modèle reste limité pour certaines interactions réglementaires distantes, notamment au-delà de 100 000 paires de bases. Les auteurs signalent aussi des difficultés pour reproduire des effets propres à certains tissus ou états biologiques, une couverture plus faible des gènes non codants et l’absence d’évaluation sur la prédiction de génomes personnels. Sa couverture par espèces se limite à l’humain et à la souris.[3]

L’Atlas se concentre sur les substitutions d’une seule base et inclut aussi de nombreux petits variants observés. Il ne résume pas toute la diversité génétique. Les grandes insertions, délétions, réarrangements, variations du nombre de copies et combinaisons de plusieurs variants peuvent produire des effets qui ne se déduisent pas d’une mutation isolée.

Les performances dépendent enfin des données expérimentales utilisées pour apprendre les signaux biologiques. Les tissus, types cellulaires et populations les mieux documentés sont susceptibles d’être mieux représentés. Sans évaluation par sous-groupes, un score global peut masquer des différences importantes de fiabilité.

07

Données génétiques, biais et responsabilité

L’Atlas public est une base de prédictions calculées sur un génome de référence, et non une base de dossiers médicaux. Le risque change lorsqu’un laboratoire lui soumet des variants provenant de participants ou de patients. Dans l’Union européenne, les données génétiques permettant d’identifier une personne appartiennent aux catégories particulières protégées par l’article 9 du RGPD. Leur traitement exige une base juridique appropriée, une finalité définie et les garanties prévues pour la recherche ou les soins.[8][9]

La pseudonymisation ne rend pas automatiquement un génome anonyme. Une séquence génétique est durable, fortement individualisante et peut renseigner indirectement sur des proches. Les organisations doivent donc limiter les données envoyées, séparer les identifiants, documenter les accès, encadrer les transferts et vérifier les conditions de conservation du portail ou de l’API.

Les biais de représentation posent un second problème. Si les données de référence, d’entraînement ou de validation décrivent mieux certaines ascendances et certains tissus, les variants issus d’autres populations peuvent être classés avec moins de fiabilité. Une priorisation inégale peut orienter les budgets expérimentaux et, à terme, renforcer des écarts déjà présents dans la recherche biomédicale.

Le score AVI doit aussi être protégé contre le déterminisme génétique. Il exprime une estimation d’impact moléculaire, pas une certitude sur l’avenir médical d’une personne. Une interface simple peut donner l’illusion d’une réponse définitive. Les équipes doivent conserver l’accès aux signaux détaillés, indiquer l’incertitude, confronter plusieurs sources et réserver toute interprétation clinique à des professionnels qualifiés.

Enfin, l’échelle matérielle mérite d’être documentée. Le pré-calcul et le stockage d’un pétaoctet de données mobilisent des ressources informatiques importantes. Aucune mesure publique suffisamment détaillée de l’énergie, de l’eau ou des émissions associées à la création et à l’exploitation de l’Atlas n’a été identifiée au 6 octobre 2026. Il serait donc prématuré d’en quantifier l’empreinte, mais légitime d’attendre des indicateurs comparables et vérifiables.

08

Ce qu’il faudra observer maintenant

La première étape sera la publication évaluée par les pairs de l’étude consacrée à l’Atlas et au score AVI. Les évaluations les plus utiles devront séparer la capacité à retrouver un variant déjà connu de la capacité à prioriser de nouveaux variants, sur des jeux de données indépendants et définis avant l’analyse.

Il faudra ensuite mesurer la robustesse selon les ascendances, les tissus, les maladies et les catégories de variants. Les résultats devront être comparés à ceux de modèles spécialisés, à des scores de référence et, lorsque c’est possible, à des expériences fonctionnelles. Une mesure moyenne ne suffira pas pour décider d’un usage en contexte sensible.

La gestion des versions sera tout aussi déterminante. Un variant peut recevoir un score différent après une mise à jour du modèle ou des données. Les chercheurs devront pouvoir retrouver la version interrogée, les paramètres, le génome de référence, les sorties détaillées et les règles de calcul de l’AVI.

Enfin, l’ouverture commerciale annoncée devra préciser les conditions de confidentialité, de propriété des résultats, de disponibilité et de portabilité. AlphaGenome Atlas peut devenir une infrastructure importante pour formuler plus rapidement des hypothèses. Sa portée réelle dépendra toutefois de la qualité des validations indépendantes, de l’équité entre populations et de la capacité à maintenir une frontière claire entre priorisation algorithmique, preuve biologique et décision clinique.

Pour aller plus loin

Pour replacer AlphaGenome Atlas dans l’évolution de la génomique, de la recherche scientifique augmentée et de la validation humaine en santé, découvrez également ces analyses du blog aivancity.

Sources

[1] Google DeepMind, 8 septembre 2026. AlphaGenome Atlas: Molecular Predictions for 9 Billion Human DNA Variants. Consulter la source

[2] Cheng, J. et al., septembre 2026. AlphaGenome Atlas: In Silico Mutagenesis of the Entire Human Genome Improves Prioritization and Interpretation of Non-Coding Variants. Prépublication medRxiv. Consulter la prépublication

[3] Avsec, Ž. et al., Nature, 2026. Advancing Regulatory Variant Effect Prediction with AlphaGenome. Consulter l’étude

[4] Google DeepMind, documentation AlphaGenome et AlphaGenome Atlas, consultée le 6 octobre 2026. Consulter la documentation

[5] Callaway, E., Nature, 9 septembre 2026, correction du 22 septembre 2026. DeepMind’s New Genome Atlas Charts Effects of All Nine Billion Human Gene Mutations. Lire l’article

[6] Kreimer, A. et al., septembre 2026. Causal Variant Underestimation Is a Major Overlooked Driver of Poor Expression Prediction by Sequence-to-Function Models. Prépublication bioRxiv. Consulter la prépublication

[7] Live Science, 23 septembre 2026. Google DeepMind’s Latest AI Tool Promises a New Era for Genetics Research, but Experts Warn to Take Its Predictions with Caution. Lire l’article

[8] CNIL. Le RGPD appliqué au secteur de la santé, consulté le 6 octobre 2026. Consulter la CNIL

[9] Union européenne. Règlement (UE) 2016/679 relatif à la protection des données personnelles, article 9 et dispositions relatives à la recherche scientifique. Consulter le règlement

Ne ratez pas nos prochains articles !

Recevez les prochains articles écrits par les experts et professeurs aivancity directement dans votre boîte de réception.

Nous ne spammons pas ! Consultez notre politique de données personnelles pour plus d’informations.

Ne ratez pas nos prochains articles !

Recevez les prochains articles écrits par les experts et professeurs aivancity directement dans votre boîte de réception.

Nous ne spammons pas ! Consultez notre politique de données personnelles pour plus d’informations.

Related posts
IA & santé

Vos pensées bientôt lisibles ? Meta dévoile une IA capable de les transformer en texte

Pendant longtemps, l’idée de convertir directement une pensée en texte appartenait au domaine de la science-fiction. Les interfaces cerveau-machine étaient limitées à des laboratoires spécialisés ou reposaient sur des implants cérébraux nécessitant une intervention chirurgicale….
IA & santé

Scanner un corps entier en 60 secondes : Midjourney dévoile un scanner 3D jusqu’à 100 fois plus rapide qu’une IRM

Lorsqu’on évoque Midjourney, on pense immédiatement à l’intelligence artificielle générative, aux images photoréalistes et à la révolution créative qui a bouleversé les secteurs du design, de la publicité ou du cinéma. Peu de personnes auraient…
IA & santé

L’IA s’attaque aux futures pandémies avec un vaccin universel inédit

Pendant plusieurs années, la lutte contre le Covid-19 a ressemblé à une course permanente contre l’évolution du virus. À mesure que de nouveaux variants apparaissaient, les scientifiques devaient adapter leurs connaissances, actualiser les stratégies vaccinales…