HarmonyFidelisHarmonyFidelis
Connexion
ActualitésGrands projetsActeursAcadémie

AlphaFold 3 — Prédiction universelle des interactions biomoléculaires

En mai 2024, DeepMind publie AlphaFold 3. Au-delà des protéines isolées, le modèle prédit les structures de complexes protéine-ADN, protéine-ARN et protéine-ligand avec une précision surpassant toutes les méthodes existantes — ouvrant la voie au drug design computationnel à grande échelle.

Source: pmc.ncbi.nlm.nih.gov

AlphaFold 3 — Prédiction universelle des interactions biomoléculaires

En clair

Une protéine est une longue chaîne qui se replie sur elle-même, et le nombre de replis possibles est astronomique : c'est le problème que la prédiction de structure cherche à contourner. AlphaFold 3, publié par DeepMind en mai 2024, élargit l'exercice aux assemblages — ce qu'une protéine forme avec de l'ADN, de l'ARN, un ligand ou un ion — et non plus aux seules protéines isolées. Pour y parvenir, il ne construit plus la structure pièce à pièce : il part d'un bruit aléatoire qu'il retire progressivement jusqu'à faire apparaître les coordonnées atomiques, ce qui lui permet de proposer plusieurs formes plausibles pour un même complexe au lieu d'une seule. L'usage visé est le criblage de molécules candidates sur ordinateur, en amont du laboratoire. Ce n'est pas pour autant un produit clé en main : chaque prédiction est assortie d'indices de confiance, les régions les moins fiables restent à confirmer expérimentalement, et le modèle n'a été soumis à une évaluation aveugle indépendante qu'après sa sortie, lors de CASP16.

Découverte

ParamètreValeur
Date de publication8 mai 2024 (Nature, vol. 630, p. 493–500)
ÉquipeDeepMind / Isomorphic Labs (Josh Abramson, Jonas Adler et al.)
ArchitectureDiffusion model conditionné (Pairformer + diffusion head)
Données d'entraînementPDB (coupure au 30 septembre 2021) + cross-distillation d'AlphaFold-Multimer v2.3
CiblesProtéines, ADN, ARN, ligands, ions, modifications post-traductionnelles
Serveur publicAlphaFold Server (limité à 5 000 résidus/requête)
LicenceServeur public à la sortie ; poids et code source libérés en novembre 2024 pour un usage académique

Explication technique

1. Représentation d'entrée multi-modale. AlphaFold 3 accepte comme entrée une séquence protéique (MSA + templates), une séquence nucléotidique (ADN/ARN) et/ou un ligand au format SMILES. Chaque entité est tokenisée et projetée dans un espace d'embedding commun de dimension 384. Les paires résidu-résidu (ou résidu-atome) sont encodées dans une matrice de représentation pair de dimension N×N×128N \times N \times 128N×N×128.

2. Trunk : Pairformer (remplacement de l'Evoformer). Le Pairformer utilise des couches de triangle attention et triangle update (comme AF2) mais supprime la représentation MSA explicite au profit d'un embedding single condensé. Cela réduit la complexité mémoire de O(Nseq×Nres2)O(N_{seq} \times N_{res}^2)O(Nseq​×Nres2​) à O(Nres2)O(N_{res}^2)O(Nres2​), permettant de traiter des complexes de > 5 000 résidus. Le trunk comprend 48 blocs Pairformer avec des connexions résiduelles.

3. Diffusion head : génération de coordonnées par débruitage. Contrairement à AF2 (qui utilise un module structural IPA), AF3 génère les coordonnées 3D atomiques via un processus de diffusion-débruitage en 200 étapes. Le modèle apprend à inverser un bruit gaussien appliqué aux coordonnées atomiques de la PDB. À chaque étape, le réseau prédit le bruit à retirer, raffinant progressivement la structure. Cette approche capture naturellement la multimodalité — plusieurs conformations possibles pour un même complexe.

4. Confidence head et recyclage. Le module de confiance estime le pTM (predicted TM-score), le PAE (predicted aligned error) et le pLDDT (predicted local distance difference test). Les prédictions à faible confiance (pLDDT < 50) correspondent aux régions intrinsèquement désordonnées ou aux interfaces mal résolues.

Pourquoi ça a fonctionné

L'approche par diffusion résout deux limitations majeures d'AF2 : le biais vers une seule conformation (le module IPA d'AF2 converge vers un minimum unique) et l'incapacité à modéliser les petites molécules (ligands, ions) qui n'ont pas de MSA. Le tableau ci-dessous met les deux générations en regard sur les points d'architecture décrits plus haut.

Point de comparaisonAlphaFold 2AlphaFold 3
TrunkEvoformer, avec représentation MSA explicitePairformer, embedding single condensé
Complexité mémoireO(Nseq×Nres2)O(N_{seq} \times N_{res}^2)O(Nseq​×Nres2​)O(Nres2)O(N_{res}^2)O(Nres2​)
Génération des coordonnéesModule structural IPADiffusion-débruitage en 200 étapes
Conformations produitesConvergence vers un minimum uniqueEnsemble de structures (multimodalité)
Petites molécules (ligands, ions)Non modélisées, faute de MSAPrises en charge

Le modèle de diffusion génère un ensemble de structures, capturant l'hétérogénéité conformationnelle — critique pour les sites de liaison protéine-ligand où la flexibilité détermine l'affinité.

L'entraînement combine la PDB et une cross-distillation des prédictions d'AlphaFold-Multimer v2.3 : AF3 apprend de son prédécesseur tout en le surpassant, créant une boucle d'amélioration cumulative.

Chaîne causale

Paradoxe de Levinthal (1969, espace conformationnel astronomique) → CASP (1994, benchmark biennal) → AlphaFold 1 (2018, CASP13, GDT 58) → Evoformer + IPA (AF2, 2020, CASP14, GDT 92,4) → Publication de 200M de structures (2022) → AlphaFold 3 (2024, diffusion model, multi-cibles) → Criblage virtuel in silico (2024–) → Drug design accéléré (horizon 2026–2030)

Anecdote historique

À sa publication en mai 2024, AF3 n'avait été évalué que sur des benchmarks internes — CASP15 s'était tenu en 2022, avant sa sortie —, ce qui a suscité des critiques de la communauté sur l'absence de validation indépendante. Le modèle a depuis fait l'objet d'une évaluation aveugle indépendante lors de CASP16 (2024), publiée dans Proteins.


Limites et controverses

Les résultats présentés correspondent aux données publiées dans les sources citées. Les mesures historiques ont été réévaluées par la recherche ultérieure — les valeurs modernes sont indiquées quand elles diffèrent. Les statistiques actuelles proviennent de sources institutionnelles dont les méthodologies peuvent varier.

Sources

Références vérifiées lors de l'audit factuel d'août 2026 : ce sont les pages
contre lesquelles les affirmations de ce bulletin ont été confrontées.

  1. Accurate structure prediction of biomolecular interactions with AlphaFold 3 — Nature 630, 493-500
  2. Évaluation aveugle d'AlphaFold 3 à CASP16 — Proteins
  3. DeepMind releases AlphaFold 3 code and weights for academic use — Nature News