HarmonyFidelisHarmonyFidelis
Connexion
ActualitésGrands projetsActeursAcadémie

AlphaFold 2 — L'IA résout le repliement des protéines

En novembre 2020, AlphaFold 2 de DeepMind obtient un score GDT médian de 92,4 au concours CASP14. Un problème fondamental de la biologie — prédire la structure 3D d'une protéine à partir de sa séquence — est déclaré « résolu » après 50 ans de recherche. En 2022, les structures de 200 millions de protéines sont publiées gratuitement.

Source: deepmind.google

AlphaFold 2 — L'IA résout le repliement des protéines

Le 30 novembre 2020, aux résultats du concours CASP14, AlphaFold 2 obtient un score GDT médian de 92,4 sur 100 — au-delà du seuil d'environ 90 à partir duquel le problème est tenu pour « résolu ». Prédire la structure 3D d'une protéine à partir de sa seule séquence, question ouverte depuis le paradoxe de Levinthal (1969), passe de mois de cristallographie à quelques minutes de calcul. En 2022, 200 millions de structures prédites sont publiées gratuitement.

Source : deepmind.google

En clair

Une protéine est une longue chaîne de maillons qui se replie sur elle-même pour adopter une forme précise. Deviner cette forme à partir de la seule liste des maillons revient à chercher une aiguille dans un espace de possibilités astronomique : le paradoxe de Levinthal chiffrait ce champ à environ 10³⁰⁰ conformations. Pendant cinquante ans, obtenir la forme réelle a demandé des mois, parfois des années de cristallographie. AlphaFold 2 rend le même service en quelques minutes, avec un score de 92,4 sur 100 au concours de référence CASP14 — 90 étant le seuil à partir duquel la communauté parle de problème « résolu ». La réserve tient en une phrase : le programme livre un modèle assorti d'un indice de confiance (pLDDT), pas une mesure expérimentale.

Découverte

ParamètreValeur
Date30 novembre 2020 (résultats CASP14) ; 15 juillet 2021 (Nature, vol. 596, p. 583–589)
ÉquipeDeepMind (John Jumper, Richard Evans et al.), ~15 chercheurs principaux
ProblèmeRepliement des protéines (Paradoxe de Levinthal, 1969)
BenchmarkCASP14 (Critical Assessment of protein Structure Prediction)
Score GDT médian92,4 / 100 (seuil « résolu » : ~90)
ArchitectureEvoformer (48 blocs) + Structure Module (IPA, 8 blocs)
Entraînement~170 000 structures de la PDB, 128 TPUv3, ~11 jours
Temps d'inférenceMinutes (vs mois/années en cristallographie)

Explication technique

1. Alignement multiple de séquences (MSA) et extraction co-évolutive. À partir de la séquence cible, AF2 recherche les séquences homologues dans les bases UniRef90 et MGnify (~250 millions de séquences). Les positions co-évoluant ensemble (colonnes corrélées dans le MSA) indiquent des contacts 3D : si les résidus i et j mutent toujours en paire, ils sont probablement proches dans l'espace (< 8 Å). Le MSA typique comprend 1 000 à 100 000 séquences alignées.

2. Evoformer : attention axiale sur le MSA et les paires. L'Evoformer alterne entre (a) une attention sur les lignes du MSA (row attention), capturant les relations entre résidus d'une même séquence, et (b) une attention sur les colonnes (column attention), capturant la co-évolution entre séquences. Les triangle updates et triangle attention imposent la cohérence géométrique : si d(i,j)d(i,j)d(i,j) et d(j,k)d(j,k)d(j,k) sont connus, d(i,k)d(i,k)d(i,k) est contraint par l'inégalité triangulaire. 48 blocs Evoformer, chacun avec 256 + 128 canaux.

3. Structure Module : Invariant Point Attention (IPA). Le module de structure convertit les représentations abstraites en coordonnées 3D. L'IPA opère dans l'espace des frames (repères locaux SE(3)) attachés à chaque résidu — un backbone local défini par N, Cα, C. L'attention IPA est invariante par rotation et translation : la structure prédite ne dépend pas de l'orientation initiale. 8 blocs avec recyclage (3 itérations complètes du réseau).

4. Fonctions de perte et FAPE. La perte principale est le Frame Aligned Point Error (FAPE) : pour chaque paire de résidus, l'erreur est mesurée dans le repère local de l'un des deux résidus. Cela garantit que les distances locales (liaisons, angles) et les distances globales (contacts tertiaires) sont simultanément optimisées. L'entraînement combine cette perte principale à plusieurs pertes auxiliaires :

PerteRôle
FAPE (Frame Aligned Point Error)Perte principale — erreur de position mesurée dans le repère local de chaque résidu
pLDDTConfiance locale de la prédiction
pTMScore TM global
Violation de la géométrie peptidiqueLongueurs de liaison, angles de Ramachandran

Pourquoi ça a marché

Deux innovations architecturales sont décisives. Premièrement, les triangle updates imposent la cohérence géométrique 3D directement dans l'espace des représentations — les méthodes précédentes (trRosetta, RaptorX) prédisaient des cartes de distance 2D puis reconstruisaient la structure séparément, perdant de l'information. Deuxièmement, l'IPA permet de raisonner dans des repères locaux invariants par SE(3), éliminant le besoin de data augmentation rotationnelle.

Point de comparaisonAvant AlphaFold 2AlphaFold 2
Cohérence géométriqueCartes de distance 2D (trRosetta, RaptorX), puis reconstruction séparée de la structure — perte d'informationTriangle updates : contrainte 3D imposée dans l'espace des représentations
Invariance aux rotationsData augmentation rotationnelle nécessaireIPA : repères locaux invariants par SE(3)
Score GDT médian (CASP14)Seuil « résolu » attendu : ~9092,4 / 100
Obtention d'une structureMois à années (cristallographie)Minutes (inférence)

L'apprentissage par recyclage (3 passes complètes du réseau) permet une auto-correction itérative : les erreurs de la première passe sont détectées et corrigées par les passes suivantes, mimant le raffinement en cristallographie.

Chaîne causale

Paradoxe de Levinthal (1969, 10³⁰⁰ conformations possibles) → Protein Data Bank créée (1971) → CASP lancé (1994, benchmark biennal) → Utilisation des MSA pour prédire les contacts (Marks et al., 2011) → Deep learning sur cartes de distance (trRosetta, 2020) → AlphaFold 2 (2020, GDT 92,4, Evoformer + IPA) → Publication de 200M de structures (2022, AlphaFold DB) → AlphaFold 3 (2024, diffusion model, multi-cibles) → Prix Nobel de chimie 2024 (Hassabis, Jumper)

Anecdote

Lors de l'annonce des résultats CASP14 le 30 novembre 2020, John Moult — fondateur de CASP — commente : « This is a big deal, in some sense the problem is solved. » Andrei Lupas, l'un des évaluateurs, déclare à Nature : « Ceci changera tout », et précise que les modèles d'AlphaFold ont permis à son laboratoire de résoudre une structure sur laquelle il butait depuis près de dix ans. La communauté des bioinformaticiens, habituée à des progrès incrémentaux de quelques points GDT par cycle CASP, voit un bond sans commune mesure en un seul concours.

Héritage et données actuelles

Depuis 2022, la base AlphaFold DB diffuse gratuitement les structures prédites de 200 millions de protéines. L'approche a été prolongée par AlphaFold 3 (2024), bâti sur un modèle de diffusion et étendu à des cibles multiples. En 2024, le prix Nobel de chimie récompense Hassabis et Jumper.

Sources

Références vérifiées lors de l'audit factuel d'août 2026 : ce sont les pages
contre lesquelles les affirmations de ce bulletin ont été confrontées.

  1. AlphaFold: a solution to a 50-year-old grand challenge in biology — Google DeepMind
  2. Communiqué officiel des résultats CASP14 — Prediction Center
  3. Highly accurate protein structure prediction with AlphaFold — Nature 596, 583-589