Le 30 novembre 2020, aux résultats du concours CASP14, AlphaFold 2 obtient un score GDT médian de 92,4 sur 100 — au-delà du seuil d'environ 90 à partir duquel le problème est tenu pour « résolu ». Prédire la structure 3D d'une protéine à partir de sa seule séquence, question ouverte depuis le paradoxe de Levinthal (1969), passe de mois de cristallographie à quelques minutes de calcul. En 2022, 200 millions de structures prédites sont publiées gratuitement.
Source : deepmind.google
En clair
Une protéine est une longue chaîne de maillons qui se replie sur elle-même pour adopter une forme précise. Deviner cette forme à partir de la seule liste des maillons revient à chercher une aiguille dans un espace de possibilités astronomique : le paradoxe de Levinthal chiffrait ce champ à environ 10³⁰⁰ conformations. Pendant cinquante ans, obtenir la forme réelle a demandé des mois, parfois des années de cristallographie. AlphaFold 2 rend le même service en quelques minutes, avec un score de 92,4 sur 100 au concours de référence CASP14 — 90 étant le seuil à partir duquel la communauté parle de problème « résolu ». La réserve tient en une phrase : le programme livre un modèle assorti d'un indice de confiance (pLDDT), pas une mesure expérimentale.
Découverte
| Paramètre | Valeur |
|---|---|
| Date | 30 novembre 2020 (résultats CASP14) ; 15 juillet 2021 (Nature, vol. 596, p. 583–589) |
| Équipe | DeepMind (John Jumper, Richard Evans et al.), ~15 chercheurs principaux |
| Problème | Repliement des protéines (Paradoxe de Levinthal, 1969) |
| Benchmark | CASP14 (Critical Assessment of protein Structure Prediction) |
| Score GDT médian | 92,4 / 100 (seuil « résolu » : ~90) |
| Architecture | Evoformer (48 blocs) + Structure Module (IPA, 8 blocs) |
| Entraînement | ~170 000 structures de la PDB, 128 TPUv3, ~11 jours |
| Temps d'inférence | Minutes (vs mois/années en cristallographie) |
Explication technique
1. Alignement multiple de séquences (MSA) et extraction co-évolutive. À partir de la séquence cible, AF2 recherche les séquences homologues dans les bases UniRef90 et MGnify (~250 millions de séquences). Les positions co-évoluant ensemble (colonnes corrélées dans le MSA) indiquent des contacts 3D : si les résidus i et j mutent toujours en paire, ils sont probablement proches dans l'espace (< 8 Å). Le MSA typique comprend 1 000 à 100 000 séquences alignées.
2. Evoformer : attention axiale sur le MSA et les paires. L'Evoformer alterne entre (a) une attention sur les lignes du MSA (row attention), capturant les relations entre résidus d'une même séquence, et (b) une attention sur les colonnes (column attention), capturant la co-évolution entre séquences. Les triangle updates et triangle attention imposent la cohérence géométrique : si d(i,j) et d(j,k) sont connus, d(i,k) est contraint par l'inégalité triangulaire. 48 blocs Evoformer, chacun avec 256 + 128 canaux.
3. Structure Module : Invariant Point Attention (IPA). Le module de structure convertit les représentations abstraites en coordonnées 3D. L'IPA opère dans l'espace des frames (repères locaux SE(3)) attachés à chaque résidu — un backbone local défini par N, Cα, C. L'attention IPA est invariante par rotation et translation : la structure prédite ne dépend pas de l'orientation initiale. 8 blocs avec recyclage (3 itérations complètes du réseau).
4. Fonctions de perte et FAPE. La perte principale est le Frame Aligned Point Error (FAPE) : pour chaque paire de résidus, l'erreur est mesurée dans le repère local de l'un des deux résidus. Cela garantit que les distances locales (liaisons, angles) et les distances globales (contacts tertiaires) sont simultanément optimisées. L'entraînement combine cette perte principale à plusieurs pertes auxiliaires :
| Perte | Rôle |
|---|---|
| FAPE (Frame Aligned Point Error) | Perte principale — erreur de position mesurée dans le repère local de chaque résidu |
| pLDDT | Confiance locale de la prédiction |
| pTM | Score TM global |
| Violation de la géométrie peptidique | Longueurs de liaison, angles de Ramachandran |
Pourquoi ça a marché
Deux innovations architecturales sont décisives. Premièrement, les triangle updates imposent la cohérence géométrique 3D directement dans l'espace des représentations — les méthodes précédentes (trRosetta, RaptorX) prédisaient des cartes de distance 2D puis reconstruisaient la structure séparément, perdant de l'information. Deuxièmement, l'IPA permet de raisonner dans des repères locaux invariants par SE(3), éliminant le besoin de data augmentation rotationnelle.
| Point de comparaison | Avant AlphaFold 2 | AlphaFold 2 |
|---|---|---|
| Cohérence géométrique | Cartes de distance 2D (trRosetta, RaptorX), puis reconstruction séparée de la structure — perte d'information | Triangle updates : contrainte 3D imposée dans l'espace des représentations |
| Invariance aux rotations | Data augmentation rotationnelle nécessaire | IPA : repères locaux invariants par SE(3) |
| Score GDT médian (CASP14) | Seuil « résolu » attendu : ~90 | 92,4 / 100 |
| Obtention d'une structure | Mois à années (cristallographie) | Minutes (inférence) |
L'apprentissage par recyclage (3 passes complètes du réseau) permet une auto-correction itérative : les erreurs de la première passe sont détectées et corrigées par les passes suivantes, mimant le raffinement en cristallographie.
Chaîne causale
Paradoxe de Levinthal (1969, 10³⁰⁰ conformations possibles) → Protein Data Bank créée (1971) → CASP lancé (1994, benchmark biennal) → Utilisation des MSA pour prédire les contacts (Marks et al., 2011) → Deep learning sur cartes de distance (trRosetta, 2020) → AlphaFold 2 (2020, GDT 92,4, Evoformer + IPA) → Publication de 200M de structures (2022, AlphaFold DB) → AlphaFold 3 (2024, diffusion model, multi-cibles) → Prix Nobel de chimie 2024 (Hassabis, Jumper)
Anecdote
Lors de l'annonce des résultats CASP14 le 30 novembre 2020, John Moult — fondateur de CASP — commente : « This is a big deal, in some sense the problem is solved. » Andrei Lupas, l'un des évaluateurs, déclare à Nature : « Ceci changera tout », et précise que les modèles d'AlphaFold ont permis à son laboratoire de résoudre une structure sur laquelle il butait depuis près de dix ans. La communauté des bioinformaticiens, habituée à des progrès incrémentaux de quelques points GDT par cycle CASP, voit un bond sans commune mesure en un seul concours.
Héritage et données actuelles
Depuis 2022, la base AlphaFold DB diffuse gratuitement les structures prédites de 200 millions de protéines. L'approche a été prolongée par AlphaFold 3 (2024), bâti sur un modèle de diffusion et étendu à des cibles multiples. En 2024, le prix Nobel de chimie récompense Hassabis et Jumper.
Sources
Références vérifiées lors de l'audit factuel d'août 2026 : ce sont les pages
contre lesquelles les affirmations de ce bulletin ont été confrontées.
