El 30 de noviembre de 2020, en los resultados del concurso CASP14, AlphaFold 2 obtiene una puntuación GDT mediana de 92,4 sobre 100 — por encima del umbral de aproximadamente 90 a partir del cual el problema se considera «resuelto». Predecir la estructura 3D de una proteína a partir únicamente de su secuencia, cuestión abierta desde la paradoja de Levinthal (1969), pasa de meses de cristalografía a unos minutos de cálculo. En 2022 se publican gratuitamente 200 millones de estructuras predichas.
Fuente: deepmind.google
En pocas palabras
Una proteína es una larga cadena de eslabones que se pliega sobre sí misma para adoptar una forma precisa. Adivinar esa forma solo a partir de la lista de eslabones equivale a buscar una aguja en un espacio de posibilidades astronómico: la paradoja de Levinthal cifraba ese campo en unas 10³⁰⁰ conformaciones. Durante cincuenta años, obtener la forma real exigió meses, a veces años de cristalografía. AlphaFold 2 presta el mismo servicio en unos minutos, con una puntuación de 92,4 sobre 100 en el concurso de referencia CASP14 — siendo 90 el umbral a partir del cual la comunidad habla de problema «resuelto». La reserva cabe en una frase: el programa entrega un modelo acompañado de un índice de confianza (pLDDT), no una medida experimental.
Descubrimiento
| Parámetro | Valor |
|---|---|
| Fecha | 30 de noviembre de 2020 (resultados CASP14); 15 de julio de 2021 (Nature, vol. 596, p. 583–589) |
| Equipo | DeepMind (John Jumper, Richard Evans et al.), ~15 investigadores principales |
| Problema | Plegamiento de las proteínas (paradoja de Levinthal, 1969) |
| Banco de pruebas | CASP14 (Critical Assessment of protein Structure Prediction) |
| Puntuación GDT mediana | 92,4 / 100 (umbral «resuelto»: ~90) |
| Arquitectura | Evoformer (48 bloques) + Structure Module (IPA, 8 bloques) |
| Entrenamiento | ~170 000 estructuras del PDB, 128 TPUv3, ~11 días |
| Tiempo de inferencia | Minutos (frente a meses/años en cristalografía) |
Explicación técnica
1. Alineamiento múltiple de secuencias (MSA) y extracción coevolutiva. A partir de la secuencia objetivo, AF2 busca las secuencias homólogas en las bases UniRef90 y MGnify (~250 millones de secuencias). Las posiciones que coevolucionan juntas (columnas correlacionadas en el MSA) indican contactos 3D: si los residuos i y j mutan siempre en pareja, probablemente estén próximos en el espacio (< 8 Å). El MSA típico comprende de 1000 a 100 000 secuencias alineadas.
2. Evoformer: atención axial sobre el MSA y los pares. El Evoformer alterna entre (a) una atención sobre las filas del MSA (row attention), que capta las relaciones entre residuos de una misma secuencia, y (b) una atención sobre las columnas (column attention), que capta la coevolución entre secuencias. Los triangle updates y la triangle attention imponen la coherencia geométrica: si d(i,j) y d(j,k) son conocidos, d(i,k) queda restringido por la desigualdad triangular. 48 bloques Evoformer, cada uno con 256 + 128 canales.
3. Structure Module: Invariant Point Attention (IPA). El módulo de estructura convierte las representaciones abstractas en coordenadas 3D. La IPA opera en el espacio de los frames (sistemas de referencia locales SE(3)) asociados a cada residuo — un backbone local definido por N, Cα, C. La atención IPA es invariante por rotación y traslación: la estructura predicha no depende de la orientación inicial. 8 bloques con reciclado (3 iteraciones completas de la red).
4. Funciones de pérdida y FAPE. La pérdida principal es el Frame Aligned Point Error (FAPE): para cada par de residuos, el error se mide en el sistema de referencia local de uno de los dos residuos. Esto garantiza que las distancias locales (enlaces, ángulos) y las distancias globales (contactos terciarios) se optimicen simultáneamente. El entrenamiento combina esta pérdida principal con varias pérdidas auxiliares:
| Pérdida | Función |
|---|---|
| FAPE (Frame Aligned Point Error) | Pérdida principal — error de posición medido en el sistema de referencia local de cada residuo |
| pLDDT | Confianza local de la predicción |
| pTM | Puntuación TM global |
| Violación de la geometría peptídica | Longitudes de enlace, ángulos de Ramachandran |
Por qué funcionó
Dos innovaciones arquitectónicas resultan decisivas. En primer lugar, los triangle updates imponen la coherencia geométrica 3D directamente en el espacio de las representaciones — los métodos anteriores (trRosetta, RaptorX) predecían mapas de distancia 2D y luego reconstruían la estructura por separado, perdiendo información. En segundo lugar, la IPA permite razonar en sistemas de referencia locales invariantes por SE(3), eliminando la necesidad de data augmentation rotacional.
| Punto de comparación | Antes de AlphaFold 2 | AlphaFold 2 |
|---|---|---|
| Coherencia geométrica | Mapas de distancia 2D (trRosetta, RaptorX), luego reconstrucción separada de la estructura — pérdida de información | Triangle updates: restricción 3D impuesta en el espacio de las representaciones |
| Invariancia a las rotaciones | Data augmentation rotacional necesaria | IPA: sistemas de referencia locales invariantes por SE(3) |
| Puntuación GDT mediana (CASP14) | Umbral «resuelto» esperado: ~90 | 92,4 / 100 |
| Obtención de una estructura | De meses a años (cristalografía) | Minutos (inferencia) |
El aprendizaje por reciclado (3 pasadas completas de la red) permite una autocorrección iterativa: los errores de la primera pasada son detectados y corregidos por las siguientes, imitando el refinamiento en cristalografía.
Cadena causal
Paradoja de Levinthal (1969, 10³⁰⁰ conformaciones posibles) → creación del Protein Data Bank (1971) → lanzamiento de CASP (1994, banco de pruebas bienal) → uso de los MSA para predecir los contactos (Marks et al., 2011) → aprendizaje profundo sobre mapas de distancia (trRosetta, 2020) → AlphaFold 2 (2020, GDT 92,4, Evoformer + IPA) → publicación de 200M de estructuras (2022, AlphaFold DB) → AlphaFold 3 (2024, diffusion model, multiobjetivo) → Premio Nobel de Química 2024 (Hassabis, Jumper)
Anécdota
En el anuncio de los resultados de CASP14, el 30 de noviembre de 2020, John Moult — fundador de CASP — comenta: «This is a big deal, in some sense the problem is solved.» Andrei Lupas, uno de los evaluadores, declara a Nature: «Esto lo cambiará todo», y precisa que los modelos de AlphaFold permitieron a su laboratorio resolver una estructura con la que llevaba atascado cerca de diez años. La comunidad de los bioinformáticos, acostumbrada a progresos incrementales de unos pocos puntos GDT por ciclo CASP, ve un salto sin parangón en un solo concurso.
Legado y datos actuales
Desde 2022, la base AlphaFold DB difunde gratuitamente las estructuras predichas de 200 millones de proteínas. El enfoque fue prolongado por AlphaFold 3 (2024), construido sobre un modelo de difusión y ampliado a objetivos múltiples. En 2024, el Premio Nobel de Química reconoce a Hassabis y Jumper.
Fuentes
Referencias verificadas durante la auditoría factual de agosto de 2026: son las páginas
contra las que se han contrastado las afirmaciones de este boletín.
