HarmonyFidelisHarmonyFidelis
Iniciar sesión
ActualidadGrandes proyectosActoresAcademia

AlphaFold 2 — La IA resuelve el plegamiento de las proteínas

En noviembre de 2020, AlphaFold 2 de DeepMind obtiene una puntuación GDT mediana de 92,4 en el concurso CASP14. Un problema fundamental de la biología —predecir la estructura 3D de una proteína a partir de su secuencia— se declara «resuelto» tras 50 años de investigación. En 2022 se publican gratuitamente las estructuras de 200 millones de proteínas.

Source: deepmind.google

AlphaFold 2 — La IA resuelve el plegamiento de las proteínas

El 30 de noviembre de 2020, en los resultados del concurso CASP14, AlphaFold 2 obtiene una puntuación GDT mediana de 92,4 sobre 100 — por encima del umbral de aproximadamente 90 a partir del cual el problema se considera «resuelto». Predecir la estructura 3D de una proteína a partir únicamente de su secuencia, cuestión abierta desde la paradoja de Levinthal (1969), pasa de meses de cristalografía a unos minutos de cálculo. En 2022 se publican gratuitamente 200 millones de estructuras predichas.

Fuente: deepmind.google

En pocas palabras

Una proteína es una larga cadena de eslabones que se pliega sobre sí misma para adoptar una forma precisa. Adivinar esa forma solo a partir de la lista de eslabones equivale a buscar una aguja en un espacio de posibilidades astronómico: la paradoja de Levinthal cifraba ese campo en unas 10³⁰⁰ conformaciones. Durante cincuenta años, obtener la forma real exigió meses, a veces años de cristalografía. AlphaFold 2 presta el mismo servicio en unos minutos, con una puntuación de 92,4 sobre 100 en el concurso de referencia CASP14 — siendo 90 el umbral a partir del cual la comunidad habla de problema «resuelto». La reserva cabe en una frase: el programa entrega un modelo acompañado de un índice de confianza (pLDDT), no una medida experimental.

Descubrimiento

ParámetroValor
Fecha30 de noviembre de 2020 (resultados CASP14); 15 de julio de 2021 (Nature, vol. 596, p. 583–589)
EquipoDeepMind (John Jumper, Richard Evans et al.), ~15 investigadores principales
ProblemaPlegamiento de las proteínas (paradoja de Levinthal, 1969)
Banco de pruebasCASP14 (Critical Assessment of protein Structure Prediction)
Puntuación GDT mediana92,4 / 100 (umbral «resuelto»: ~90)
ArquitecturaEvoformer (48 bloques) + Structure Module (IPA, 8 bloques)
Entrenamiento~170 000 estructuras del PDB, 128 TPUv3, ~11 días
Tiempo de inferenciaMinutos (frente a meses/años en cristalografía)

Explicación técnica

1. Alineamiento múltiple de secuencias (MSA) y extracción coevolutiva. A partir de la secuencia objetivo, AF2 busca las secuencias homólogas en las bases UniRef90 y MGnify (~250 millones de secuencias). Las posiciones que coevolucionan juntas (columnas correlacionadas en el MSA) indican contactos 3D: si los residuos i y j mutan siempre en pareja, probablemente estén próximos en el espacio (< 8 Å). El MSA típico comprende de 1000 a 100 000 secuencias alineadas.

2. Evoformer: atención axial sobre el MSA y los pares. El Evoformer alterna entre (a) una atención sobre las filas del MSA (row attention), que capta las relaciones entre residuos de una misma secuencia, y (b) una atención sobre las columnas (column attention), que capta la coevolución entre secuencias. Los triangle updates y la triangle attention imponen la coherencia geométrica: si d(i,j)d(i,j)d(i,j) y d(j,k)d(j,k)d(j,k) son conocidos, d(i,k)d(i,k)d(i,k) queda restringido por la desigualdad triangular. 48 bloques Evoformer, cada uno con 256 + 128 canales.

3. Structure Module: Invariant Point Attention (IPA). El módulo de estructura convierte las representaciones abstractas en coordenadas 3D. La IPA opera en el espacio de los frames (sistemas de referencia locales SE(3)) asociados a cada residuo — un backbone local definido por N, Cα, C. La atención IPA es invariante por rotación y traslación: la estructura predicha no depende de la orientación inicial. 8 bloques con reciclado (3 iteraciones completas de la red).

4. Funciones de pérdida y FAPE. La pérdida principal es el Frame Aligned Point Error (FAPE): para cada par de residuos, el error se mide en el sistema de referencia local de uno de los dos residuos. Esto garantiza que las distancias locales (enlaces, ángulos) y las distancias globales (contactos terciarios) se optimicen simultáneamente. El entrenamiento combina esta pérdida principal con varias pérdidas auxiliares:

PérdidaFunción
FAPE (Frame Aligned Point Error)Pérdida principal — error de posición medido en el sistema de referencia local de cada residuo
pLDDTConfianza local de la predicción
pTMPuntuación TM global
Violación de la geometría peptídicaLongitudes de enlace, ángulos de Ramachandran

Por qué funcionó

Dos innovaciones arquitectónicas resultan decisivas. En primer lugar, los triangle updates imponen la coherencia geométrica 3D directamente en el espacio de las representaciones — los métodos anteriores (trRosetta, RaptorX) predecían mapas de distancia 2D y luego reconstruían la estructura por separado, perdiendo información. En segundo lugar, la IPA permite razonar en sistemas de referencia locales invariantes por SE(3), eliminando la necesidad de data augmentation rotacional.

Punto de comparaciónAntes de AlphaFold 2AlphaFold 2
Coherencia geométricaMapas de distancia 2D (trRosetta, RaptorX), luego reconstrucción separada de la estructura — pérdida de informaciónTriangle updates: restricción 3D impuesta en el espacio de las representaciones
Invariancia a las rotacionesData augmentation rotacional necesariaIPA: sistemas de referencia locales invariantes por SE(3)
Puntuación GDT mediana (CASP14)Umbral «resuelto» esperado: ~9092,4 / 100
Obtención de una estructuraDe meses a años (cristalografía)Minutos (inferencia)

El aprendizaje por reciclado (3 pasadas completas de la red) permite una autocorrección iterativa: los errores de la primera pasada son detectados y corregidos por las siguientes, imitando el refinamiento en cristalografía.

Cadena causal

Paradoja de Levinthal (1969, 10³⁰⁰ conformaciones posibles) → creación del Protein Data Bank (1971) → lanzamiento de CASP (1994, banco de pruebas bienal) → uso de los MSA para predecir los contactos (Marks et al., 2011) → aprendizaje profundo sobre mapas de distancia (trRosetta, 2020) → AlphaFold 2 (2020, GDT 92,4, Evoformer + IPA) → publicación de 200M de estructuras (2022, AlphaFold DB) → AlphaFold 3 (2024, diffusion model, multiobjetivo) → Premio Nobel de Química 2024 (Hassabis, Jumper)

Anécdota

En el anuncio de los resultados de CASP14, el 30 de noviembre de 2020, John Moult — fundador de CASP — comenta: «This is a big deal, in some sense the problem is solved.» Andrei Lupas, uno de los evaluadores, declara a Nature: «Esto lo cambiará todo», y precisa que los modelos de AlphaFold permitieron a su laboratorio resolver una estructura con la que llevaba atascado cerca de diez años. La comunidad de los bioinformáticos, acostumbrada a progresos incrementales de unos pocos puntos GDT por ciclo CASP, ve un salto sin parangón en un solo concurso.

Legado y datos actuales

Desde 2022, la base AlphaFold DB difunde gratuitamente las estructuras predichas de 200 millones de proteínas. El enfoque fue prolongado por AlphaFold 3 (2024), construido sobre un modelo de difusión y ampliado a objetivos múltiples. En 2024, el Premio Nobel de Química reconoce a Hassabis y Jumper.

Fuentes

Referencias verificadas durante la auditoría factual de agosto de 2026: son las páginas
contra las que se han contrastado las afirmaciones de este boletín.

  1. AlphaFold: a solution to a 50-year-old grand challenge in biology — Google DeepMind
  2. Comunicado oficial de los resultados de CASP14 — Prediction Center
  3. Highly accurate protein structure prediction with AlphaFold — Nature 596, 583-589