En pocas palabras
Una proteína es una cadena larga que se pliega sobre sí misma, y el número de plegamientos posibles es astronómico: ese es el problema que la predicción de estructuras trata de sortear. AlphaFold 3, publicado por DeepMind en mayo de 2024, amplía el ejercicio a los ensamblajes — lo que una proteína forma con el ADN, el ARN, un ligando o un ion — y ya no solo a las proteínas aisladas. Para lograrlo, deja de construir la estructura pieza a pieza: parte de un ruido aleatorio que va retirando progresivamente hasta hacer aparecer las coordenadas atómicas, lo que le permite proponer varias formas plausibles para un mismo complejo en lugar de una sola. El uso previsto es el cribado de moléculas candidatas por ordenador, antes de pasar al laboratorio. Aun así, no es un producto llave en mano: cada predicción va acompañada de índices de confianza, las regiones menos fiables quedan pendientes de confirmación experimental y el modelo no se sometió a una evaluación ciega independiente hasta después de su lanzamiento, en CASP16.
Descubrimiento
| Parámetro | Valor |
|---|---|
| Fecha de publicación | 8 de mayo de 2024 (Nature, vol. 630, pp. 493–500) |
| Equipo | DeepMind / Isomorphic Labs (Josh Abramson, Jonas Adler et al.) |
| Arquitectura | Diffusion model condicionado (Pairformer + diffusion head) |
| Datos de entrenamiento | PDB (corte al 30 de septiembre de 2021) + cross-distillation de AlphaFold-Multimer v2.3 |
| Dianas | Proteínas, ADN, ARN, ligandos, iones, modificaciones postraduccionales |
| Servidor público | AlphaFold Server (limitado a 5 000 residuos por consulta) |
| Licencia | Servidor público en el lanzamiento; pesos y código fuente liberados en noviembre de 2024 para uso académico |
Explicación técnica
1. Representación de entrada multimodal. AlphaFold 3 acepta como entrada una secuencia proteica (MSA + templates), una secuencia nucleotídica (ADN/ARN) y/o un ligando en formato SMILES. Cada entidad se tokeniza y se proyecta en un espacio de embedding común de dimensión 384. Los pares residuo-residuo (o residuo-átomo) se codifican en una matriz de representación pair de dimensión N×N×128.
2. Trunk: Pairformer (en sustitución del Evoformer). El Pairformer emplea capas de triangle attention y triangle update (como AF2), pero suprime la representación MSA explícita en favor de un embedding single condensado. Esto reduce la complejidad de memoria de O(Nseq×Nres2) a O(Nres2), lo que permite tratar complejos de > 5 000 residuos. El trunk consta de 48 bloques Pairformer con conexiones residuales.
3. Diffusion head: generación de coordenadas por eliminación de ruido. A diferencia de AF2 (que utiliza un módulo estructural IPA), AF3 genera las coordenadas atómicas 3D mediante un proceso de difusión-eliminación de ruido en 200 etapas. El modelo aprende a invertir un ruido gaussiano aplicado a las coordenadas atómicas del PDB. En cada etapa, la red predice el ruido que debe retirarse y refina progresivamente la estructura. Este enfoque capta de forma natural la multimodalidad: varias conformaciones posibles para un mismo complejo.
4. Confidence head y reciclaje. El módulo de confianza estima el pTM (predicted TM-score), el PAE (predicted aligned error) y el pLDDT (predicted local distance difference test). Las predicciones de baja confianza (pLDDT < 50) corresponden a regiones intrínsecamente desordenadas o a interfaces mal resueltas.
Por qué funcionó
El enfoque por difusión resuelve dos limitaciones importantes de AF2: el sesgo hacia una única conformación (el módulo IPA de AF2 converge a un mínimo único) y la incapacidad de modelar las moléculas pequeñas (ligandos, iones) que carecen de MSA. La tabla siguiente contrapone ambas generaciones en los puntos de arquitectura descritos más arriba.
| Punto de comparación | AlphaFold 2 | AlphaFold 3 |
|---|---|---|
| Trunk | Evoformer, con representación MSA explícita | Pairformer, embedding single condensado |
| Complejidad de memoria | O(Nseq×Nres2) | O(Nres2) |
| Generación de coordenadas | Módulo estructural IPA | Difusión-eliminación de ruido en 200 etapas |
| Conformaciones producidas | Convergencia a un mínimo único | Conjunto de estructuras (multimodalidad) |
| Moléculas pequeñas (ligandos, iones) | No modeladas, por falta de MSA | Admitidas |
El modelo de difusión genera un conjunto de estructuras y capta así la heterogeneidad conformacional, algo crítico para los sitios de unión proteína-ligando, donde la flexibilidad determina la afinidad.
El entrenamiento combina el PDB con una cross-distillation de las predicciones de AlphaFold-Multimer v2.3: AF3 aprende de su predecesor y a la vez lo supera, creando un bucle de mejora acumulativa.
Cadena causal
Paradoja de Levinthal (1969, espacio conformacional astronómico) → CASP (1994, benchmark bienal) → AlphaFold 1 (2018, CASP13, GDT 58) → Evoformer + IPA (AF2, 2020, CASP14, GDT 92,4) → Publicación de 200M de estructuras (2022) → AlphaFold 3 (2024, diffusion model, multidiana) → Cribado virtual in silico (2024–) → Drug design acelerado (horizonte 2026–2030)
Anécdota histórica
Cuando se publicó, en mayo de 2024, AF3 solo había sido evaluado con benchmarks internos — CASP15 se había celebrado en 2022, antes de su lanzamiento —, lo que suscitó críticas de la comunidad por la ausencia de validación independiente. Desde entonces, el modelo ha sido objeto de una evaluación ciega independiente en CASP16 (2024), publicada en Proteins.
Límites y controversias
Los resultados presentados corresponden a los datos publicados en las fuentes citadas. Las mediciones históricas han sido reevaluadas por investigaciones posteriores: se indican los valores modernos cuando difieren. Las estadísticas actuales proceden de fuentes institucionales cuyas metodologías pueden variar.
Fuentes
Referencias verificadas durante la auditoría de comprobación de hechos de agosto de 2026: son las páginas
con las que se han contrastado las afirmaciones de este boletín.
