Em 30 de novembro de 2020, nos resultados do concurso CASP14, o AlphaFold 2 obtém uma pontuação GDT mediana de 92,4 em 100 — acima do limiar de cerca de 90 a partir do qual o problema é tido como "resolvido". Prever a estrutura 3D de uma proteína apenas a partir de sua sequência, questão em aberto desde o paradoxo de Levinthal (1969), passa de meses de cristalografia a alguns minutos de cálculo. Em 2022, 200 milhões de estruturas previstas são publicadas gratuitamente.
Fonte: deepmind.google
Em resumo
Uma proteína é uma longa cadeia de elos que se dobra sobre si mesma para adotar uma forma precisa. Adivinhar essa forma somente a partir da lista dos elos equivale a procurar uma agulha num espaço de possibilidades astronômico: o paradoxo de Levinthal estimava esse campo em cerca de 10³⁰⁰ conformações. Durante cinquenta anos, obter a forma real exigiu meses, às vezes anos de cristalografia. O AlphaFold 2 presta o mesmo serviço em alguns minutos, com uma pontuação de 92,4 em 100 no concurso de referência CASP14 — sendo 90 o limiar a partir do qual a comunidade fala em problema "resolvido". A ressalva cabe em uma frase: o programa entrega um modelo acompanhado de um índice de confiança (pLDDT), não uma medida experimental.
Descoberta
| Parâmetro | Valor |
|---|---|
| Data | 30 de novembro de 2020 (resultados CASP14); 15 de julho de 2021 (Nature, vol. 596, p. 583–589) |
| Equipe | DeepMind (John Jumper, Richard Evans et al.), ~15 pesquisadores principais |
| Problema | Enovelamento de proteínas (paradoxo de Levinthal, 1969) |
| Benchmark | CASP14 (Critical Assessment of protein Structure Prediction) |
| Pontuação GDT mediana | 92,4 / 100 (limiar "resolvido": ~90) |
| Arquitetura | Evoformer (48 blocos) + Structure Module (IPA, 8 blocos) |
| Treinamento | ~170 000 estruturas do PDB, 128 TPUv3, ~11 dias |
| Tempo de inferência | Minutos (ante meses/anos na cristalografia) |
Explicação técnica
1. Alinhamento múltiplo de sequências (MSA) e extração coevolutiva. A partir da sequência-alvo, o AF2 procura as sequências homólogas nas bases UniRef90 e MGnify (~250 milhões de sequências). As posições que coevoluem juntas (colunas correlacionadas no MSA) indicam contatos 3D: se os resíduos i e j mutam sempre aos pares, provavelmente estão próximos no espaço (< 8 Å). O MSA típico compreende de 1000 a 100 000 sequências alinhadas.
2. Evoformer: atenção axial sobre o MSA e os pares. O Evoformer alterna entre (a) uma atenção sobre as linhas do MSA (row attention), captando as relações entre resíduos de uma mesma sequência, e (b) uma atenção sobre as colunas (column attention), captando a coevolução entre sequências. Os triangle updates e a triangle attention impõem a coerência geométrica: se d(i,j) e d(j,k) são conhecidos, d(i,k) fica restringido pela desigualdade triangular. 48 blocos Evoformer, cada um com 256 + 128 canais.
3. Structure Module: Invariant Point Attention (IPA). O módulo de estrutura converte as representações abstratas em coordenadas 3D. A IPA opera no espaço dos frames (referenciais locais SE(3)) ligados a cada resíduo — um backbone local definido por N, Cα, C. A atenção IPA é invariante por rotação e translação: a estrutura prevista não depende da orientação inicial. 8 blocos com reciclagem (3 iterações completas da rede).
4. Funções de perda e FAPE. A perda principal é o Frame Aligned Point Error (FAPE): para cada par de resíduos, o erro é medido no referencial local de um dos dois resíduos. Isso garante que as distâncias locais (ligações, ângulos) e as distâncias globais (contatos terciários) sejam otimizadas simultaneamente. O treinamento combina essa perda principal com várias perdas auxiliares:
| Perda | Função |
|---|---|
| FAPE (Frame Aligned Point Error) | Perda principal — erro de posição medido no referencial local de cada resíduo |
| pLDDT | Confiança local da previsão |
| pTM | Pontuação TM global |
| Violação da geometria peptídica | Comprimentos de ligação, ângulos de Ramachandran |
Por que deu certo
Duas inovações arquiteturais são decisivas. Em primeiro lugar, os triangle updates impõem a coerência geométrica 3D diretamente no espaço das representações — os métodos anteriores (trRosetta, RaptorX) previam mapas de distância 2D e depois reconstruíam a estrutura separadamente, perdendo informação. Em segundo lugar, a IPA permite raciocinar em referenciais locais invariantes por SE(3), eliminando a necessidade de data augmentation rotacional.
| Ponto de comparação | Antes do AlphaFold 2 | AlphaFold 2 |
|---|---|---|
| Coerência geométrica | Mapas de distância 2D (trRosetta, RaptorX), depois reconstrução separada da estrutura — perda de informação | Triangle updates: restrição 3D imposta no espaço das representações |
| Invariância às rotações | Data augmentation rotacional necessária | IPA: referenciais locais invariantes por SE(3) |
| Pontuação GDT mediana (CASP14) | Limiar "resolvido" esperado: ~90 | 92,4 / 100 |
| Obtenção de uma estrutura | De meses a anos (cristalografia) | Minutos (inferência) |
O aprendizado por reciclagem (3 passagens completas da rede) permite uma autocorreção iterativa: os erros da primeira passagem são detectados e corrigidos pelas passagens seguintes, imitando o refinamento na cristalografia.
Cadeia causal
Paradoxo de Levinthal (1969, 10³⁰⁰ conformações possíveis) → criação do Protein Data Bank (1971) → lançamento do CASP (1994, benchmark bienal) → uso dos MSA para prever os contatos (Marks et al., 2011) → aprendizado profundo sobre mapas de distância (trRosetta, 2020) → AlphaFold 2 (2020, GDT 92,4, Evoformer + IPA) → publicação de 200M de estruturas (2022, AlphaFold DB) → AlphaFold 3 (2024, diffusion model, multialvo) → Prêmio Nobel de Química 2024 (Hassabis, Jumper)
Anedota
No anúncio dos resultados do CASP14, em 30 de novembro de 2020, John Moult — fundador do CASP — comenta: "This is a big deal, in some sense the problem is solved." Andrei Lupas, um dos avaliadores, declara à Nature: "Isso vai mudar tudo", e esclarece que os modelos do AlphaFold permitiram a seu laboratório resolver uma estrutura na qual emperrava havia quase dez anos. A comunidade dos bioinformatas, habituada a progressos incrementais de alguns pontos GDT por ciclo CASP, vê um salto sem qualquer comparação em um único concurso.
Legado e dados atuais
Desde 2022, a base AlphaFold DB difunde gratuitamente as estruturas previstas de 200 milhões de proteínas. A abordagem foi prolongada pelo AlphaFold 3 (2024), construído sobre um modelo de difusão e ampliado a alvos múltiplos. Em 2024, o Prêmio Nobel de Química reconhece Hassabis e Jumper.
Fontes
Referências verificadas durante a auditoria factual de agosto de 2026: são as páginas
contra as quais as afirmações deste boletim foram confrontadas.
