HarmonyFidelisHarmonyFidelis
Entrar
NotíciasGrandes projetosAtoresAcademia

AlphaFold 2 — A IA resolve o enovelamento das proteínas

Em novembro de 2020, o AlphaFold 2 da DeepMind obtém uma pontuação GDT mediana de 92,4 no concurso CASP14. Um problema fundamental da biologia — prever a estrutura 3D de uma proteína a partir de sua sequência — é declarado "resolvido" após 50 anos de pesquisa. Em 2022, as estruturas de 200 milhões de proteínas são publicadas gratuitamente.

Source: deepmind.google

AlphaFold 2 — A IA resolve o enovelamento das proteínas

Em 30 de novembro de 2020, nos resultados do concurso CASP14, o AlphaFold 2 obtém uma pontuação GDT mediana de 92,4 em 100 — acima do limiar de cerca de 90 a partir do qual o problema é tido como "resolvido". Prever a estrutura 3D de uma proteína apenas a partir de sua sequência, questão em aberto desde o paradoxo de Levinthal (1969), passa de meses de cristalografia a alguns minutos de cálculo. Em 2022, 200 milhões de estruturas previstas são publicadas gratuitamente.

Fonte: deepmind.google

Em resumo

Uma proteína é uma longa cadeia de elos que se dobra sobre si mesma para adotar uma forma precisa. Adivinhar essa forma somente a partir da lista dos elos equivale a procurar uma agulha num espaço de possibilidades astronômico: o paradoxo de Levinthal estimava esse campo em cerca de 10³⁰⁰ conformações. Durante cinquenta anos, obter a forma real exigiu meses, às vezes anos de cristalografia. O AlphaFold 2 presta o mesmo serviço em alguns minutos, com uma pontuação de 92,4 em 100 no concurso de referência CASP14 — sendo 90 o limiar a partir do qual a comunidade fala em problema "resolvido". A ressalva cabe em uma frase: o programa entrega um modelo acompanhado de um índice de confiança (pLDDT), não uma medida experimental.

Descoberta

ParâmetroValor
Data30 de novembro de 2020 (resultados CASP14); 15 de julho de 2021 (Nature, vol. 596, p. 583–589)
EquipeDeepMind (John Jumper, Richard Evans et al.), ~15 pesquisadores principais
ProblemaEnovelamento de proteínas (paradoxo de Levinthal, 1969)
BenchmarkCASP14 (Critical Assessment of protein Structure Prediction)
Pontuação GDT mediana92,4 / 100 (limiar "resolvido": ~90)
ArquiteturaEvoformer (48 blocos) + Structure Module (IPA, 8 blocos)
Treinamento~170 000 estruturas do PDB, 128 TPUv3, ~11 dias
Tempo de inferênciaMinutos (ante meses/anos na cristalografia)

Explicação técnica

1. Alinhamento múltiplo de sequências (MSA) e extração coevolutiva. A partir da sequência-alvo, o AF2 procura as sequências homólogas nas bases UniRef90 e MGnify (~250 milhões de sequências). As posições que coevoluem juntas (colunas correlacionadas no MSA) indicam contatos 3D: se os resíduos i e j mutam sempre aos pares, provavelmente estão próximos no espaço (< 8 Å). O MSA típico compreende de 1000 a 100 000 sequências alinhadas.

2. Evoformer: atenção axial sobre o MSA e os pares. O Evoformer alterna entre (a) uma atenção sobre as linhas do MSA (row attention), captando as relações entre resíduos de uma mesma sequência, e (b) uma atenção sobre as colunas (column attention), captando a coevolução entre sequências. Os triangle updates e a triangle attention impõem a coerência geométrica: se d(i,j)d(i,j)d(i,j) e d(j,k)d(j,k)d(j,k) são conhecidos, d(i,k)d(i,k)d(i,k) fica restringido pela desigualdade triangular. 48 blocos Evoformer, cada um com 256 + 128 canais.

3. Structure Module: Invariant Point Attention (IPA). O módulo de estrutura converte as representações abstratas em coordenadas 3D. A IPA opera no espaço dos frames (referenciais locais SE(3)) ligados a cada resíduo — um backbone local definido por N, Cα, C. A atenção IPA é invariante por rotação e translação: a estrutura prevista não depende da orientação inicial. 8 blocos com reciclagem (3 iterações completas da rede).

4. Funções de perda e FAPE. A perda principal é o Frame Aligned Point Error (FAPE): para cada par de resíduos, o erro é medido no referencial local de um dos dois resíduos. Isso garante que as distâncias locais (ligações, ângulos) e as distâncias globais (contatos terciários) sejam otimizadas simultaneamente. O treinamento combina essa perda principal com várias perdas auxiliares:

PerdaFunção
FAPE (Frame Aligned Point Error)Perda principal — erro de posição medido no referencial local de cada resíduo
pLDDTConfiança local da previsão
pTMPontuação TM global
Violação da geometria peptídicaComprimentos de ligação, ângulos de Ramachandran

Por que deu certo

Duas inovações arquiteturais são decisivas. Em primeiro lugar, os triangle updates impõem a coerência geométrica 3D diretamente no espaço das representações — os métodos anteriores (trRosetta, RaptorX) previam mapas de distância 2D e depois reconstruíam a estrutura separadamente, perdendo informação. Em segundo lugar, a IPA permite raciocinar em referenciais locais invariantes por SE(3), eliminando a necessidade de data augmentation rotacional.

Ponto de comparaçãoAntes do AlphaFold 2AlphaFold 2
Coerência geométricaMapas de distância 2D (trRosetta, RaptorX), depois reconstrução separada da estrutura — perda de informaçãoTriangle updates: restrição 3D imposta no espaço das representações
Invariância às rotaçõesData augmentation rotacional necessáriaIPA: referenciais locais invariantes por SE(3)
Pontuação GDT mediana (CASP14)Limiar "resolvido" esperado: ~9092,4 / 100
Obtenção de uma estruturaDe meses a anos (cristalografia)Minutos (inferência)

O aprendizado por reciclagem (3 passagens completas da rede) permite uma autocorreção iterativa: os erros da primeira passagem são detectados e corrigidos pelas passagens seguintes, imitando o refinamento na cristalografia.

Cadeia causal

Paradoxo de Levinthal (1969, 10³⁰⁰ conformações possíveis) → criação do Protein Data Bank (1971) → lançamento do CASP (1994, benchmark bienal) → uso dos MSA para prever os contatos (Marks et al., 2011) → aprendizado profundo sobre mapas de distância (trRosetta, 2020) → AlphaFold 2 (2020, GDT 92,4, Evoformer + IPA) → publicação de 200M de estruturas (2022, AlphaFold DB) → AlphaFold 3 (2024, diffusion model, multialvo) → Prêmio Nobel de Química 2024 (Hassabis, Jumper)

Anedota

No anúncio dos resultados do CASP14, em 30 de novembro de 2020, John Moult — fundador do CASP — comenta: "This is a big deal, in some sense the problem is solved." Andrei Lupas, um dos avaliadores, declara à Nature: "Isso vai mudar tudo", e esclarece que os modelos do AlphaFold permitiram a seu laboratório resolver uma estrutura na qual emperrava havia quase dez anos. A comunidade dos bioinformatas, habituada a progressos incrementais de alguns pontos GDT por ciclo CASP, vê um salto sem qualquer comparação em um único concurso.

Legado e dados atuais

Desde 2022, a base AlphaFold DB difunde gratuitamente as estruturas previstas de 200 milhões de proteínas. A abordagem foi prolongada pelo AlphaFold 3 (2024), construído sobre um modelo de difusão e ampliado a alvos múltiplos. Em 2024, o Prêmio Nobel de Química reconhece Hassabis e Jumper.

Fontes

Referências verificadas durante a auditoria factual de agosto de 2026: são as páginas
contra as quais as afirmações deste boletim foram confrontadas.

  1. AlphaFold: a solution to a 50-year-old grand challenge in biology — Google DeepMind
  2. Comunicado oficial dos resultados do CASP14 — Prediction Center
  3. Highly accurate protein structure prediction with AlphaFold — Nature 596, 583-589