2020年11月30日,在CASP14竞赛的成绩公布中,AlphaFold 2取得92.4/100的GDT中位分——超过约90这一被视为问题「已解决」的门槛。仅凭序列预测一个蛋白质的三维结构,这个自莱文塔尔佯谬(1969年)以来悬而未决的问题,从数月的晶体学工作变成了几分钟的计算。2022年,2亿个预测结构被免费公开。
来源:deepmind.google
通俗地说
蛋白质是一条长长的链,它折叠起来形成一个精确的形状。仅凭链上各环节的清单去猜出这个形状,无异于在天文数字般庞大的可能性空间里找一根针——莱文塔尔佯谬把这个空间估算为大约10³⁰⁰种构象。五十年间,要得到真实的形状需要数月、有时数年的晶体学工作。AlphaFold 2在几分钟内完成同样的事,并在基准竞赛CASP14上取得92.4/100的成绩——90正是学界称问题「已解决」的门槛。保留意见只需一句话:该程序给出的是附带置信指标(pLDDT)的模型,而非实验测量值。
发现
| 参数 | 数值 |
|---|---|
| 日期 | 2020年11月30日(CASP14成绩);2021年7月15日(Nature, vol. 596, p. 583–589) |
| 团队 | DeepMind(John Jumper、Richard Evans 等),主要研究者约15人 |
| 问题 | 蛋白质折叠(莱文塔尔佯谬,1969年) |
| 基准 | CASP14(Critical Assessment of protein Structure Prediction) |
| GDT中位分 | 92.4 / 100(「已解决」门槛:约90) |
| 架构 | Evoformer(48个模块)+ Structure Module(IPA,8个模块) |
| 训练 | 来自PDB的约17万个结构,128块TPUv3,约11天 |
| 推理时间 | 数分钟(相较于晶体学的数月/数年) |
技术解释
1. 多重序列比对(MSA)与共进化信息提取。 从目标序列出发,AF2在UniRef90与MGnify数据库(约2.5亿条序列)中检索同源序列。共同演化的位点(MSA中相关联的列)指示三维接触:若残基 i 与 j 总是成对突变,二者在空间上很可能彼此靠近(< 8 Å)。典型的MSA包含1000至10万条已比对序列。
2. Evoformer:面向MSA与配对表示的轴向注意力。 Evoformer在两者之间交替:(a) 对MSA行的注意力(row attention),捕捉同一序列内残基之间的关系;(b) 对列的注意力(column attention),捕捉序列之间的共进化。triangle updates 与 triangle attention 强制几何一致性:若 d(i,j) 与 d(j,k) 已知,则 d(i,k) 受三角不等式约束。共48个Evoformer模块,每个含256 + 128个通道。
3. Structure Module:Invariant Point Attention(IPA)。 结构模块把抽象表示转换为三维坐标。IPA在附着于每个残基的 frames(局部SE(3)参考系)空间中运作——即由N、Cα、C定义的局部主链。IPA的注意力对旋转与平移保持不变:预测出的结构不依赖于初始取向。8个模块并带回收机制(网络整体迭代3次)。
4. 损失函数与FAPE。 主损失是 Frame Aligned Point Error(FAPE):对每一对残基,误差在其中一个残基的局部参考系中度量。这保证了局部距离(键长、键角)与全局距离(三级接触)被同时优化。训练把这一主损失与若干辅助损失结合起来:
| 损失 | 作用 |
|---|---|
| FAPE(Frame Aligned Point Error) | 主损失——在每个残基的局部参考系中度量的位置误差 |
| pLDDT | 预测的局部置信度 |
| pTM | 全局TM分数 |
| 肽几何违规 | 键长、拉氏(Ramachandran)角 |
为什么它成功了
两项架构创新具有决定意义。其一,triangle updates 把三维几何一致性直接施加于表示空间之中——此前的方法(trRosetta、RaptorX)先预测二维距离图,再另行重建结构,过程中损失了信息。其二,IPA使得推理可以在SE(3)不变的局部参考系中进行,从而不再需要旋转数据增强。
| 比较项 | AlphaFold 2之前 | AlphaFold 2 |
|---|---|---|
| 几何一致性 | 二维距离图(trRosetta、RaptorX),随后另行重建结构——信息损失 | Triangle updates:在表示空间中直接施加三维约束 |
| 旋转不变性 | 需要旋转数据增强 | IPA:SE(3)不变的局部参考系 |
| GDT中位分(CASP14) | 预期的「已解决」门槛:约90 | 92.4 / 100 |
| 获得一个结构 | 数月至数年(晶体学) | 数分钟(推理) |
回收式学习(网络整体走完3遍)实现了迭代式自我纠正:第一遍留下的错误被后续几遍检出并修正,这模仿了晶体学中的精修过程。
因果链
莱文塔尔佯谬(1969年,10³⁰⁰种可能构象)→ Protein Data Bank创建(1971年)→ CASP启动(1994年,两年一度的基准)→ 利用MSA预测接触(Marks et al., 2011)→ 在距离图上应用深度学习(trRosetta,2020年)→ AlphaFold 2(2020年,GDT 92.4,Evoformer + IPA) → 2亿个结构公开(2022年,AlphaFold DB)→ AlphaFold 3(2024年,diffusion model,多类靶标)→ 2024年诺贝尔化学奖(Hassabis、Jumper)
轶事
2020年11月30日CASP14成绩公布之际,CASP创始人John Moult评论道:"This is a big deal, in some sense the problem is solved." 评审者之一Andrei Lupas对 Nature 表示:「这将改变一切」,并说明AlphaFold的模型让他的实验室解出了一个卡了近十年的结构。生物信息学界原本习惯于每个CASP周期GDT只前进几分的渐进式进步,此刻却在一届竞赛中看到了无可比拟的跃升。
遗产与当前数据
自2022年起,AlphaFold DB数据库免费提供2亿个蛋白质的预测结构。这一路径由AlphaFold 3(2024年)延续下去,后者建立在扩散模型之上,并把适用范围扩展到多类靶标。2024年,诺贝尔化学奖授予了Hassabis与Jumper。
来源
2026年8月事实核查审计时所验证的参考文献:本简报的各项论断即是对照这些页面进行核对的。
