Простыми словами
Белок — это длинная цепь, которая сворачивается сама на себя, и число возможных укладок астрономически велико: именно эту трудность и пытается обойти предсказание структуры. AlphaFold 3, опубликованный DeepMind в мае 2024 года, расширяет задачу до комплексов — того, что белок образует вместе с ДНК, РНК, лигандом или ионом, — а не только до отдельных белков. Ради этого он больше не собирает структуру по частям: он стартует со случайного шума и постепенно снимает его, пока не проступают атомные координаты, что позволяет предлагать для одного и того же комплекса несколько правдоподобных форм вместо одной. Предполагаемое применение — скрининг молекул-кандидатов на компьютере, до работы в лаборатории. Готовым продуктом это всё же не является: каждое предсказание сопровождается показателями достоверности, наименее надёжные участки ещё предстоит подтвердить экспериментально, а независимую слепую оценку модель прошла лишь после выхода, на CASP16.
Открытие
| Параметр | Значение |
|---|---|
| Дата публикации | 8 мая 2024 года (Nature, т. 630, с. 493–500) |
| Команда | DeepMind / Isomorphic Labs (Josh Abramson, Jonas Adler et al.) |
| Архитектура | Обусловленная diffusion model (Pairformer + diffusion head) |
| Обучающие данные | PDB (отсечка на 30 сентября 2021 года) + cross-distillation из AlphaFold-Multimer v2.3 |
| Мишени | Белки, ДНК, РНК, лиганды, ионы, посттрансляционные модификации |
| Публичный сервер | AlphaFold Server (не более 5000 остатков на запрос) |
| Лицензия | На старте — публичный сервер; веса и исходный код открыты в ноябре 2024 года для академического использования |
Техническое объяснение
1. Мультимодальное представление входа. AlphaFold 3 принимает на вход белковую последовательность (MSA + templates), нуклеотидную последовательность (ДНК/РНК) и/или лиганд в формате SMILES. Каждая сущность токенизируется и проецируется в общее пространство embedding размерности 384. Пары остаток-остаток (или остаток-атом) кодируются в матрице pair-представления размерности N×N×128.
2. Trunk: Pairformer (замена Evoformer). Pairformer использует слои triangle attention и triangle update (как и AF2), но отказывается от явного MSA-представления в пользу сжатого single embedding. Это снижает сложность по памяти с O(Nseq×Nres2) до O(Nres2) и позволяет обрабатывать комплексы более чем из 5000 остатков. Trunk состоит из 48 блоков Pairformer с остаточными связями.
3. Diffusion head: генерация координат через шумоподавление. В отличие от AF2 (где используется структурный модуль IPA), AF3 порождает трёхмерные атомные координаты через процесс диффузии-шумоподавления в 200 шагов. Модель учится обращать гауссов шум, наложенный на атомные координаты из PDB. На каждом шаге сеть предсказывает подлежащий удалению шум, постепенно уточняя структуру. Такой подход естественным образом схватывает мультимодальность — несколько возможных конформаций для одного и того же комплекса.
4. Confidence head и рециклинг. Модуль достоверности оценивает pTM (predicted TM-score), PAE (predicted aligned error) и pLDDT (predicted local distance difference test). Предсказания с низкой достоверностью (pLDDT < 50) соответствуют внутренне неупорядоченным участкам или плохо разрешённым интерфейсам.
Почему это сработало
Диффузионный подход снимает два главных ограничения AF2: смещение в сторону единственной конформации (модуль IPA в AF2 сходится к единственному минимуму) и невозможность моделировать малые молекулы (лиганды, ионы), у которых нет MSA. В таблице ниже два поколения сопоставлены по описанным выше архитектурным пунктам.
| Критерий сравнения | AlphaFold 2 | AlphaFold 3 |
|---|---|---|
| Trunk | Evoformer, с явным MSA-представлением | Pairformer, сжатый single embedding |
| Сложность по памяти | O(Nseq×Nres2) | O(Nres2) |
| Генерация координат | Структурный модуль IPA | Диффузия-шумоподавление в 200 шагов |
| Получаемые конформации | Сходимость к единственному минимуму | Ансамбль структур (мультимодальность) |
| Малые молекулы (лиганды, ионы) | Не моделируются из-за отсутствия MSA | Поддерживаются |
Диффузионная модель порождает ансамбль структур и тем самым схватывает конформационную неоднородность — это критично для сайтов связывания белок-лиганд, где гибкость определяет аффинность.
Обучение сочетает PDB и cross-distillation предсказаний AlphaFold-Multimer v2.3: AF3 учится у предшественника и одновременно превосходит его, создавая петлю накопительного улучшения.
Причинная цепочка
Парадокс Левинталя (1969, астрономическое конформационное пространство) → CASP (1994, бенчмарк раз в два года) → AlphaFold 1 (2018, CASP13, GDT 58) → Evoformer + IPA (AF2, 2020, CASP14, GDT 92,4) → Публикация 200 млн структур (2022) → AlphaFold 3 (2024, diffusion model, множество классов мишеней) → Виртуальный скрининг in silico (2024–) → Ускоренный drug design (горизонт 2026–2030)
Исторический эпизод
На момент публикации в мае 2024 года AF3 был оценён только на внутренних бенчмарках — CASP15 прошёл в 2022 году, до его выхода, — что вызвало критику сообщества из-за отсутствия независимой проверки. С тех пор модель прошла независимую слепую оценку на CASP16 (2024), опубликованную в Proteins.
Ограничения и споры
Приведённые результаты соответствуют данным, опубликованным в указанных источниках. Исторические измерения были пересмотрены последующими исследованиями — современные значения приводятся там, где они расходятся. Текущая статистика взята из институциональных источников, методики которых могут различаться.
Источники
Ссылки, проверенные в ходе фактологического аудита в августе 2026 года: именно с этими
страницами сверялись утверждения данного бюллетеня.
