Предполагается, что несколько сотен человеческих белков регулируют наши гены, хотя неизвестно, какую последовательность ДНК они распознают. Консорциум Codebook получил воспроизводимый мотив для 177 из 332 белков-кандидатов; около 130 мотивов оказались новыми. Анализ также картировал 113 577 прямых и консервативных участков, из которых 82 760 относятся к белкам Codebook, а 30 817—к контролям. Для всех, кто интерпретирует генетические варианты, словарь пополнился новой главой.
Источник: nature.com
Простыми словами
Наши гены включены не постоянно. Белки, называемые «факторами транскрипции», садятся на короткие слова ДНК рядом с генами и определяют, какие из них будут экспрессироваться и когда. Слово, распознаваемое большинством таких белков, известно, но для нескольких сотен кандидатов, обнаруженных лишь потому, что они похожи на регуляторы, оно оставалось неизвестным. Большая международная группа проверила 332 этих загадочных белка пятью взаимодополняющими методами в более чем 4 000 экспериментов. Половина раскрыла своё слово; теперь можно предсказывать, где эти белки связываются в геноме и как замена одной буквы ДНК может разрушить их точку опоры. Это не лекарство и не клинический тест, а фундаментальный элемент чтения генома, особенно полезный, когда вариант последовательности попадает прямо на одно из таких слов.
Техническая карточка — Открытие
| Параметр | Значение |
|---|---|
| Дата публикации | 5 августа 2026 |
| Журнал | Nature (рецензируемая статья) |
| Название | An expanded codebook of human transcription factor DNA-binding specificity |
| DOI | 10.1038/s41586-026-10798-9 |
| Авторы для корреспонденции | Bart Deplancke, Ivan V. Kulakovskiy и Timothy R. Hughes—коллаборация Codebook–GRECO-BIT |
| Проанализированные белки | 393 (332 предполагаемых фактора транскрипции + 61 контроль) |
| Объём экспериментов | 4 804 эксперимента (4 377 с белками Codebook и 427 с контролями) |
| Использованные методы | HT-SELEX · GHT-SELEX · SMiLE-seq · матрицы PBM · ChIP–seq (клетки HEK293) |
| Полученные мотивы | 177/332 предполагаемых факторов (53 %) + 58/61 контролей |
| Чистый вклад | ≈ 130 новых мотивов → человеческий лексикон расширен как минимум на 15 % (новый итог: 1 421 охарактеризованный FT) |
| Картированные консервативные участки | 113 577 участков CTOP: 82 760 Codebook + 30 817 контролей (1 394 530 оснований) |
| Репозиторий данных | CisBP build 3.1, идентификатор Jolma,2026a; humantfs.ccbr.utoronto.ca |
| Статус | Рецензируемая работа, проект продолжался ~6 лет |
Техническое объяснение
Что физически представляет собой мотив. Фактор транскрипции (FT) распознаёт ДНК с помощью ДНК-связывающего домена (DBD), поверхность которого соответствует желобку двойной спирали. Специфические контакты—водородные связи и ван-дер-ваальсовы взаимодействия—между определёнными аминокислотами и краями пар оснований, считываемых в большой бороздке, задают предпочтение последовательности. Это предпочтение моделируется позиционно-весовой матрицей (PWM): относительной вероятностью A, C, G и T в каждой позиции участка. PWM—не сам белок, а статистическое описание того, какие буквы он допускает в каждой позиции.
Почему только половина даёт мотив и что это означает. Из 332 предполагаемых факторов 177 (53 %) дают воспроизводимый мотив. Доминирует класс цинковых пальцев C2H2 (121/180, то есть 67 %); напротив, среди 49 белков без известного ДНК-связывающего домена мотив дают только 6 (12 %), и у всех шести в итоге обнаруживается правдоподобная область связывания. Исследование не превращает каждый экспериментальный провал в доказательство отсутствия. Повторная курация относит 83 из 155 неудач к вероятным истинно отрицательным результатам. Остальным могут требоваться партнёр, модификация ДНК или отсутствующая в экспериментах посттрансляционная модификация.
Механизм методов—что доказывает каждый тест. Сила исследования в сочетании измерений, которые успешны или неуспешны по разным причинам, поэтому мотив, подтверждённый двумя платформами, вряд ли является артефактом.
| Метод | Что он измеряет | Что он демонстрирует |
|---|---|---|
| HT-SELEX | Итеративный отбор на случайной ДНК | Внутреннее предпочтение вне геномного контекста |
| GHT-SELEX | HT-SELEX на фрагментированной геномной ДНК | Предпочтение в контексте реальных геномных последовательностей |
| SMiLE-seq | Связывание одиночных FT или димеров в микрофлюидике | Мотивы комплексов с малым смещением |
| PBM | Матрицы заданных двуцепочечных зондов | Полное сканирование коротких k-меров |
| ChIP–seq | Занятые in vivo участки (HEK293) | Где белок фактически связывается в клетке |
Критерий успеха явно перекрёстный: мотив сохраняют, только если он сходен на ≥ 2 платформах и предсказывает данные остальных. Надёжность обеспечивает это пересечение, а не отдельное измерение.
- От мотивов к вероятно важным участкам: логика «TOP». Один мотив даёт избыточные предсказания, потому что геном насыщен случайными совпадениями. Авторы определяют участки TOP (triple optimized overlap) как пересечение трёх свидетельств: пика ChIP–seq (занятость in vivo), сигнала GHT-SELEX (прямое связывание in vitro) и совпадения PWM, каждое со своим порогом. Так получают непосредственно связанные в тестах участки с однонуклеотидным разрешением. Сравнивая консервативность мотива (phyloP, выравнивание 241 млекопитающего Zoonomia) с окружающей последовательностью, группа выделяет 113 577 консервативных участков CTOP—82 760 для белков Codebook и 30 817 для контролей—покрывающих около 1,39 миллиона оснований. Такое обогащение убедительно поддерживает их функциональную значимость, но не доказывает индивидуальную функцию каждого участка.
Почему это сработало
Самое наглядное количественное сравнение: при объединении 177 мотивов Codebook с уже известными мотивами 1 211 человеческих FT—в 7,8× большего числа белков—получается лишь в 4,75× больше разных семейств мотивов, причём от 92 до 135 из этих семейств, в зависимости от метода, содержат только мотивы Codebook. Иными словами, долго игнорировавшиеся белки дают непропорционально большую долю новизны: как минимум на 15 % больше слов в лексиконе, считавшемся почти полным. Результат сохраняется при смене базы мотивов, метрики сходства и процедуры группировки.
Измеренная прогностическая полезность: в данных HEK293 из исследования PWM Codebook отличают участки связывания от случайных последовательностей с медианной AUROC 0,71; в других типах клеток значение немного ниже. Для 2 260 сильно нарушающих вариантов экспериментально наблюдаемое аллельное предпочтение совпадает с прогнозом PWM в 74 % случаев.
Важно помнить о разрыве между заявлением и доказательством: «расширение лексикона на 15 %» надёжно установлено и устойчиво. Однако исследование не утверждает, что все 177 белков являются активными регуляторами в конкретном физиологическом контексте—ChIP–seq проводился в одной клеточной линии (HEK293), а тканеспецифическая активность не проверялась. Ограничения признаны явно: только пять методов, одна клеточная линия и почти половина предполагаемых факторов без мотива, многие из которых, вероятно, не связываются с последовательностью.
Причинная цепочка
Перепись человеческих FT 2018 года → вывод: несколько сотен «предполагаемых» FT без известного мотива → проект Codebook (5 методов, почти 6 лет) → 4 804 эксперимента с 393 белками → 177 воспроизводимых мотивов (в том числе ~130 новых) → пересечение ChIP–seq ∩ GHT-SELEX ∩ PWM → 113 577 консервативных участков CTOP (82 760 Codebook + 30 817 контролей) → прогноз эффекта вариантов (74 % аллельного соответствия в 2 260 сильно нарушающих случаях) → обогащение по SNP заболеваний (OR 1,35) и eQTL GTEx (OR 1,34) → курированный итог в 1 421 человеческий FT с охарактеризованной специфичностью последовательности, объединяющий успехи Codebook и 33 недавних внешних вклада.
Историческая деталь
Название «Codebook» прямо описывает цель проекта: каждый фактор транскрипции распознаёт в геноме «слово» последовательности. В результатах доминирует класс цинковых пальцев C2H2: мотивы получены для 121 из 180 белков-кандидатов этого семейства. Но словарь всё ещё неполон: мотив описывает предпочтение связывания, а не сам по себе биологическую роль белка в каждой клетке.
Наследие и современные данные
Эталонная перепись человеческих FT (Lambert et al., Cell 2018) оставила несколько сотен «предполагаемых» белков без известной специфичности. 177 успешных результатов Codebook, дополненные 33 FT из недавних внешних наборов, доводят курированное число человеческих FT с охарактеризованной специфичностью последовательности до 1 421; репрезентативные PWM приведены в Supplementary Data 1. Данные Codebook размещены в CisBP build 3.1 под идентификатором Jolma,2026a. Для некодирующего варианта мотив позволяет предсказать нарушение связывания в измеренных здесь пределах: медианная AUROC 0,71 в HEK293 и аллельное соответствие 74 % среди сильно нарушающих случаев. Одного мотива недостаточно, чтобы объявить участок функциональным или последствие клинически значимым.
Взгляд исследователя — открытые вопросы
(Интерпретация, а не результаты исследования.) Решающими продолжениями станут: (1) переносимость между тканями—повторить ChIP–seq в нескольких клеточных линиях, чтобы отделить универсальные участки от контекстно-зависимых; лишь так можно выяснить, что и где регулируют 177 FT; (2) направленная нарушающая мутация—исключить остаток специфичности цинкового пальца и проверить исчезновение ожидаемого мотива, получив причинное доказательство того, что этот остаток обеспечивает считывание; (3) 155 молчащих факторов—части из них может требоваться обязательный партнёр, модификация ДНК вроде метилирования или отсутствующая in vitro посттрансляционная модификация; повторные испытания в таких условиях отличат «истинно отрицательные» результаты от «методических ложноотрицательных».
Источники
Ссылки, проверенные при фактчекинге (дата доступа: 6 августа 2026).
- Codebook–GRECO-BIT Collaboration (Hughes, T. R. et al.). An expanded codebook of human transcription factor DNA-binding specificity. Nature, опубликовано 5 августа 2026. DOI: 10.1038/s41586-026-10798-9. (Рецензируемая статья. Данные: CisBP build 3.1, идентификатор
Jolma,2026a.)
Фоновые источники
(Контекст, отличный от первичного источника исследования.)
- Lambert, S. A. et al. The human transcription factors. Cell 172, 650–665 (2018).
- Stormo, G. D. & Zhao, Y. Determining the specificity of protein–DNA interactions. Nat. Rev. Genet. 11, 751–760 (2010).
- Najafabadi, H. S. et al. C2H2 zinc finger proteins greatly expand the human regulatory lexicon. Nat. Biotechnol. 33, 555–562 (2015).
Заявление об уверенности. Надёжно установлены: характеристика мотивов для 177/332 предполагаемых FT, добавление примерно 130 мотивов (как минимум на 15 % больше лексикона), 113 577 консервативных участков CTOP—82 760 Codebook и 30 817 контролей—и измеренная прогностическая ценность (медианная AUROC 0,71 в HEK293; аллельное соответствие 74 % в 2 260 сильно нарушающих случаях). Неопределённы или не проверены здесь: тканеспецифическая регуляторная активность этих FT, индивидуальная функция каждого участка CTOP и причина каждой неудачи при поиске мотива. Технические проверки: DOI разрешается, точный объём экспериментов, распределение CTOP и состав общего числа 1 421 исправлены. Вердикт дедупликации: КОНТРОЛИРУЕМОЕ ВОССТАНОВЛЕНИЕ ИЗ БЭКЛОГА—ключ DOI уже существует в реестре как A005, но соответствующего бюллетеня в базе данных нет; это восстановление возвращает исторический материал без создания нового ракурса или новой записи реестра.
