数百种人类蛋白质被怀疑能够调控基因,但人们一直不知道它们识别哪段DNA序列。Codebook联盟为332个候选蛋白质中的177个获得了可重复的基序,其中约130个基序是新的。分析还绘制出113,577个直接结合且保守的位点,其中Codebook蛋白质占82,760个,对照占30,817个。对于解释遗传变异的人来说,这本词典刚刚增加了一个章节。
来源:nature.com
通俗解释
我们的基因不会一直开启。被称为“转录因子”的蛋白质会停靠在基因附近的短DNA“词语”上,决定哪些基因在何时表达。大多数转录因子识别的词语已经清楚,但还有数百种蛋白质只是因为看起来像调控因子而被列为候选,它们识别的词语始终未知。一个大型国际合作团队利用五种互补技术和超过4,000次实验,测试了332种这样的神秘蛋白质。结果,一半给出了自己的词语;研究人员由此能够预测它们在基因组中的结合位置,以及DNA单个字母的变化如何破坏它们的落脚点。这不是药物,也不是临床检测,而是读取基因组的一块基础拼图;当序列变异恰好落在某个词语上时,它尤其有用。
技术概览 — 发现
| 参数 | 数值 |
|---|---|
| 发表日期 | 2026年八月5日 |
| 期刊 | Nature(同行评议论文) |
| 标题 | An expanded codebook of human transcription factor DNA-binding specificity |
| DOI | 10.1038/s41586-026-10798-9 |
| 通讯作者 | Bart Deplancke、Ivan V. Kulakovskiy、Timothy R. Hughes—Codebook–GRECO-BIT合作 |
| 分析的蛋白质 | 393种(推定转录因子332种 + 对照61种) |
| 实验规模 | 4,804次(Codebook蛋白质4,377次,对照427次) |
| 使用的实验 | HT-SELEX · GHT-SELEX · SMiLE-seq · PBM芯片 · ChIP–seq(HEK293细胞) |
| 获得的基序 | 推定因子177/332(53%)+ 对照58/61 |
| 净新增 | ≈ 130个新基序 → 人类词汇扩充至少15%(新总数:已表征FT 1,421个) |
| 绘制的保守位点 | CTOP位点113,577个:Codebook 82,760 + 对照30,817(1,394,530个碱基) |
| 数据存储 | CisBP build 3.1,登录号Jolma,2026a;humantfs.ccbr.utoronto.ca |
| 状态 | 同行评议,项目历时~6年 |
技术解析
基序在物理上是什么。 转录因子(FT)通过DNA结合结构域(DBD)识别DNA,该结构域的表面与双螺旋沟槽相吻合。某些氨基酸与大沟中暴露的碱基对边缘形成特异接触,包括氢键和范德华相互作用,从而决定序列偏好。研究人员用位置权重矩阵(PWM)描述这种偏好,即位点每个位置上A、C、G、T的相对概率。PWM不是蛋白质本身,而是蛋白质对每个字母容忍程度的统计摘要。
为何只有一半给出基序,这意味着什么。 在332个推定因子中,177个(53%)产生可重复的基序。C2H2锌指类别占主导(121/180,即67%);相反,在49个没有已知DNA结合结构域的蛋白质中,只有6个(12%)产生基序,而且这六个最终都含有可信的结合区域。研究并没有把每次实验失败都视为不存在结合的证据。重新整理后,155个失败案例中的83个被归为很可能是真阴性。其余案例可能需要实验中缺失的伙伴、DNA修饰或翻译后修饰。
方法的机制:每种实验能证明什么。 本研究的优势在于交叉使用因不同原因成功或失败的测量,因此被两个平台共同保留的基序不太可能是伪影。
| 实验 | 测量什么 | 证明什么 |
|---|---|---|
| HT-SELEX | 在随机DNA上反复筛选 | 脱离基因组语境的内在偏好 |
| GHT-SELEX | 在片段化基因组DNA上进行HT-SELEX | 真实基因组序列语境中的偏好 |
| SMiLE-seq | 在微流控系统中测量单个FT或二聚体结合 | 复合体基序,偏差较低 |
| PBM | 采用确定的双链探针芯片 | 穷尽扫描短k-mer |
| ChIP–seq | in vivo占据位点(HEK293) | 蛋白质在细胞内实际停靠的位置 |
成功标准明确要求跨平台验证:只有当基序在**≥ 2个平台上相似**,并且能够预测其他平台的数据时,才会被保留。可靠性来自这种交叉印证,而非某一次孤立测量。
- 从基序到可能重要的位点:“TOP”逻辑。 单靠基序会产生过度预测,因为基因组中充满偶然匹配。作者将TOP(triple optimized overlap)位点定义为三类证据的交集:ChIP–seq峰(in vivo占据)、GHT-SELEX信号(直接的in vitro结合)以及PWM匹配,并分别设置阈值。由此获得的是实验中直接结合、达到单碱基分辨率的位点。团队比较基序与周边序列的保守性(phyloP,Zoonomia的241种哺乳动物比对),筛出113,577个保守CTOP位点,其中Codebook蛋白质82,760个、对照30,817个,覆盖约1.39百万个碱基。这种富集强有力地支持其功能重要性,但并未证明每个位点的具体功能。
为何能够实现
最有说服力的定量比较是:把177个Codebook基序与1,211个人类FT的已知基序放在一起,蛋白质数量增加到7.8×,但不同基序家族只增加到4.75×;根据聚类方法,其中92至135个家族只包含Codebook基序。换言之,这些长期被忽视的蛋白质贡献了不成比例的新颖性:在一套曾被认为接近完整的词汇中,增加了至少15%的词语。改变基序数据库、相似性指标和聚类程序,结果依然稳健。
测得的预测效用:在研究的HEK293数据中,Codebook PWM区分结合位点与随机序列的AUROC中位数为0.71;其他细胞类型中的数值略低。在2,260个高度破坏性变异中,实验观察到的等位基因偏好有74%与PWM预测一致。
必须注意主张与证据之间的边界:“词汇扩充15%”已经得到可靠且稳健的支持。不过,研究并未声称177种蛋白质在任何特定生理情境中都是活跃调控因子。ChIP–seq只在单一细胞系(HEK293)中进行,也没有测试组织特异性活性。研究明确承认局限:只有五种实验、一个细胞系,而且接近一半的推定因子没有基序,其中许多很可能不结合序列。
因果链
2018年人类FT普查 → 发现:数百个“推定”FT没有已知基序 → Codebook项目(5种实验、近6年)→ 对393种蛋白质开展4,804次实验 → 177个可重复基序(其中~130个新基序)→ ChIP–seq ∩ GHT-SELEX ∩ PWM交集 → 113,577个保守CTOP位点(Codebook 82,760 + 对照30,817)→ 预测变异效应(2,260个高度破坏性案例中的等位基因一致率74%)→ 疾病SNP(OR 1.35)和GTEx eQTL(OR 1.34)富集 → 把Codebook成果与近期33项外部贡献合并,已表征序列特异性的人类FT总数达到1,421。
轶事
“Codebook”这个名称直接描述了项目目标:每个转录因子都识别基因组中的一个序列“词语”。C2H2锌指类在结果中占主导,该家族180个候选蛋白质中有121个获得了基序。不过,这本词典仍不完整:基序描述的是结合偏好,不能单凭它判断一种蛋白质在每种细胞中的生物学角色。
历史脉络与当前数据
人类FT的基准普查(Lambert et al., Cell 2018)留下数百个特异性未知的“推定”蛋白质。Codebook的177项成功加上近期外部数据集发现的33个FT,使具有已表征序列特异性的人类FT整理总数达到1,421;代表性PWM见Supplementary Data 1。Codebook数据存放在CisBP build 3.1,登录号为Jolma,2026a。对于非编码变异,基序可以预测结合扰动,但受限于本研究测得的性能:HEK293中的AUROC中位数为0.71,高度破坏性案例中的等位基因一致率为74%。单凭一个基序,不足以断言位点具有功能,也不足以认定后果具有临床意义。
研究者视角 — 未解问题
(这是解释,而非本研究的结果。) 关键后续工作包括:(1) 组织可迁移性—在多个细胞系中重复ChIP–seq,区分普遍位点与情境依赖位点,这是确定177个FT在何处调控什么的唯一方法;(2) 定向破坏性突变—去除锌指中的特异性残基,检查预期基序是否消失,为该残基承担读取功能提供因果证据;(3) 155个沉默因子—其中一部分可能需要必需伙伴、DNA修饰(如甲基化),或in vitro实验中缺失的翻译后修饰;在这些条件下重新测试,可区分“真阴性”和“方法学假阴性”。
来源
事实核查审计中已验证的参考资料(访问日期:2026年八月6日)。
- Codebook–GRECO-BIT Collaboration (Hughes, T. R. et al.). An expanded codebook of human transcription factor DNA-binding specificity. Nature,发表于2026年八月5日。DOI:10.1038/s41586-026-10798-9。(同行评议论文。数据:CisBP build 3.1,登录号
Jolma,2026a。)
背景文献
(与研究一手来源分开的背景资料。)
- Lambert, S. A. et al. The human transcription factors. Cell 172, 650–665 (2018).
- Stormo, G. D. & Zhao, Y. Determining the specificity of protein–DNA interactions. Nat. Rev. Genet. 11, 751–760 (2010).
- Najafabadi, H. S. et al. C2H2 zinc finger proteins greatly expand the human regulatory lexicon. Nat. Biotechnol. 33, 555–562 (2015).
可信度声明。 可靠确立的内容:为177/332个推定FT表征基序,增加约130个基序(词汇至少扩充15%),113,577个保守CTOP位点—Codebook 82,760个、对照30,817个—以及测得的预测能力(HEK293中AUROC中位数0.71;2,260个高度破坏性案例中等位基因一致率74%)。不确定或未在本研究中检验的内容:这些FT的组织特异性调控活性、每个CTOP位点的个体功能,以及每次基序失败的原因。技术检查:DOI可解析,实验总量、CTOP拆分和总数1,421的组成已纠正。去重结论:受控的历史积压恢复—DOI键已以A005存在于登记表中,但数据库中没有对应快讯;此次恢复只补回历史内容,不创建新角度或新登记项。
