027

Papers with Code 蛋白结构预测导航

蛋白结构预测的方法进展快,排行榜与基准是跟进的入口。这篇讲清关键基准、指标与解读要点。

蛋白结构预测是 AI 生物学中进展最快、也最有共识的方向。跟进这个领域的关键是理解几个核心基准与指标——它们决定了「什么算做得好」。

核心基准

基准 内容 特点
CASP 两年一次的盲测竞赛 金标准——预测时真实结构尚未公开
CAMEO 持续的自动评测 每周更新,跟踪新发布的 PDB 结构
PoseBusters 蛋白-配体复合物 强调物理有效性
CAPRI 蛋白-蛋白复合物 界面预测
PDB 时间划分 用某日期后的结构测试 防止训练数据泄漏

CASP 的盲测设计是它的核心价值:预测提交时,真实结构还没有公开——这从根本上排除了数据泄漏的可能。相比之下,用已公开的 PDB 结构做测试,永远存在「模型是否见过」的疑问。

关键指标

# ---- GDT-TS(Global Distance Test - Total Score)----
#   CASP 的主要指标,0~100
#   计算:在不同距离阈值(1、2、4、8 Å)下
#         能对齐的残基百分比的平均
#
#   > 90   接近实验精度
#   70~90  正确的折叠,细节可用
#   50~70  大体正确的折叠
#   < 50   折叠可能错误
#
# ---- TM-score ----
#   0~1,衡量整体折叠的相似性
#   > 0.5  通常认为是相同的折叠
#   > 0.9  非常接近
#   【对蛋白长度不敏感】—— 这是它优于 RMSD 的地方
#
# ---- RMSD ----
#   直观但【对长度敏感】
#   长蛋白的 RMSD 天然更大
#   → 【不适合跨蛋白比较】
#
# ---- lDDT ----
#   基于局部距离差异,不需要全局对齐
#   → 【对柔性区域更稳健】
#   → pLDDT 就是模型对它的预测
#
# ---- DockQ(复合物)----
#   综合界面 RMSD、配体 RMSD、接触保真度
#   > 0.8   高质量
#   0.49~0.8 中等
#   0.23~0.49 可接受
#   < 0.23  失败
#
# ---- 配体姿势:RMSD ≤ 2 Å + 物理有效性 ----
#   【PoseBusters 的重要贡献】:
#     只看 RMSD 是不够的
#     必须同时检查键长键角、空间冲突、立体化学
#   → 【很多深度学习方法的 RMSD 达标率
#      在加上有效性检查后大幅下降】

方法演进的脉络

阶段 代表 关键突破
同源建模 Modeller、SWISS-MODEL 依赖模板
接触预测 共进化分析方法 从 MSA 提取接触
端到端预测 AlphaFold2(见 112《AlphaFold2 论文精读》 MSA 与结构联合优化
开放复现 RoseTTAFold、OpenFold(见 114《RoseTTAFold 论文精读》117《OpenFold》 社区可用
无 MSA ESMFold(见 116《ESMFold 论文精读》 语言模型替代 MSA
全原子复合物 AlphaFold3、RFAA(见 113《AlphaFold3 论文精读》115《RoseTTAFold All-Atom》 统一建模多种分子
开放可商用 Boltz、Chai-1(见 120《Boltz-1 技术报告精读》122《Chai-1 技术报告精读》 产业可用
结构 + 亲和力 Boltz-2(见 121《Boltz-2 技术报告精读》 向决策靠拢

解读排行榜时要问的问题

# 【蛋白结构预测领域特有的陷阱】
#
# 1) 【训练数据的截止日期】
#    模型训练用了哪个日期之前的 PDB?
#    测试集的结构是什么时候发布的?
#    → 【测试结构在训练截止日期之前 = 可能泄漏】
#    → 这是最重要的检查
#
# 2) 【是否使用了模板】
#    用模板 vs 不用模板,难度完全不同
#    → 同源结构可用时,任务简单得多
#    → 【比较时必须统一设置】
#
# 3) 【MSA 的深度】
#    有深 MSA 的蛋白容易预测
#    → 报告应该分层:
#      深 MSA / 浅 MSA / 无 MSA 各自的表现
#
# 4) 【测试集的难度分布】
#    容易的靶标(有近缘模板)与
#    困难的靶标(新颖折叠)
#    → 平均值会掩盖这个差异
#
# 5) 【复合物预测的额外问题】
#    - 界面是否在训练集中出现过?
#    - 【抗体-抗原是公认的难点】(见 364)
#    - 弱瞬时相互作用预测不可靠
#
# 6) 【配体姿势的物理有效性】
#    RMSD 达标但物理不合理的姿势
#    在实际使用中是没有价值的
#    → 【必须看 PoseBusters 通过率】

# 【最可信的证据】:
#   CASP 的盲测结果
#   → 因为提交时真实结构尚未公开

对药物发现的实际意义

  • 结构预测的进展扩大了结构基设计的适用范围:过去没有结构的靶点现在可以尝试;
  • 但预测结构用于对接仍有明显折扣:apo 样构象、侧链取向不可靠(见 112《AlphaFold2 论文精读》);
  • 复合物预测是更有价值的方向:直接预测蛋白-配体复合物,绕过「预测 apo 结构再对接」的两步误差累积;
  • 亲和力预测才是真正的需求:结构再准,不知道结合强度也无法排序候选分子——这是 Boltz-2 等工作的方向(见 121《Boltz-2 技术报告精读》);
  • 许可是产业界的实际约束:AF3 不能商用,Boltz 的 MIT 许可让这个能力真正可用

跟进这个领域的建议

# 【关注的优先级】
#
# 高优先级:
#   □ CASP 的结果(两年一次)
#   □ 【PoseBusters 类的严格评测】
#   □ 开源可商用模型的进展(Boltz、Chai)
#   □ 亲和力预测的进展
#
# 中优先级:
#   □ CAMEO 的持续评测
#   □ 复合物预测的方法
#   □ 抗体特异的方法(见 364)
#
# 低优先级:
#   □ 单序列预测的微小改进
#   □ 只在旧基准上的提升
#
# 【一个实用的做法】:
#   在自己关心的靶点上,
#   用几个方法各跑一遍,比较:
#     - 结构的一致性
#     - 能否复现已知的共晶结合模式
#     - 用于对接的效果
#   → 【这比读十篇论文更能告诉你该用什么】

关键要点

  • CASP 的盲测设计从根本上排除了数据泄漏,是最可信的证据;
  • 解读排行榜必须查训练截止日期、是否用模板、MSA 深度分层
  • 配体姿势只看 RMSD 不够——必须看 PoseBusters 的物理有效性通过率;
  • 对药物发现而言,复合物预测与亲和力预测比 apo 结构预测更有价值

延伸资源