238

PDBbind:结合亲和力数据集怎么用于 AI 训练

PDBbind 把 PDB 复合物配上实测亲和力,是打分函数与亲和力模型的常用训练评测集。这篇讲清它的分层结构、CASF 评测体系与广为人知的数据泄漏问题。

PDBbind 把 PDB 中的蛋白-配体复合物结构与从原始文献人工提取的实测结合亲和力(Kd、Ki、IC50)配对,是打分函数开发和结合亲和力预测模型最常用的数据集。几乎所有 AI 打分函数的论文都会报 PDBbind 上的成绩——也正因如此,它的数据泄漏问题必须先讲清楚

三层结构

集合 规模(v2020 量级) 筛选标准 用途
General set 约 19,000 所有有亲和力数据的复合物 预训练、数据增强
Refined set 约 5,300 分辨率 ≤ 2.5 Å、R 因子达标、配体质量好、Kd/Ki 精确值 主要训练集
Core set 约 285 从 refined set 精选,按靶点聚类、覆盖亲和力范围 CASF 评测的测试集

Core set 的构建很讲究:按序列相似性把靶点聚成约 57 簇,每簇选 5 个亲和力跨度大的复合物。这样设计是为了同时评测不同靶点间的排序同一靶点内的排序

CASF 评测的四个维度

  • Scoring power:预测亲和力与实测值的 Pearson 相关系数。目前经典打分函数约 0.5~0.6,机器学习方法可到 0.8 以上(但见下文的泄漏问题)。
  • Ranking power:同一靶点内不同配体的排序能力(Spearman)。这个比 scoring power 更贴近实际用途——先导优化关心的是「哪个更强」而非绝对数值。
  • Docking power:能否从一堆诱饵姿势中挑出正确姿势(RMSD ≤ 2 Å)。
  • Screening power:虚拟筛选的富集能力,最接近真实筛选场景。

一个反复被观察到的现象:机器学习打分函数在 scoring power 上大幅领先,但在 screening power 上未必优于经典物理打分函数。这说明它们学到的更多是「记住这类复合物大概什么亲和力」,而非真正理解结合。

数据泄漏:使用前必读

PDBbind 上的高分成绩,很大一部分来自数据泄漏,主要有三种:

  • 靶点相似性泄漏:训练集和测试集里有同源蛋白(甚至同一蛋白的不同结构)。模型只要认出「这是激酶 X」就能猜个大概。
  • 配体相似性泄漏:同一系列的类似物分散在训练与测试集中。
  • 只看配体也能拿高分:多项研究发现,把蛋白信息完全去掉、只用配体特征训练,在 PDBbind 上照样能拿到接近的相关系数。这说明模型很大程度上是在学配体的分子量、疏水性等平凡特征与亲和力的统计关联,而非蛋白-配体相互作用。
# 正确做法:做严格划分并设置对照
# 1) 按蛋白序列相似性聚类划分(如 < 30% identity)
# 2) 同时做配体骨架划分
# 3) 必设「只用配体」的对照实验
#    若你的复合物模型只比配体-only 模型好一点点,
#    说明它并没有真正学到相互作用

# 4) 用时间划分:训练用 2019 年前的结构,测试用之后的

更严格的替代与补充

  • 时间划分基准:用结构发布年份切分,模拟真实的前瞻预测场景。
  • LP-PDBbind 等重新划分的版本:专门控制了蛋白与配体的泄漏。
  • PoseBusters 基准集:专注姿势预测的物理有效性评估。
  • 结合 LIT-PCBA(见 242《LIT-PCBA》):评估真实筛选场景下的富集能力。

上手提示

  • Refined set 做训练、Core set 做测试是惯例,但默认划分泄漏严重;
  • 必须做「只用配体」的对照实验——差距不大说明没学到相互作用;
  • Ranking power 和 screening power 比 scoring power 更贴近实际用途;
  • 报结果时说明划分方式,并考虑时间划分或序列相似性划分。

延伸资源