PDBbind 把 PDB 中的蛋白-配体复合物结构与从原始文献人工提取的实测结合亲和力(Kd、Ki、IC50)配对,是打分函数开发和结合亲和力预测模型最常用的数据集。几乎所有 AI 打分函数的论文都会报 PDBbind 上的成绩——也正因如此,它的数据泄漏问题必须先讲清楚。
三层结构
| 集合 | 规模(v2020 量级) | 筛选标准 | 用途 |
|---|---|---|---|
| General set | 约 19,000 | 所有有亲和力数据的复合物 | 预训练、数据增强 |
| Refined set | 约 5,300 | 分辨率 ≤ 2.5 Å、R 因子达标、配体质量好、Kd/Ki 精确值 | 主要训练集 |
| Core set | 约 285 | 从 refined set 精选,按靶点聚类、覆盖亲和力范围 | CASF 评测的测试集 |
Core set 的构建很讲究:按序列相似性把靶点聚成约 57 簇,每簇选 5 个亲和力跨度大的复合物。这样设计是为了同时评测不同靶点间的排序和同一靶点内的排序。
CASF 评测的四个维度
- Scoring power:预测亲和力与实测值的 Pearson 相关系数。目前经典打分函数约 0.5~0.6,机器学习方法可到 0.8 以上(但见下文的泄漏问题)。
- Ranking power:同一靶点内不同配体的排序能力(Spearman)。这个比 scoring power 更贴近实际用途——先导优化关心的是「哪个更强」而非绝对数值。
- Docking power:能否从一堆诱饵姿势中挑出正确姿势(RMSD ≤ 2 Å)。
- Screening power:虚拟筛选的富集能力,最接近真实筛选场景。
一个反复被观察到的现象:机器学习打分函数在 scoring power 上大幅领先,但在 screening power 上未必优于经典物理打分函数。这说明它们学到的更多是「记住这类复合物大概什么亲和力」,而非真正理解结合。
数据泄漏:使用前必读
PDBbind 上的高分成绩,很大一部分来自数据泄漏,主要有三种:
- 靶点相似性泄漏:训练集和测试集里有同源蛋白(甚至同一蛋白的不同结构)。模型只要认出「这是激酶 X」就能猜个大概。
- 配体相似性泄漏:同一系列的类似物分散在训练与测试集中。
- 只看配体也能拿高分:多项研究发现,把蛋白信息完全去掉、只用配体特征训练,在 PDBbind 上照样能拿到接近的相关系数。这说明模型很大程度上是在学配体的分子量、疏水性等平凡特征与亲和力的统计关联,而非蛋白-配体相互作用。
# 正确做法:做严格划分并设置对照
# 1) 按蛋白序列相似性聚类划分(如 < 30% identity)
# 2) 同时做配体骨架划分
# 3) 必设「只用配体」的对照实验
# 若你的复合物模型只比配体-only 模型好一点点,
# 说明它并没有真正学到相互作用
# 4) 用时间划分:训练用 2019 年前的结构,测试用之后的
更严格的替代与补充
- 时间划分基准:用结构发布年份切分,模拟真实的前瞻预测场景。
- LP-PDBbind 等重新划分的版本:专门控制了蛋白与配体的泄漏。
- PoseBusters 基准集:专注姿势预测的物理有效性评估。
- 结合 LIT-PCBA(见 242《LIT-PCBA》):评估真实筛选场景下的富集能力。
上手提示
- Refined set 做训练、Core set 做测试是惯例,但默认划分泄漏严重;
- 必须做「只用配体」的对照实验——差距不大说明没学到相互作用;
- Ranking power 和 screening power 比 scoring power 更贴近实际用途;
- 报结果时说明划分方式,并考虑时间划分或序列相似性划分。
延伸资源
- 结构来源:236《PDB》、237《RCSB PDB》;对照数据:239《Binding MOAD》、240《CrossDocked2020》;
- 筛选基准:241《DUD-E》、242《LIT-PCBA》;
- 打分函数与评测陷阱:095《Docking Score》、169《Benchmark 陷阱》。