LIT-PCBA(2020)是针对 DUD-E 偏倚问题设计的虚拟筛选基准。它的根本差别在于:活性和非活性分子都来自真实的高通量筛选实验(PubChem BioAssay),不是人工挑选的诱饵。这让评测结果与真实筛选场景的对应关系可靠得多,代价是难度陡增。
怎么构建的
- 从 PubChem BioAssay 中挑选做过剂量-响应确证的大规模筛选(不只是单点初筛);
- 要求有对应的高质量蛋白结构可用于对接;
- 对化合物做严格清洗:去除干扰化合物、聚集体、频繁命中者(frequent hitters);
- 做不对称验证嵌入(AVE)去偏,主动降低训练/测试集之间的化学空间分离度;
- 最终得到 15 个靶点,共约 270 万个化合物。
| 维度 | DUD-E | LIT-PCBA |
|---|---|---|
| 活性来源 | ChEMBL 文献 | 真实 HTS 实测 |
| 非活性来源 | 人工挑选的诱饵 | 实测无活性 |
| 活性率 | 约 2% | 0.02%~1%,接近真实 |
| 靶点数 | 102 | 15 |
| 去偏处理 | 无 | AVE 去偏 |
| 难度 | 中等 | 高 |
难度有多高:正确的期望值
这是使用 LIT-PCBA 前最该调整的认知:在这个基准上,多数方法的表现都不好。
- 经典对接方法的 EF@1% 常常只在 1~3 之间,也就是说比随机挑选只好一点点;
- 不少机器学习方法在某些靶点上的表现甚至不如随机;
- ROC-AUC 常在 0.5~0.7 区间徘徊——而同样的方法在 DUD-E 上轻松超过 0.9。
这个巨大落差本身就是最有价值的信息:它说明 DUD-E 上的漂亮成绩有多大比例来自偏倚,也说明真实虚拟筛选比文献给人的印象困难得多。看到自己的方法在 LIT-PCBA 上 EF@1% 只有 2,不必沮丧——那可能已经是有意义的结果。
使用方式
# 数据集提供:
# 每个靶点的活性/非活性 SMILES 列表
# 对应的蛋白结构(PDB)
# 官方的训练/验证/测试划分(AVE 去偏后)
# 评测重点关注:
# EF@1% ← 最贴近实际筛选
# BEDROC(α=20)
# ROC-AUC ← 参考,但对极端不平衡数据意义有限
# PR-AUC ← 极端不平衡下更有信息量
活性率低至 0.02% 时,ROC-AUC 会给人虚假的安慰。必须看 PR-AUC 和早期富集指标。
它揭示的真实困难
- HTS 数据本身有噪声:即使是剂量-响应确证过的数据,仍存在假阳性和假阴性。这是真实世界的固有噪声,不是数据集的缺陷。
- 活性分子化学上很多样:真实筛选命中的分子不像文献活性分子那样集中在少数系列,模型无法靠记忆系列取巧。
- 极端不平衡:0.02% 的活性率意味着筛 100 万个分子只有 200 个活性,任何微小的假阳性率都会淹没真阳性。
- 靶点差异巨大:15 个靶点的难度差别很大,报告结果应逐靶点给出而非只报平均。
实践建议
- 作为方法的「压力测试」:新方法在 DUD-E 上好不算数,在 LIT-PCBA 上仍有富集才值得投入。
- 逐靶点报告:平均值会掩盖方法在某些靶点上完全失效的事实。
- 与 DUD-E 一起报:两者的落差本身就是关于方法泛化能力的重要信息。
- 调整对虚拟筛选的整体预期:EF@1% = 5 在真实场景中已经是相当有用的结果,意味着实验工作量降到五分之一。
上手提示
- 活性与非活性都来自实测 HTS,是目前最接近真实的虚拟筛选基准;
- 难度远高于 DUD-E,EF@1% 只有 2~3 是常态,不必因此否定方法;
- 极端不平衡下看 PR-AUC 与早期富集,别看 ROC-AUC;
- 逐靶点报告结果,平均值会掩盖完全失效的情况。
延伸资源
- 对照基准:241《DUD-E》、238《PDBbind》;HTS 数据来源:227《PubChem》;
- 评测陷阱:169《Benchmark 陷阱》;虚拟筛选流程见「实战流程」模块。