242

LIT-PCBA:更接近真实筛选场景的 Benchmark

LIT-PCBA 从真实高通量筛选实验构建,活性与非活性都是实测的,弥补 DUD-E 的偏倚问题。这篇讲清它的构建方式、难度水平与正确的期望值。

LIT-PCBA(2020)是针对 DUD-E 偏倚问题设计的虚拟筛选基准。它的根本差别在于:活性和非活性分子都来自真实的高通量筛选实验(PubChem BioAssay),不是人工挑选的诱饵。这让评测结果与真实筛选场景的对应关系可靠得多,代价是难度陡增。

怎么构建的

  • 从 PubChem BioAssay 中挑选做过剂量-响应确证的大规模筛选(不只是单点初筛);
  • 要求有对应的高质量蛋白结构可用于对接;
  • 对化合物做严格清洗:去除干扰化合物、聚集体、频繁命中者(frequent hitters);
  • 不对称验证嵌入(AVE)去偏,主动降低训练/测试集之间的化学空间分离度;
  • 最终得到 15 个靶点,共约 270 万个化合物。
维度 DUD-E LIT-PCBA
活性来源 ChEMBL 文献 真实 HTS 实测
非活性来源 人工挑选的诱饵 实测无活性
活性率 约 2% 0.02%~1%,接近真实
靶点数 102 15
去偏处理 AVE 去偏
难度 中等

难度有多高:正确的期望值

这是使用 LIT-PCBA 前最该调整的认知:在这个基准上,多数方法的表现都不好

  • 经典对接方法的 EF@1% 常常只在 1~3 之间,也就是说比随机挑选只好一点点;
  • 不少机器学习方法在某些靶点上的表现甚至不如随机;
  • ROC-AUC 常在 0.5~0.7 区间徘徊——而同样的方法在 DUD-E 上轻松超过 0.9。

这个巨大落差本身就是最有价值的信息:它说明 DUD-E 上的漂亮成绩有多大比例来自偏倚,也说明真实虚拟筛选比文献给人的印象困难得多。看到自己的方法在 LIT-PCBA 上 EF@1% 只有 2,不必沮丧——那可能已经是有意义的结果。

使用方式

# 数据集提供:
#   每个靶点的活性/非活性 SMILES 列表
#   对应的蛋白结构(PDB)
#   官方的训练/验证/测试划分(AVE 去偏后)

# 评测重点关注:
#   EF@1%      ← 最贴近实际筛选
#   BEDROC(α=20)
#   ROC-AUC    ← 参考,但对极端不平衡数据意义有限
#   PR-AUC     ← 极端不平衡下更有信息量

活性率低至 0.02% 时,ROC-AUC 会给人虚假的安慰。必须看 PR-AUC 和早期富集指标。

它揭示的真实困难

  • HTS 数据本身有噪声:即使是剂量-响应确证过的数据,仍存在假阳性和假阴性。这是真实世界的固有噪声,不是数据集的缺陷。
  • 活性分子化学上很多样:真实筛选命中的分子不像文献活性分子那样集中在少数系列,模型无法靠记忆系列取巧。
  • 极端不平衡:0.02% 的活性率意味着筛 100 万个分子只有 200 个活性,任何微小的假阳性率都会淹没真阳性。
  • 靶点差异巨大:15 个靶点的难度差别很大,报告结果应逐靶点给出而非只报平均。

实践建议

  • 作为方法的「压力测试」:新方法在 DUD-E 上好不算数,在 LIT-PCBA 上仍有富集才值得投入。
  • 逐靶点报告:平均值会掩盖方法在某些靶点上完全失效的事实。
  • 与 DUD-E 一起报:两者的落差本身就是关于方法泛化能力的重要信息。
  • 调整对虚拟筛选的整体预期:EF@1% = 5 在真实场景中已经是相当有用的结果,意味着实验工作量降到五分之一。

上手提示

  • 活性与非活性都来自实测 HTS,是目前最接近真实的虚拟筛选基准;
  • 难度远高于 DUD-E,EF@1% 只有 2~3 是常态,不必因此否定方法;
  • 极端不平衡下看 PR-AUC 与早期富集,别看 ROC-AUC;
  • 逐靶点报告结果,平均值会掩盖完全失效的情况。

延伸资源