028

Papers with Code 药物发现任务导航

药物发现相关的 AI 任务分散在多个板块。这篇给出按任务类型的导航与各自的成熟度判断。

药物发现相关的 AI 任务分散在多个研究板块,且各任务的成熟度差异很大。理解这个分布,能帮你判断某个方向是「已经可用」还是「仍在探索」。

按任务的成熟度地图

任务 成熟度 实际可用性
蛋白结构预测 生产可用(见 112《AlphaFold2 论文精读》
分子性质预测 中高 可用,但需自家数据(见 155《AI 活性预测模型》
虚拟筛选 中高 可用于粗筛(见 095《Docking Score》
结合姿势预测 需验证(见 096《Binding Pose》
分子生成 需要好的打分函数(见 158《AI 分子生成模型》
逆合成规划 可用作参考
蛋白设计 成功率有限但能力是新增的(见 151《RFdiffusion 论文精读》
结合亲和力预测 低到中 FEP 可靠但贵(见 127《FEP、RBFE 与 ABFE》
DTI 预测 低到中 评测问题严重(见 157《AI DTI 预测模型》
靶点发现 辅助证据汇总(见 154《AI 靶点发现模型》
毒性/临床结果预测 早期排除用

一个规律:越靠近「物理与化学」的任务越成熟,越靠近「生物学与临床」的任务越不成熟。结构预测有明确的物理约束与大量高质量数据;而临床结果受无数因素影响,数据少且噪声大。

各任务的关键数据集与基准

# 【分子性质预测】
#   MoleculeNet(见 132)—— 经典但有局限
#   TDC ADMET Group(见 133)—— 更贴近实际
#   Polaris —— 强调数据质量
#   【最重要的:自家的历史数据】
#
# 【虚拟筛选】
#   DUD-E(见 241)—— 有已知的偏倚问题
#   LIT-PCBA(见 242)—— 更真实但更难
#   【注意】:在 DUD-E 上的好成绩
#            不代表实际筛选能力
#
# 【结合姿势】
#   PDBbind(见 238)
#   PoseBusters —— 【强调物理有效性】
#   CrossDocked2020(见 240)
#
# 【亲和力预测】
#   PDBbind core set
#   【FEP 基准集】—— 更接近实际的先导优化场景
#
# 【分子生成】
#   GuacaMol(见 135)、MOSES(见 136)
#   【但这些基准与实际需求距离较大】
#
# 【逆合成】
#   USPTO 数据集
#   【注意】:文献反应有报告偏倚
#            (失败的反应不发表)
#
# 【DTI】
#   DAVIS、KIBA、BindingDB
#   【必须用 cold split】(见 133、157)

判断一个方向是否值得投入

# 【五个问题】
#
# 1) 【这个任务的数据质量如何?】
#    - 数据量多少?
#    - 标签的实验一致性?
#    - 有没有系统性的偏倚?
#    → 【数据差 → 再好的方法也做不好】
#
# 2) 【基准与实际需求的距离?】
#    在基准上提升 10%,
#    在实际项目中意味着什么?
#    → 答不上来 → 这个方向的实用性存疑
#
# 3) 【有没有前瞻性验证的案例?】
#    有人真的用它做出了实际的发现吗?
#    → 只有回溯性测试的方向要谨慎
#
# 4) 【方法之间的差距 vs 数据带来的差距?】
#    如果换一个模型提升 2%,
#    而清洗一遍数据提升 15%,
#    → 【应该投入到数据上】
#
# 5) 【物理约束的强度?】
#    有强物理约束的任务(结构、能量)
#    → AI 更可能做好
#    纯统计关联的任务(临床结果)
#    → 更难,需要更谨慎
#
# 【一个务实的建议】:
#   优先投入到【成熟度中高且与自己项目直接相关】的方向
#   而非最前沿最热门的方向

各任务的典型陷阱速查

任务 最常见的陷阱
分子性质预测 随机划分高估性能(见 051《Scaffold Split》
虚拟筛选 基准的诱饵分子有系统性偏倚(见 241《DUD-E》
结合姿势 只看 RMSD 不看物理有效性(见 096《Binding Pose》
亲和力预测 只用配体特征就能达到接近成绩(见 238《PDBbind》
DTI 随机划分 + 无平凡基线对照(见 157《AI DTI 预测模型》
分子生成 指标可被钻空子;忽略可合成性(见 135《GuacaMol 论文精读》
逆合成 训练数据有报告偏倚
靶点发现 把相关当因果(见 154《AI 靶点发现模型》
毒性预测 标签定义混乱;机制多样

跟进方法进展的实用建议

  • 不要追每一篇新论文:多数论文的实际增量很小,且难以复现;
  • 关注有实验验证的工作「合成并测试了 X 个分子」比「在基准上提升 2%」有价值得多
  • 关注负面结果与批判性工作:指出评测问题的论文,信息量常常大于报告 SOTA 的论文;
  • 关注开源与许可:能实际用上的方法才有价值;
  • 定期在自己的数据上复测方法的排名在你的化学空间上可能完全不同
  • 用五问框架读论文(见 170《AI 制药论文阅读框架》):任务、数据、模型、验证、落地。

关键要点

  • 越靠近物理化学的任务越成熟,越靠近生物学与临床的越不成熟
  • 判断方向时问:数据质量、基准与需求的距离、有无前瞻性验证
  • 换模型提升 2% vs 清洗数据提升 15%——优先投入数据;
  • 关注有实验验证的工作与批判性论文,而非追每一篇 SOTA

延伸资源