药物发现相关的 AI 任务分散在多个研究板块,且各任务的成熟度差异很大。理解这个分布,能帮你判断某个方向是「已经可用」还是「仍在探索」。
按任务的成熟度地图
| 任务 | 成熟度 | 实际可用性 |
|---|---|---|
| 蛋白结构预测 | 高 | 生产可用(见 112《AlphaFold2 论文精读》) |
| 分子性质预测 | 中高 | 可用,但需自家数据(见 155《AI 活性预测模型》) |
| 虚拟筛选 | 中高 | 可用于粗筛(见 095《Docking Score》) |
| 结合姿势预测 | 中 | 需验证(见 096《Binding Pose》) |
| 分子生成 | 中 | 需要好的打分函数(见 158《AI 分子生成模型》) |
| 逆合成规划 | 中 | 可用作参考 |
| 蛋白设计 | 中 | 成功率有限但能力是新增的(见 151《RFdiffusion 论文精读》) |
| 结合亲和力预测 | 低到中 | FEP 可靠但贵(见 127《FEP、RBFE 与 ABFE》) |
| DTI 预测 | 低到中 | 评测问题严重(见 157《AI DTI 预测模型》) |
| 靶点发现 | 低 | 辅助证据汇总(见 154《AI 靶点发现模型》) |
| 毒性/临床结果预测 | 低 | 早期排除用 |
一个规律:越靠近「物理与化学」的任务越成熟,越靠近「生物学与临床」的任务越不成熟。结构预测有明确的物理约束与大量高质量数据;而临床结果受无数因素影响,数据少且噪声大。
各任务的关键数据集与基准
# 【分子性质预测】
# MoleculeNet(见 132)—— 经典但有局限
# TDC ADMET Group(见 133)—— 更贴近实际
# Polaris —— 强调数据质量
# 【最重要的:自家的历史数据】
#
# 【虚拟筛选】
# DUD-E(见 241)—— 有已知的偏倚问题
# LIT-PCBA(见 242)—— 更真实但更难
# 【注意】:在 DUD-E 上的好成绩
# 不代表实际筛选能力
#
# 【结合姿势】
# PDBbind(见 238)
# PoseBusters —— 【强调物理有效性】
# CrossDocked2020(见 240)
#
# 【亲和力预测】
# PDBbind core set
# 【FEP 基准集】—— 更接近实际的先导优化场景
#
# 【分子生成】
# GuacaMol(见 135)、MOSES(见 136)
# 【但这些基准与实际需求距离较大】
#
# 【逆合成】
# USPTO 数据集
# 【注意】:文献反应有报告偏倚
# (失败的反应不发表)
#
# 【DTI】
# DAVIS、KIBA、BindingDB
# 【必须用 cold split】(见 133、157)
判断一个方向是否值得投入
# 【五个问题】
#
# 1) 【这个任务的数据质量如何?】
# - 数据量多少?
# - 标签的实验一致性?
# - 有没有系统性的偏倚?
# → 【数据差 → 再好的方法也做不好】
#
# 2) 【基准与实际需求的距离?】
# 在基准上提升 10%,
# 在实际项目中意味着什么?
# → 答不上来 → 这个方向的实用性存疑
#
# 3) 【有没有前瞻性验证的案例?】
# 有人真的用它做出了实际的发现吗?
# → 只有回溯性测试的方向要谨慎
#
# 4) 【方法之间的差距 vs 数据带来的差距?】
# 如果换一个模型提升 2%,
# 而清洗一遍数据提升 15%,
# → 【应该投入到数据上】
#
# 5) 【物理约束的强度?】
# 有强物理约束的任务(结构、能量)
# → AI 更可能做好
# 纯统计关联的任务(临床结果)
# → 更难,需要更谨慎
#
# 【一个务实的建议】:
# 优先投入到【成熟度中高且与自己项目直接相关】的方向
# 而非最前沿最热门的方向
各任务的典型陷阱速查
| 任务 | 最常见的陷阱 |
|---|---|
| 分子性质预测 | 随机划分高估性能(见 051《Scaffold Split》) |
| 虚拟筛选 | 基准的诱饵分子有系统性偏倚(见 241《DUD-E》) |
| 结合姿势 | 只看 RMSD 不看物理有效性(见 096《Binding Pose》) |
| 亲和力预测 | 只用配体特征就能达到接近成绩(见 238《PDBbind》) |
| DTI | 随机划分 + 无平凡基线对照(见 157《AI DTI 预测模型》) |
| 分子生成 | 指标可被钻空子;忽略可合成性(见 135《GuacaMol 论文精读》) |
| 逆合成 | 训练数据有报告偏倚 |
| 靶点发现 | 把相关当因果(见 154《AI 靶点发现模型》) |
| 毒性预测 | 标签定义混乱;机制多样 |
跟进方法进展的实用建议
- 不要追每一篇新论文:多数论文的实际增量很小,且难以复现;
- 关注有实验验证的工作:「合成并测试了 X 个分子」比「在基准上提升 2%」有价值得多;
- 关注负面结果与批判性工作:指出评测问题的论文,信息量常常大于报告 SOTA 的论文;
- 关注开源与许可:能实际用上的方法才有价值;
- 定期在自己的数据上复测:方法的排名在你的化学空间上可能完全不同;
- 用五问框架读论文(见 170《AI 制药论文阅读框架》):任务、数据、模型、验证、落地。
关键要点
- 越靠近物理化学的任务越成熟,越靠近生物学与临床的越不成熟;
- 判断方向时问:数据质量、基准与需求的距离、有无前瞻性验证;
- 换模型提升 2% vs 清洗数据提升 15%——优先投入数据;
- 关注有实验验证的工作与批判性论文,而非追每一篇 SOTA。
延伸资源
- 分子性质导航:026《Papers with Code 分子性质预测导航》;蛋白结构导航:027《Papers with Code 蛋白结构预测导航》;
- Benchmark 陷阱:169《Benchmark 陷阱》;论文阅读框架:170《AI 制药论文阅读框架》;全流程地图:001《AI 药物发现是什么》。