AI 制药领域的综述数量巨大,质量差异也大。盲目地读综述容易陷入「读了很多但什么都不会做」的状态——关键是先明确目的,再选择对应层次的综述。
按目的选择综述层次
| 你的目的 | 该读什么 | 典型来源 |
|---|---|---|
| 了解领域全貌 | 高层次的展望型综述 | NRDD、Nature 子刊 |
| 理解某个环节 | 专题综述 | Drug Discovery Today、Chem Soc Rev |
| 选择具体方法 | 方法学的对比研究 | JCIM、J Cheminform |
| 动手实现 | 原始论文 + 代码 | — |
| 了解产业现状 | 行业分析、案例报道 | — |
| 批判性认识 | 指出问题的评论文章 | 价值常被低估 |
建议的阅读顺序
# 【第 1 层】:先建立全局地图(2~3 篇)
# 目标:知道药物研发有哪些环节,
# AI 在各环节的位置与成熟度
# → 见本知识库的 001、028
#
# 【读完应该能回答】:
# - 药物研发的主要阶段是什么?
# - 每个阶段的核心问题?
# - AI 在哪个阶段最成熟?
#
# 【第 2 层】:选一个环节深入(3~5 篇)
# 根据自己的工作选择:
# 虚拟筛选 / 分子生成 / ADMET / 结构预测
#
# 【读完应该能回答】:
# - 这个环节有哪些主流方法?
# - 各方法的适用条件?
# - 当前的主要瓶颈是什么?
#
# 【第 3 层】:读方法学的对比研究(2~3 篇)
# 【这是最有实用价值的一层,也最容易被跳过】
# 特征:
# - 在统一设置下比较多个方法
# - 有严格的数据划分
# - 报告统计显著性
# - 【常常报告「新方法没有明显优势」】
#
# 【读完应该能回答】:
# - 我该用哪个方法?
# - 它相对基线的真实提升是多少?
#
# 【第 4 层】:读原始论文 + 跑代码
# 只对确定要用的方法做
# → 【用五问框架】(见 170)
#
# 【第 5 层】:持续跟进(每月 1~2 小时)
# 关注:
# - 有实验验证的工作
# - 批判性的评论文章
# - 开源可用的新工具
#
# 【一个常见的错误路径】:
# 在第 1 层读了十几篇综述 →
# 感觉「什么都知道一点」 →
# 但不知道该做什么 →
# 【应该尽早进入第 3、4 层】
判断综述质量的信号
| 好信号 | 警示信号 |
|---|---|
| 讨论方法的局限与失败案例 | 只罗列成功案例 |
| 有定量的对比数据 | 只有定性描述 |
| 指出评测中的问题 | 直接引用各论文报告的数字 |
| 区分「已验证」与「有潜力」 | 把展望当作现实 |
| 作者有实际项目经验 | 纯文献综述 |
| 讨论数据质量问题 | 只关注模型 |
| 给出可操作的建议 | 结论是「AI 前景广阔」 |
一个快速判断法:看综述有没有「Limitations」或「Challenges」章节,以及这一节写得有多具体。写得越具体、越坦诚,通常质量越高。只有一段泛泛而谈的「数据质量与可解释性仍是挑战」,说明作者可能缺乏实操经验。
读综述时要主动提的问题
# 【对每个宣称】:
#
# 1) 【这个结论的证据是什么?】
# - 回溯性基准测试?
# - 前瞻性验证?
# - 【实际的实验验证?】
# → 证据强度差异很大
#
# 2) 【引用的原始工作用了什么评测设置?】
# 综述常常直接引用各论文报告的数字,
# 而这些数字可能来自不同的划分方式
# → 【不可直接比较】
#
# 3) 【有没有与强基线比较?】
# 综述中列出的「SOTA 方法」,
# 与 ECFP + 树模型相比如何?
# → 【综述通常不会回答这个问题】
#
# 4) 【时间因素】
# 综述有滞后性,
# 发表时可能已经过时一两年
# → 【结构预测这类快速演进的领域尤其明显】
#
# 5) 【作者的立场】
# 来自方法开发者的综述可能更乐观
# 来自产业实践者的综述可能更审慎
# → 两种都读
#
# 6) 【这对我的工作意味着什么?】
# → 【读完如果不能回答这个问题,
# 这篇综述对你就没有价值】
更有价值的替代阅读
- 方法学的严格对比研究:比综述有用得多——它们在统一设置下比较多个方法,常常得出「差异不显著」的结论;
- 指出评测问题的论文:如揭示基准偏倚、数据泄漏的工作——这类论文改变你判断所有其它论文的方式;
- 失败案例的分析:比成功案例信息量大,但发表的少;
- 产业实践的经验分享:博客、会议报告(见 011《Practical Cheminformatics 博客》);
- 直接读原始论文:对确定要用的方法,综述的二手描述常常丢失关键细节。
一个务实的阅读节奏
# 【时间分配建议】
#
# 综述阅读: 20%
# 建立地图与背景
#
# 方法学对比研究: 20%
# 【判断该用什么】
#
# 原始论文 + 代码: 30%
# 深入理解要用的方法
#
# 【自己动手实验】: 30%
# 【这是理解的真正来源】
#
# 【核心原则】:
# 读一篇 → 【动手试一个】
# 而非读十篇再动手
#
# 【一个自检问题】:
# 「我上次因为读了某篇论文
# 而改变了自己的做法,是什么时候?」
# → 如果想不起来,说明读的方式需要调整
#
# 【另一个建议】:
# 读完一篇有价值的论文,
# 写三句话总结:
# 1) 它解决了什么问题
# 2) 关键的方法创新是什么
# 3) 【它改变了我的什么认识】
# → 第 3 条写不出来的,可能不值得花时间读
关键要点
- 先明确目的再选综述层次——在第 1 层读十几篇是常见的低效路径;
- 方法学的严格对比研究比综述有用得多,也最容易被跳过;
- 快速判断质量:看有没有具体的 Limitations 章节;
- 读一篇就动手试一个,而非读十篇再动手;写不出「改变了我什么认识」就不值得读。
延伸资源
- 论文阅读框架:170《AI 制药论文阅读框架》;Benchmark 陷阱:169《Benchmark 陷阱》;
- Practical Cheminformatics:011《Practical Cheminformatics 博客》;任务导航:028《Papers with Code 药物发现任务导航》;全流程地图:001《AI 药物发现是什么》。