AI 制药论文数量庞大、质量参差。一个结构化的阅读框架,能让你在十几分钟内判断一篇论文值不值得深读,以及它的结论能信到什么程度。这篇给出「任务、数据、模型、验证、落地」五问的完整清单。
第一问:任务
# 【论文在解决什么问题?这个问题重要吗?】
#
# 核心问题:
# □ 输入是什么,输出是什么?
# □ 这个任务对应研发链条的哪个环节?
# 靶点发现 / 苗头筛选 / 先导优化 /
# 临床前 / 临床
# □ 【解决它能改变什么决策?】
# □ 现在这个决策是怎么做的?
# □ 提升多少才有实际意义?
#
# 【最关键的问题】:
# 「如果这个方法完美工作,
# 实际工作流会有什么不同?」
#
# 答不上来 → 这篇论文可能是在解决
# 一个不存在的问题
#
# 常见的问题错配:
# - 优化 RMSE 而实际需要排序
# - 预测的性质在实际中容易测(不需要预测)
# - 精度已经超过实验误差(没有提升空间)
# - 任务的定义与实际决策不对应
第二问:数据
# 【数据能支撑这个结论吗?】
#
# 来源与质量:
# □ 数据从哪来?公开数据库还是自有数据?
# □ 【不同来源的数据是否可比?】
# (测定方法、实验条件,见 156)
# □ 标签怎么定义的?阈值合理吗?
# □ 有没有做去重与标准化?(见 046)
#
# 规模:
# □ 训练/验证/测试各多少?
# □ 【几百个样本的结论要大打折扣】
# □ 类别是否平衡?
#
# 划分:
# □ 【什么划分方式?】(见 167)
# 随机 → 主要结论存疑
# 骨架/时间 → 可信度高
# □ 有没有报告测试集与训练集的相似度?
# □ 有没有数据泄漏的可能?
#
# 覆盖面:
# □ 化学空间的覆盖如何?
# □ 结论能外推到什么范围?
#
# 【一个快速判断】:
# 数据部分描述得越详细、越坦诚地说明局限,
# 通常论文质量越高
第三问:模型
# 【方法的贡献是什么?】
#
# 创新点:
# □ 新架构、新训练方式、还是新的应用?
# □ 【创新点与任务特点的联系是什么?】
# - 有明确的化学/生物动机 → 加分
# - 只是把 NLP/CV 的方法搬过来 → 需要更多证据
#
# 消融:
# □ 有没有逐个去掉组件的实验?
# □ 【提升主要来自哪个部分?】
# □ 有没有「随机初始化」的对照?(预训练类工作)
#
# 基线:
# □ 【有 ECFP + 树模型的强基线吗?】
# □ 基线的调优预算相同吗?
# □ 有任务特定的平凡基线吗?
# DTI: 药物均值/靶点均值(见 157)
# 结构基模型: 只用配体特征(见 138)
#
# 复杂度:
# □ 参数量、训练时间、推理速度?
# □ 【提升是否值得增加的复杂度?】
#
# 【一个务实的问题】:
# 如果去掉论文中所有的新东西,
# 只用最朴素的方法,能达到多少?
# → 这个差距才是真正的贡献
第四问:验证
| 验证强度 | 类型 |
|---|---|
| 最弱 | 只在标准基准上回溯测试 |
| 弱 | + 多个基准、多个种子 |
| 中 | + 外部独立数据集 |
| 较强 | + 时间划分的前瞻性验证 |
| 强 | + 实际合成并测试了分子 |
| 最强 | + 发现进入了后续研发 |
# 具体检查:
# □ 几个随机种子?有标准差吗?
# □ 【提升是否超过种子间的方差?】
# □ 有显著性检验吗?
# □ 失败案例分析有吗?
# (【只报告成功案例是常见做法】)
# □ 误差分析:模型在什么情况下会错?
#
# 关于实验验证:
# □ 合成/测试了多少个?
# □ 命中率是多少?与基线方法相比?
# □ 【测试的分子是怎么选的?】
# 如果是从模型输出中人工挑选的,
# 那么人的贡献无法与模型分离
#
# 【一个常见的模糊表述】:
# 「AI 设计的分子进入临床」
# → 需要追问:AI 在哪一步、贡献多大、
# 后续有多少人工优化
第五问:落地
# 【我能用上吗?】
#
# 可用性:
# □ 代码开源吗?许可是什么?
# □ 【预训练权重可用吗?商用许可如何?】
# (AF3 vs Boltz 是典型例子,见 113、120)
# □ 数据可获取吗?
# □ 文档与示例完整吗?
#
# 可复现:
# □ 超参数、随机种子有记录吗?
# □ 依赖版本有说明吗?
# □ 有人成功复现过吗?(看 issue 区)
#
# 成本:
# □ 训练需要什么资源?
# □ 推理速度?能处理多大规模?
# □ 需要什么样的输入准备?
#
# 适配:
# □ 我的数据与论文的数据分布接近吗?
# □ 【需要多少改动才能用在我的问题上?】
# □ 维护成本如何?
#
# 【落地前的必做动作】:
# 在【自己的数据】上复现一遍,
# 与自己的基线比较
# → 论文的数字与你的场景可能毫无关系
快速分诊:15 分钟判断
# 【第 1 步】:看摘要与图 1(2 分钟)
# 任务是什么?宣称的贡献是什么?
# → 与我关心的问题相关吗?不相关就停
#
# 【第 2 步】:看实验部分的表格(5 分钟)
# □ 数据集大小
# □ 划分方式
# □ 基线有哪些
# □ 有没有标准差
# □ 提升幅度
# → 【这一步就能筛掉大部分论文】
#
# 【第 3 步】:找消融实验(3 分钟)
# 提升来自哪里?
#
# 【第 4 步】:找局限性讨论(2 分钟)
# □ 作者自己承认了什么局限?
# → 【坦诚讨论局限的论文,通常更可信】
# → 完全不提局限的,要更警惕
#
# 【第 5 步】:看代码仓库(3 分钟)
# □ 最近更新时间
# □ star 与 issue 情况
# □ 有没有人报告复现问题
# → 【issue 区常常比论文更能说明真实情况】
#
# 通过这 5 步的论文,才值得深读
# 【一个补充建议】:
# 优先读那些【报告负面结果】或
# 【诚实比较强基线】的论文
# 它们提供的信息量往往更大
# (如 Chemprop 论文,见 131)
常见的过度宣称与合理解读
| 论文中的说法 | 合理的解读 |
|---|---|
| 「超越现有方法」 | 在这些特定基准与设置下 |
| 「AI 发现的药物」 | AI 参与了某个环节,贡献比例待明确 |
| 「可解释的模型」 | 画了热图;解释未必经过验证(见 168《可解释性 AI》) |
| 「端到端」 | 省略了数据准备与后处理的工作量 |
| 「达到实验精度」 | 在训练分布内;外推能力另说 |
| 「大幅缩短研发周期」 | 需要看对比基准与统计口径 |
| 「零样本」 | 预训练数据中可能已包含相关信息 |
关键要点
- 五问框架:任务(改变什么决策)、数据(划分与质量)、模型(消融与基线)、验证(强度层级)、落地(许可与成本);
- 看表格 5 分钟就能筛掉大部分论文——数据规模、划分方式、基线、标准差;
- 坦诚讨论局限的论文通常更可信;代码仓库的 issue 区常比论文更说明问题;
- 落地前必须在自己的数据上复现并与自己的基线比较。
延伸资源
- Benchmark 陷阱:169《Benchmark 陷阱》;模型外推性:167《模型外推性》;可解释性:168《可解释性 AI》;
- Chemprop:131《Chemprop / D-MPNN 论文精读》;TDC:133《TDC 论文精读》;不确定性:166《不确定性估计》。