「AI 药物发现」与「传统 CADD(计算机辅助药物设计)」常被对立起来,但两者的真实关系是互补而非替代。理解边界,能避免两个常见错误:用 AI 做它不擅长的事,或者忽视传统方法在关键环节的不可替代性。
方法论的根本差异
| 传统 CADD | AI / 机器学习 | |
|---|---|---|
| 知识来源 | 物理定律与化学规则 | 从数据中学习统计规律 |
| 需要数据吗 | 不需要历史活性数据 | 需要,且越多越好 |
| 对新靶点 | 同样适用 | 可能完全失效 |
| 可解释性 | 强(有物理含义) | 弱 |
| 精度上限 | 受近似程度限制 | 受数据质量限制 |
| 计算成本 | 通常更高(如 MD、FEP) | 训练贵,推理便宜 |
| 失败模式 | 模型近似不足 | 训练分布外时崩溃 |
最关键的区别:对新体系的表现
# 【这是选择方法时最重要的判断】
#
# 传统物理方法(对接、MD、FEP):
# 它们依据的是物理定律
# → 对一个全新的靶点、全新的化学骨架
# 同样适用(精度可能不高,但不会「崩溃」)
#
# 机器学习方法:
# 它们依据的是训练数据中的统计规律
# → 【对训练分布外的输入,预测可能完全无意义】
# → 而且模型往往不会告诉你它不知道(见 166)
#
# 实际含义:
#
# 场景 A:优化一个已有 500 个类似物数据的系列
# → 【机器学习占优】
# 数据充足,分布内,模型能学到细致的 SAR
#
# 场景 B:一个全新靶点,没有已知配体
# → 【传统结构基方法是唯一选择】
# 没有数据可以训练
#
# 场景 C:跨骨架比较两个化学系列
# → 【FEP 更可靠】(见 127)
# ML 模型在骨架间的外推能力差
#
# 场景 D:从千万级库中初筛
# → 【ML 更快】
# 物理方法太慢
#
# 【一个实用的判断】:
# 问「我有多少这个体系的数据?」
# 很多 → 优先 ML
# 很少 → 优先物理方法
# 没有 → 只能物理方法
传统 CADD 的核心方法
- 分子对接:预测结合姿势与粗略打分(见 095《Docking Score》、097《AutoDock Vina 论文精读》);
- 药效团:从相互作用模式抽象出三维特征(见 092《药效团 Pharmacophore》);
- 分子动力学:模拟动态行为(见 123《分子动力学 MD 入门》);
- 自由能计算:FEP/MM-GBSA,目前最可靠的定量方法(见 127《FEP、RBFE 与 ABFE》、126《MM/GBSA》);
- QSAR:注意——经典 QSAR 本身就是机器学习,只是用的是线性回归、PLS 等简单模型。「传统 vs AI」的界线在这里其实是模糊的;
- 形状与静电匹配:三维相似性(见 093《形状互补 Shape Complementarity》、094《静电互补 Electrostatic Complementarity》)。
AI 带来的真正新增能力
| 能力 | 传统方法能做吗 |
|---|---|
| 从序列预测蛋白结构 | 不能(同源建模受限于模板) |
| 从头设计蛋白 | 极其困难(见 151《RFdiffusion 论文精读》) |
| 大规模的分子生成 | 规则枚举有限 |
| 从数据中学习复杂的非线性 SAR | 线性 QSAR 能力有限 |
| 多任务/迁移学习 | 不能 |
| 快速的性质预测(毫秒级) | 部分可以(描述符计算) |
| 逆合成路线规划 | 基于规则的系统能力有限 |
AlphaFold 是 AI 带来的最大增量:它让「没有实验结构的靶点也能做结构基设计」成为可能——这直接扩大了传统 CADD 方法的适用范围。这是两者互补关系的最好例证。
实际项目中的配合
# 一个成熟的计算流程通常是混合的:
#
# 靶点结构:
# 实验结构(首选)
# → 没有则用 AlphaFold/Boltz 预测【AI】
# → 用 MD 生成构象集合【传统】
#
# 大规模筛选:
# ML 快速打分【AI】
# → 对接【传统】
# → CNN 重打分【AI】
# → 相互作用核对【传统】
#
# 苗头确认:
# 聚集体/PAINS 过滤【规则】
# → MD 验证姿势稳定性【传统】
#
# 先导优化:
# QSAR 预测活性【AI】
# → FEP 对关键分子精确排序【传统】
# → 生成模型提设计建议【AI】
# → 化学家判断【人】
#
# ADMET:
# ML 预测做初筛【AI】
# → 实验测定确认【实验】
#
# 【设计原则】:
# 每一层用【不同原理】的方法
# → 避免同一种偏倚被层层放大(见 157)
# → 【物理方法与统计方法的错误模式不同,
# 这正是它们互补的价值所在】
常见的认知误区
- 「AI 会取代对接」:深度学习对接方法在给定口袋的场景下,相对传统对接的优势并不明显(见 346《比较 DiffDock、Vina、GNINA》),且物理有效性常常更差;
- 「有了 AlphaFold 就不需要实验结构」:预测结构是 apo 样构象,侧链取向不可靠,直接用于对接效果打折(见 112《AlphaFold2 论文精读》);
- 「深度学习一定比传统 QSAR 好」:在几百到几千样本的常见情形下,ECFP + 梯度提升常常打平或更好(见 131《Chemprop / D-MPNN 论文精读》);
- 「传统方法过时了」:FEP 仍然是唯一能提供可靠定量预测的方法;
- 「AI 不需要懂化学」:不懂化学就无法判断模型输出是否合理,也无法设计有意义的特征与评测。
关键要点
- 物理方法对新体系同样适用,ML 在训练分布外可能完全失效——这是最关键的区别;
- 选择依据是「我有多少这个体系的数据」:多则 ML,少则物理方法;
- AlphaFold 扩大了传统 CADD 的适用范围,是互补关系的最好例证;
- 分级流程中每层用不同原理的方法,因为它们的错误模式不同。
延伸资源
- 全流程地图:001《AI 药物发现是什么》;学习路线:003《AI 药物发现学习路线》;
- 对接打分:095《Docking Score》;FEP:127《FEP、RBFE 与 ABFE》;方法对比:346《比较 DiffDock、Vina、GNINA》。