002

AI DD 与传统 CADD 的区别:新手必须先理解的边界

AI 药物发现与传统 CADD 的边界在哪里?这篇讲清两者的方法差异、各自擅长的场景与配合方式。

「AI 药物发现」与「传统 CADD(计算机辅助药物设计)」常被对立起来,但两者的真实关系是互补而非替代。理解边界,能避免两个常见错误:用 AI 做它不擅长的事,或者忽视传统方法在关键环节的不可替代性。

方法论的根本差异

传统 CADD AI / 机器学习
知识来源 物理定律与化学规则 从数据中学习统计规律
需要数据吗 不需要历史活性数据 需要,且越多越好
对新靶点 同样适用 可能完全失效
可解释性 强(有物理含义)
精度上限 受近似程度限制 受数据质量限制
计算成本 通常更高(如 MD、FEP) 训练贵,推理便宜
失败模式 模型近似不足 训练分布外时崩溃

最关键的区别:对新体系的表现

# 【这是选择方法时最重要的判断】
#
# 传统物理方法(对接、MD、FEP):
#   它们依据的是物理定律
#   → 对一个全新的靶点、全新的化学骨架
#     同样适用(精度可能不高,但不会「崩溃」)
#
# 机器学习方法:
#   它们依据的是训练数据中的统计规律
#   → 【对训练分布外的输入,预测可能完全无意义】
#   → 而且模型往往不会告诉你它不知道(见 166)
#
# 实际含义:
#
#   场景 A:优化一个已有 500 个类似物数据的系列
#     → 【机器学习占优】
#     数据充足,分布内,模型能学到细致的 SAR
#
#   场景 B:一个全新靶点,没有已知配体
#     → 【传统结构基方法是唯一选择】
#     没有数据可以训练
#
#   场景 C:跨骨架比较两个化学系列
#     → 【FEP 更可靠】(见 127)
#     ML 模型在骨架间的外推能力差
#
#   场景 D:从千万级库中初筛
#     → 【ML 更快】
#     物理方法太慢
#
# 【一个实用的判断】:
#   问「我有多少这个体系的数据?」
#     很多 → 优先 ML
#     很少 → 优先物理方法
#     没有 → 只能物理方法

传统 CADD 的核心方法

AI 带来的真正新增能力

能力 传统方法能做吗
从序列预测蛋白结构 不能(同源建模受限于模板)
从头设计蛋白 极其困难(见 151《RFdiffusion 论文精读》
大规模的分子生成 规则枚举有限
从数据中学习复杂的非线性 SAR 线性 QSAR 能力有限
多任务/迁移学习 不能
快速的性质预测(毫秒级) 部分可以(描述符计算)
逆合成路线规划 基于规则的系统能力有限

AlphaFold 是 AI 带来的最大增量:它让「没有实验结构的靶点也能做结构基设计」成为可能——这直接扩大了传统 CADD 方法的适用范围。这是两者互补关系的最好例证。

实际项目中的配合

# 一个成熟的计算流程通常是混合的:
#
# 靶点结构:
#   实验结构(首选)
#   → 没有则用 AlphaFold/Boltz 预测【AI】
#   → 用 MD 生成构象集合【传统】
#
# 大规模筛选:
#   ML 快速打分【AI】
#   → 对接【传统】
#   → CNN 重打分【AI】
#   → 相互作用核对【传统】
#
# 苗头确认:
#   聚集体/PAINS 过滤【规则】
#   → MD 验证姿势稳定性【传统】
#
# 先导优化:
#   QSAR 预测活性【AI】
#   → FEP 对关键分子精确排序【传统】
#   → 生成模型提设计建议【AI】
#   → 化学家判断【人】
#
# ADMET:
#   ML 预测做初筛【AI】
#   → 实验测定确认【实验】
#
# 【设计原则】:
#   每一层用【不同原理】的方法
#   → 避免同一种偏倚被层层放大(见 157)
#   → 【物理方法与统计方法的错误模式不同,
#     这正是它们互补的价值所在】

常见的认知误区

  • 「AI 会取代对接」深度学习对接方法在给定口袋的场景下,相对传统对接的优势并不明显(见 346《比较 DiffDock、Vina、GNINA》),且物理有效性常常更差;
  • 「有了 AlphaFold 就不需要实验结构」:预测结构是 apo 样构象,侧链取向不可靠,直接用于对接效果打折(见 112《AlphaFold2 论文精读》);
  • 「深度学习一定比传统 QSAR 好」在几百到几千样本的常见情形下,ECFP + 梯度提升常常打平或更好(见 131《Chemprop / D-MPNN 论文精读》);
  • 「传统方法过时了」:FEP 仍然是唯一能提供可靠定量预测的方法;
  • 「AI 不需要懂化学」不懂化学就无法判断模型输出是否合理,也无法设计有意义的特征与评测。

关键要点

  • 物理方法对新体系同样适用,ML 在训练分布外可能完全失效——这是最关键的区别;
  • 选择依据是「我有多少这个体系的数据」:多则 ML,少则物理方法;
  • AlphaFold 扩大了传统 CADD 的适用范围,是互补关系的最好例证;
  • 分级流程中每层用不同原理的方法,因为它们的错误模式不同

延伸资源