「AI 药物发现」不是一个技术,而是一批技术在药物研发不同阶段的应用。理解这张全流程地图,才能知道某个模型、某篇论文、某个工具在整个链条中的位置——以及它能不能解决你手上的问题。
全流程地图
| 阶段 | 核心问题 | 典型周期 | AI 的成熟度 |
|---|---|---|---|
| 靶点发现 | 打哪个蛋白 | 1~3 年 | 辅助证据汇总(见 154《AI 靶点发现模型》) |
| 苗头发现 | 找到能结合的分子 | 0.5~2 年 | 较成熟(虚拟筛选、生成) |
| 苗头到先导 | 确认可优化的化学系列 | 1~2 年 | 较成熟(见 404《Hit-to-Lead》) |
| 先导优化 | 多参数同时改善 | 1~3 年 | 最有价值的应用场景 |
| 临床前 | 安全性与成药性 | 1~2 年 | 辅助预测(见 156《AI ADMET 预测模型》) |
| 临床 | 人体有效性与安全性 | 5~8 年 | 试验设计、患者分层 |
一个重要的认识:整个流程约 10~15 年,而AI 目前能显著加速的主要是前 3~5 年的部分——即从靶点确认到候选化合物。临床阶段占了大部分时间与成本,而 AI 在那里的作用目前有限。因此「AI 把药物研发时间减半」这类说法需要看清具体指的是哪一段。
各阶段的 AI 切入点
# ---- 靶点发现 ----
# 多组学整合、知识图谱、文献挖掘
# → 【产生假设,不产生结论】
# 关键:证据梯度(相关 → 遗传 → 功能 → 人体,见 154)
#
# ---- 苗头发现 ----
# 虚拟筛选:
# 配体基(相似性、药效团、QSAR)
# 结构基(对接,见 095、097)
# 分子生成(见 158)
# 结构预测让「无结构靶点」也能做(见 112、120)
# → 【这是 AI 应用最成熟的环节】
#
# ---- 苗头到先导 ----
# 命中确认(排除假阳性,见 069)
# SAR 建立(见 073)
# 化学系列的选择与优先级
#
# ---- 先导优化 ----
# 多参数优化:活性 + 选择性 + ADMET + 可合成性
# 自由能计算(见 127)
# 主动学习指导实验设计(见 165)
# → 【AI 价值最大的环节】:
# 每个化合物的合成 + 测试成本高,
# 少做几轮无效实验的价值很直接
#
# ---- 临床前 ----
# 毒性预测、PK 预测、剂型设计
# → 【预测能力有限,主要用于早期排除】
#
# ---- 临床 ----
# 患者分层、试验设计优化、真实世界数据分析
# → 与化学关系不大,更接近医疗 AI
三类核心技术
| 技术 | 做什么 | 代表 |
|---|---|---|
| 预测 | 给分子/蛋白,预测性质 | QSAR、ADMET、DTI(见 155《AI 活性预测模型》~157《AI DTI 预测模型》) |
| 生成 | 设计新分子/蛋白 | REINVENT、扩散模型(见 158《AI 分子生成模型》) |
| 结构 | 预测三维结构与结合模式 | AlphaFold、对接(见 112《AlphaFold2 论文精读》、095《Docking Score》) |
这三类技术在实际项目中是配合使用的:用结构指导生成、用预测筛选生成的结果、用生成扩大预测的搜索空间。
一个典型的 AI 辅助项目流程
# 场景:针对某个已验证靶点找先导化合物
#
# 第 0 步:【准备】
# - 收集该靶点的已知配体与活性数据(ChEMBL,见 226)
# - 获取结构(PDB 或预测,见 112、120)
# - 明确目标产品概况(活性、选择性、给药途径)
#
# 第 1 步:【建立基线模型】
# 用已知活性数据训练 QSAR(见 131)
# → 骨架划分评测,知道模型能信到什么程度
#
# 第 2 步:【虚拟筛选】
# 商业库(Enamine 等)→ 性质过滤 → 相似性/药效团
# → 对接(见 336)→ 重打分(见 337)→ 人工审查
# → 采购 200~500 个化合物
#
# 第 3 步:【实验筛选】
# → 得到苗头化合物(命中率通常 1%~5%)
#
# 第 4 步:【苗头确认】
# 剂量响应、正交实验、排除聚集体与假阳性
#
# 第 5 步:【结构表征】
# 共晶结构(最理想)或对接 + MD 验证(见 096、123)
#
# 第 6 步:【先导优化循环】(DMTA)
# 设计(生成模型 + 化学家)→ 合成 →
# 测试 → 分析(更新模型)→ 再设计
# → 【AI 在这个循环中的价值是提高每轮的命中率】
#
# 第 7 步:【候选化合物】
# 活性、选择性、ADMET、安全性都达标
#
# 【关键认识】:
# AI 不是取代任何一步,
# 而是让每一步的【决策质量】更高、【迭代速度】更快
需要建立的现实预期
- AI 不能替代实验:所有计算结果都是假设,需要实验验证。计算的价值在于减少无效实验的比例;
- 数据质量比模型重要:多数项目的瓶颈是数据,而非算法(见 046《分子标准化》);
- 靶点选错,后面全白做:这是最大的风险,而 AI 在这一步的能力最弱;
- 临床失败的主因是有效性不足与安全性问题,而这两者目前都难以计算预测;
- 「AI 发现的药物」需要具体看 AI 的贡献:从生成分子到临床候选,中间有大量人工优化(见 153《Chemistry42 JCIM 论文精读》);
- 合理的期望:AI 是加速器与放大器,不是自动化机器。
入门的建议路径
# 【如果你有计算背景,缺化学/生物】
# 1) 先理解药物研发的流程与约束(本文 + 404、405)
# 2) 学化学信息学基础:SMILES、指纹、相似性(见 031、035)
# 3) 用 RDKit 做实际操作(见 022)
# 4) 理解成药性的基本概念(见 064、070)
# 5) 【与化学家聊天】—— 比读十篇论文有用
#
# 【如果你有化学/生物背景,缺计算】
# 1) Python + pandas + scikit-learn 基础
# 2) RDKit 操作分子(见 022)
# 3) 建一个简单的 QSAR 模型(见 131)
# 4) 理解评测的陷阱(见 167、169)
# 5) 【不要一上来就学深度学习】——
# 传统方法在很多任务上已经够用
#
# 【共同的建议】:
# 找一个【真实的小问题】做完整的一遍,
# 比广泛地读教程有效得多
# 例:用 ChEMBL 上某个靶点的数据
# 建一个活性预测模型,
# 做骨架划分评测,
# 与指纹基线比较
关键要点
- 整个研发周期 10~15 年,AI 目前主要加速前 3~5 年——临床阶段的作用仍有限;
- 先导优化是 AI 价值最大的环节——每轮实验成本高,少做无效实验的收益直接;
- 预测、生成、结构三类技术在实际项目中是配合使用的,不是互相替代;
- 入门最有效的方式是找一个真实的小问题做完整的一遍,而非广泛读教程。
延伸资源
- 与传统 CADD 的区别:002《AI DD 与传统 CADD 的区别》;学习路线:003《AI 药物发现学习路线》;
- Hit-to-Lead:404《Hit-to-Lead》;先导优化:405《Lead Optimization》;论文阅读框架:170《AI 制药论文阅读框架》。