001

AI 药物发现是什么:从靶点到候选药物的全流程地图

AI 药物发现覆盖从靶点到候选药物的完整链条。这篇给出全流程地图、各阶段的 AI 切入点与真实的能力边界。

「AI 药物发现」不是一个技术,而是一批技术在药物研发不同阶段的应用。理解这张全流程地图,才能知道某个模型、某篇论文、某个工具在整个链条中的位置——以及它能不能解决你手上的问题。

全流程地图

阶段 核心问题 典型周期 AI 的成熟度
靶点发现 打哪个蛋白 1~3 年 辅助证据汇总(见 154《AI 靶点发现模型》
苗头发现 找到能结合的分子 0.5~2 年 较成熟(虚拟筛选、生成)
苗头到先导 确认可优化的化学系列 1~2 年 较成熟(见 404《Hit-to-Lead》
先导优化 多参数同时改善 1~3 年 最有价值的应用场景
临床前 安全性与成药性 1~2 年 辅助预测(见 156《AI ADMET 预测模型》
临床 人体有效性与安全性 5~8 年 试验设计、患者分层

一个重要的认识:整个流程约 10~15 年,而AI 目前能显著加速的主要是前 3~5 年的部分——即从靶点确认到候选化合物。临床阶段占了大部分时间与成本,而 AI 在那里的作用目前有限。因此「AI 把药物研发时间减半」这类说法需要看清具体指的是哪一段。

各阶段的 AI 切入点

# ---- 靶点发现 ----
#   多组学整合、知识图谱、文献挖掘
#   → 【产生假设,不产生结论】
#   关键:证据梯度(相关 → 遗传 → 功能 → 人体,见 154)
#
# ---- 苗头发现 ----
#   虚拟筛选:
#     配体基(相似性、药效团、QSAR)
#     结构基(对接,见 095、097)
#   分子生成(见 158)
#   结构预测让「无结构靶点」也能做(见 112、120)
#   → 【这是 AI 应用最成熟的环节】
#
# ---- 苗头到先导 ----
#   命中确认(排除假阳性,见 069)
#   SAR 建立(见 073)
#   化学系列的选择与优先级
#
# ---- 先导优化 ----
#   多参数优化:活性 + 选择性 + ADMET + 可合成性
#   自由能计算(见 127)
#   主动学习指导实验设计(见 165)
#   → 【AI 价值最大的环节】:
#     每个化合物的合成 + 测试成本高,
#     少做几轮无效实验的价值很直接
#
# ---- 临床前 ----
#   毒性预测、PK 预测、剂型设计
#   → 【预测能力有限,主要用于早期排除】
#
# ---- 临床 ----
#   患者分层、试验设计优化、真实世界数据分析
#   → 与化学关系不大,更接近医疗 AI

三类核心技术

技术 做什么 代表
预测 给分子/蛋白,预测性质 QSAR、ADMET、DTI(见 155《AI 活性预测模型》157《AI DTI 预测模型》
生成 设计新分子/蛋白 REINVENT、扩散模型(见 158《AI 分子生成模型》
结构 预测三维结构与结合模式 AlphaFold、对接(见 112《AlphaFold2 论文精读》095《Docking Score》

这三类技术在实际项目中是配合使用的:用结构指导生成、用预测筛选生成的结果、用生成扩大预测的搜索空间。

一个典型的 AI 辅助项目流程

# 场景:针对某个已验证靶点找先导化合物
#
# 第 0 步:【准备】
#   - 收集该靶点的已知配体与活性数据(ChEMBL,见 226)
#   - 获取结构(PDB 或预测,见 112、120)
#   - 明确目标产品概况(活性、选择性、给药途径)
#
# 第 1 步:【建立基线模型】
#   用已知活性数据训练 QSAR(见 131)
#   → 骨架划分评测,知道模型能信到什么程度
#
# 第 2 步:【虚拟筛选】
#   商业库(Enamine 等)→ 性质过滤 → 相似性/药效团
#   → 对接(见 336)→ 重打分(见 337)→ 人工审查
#   → 采购 200~500 个化合物
#
# 第 3 步:【实验筛选】
#   → 得到苗头化合物(命中率通常 1%~5%)
#
# 第 4 步:【苗头确认】
#   剂量响应、正交实验、排除聚集体与假阳性
#
# 第 5 步:【结构表征】
#   共晶结构(最理想)或对接 + MD 验证(见 096、123)
#
# 第 6 步:【先导优化循环】(DMTA)
#   设计(生成模型 + 化学家)→ 合成 →
#   测试 → 分析(更新模型)→ 再设计
#   → 【AI 在这个循环中的价值是提高每轮的命中率】
#
# 第 7 步:【候选化合物】
#   活性、选择性、ADMET、安全性都达标
#
# 【关键认识】:
#   AI 不是取代任何一步,
#   而是让每一步的【决策质量】更高、【迭代速度】更快

需要建立的现实预期

  • AI 不能替代实验:所有计算结果都是假设,需要实验验证。计算的价值在于减少无效实验的比例
  • 数据质量比模型重要:多数项目的瓶颈是数据,而非算法(见 046《分子标准化》);
  • 靶点选错,后面全白做:这是最大的风险,而 AI 在这一步的能力最弱;
  • 临床失败的主因是有效性不足与安全性问题,而这两者目前都难以计算预测;
  • 「AI 发现的药物」需要具体看 AI 的贡献:从生成分子到临床候选,中间有大量人工优化(见 153《Chemistry42 JCIM 论文精读》);
  • 合理的期望:AI 是加速器与放大器,不是自动化机器。

入门的建议路径

# 【如果你有计算背景,缺化学/生物】
#   1) 先理解药物研发的流程与约束(本文 + 404、405)
#   2) 学化学信息学基础:SMILES、指纹、相似性(见 031、035)
#   3) 用 RDKit 做实际操作(见 022)
#   4) 理解成药性的基本概念(见 064、070)
#   5) 【与化学家聊天】—— 比读十篇论文有用
#
# 【如果你有化学/生物背景,缺计算】
#   1) Python + pandas + scikit-learn 基础
#   2) RDKit 操作分子(见 022)
#   3) 建一个简单的 QSAR 模型(见 131)
#   4) 理解评测的陷阱(见 167、169)
#   5) 【不要一上来就学深度学习】——
#      传统方法在很多任务上已经够用
#
# 【共同的建议】:
#   找一个【真实的小问题】做完整的一遍,
#   比广泛地读教程有效得多
#   例:用 ChEMBL 上某个靶点的数据
#       建一个活性预测模型,
#       做骨架划分评测,
#       与指纹基线比较

关键要点

  • 整个研发周期 10~15 年,AI 目前主要加速前 3~5 年——临床阶段的作用仍有限;
  • 先导优化是 AI 价值最大的环节——每轮实验成本高,少做无效实验的收益直接;
  • 预测、生成、结构三类技术在实际项目中是配合使用的,不是互相替代;
  • 入门最有效的方式是找一个真实的小问题做完整的一遍,而非广泛读教程。

延伸资源