逆合成分析是有机合成的核心思维方式:从目标分子出发,反向推导「它可以由什么反应、从什么前体做出来」,递归下去直到全部是可购买的起始原料。AI 逆合成把这个过程自动化。
切断(disconnection)的思维
逆合成的基本操作是切断——在目标分子中选一个键断开,得到两个(或多个)前体。好的切断有几个特征:
- 对应可靠的正向反应:切断处应该能用成熟反应重新连上;
- 简化程度高:切断后前体明显更简单或更易得;
- 汇聚式而非线性:把分子切成两个大小相近的片段,比切下一个小基团更好;
- 官能团兼容:切断后的前体不应有难以处理的官能团冲突。
# 常见的可靠切断(对应的正向反应)
#
# 酰胺 C-N → 羧酸 + 胺(酰胺偶联)
# 芳基-芳基 → 卤代芳烃 + 硼酸(Suzuki 偶联)
# 芳基-N → 卤代芳烃 + 胺(Buchwald-Hartwig)
# C-N(sp3) → 醛/酮 + 胺(还原胺化)
# 醚 C-O → 醇 + 卤代物(Williamson)
# 烯烃 → 两个烯烃(复分解)或醛 + 磷叶立德(Wittig)
# 杂环 → 相应的环合前体
#
# 这些反应产率高、官能团耐受性好、条件温和,
# 是「可靠切断」的主力
汇聚式 vs 线性:为什么重要
# 线性路线:A → B → C → D → E(5 步,每步 80% 产率)
# 总产率 = 0.8^4 = 41%
#
# 汇聚式路线:
# A → B → C (2 步,80% 各)
# D → E (1 步,80%)
# C + E → F (1 步,80%)
# 最长线性序列 = 3 步
# 总产率 = 0.8^3 = 51%,且原料消耗更少
#
# 步数越多,线性路线的劣势越明显:
# 10 步线性、每步 80% → 总产率仅 13%
#
# 因此评估路线时看的是「最长线性序列」(LLS),
# 而不是总步数
AI 逆合成怎么工作
| 组件 | 作用 | 方法 |
|---|---|---|
| 单步逆合成模型 | 给定分子,预测可能的前体 | 基于模板(从反应库提取规则)或无模板(seq2seq / 图到图) |
| 路线搜索 | 递归应用单步模型,构建路线树 | 蒙特卡洛树搜索、A*、best-first |
| 可购买库 | 判断什么算「终点」 | ZINC、Enamine 等商业库 |
| 路线打分 | 排序候选路线 | 步数、原料成本、反应可靠性 |
| 过滤策略 | 剔除不合理的预测 | 正向反应模型验证 |
基于模板 vs 无模板
- 基于模板:从反应数据库中自动提取反应规则(模板),预测时匹配并应用。优点是产物化学上一定合法(模板保证了原子映射正确);缺点是无法预测模板库之外的新反应。
- 无模板:用序列模型或图模型直接生成前体 SMILES。优点是灵活;缺点是可能生成化学上不合法的结构,需要额外验证。
- 实践中基于模板的方法更常用,因为可解释、可靠、且能追溯到具体的文献先例。
评估一条路线
| 维度 | 关注点 |
|---|---|
| 最长线性序列 | 越短越好,比总步数更重要 |
| 起始原料 | 现货可得?价格?(见 232《Mcule》、233《eMolecules》) |
| 反应可靠性 | 是否为成熟反应?有无文献先例? |
| 官能团兼容性 | 需要保护基吗?保护/脱保护会增加步数 |
| 立体化学 | 手性中心怎么构建?拆分还是不对称合成? |
| 放大可行性 | 危险试剂?极端条件?难以放大的操作? |
| 纯化难度 | 需要柱层析还是能结晶?(放大时差别巨大) |
AI 逆合成的能力边界
- 训练数据只有成功的反应。这是最根本的局限:失败的反应不会被发表,所以模型对「什么行不通」了解有限,可能自信地给出实际不可行的路线。
- 不理解反应条件的细节:温度、溶剂、催化剂用量、加料顺序——这些对成败至关重要,但模型把握有限。
- 官能团兼容性判断不足:复杂分子中多个官能团的相互干扰、保护基策略,是模型的弱项。
- 产率预测不可靠:预估产率的参考价值有限。
- 立体选择性预测弱:不对称合成的选择性难以预测。
- 结论:把它当作「给合成化学家提供思路的工具」,而不是「自动生成可执行方案的系统」。最终路线必须由有经验的化学家评审。
最有价值的用法
- 把逆合成前置到设计阶段:不是先生成一千个分子再挨个查路线,而是把「能否找到合理路线」作为分子生成时的打分项(见 348《在分子生成中加入 SA Score 约束》)。这样产出的分子从一开始就偏向可合成的区域。
- 快速评估一批候选:对虚拟筛选或生成得到的分子批量跑逆合成,按「是否可解」与「路线长度」排序。
- 探索替代路线:对已有路线的分子,看是否有更短、更便宜的方案。
- 培训与启发:给年轻化学家提供切断思路的参考。
关键要点
- 评估路线看最长线性序列而非总步数,汇聚式路线远优于线性;
- 基于模板的方法更常用,因为产物化学合法且可追溯文献先例;
- 模型只见过成功的反应,对「什么行不通」了解有限;
- 最有价值的用法是把逆合成前置到分子设计阶段作为打分项。