400

从设计到合成的闭环:DMTA 中 Make 环节自动化

DMTA 中的 Make 环节自动化,是把设计变成实物的关键。这篇讲清自动化合成的适用范围、系统设计与现实约束。

DMTA 闭环中,Make(合成)往往是最慢的一环:设计可以一天产出上千个分子,测试可以一周测几百个,但合成一个新分子可能需要数周。这个瓶颈决定了整个闭环的转速。

为什么 Make 是瓶颈

环节 典型周期 可并行度
Design 小时~天 极高(计算)
Make 数周~数月 受化学家人数限制
Test 天~周 高(板式实验)
Analyze 小时~天

提高闭环速度的杠杆在 Make:即使设计能力提升十倍,如果合成速度不变,整体周期几乎不变。

自动化合成的适用范围

  • 最适合:基于可靠反应的类似物库合成。酰胺偶联、Suzuki 偶联、还原胺化、SNAr、点击化学——这些反应条件宽容、官能团耐受性好、产率稳定,是自动化的主力。
  • 可行:两到三步的短序列,中间体不需要复杂纯化。
  • 困难:需要无水无氧的敏感反应、需要低温(-78℃)、需要柱层析纯化、需要判断反应终点。
  • 不适合:探索性化学、复杂天然产物全合成、需要大量人工判断的操作。

系统设计

# 自动化合成平台的典型模块
#
# 1) 物料管理
#    - 砌块库存(固体或溶液储备)
#    - 自动称量或溶液分装
#
# 2) 反应执行
#    - 平行反应器(加热、搅拌、惰性气氛)
#    - 液体处理机器人
#    - 微反应器/流动化学(对某些反应更适合)
#
# 3) 后处理
#    - 自动萃取、相分离
#    - 固相萃取(SPE)—— 比柱层析更易自动化
#    - 自动浓缩
#
# 4) 纯化
#    - 制备型 HPLC/SFC + 自动收集
#    ← 这是自动化合成中最成熟也最关键的环节
#
# 5) 分析与质控
#    - LC-MS 确认产物
#    - 定量(NMR 或称重)
#    - 纯度检查
#
# 6) 数据管理
#    - 每个孔位/瓶的完整记录
#    - 结果自动回流到设计系统

制备型 HPLC 自动纯化是自动化合成的关键使能技术:它绕开了柱层析这个难以自动化的步骤,让「粗品 → 纯品」变成可批量执行的流程。

从设计到执行的翻译

# 关键工程问题:把「设计的分子」翻译成「机器人的操作指令」

# 1) 逆合成规划(见 385)
#    目标分子 → 合成路线

# 2) 砌块匹配
#    路线中的起始原料 → 库存中有吗?
#    如果没有,能买到吗?

def match_building_blocks(route_precursors, inventory_db):
    """把逆合成得到的前体匹配到实际库存"""
    from rdkit import Chem
    matched, missing = [], []
    for smi in route_precursors:
        m = Chem.MolFromSmiles(smi)
        if m is None:
            missing.append(smi); continue
        key = Chem.MolToInchiKey(m)
        if key in inventory_db:
            matched.append({"smiles": smi, "location": inventory_db[key]["location"],
                            "amount": inventory_db[key]["amount_mg"]})
        else:
            missing.append(smi)
    return matched, missing

# 3) 反应条件确定
#    从条件预测(见 389)或内部标准条件库

# 4) 生成操作指令
#    化学计量 → 体积 → 移液指令
#    温度曲线、时间、搅拌速度

# 5) 排产与执行
#    考虑设备可用性、试剂共用、批次组织

# 关键:每一步都要有失败处理
#   砌块不足 → 提示补货或换路线
#   反应失败 → 记录并反馈(这是宝贵的阴性数据!)

阴性数据:被浪费的资产

自动化合成的一个被严重低估的价值是它天然产生标准化的失败数据。

  • 人工合成时,失败的反应常常不被系统记录(「这个没做出来」就过去了);
  • 自动化平台执行的每一个反应都有完整记录:底物、条件、结果(包括零产率);
  • 这类数据在公开数据源中完全不存在(见 399《反应数据库》);
  • 用它训练的模型,才真正知道「什么行不通」;
  • 建议:从一开始就把失败数据的结构化记录设计进系统,这是长期最有价值的资产。

流动化学(flow chemistry)

# 流动化学在自动化合成中有独特优势
#
# 优点:
#   - 传热传质效率高 → 可安全地做放热反应
#   - 反应时间精确控制(停留时间)
#   - 易于串联多步(telescoping)
#   - 放大靠延长运行时间而非放大设备(scale-out)
#   - 高温高压反应更安全
#
# 适合:
#   - 快速反应
#   - 危险中间体(就地生成就地消耗)
#   - 需要精确控温的反应
#
# 不适合:
#   - 有固体生成/悬浮(堵管)
#   - 反应极慢
#   - 需要相分离的后处理
#
# 与批式自动化互补,不是替代关系

现实的约束

  • 投入产出比:设备与集成成本高,只有高频重复的合成才划算。先算清楚:每年要做多少个类似物?
  • 化学范围有限:平台通常只支持有限的反应类型。超出范围仍需人工。
  • 规模限制:自动化平台通常做毫克到几十毫克级,够做生物测试但不够做体内实验或深入表征。
  • 维护成本:设备故障、管路堵塞、试剂过期——运维投入常被低估。
  • 人的角色转变:化学家从「做实验」转向「设计实验与处理异常」,需要不同的技能组合。

务实的分级路径

# 按投入产出比排序,逐步推进
#
# 级别 1:数据记录自动化(收益最高、成本最低)
#   仪器数据自动入库、消除手工录入
#
# 级别 2:纯化自动化
#   制备 HPLC + 自动收集,解放最耗时的环节
#
# 级别 3:平行合成
#   平行反应器 + 液体处理,做类似物库
#
# 级别 4:路线规划集成
#   逆合成 + 砌块匹配 + 自动排产
#
# 级别 5:全闭环
#   设计 → 合成 → 测试 → 模型更新,无人干预
#
# 多数团队在级别 1~3 就能显著提速,
# 级别 5 只在特定场景才划算

关键要点

  • Make 是 DMTA 闭环的速度瓶颈,提速的杠杆在这里;
  • 自动化最适合基于可靠反应的类似物库合成,探索性化学不适合;
  • 制备 HPLC 自动纯化是关键使能技术,绕开了难以自动化的柱层析;
  • 系统性记录失败反应是被低估的长期资产——公开数据中不存在这类数据。

延伸资源