082

ADME Cascade:先导优化中的 ADME 级联筛选

ADME 级联筛选按成本与通量分层安排实验。这篇给出典型的级联设计、决策门禁与资源分配原则。

ADME 级联(cascade)是把各类 ADME 实验按成本、通量、信息价值排序,形成一个漏斗式的筛选流程。设计得好,能用最少的资源筛掉最多的不合格分子。

级联设计的基本原则

  • 便宜的在前:每个分子的筛选成本随级别上升,越往后分子越少;
  • 判别力强的在前:能排除最多分子的实验优先;
  • 不可逆的缺陷优先筛如果某个性质无法通过后续优化改善,应该尽早筛
  • 与项目 TPP 对齐(见 414《目标产品特征 TPP》):口服慢性用药与静脉急性用药的级联应该不同;
  • 留有反馈:每级的通过率应该被监控,通过率异常提示级联设计需要调整。

典型的级联结构

级别 实验 通量 典型分子数
0(计算) cLogP、TPSA、结构警报、QSAR 预测 无限 合成前全部
1 动力学溶解度、微粒体稳定性、PAMPA 数百
2 Caco-2、hERG 结合、CYP 抑制(主要亚型) 数十~百
3 平衡溶解度、肝细胞稳定性、血浆蛋白结合、CYP 全面板 中低 数十
4 动物 PK(大鼠)、hERG 膜片钳、代谢产物鉴定 十几个
5 多物种 PK、遗传毒性、安全药理面板 很低 数个

级别 0:计算筛选的价值

# 在合成之前就过滤,是最高性价比的一步
#
# 应该在设计阶段就算的:
#   - cLogP、TPSA、MW、HBD/HBA、可旋转键
#   - 结构警报(PAINS、Brenk,见 068、069)
#   - SA Score(合成可及性,见 067)
#   - QSAR 预测:溶解度、hERG、CYP、微粒体稳定性
#   - 适用域检查(见 417)
#
# 关键:
#   计算预测用于「排序与优先级」,不用于「淘汰」
#   → 模型提示高风险的分子,应优先安排实测确认
#   → 而非直接删除(模型可能错)
#
# 例外:
#   硬性的结构警报(如酰卤、异氰酸酯)可以直接排除
#   物理化学的极端值(如 cLogP > 7)可以直接排除

决策门禁的设计

# 每一级设置明确的通过标准

CASCADE_GATES = {
    "level_1": {
        "kinetic_solubility": "> 10 μM",
        "HLM_CLint": "< 50 μL/min/mg",
        "PAMPA_Papp": "> 1e-6 cm/s",
        "action_if_fail": "不进入下一级,除非活性极其突出",
    },
    "level_2": {
        "Caco2_Papp": "> 5e-6 cm/s",
        "Caco2_efflux_ratio": "< 3",
        "hERG_binding": "IC50 > 10 μM",
        "CYP3A4_inhibition": "IC50 > 10 μM",
    },
    # ...
}

# 设计要点:
#
# 1) 标准应从 TPP 反推(见 414),不要照搬通用值
#
# 2) 允许「例外通道」
#    活性特别突出的分子可以带着某个缺陷进入下一级,
#    但必须明确记录并制定改善计划
#
# 3) 关注通过率
#    某一级通过率极低(< 10%)→ 标准可能过严,或该性质是系列的共性问题
#    某一级通过率极高(> 90%)→ 这个筛可能没有判别力,考虑移除或提前
#
# 4) 定期回顾
#    用后期数据回测:被筛掉的分子中,有多少其实是好的?
#    → 这能发现过严的门禁

什么应该尽早筛

  • 难以通过优化改善的性质
    • hERG:与骨架特征关联深,发现晚可能需要大幅重构(见 057《hERG 风险》);
    • 遗传毒性:结构相关,可能整个系列都有问题;
    • 时间依赖性 CYP 抑制:与代谢活化相关,难以在保持活性的前提下消除;
  • 影响后续实验解读的性质
    • 溶解度:溶解度太差会让后续所有实验的数据不可靠(化合物在孔中析出);
    • 化学稳定性:不稳定的化合物在实验过程中降解,数据无意义。
  • 反过来,可以推迟的:血浆蛋白结合(通常可以后期测)、多物种 PK(成本高、信息在后期才需要)。

级联的常见问题

  • 串行而非并行最常见的效率损失。如果一批分子要经过 5 级,每级等结果再进下一级,周期会非常长。实践中应该把 1~3 级的实验并行做,一次拿到完整数据;
  • 门禁过严导致无分子通过:应该看整批分子的分布,动态调整;
  • 只筛不优化:级联是筛选工具,但真正的价值在于用数据指导下一轮设计——每级的失败模式应该反馈到设计中;
  • 忽略数据质量:同一实验在不同批次的结果可能差异很大,需要内标与质控;
  • 不做回顾:级联设计应该随项目进展调整,而非一成不变。

把级联数据接进 AI 流程

# 级联产生的数据是训练 ADMET 模型的最佳来源
#
# 优势:
#   - 条件标准化(同一实验室、同一方案)
#   - 化学空间与项目相关
#   - 包含阴性数据(不合格的分子也有数据)
#
# 实践建议:
#   1) 从一开始就结构化记录(见 300、422)
#   2) 记录完整的实验条件与批次
#   3) 预测值与实测值分开存储
#   4) 定期用新数据重训并做前瞻性校准(见 417)
#   5) 用「公开数据预训练 + 内部数据微调」
#      通常优于任一单独使用
#
# 长期价值:
#   项目做久了,内部 ADMET 模型的准确性会
#   显著超过任何公开模型 ——
#   因为它见过你的化学空间

关键要点

  • 难以通过优化改善的性质应尽早筛(hERG、遗传毒性、TDI);
  • 溶解度要早筛——太差会让后续所有实验数据不可靠;
  • 1~3 级实验应并行而非串行,否则周期过长;
  • 级联数据是训练内部 ADMET 模型的最佳来源,从一开始就结构化记录。

延伸资源