ADME 级联(cascade)是把各类 ADME 实验按成本、通量、信息价值排序,形成一个漏斗式的筛选流程。设计得好,能用最少的资源筛掉最多的不合格分子。
级联设计的基本原则
- 便宜的在前:每个分子的筛选成本随级别上升,越往后分子越少;
- 判别力强的在前:能排除最多分子的实验优先;
- 不可逆的缺陷优先筛:如果某个性质无法通过后续优化改善,应该尽早筛;
- 与项目 TPP 对齐(见 414《目标产品特征 TPP》):口服慢性用药与静脉急性用药的级联应该不同;
- 留有反馈:每级的通过率应该被监控,通过率异常提示级联设计需要调整。
典型的级联结构
| 级别 | 实验 | 通量 | 典型分子数 |
|---|---|---|---|
| 0(计算) | cLogP、TPSA、结构警报、QSAR 预测 | 无限 | 合成前全部 |
| 1 | 动力学溶解度、微粒体稳定性、PAMPA | 高 | 数百 |
| 2 | Caco-2、hERG 结合、CYP 抑制(主要亚型) | 中 | 数十~百 |
| 3 | 平衡溶解度、肝细胞稳定性、血浆蛋白结合、CYP 全面板 | 中低 | 数十 |
| 4 | 动物 PK(大鼠)、hERG 膜片钳、代谢产物鉴定 | 低 | 十几个 |
| 5 | 多物种 PK、遗传毒性、安全药理面板 | 很低 | 数个 |
级别 0:计算筛选的价值
# 在合成之前就过滤,是最高性价比的一步
#
# 应该在设计阶段就算的:
# - cLogP、TPSA、MW、HBD/HBA、可旋转键
# - 结构警报(PAINS、Brenk,见 068、069)
# - SA Score(合成可及性,见 067)
# - QSAR 预测:溶解度、hERG、CYP、微粒体稳定性
# - 适用域检查(见 417)
#
# 关键:
# 计算预测用于「排序与优先级」,不用于「淘汰」
# → 模型提示高风险的分子,应优先安排实测确认
# → 而非直接删除(模型可能错)
#
# 例外:
# 硬性的结构警报(如酰卤、异氰酸酯)可以直接排除
# 物理化学的极端值(如 cLogP > 7)可以直接排除
决策门禁的设计
# 每一级设置明确的通过标准
CASCADE_GATES = {
"level_1": {
"kinetic_solubility": "> 10 μM",
"HLM_CLint": "< 50 μL/min/mg",
"PAMPA_Papp": "> 1e-6 cm/s",
"action_if_fail": "不进入下一级,除非活性极其突出",
},
"level_2": {
"Caco2_Papp": "> 5e-6 cm/s",
"Caco2_efflux_ratio": "< 3",
"hERG_binding": "IC50 > 10 μM",
"CYP3A4_inhibition": "IC50 > 10 μM",
},
# ...
}
# 设计要点:
#
# 1) 标准应从 TPP 反推(见 414),不要照搬通用值
#
# 2) 允许「例外通道」
# 活性特别突出的分子可以带着某个缺陷进入下一级,
# 但必须明确记录并制定改善计划
#
# 3) 关注通过率
# 某一级通过率极低(< 10%)→ 标准可能过严,或该性质是系列的共性问题
# 某一级通过率极高(> 90%)→ 这个筛可能没有判别力,考虑移除或提前
#
# 4) 定期回顾
# 用后期数据回测:被筛掉的分子中,有多少其实是好的?
# → 这能发现过严的门禁
什么应该尽早筛
- 难以通过优化改善的性质:
- hERG:与骨架特征关联深,发现晚可能需要大幅重构(见 057《hERG 风险》);
- 遗传毒性:结构相关,可能整个系列都有问题;
- 时间依赖性 CYP 抑制:与代谢活化相关,难以在保持活性的前提下消除;
- 影响后续实验解读的性质:
- 溶解度:溶解度太差会让后续所有实验的数据不可靠(化合物在孔中析出);
- 化学稳定性:不稳定的化合物在实验过程中降解,数据无意义。
- 反过来,可以推迟的:血浆蛋白结合(通常可以后期测)、多物种 PK(成本高、信息在后期才需要)。
级联的常见问题
- 串行而非并行:最常见的效率损失。如果一批分子要经过 5 级,每级等结果再进下一级,周期会非常长。实践中应该把 1~3 级的实验并行做,一次拿到完整数据;
- 门禁过严导致无分子通过:应该看整批分子的分布,动态调整;
- 只筛不优化:级联是筛选工具,但真正的价值在于用数据指导下一轮设计——每级的失败模式应该反馈到设计中;
- 忽略数据质量:同一实验在不同批次的结果可能差异很大,需要内标与质控;
- 不做回顾:级联设计应该随项目进展调整,而非一成不变。
把级联数据接进 AI 流程
# 级联产生的数据是训练 ADMET 模型的最佳来源
#
# 优势:
# - 条件标准化(同一实验室、同一方案)
# - 化学空间与项目相关
# - 包含阴性数据(不合格的分子也有数据)
#
# 实践建议:
# 1) 从一开始就结构化记录(见 300、422)
# 2) 记录完整的实验条件与批次
# 3) 预测值与实测值分开存储
# 4) 定期用新数据重训并做前瞻性校准(见 417)
# 5) 用「公开数据预训练 + 内部数据微调」
# 通常优于任一单独使用
#
# 长期价值:
# 项目做久了,内部 ADMET 模型的准确性会
# 显著超过任何公开模型 ——
# 因为它见过你的化学空间
关键要点
- 难以通过优化改善的性质应尽早筛(hERG、遗传毒性、TDI);
- 溶解度要早筛——太差会让后续所有实验数据不可靠;
- 1~3 级实验应并行而非串行,否则周期过长;
- 级联数据是训练内部 ADMET 模型的最佳来源,从一开始就结构化记录。
延伸资源
- 各终点详解见本模块其它文章;TPP:414《目标产品特征 TPP》;
- 数据管理:300《CDD Vault》、422《MLOps for 药物发现》;模型校准:417《计算与实验的差距》。