Hit-to-Lead(H2L)把苗头化合物优化成先导化合物。它的核心不是把活性做到多强,而是验证「这个化学系列值不值得投入后续两三年」——这是一个筛选决策,不是优化任务。
先导化合物的判断标准
| 维度 | 典型标准 | 说明 |
|---|---|---|
| 靶点活性 | IC₅₀ < 100 nM~1 μM | 视靶点与适应症而定 |
| 配体高效性 | LE > 0.3 | 比绝对活性更重要 |
| 亲脂高效性 | LLE > 5 | 活性不是靠疏水堆出来的 |
| 细胞活性 | 与生化活性有合理相关 | 差距过大提示通透性或外排问题 |
| 选择性 | 对关键脱靶 > 10~100 倍 | 至少要有可优化的迹象 |
| 理化性质 | MW < 450、cLogP 1~4 | 留出后续增重空间 |
| 初步 ADMET | 无致命缺陷 | 微粒体稳定性、溶解度、hERG |
| SAR 可解释 | 结构变化与活性变化有规律 | 关键的健康信号 |
| 合成可及性 | 能快速做类似物 | 否则 SAR 探索寸步难行 |
| 专利空间 | 有自由度 | 需专业检索确认 |
为什么效率指标比绝对活性重要
# 配体高效性 LE = -ΔG / 重原子数 ≈ 1.37 × pIC50 / HAC
# 亲脂高效性 LLE = pIC50 - cLogP
# 对比两个「同样是 100 nM」的候选:
#
# 候选 A: pIC50=7.0, MW=320, HAC=23, cLogP=2.5
# LE = 1.37 × 7.0 / 23 = 0.42 ← 高效
# LLE = 7.0 - 2.5 = 4.5
# → 还有增重与增脂的空间,优化潜力大
#
# 候选 B: pIC50=7.0, MW=520, HAC=37, cLogP=5.2
# LE = 1.37 × 7.0 / 37 = 0.26 ← 低效
# LLE = 7.0 - 5.2 = 1.8 ← 很差
# → 「预算」已用尽,再优化必然突破性质边界
#
# 结论:A 是好得多的先导,尽管活性相同
def efficiency_metrics(pic50, heavy_atoms, clogp):
return {
"LE": 1.37 * pic50 / heavy_atoms,
"LLE": pic50 - clogp,
"LELP": clogp / (1.37 * pic50 / heavy_atoms), # 越小越好
}
后续优化几乎总是会增加分子量与脂溶性(为了提高活性、选择性)。如果先导阶段就已经又大又油,到候选化合物阶段必然撞上溶解度、代谢、hERG 的墙。
H2L 阶段要做的事
- 建立 SAR:系统探索各取代位点,理解什么重要什么不重要;
- 获取结构信息:共晶结构是这个阶段最有价值的投入,让后续优化从试错变成设计;
- 提升活性到可用水平:通常要提升 10~100 倍;
- 建立初步选择性:至少证明有可利用的选择性来源;
- 初步 ADMET 评估:溶解度、微粒体稳定性、通透性、hERG——发现致命缺陷要趁早;
- 验证细胞活性:生化活性能否转化为细胞活性;
- 确认可合成性:能否快速做出多样的类似物;
- 专利检索:确认有自由实施空间。
常见的决策错误
- 只优化活性,忽略性质。这是最常见也最致命的错误。把 IC50 从 1 μM 做到 1 nM,但分子量涨到 600、cLogP 涨到 6——这样的「先导」在后续阶段几乎必然失败。活性、选择性、性质应该并行优化,不能串行。
- 过早收敛到单一系列:H2L 阶段应保持 2~3 个系列,过早聚焦会在系列失败时无路可退;
- 忽略 SAR 的「异常」:如果某个明明应该提高活性的改动反而降低了,这可能提示结合模式的理解有误——值得深究而非忽略;
- 推迟 ADMET 评估:等到活性优化完才做 ADMET,可能发现整个系列都有致命的代谢问题;
- 不做细胞活性验证:生化活性强但细胞无活性的情况很常见(通透性、外排、蛋白结合);
- 沉没成本效应:已经投入很多的系列,即使数据不好也舍不得停。应该设定明确的终止标准并严格执行。
Go/No-Go 决策
# 建议在 H2L 开始前就定义清楚终止标准
GO_CRITERIA = {
"potency": {"target": "IC50 < 500 nM", "weight": "必须"},
"LE": {"target": "> 0.3", "weight": "必须"},
"LLE": {"target": "> 4", "weight": "必须"},
"cell_activity": {"target": "与生化活性在 10 倍以内", "weight": "必须"},
"selectivity": {"target": "> 10 倍或有优化路径", "weight": "重要"},
"solubility": {"target": "> 10 μM", "weight": "重要"},
"microsomal_stability": {"target": "CLint 可接受", "weight": "重要"},
"hERG": {"target": "> 10 μM 或有优化路径", "weight": "重要"},
"synthesis": {"target": "≤ 5 步可做类似物", "weight": "重要"},
"IP": {"target": "有自由度", "weight": "必须"},
}
# 关键:
# 1) 标准在开始前定,不要事后调整以迁就数据
# 2) 「必须」项不达标就停,不要找理由继续
# 3) 定期回顾,避免沉没成本效应
# 4) 停掉一个系列不是失败,是节省资源
计算在这个阶段的作用
- SAR 分析与可视化:R 基团分解、活性悬崖识别、MMP 分析(见 353《R-group Replacement 实战》);
- 基于结构的设计:有共晶结构后,用对接与自由能计算指导改造(见 336《用 AutoDock Vina 跑 Docking》、201《OpenFE》);
- ADMET 预测:早期预警(见 334《训练 ADMET 多任务模型》);
- 多参数优化:综合排序候选(见 415《化合物优先级排序》);
- 选择性预测:对同源蛋白建模;
- 关键提醒:这个阶段的数据量还很小(几十到几百个分子),模型可靠性有限。计算的作用是提供方向性建议,不是精确预测。
关键要点
- H2L 的核心是筛选决策(这个系列值不值得投入),不只是优化;
- LE 与 LLE 比绝对活性更能预示后续成功率;
- 活性、选择性、性质必须并行优化,串行优化是最常见的致命错误;
- 开始前定义 Go/No-Go 标准并严格执行,避免沉没成本效应。
延伸资源
- 上一步:402《Hit Identification》、403《Hit Expansion》;下一步:405《Lead Optimization》;
- MPO:415《化合物优先级排序》;ADMET 见「成药性」模块。