苗头化合物(hit)是项目的第一个可优化起点。这一步的质量直接决定后续几年的工作能否成功——一个假阳性苗头可能浪费整个团队半年时间。
主要的苗头发现策略
| 策略 | 规模 | 适用 | 典型命中率 |
|---|---|---|---|
| 高通量筛选(HTS) | 10⁵~10⁶ | 有稳健的检测体系 | 0.1%~1%(含大量假阳性) |
| 虚拟筛选 | 10⁶~10¹⁰ | 有靶点结构 | 视方法而定,需实验确认 |
| 片段筛选(FBDD) | 10³~10⁴ | 难成药靶点 | 1%~10%(弱结合) |
| DNA 编码库(DEL) | 10⁹~10¹² | 可纯化的靶点蛋白 | 需严格验证 |
| 已知配体改造 | — | 有文献先例 | 高,但新颖性受限 |
| 表型筛选 | 10⁴~10⁶ | 靶点未知或多靶点 | 需机制去卷积 |
| 天然产物 | — | 特殊化学空间 | 分离鉴定成本高 |
选择策略的决策依据
- 有高质量结构 + 明确口袋 → 虚拟筛选性价比最高(见 336《用 AutoDock Vina 跑 Docking》);
- 难成药靶点、浅口袋 → 片段筛选(小分子更容易在浅口袋找到结合点);
- 有稳健的生化/细胞检测 → HTS;
- 靶点生物学不确定 → 表型筛选(绕开靶点假设风险);
- 蛋白可纯化且量足 → DEL 提供最大的化学空间覆盖;
- 实践中常常组合使用:虚拟筛选 + 小规模实验验证,成本远低于全库 HTS。
命中确认:最容易被省略也最关键
初筛的「命中」中,相当比例是假阳性。确认流程必须做完整:
# 命中确认的标准流程
#
# 1) 重复验证
# 用新配制的化合物重测,排除孔位效应与操作误差
#
# 2) 剂量-响应曲线
# 单点活性不可信,必须做完整的 8~10 点曲线
# 检查:Hill 系数是否正常(异常陡峭提示聚集或非特异)
# 曲线是否达到平台
#
# 3) 化合物纯度与结构确认
# LC-MS / NMR 重新确认
# ← 商业化合物的结构错误或降解是真实存在的问题
#
# 4) 排除干扰机制 —— 最重要的一步
# a) 聚集体:加去污剂(如 0.01% Triton X-100)重测
# 活性消失 → 是聚集体假阳性
# b) 光学干扰:检查化合物是否荧光/吸光
# c) 化学反应性:检查是否含反应性基团
# d) 氧化还原循环:某些化合物产生 H2O2
#
# 5) 正交检测
# 用原理完全不同的第二种方法验证
# (如生化活性 + SPR 结合 + 细胞热位移)
#
# 6) 直接结合验证
# SPR、ITC、NMR、MST 等确认真的结合靶点
#
# 7) 结构确证(最强证据)
# 共晶结构直接看到结合模式
#
# 8) 靶点参与验证
# 突变体实验:关键残基突变后活性应丧失
# 细胞水平:CETSA、靶点占有率
PAINS 与频繁命中者
from rdkit import Chem
from rdkit.Chem import FilterCatalog
params = FilterCatalog.FilterCatalogParams()
for cat in [FilterCatalog.FilterCatalogParams.FilterCatalogs.PAINS_A,
FilterCatalog.FilterCatalogParams.FilterCatalogs.PAINS_B,
FilterCatalog.FilterCatalogParams.FilterCatalogs.PAINS_C]:
params.AddCatalog(cat)
catalog = FilterCatalog.FilterCatalog(params)
def check_pains(smiles):
mol = Chem.MolFromSmiles(smiles)
if mol is None:
return None
entry = catalog.GetFirstMatch(mol)
return entry.GetDescription() if entry else None
# 但要理解 PAINS 的正确用法:
# PAINS 命中 ≠ 一定是假阳性
# 它只是「需要额外验证」的提示
# 某些 PAINS 结构确实有真实活性
#
# 更可靠的判断:
# 1) 查该化合物在多少个不相关 assay 中显示活性
# (频繁命中者 = 高度可疑)
# 2) 看剂量-响应曲线形状
# 3) 做去污剂对照
# 4) 用正交方法验证
评估苗头质量
| 指标 | 关注点 |
|---|---|
| 配体高效性(LE) | LE = −ΔG/重原子数;比绝对活性更能预示优化潜力 |
| 亲脂高效性(LLE) | LLE = pIC50 − logP;反映活性是否靠疏水性堆出来的 |
| 结构新颖性 | 与已知配体的差异、专利空间 |
| 可优化性 | 有可修饰的位点吗?合成是否可及? |
| 初步选择性 | 对近缘靶点的选择性 |
| 理化性质 | MW、logP 是否还有优化空间 |
| SAR 迹象 | 类似物是否显示合理的构效关系 |
配体高效性比绝对活性更重要:一个 MW 250、IC50 = 10 μM 的苗头(LE 约 0.4),优化潜力远大于一个 MW 550、IC50 = 1 μM 的苗头(LE 约 0.2)——后者已经用掉了大部分「分子量预算」。
常见陷阱
- 只看活性不看效率:选了一个又大又油的分子作起点,后续优化空间已被耗尽;
- 跳过命中确认直接优化:在假阳性上做几个月 SAR 是最惨的浪费;
- 忽略 SAR 迹象:如果一个化学系列中的类似物活性毫无规律,很可能是非特异性效应;
- 单一苗头系列:应该推进 2~3 个化学系列并行,降低单点失败风险;
- 忽略可合成性:苗头结构如果极难衍生化,SAR 探索会寸步难行。
关键要点
- 命中确认不可省略——去污剂对照、剂量曲线、正交方法、直接结合验证;
- 配体高效性比绝对活性更能预示优化潜力;
- PAINS 命中是「需要额外验证」的提示,不等于一定是假阳性;
- 并行推进 2~3 个化学系列,降低单点失败风险。