402

Hit Identification:如何从筛选命中物开始一个项目

Hit Identification 是项目的起点。这篇讲清各类苗头发现策略的适用场景、命中确认流程与常见陷阱。

苗头化合物(hit)是项目的第一个可优化起点。这一步的质量直接决定后续几年的工作能否成功——一个假阳性苗头可能浪费整个团队半年时间

主要的苗头发现策略

策略 规模 适用 典型命中率
高通量筛选(HTS) 10⁵~10⁶ 有稳健的检测体系 0.1%~1%(含大量假阳性)
虚拟筛选 10⁶~10¹⁰ 有靶点结构 视方法而定,需实验确认
片段筛选(FBDD) 10³~10⁴ 难成药靶点 1%~10%(弱结合)
DNA 编码库(DEL) 10⁹~10¹² 可纯化的靶点蛋白 需严格验证
已知配体改造 有文献先例 高,但新颖性受限
表型筛选 10⁴~10⁶ 靶点未知或多靶点 需机制去卷积
天然产物 特殊化学空间 分离鉴定成本高

选择策略的决策依据

  • 有高质量结构 + 明确口袋 → 虚拟筛选性价比最高(见 336《用 AutoDock Vina 跑 Docking》);
  • 难成药靶点、浅口袋 → 片段筛选(小分子更容易在浅口袋找到结合点);
  • 有稳健的生化/细胞检测 → HTS;
  • 靶点生物学不确定 → 表型筛选(绕开靶点假设风险);
  • 蛋白可纯化且量足 → DEL 提供最大的化学空间覆盖;
  • 实践中常常组合使用:虚拟筛选 + 小规模实验验证,成本远低于全库 HTS。

命中确认:最容易被省略也最关键

初筛的「命中」中,相当比例是假阳性。确认流程必须做完整:

# 命中确认的标准流程
#
# 1) 重复验证
#    用新配制的化合物重测,排除孔位效应与操作误差
#
# 2) 剂量-响应曲线
#    单点活性不可信,必须做完整的 8~10 点曲线
#    检查:Hill 系数是否正常(异常陡峭提示聚集或非特异)
#         曲线是否达到平台
#
# 3) 化合物纯度与结构确认
#    LC-MS / NMR 重新确认
#    ← 商业化合物的结构错误或降解是真实存在的问题
#
# 4) 排除干扰机制 —— 最重要的一步
#    a) 聚集体:加去污剂(如 0.01% Triton X-100)重测
#       活性消失 → 是聚集体假阳性
#    b) 光学干扰:检查化合物是否荧光/吸光
#    c) 化学反应性:检查是否含反应性基团
#    d) 氧化还原循环:某些化合物产生 H2O2
#
# 5) 正交检测
#    用原理完全不同的第二种方法验证
#    (如生化活性 + SPR 结合 + 细胞热位移)
#
# 6) 直接结合验证
#    SPR、ITC、NMR、MST 等确认真的结合靶点
#
# 7) 结构确证(最强证据)
#    共晶结构直接看到结合模式
#
# 8) 靶点参与验证
#    突变体实验:关键残基突变后活性应丧失
#    细胞水平:CETSA、靶点占有率

PAINS 与频繁命中者

from rdkit import Chem
from rdkit.Chem import FilterCatalog

params = FilterCatalog.FilterCatalogParams()
for cat in [FilterCatalog.FilterCatalogParams.FilterCatalogs.PAINS_A,
            FilterCatalog.FilterCatalogParams.FilterCatalogs.PAINS_B,
            FilterCatalog.FilterCatalogParams.FilterCatalogs.PAINS_C]:
    params.AddCatalog(cat)
catalog = FilterCatalog.FilterCatalog(params)

def check_pains(smiles):
    mol = Chem.MolFromSmiles(smiles)
    if mol is None:
        return None
    entry = catalog.GetFirstMatch(mol)
    return entry.GetDescription() if entry else None

# 但要理解 PAINS 的正确用法:
#   PAINS 命中 ≠ 一定是假阳性
#   它只是「需要额外验证」的提示
#   某些 PAINS 结构确实有真实活性
#
# 更可靠的判断:
#   1) 查该化合物在多少个不相关 assay 中显示活性
#      (频繁命中者 = 高度可疑)
#   2) 看剂量-响应曲线形状
#   3) 做去污剂对照
#   4) 用正交方法验证

评估苗头质量

指标 关注点
配体高效性(LE) LE = −ΔG/重原子数;比绝对活性更能预示优化潜力
亲脂高效性(LLE) LLE = pIC50 − logP;反映活性是否靠疏水性堆出来的
结构新颖性 与已知配体的差异、专利空间
可优化性 有可修饰的位点吗?合成是否可及?
初步选择性 对近缘靶点的选择性
理化性质 MW、logP 是否还有优化空间
SAR 迹象 类似物是否显示合理的构效关系

配体高效性比绝对活性更重要:一个 MW 250、IC50 = 10 μM 的苗头(LE 约 0.4),优化潜力远大于一个 MW 550、IC50 = 1 μM 的苗头(LE 约 0.2)——后者已经用掉了大部分「分子量预算」。

常见陷阱

  • 只看活性不看效率:选了一个又大又油的分子作起点,后续优化空间已被耗尽;
  • 跳过命中确认直接优化在假阳性上做几个月 SAR 是最惨的浪费
  • 忽略 SAR 迹象:如果一个化学系列中的类似物活性毫无规律,很可能是非特异性效应;
  • 单一苗头系列:应该推进 2~3 个化学系列并行,降低单点失败风险;
  • 忽略可合成性:苗头结构如果极难衍生化,SAR 探索会寸步难行。

关键要点

  • 命中确认不可省略——去污剂对照、剂量曲线、正交方法、直接结合验证;
  • 配体高效性比绝对活性更能预示优化潜力
  • PAINS 命中是「需要额外验证」的提示,不等于一定是假阳性;
  • 并行推进 2~3 个化学系列,降低单点失败风险。

延伸资源