154

AI 靶点发现模型:从相关信号到因果假设的证据梯度

靶点发现的 AI 模型输出的是假设而非结论。这篇给出从相关信号到因果假设的完整证据梯度与实操判据。

靶点选择是药物研发中影响最大、最难纠错的决策——选错靶点,后面所有的化学与临床工作都会白费。AI 能加速证据的汇总与假设的生成,但它不能把相关性变成因果性

证据梯度:核心框架

层级 证据类型 能说明什么 不能说明什么
1 表达相关 该基因与疾病有关 是因还是果
2 网络/通路位置 在相关生物学中 是否关键节点
3 人类遗传学 接近因果 是否可药物干预
4 细胞功能扰动 在该模型中有因果作用 模型是否代表疾病
5 动物模型 在体内有作用 是否可外推到人
6 人体概念验证 金标准

关键事实:有人类遗传学支持的靶点,临床成功率明显高于没有的。这是靶点选择中最可靠的先验之一——在评估任何 AI 给出的靶点候选时,第一个该问的问题就是「有没有人类遗传学证据」

各类 AI 方法的定位

# 1) 【文献挖掘与知识图谱】
#    做什么:从海量文献中抽取实体与关系
#    价值:汇总人力无法覆盖的信息
#    局限:
#      - 【偏向研究充分的基因】
#      - 文献中的关系不等于因果
#      - 错误会被传播放大
#    → 用于【发现候选】而非评估强度
#
# 2) 【多组学整合】
#    做什么:整合转录组、蛋白组、代谢组
#    价值:跨层次的一致信号更可信
#    局限:
#      - 大部分仍是相关性
#      - 批次效应与技术偏倚
#      - 组织/细胞类型的异质性
#    → 【单细胞数据在这里价值较大】:
#      能定位到具体细胞类型
#
# 3) 【CRISPR 筛选分析】
#    做什么:从全基因组筛选中找依赖性基因
#    价值:【直接的因果证据】
#    局限:
#      - 细胞系模型的代表性
#      - 体外与体内的差异
#      - 必需基因(对所有细胞都重要)会带来安全性风险
#    → 【DepMap 是重要的公开资源】
#
# 4) 【孟德尔随机化】
#    做什么:用遗传变异作为「自然实验」推断因果
#    价值:【最接近因果的观察性方法】
#    局限:
#      - 需要合适的工具变量
#      - 水平多效性的假设难以完全验证
#      - 反映终生暴露,与药物短期干预不同
#
# 5) 【网络与图神经网络方法】
#    做什么:在生物网络上传播信号,预测新关联
#    价值:能发现间接关联
#    局限:
#      - 【网络本身来自已有知识,偏倚被继承】
#      - 预测的关联需要独立验证

必须同时评估的三个维度

# 靶点评估不只是「与疾病有没有关系」
#
# 维度一:【疾病相关性】(causality)
#   证据梯度如上
#   核心问题:干预这个靶点能否改变疾病进程?
#
# 维度二:【可成药性】(tractability)
#   - 有没有可结合的口袋?(见 091、413)
#   - 属于哪类蛋白?
#     激酶、GPCR、核受体 → 相对好做
#     转录因子、PPI、支架蛋白 → 难
#   - 有没有已知配体或工具化合物?
#   - 适合什么模态?
#     小分子 / 抗体 / 降解剂(见 356)/ 核酸(见 375)
#     → 【「不可成药」常常只是「小分子不可成药」】
#
# 维度三:【安全性】(safety)
#   - 敲除动物的表型如何?
#   - 人类功能缺失变异携带者有什么表型?
#     → 【这是最有价值的安全性信号】
#   - 组织表达谱:在哪些正常组织中高表达?
#   - 同家族蛋白的选择性能否实现?
#   - 是否有已知的机制相关毒性?
#
# 【三个维度都要过关】
#   相关性很强但不可成药 → 做不了
#   可成药但安全性风险高 → 不该做
#   → 很多「AI 发现的新靶点」在后两个维度上过不了关
#
# 【实操建议】:
#   做一张三维度的评分表,
#   每个候选靶点逐项填写并注明证据来源
#   → 比任何单一的 AI 评分有用

可用的公开资源

资源 内容
Open Targets 整合遗传学、表达、通路、药物证据;可拆解查看
DepMap 数千细胞系的 CRISPR 依赖性数据
GWAS Catalog 人类遗传关联
gnomAD 人群变异频率与基因的约束性
Human Protein Atlas 组织与单细胞表达谱
ChEMBL 已知配体与活性(见 228《BindingDB》
Pharos / TCRD 靶点的研究程度分级

Open Targets 尤其值得用:它免费、证据可拆解、方法透明——在评估任何商业平台之前,先用它做基线

常见的失败模式

  • 把相关当因果:差异表达最常被误读。疾病组织中某基因上调,可能是疾病的结果、代偿反应,甚至是保护性的——抑制它反而有害;
  • 忽略方向性:知道靶点相关,但不知道该激动还是拮抗;
  • 模型系统的代表性:细胞系筛选中的依赖性,在体内可能完全不同;
  • 只看正面证据主动搜索反面证据是必要的纪律——失败的临床试验、敲除动物的严重表型;
  • 忽略竞争格局:靶点很好但已有五家在做,且进度更快;
  • 把「新颖」当优点没有人做过的靶点,可能是因为别人已经试过并放弃了——需要查清为什么没人做。

关键要点

  • 有人类遗传学支持的靶点临床成功率明显更高——这是最可靠的先验;
  • 靶点评估必须同时过疾病相关性、可成药性、安全性三关;
  • 「不可成药」常常只是「小分子不可成药」——降解剂、核酸、抗体可能可行;
  • 主动搜索反面证据是必要纪律;「没人做过」可能意味着别人试过并放弃了。

延伸资源