152

PandaOmics 平台论文精读:靶点发现证据链要怎么拆开看

PandaOmics 用多组学与文献证据做靶点发现。这篇讲清它的证据类型、如何拆解证据链,以及审读时的关键问题。

PandaOmics(Insilico Medicine)是靶点发现平台,整合多组学数据、文献挖掘与知识图谱,为靶点打分排序。评价这类平台的关键不是看它给出的排名,而是看能否把排名背后的证据链完整拆开检验

平台整合的证据类型

证据类型 数据来源 证据强度
差异表达 转录组(GEO、TCGA) ——相关不等于因果
共表达网络 转录组
通路富集 KEGG、Reactome 中等
遗传关联 GWAS、罕见病变异 较强
孟德尔随机化 遗传变异 + 表型 较强(接近因果)
功能扰动 CRISPR 筛选、RNAi
蛋白组/代谢组 质谱数据 中等
文献共现 PubMed 文本挖掘 很弱——反映研究热度
知识图谱推理 整合的关系网络 取决于底层证据

核心问题:如何拆解证据链

# 平台给出「靶点 X,评分 0.87,排名第 3」
# 【这个数字本身没有信息量】
#
# 必须能回答的问题:
#
# 1) 【这个分数由哪些证据构成?各占多少权重?】
#    - 如果主要来自文献共现,那基本等于「热门程度」
#    - 如果主要来自差异表达,那只是相关性
#    - 如果有遗传学与功能扰动证据,才有分量
#
# 2) 【每条证据的原始来源是什么?】
#    - 差异表达来自哪个数据集?样本量多少?
#    - 是什么疾病亚型、什么组织?
#    - 与我关心的适应症匹配吗?
#
# 3) 【方向对不对?】
#    - 靶点在疾病中上调,那应该抑制它
#    - 但如果它是保护性因子,抑制反而有害
#    - 【平台的打分未必区分这个】
#
# 4) 【有没有反面证据?】
#    - 敲除动物是否有严重表型(安全性风险)
#    - 是否有失败的临床试验
#    - 【平台通常只强调正面证据】
#
# 5) 【可成药性如何?】
#    - 有没有可结合的口袋(见 413)
#    - 是否属于「难成药」的蛋白类别
#    - 有没有已知的配体或工具化合物
#
# 6) 【组织特异性与安全窗】
#    - 靶点在正常组织中的表达
#    - 抑制它会有什么副作用
#
# 【如果平台不能给出这些细节,
#  那么它的排名不应该驱动实际决策】

从相关到因果的证据梯度

# 这是评估靶点证据的核心框架(见 154)
#
# 第 1 层:【相关性】
#   - 疾病组织中表达变化
#   - 与临床指标相关
#   → 最容易获得,也最不可靠
#   → 可能是疾病的【结果】而非【原因】
#
# 第 2 层:【共变与网络位置】
#   - 在疾病相关通路中
#   - 网络中心性高
#   → 提示性,但仍非因果
#
# 第 3 层:【遗传学证据】
#   - GWAS 关联
#   - 罕见功能缺失变异与表型
#   - 孟德尔随机化
#   → 【接近因果】:基因型先于表型,
#     不受反向因果与多数混杂影响
#   → 【有人类遗传学支持的靶点,
#      临床成功率明显更高】
#
# 第 4 层:【功能扰动】
#   - 细胞模型中敲除/敲低改变表型
#   - CRISPR 筛选中的依赖性
#   → 直接的因果证据,但模型是否代表疾病?
#
# 第 5 层:【动物模型】
#   - 基因敲除动物的疾病表型
#   - 药理学干预的效果
#   → 更接近,但物种差异是主要风险
#
# 第 6 层:【人体证据】
#   - 工具化合物的临床概念验证
#   - 已有药物的作用机制
#   → 【金标准】
#
# 【实践建议】:
#   把平台给出的每个候选靶点,
#   明确标注它的证据处在哪一层
#   → 只有第 3 层以上的证据才值得投入资源

AI 在靶点发现中的真实作用

  • 它擅长的
    • 大规模文献与数据的汇总——人工不可能读完所有相关文献;
    • 发现被忽略的候选(不在当前研究热点中的基因);
    • 跨数据集的一致性检验;
    • 快速生成假设供进一步验证。
  • 它不能做的
    • 把相关性变成因果性——这需要实验;
    • 判断临床可行性与商业价值;
    • 预测安全性风险(除非有明确的遗传学信号);
    • 替代对疾病生物学的深入理解。
  • 系统性偏倚基于文献的方法天然偏向研究充分的基因——而真正的新靶点恰恰是文献少的。这个偏倚必须主动纠正(如给文献证据降权,或专门筛选低文献量的候选)。

使用这类平台的务实方式

做法 说明
当作检索与汇总工具 快速了解某个靶点的证据全貌
用来发现候选,而非做决策 排名靠前的进入人工评估
验证已有假设 看数据是否支持内部的想法
逐条核对原始文献 关键证据必须回到原文
补充公开数据库 Open Targets、DepMap 等免费资源可交叉验证
不要只看总分 展开各维度的分数

关键要点

  • 排名数字本身没有信息量——必须能拆开看证据构成与原始来源;
  • 只有遗传学证据及以上层级才值得投入资源;差异表达与文献共现是最弱的证据;
  • 基于文献的方法天然偏向研究充分的基因——而新靶点恰恰文献少;
  • 平台通常只强调正面证据,反面证据(敲除表型、失败试验)需要主动查

说明

  • 公司/平台信息变动很快,本文为方向性介绍,决策前请核对官方最新信息。

延伸资源