PandaOmics(Insilico Medicine)是靶点发现平台,整合多组学数据、文献挖掘与知识图谱,为靶点打分排序。评价这类平台的关键不是看它给出的排名,而是看能否把排名背后的证据链完整拆开检验。
平台整合的证据类型
| 证据类型 | 数据来源 | 证据强度 |
|---|---|---|
| 差异表达 | 转录组(GEO、TCGA) | 弱——相关不等于因果 |
| 共表达网络 | 转录组 | 弱 |
| 通路富集 | KEGG、Reactome | 中等 |
| 遗传关联 | GWAS、罕见病变异 | 较强 |
| 孟德尔随机化 | 遗传变异 + 表型 | 较强(接近因果) |
| 功能扰动 | CRISPR 筛选、RNAi | 强 |
| 蛋白组/代谢组 | 质谱数据 | 中等 |
| 文献共现 | PubMed 文本挖掘 | 很弱——反映研究热度 |
| 知识图谱推理 | 整合的关系网络 | 取决于底层证据 |
核心问题:如何拆解证据链
# 平台给出「靶点 X,评分 0.87,排名第 3」
# 【这个数字本身没有信息量】
#
# 必须能回答的问题:
#
# 1) 【这个分数由哪些证据构成?各占多少权重?】
# - 如果主要来自文献共现,那基本等于「热门程度」
# - 如果主要来自差异表达,那只是相关性
# - 如果有遗传学与功能扰动证据,才有分量
#
# 2) 【每条证据的原始来源是什么?】
# - 差异表达来自哪个数据集?样本量多少?
# - 是什么疾病亚型、什么组织?
# - 与我关心的适应症匹配吗?
#
# 3) 【方向对不对?】
# - 靶点在疾病中上调,那应该抑制它
# - 但如果它是保护性因子,抑制反而有害
# - 【平台的打分未必区分这个】
#
# 4) 【有没有反面证据?】
# - 敲除动物是否有严重表型(安全性风险)
# - 是否有失败的临床试验
# - 【平台通常只强调正面证据】
#
# 5) 【可成药性如何?】
# - 有没有可结合的口袋(见 413)
# - 是否属于「难成药」的蛋白类别
# - 有没有已知的配体或工具化合物
#
# 6) 【组织特异性与安全窗】
# - 靶点在正常组织中的表达
# - 抑制它会有什么副作用
#
# 【如果平台不能给出这些细节,
# 那么它的排名不应该驱动实际决策】
从相关到因果的证据梯度
# 这是评估靶点证据的核心框架(见 154)
#
# 第 1 层:【相关性】
# - 疾病组织中表达变化
# - 与临床指标相关
# → 最容易获得,也最不可靠
# → 可能是疾病的【结果】而非【原因】
#
# 第 2 层:【共变与网络位置】
# - 在疾病相关通路中
# - 网络中心性高
# → 提示性,但仍非因果
#
# 第 3 层:【遗传学证据】
# - GWAS 关联
# - 罕见功能缺失变异与表型
# - 孟德尔随机化
# → 【接近因果】:基因型先于表型,
# 不受反向因果与多数混杂影响
# → 【有人类遗传学支持的靶点,
# 临床成功率明显更高】
#
# 第 4 层:【功能扰动】
# - 细胞模型中敲除/敲低改变表型
# - CRISPR 筛选中的依赖性
# → 直接的因果证据,但模型是否代表疾病?
#
# 第 5 层:【动物模型】
# - 基因敲除动物的疾病表型
# - 药理学干预的效果
# → 更接近,但物种差异是主要风险
#
# 第 6 层:【人体证据】
# - 工具化合物的临床概念验证
# - 已有药物的作用机制
# → 【金标准】
#
# 【实践建议】:
# 把平台给出的每个候选靶点,
# 明确标注它的证据处在哪一层
# → 只有第 3 层以上的证据才值得投入资源
AI 在靶点发现中的真实作用
- 它擅长的:
- 大规模文献与数据的汇总——人工不可能读完所有相关文献;
- 发现被忽略的候选(不在当前研究热点中的基因);
- 跨数据集的一致性检验;
- 快速生成假设供进一步验证。
- 它不能做的:
- 把相关性变成因果性——这需要实验;
- 判断临床可行性与商业价值;
- 预测安全性风险(除非有明确的遗传学信号);
- 替代对疾病生物学的深入理解。
- 系统性偏倚:基于文献的方法天然偏向研究充分的基因——而真正的新靶点恰恰是文献少的。这个偏倚必须主动纠正(如给文献证据降权,或专门筛选低文献量的候选)。
使用这类平台的务实方式
| 做法 | 说明 |
|---|---|
| 当作检索与汇总工具 | 快速了解某个靶点的证据全貌 |
| 用来发现候选,而非做决策 | 排名靠前的进入人工评估 |
| 验证已有假设 | 看数据是否支持内部的想法 |
| 逐条核对原始文献 | 关键证据必须回到原文 |
| 补充公开数据库 | Open Targets、DepMap 等免费资源可交叉验证 |
| 不要只看总分 | 展开各维度的分数 |
关键要点
- 排名数字本身没有信息量——必须能拆开看证据构成与原始来源;
- 只有遗传学证据及以上层级才值得投入资源;差异表达与文献共现是最弱的证据;
- 基于文献的方法天然偏向研究充分的基因——而新靶点恰恰文献少;
- 平台通常只强调正面证据,反面证据(敲除表型、失败试验)需要主动查。
说明
- 公司/平台信息变动很快,本文为方向性介绍,决策前请核对官方最新信息。
延伸资源
- AI 靶点发现:154《AI 靶点发现模型》;Chemistry42:153《Chemistry42 JCIM 论文精读》;
- 靶点可成药性:413《靶点可成药性 Druggability》;论文阅读框架:170《AI 制药论文阅读框架》。