272

PandaOmics:AI 靶点发现平台如何组织证据

PandaOmics 是英矽智能的 AI 靶点发现平台,把多源组学与文献证据组织成可比较的靶点排序。这篇讲清它的证据组织方式与自建时的关键考量。

PandaOmics 是 Insilico Medicine 的靶点发现平台,把转录组、蛋白组、遗传学、文献、通路、临床试验等多源证据整合起来,为某个疾病给出候选靶点的排序。它要解决的问题是:靶点证据分散在几十个数据源中,人工整合既慢又难以保持一致

证据组织的逻辑

证据维度 问的问题
组学证据 该基因在患病组织中是否异常表达/修饰?
遗传学证据 是否有 GWAS 或罕见变异关联?方向如何?
通路证据 是否处在疾病相关通路的关键位置?
文献证据 研究积累多少?是新兴还是成熟靶点?
可成药性 有无口袋、有无已知配体、适合什么模态?
安全性 敲除表型、组织表达谱、已知不良反应
竞争格局 已有多少公司在做?处于什么阶段?
新颖性 是老靶点还是尚未被充分研究?

「新颖性」与「证据强度」的张力是靶点选择的核心矛盾:证据最充分的靶点往往竞争最激烈,而新颖靶点的证据必然较弱。好的平台不是给一个总分,而是让你能在这两个维度上明确取舍。

自建同类能力的关键考量

多数团队不会采购这类平台,而是自己搭一套靶点评估流程。以下几点是实践中最重要的:

  • 证据要分层而非加权求和。把遗传学证据和文献共现加权成一个总分,会让弱证据稀释强证据。更好的做法是分维度展示,让决策者自己权衡——Open Targets(见 249《Open Targets Platform》)的 datatypeScores 就是这个思路。
  • 因果性优先于相关性:差异表达是相关证据,遗传学关联和扰动实验是因果证据。两者的权重不应相同。有人类遗传学支持的靶点,临床成功率约为无支持靶点的两倍,这是有实证依据的先验。
  • 可成药性要早评估:一个证据完美但无口袋、无法用任何模态触及的靶点,是无法推进的。在立项阶段就把可成药性作为硬约束,而不是选完靶点再发愁。
  • 安全性信号不能后置:该基因敲除的小鼠是否致死?在心脏、肝脏是否高表达?功能丧失变异携带者是否健康?这些在立项时就该查清楚(见 253《ClinVar》254《OMIM》)。
  • 警惕文献偏倚:被研究得多的基因在几乎所有基于文献的指标上都占优,这反映的是研究投入而非生物学重要性。

用开源资源自建的路径

# 一个可行的开源组合
# 1. 靶点-疾病关联与可成药性 → Open Targets(249)
# 2. 遗传学因果证据          → Open Targets Genetics(250)、GWAS Catalog(252)
# 3. 安全性线索              → ClinVar(253)、OMIM(254)、GTEx 组织表达
# 4. 肿瘤依赖性              → DepMap(264)
# 5. 通路语境                → Reactome(260)、STRING(258)
# 6. 竞争格局                → ClinicalTrials.gov、SureChEMBL(234)
# 7. 结构与口袋              → PDB(236)、AlphaFold DB

# 把这些整合成一张表,每个靶点一行,各维度一列,
# 分维度展示而非加权成单一分数

这套组合能覆盖商业平台的大部分核心能力,成本主要在工程整合与持续维护上。

提示

公司与平台信息变动很快,本文为方向性介绍。决策前请核对官方最新信息;靶点结论必须回到原始证据与实验验证,任何平台的排序都只是起点。

延伸资源