PandaOmics 是 Insilico Medicine 的靶点发现平台,把转录组、蛋白组、遗传学、文献、通路、临床试验等多源证据整合起来,为某个疾病给出候选靶点的排序。它要解决的问题是:靶点证据分散在几十个数据源中,人工整合既慢又难以保持一致。
证据组织的逻辑
| 证据维度 | 问的问题 |
|---|---|
| 组学证据 | 该基因在患病组织中是否异常表达/修饰? |
| 遗传学证据 | 是否有 GWAS 或罕见变异关联?方向如何? |
| 通路证据 | 是否处在疾病相关通路的关键位置? |
| 文献证据 | 研究积累多少?是新兴还是成熟靶点? |
| 可成药性 | 有无口袋、有无已知配体、适合什么模态? |
| 安全性 | 敲除表型、组织表达谱、已知不良反应 |
| 竞争格局 | 已有多少公司在做?处于什么阶段? |
| 新颖性 | 是老靶点还是尚未被充分研究? |
「新颖性」与「证据强度」的张力是靶点选择的核心矛盾:证据最充分的靶点往往竞争最激烈,而新颖靶点的证据必然较弱。好的平台不是给一个总分,而是让你能在这两个维度上明确取舍。
自建同类能力的关键考量
多数团队不会采购这类平台,而是自己搭一套靶点评估流程。以下几点是实践中最重要的:
- 证据要分层而非加权求和。把遗传学证据和文献共现加权成一个总分,会让弱证据稀释强证据。更好的做法是分维度展示,让决策者自己权衡——Open Targets(见 249《Open Targets Platform》)的 datatypeScores 就是这个思路。
- 因果性优先于相关性:差异表达是相关证据,遗传学关联和扰动实验是因果证据。两者的权重不应相同。有人类遗传学支持的靶点,临床成功率约为无支持靶点的两倍,这是有实证依据的先验。
- 可成药性要早评估:一个证据完美但无口袋、无法用任何模态触及的靶点,是无法推进的。在立项阶段就把可成药性作为硬约束,而不是选完靶点再发愁。
- 安全性信号不能后置:该基因敲除的小鼠是否致死?在心脏、肝脏是否高表达?功能丧失变异携带者是否健康?这些在立项时就该查清楚(见 253《ClinVar》、254《OMIM》)。
- 警惕文献偏倚:被研究得多的基因在几乎所有基于文献的指标上都占优,这反映的是研究投入而非生物学重要性。
用开源资源自建的路径
# 一个可行的开源组合
# 1. 靶点-疾病关联与可成药性 → Open Targets(249)
# 2. 遗传学因果证据 → Open Targets Genetics(250)、GWAS Catalog(252)
# 3. 安全性线索 → ClinVar(253)、OMIM(254)、GTEx 组织表达
# 4. 肿瘤依赖性 → DepMap(264)
# 5. 通路语境 → Reactome(260)、STRING(258)
# 6. 竞争格局 → ClinicalTrials.gov、SureChEMBL(234)
# 7. 结构与口袋 → PDB(236)、AlphaFold DB
# 把这些整合成一张表,每个靶点一行,各维度一列,
# 分维度展示而非加权成单一分数
这套组合能覆盖商业平台的大部分核心能力,成本主要在工程整合与持续维护上。
提示
公司与平台信息变动很快,本文为方向性介绍。决策前请核对官方最新信息;靶点结论必须回到原始证据与实验验证,任何平台的排序都只是起点。
延伸资源
- 开源替代:249《Open Targets Platform》、250《Open Targets Genetics》、264《DepMap》;
- 公司案例:308《Insilico Medicine》;
- 靶点发现概念见「入门 · 学习地图」模块。