249

Open Targets Platform:靶点发现证据链怎么查

Open Targets 整合多源证据为「靶点-疾病」关联打分,是查靶点证据链、做优先级排序的权威平台。这篇讲清证据类型、打分逻辑与查询方式。

Open Targets Platform(EMBL-EBI、Wellcome Sanger、GSK 等联合)把分散在遗传学、基因组学、文献、通路、动物模型中的证据整合起来,为每一对「靶点-疾病」计算一个关联分数。做靶点评估时,它是最实用的单一入口——比起自己去二十个数据库拼证据,这里一次就能看到全貌

证据类型与权重

证据类型 来源 因果强度
遗传关联 GWAS、罕见病变异、ClinVar 最强
体细胞突变 COSMIC、cancer gene census 强(肿瘤领域)
已知药物 ChEMBL 中该靶点的临床阶段药物 强(但有循环论证风险)
差异表达 Expression Atlas 弱(相关而非因果)
通路与系统生物学 Reactome、SLAPenrich
文本挖掘 Europe PMC 文献共现
动物模型 IMPC 小鼠表型

遗传学证据的权重最高是有充分依据的:多项回顾性分析表明,有人类遗传学证据支持的靶点,其药物在临床试验中的成功率约为无此证据靶点的两倍。这是靶点选择中最可靠的先验之一。

用 GraphQL API 查询

import requests

query = """
query TargetDisease($ensemblId: String!) {
  target(ensemblId: $ensemblId) {
    approvedSymbol
    biotype
    associatedDiseases(page: {index: 0, size: 15}) {
      count
      rows {
        disease { id name }
        score
        datatypeScores { id score }
      }
    }
    tractability { label modality value }
    safetyLiabilities { event datasource }
  }
}
"""

r = requests.post("https://api.platform.opentargets.org/api/v4/graphql",
                  json={"query": query, "variables": {"ensemblId": "ENSG00000146648"}})
data = r.json()["data"]["target"]

for row in data["associatedDiseases"]["rows"]:
    types = {d["id"]: round(d["score"], 2) for d in row["datatypeScores"]}
    print(f"{row['disease']['name']:45s} {row['score']:.3f}  {types}")

关键在于看 datatypeScores 的构成,而不是只看总分。总分 0.6 全部来自文本挖掘,和总分 0.6 主要来自遗传关联,含义完全不同——前者可能只是文献里被反复提及,后者才是真正的因果线索。

两个容易被忽略但很有用的字段

  • Tractability(可成药性):分小分子、抗体、PROTAC 等模态,给出该靶点在每种模态下的可成药性证据等级(如「有已上市小分子药物」「有配体结合口袋」「仅有结构」)。做模态选择时这是第一手信息
  • Safety liabilities:汇总已知的安全性问题——该靶点敲除的动物表型、已知的不良反应关联、表达谱提示的组织风险。在立项阶段就看这个,能避免后期才发现机制性毒性。

批量下载做系统分析

# 全量数据以 Parquet 格式发布(FTP / Google Cloud)
# 适合做全基因组范围的靶点优先级分析

import pandas as pd
assoc = pd.read_parquet("associationByOverallDirect/")

# 例:找某疾病下遗传证据强、且小分子可成药的靶点
candidates = assoc[(assoc["diseaseId"] == "EFO_0000685") &
                   (assoc["score"] > 0.5)]

使用时的判断

  • 分数是启发式的,不是概率:0.8 不代表 80% 的把握,只表示证据相对更强。不要在分数上做过度精细的比较。
  • 警惕循环论证:「已知药物」证据来自已有药物,用它评估「这个靶点值不值得做」会偏向已被验证的靶点,不利于发现新靶点。做新靶点探索时应把这一项排除。
  • 文本挖掘证据要打折:文献共现只说明被一起提到过,可能只是综述里的顺带提及。
  • 疾病本体的层级:疾病用 EFO 本体组织,父子关系会影响关联汇总。查询时注意是看具体疾病还是疾病大类。
  • 它是起点不是终点:Open Targets 帮你快速建立证据全貌,但深入判断仍需回到原始文献和实验数据。

上手提示

  • datatypeScores 的构成而非只看总分,遗传学证据权重最高;
  • Tractability 与 Safety liabilities 两个字段在立项阶段极有价值;
  • 探索新靶点时应排除「已知药物」证据,避免循环论证;
  • 分数是启发式排序,不是概率,别做过度精细的比较。

延伸资源