Open Targets Platform(EMBL-EBI、Wellcome Sanger、GSK 等联合)把分散在遗传学、基因组学、文献、通路、动物模型中的证据整合起来,为每一对「靶点-疾病」计算一个关联分数。做靶点评估时,它是最实用的单一入口——比起自己去二十个数据库拼证据,这里一次就能看到全貌。
证据类型与权重
| 证据类型 | 来源 | 因果强度 |
|---|---|---|
| 遗传关联 | GWAS、罕见病变异、ClinVar | 最强 |
| 体细胞突变 | COSMIC、cancer gene census | 强(肿瘤领域) |
| 已知药物 | ChEMBL 中该靶点的临床阶段药物 | 强(但有循环论证风险) |
| 差异表达 | Expression Atlas | 弱(相关而非因果) |
| 通路与系统生物学 | Reactome、SLAPenrich | 中 |
| 文本挖掘 | Europe PMC 文献共现 | 弱 |
| 动物模型 | IMPC 小鼠表型 | 中 |
遗传学证据的权重最高是有充分依据的:多项回顾性分析表明,有人类遗传学证据支持的靶点,其药物在临床试验中的成功率约为无此证据靶点的两倍。这是靶点选择中最可靠的先验之一。
用 GraphQL API 查询
import requests
query = """
query TargetDisease($ensemblId: String!) {
target(ensemblId: $ensemblId) {
approvedSymbol
biotype
associatedDiseases(page: {index: 0, size: 15}) {
count
rows {
disease { id name }
score
datatypeScores { id score }
}
}
tractability { label modality value }
safetyLiabilities { event datasource }
}
}
"""
r = requests.post("https://api.platform.opentargets.org/api/v4/graphql",
json={"query": query, "variables": {"ensemblId": "ENSG00000146648"}})
data = r.json()["data"]["target"]
for row in data["associatedDiseases"]["rows"]:
types = {d["id"]: round(d["score"], 2) for d in row["datatypeScores"]}
print(f"{row['disease']['name']:45s} {row['score']:.3f} {types}")
关键在于看 datatypeScores 的构成,而不是只看总分。总分 0.6 全部来自文本挖掘,和总分 0.6 主要来自遗传关联,含义完全不同——前者可能只是文献里被反复提及,后者才是真正的因果线索。
两个容易被忽略但很有用的字段
- Tractability(可成药性):分小分子、抗体、PROTAC 等模态,给出该靶点在每种模态下的可成药性证据等级(如「有已上市小分子药物」「有配体结合口袋」「仅有结构」)。做模态选择时这是第一手信息。
- Safety liabilities:汇总已知的安全性问题——该靶点敲除的动物表型、已知的不良反应关联、表达谱提示的组织风险。在立项阶段就看这个,能避免后期才发现机制性毒性。
批量下载做系统分析
# 全量数据以 Parquet 格式发布(FTP / Google Cloud)
# 适合做全基因组范围的靶点优先级分析
import pandas as pd
assoc = pd.read_parquet("associationByOverallDirect/")
# 例:找某疾病下遗传证据强、且小分子可成药的靶点
candidates = assoc[(assoc["diseaseId"] == "EFO_0000685") &
(assoc["score"] > 0.5)]
使用时的判断
- 分数是启发式的,不是概率:0.8 不代表 80% 的把握,只表示证据相对更强。不要在分数上做过度精细的比较。
- 警惕循环论证:「已知药物」证据来自已有药物,用它评估「这个靶点值不值得做」会偏向已被验证的靶点,不利于发现新靶点。做新靶点探索时应把这一项排除。
- 文本挖掘证据要打折:文献共现只说明被一起提到过,可能只是综述里的顺带提及。
- 疾病本体的层级:疾病用 EFO 本体组织,父子关系会影响关联汇总。查询时注意是看具体疾病还是疾病大类。
- 它是起点不是终点:Open Targets 帮你快速建立证据全貌,但深入判断仍需回到原始文献和实验数据。
上手提示
- 看
datatypeScores的构成而非只看总分,遗传学证据权重最高; - Tractability 与 Safety liabilities 两个字段在立项阶段极有价值;
- 探索新靶点时应排除「已知药物」证据,避免循环论证;
- 分数是启发式排序,不是概率,别做过度精细的比较。
延伸资源
- 遗传学专门平台:250《Open Targets Genetics》;关联数据库:251《DisGeNET》、252《GWAS Catalog》;
- 通路语境:258《STRING》、260《Reactome》;
- 靶点发现概念见「入门 · 学习地图」模块。