251

DisGeNET:疾病-基因关联数据库使用指南

DisGeNET 汇总疾病-基因关联,便于围绕某疾病快速梳理候选基因。这篇讲清它的证据来源分层、打分含义与使用时的判断。

DisGeNET 是疾病-基因关联的综合数据库,把来自专家审编数据库、动物模型、文献文本挖掘的关联汇总到一起。它的定位是广度优先:想快速知道「和某个疾病相关的基因有哪些」,它的覆盖面比多数单一来源都大。

数据来源分层

层级 来源 可靠性
CURATED UniProt、ClinGen、Orphanet、PsyGeNET、CGI 等专家审编 最高
INFERRED 从变异-疾病关联推断、GWAS 目录
ANIMAL MODELS 小鼠、大鼠模型表型(MGD、RGD)
LITERATURE (BEFREE) 文本挖掘的文献共现 最低
ALL 以上全部 混合

选对来源层级比看分数更重要。用 ALL 层级会得到大量仅有文献共现支持的关联——某个基因和某疾病在一篇综述里同时出现,就构成一条「关联」。做严肃的靶点分析应从 CURATED 开始。

两个核心分数

  • GDA score(0~1):基因-疾病关联分数,综合了证据来源的可靠性、支持的文献数量、数据库数量。它是启发式加权的结果,不是概率
  • DSI(Disease Specificity Index):基因的疾病特异性。这个指标很有用但常被忽略——DSI 低说明该基因与几乎所有疾病都「相关」(如 TP53、TNF),这类关联的信息量很低;DSI 高说明该基因只与少数疾病关联,提示更强的特异性。
  • DPI(Disease Pleiotropy Index):疾病类别的多效性,与 DSI 互补。
# 通过 REST API 查询(需注册获取 API key)
import requests

headers = {"Authorization": f"Bearer {api_key}"}
r = requests.get(
    "https://www.disgenet.org/api/gda/disease/UMLS_C0002395",   # 阿尔茨海默病
    params={"source": "CURATED", "format": "json"},
    headers=headers)

import pandas as pd
df = pd.DataFrame(r.json())
df = df[["gene_symbol", "score", "gene_dsi", "gene_dpi", "ei", "source"]]

# 优先看:分数高 + DSI 高(特异性强)的基因
focused = df[(df["score"] > 0.3) & (df["gene_dsi"] > 0.5)]
print(focused.sort_values("score", ascending=False).head(20))

典型用法

  • 疾病基因景观速览:接到一个新适应症,先拉出相关基因列表,快速建立认知地图。
  • 基因集富集的背景:把疾病相关基因集作为参照,检验实验得到的基因列表是否富集。
  • 共病分析:通过共享基因分析不同疾病之间的分子联系,为适应症拓展提供线索。
  • 与其他证据交叉:DisGeNET 的关联 + Open Targets 的遗传学证据 + DepMap 的依赖性数据,三者交集通常是更可靠的候选。

和 Open Targets 怎么分工

  • DisGeNET:覆盖面广(尤其是文献挖掘部分),适合广撒网、建立全景,疾病本体覆盖更全(含很多罕见病)。
  • Open Targets(见 249《Open Targets Platform》):证据分层更清晰、遗传学证据更深入、附带可成药性与安全性信息,适合做靶点优先级决策
  • 实际做法:DisGeNET 先扩大候选范围,Open Targets 做深度评估与排序。

使用注意

  • 文献挖掘关联噪声大:共现不等于因果,甚至不等于正相关(可能是「A 不影响 B」这样的否定陈述)。
  • 研究热度偏倚:被研究得多的基因(TP53、EGFR)关联数天然更多,这反映的是研究投入而非生物学重要性。DSI 指标正是用来校正这个偏倚的。
  • 许可:学术使用免费,商业使用需要许可,使用前应核对当前条款。
  • 疾病术语:用 UMLS CUI 编码,与 EFO、MONDO 等其他本体的映射需注意。

上手提示

  • 先选对来源层级:严肃分析从 CURATED 开始,别用 ALL;
  • DSI 指标能校正研究热度偏倚,是被低估的过滤维度;
  • 广度用 DisGeNET,深度决策用 Open Targets;
  • 商业使用需核对许可条款。

延伸资源