264

DepMap:癌症依赖性数据如何寻找靶点

DepMap 用大规模 CRISPR 敲除筛选揭示癌细胞系的基因依赖,是发现癌症靶点的关键资源。这篇讲清依赖性分数的读法、选择性依赖的识别与合成致死分析。

DepMap(Cancer Dependency Map,Broad Institute)在上千个癌细胞系中系统敲除每一个基因,测量哪些基因是细胞存活所必需的。它回答药物研发最核心的问题之一:哪些基因是癌细胞的「阿喀琉斯之踵」? 这是当前癌症靶点发现最重要的公开资源。

数据规模与内容

数据集 内容
CRISPR (Chronos/Avana) 约 1,100 个细胞系 × 约 18,000 个基因的敲除依赖性
RNAi (DEMETER2) 较早的 shRNA 敲低数据,可作正交验证
Omics 表达、突变、拷贝数、甲基化、蛋白组
PRISM 药敏 药物响应数据(见 267《PRISM Repurposing》

依赖性分数怎么读

Chronos / CERES 分数经过归一化,含义明确:

  • 0:敲除无影响(对照水平);
  • −1:与「所有细胞系共同必需基因」的中位效应相当,这是判断强依赖的基准线
  • < −0.5:通常认为该细胞系对此基因有依赖;
  • > 0:敲除反而促进生长(可能是抑癌基因)。
import pandas as pd

# 从 depmap.org 下载 CRISPRGeneEffect.csv 与 Model.csv
dep = pd.read_csv("CRISPRGeneEffect.csv", index_col=0)   # 行=细胞系, 列=基因
model = pd.read_csv("Model.csv", index_col=0)

gene = "EGFR (1956)"
scores = dep[gene].dropna()

print(f"依赖细胞系数 (< -0.5): {(scores < -0.5).sum()} / {len(scores)}")
print(f"中位依赖性: {scores.median():.3f}")

# 哪些谱系最依赖?
df = pd.DataFrame({"score": scores}).join(model[["OncotreeLineage"]])
print(df.groupby("OncotreeLineage")["score"].median().sort_values().head(10))

关键区分:共同必需 vs 选择性依赖

这是使用 DepMap 最重要的判断:

类型 特征 作为药物靶点
共同必需(common essential) 几乎所有细胞系都依赖(核糖体、剪接体、蛋白酶体等) ——正常细胞同样依赖,治疗窗口窄
选择性依赖(selective) 只有部分细胞系依赖,且与某个基因组特征相关 ——天然带生物标志物
# 找选择性依赖:依赖性方差大、且只有一部分细胞系强依赖
stats = pd.DataFrame({
    "median": dep.median(),
    "std": dep.std(),
    "n_dependent": (dep < -0.5).sum(),
    "frac_dependent": (dep < -0.5).mean(),
})
selective = stats[(stats["frac_dependent"] > 0.02) &
                  (stats["frac_dependent"] < 0.30) &
                  (stats["std"] > 0.25)]
print(f"选择性依赖候选:{len(selective)} 个基因")

合成致死与生物标志物发现

把依赖性与基因组特征关联,就能找到「什么样的细胞会依赖这个基因」——这既是合成致死关系,也是天然的患者选择标志物:

from scipy import stats as sps

# 例:携带某突变的细胞系是否更依赖某基因
mut = pd.read_csv("OmicsSomaticMutations.csv")
mutated = set(mut[mut["HugoSymbol"] == "KRAS"]["ModelID"])

target = dep["SHOC2 (8036)"].dropna()
grp_mut = target[target.index.isin(mutated)]
grp_wt  = target[~target.index.isin(mutated)]

t, p = sps.ttest_ind(grp_mut, grp_wt, equal_var=False)
print(f"KRAS 突变型依赖性 {grp_mut.mean():.3f} vs 野生型 {grp_wt.mean():.3f}, p={p:.2e}")

经典成功案例包括:MTAP 缺失细胞依赖 PRMT5(已推动多个 PRMT5 抑制剂进入临床)、ARID1A 突变依赖 ARID1BSMARCA4 缺失依赖 SMARCA2。这类「缺一补一」的合成致死关系,是当前肿瘤靶点发现最有产出的方向之一。

局限

  • 细胞系不等于肿瘤:长期传代的细胞系缺少微环境、免疫系统、基质细胞。体外依赖不保证体内有效。
  • 敲除不等于抑制:CRISPR 完全敲除蛋白,而小分子通常只抑制酶活性。有支架功能的蛋白,敲除有效但抑制活性位点可能无效——这是从依赖性到可成药靶点的一道重要门槛,也是降解剂(PROTAC)的机会所在。
  • 拷贝数效应:高拷贝数区域的基因因多重切割造成 DNA 损伤,会产生假依赖信号。Chronos 等算法已做校正,但仍需留意。
  • 细胞系代表性偏差:某些癌种细胞系很少,统计效力不足。
  • 短期筛选:通常培养 2~3 周,慢作用的依赖可能检测不到。

上手提示

  • 分数 −1 是「共同必需基因的中位效应」,是判断强依赖的基准线;
  • 选择性依赖才是好靶点,共同必需基因治疗窗口太窄;
  • 把依赖性与基因组特征关联,同时得到靶点与患者选择标志物;
  • 敲除有效 ≠ 抑制活性位点有效,支架功能蛋白应考虑降解剂路线。

延伸资源