DepMap(Cancer Dependency Map,Broad Institute)在上千个癌细胞系中系统敲除每一个基因,测量哪些基因是细胞存活所必需的。它回答药物研发最核心的问题之一:哪些基因是癌细胞的「阿喀琉斯之踵」? 这是当前癌症靶点发现最重要的公开资源。
数据规模与内容
| 数据集 | 内容 |
|---|---|
| CRISPR (Chronos/Avana) | 约 1,100 个细胞系 × 约 18,000 个基因的敲除依赖性 |
| RNAi (DEMETER2) | 较早的 shRNA 敲低数据,可作正交验证 |
| Omics | 表达、突变、拷贝数、甲基化、蛋白组 |
| PRISM 药敏 | 药物响应数据(见 267《PRISM Repurposing》) |
依赖性分数怎么读
Chronos / CERES 分数经过归一化,含义明确:
- 0:敲除无影响(对照水平);
- −1:与「所有细胞系共同必需基因」的中位效应相当,这是判断强依赖的基准线;
- < −0.5:通常认为该细胞系对此基因有依赖;
- > 0:敲除反而促进生长(可能是抑癌基因)。
import pandas as pd
# 从 depmap.org 下载 CRISPRGeneEffect.csv 与 Model.csv
dep = pd.read_csv("CRISPRGeneEffect.csv", index_col=0) # 行=细胞系, 列=基因
model = pd.read_csv("Model.csv", index_col=0)
gene = "EGFR (1956)"
scores = dep[gene].dropna()
print(f"依赖细胞系数 (< -0.5): {(scores < -0.5).sum()} / {len(scores)}")
print(f"中位依赖性: {scores.median():.3f}")
# 哪些谱系最依赖?
df = pd.DataFrame({"score": scores}).join(model[["OncotreeLineage"]])
print(df.groupby("OncotreeLineage")["score"].median().sort_values().head(10))
关键区分:共同必需 vs 选择性依赖
这是使用 DepMap 最重要的判断:
| 类型 | 特征 | 作为药物靶点 |
|---|---|---|
| 共同必需(common essential) | 几乎所有细胞系都依赖(核糖体、剪接体、蛋白酶体等) | 差——正常细胞同样依赖,治疗窗口窄 |
| 选择性依赖(selective) | 只有部分细胞系依赖,且与某个基因组特征相关 | 好——天然带生物标志物 |
# 找选择性依赖:依赖性方差大、且只有一部分细胞系强依赖
stats = pd.DataFrame({
"median": dep.median(),
"std": dep.std(),
"n_dependent": (dep < -0.5).sum(),
"frac_dependent": (dep < -0.5).mean(),
})
selective = stats[(stats["frac_dependent"] > 0.02) &
(stats["frac_dependent"] < 0.30) &
(stats["std"] > 0.25)]
print(f"选择性依赖候选:{len(selective)} 个基因")
合成致死与生物标志物发现
把依赖性与基因组特征关联,就能找到「什么样的细胞会依赖这个基因」——这既是合成致死关系,也是天然的患者选择标志物:
from scipy import stats as sps
# 例:携带某突变的细胞系是否更依赖某基因
mut = pd.read_csv("OmicsSomaticMutations.csv")
mutated = set(mut[mut["HugoSymbol"] == "KRAS"]["ModelID"])
target = dep["SHOC2 (8036)"].dropna()
grp_mut = target[target.index.isin(mutated)]
grp_wt = target[~target.index.isin(mutated)]
t, p = sps.ttest_ind(grp_mut, grp_wt, equal_var=False)
print(f"KRAS 突变型依赖性 {grp_mut.mean():.3f} vs 野生型 {grp_wt.mean():.3f}, p={p:.2e}")
经典成功案例包括:MTAP 缺失细胞依赖 PRMT5(已推动多个 PRMT5 抑制剂进入临床)、ARID1A 突变依赖 ARID1B、SMARCA4 缺失依赖 SMARCA2。这类「缺一补一」的合成致死关系,是当前肿瘤靶点发现最有产出的方向之一。
局限
- 细胞系不等于肿瘤:长期传代的细胞系缺少微环境、免疫系统、基质细胞。体外依赖不保证体内有效。
- 敲除不等于抑制:CRISPR 完全敲除蛋白,而小分子通常只抑制酶活性。有支架功能的蛋白,敲除有效但抑制活性位点可能无效——这是从依赖性到可成药靶点的一道重要门槛,也是降解剂(PROTAC)的机会所在。
- 拷贝数效应:高拷贝数区域的基因因多重切割造成 DNA 损伤,会产生假依赖信号。Chronos 等算法已做校正,但仍需留意。
- 细胞系代表性偏差:某些癌种细胞系很少,统计效力不足。
- 短期筛选:通常培养 2~3 周,慢作用的依赖可能检测不到。
上手提示
- 分数 −1 是「共同必需基因的中位效应」,是判断强依赖的基准线;
- 选择性依赖才是好靶点,共同必需基因治疗窗口太窄;
- 把依赖性与基因组特征关联,同时得到靶点与患者选择标志物;
- 敲除有效 ≠ 抑制活性位点有效,支架功能蛋白应考虑降解剂路线。
延伸资源
- 细胞系组学:265《CCLE》;药敏数据:266《GDSC》、267《PRISM Repurposing》;
- 靶点证据:249《Open Targets Platform》;肿瘤基因组:269《cBioPortal》、270《TCGA》。