CCLE(Cancer Cell Line Encyclopedia,Broad 与 Novartis)对上千个癌细胞系做了系统的多组学表征。它本身不做扰动实验,而是提供「这些细胞系是什么样的」这一基础信息——正是有了 CCLE 的分子特征,DepMap 的依赖性数据才能被解释成「什么样的细胞依赖什么基因」。
数据类型
| 数据 | 覆盖 | 主要用途 |
|---|---|---|
| RNA-seq 表达 | 约 1,400 细胞系 | 亚型分类、标志物、通路活性 |
| 全外显子 / 全基因组测序 | 约 1,700 | 突变、拷贝数 |
| 拷贝数变异 | 约 1,700 | 扩增缺失分析 |
| DNA 甲基化 | 约 900 | 表观调控 |
| 蛋白组(RPPA / MS) | 数百 | 蛋白水平验证 |
| 代谢组 | 约 900 | 代谢重编程 |
| miRNA | 约 950 | 调控网络 |
| 融合基因 | 约 1,000 | 驱动融合识别 |
代谢组数据是比较独特的一块:公开的大规模细胞系代谢组不多,做代谢靶点研究时价值明显。
与 DepMap 的关系
现在 CCLE 数据已整合进 DepMap 门户统一发布,两者共用细胞系标识(ACH-XXXXXX)。典型的分析范式是把两者对齐:
import pandas as pd
expr = pd.read_csv("OmicsExpressionProteinCodingGenesTPMLogp1.csv", index_col=0)
dep = pd.read_csv("CRISPRGeneEffect.csv", index_col=0)
model = pd.read_csv("Model.csv", index_col=0)
common = expr.index.intersection(dep.index)
expr, dep = expr.loc[common], dep.loc[common]
print(f"{len(common)} 个细胞系同时有表达与依赖性数据")
# 经典分析:表达量与自身依赖性的相关(癌基因成瘾特征)
import numpy as np
gene_e, gene_d = "ERBB2 (2064)", "ERBB2 (2064)"
mask = expr[gene_e].notna() & dep[gene_d].notna()
r = np.corrcoef(expr.loc[mask, gene_e], dep.loc[mask, gene_d])[0, 1]
print(f"ERBB2 表达 vs 依赖性 相关系数 = {r:.3f}") # 负相关 = 高表达则强依赖
「表达越高、依赖越强」的负相关是癌基因成瘾(oncogene addiction)的典型特征——HER2 扩增的乳腺癌依赖 HER2,正是曲妥珠单抗有效的基础。用这个模式扫全基因组,可以系统地寻找类似的靶点机会。
分析要点
- 表达值的处理:官方提供 log2(TPM+1)。做相关分析前应过滤低表达基因(如在多数细胞系中 TPM < 1),否则噪声主导。
- 突变要区分类型:错义、无义、移码、剪接位点的功能后果不同。做关联分析时应区分「功能丧失」与「可能中性」的突变,而不是简单地二分为「突变/野生型」。
- 拷贝数与表达的耦合:拷贝数扩增通常伴随表达升高,两者高度相关。同时放进模型会有共线性问题。
- 谱系是最强的混杂因素:不同癌种的细胞系在几乎所有分子特征上都有系统差异。做关联分析必须控制谱系(作为协变量,或在谱系内分析),否则很容易把「这是血液肿瘤特征」误认为「这是某基因的效应」。
- 细胞系身份问题:历史上存在细胞系交叉污染与错误标识。用 STR 图谱核实关键细胞系的身份。
典型用途
- 解释依赖性:找出「什么分子特征预测对某基因的依赖」,这直接给出患者选择标志物。
- 选择实验模型:做体外验证时,根据分子特征挑选合适的细胞系——既要有携带目标特征的,也要有阴性对照。
- 验证靶点表达:确认靶点在目标癌种细胞系中确实表达。
- 训练预测模型:用组学特征预测药物响应(见 266《GDSC》)。
- 与患者数据对照:把细胞系特征与 TCGA(见 270《TCGA》)对比,评估细胞系对真实肿瘤的代表性。
局限
- 培养适应:细胞系经长期传代,已选择出适合培养的表型,与原发肿瘤有系统差异。
- 缺少微环境:无基质、免疫、血管成分,涉及这些机制的靶点无法研究。
- 癌种覆盖不均:常见癌种细胞系多,罕见癌种很少。
- 二维培养:与体内三维环境差异大,类器官等模型正在补充这一点。
上手提示
- 它提供「细胞系是什么样的」,与 DepMap 的「依赖什么」配合才有解释力;
- 「高表达 → 强依赖」的负相关是癌基因成瘾的典型信号;
- 关联分析必须控制谱系,它是最强的混杂因素;
- 突变要按功能后果分类,别简单二分为突变/野生型。
延伸资源
- 依赖性数据:264《DepMap》;药敏:266《GDSC》、267《PRISM Repurposing》;
- 患者肿瘤数据:269《cBioPortal》、270《TCGA》。