265

CCLE:癌细胞系组学数据资源

CCLE 提供数百癌细胞系的多组学数据,是解释依赖性、药敏与建立细胞系模型的基础。这篇讲清数据类型、与 DepMap 的关系和分析要点。

CCLE(Cancer Cell Line Encyclopedia,Broad 与 Novartis)对上千个癌细胞系做了系统的多组学表征。它本身不做扰动实验,而是提供「这些细胞系是什么样的」这一基础信息——正是有了 CCLE 的分子特征,DepMap 的依赖性数据才能被解释成「什么样的细胞依赖什么基因」。

数据类型

数据 覆盖 主要用途
RNA-seq 表达 约 1,400 细胞系 亚型分类、标志物、通路活性
全外显子 / 全基因组测序 约 1,700 突变、拷贝数
拷贝数变异 约 1,700 扩增缺失分析
DNA 甲基化 约 900 表观调控
蛋白组(RPPA / MS) 数百 蛋白水平验证
代谢组 约 900 代谢重编程
miRNA 约 950 调控网络
融合基因 约 1,000 驱动融合识别

代谢组数据是比较独特的一块:公开的大规模细胞系代谢组不多,做代谢靶点研究时价值明显。

与 DepMap 的关系

现在 CCLE 数据已整合进 DepMap 门户统一发布,两者共用细胞系标识(ACH-XXXXXX)。典型的分析范式是把两者对齐

import pandas as pd

expr  = pd.read_csv("OmicsExpressionProteinCodingGenesTPMLogp1.csv", index_col=0)
dep   = pd.read_csv("CRISPRGeneEffect.csv", index_col=0)
model = pd.read_csv("Model.csv", index_col=0)

common = expr.index.intersection(dep.index)
expr, dep = expr.loc[common], dep.loc[common]
print(f"{len(common)} 个细胞系同时有表达与依赖性数据")

# 经典分析:表达量与自身依赖性的相关(癌基因成瘾特征)
import numpy as np
gene_e, gene_d = "ERBB2 (2064)", "ERBB2 (2064)"
mask = expr[gene_e].notna() & dep[gene_d].notna()
r = np.corrcoef(expr.loc[mask, gene_e], dep.loc[mask, gene_d])[0, 1]
print(f"ERBB2 表达 vs 依赖性 相关系数 = {r:.3f}")   # 负相关 = 高表达则强依赖

「表达越高、依赖越强」的负相关是癌基因成瘾(oncogene addiction)的典型特征——HER2 扩增的乳腺癌依赖 HER2,正是曲妥珠单抗有效的基础。用这个模式扫全基因组,可以系统地寻找类似的靶点机会。

分析要点

  • 表达值的处理:官方提供 log2(TPM+1)。做相关分析前应过滤低表达基因(如在多数细胞系中 TPM < 1),否则噪声主导。
  • 突变要区分类型:错义、无义、移码、剪接位点的功能后果不同。做关联分析时应区分「功能丧失」与「可能中性」的突变,而不是简单地二分为「突变/野生型」。
  • 拷贝数与表达的耦合:拷贝数扩增通常伴随表达升高,两者高度相关。同时放进模型会有共线性问题。
  • 谱系是最强的混杂因素不同癌种的细胞系在几乎所有分子特征上都有系统差异。做关联分析必须控制谱系(作为协变量,或在谱系内分析),否则很容易把「这是血液肿瘤特征」误认为「这是某基因的效应」。
  • 细胞系身份问题:历史上存在细胞系交叉污染与错误标识。用 STR 图谱核实关键细胞系的身份。

典型用途

  • 解释依赖性:找出「什么分子特征预测对某基因的依赖」,这直接给出患者选择标志物。
  • 选择实验模型:做体外验证时,根据分子特征挑选合适的细胞系——既要有携带目标特征的,也要有阴性对照。
  • 验证靶点表达:确认靶点在目标癌种细胞系中确实表达。
  • 训练预测模型:用组学特征预测药物响应(见 266《GDSC》)。
  • 与患者数据对照:把细胞系特征与 TCGA(见 270《TCGA》)对比,评估细胞系对真实肿瘤的代表性。

局限

  • 培养适应:细胞系经长期传代,已选择出适合培养的表型,与原发肿瘤有系统差异。
  • 缺少微环境:无基质、免疫、血管成分,涉及这些机制的靶点无法研究。
  • 癌种覆盖不均:常见癌种细胞系多,罕见癌种很少。
  • 二维培养:与体内三维环境差异大,类器官等模型正在补充这一点。

上手提示

  • 它提供「细胞系是什么样的」,与 DepMap 的「依赖什么」配合才有解释力;
  • 「高表达 → 强依赖」的负相关是癌基因成瘾的典型信号;
  • 关联分析必须控制谱系,它是最强的混杂因素;
  • 突变要按功能后果分类,别简单二分为突变/野生型。

延伸资源