TCGA(The Cancer Genome Atlas)是癌症基因组学的奠基性项目:对 33 种癌症、逾 11,000 例患者样本做了系统的多组学表征,并配有临床随访数据。今天几乎所有癌症相关的计算研究都直接或间接建立在它之上。
数据类型与层级
| 数据类型 | 内容 |
|---|---|
| WES / WGS | 体细胞突变、胚系变异 |
| RNA-seq | 基因表达、融合、可变剪接 |
| miRNA-seq | miRNA 表达 |
| SNP array | 拷贝数变异 |
| 甲基化芯片 | DNA 甲基化 |
| RPPA | 约 200 个蛋白/磷酸化蛋白 |
| 病理图像 | 全切片扫描图(H&E) |
| 临床数据 | 分期、治疗、生存随访 |
访问层级:处理后的汇总数据(表达矩阵、突变列表)是开放访问;原始测序数据(BAM/FASTQ)和胚系变异是受控访问,需通过 dbGaP 申请授权。做常规分析用开放数据即可。
获取方式
# 方式一:GDC 数据门户 / gdc-client(官方,最全)
gdc-client download -m manifest.txt
# 方式二:R 的 TCGAbiolinks(最方便)
# library(TCGAbiolinks)
# query <- GDCquery(project="TCGA-LUAD",
# data.category="Transcriptome Profiling",
# data.type="Gene Expression Quantification",
# workflow.type="STAR - Counts")
# GDCdownload(query); data <- GDCprepare(query)
# 方式三:UCSC Xena(预处理好的矩阵,最快上手)
# https://xenabrowser.net —— 可直接下载 TSV
# 方式四:cBioPortal(交互式探索,见 269)
# 方式五:Recount3 / GDC 的标准化表达数据
import pandas as pd
# 用 Xena 下载的表达矩阵做快速分析
expr = pd.read_csv("TCGA-LUAD.htseq_fpkm.tsv", sep="\t", index_col=0)
pheno = pd.read_csv("TCGA-LUAD.GDC_phenotype.tsv", sep="\t", index_col=0)
surv = pd.read_csv("TCGA-LUAD.survival.tsv", sep="\t", index_col=0)
# 样本条码的第 4 段区分肿瘤与正常
# 01=原发肿瘤 11=癌旁正常 06=转移
tumor = [c for c in expr.columns if c.split("-")[3].startswith("01")]
normal = [c for c in expr.columns if c.split("-")[3].startswith("11")]
print(f"肿瘤 {len(tumor)} 例,配对正常 {len(normal)} 例")
分析中的关键陷阱
- 正常样本极少且是癌旁组织。这是最容易出问题的一点。多数癌种只有几十例「正常」样本,且都是癌旁组织——它们受肿瘤微环境影响,已发生场效应(field effect),不等于健康人组织。做差异表达时,用 GTEx 的健康组织作对照往往更合适(但需处理批次效应)。
- 肿瘤纯度差异巨大:不同样本的肿瘤细胞含量从 20% 到 95% 不等。表达差异可能只反映纯度差异而非生物学差异。分析时应把纯度(ABSOLUTE、ESTIMATE 等估计值)作为协变量。
- 批次效应:样本采集自多个中心、跨越多年、用过不同平台版本。必须做批次校正(ComBat 等),或至少把批次作为协变量。
- 生存分析的混杂:单变量的生存差异极易被分期、年龄、治疗方案混杂。必须做多变量 Cox 回归,并检验比例风险假设。
- 多重检验:两万个基因逐个检验,不做 FDR 校正必然产生大量假阳性。
- 样本条码解读:TCGA 条码(如
TCGA-05-4384-01A-01R-1206-07)各段有确切含义,混淆会导致把转移灶当原发灶。
在药物研发中的用途
- 靶点表达验证:靶点在目标癌种中是否高表达?相比正常组织的选择性如何?这直接关系治疗窗口。
- 患者分层假设:按分子特征分组,哪一组可能从该靶点获益?
- 生物标志物候选:与预后或某分子特征相关的基因,可作为候选标志物(需独立队列验证)。
- 免疫微环境分析:用表达数据推断免疫细胞浸润(CIBERSORT 等),支持免疫治疗相关决策。
- 与细胞系对照:验证所选细胞系模型(见 265《CCLE》)是否代表真实肿瘤的分子特征。
相关资源
- GTEx:健康组织的表达数据,做正常对照的更好选择;
- ICGC / PCAWG:国际癌症基因组联盟,含全基因组数据;
- CPTAC:与 TCGA 样本配套的深度蛋白组学数据;
- MSK-IMPACT:更大规模的临床测序队列(见 269《cBioPortal》)。
关键要点
- TCGA 的「正常」是癌旁组织且数量少,健康对照建议用 GTEx;
- 肿瘤纯度差异巨大,必须作为协变量,否则表达差异可能只是纯度差异;
- 生存分析必须做多变量 Cox 回归,单变量结论极易被分期混杂;
- 快速上手用 UCSC Xena 的预处理矩阵,交互探索用 cBioPortal。
延伸资源
- 交互查询:269《cBioPortal》;细胞系数据:265《CCLE》、264《DepMap》;
- 靶点证据:249《Open Targets Platform》、250《Open Targets Genetics》。