270

TCGA:癌症多组学数据在靶点发现中的用途

TCGA 提供数十种癌症的大规模多组学与临床数据,是癌症靶点发现与生物标志物研究的基石。这篇讲清数据层级、访问方式与分析中的关键陷阱。

TCGA(The Cancer Genome Atlas)是癌症基因组学的奠基性项目:对 33 种癌症、逾 11,000 例患者样本做了系统的多组学表征,并配有临床随访数据。今天几乎所有癌症相关的计算研究都直接或间接建立在它之上。

数据类型与层级

数据类型 内容
WES / WGS 体细胞突变、胚系变异
RNA-seq 基因表达、融合、可变剪接
miRNA-seq miRNA 表达
SNP array 拷贝数变异
甲基化芯片 DNA 甲基化
RPPA 约 200 个蛋白/磷酸化蛋白
病理图像 全切片扫描图(H&E)
临床数据 分期、治疗、生存随访

访问层级:处理后的汇总数据(表达矩阵、突变列表)是开放访问;原始测序数据(BAM/FASTQ)和胚系变异是受控访问,需通过 dbGaP 申请授权。做常规分析用开放数据即可。

获取方式

# 方式一:GDC 数据门户 / gdc-client(官方,最全)
gdc-client download -m manifest.txt

# 方式二:R 的 TCGAbiolinks(最方便)
# library(TCGAbiolinks)
# query <- GDCquery(project="TCGA-LUAD",
#                   data.category="Transcriptome Profiling",
#                   data.type="Gene Expression Quantification",
#                   workflow.type="STAR - Counts")
# GDCdownload(query); data <- GDCprepare(query)

# 方式三:UCSC Xena(预处理好的矩阵,最快上手)
# https://xenabrowser.net —— 可直接下载 TSV

# 方式四:cBioPortal(交互式探索,见 269)

# 方式五:Recount3 / GDC 的标准化表达数据
import pandas as pd

# 用 Xena 下载的表达矩阵做快速分析
expr = pd.read_csv("TCGA-LUAD.htseq_fpkm.tsv", sep="\t", index_col=0)
pheno = pd.read_csv("TCGA-LUAD.GDC_phenotype.tsv", sep="\t", index_col=0)
surv  = pd.read_csv("TCGA-LUAD.survival.tsv", sep="\t", index_col=0)

# 样本条码的第 4 段区分肿瘤与正常
# 01=原发肿瘤  11=癌旁正常  06=转移
tumor  = [c for c in expr.columns if c.split("-")[3].startswith("01")]
normal = [c for c in expr.columns if c.split("-")[3].startswith("11")]
print(f"肿瘤 {len(tumor)} 例,配对正常 {len(normal)} 例")

分析中的关键陷阱

  • 正常样本极少且是癌旁组织这是最容易出问题的一点。多数癌种只有几十例「正常」样本,且都是癌旁组织——它们受肿瘤微环境影响,已发生场效应(field effect),不等于健康人组织。做差异表达时,用 GTEx 的健康组织作对照往往更合适(但需处理批次效应)。
  • 肿瘤纯度差异巨大:不同样本的肿瘤细胞含量从 20% 到 95% 不等。表达差异可能只反映纯度差异而非生物学差异。分析时应把纯度(ABSOLUTE、ESTIMATE 等估计值)作为协变量。
  • 批次效应:样本采集自多个中心、跨越多年、用过不同平台版本。必须做批次校正(ComBat 等),或至少把批次作为协变量。
  • 生存分析的混杂:单变量的生存差异极易被分期、年龄、治疗方案混杂。必须做多变量 Cox 回归,并检验比例风险假设。
  • 多重检验:两万个基因逐个检验,不做 FDR 校正必然产生大量假阳性。
  • 样本条码解读:TCGA 条码(如 TCGA-05-4384-01A-01R-1206-07)各段有确切含义,混淆会导致把转移灶当原发灶。

在药物研发中的用途

  • 靶点表达验证:靶点在目标癌种中是否高表达?相比正常组织的选择性如何?这直接关系治疗窗口。
  • 患者分层假设:按分子特征分组,哪一组可能从该靶点获益?
  • 生物标志物候选:与预后或某分子特征相关的基因,可作为候选标志物(需独立队列验证)。
  • 免疫微环境分析:用表达数据推断免疫细胞浸润(CIBERSORT 等),支持免疫治疗相关决策。
  • 与细胞系对照:验证所选细胞系模型(见 265《CCLE》)是否代表真实肿瘤的分子特征。

相关资源

  • GTEx:健康组织的表达数据,做正常对照的更好选择;
  • ICGC / PCAWG:国际癌症基因组联盟,含全基因组数据;
  • CPTAC:与 TCGA 样本配套的深度蛋白组学数据;
  • MSK-IMPACT:更大规模的临床测序队列(见 269《cBioPortal》)。

关键要点

  • TCGA 的「正常」是癌旁组织且数量少,健康对照建议用 GTEx;
  • 肿瘤纯度差异巨大,必须作为协变量,否则表达差异可能只是纯度差异;
  • 生存分析必须做多变量 Cox 回归,单变量结论极易被分期混杂;
  • 快速上手用 UCSC Xena 的预处理矩阵,交互探索用 cBioPortal。

延伸资源