LINCS L1000(Broad Institute)通过一个关键的成本优化,把转录组扰动实验做到了百万级规模:只测量 978 个精心挑选的「标志基因」(landmark genes),再用计算方法推断其余约 12,000 个基因的表达。这让大规模系统性扰动实验第一次在成本上可行。
L1000 技术
- 978 个标志基因:通过对大量表达数据做主成分分析选出,这些基因足以捕捉转录组的主要变异方向。
- 推断其余基因:用线性模型从标志基因推断「best inferred」基因。推断值的可靠性低于直接测量值,分析时应优先使用标志基因。
- Luminex 微珠检测:每个微珠颜色对应两个基因,通过荧光强度区分,进一步降低成本。
- 规模:逾 100 万个特征,覆盖数万种化合物扰动、数千个基因敲低/过表达,覆盖数十个细胞系。
数据层级
| 层级 | 内容 | 用途 |
|---|---|---|
| Level 2 | 原始基因表达值 | 底层分析 |
| Level 3 | 归一化后的表达(q2norm) | 常规分析起点 |
| Level 4 | z 分数(相对同板对照) | 单个重复的差异表达 |
| Level 5 | 重复间合并的一致性特征 | 多数分析应从这里开始 |
连通性分析:核心用法
连通性图谱(Connectivity Map, CMap)的思想很简洁但很有力:如果化合物 A 的转录组特征与化合物 B 高度相似,它们很可能有相似的作用机制。反过来,如果化合物的特征与疾病特征相反,它可能有治疗作用。
import pandas as pd
import numpy as np
from scipy import stats
# 简化的连通性打分思路(实际 CMap 用 weighted KS 统计量)
def connectivity_score(query_up, query_down, signature):
"""query_up/down: 疾病或扰动的上/下调基因集
signature: 某化合物的表达变化(Series,index=基因)"""
ranks = signature.rank(ascending=False)
n = len(ranks)
ks_up = stats.kstest(ranks[ranks.index.isin(query_up)] / n, "uniform").statistic
ks_down = stats.kstest(ranks[ranks.index.isin(query_down)] / n, "uniform").statistic
return ks_up - ks_down # 正=相似,负=相反(潜在治疗方向)
# 实际使用推荐官方的 CLUE 平台或 cmapPy 工具包
# https://clue.io —— 提供在线查询与标准化的打分
三个实际用途
- 靶点去卷积:表型筛选得到一个活性化合物但不知道靶点。测它的转录组特征,与 LINCS 中已知机制的化合物或基因敲低特征比对,找出最相似的——如果与某个基因敲低的特征高度相似,提示该化合物可能作用于该基因产物。
- 药物重定位:拿疾病的转录组特征(患者组织 vs 正常),找出特征相反的化合物,作为潜在治疗候选。
- 脱靶效应发现:化合物特征中意外出现的模式,可能提示未预期的活性。
数据质量判断
这是使用 LINCS 最需要注意的部分:
- 看重复一致性:Level 5 数据附带
distil_cc_q75(重复间相关性)等指标。一致性低的特征基本是噪声,应过滤掉。 - 看特征强度:很多化合物在测试浓度下几乎没有转录组效应,其「特征」只是噪声。用
ss_ngene(显著变化基因数)等指标过滤。 - 细胞系依赖性强:同一化合物在不同细胞系中的特征可能差别很大。跨细胞系比较要谨慎,最好在同一细胞系内比较。
- 浓度与时间:通常测 6h 和 24h、多个浓度。选错时间点会完全改变结论——直接靶点效应在早期,下游适应性反应在晚期。
- 推断基因要打折:非标志基因是推断值,做关键结论时应回到 978 个标志基因。
局限
- 转录组不等于功能:许多药物(尤其是酶抑制剂)的直接效应不体现在转录水平上,L1000 可能完全看不到。
- 细胞系为主:主要在癌细胞系中测定,与正常组织和体内环境差异大。
- 浓度往往偏高:为保证有信号,测试浓度可能高于临床可达水平。
- 连通性是假设生成:相似的转录组特征不等于相同的机制,必须实验验证。
上手提示
- 从 Level 5 数据起步,并用重复一致性与信号强度指标过滤噪声特征;
- 关键结论回到 978 个直接测量的标志基因,推断基因要打折;
- 靶点去卷积是它最有价值的用法——与基因敲低特征比对;
- 许多药物的作用不体现在转录水平,看不到信号不代表没有活性。
延伸资源
- 基因集分析:263《MSigDB》;大规模药敏:267《PRISM Repurposing》、266《GDSC》;
- 依赖性数据:264《DepMap》;重定位建模:178《DeepPurpose》。