268

LINCS L1000:转录组扰动数据如何用于药物发现

LINCS L1000 用低成本测一千个标志基因,构建海量扰动转录组特征,用于连通性与机制分析。这篇讲清 L1000 技术、连通性分析与数据质量判断。

LINCS L1000(Broad Institute)通过一个关键的成本优化,把转录组扰动实验做到了百万级规模:只测量 978 个精心挑选的「标志基因」(landmark genes),再用计算方法推断其余约 12,000 个基因的表达。这让大规模系统性扰动实验第一次在成本上可行。

L1000 技术

  • 978 个标志基因:通过对大量表达数据做主成分分析选出,这些基因足以捕捉转录组的主要变异方向。
  • 推断其余基因:用线性模型从标志基因推断「best inferred」基因。推断值的可靠性低于直接测量值,分析时应优先使用标志基因。
  • Luminex 微珠检测:每个微珠颜色对应两个基因,通过荧光强度区分,进一步降低成本。
  • 规模:逾 100 万个特征,覆盖数万种化合物扰动、数千个基因敲低/过表达,覆盖数十个细胞系。

数据层级

层级 内容 用途
Level 2 原始基因表达值 底层分析
Level 3 归一化后的表达(q2norm) 常规分析起点
Level 4 z 分数(相对同板对照) 单个重复的差异表达
Level 5 重复间合并的一致性特征 多数分析应从这里开始

连通性分析:核心用法

连通性图谱(Connectivity Map, CMap)的思想很简洁但很有力:如果化合物 A 的转录组特征与化合物 B 高度相似,它们很可能有相似的作用机制。反过来,如果化合物的特征与疾病特征相反,它可能有治疗作用

import pandas as pd
import numpy as np
from scipy import stats

# 简化的连通性打分思路(实际 CMap 用 weighted KS 统计量)
def connectivity_score(query_up, query_down, signature):
    """query_up/down: 疾病或扰动的上/下调基因集
       signature: 某化合物的表达变化(Series,index=基因)"""
    ranks = signature.rank(ascending=False)
    n = len(ranks)
    ks_up   = stats.kstest(ranks[ranks.index.isin(query_up)] / n, "uniform").statistic
    ks_down = stats.kstest(ranks[ranks.index.isin(query_down)] / n, "uniform").statistic
    return ks_up - ks_down      # 正=相似,负=相反(潜在治疗方向)

# 实际使用推荐官方的 CLUE 平台或 cmapPy 工具包
# https://clue.io —— 提供在线查询与标准化的打分

三个实际用途

  • 靶点去卷积:表型筛选得到一个活性化合物但不知道靶点。测它的转录组特征,与 LINCS 中已知机制的化合物或基因敲低特征比对,找出最相似的——如果与某个基因敲低的特征高度相似,提示该化合物可能作用于该基因产物
  • 药物重定位:拿疾病的转录组特征(患者组织 vs 正常),找出特征相反的化合物,作为潜在治疗候选。
  • 脱靶效应发现:化合物特征中意外出现的模式,可能提示未预期的活性。

数据质量判断

这是使用 LINCS 最需要注意的部分:

  • 看重复一致性:Level 5 数据附带 distil_cc_q75(重复间相关性)等指标。一致性低的特征基本是噪声,应过滤掉。
  • 看特征强度:很多化合物在测试浓度下几乎没有转录组效应,其「特征」只是噪声。用 ss_ngene(显著变化基因数)等指标过滤。
  • 细胞系依赖性强:同一化合物在不同细胞系中的特征可能差别很大。跨细胞系比较要谨慎,最好在同一细胞系内比较。
  • 浓度与时间:通常测 6h 和 24h、多个浓度。选错时间点会完全改变结论——直接靶点效应在早期,下游适应性反应在晚期。
  • 推断基因要打折:非标志基因是推断值,做关键结论时应回到 978 个标志基因。

局限

  • 转录组不等于功能:许多药物(尤其是酶抑制剂)的直接效应不体现在转录水平上,L1000 可能完全看不到。
  • 细胞系为主:主要在癌细胞系中测定,与正常组织和体内环境差异大。
  • 浓度往往偏高:为保证有信号,测试浓度可能高于临床可达水平。
  • 连通性是假设生成:相似的转录组特征不等于相同的机制,必须实验验证。

上手提示

  • 从 Level 5 数据起步,并用重复一致性与信号强度指标过滤噪声特征;
  • 关键结论回到 978 个直接测量的标志基因,推断基因要打折;
  • 靶点去卷积是它最有价值的用法——与基因敲低特征比对;
  • 许多药物的作用不体现在转录水平,看不到信号不代表没有活性。

延伸资源