310

Recursion:工业化表型组学与 AI 药物发现

Recursion 用工业化的细胞成像筛选构建表型数据,是「先造数据再建模」路线的代表。这篇讲清表型组学的逻辑、优势与固有难题。

Recursion 走的是与多数 AI 制药公司相反的路线:不从已有数据建模,而是先工业化地生产数据。它建立了大规模自动化的细胞成像平台,系统性地拍摄细胞在各种基因扰动与化合物处理下的形态变化,积累了规模极大的自有图像数据集。

表型筛选的逻辑

路线 起点 特点
靶点导向 先确定靶点,再找作用于它的分子 机制清楚,但依赖靶点假设正确
表型导向 先找能产生期望细胞表型的分子,再反推机制 不需要预设靶点,但机制未知

表型筛选的最大价值是绕开了「靶点假设可能是错的」这个新药研发最大的风险源。历史上很多重要药物就是先发现有效、后才搞清机制的。缺点是拿到活性分子后,机制去卷积(搞清它作用于什么)是一项艰巨的工作

用图像做「细胞表型指纹」

  • 用多种荧光染料标记细胞的不同结构(细胞核、线粒体、内质网、肌动蛋白等);
  • 自动显微镜拍摄大量细胞图像;
  • 用深度学习把每张图像编码成一个高维向量——这就是该扰动的「表型指纹」
  • 比较指纹相似性:如果化合物 A 的表型指纹与基因 B 敲除的指纹高度相似,提示 A 可能作用于 B 通路

这个「用表型相似性推断机制」的思路,与 LINCS L1000 的转录组连通性分析(见 268《LINCS L1000》)同源,只是模态从转录组换成了图像。图像的优势是成本低、通量高、且能捕捉转录组看不到的形态与定位变化。

固有难题

  • 批次效应极其严重这是这条路线最大的技术挑战。不同实验批次、不同孔板位置、不同日期的图像存在系统性差异,模型很容易学到「这是哪个批次」而非「这是什么生物学效应」。需要严格的实验设计(随机化布板、每板带对照)与计算校正。
  • 表型相似不等于机制相同:完全不同的机制可能产生相似的细胞形态(如多种途径都导致细胞周期阻滞)。
  • 细胞模型的相关性:体外细胞系的表型与体内疾病过程的关系需要论证。
  • 机制去卷积仍然困难:即使有表型指纹的线索,确证靶点仍需大量实验(化学蛋白组学、CRISPR 筛选、共结晶)。
  • 数据规模不自动等于价值「我们有几十 PB 数据」本身不是竞争力,能否从中提取出可转化为药物的洞察才是。

可借鉴的方法论

  • 自建数据是最深的护城河:公开数据人人可得,自产的、标准化的、包含失败案例的数据才是差异化来源。
  • 标准化比规模更重要:一百万张条件不一致的图像,价值可能不如十万张严格标准化的。实验设计的严谨性决定数据的可用性。
  • 把对照设计进流程:每块板都带已知机制的阳性对照,用于批次校正与质控。
  • 表型与靶点路线互补:表型筛选找到活性分子,靶点方法做优化,两者结合比单用任一种更实际。

开源资源

# 细胞图像分析的开源生态
#   CellProfiler —— 经典的图像特征提取(形态、强度、纹理)
#   DeepProfiler —— 深度学习特征提取
#   pycytominer  —— 特征处理、归一化、批次校正
#   JUMP-Cell Painting —— 大规模公开的细胞成像数据集,
#                          可用于练习表型分析方法

# 批次校正的常用方法
#   - 按板归一化(相对同板 DMSO 对照)
#   - Combat / Harmony 等批次校正算法
#   - 用已知对照评估校正效果

提示

公司业务、管线与合作变动很快(该公司近年有重大合并动作),本文为方向性观察,具体信息请以官方披露为准。表型组学路线的关键挑战是批次效应与机制去卷积,数据规模本身不等于价值。

延伸资源