Recursion 走的是与多数 AI 制药公司相反的路线:不从已有数据建模,而是先工业化地生产数据。它建立了大规模自动化的细胞成像平台,系统性地拍摄细胞在各种基因扰动与化合物处理下的形态变化,积累了规模极大的自有图像数据集。
表型筛选的逻辑
| 路线 | 起点 | 特点 |
|---|---|---|
| 靶点导向 | 先确定靶点,再找作用于它的分子 | 机制清楚,但依赖靶点假设正确 |
| 表型导向 | 先找能产生期望细胞表型的分子,再反推机制 | 不需要预设靶点,但机制未知 |
表型筛选的最大价值是绕开了「靶点假设可能是错的」这个新药研发最大的风险源。历史上很多重要药物就是先发现有效、后才搞清机制的。缺点是拿到活性分子后,机制去卷积(搞清它作用于什么)是一项艰巨的工作。
用图像做「细胞表型指纹」
- 用多种荧光染料标记细胞的不同结构(细胞核、线粒体、内质网、肌动蛋白等);
- 自动显微镜拍摄大量细胞图像;
- 用深度学习把每张图像编码成一个高维向量——这就是该扰动的「表型指纹」;
- 比较指纹相似性:如果化合物 A 的表型指纹与基因 B 敲除的指纹高度相似,提示 A 可能作用于 B 通路。
这个「用表型相似性推断机制」的思路,与 LINCS L1000 的转录组连通性分析(见 268《LINCS L1000》)同源,只是模态从转录组换成了图像。图像的优势是成本低、通量高、且能捕捉转录组看不到的形态与定位变化。
固有难题
- 批次效应极其严重。这是这条路线最大的技术挑战。不同实验批次、不同孔板位置、不同日期的图像存在系统性差异,模型很容易学到「这是哪个批次」而非「这是什么生物学效应」。需要严格的实验设计(随机化布板、每板带对照)与计算校正。
- 表型相似不等于机制相同:完全不同的机制可能产生相似的细胞形态(如多种途径都导致细胞周期阻滞)。
- 细胞模型的相关性:体外细胞系的表型与体内疾病过程的关系需要论证。
- 机制去卷积仍然困难:即使有表型指纹的线索,确证靶点仍需大量实验(化学蛋白组学、CRISPR 筛选、共结晶)。
- 数据规模不自动等于价值:「我们有几十 PB 数据」本身不是竞争力,能否从中提取出可转化为药物的洞察才是。
可借鉴的方法论
- 自建数据是最深的护城河:公开数据人人可得,自产的、标准化的、包含失败案例的数据才是差异化来源。
- 标准化比规模更重要:一百万张条件不一致的图像,价值可能不如十万张严格标准化的。实验设计的严谨性决定数据的可用性。
- 把对照设计进流程:每块板都带已知机制的阳性对照,用于批次校正与质控。
- 表型与靶点路线互补:表型筛选找到活性分子,靶点方法做优化,两者结合比单用任一种更实际。
开源资源
# 细胞图像分析的开源生态
# CellProfiler —— 经典的图像特征提取(形态、强度、纹理)
# DeepProfiler —— 深度学习特征提取
# pycytominer —— 特征处理、归一化、批次校正
# JUMP-Cell Painting —— 大规模公开的细胞成像数据集,
# 可用于练习表型分析方法
# 批次校正的常用方法
# - 按板归一化(相对同板 DMSO 对照)
# - Combat / Harmony 等批次校正算法
# - 用已知对照评估校正效果
提示
公司业务、管线与合作变动很快(该公司近年有重大合并动作),本文为方向性观察,具体信息请以官方披露为准。表型组学路线的关键挑战是批次效应与机制去卷积,数据规模本身不等于价值。
延伸资源
- 转录组扰动对照:268《LINCS L1000》;细胞系数据:265《CCLE》、266《GDSC》;
- 其他公司:311《Exscientia》、321《Insitro》。