TDC Genomics Benchmark Group 覆盖基因组学相关的预测任务,把「基因层面的操作与效应」纳入机器学习框架。它连接的是药物研发的上游——靶点发现与验证阶段,而不是分子设计阶段。理解这一层,才能看懂 AI 在整条研发链上的分工。
主要任务
| 任务 | 预测目标 | 用途 |
|---|---|---|
| CRISPROutcome | CRISPR 编辑后的修复结果分布 | 基因编辑疗法设计 |
| GDSC / CCLE 药敏 | 细胞系对药物的敏感性 | 生物标志物、适应症选择 |
| Gene-Disease 关联 | 基因与疾病的关联强度 | 靶点优先级 |
| Perturb-seq 类任务 | 基因扰动后的转录组响应 | 机制推断 |
CRISPR 结果预测:最具体的一个
CRISPR-Cas9 切断 DNA 后,细胞用非同源末端连接(NHEJ)等机制修复,产生的插入缺失(indel)不是随机的——修复结果高度依赖切割位点周围的序列。能预测这个分布,对基因编辑疗法很关键:
- 设计 sgRNA:选择能产生高比例移码突变(有效敲除)的位点;
- 避免意外结果:某些位点会产生高比例的框内缺失,蛋白仍有部分功能,敲除失败;
- 预测治疗性编辑的精确度:基因治疗中需要精确的修复结果。
from tdc.single_pred import CRISPROutcome
data = CRISPROutcome(name="Leenay")
split = data.get_split()
# 输入:sgRNA 序列 + 切割位点周边序列
# 输出:修复结果的分布(各类 indel 的频率)
print(split["train"].head())
建模要点:这是序列到分布的任务,输出是概率分布而非单个值,损失函数应用 KL 散度或 Earth Mover’s Distance,而非普通的 MSE。微同源序列(microhomology)是关键特征——修复机制会利用切口两侧的短同源序列,这是预测的物理基础。
药敏预测
# 输入:细胞系的多组学特征 + 药物结构
# 输出:IC50 或 AUC(剂量-响应曲线下面积)
# 关键:划分方式决定问题性质
# 随机划分 → 补全已知矩阵(最容易)
# cold cell → 新细胞系,见过的药(预测新患者响应)
# cold drug → 新药,见过的细胞系(预测新药敏感谱)
# cold both → 最难
和 DTI 一样,随机划分的高分主要来自「记住这个细胞系整体对药物敏感还是耐受」。真正有价值的是 cold 划分下的表现。另外要注意:细胞系响应与患者响应之间存在巨大鸿沟,细胞系模型的预测不能直接外推到临床。
在研发链条中的位置
- 靶点发现:基因-疾病关联、依赖性数据(见 264《DepMap》)帮助确定「打哪个靶点」;
- 靶点验证:CRISPR 敲除实验验证靶点必要性,这一步的设计可用 CRISPR 结果预测优化;
- 生物标志物:药敏数据把「哪类患者会响应」与基因组特征关联起来;
- 适应症拓展:已有药物在不同细胞系背景下的响应,提示新的适应症方向。
这些任务的共同特点是离临床决策更近、但因果链更长。分子层面的预测(如 logP)验证起来快,而「这个靶点是否值得做」的判断需要数年才能验证——这也是为什么这个方向的模型评估格外困难。
使用注意
- 批次效应严重:不同实验室、不同平台的组学数据存在系统性差异。合并数据前必须做批次校正,否则模型学到的是实验室特征。
- 细胞系不等于患者:细胞系经过长期传代,与原发肿瘤的生物学已有相当差异。
- 特征维度远大于样本量:几百个细胞系、几万个基因特征,极易过拟合。必须做严格的特征选择与正则化。
- 因果与相关:组学关联绝大多数是相关性。要建立因果性,需要扰动实验(CRISPR 筛选)或遗传学证据(孟德尔随机化)。
上手提示
- 这组任务面向研发上游(靶点发现与验证),不是分子设计;
- CRISPR 结果预测是序列到分布的任务,损失函数要用分布距离;
- 药敏预测同样要看 cold 划分,随机划分的高分靠记忆细胞系;
- 组学数据批次效应严重,且特征维度远大于样本量,极易过拟合。
延伸资源
- 工具箱:173《TDC》;依赖性数据:264《DepMap》、265《CCLE》;
- 药敏数据:266《GDSC》;靶点证据:249《Open Targets Platform》、250《Open Targets Genetics》。