预测降解剂的 DC50 和 Dmax,是靶向蛋白降解领域最受关注也最困难的计算问题。相比小分子活性预测已相当成熟,降解活性预测目前仍处于早期阶段,有必要说清楚难在哪、能做到什么程度。
四个根本难点
| 难点 | 说明 |
|---|---|
| 依赖三元复合物 | 不是简单的分子-蛋白结合,涉及蛋白-蛋白界面与协同性 |
| 公开数据稀缺 | 降解数据总量远少于常规活性数据,且集中在少数靶点 |
| 数据口径不一 | 不同细胞系、不同时间点、不同检测方法的 DC50 不可直接比较 |
| 非单调关系 | Hook 效应导致钟形剂量曲线,破坏常规回归假设 |
数据问题:最根本的约束
- 规模小:公开的 PROTAC 降解数据(如 PROTAC-DB)总量在数千条量级,而 ChEMBL 有两千万条活性记录。数据量差三到四个数量级。
- 靶点集中:大量数据集中在 BRD4、AR、ER、BTK 等少数靶点上,跨靶点泛化几乎无从验证。
- 细胞系依赖:同一个降解剂在不同细胞系中的 DC50 可能相差数倍——E3 表达水平、蛋白酶体活性、药物摄取都不同。合并不同细胞系的数据会引入巨大噪声。
- 时间点不统一:4 小时和 24 小时测得的 DC50 不同,很多文献不明确报告。
- 检测方法差异:Western blot、HiBiT、质谱定量的灵敏度与线性范围不同。
- 阴性数据缺失:不起作用的降解剂很少被发表,模型见不到失败案例。
现有的建模做法
# 做法一:把降解剂当普通分子,用常规 QSAR
# 特征:整个 PROTAC 分子的指纹/描述符
# 局限:完全忽略三元复合物机制,只在同一靶点+同一E3 的
# 系列内有一定排序能力,跨系列基本无效
# 做法二:分块特征
# 把 PROTAC 拆成「靶蛋白配体 + 连接子 + E3 配体」三部分
# 分别特征化后拼接
from rdkit import Chem
from rdkit.Chem import rdFingerprintGenerator, DataStructs, Descriptors
import numpy as np
gen = rdFingerprintGenerator.GetMorganGenerator(radius=2, fpSize=1024)
def protac_features(warhead_smi, linker_smi, e3_smi):
feats = []
for smi in [warhead_smi, linker_smi, e3_smi]:
m = Chem.MolFromSmiles(smi)
arr = np.zeros(1024, dtype=np.uint8)
if m is not None:
DataStructs.ConvertToNumpyArray(gen.GetFingerprint(m), arr)
feats.append(arr)
# 连接子的额外几何特征 —— 这部分往往最有信息量
lm = Chem.MolFromSmiles(linker_smi)
geo = [
lm.GetNumHeavyAtoms() if lm else 0,
Descriptors.NumRotatableBonds(lm) if lm else 0,
Descriptors.MolWt(lm) if lm else 0,
Descriptors.TPSA(lm) if lm else 0,
]
return np.concatenate(feats + [np.array(geo)])
# 做法三:加入三元复合物的结构特征
# 若能建模三元复合物,可提取界面特征(BSA、接触残基、赖氨酸距离)
# 数据量太小时容易过拟合
# 做法四:分类而非回归
# 「有效降解 vs 无效」比预测精确的 DC50 现实得多
合理的目标设定
| 目标 | 可行性 |
|---|---|
| 同一靶点+E3 内,对连接子变体排序 | 有一定可行性 |
| 预测「能否降解」的二分类 | 有一定可行性 |
| 预测精确 DC50 数值 | 目前不现实 |
| 跨靶点泛化 | 目前不现实 |
| 从零预测新靶点的降解剂 | 目前不现实 |
务实的定位是「在一个项目内部,用模型对下一批连接子变体排优先级」,而不是「预测某个降解剂的活性」。
更有价值的辅助方向
与其硬做活性预测,这些方向的计算辅助更实在:
- 连接子几何筛选:用构象采样排除长度明显不合适的连接子(见 354《Linker Design 实战》、360《PROTAC Linker 设计》)。这不需要活性数据,纯几何计算。
- 三元复合物建模:即使不能定量预测活性,能给出可能的复合物结构就有助于理解 SAR。
- 性质预测:PROTAC 的通透性、溶解度、代谢稳定性预测(见 362《降解剂成药性》)——这些是常规 ADMET 问题,方法相对成熟,且对项目推进同样关键。
- 赖氨酸可及性分析:从结构判断靶蛋白是否有合适的泛素化位点。
- E3 选择建议:基于蛋白表面性质预测哪个 E3 更可能形成有利界面。
评估模型时的纪律
# 降解活性预测的评估必须格外严格
# 1) 划分必须按「连接子系列」而非随机
# 同一系列的连接子变体高度相似,随机划分严重泄漏
# 2) 必须报告数据来源的一致性
# 是否同一细胞系?同一时间点?同一检测方法?
# 3) 必须与朴素基线对比
# 基线:只用连接子长度预测
# 如果模型赢不过「连接子长度」这个单一特征,说明没学到东西
# 4) 小数据集必须多种子 + 报告置信区间
# 几百条数据上,不同划分的结果波动会很大
# 5) 诚实报告适用域
# 模型只在训练涉及的靶点/E3 组合上有效
关键要点
- 降解活性预测的数据量比常规活性数据少三到四个数量级,这是根本约束;
- 合理目标是「项目内部对连接子变体排序」,不是预测精确 DC50;
- 连接子几何筛选与 PROTAC 的 ADMET 预测,是更实在的计算辅助方向;
- 评估时必须按连接子系列划分,并与「只用连接子长度」的基线对比。