282

Optibrium StarDrop:ADMET 与多参数优化平台

Optibrium StarDrop 专注 ADMET 预测与多参数优化,把成药性权衡工程化。这篇讲清概率化 MPO 的思路与它对决策方式的影响。

StarDrop 是 Optibrium 的药物设计平台,核心特色是多参数优化(MPO)与不确定性的处理。它针对的是先导优化中最本质的困难:活性、选择性、溶解度、通透性、代谢稳定性、安全性等目标互相冲突,怎么在不确定的预测值上做取舍?

问题的本质

传统做法是设一组硬阈值:MW < 500、logP < 5、溶解度 > 50 μM、hERG IC50 > 10 μM……然后筛出全部满足的分子。这个做法有两个根本缺陷:

  • 阈值附近的悬崖:logP = 5.01 被淘汰、5.00 被保留,而预测误差远大于 0.01。这种硬切分毫无道理。
  • 忽略预测不确定性:预测 logP = 4.5 ± 0.3 和 4.5 ± 1.5 的分子被同等对待,而后者的风险高得多。

概率化评分的思路

StarDrop 的 Probabilistic Scoring 把这两点处理成:

  • 为每个性质定义期望的取值区间与重要性权重,而不是硬阈值;
  • 每个预测值带不确定性估计
  • 综合计算「该分子满足全部标准的概率」,并给出这个概率本身的置信区间;
  • 关键产出不是排名,而是「哪些分子的差异在统计上不显著」——如果 A 和 B 的得分区间高度重叠,就不应该仅凭得分选 A 弃 B,此时该考虑其他因素(合成难度、新颖性、专利空间)。

这个思路的价值超出工具本身:它把「用预测值做决策」从「按分数排序取前 N」变成「识别哪些分子确实更好、哪些只是噪声差异」,这是更诚实也更有用的决策方式。

其它能力

模块 作用
ADME QSAR 溶解度、logP/logD、通透性、血浆蛋白结合、hERG、CYP 等预测
P450 代谢位点 预测代谢软点,指导阻断策略
Glowing Molecule 把预测贡献映射回分子结构,直观显示哪个部分是问题所在
Card View 多参数并排的可视化决策界面
Nova 基于规则的类似物生成
Auto-Modeller 用内部数据自建 QSAR 模型

「把预测贡献映射回结构」的可视化很实用:告诉药化「这个分子代谢稳定性差」不如告诉他「这个甲基是主要代谢位点」,后者直接指向改造方案。

用开源实现 MPO 的思路

import numpy as np
from scipy import stats

def desirability(value, low, high, direction="range"):
    """把性质值映射到 0~1 的期望度,用平滑函数而非硬阈值"""
    if direction == "range":              # 落在区间内最好
        center, width = (low + high) / 2, (high - low) / 2
        return float(np.exp(-((value - center) / width) ** 2))
    if direction == "higher":             # 越大越好
        return float(1 / (1 + np.exp(-(value - low) / (0.1 * abs(low) + 1e-9))))
    return float(1 / (1 + np.exp((value - high) / (0.1 * abs(high) + 1e-9))))

def mpo_score_with_uncertainty(preds, uncerts, criteria, weights, n_sim=2000):
    """蒙特卡洛传播预测不确定性,得到 MPO 分数的分布"""
    scores = []
    for _ in range(n_sim):
        d = []
        for k, (lo, hi, direc) in criteria.items():
            sampled = np.random.normal(preds[k], uncerts[k])
            d.append(desirability(sampled, lo, hi, direc) ** weights[k])
        scores.append(np.prod(d) ** (1 / sum(weights.values())))   # 加权几何平均
    return np.mean(scores), np.percentile(scores, [5, 95])

# 用置信区间判断分子间差异是否显著
# 区间重叠 → 差异不显著,应引入其它决策因素

关键设计选择:用几何平均而非算术平均(任一项接近 0 则整体接近 0,防止「牺牲一个性质换其它高分」);用蒙特卡洛传播不确定性(把预测误差如实反映到最终分数的区间上)。

提示

商业平台功能与定价变动较快,本文为方向性介绍,采购前请核对官方最新信息。无论用什么工具,「不确定性感知的多参数决策」这个思路本身值得引入到任何 DMTA 流程中。

延伸资源