153

Chemistry42 JCIM 论文精读:商业生成平台的方法框架和审读边界

Chemistry42 的论文给出了商业生成平台的方法框架。这篇讲清它的架构、可审读的部分与需要保留判断的地方。

Chemistry42(Insilico Medicine,JCIM 2023 等)是少数发表了较详细方法论文的商业分子生成平台。这类论文的价值在于展示了工业级生成系统的架构,但也存在商业论文固有的审读限制。

平台的方法框架

模块 内容
生成引擎 多种生成模型并行(GAN、VAE、RL、遗传算法、基于规则)
奖励/打分 数十个打分器:活性、ADMET、可合成性、新颖性
过滤管线 结构警示、专利检索、多样性去冗余
结构模块 对接、药效团、形状匹配
输出 排序后的候选分子与各维度分数

「多引擎并行」是工业系统与学术工作的一个显著差异:学术论文通常论证「我的方法最好」,而工业系统并行运行多种方法并合并结果——因为不同方法在不同问题上各有优势,而项目关心的是拿到可用分子,不是证明某个方法优越。

可以从论文中学到的架构经验

# 1) 【多引擎 + 统一打分】
#    不押注单一生成方法
#    → 各引擎生成候选,用同一套打分体系排序
#    → 这个架构值得自建系统借鉴
#
# 2) 【打分器的层次化】
#    快的先跑(性质计算、规则过滤)
#    慢的后跑(对接、模型预测)
#    → 分级过滤,节省算力
#
# 3) 【多样性作为一等公民】
#    不只输出最高分的分子,
#    而是保证输出集合的化学多样性
#    → 因为单一化学系列的风险太高
#
# 4) 【专利检索内置】
#    生成的分子必须检查是否落入已有专利
#    → 【学术工作几乎不做这一步,但工业上是必需的】
#
# 5) 【人在环路】
#    最终由化学家审阅与选择
#    → 系统的定位是「产生候选」而非「决定合成什么」
#
# 6) 【可追溯性】
#    每个分子的每项分数都可查询来源
#    → 决策要能解释

# 【这些架构经验的价值,
#  可能高于论文中的任何单个算法】

审读商业平台论文的边界

  • 无法独立复现:代码与模型不开放,报告的结果无法验证。这不是论文的错,但读者必须意识到证据等级的差异
  • 案例选择的偏倚:展示的是成功案例,失败的项目通常不会发表——这让成功率无法评估;
  • 「AI 设计」的贡献难以界定:一个分子从生成到进入临床,中间有大量人工优化。「AI 设计的药物」这个说法中,AI 的实际贡献比例通常不明确
  • 时间线的叙述:「18 个月从靶点到候选化合物」这类宣称,需要看清对比基准是什么、包含哪些步骤、是否有并行的传统工作;
  • 基准比较的公平性:与开源方法比较时,开源方法是否得到了同等的调优?
  • 应有的态度把它当作「工业实践的经验分享」而非「经同行验证的方法学证据」

值得关注的实际问题

# 如果考虑使用这类平台,应该问:
#
# 关于能力:
#   □ 生成的分子经过哪些过滤?能否自定义?
#   □ 打分器用的是什么模型?在我的靶点上验证过吗?
#   □ 能否接入我们自己的 QSAR 模型与数据?
#   □ 对接与结构模块用的是什么方法?
#   □ 专利检索覆盖哪些数据库?更新频率?
#
# 关于数据:
#   □ 【我们的数据会如何处理?是否用于训练?】
#   □ 生成的分子的知识产权归属?
#   □ 数据存储在哪个法域?
#
# 关于验证:
#   □ 能否用我们的历史项目做回溯验证?
#     (用当年的数据,看能否「重新发现」当年的先导物)
#   → 【这是最有说服力的评估方式】
#
# 关于成本:
#   □ 定价模式?按项目、按分子还是订阅?
#   □ 与内部自建的成本比较?
#
# 关于集成:
#   □ 与现有的 ELN、化合物库、决策流程如何衔接?
#
# 【最关键的一条】:
#   要求做【回溯验证】——
#   用你自己已完成项目的早期数据,
#   看平台能否产出接近你最终选择的分子
#   这比任何 demo 都有说服力

自建 vs 采购的判断

考量 自建 采购平台
起步速度
与内部数据整合 完全可控 受限
定制化 受平台限制
能力沉淀 留在团队内 依赖供应商
成本(长期) 人力为主 持续订阅
数据安全 可控 需要评估
方法更新 需自行跟进 供应商负责

一个务实的中间路线:用开源组件(REINVENT4、RDKit、Vina、Chemprop——见 138《REINVENT4 文档精读》131《Chemprop / D-MPNN 论文精读》)自建基础流程,把精力投入到「自家数据的打分器」上。因为生成引擎是通用的,而真正决定质量的打分函数依赖你的专有数据——这部分外部平台无法替代。

核心判断

  • 生成不是瓶颈:现在生成一百万个分子是容易的,难的是判断哪些值得合成;
  • 打分函数的质量决定一切:而它依赖你的实验数据(见 137《REINVENT 论文精读》);
  • 因此,投资数据 > 投资生成算法
  • 平台的价值在于工程完备度:过滤管线、专利检索、多样性控制、可追溯性——这些「不性感」的部分才是工业可用性的关键。

关键要点

  • 多引擎并行 + 统一打分是工业系统与学术工作的显著差异,这个架构值得借鉴;
  • 专利检索内置——学术工作几乎不做,但工业上是必需的;
  • 商业论文无法独立复现且存在案例选择偏倚,应视为经验分享而非方法学证据
  • 评估平台最有说服力的方式是用自己已完成项目做回溯验证

说明

  • 公司/平台信息变动很快,本文为方向性介绍,决策前请核对官方最新信息。

延伸资源