Chemistry42(Insilico Medicine,JCIM 2023 等)是少数发表了较详细方法论文的商业分子生成平台。这类论文的价值在于展示了工业级生成系统的架构,但也存在商业论文固有的审读限制。
平台的方法框架
| 模块 | 内容 |
|---|---|
| 生成引擎 | 多种生成模型并行(GAN、VAE、RL、遗传算法、基于规则) |
| 奖励/打分 | 数十个打分器:活性、ADMET、可合成性、新颖性 |
| 过滤管线 | 结构警示、专利检索、多样性去冗余 |
| 结构模块 | 对接、药效团、形状匹配 |
| 输出 | 排序后的候选分子与各维度分数 |
「多引擎并行」是工业系统与学术工作的一个显著差异:学术论文通常论证「我的方法最好」,而工业系统并行运行多种方法并合并结果——因为不同方法在不同问题上各有优势,而项目关心的是拿到可用分子,不是证明某个方法优越。
可以从论文中学到的架构经验
# 1) 【多引擎 + 统一打分】
# 不押注单一生成方法
# → 各引擎生成候选,用同一套打分体系排序
# → 这个架构值得自建系统借鉴
#
# 2) 【打分器的层次化】
# 快的先跑(性质计算、规则过滤)
# 慢的后跑(对接、模型预测)
# → 分级过滤,节省算力
#
# 3) 【多样性作为一等公民】
# 不只输出最高分的分子,
# 而是保证输出集合的化学多样性
# → 因为单一化学系列的风险太高
#
# 4) 【专利检索内置】
# 生成的分子必须检查是否落入已有专利
# → 【学术工作几乎不做这一步,但工业上是必需的】
#
# 5) 【人在环路】
# 最终由化学家审阅与选择
# → 系统的定位是「产生候选」而非「决定合成什么」
#
# 6) 【可追溯性】
# 每个分子的每项分数都可查询来源
# → 决策要能解释
# 【这些架构经验的价值,
# 可能高于论文中的任何单个算法】
审读商业平台论文的边界
- 无法独立复现:代码与模型不开放,报告的结果无法验证。这不是论文的错,但读者必须意识到证据等级的差异;
- 案例选择的偏倚:展示的是成功案例,失败的项目通常不会发表——这让成功率无法评估;
- 「AI 设计」的贡献难以界定:一个分子从生成到进入临床,中间有大量人工优化。「AI 设计的药物」这个说法中,AI 的实际贡献比例通常不明确;
- 时间线的叙述:「18 个月从靶点到候选化合物」这类宣称,需要看清对比基准是什么、包含哪些步骤、是否有并行的传统工作;
- 基准比较的公平性:与开源方法比较时,开源方法是否得到了同等的调优?
- 应有的态度:把它当作「工业实践的经验分享」而非「经同行验证的方法学证据」。
值得关注的实际问题
# 如果考虑使用这类平台,应该问:
#
# 关于能力:
# □ 生成的分子经过哪些过滤?能否自定义?
# □ 打分器用的是什么模型?在我的靶点上验证过吗?
# □ 能否接入我们自己的 QSAR 模型与数据?
# □ 对接与结构模块用的是什么方法?
# □ 专利检索覆盖哪些数据库?更新频率?
#
# 关于数据:
# □ 【我们的数据会如何处理?是否用于训练?】
# □ 生成的分子的知识产权归属?
# □ 数据存储在哪个法域?
#
# 关于验证:
# □ 能否用我们的历史项目做回溯验证?
# (用当年的数据,看能否「重新发现」当年的先导物)
# → 【这是最有说服力的评估方式】
#
# 关于成本:
# □ 定价模式?按项目、按分子还是订阅?
# □ 与内部自建的成本比较?
#
# 关于集成:
# □ 与现有的 ELN、化合物库、决策流程如何衔接?
#
# 【最关键的一条】:
# 要求做【回溯验证】——
# 用你自己已完成项目的早期数据,
# 看平台能否产出接近你最终选择的分子
# 这比任何 demo 都有说服力
自建 vs 采购的判断
| 考量 | 自建 | 采购平台 |
|---|---|---|
| 起步速度 | 慢 | 快 |
| 与内部数据整合 | 完全可控 | 受限 |
| 定制化 | 高 | 受平台限制 |
| 能力沉淀 | 留在团队内 | 依赖供应商 |
| 成本(长期) | 人力为主 | 持续订阅 |
| 数据安全 | 可控 | 需要评估 |
| 方法更新 | 需自行跟进 | 供应商负责 |
一个务实的中间路线:用开源组件(REINVENT4、RDKit、Vina、Chemprop——见 138《REINVENT4 文档精读》、131《Chemprop / D-MPNN 论文精读》)自建基础流程,把精力投入到「自家数据的打分器」上。因为生成引擎是通用的,而真正决定质量的打分函数依赖你的专有数据——这部分外部平台无法替代。
核心判断
- 生成不是瓶颈:现在生成一百万个分子是容易的,难的是判断哪些值得合成;
- 打分函数的质量决定一切:而它依赖你的实验数据(见 137《REINVENT 论文精读》);
- 因此,投资数据 > 投资生成算法;
- 平台的价值在于工程完备度:过滤管线、专利检索、多样性控制、可追溯性——这些「不性感」的部分才是工业可用性的关键。
关键要点
- 多引擎并行 + 统一打分是工业系统与学术工作的显著差异,这个架构值得借鉴;
- 专利检索内置——学术工作几乎不做,但工业上是必需的;
- 商业论文无法独立复现且存在案例选择偏倚,应视为经验分享而非方法学证据;
- 评估平台最有说服力的方式是用自己已完成项目做回溯验证。
说明
- 公司/平台信息变动很快,本文为方向性介绍,决策前请核对官方最新信息。
延伸资源
- PandaOmics:152《PandaOmics 平台论文精读》;REINVENT4:138《REINVENT4 文档精读》;分子生成模型:158《AI 分子生成模型》;
- 论文阅读框架:170《AI 制药论文阅读框架》;Benchmark 陷阱:169《Benchmark 陷阱》。