323

Genesis Therapeutics:生成式 AI 小分子设计公司

Genesis Therapeutics 以图神经网络驱动的分子设计为核心。这篇讲清其技术定位、生成式小分子设计公司的共性挑战与判断方法。

Genesis Therapeutics 从斯坦福的图神经网络研究(其创始团队与 Chemprop/D-MPNN 等工作的学术脉络相关)孵化而来,技术核心是用图神经网络做分子性质预测与生成式设计,并自建实验能力形成闭环。

技术定位

  • 图神经网络的分子表示:把分子作为图处理,学习原子与键的表示(见 176《PyTorch Geometric》006《Stanford CS224W 图神经网络》);
  • 多目标性质预测:活性、选择性、ADMET 联合建模;
  • 生成式设计:在预测模型指导下生成候选分子;
  • 实验闭环:自建或深度合作的湿实验能力,让模型能用自产数据迭代。

生成式小分子设计公司的共性挑战

这一类公司(包括 308《Insilico Medicine》311《Exscientia》324《Iambic Therapeutics》 等)面临一组共同的问题,理解它们比记住某家公司的具体技术更有价值:

挑战 本质
数据稀缺 公开活性数据有限且有偏;自产数据成本高、周期长
闭环慢 小分子合成需数周到数月,一轮只能测几十个
打分函数被钻空子 生成模型必然找到评价函数的漏洞
可合成性 产出分子做不出来则毫无价值
适用域外推 模型对新骨架的预测不可靠
验证周期长 从设计到临床结果需要多年
生物学风险 靶点选错时,分子设计得再好也没用

「闭环慢」是小分子领域相对抗体、蛋白最本质的劣势:抗体可以一次表达测试上千个变体、周期数周;小分子一轮只能合成几十个、周期数月。这直接决定了模型能积累多少自产数据。

怎么判断这类公司/技术的成色

无论是评估合作对象还是评估自建方案,这套问题都适用:

  • 看数据来源:模型训练用的是公开数据还是自产数据?自产数据的规模、标准化程度、是否包含阴性结果?
  • 看闭环速度:从设计到拿到实验反馈需要多久?一轮能测多少个分子?这个数字比模型架构重要得多。
  • 看合成通过率:模型产出的分子,实际能合成出来的比例是多少?
  • 看评估纪律:有没有用骨架划分?有没有和 ECFP4 + 随机森林基线对比?赢不过指纹基线的复杂模型,说明问题在数据不在模型。
  • 看失败案例:有多少项目没推进成功?原因是什么?只展示成功案例的必然高估。
  • 看临床证据:有分子进入临床吗?临床结果如何?这是最终判据。

自建团队的务实路径

# 用开源栈能覆盖大部分能力,差异化在数据与闭环

# 1. 性质预测基线(必须先做)
#    Chemprop(174)+ 骨架划分 + 多种子集成
#    对照:ECFP4 + 随机森林
#    赢不过基线 → 回去查数据,别换模型

# 2. 生成
#    REINVENT4(221)的 LibInvent / Mol2Mol 模式
#    先导优化用受控改造,比从头生成实际得多

# 3. 护栏(决定成败)
#    SA score + 结构警报 + 相似性下限 + 不确定性约束
#    用几何平均组合,防止钻空子

# 4. 人工审查
#    mols2grid(217)批量渲染,药化专家过一遍

# 5. 闭环
#    合成 → 测活性 → 数据回流 → 重训
#    记录所有结果,包括失活的分子

第 5 步的「记录失活分子」是最容易被忽略、也最有长期价值的一步。这些数据在公开文献中不存在,是自建团队真正的差异化资产。

提示

公司管线、技术与合作变动较快,本文为方向性观察,具体信息请以官方披露为准。评估生成式设计能力时,闭环速度与数据质量比模型架构更能说明问题。

延伸资源