Genesis Therapeutics 从斯坦福的图神经网络研究(其创始团队与 Chemprop/D-MPNN 等工作的学术脉络相关)孵化而来,技术核心是用图神经网络做分子性质预测与生成式设计,并自建实验能力形成闭环。
技术定位
- 图神经网络的分子表示:把分子作为图处理,学习原子与键的表示(见 176《PyTorch Geometric》、006《Stanford CS224W 图神经网络》);
- 多目标性质预测:活性、选择性、ADMET 联合建模;
- 生成式设计:在预测模型指导下生成候选分子;
- 实验闭环:自建或深度合作的湿实验能力,让模型能用自产数据迭代。
生成式小分子设计公司的共性挑战
这一类公司(包括 308《Insilico Medicine》、311《Exscientia》、324《Iambic Therapeutics》 等)面临一组共同的问题,理解它们比记住某家公司的具体技术更有价值:
| 挑战 | 本质 |
|---|---|
| 数据稀缺 | 公开活性数据有限且有偏;自产数据成本高、周期长 |
| 闭环慢 | 小分子合成需数周到数月,一轮只能测几十个 |
| 打分函数被钻空子 | 生成模型必然找到评价函数的漏洞 |
| 可合成性 | 产出分子做不出来则毫无价值 |
| 适用域外推 | 模型对新骨架的预测不可靠 |
| 验证周期长 | 从设计到临床结果需要多年 |
| 生物学风险 | 靶点选错时,分子设计得再好也没用 |
「闭环慢」是小分子领域相对抗体、蛋白最本质的劣势:抗体可以一次表达测试上千个变体、周期数周;小分子一轮只能合成几十个、周期数月。这直接决定了模型能积累多少自产数据。
怎么判断这类公司/技术的成色
无论是评估合作对象还是评估自建方案,这套问题都适用:
- 看数据来源:模型训练用的是公开数据还是自产数据?自产数据的规模、标准化程度、是否包含阴性结果?
- 看闭环速度:从设计到拿到实验反馈需要多久?一轮能测多少个分子?这个数字比模型架构重要得多。
- 看合成通过率:模型产出的分子,实际能合成出来的比例是多少?
- 看评估纪律:有没有用骨架划分?有没有和 ECFP4 + 随机森林基线对比?赢不过指纹基线的复杂模型,说明问题在数据不在模型。
- 看失败案例:有多少项目没推进成功?原因是什么?只展示成功案例的必然高估。
- 看临床证据:有分子进入临床吗?临床结果如何?这是最终判据。
自建团队的务实路径
# 用开源栈能覆盖大部分能力,差异化在数据与闭环
# 1. 性质预测基线(必须先做)
# Chemprop(174)+ 骨架划分 + 多种子集成
# 对照:ECFP4 + 随机森林
# 赢不过基线 → 回去查数据,别换模型
# 2. 生成
# REINVENT4(221)的 LibInvent / Mol2Mol 模式
# 先导优化用受控改造,比从头生成实际得多
# 3. 护栏(决定成败)
# SA score + 结构警报 + 相似性下限 + 不确定性约束
# 用几何平均组合,防止钻空子
# 4. 人工审查
# mols2grid(217)批量渲染,药化专家过一遍
# 5. 闭环
# 合成 → 测活性 → 数据回流 → 重训
# 记录所有结果,包括失活的分子
第 5 步的「记录失活分子」是最容易被忽略、也最有长期价值的一步。这些数据在公开文献中不存在,是自建团队真正的差异化资产。
提示
公司管线、技术与合作变动较快,本文为方向性观察,具体信息请以官方披露为准。评估生成式设计能力时,闭环速度与数据质量比模型架构更能说明问题。