231

Enamine REAL:超大可合成化合物空间怎么理解

Enamine REAL 是数百亿级的「按需合成」化合物空间,把虚拟筛选从现货库扩展到可合成空间。这篇讲清它的构建逻辑、检索方法与实际交付预期。

Enamine REAL(REadily AccessibLe)是当前最大的商业可及化合物空间,规模已达数百亿量级。它不是一个真实存在的化合物库——这些分子并不在货架上,而是由可靠反应 + 现货砌块组合枚举出来的、承诺能合成的分子。这个概念的转变,把虚拟筛选的可及化学空间扩大了三四个数量级。

它是怎么构建的

  • 反应集:约 170 种经过验证、稳健、高成功率的合成反应(酰胺化、还原胺化、Suzuki 偶联、SNAr 等)。
  • 砌块库:Enamine 现货的数十万个构建块。
  • 组合枚举:把砌块按反应规则两两/三三组合,枚举出所有产物。
  • 质量控制:过滤掉不稳定、有毒性警报、合成把握不足的产物。

核心承诺是交付率:Enamine 报告 REAL 分子的合成成功率约 80%,交付周期通常 3~4 周。这个可靠性是它区别于「理论上可能存在的分子」的关键。

怎么检索这么大的空间

数百亿分子无法用传统方法逐个对接,需要专门的检索策略:

方法 思路 工具
相似性检索 不枚举全库,在组合空间上直接搜索 Enamine REAL Space 搜索、Infiniscreen
片段生长 固定一个砌块,枚举另一侧 V-SYNTHES、片段生长流程
主动学习 对小样本对接,训模型预测其余,迭代聚焦 Deep Docking、Active Learning Docking
合成子层面对接 先对接砌块,再组合高分片段 V-SYNTHES 等
子集下载 下一个可管理的代表性子集 REAL Diversity Set 等

主动学习筛选:最实用的做法

# 典型流程(Deep Docking 思路)
# 1) 从 REAL 随机抽 100 万个分子
# 2) 全部对接,得到分数
# 3) 用这些数据训一个快速模型(如指纹 + 梯度提升)
# 4) 用模型给全库(数十亿)打分,取 top N
# 5) 对 top N 真实对接,把结果加回训练集
# 6) 重复 3~5 若干轮,逐步聚焦

# 效果:用约 1% 的对接算力,找回大部分高分分子

这类方法把「筛数十亿」从不可能变成了几天的计算任务,是目前超大库筛选的主流做法。

实际使用的注意点

  • 先导化合物阶段最合适:REAL 的分子多是「砌块拼起来」的形态,适合作为苗头/先导发现的来源。后期精细优化仍需定制合成。
  • 化学多样性有结构性偏差:受限于 170 种反应和现货砌块,某些骨架和连接方式被大量代表,另一些几乎不存在。它扩大的是「可及空间」,不是「均匀覆盖化学空间」
  • 虚拟命中的假阳性问题被放大:库越大,打分函数的极端值越可能是评分函数的漏洞而非真实的强结合。必须做多层过滤:重打分、姿势物理检查、相互作用指纹核对、人工审查。
  • 成本与周期:单个分子价格通常在数百美元量级,3~4 周交付,约 20% 失败。下单时建议多选一些备选,并接受部分无法交付。
  • 知识产权:使用商业库需注意采购协议中的条款。

它带来的思路转变

传统虚拟筛选是「在现有货架上挑」,REAL 类空间是「在可制造的可能性中搜索」。这个转变的意义在于:化学空间的瓶颈从「有没有」变成了「怎么搜」和「怎么排」。也正因如此,超大库时代对打分函数可靠性、假阳性控制、主动学习策略的要求,比以往任何时候都高。

关键要点

  • REAL 是「承诺可合成」的组合空间,不是货架库,交付率约 80%、周期 3~4 周;
  • 数百亿规模必须用主动学习或合成子级检索,不能全量对接;
  • 库越大,打分函数漏洞被放大的风险越高,必须多层过滤与人工审查;
  • 它扩大的是可及空间,化学多样性仍受 170 种反应与砌块限制。

延伸资源