Enamine REAL(REadily AccessibLe)是当前最大的商业可及化合物空间,规模已达数百亿量级。它不是一个真实存在的化合物库——这些分子并不在货架上,而是由可靠反应 + 现货砌块组合枚举出来的、承诺能合成的分子。这个概念的转变,把虚拟筛选的可及化学空间扩大了三四个数量级。
它是怎么构建的
- 反应集:约 170 种经过验证、稳健、高成功率的合成反应(酰胺化、还原胺化、Suzuki 偶联、SNAr 等)。
- 砌块库:Enamine 现货的数十万个构建块。
- 组合枚举:把砌块按反应规则两两/三三组合,枚举出所有产物。
- 质量控制:过滤掉不稳定、有毒性警报、合成把握不足的产物。
核心承诺是交付率:Enamine 报告 REAL 分子的合成成功率约 80%,交付周期通常 3~4 周。这个可靠性是它区别于「理论上可能存在的分子」的关键。
怎么检索这么大的空间
数百亿分子无法用传统方法逐个对接,需要专门的检索策略:
| 方法 | 思路 | 工具 |
|---|---|---|
| 相似性检索 | 不枚举全库,在组合空间上直接搜索 | Enamine REAL Space 搜索、Infiniscreen |
| 片段生长 | 固定一个砌块,枚举另一侧 | V-SYNTHES、片段生长流程 |
| 主动学习 | 对小样本对接,训模型预测其余,迭代聚焦 | Deep Docking、Active Learning Docking |
| 合成子层面对接 | 先对接砌块,再组合高分片段 | V-SYNTHES 等 |
| 子集下载 | 下一个可管理的代表性子集 | REAL Diversity Set 等 |
主动学习筛选:最实用的做法
# 典型流程(Deep Docking 思路)
# 1) 从 REAL 随机抽 100 万个分子
# 2) 全部对接,得到分数
# 3) 用这些数据训一个快速模型(如指纹 + 梯度提升)
# 4) 用模型给全库(数十亿)打分,取 top N
# 5) 对 top N 真实对接,把结果加回训练集
# 6) 重复 3~5 若干轮,逐步聚焦
# 效果:用约 1% 的对接算力,找回大部分高分分子
这类方法把「筛数十亿」从不可能变成了几天的计算任务,是目前超大库筛选的主流做法。
实际使用的注意点
- 先导化合物阶段最合适:REAL 的分子多是「砌块拼起来」的形态,适合作为苗头/先导发现的来源。后期精细优化仍需定制合成。
- 化学多样性有结构性偏差:受限于 170 种反应和现货砌块,某些骨架和连接方式被大量代表,另一些几乎不存在。它扩大的是「可及空间」,不是「均匀覆盖化学空间」。
- 虚拟命中的假阳性问题被放大:库越大,打分函数的极端值越可能是评分函数的漏洞而非真实的强结合。必须做多层过滤:重打分、姿势物理检查、相互作用指纹核对、人工审查。
- 成本与周期:单个分子价格通常在数百美元量级,3~4 周交付,约 20% 失败。下单时建议多选一些备选,并接受部分无法交付。
- 知识产权:使用商业库需注意采购协议中的条款。
它带来的思路转变
传统虚拟筛选是「在现有货架上挑」,REAL 类空间是「在可制造的可能性中搜索」。这个转变的意义在于:化学空间的瓶颈从「有没有」变成了「怎么搜」和「怎么排」。也正因如此,超大库时代对打分函数可靠性、假阳性控制、主动学习策略的要求,比以往任何时候都高。
关键要点
- REAL 是「承诺可合成」的组合空间,不是货架库,交付率约 80%、周期 3~4 周;
- 数百亿规模必须用主动学习或合成子级检索,不能全量对接;
- 库越大,打分函数漏洞被放大的风险越高,必须多层过滤与人工审查;
- 它扩大的是可及空间,化学多样性仍受 170 种反应与砌块限制。
延伸资源
- 常规库:230《ZINC》;采购平台:232《Mcule》、233《eMolecules》;
- 对接与重打分:182《AutoDock Vina》、183《GNINA》;
- 虚拟筛选流程见「实战流程」模块。