RoseTTAFold All-Atom(RFAA)(Krishna 等,Science 2024)把 RoseTTAFold 从「只建模蛋白主链框架」扩展到全原子、多分子类型。它与 AlphaFold3 目标相似,但完全开放——这是它的核心差异。
为什么「全原子」重要
# AF2/RF 的表示方式:
# 每个氨基酸残基用一个「框架」(frame)表示
# = 主链 N-CA-C 定义的局部坐标系
# 侧链通过扭转角(chi angles)附加
#
# 优点:参数少,适合蛋白
# 限制:
# - 只能处理标准氨基酸
# - 小分子没有「残基框架」的概念
# - 核酸、辅因子、金属、修饰都无法自然表示
#
# 全原子表示:
# 每个原子是一个独立的实体,有自己的坐标
#
# 优点:
# - 统一处理任何分子类型
# - 蛋白、DNA、RNA、小分子、离子、共价修饰
# —— 都只是「一堆原子」
# 代价:
# - 参数与计算量增加
# - 需要处理原子间的化学键约束
#
# 这就是 AF3 与 RFAA 都转向全原子的原因:
# 要建模真实的生物复合物,就必须能处理非蛋白成分
RFAA 能建模什么
| 类型 | 支持 | 药物发现中的意义 |
|---|---|---|
| 蛋白(含多链) | 是 | 基础 |
| 小分子配体 | 是 | 结合模式预测 |
| DNA / RNA | 是 | 核酸药物、转录因子(见 375《反义寡核苷酸 ASO》) |
| 金属离子 | 是 | 金属酶的活性位点 |
| 共价修饰 | 是 | 共价抑制剂(见 379《共价抑制剂设计》) |
| 糖基化 | 是 | 抗体与膜蛋白 |
| 非标准氨基酸 | 是 | 多肽药物(见 372《多肽药物设计》) |
与 AlphaFold3 的对比
| AlphaFold3 | RFAA | |
|---|---|---|
| 准确度 | 总体更高 | 接近但通常略低 |
| 结构生成 | 扩散模块 | 基于 RF 的三轨 + 全原子扩展 |
| 开放程度 | 受限(非商业) | 完全开放,可商用 |
| 权重获取 | 需申请 | 直接下载 |
| 与设计工具的衔接 | 无 | 与 RFdiffusion 生态打通 |
| 共价修饰 | 支持 | 支持,且可用于设计 |
RFAA 的独特价值不在于预测准确度,而在于它是「可用于设计的全原子模型」——配合 RFdiffusion,可以做针对小分子的结合口袋从头设计,这是 AF3 做不到的(AF3 只做预测)。
使用
git clone https://github.com/baker-laboratory/RoseTTAFold-All-Atom.git
cd RoseTTAFold-All-Atom
# 按 README 配置环境并下载权重与序列数据库
# 输入用 YAML 配置
# config.yaml:
# job_name: my_complex
# protein_inputs:
# A:
# fasta_file: protein.fasta
# sm_inputs:
# B:
# input: ligand.sdf
# input_type: sdf
# na_inputs: {} # 核酸(可选)
python -m rf2aa.run_inference --config-name config
# 输出:
# 预测的复合物 PDB(含配体)
# 置信度指标
# 注意:
# 1) 需要 GPU(显存需求随体系大小增长)
# 2) 需要下载序列数据库做 MSA 搜索
# 3) 小分子输入需要正确的化学结构(SDF/SMILES)
# 质子化态与互变异构体会影响结果
结合口袋设计:RFAA 的独特应用
# 这是 RFAA + RFdiffusion 组合的核心能力
#
# 目标:设计一个能结合指定小分子的全新蛋白
#
# 流程:
# 1) 用 RFdiffusion All-Atom 生成蛋白骨架
# 条件:给定小分子的三维结构
# → 生成一个「包裹」该分子的蛋白骨架
#
# 2) 用 ProteinMPNN / LigandMPNN 设计序列
# LigandMPNN 是考虑了配体环境的版本
# → 在配体附近选择合适的残基
#
# 3) 用 RFAA 或 AF2 验证
# 预测设计序列的结构,检查:
# - 是否折叠成设计的骨架(RMSD)
# - 口袋是否保持
# - 配体是否能结合在预期位置
#
# 4) 实验验证
# 表达、纯化、测结合
#
# 应用场景:
# - 小分子传感器(生物传感)
# - 人工酶设计
# - 新型结合蛋白(替代抗体)
# - 药物递送载体
#
# 现状:
# 成功率仍然不高(实验验证的命中率是主要瓶颈)
# 但这是【之前完全做不到】的能力
# → 见 151
使用中的注意事项
- 小分子的准确度低于蛋白:训练数据中蛋白-小分子复合物的数量远少于蛋白结构,因此配体姿势的预测可靠性较低;
- 必须做物理检查:与所有深度学习方法一样,生成的配体姿势可能有键长键角问题或空间冲突,用 PoseBusters 检查(见 096《Binding Pose》);
- 与传统对接交叉验证:RFAA 的预测应与 Vina/GNINA 结果比较;
- 不预测亲和力:与 AF3 一样,RFAA 只给结构不给结合强度;
- 新颖配体的可靠性下降:与训练数据差异大的化学类型(如金属有机配合物、罕见杂环)要格外谨慎。
在工具选择中的位置
| 需求 | 推荐 |
|---|---|
| 最高准确度的复合物预测 | AF3(学术)/ Boltz-2(商用,见 121《Boltz-2 技术报告精读》) |
| 结合口袋从头设计 | RFAA + RFdiffusion All-Atom |
| 共价复合物建模 | RFAA 或 Boltz-2 |
| 常规蛋白结构预测 | ColabFold(见 118《ColabFold》) |
| 大规模配体筛选 | 传统对接(速度) |
关键要点
- 全原子表示让蛋白/核酸/小分子/修饰能被统一建模——这是建模真实生物复合物的前提;
- 准确度通常略低于 AF3,但完全开放、可商用;
- 独特价值是「可用于设计」——配合 RFdiffusion 能做结合口袋的从头设计,AF3 做不到;
- 小分子姿势的可靠性低于蛋白部分,必须做物理检查与交叉验证。
延伸资源
- RoseTTAFold:114《RoseTTAFold 论文精读》;AlphaFold3:113《AlphaFold3 论文精读》;
- RFdiffusion 与蛋白设计:151《RFdiffusion 论文精读》、150《ProteinMPNN 论文精读》;Boltz-2:121《Boltz-2 技术报告精读》。