Chai-1 是 Chai Discovery 发布的生物分子结构预测模型,能力对标 AlphaFold3,可预测蛋白、核酸、小分子配体及其复合物。它最有辨识度的功能是支持注入实验约束——能把交联质谱、突变实验等已知接触信息作为条件喂给模型。
部署
pip install chai_lab
# 也可直接用官方网页版(无需本地 GPU)
python - <<'PY'
from pathlib import Path
from chai_lab.chai1 import run_inference
run_inference(
fasta_file=Path("input.fasta"),
output_dir=Path("outputs"),
num_trunk_recycles=3,
num_diffn_timesteps=200,
use_esm_embeddings=True, # 无 MSA 模式
)
PY
FASTA 用特殊头部标记实体类型:
>protein|name=receptor
MVTPEGNVSLVDESLLVGVTDEDRAVRSAHQFYERLIG
>ligand|name=inhibitor
CC(=O)Oc1ccccc1C(=O)O
>rna|name=aptamer
GGCUAGCUACGAUC
两个实际有用的特性
- 无 MSA 模式:
use_esm_embeddings=True时用蛋白语言模型嵌入替代多序列比对。精度会有损失,但省掉了几百 GB 数据库和漫长的检索时间,对快速迭代或缺乏同源序列的蛋白(如人工设计序列、孤儿蛋白)很实用。 - 实验约束注入:可以把已知的残基接触、交联质谱结果、突变扫描证据作为约束传入,引导预测。当你手上已有部分实验证据、想补全整体结构时,这个功能是同类工具里少见的。
许可要看清楚
Chai-1 的代码与权重按特定条款发布:学术与内部研究用途通常允许,但商业用途(尤其是用于药物发现服务)可能受限或需单独授权。不要因为能 pip install 就假定可以商用。需要完全无限制的商业许可时,Boltz(见 192《Boltz》,MIT)更稳妥。使用前逐条核对当前版本的 LICENSE。
怎么用好
| 场景 | 建议设置 |
|---|---|
| 常规蛋白复合物 | 带 MSA,num_trunk_recycles=3 |
| 快速迭代 / 无同源序列 | use_esm_embeddings=True,接受精度损失 |
| 已有实验证据 | 注入约束,通常明显改善界面预测 |
| 难体系 | 提高 num_diffn_timesteps,多次采样看收敛性 |
- 同样看 pLDDT / PAE / ipTM 判断可信度,界面预测重点看 ipTM。
- 多次采样取共识:不同随机种子给出一致结构,才说明预测稳定。
- 配体姿势仍需与对接交叉验证并做物理检查,这是所有 AF3 类模型的共同注意事项。
上手提示
- 独特功能是「实验约束注入」和「无 MSA 模式」,选它主要冲这两点;
- 无 MSA 模式牺牲精度换速度,适合迭代阶段而非最终结论;
- 商用前必须核对许可,能安装不等于能商用;
- 多采样看收敛性,界面质量重点看 ipTM。
延伸资源
- 教程:021《Chai-1 教程》;对照实现:192《Boltz》、191《OpenFold》、190《HelixFold3》;
- 蛋白语言模型:194《ESM》、195《ESMFold》;
- 结构预测的局限与判读见「结构与模拟」模块。