AI 制药涉及大量第三方数据与模型,它们各自带有不同的许可条款。这些条款在学术研究中常被忽略,但在商业环境中可能造成实质性的法律风险。
常用数据源的许可
| 数据源 | 许可 | 商业使用 |
|---|---|---|
| ChEMBL(见 226《ChEMBL》) | CC BY-SA | 可以(需署名 + 相同方式共享) |
| PubChem(见 227《PubChem》) | 公共领域为主 | 可以 |
| PDB(见 236《PDB》) | CC0 | 可以 |
| DrugBank(见 229《DrugBank》) | 学术免费 | 需付费许可 |
| KEGG(见 261《KEGG》) | 学术查询免费 | 需付费许可 |
| Reactome(见 260《Reactome》) | CC BY 4.0 | 可以 |
| DisGeNET(见 251《DisGeNET》) | 视版本 | 需核对 |
| Reaxys / SciFinder | 商业订阅 | 受订阅协议约束 |
| USPTO 反应数据 | 公开 | 可以 |
「CC BY-SA」的传染性需要注意:ChEMBL 采用相同方式共享条款,基于它衍生的数据库可能需要以同样许可发布。用它训练模型是否构成「衍生作品」,在法律上并非完全清晰——涉及商业产品时应咨询法务。
模型权重的许可
| 模型 | 许可 | 商业使用 |
|---|---|---|
| Boltz(见 192《Boltz》) | MIT | 无限制 |
| RDKit | BSD | 无限制 |
| OpenMM、Chemprop、REINVENT4 | 宽松开源 | 可以(核对具体条款) |
| AlphaFold2/3 官方权重 | 非商业 | 受限 |
| OpenFold(见 191《OpenFold》) | Apache 2.0(代码) | 自训权重许可更宽松 |
| Chai-1(见 193《Chai-1》) | 特定条款 | 商业需核对 |
| HelixFold3(见 190《HelixFold3》) | 常为非商业 | 受限 |
| ESM(见 194《ESM》) | 视版本 | 需核对 |
| Rosetta / PyRosetta(见 198《Rosetta》) | 学术免费 | 商业需付费 |
「能 pip install」不等于「能商用」——这是最常见的误解。凡是用于药物研发项目(即使是内部研究),在营利性机构中都属于商业使用。建立一个内部的许可清单,在引入新工具时逐一核对。
训练数据与模型输出的知识产权
- 用第三方数据训练的模型,其输出归谁?这是一个法律上尚不完全明确的领域,不同司法辖区的判断可能不同;
- 实务建议:
- 优先使用许可明确宽松的数据(PubChem、PDB)训练用于商业目的的模型;
- 使用受限数据时,明确其在流程中的作用(是训练数据还是仅用于验证);
- 保留完整的数据来源记录;
- 涉及产品化时咨询知识产权律师。
- AI 生成分子的可专利性:目前多数司法辖区要求发明人为自然人。AI 辅助生成的分子,发明人应为使用 AI 并做出创造性判断的研究人员。这个领域的法律实践仍在演进。
合作中的数据条款
# 与 CRO、平台公司、学术机构合作时必须明确的条款
DATA_TERMS_CHECKLIST = [
"合作产生的实验数据归谁所有?",
"对方能否用这些数据训练自己的模型?",
"对方能否将模型/知识用于服务其它客户?",
"我们提供的化合物结构如何保密?保密期多久?",
"对方的员工流动如何影响保密义务?",
"产生的知识产权(分子、方法)归属如何?",
"里程碑与分成安排?",
"合作终止后数据如何处理?",
"数据存储在哪个司法辖区?跨境传输合规吗?",
"是否允许对方在论文/宣传中提及?",
]
# 最容易被忽略但影响最大的:
# 「对方能否用合作数据训练自己的模型」
# → 如果可以,你的专有数据实际上在增强对方的能力
# → 这在与 AI 平台公司合作时尤其重要
使用第三方 SaaS / 在线服务
- 结构信息会离开本地:任何在线服务(结构预测、逆合成、对接)都涉及数据外传;
- 核心风险:未公开的靶点序列、专有化合物结构一旦外传,可能影响专利新颖性或泄露研发方向;
- 务实原则:正式项目的分子与靶点不应提交在线服务;在线服务用于方法评估、教学、处理已公开的分子;
- 核对服务条款:数据是否被存储?是否用于改进服务(即训练模型)?保留多久?能否要求删除?
- 注意「本地部署也可能外传」:如 Boltz 的
--use_msa_server会把序列发到远程 MSA 服务(见 292《Chai Discovery Platform》)。
专利检索的合规使用
- SureChEMBL(见 234《SureChEMBL》)等工具可用于化学空间分析,但不能替代专业的专利检索;
- 自由实施(FTO)判断必须由专利律师完成:涉及马库什通式的覆盖范围、权利要求的法律解释、同族专利、法律状态——这些计算工具都不处理;
- 「搜不到」不等于「没被覆盖」:自动抽取有遗漏,且通式覆盖的具体化合物可能从未被例示;
- 时机:在候选提名前必须完成正式的 FTO 分析。
建立内部合规实践
# 建议的做法
# 1) 维护许可清单
# 每个使用的数据源与工具,记录:
# 名称、版本、许可类型、商业使用是否允许、
# 核对日期、核对人
# 2) 引入新工具的检查流程
# 在集成任何新的数据源或模型前,
# 先完成许可核对并记录
# 3) 数据分级
# 对内部数据分级(公开/内部/机密/高度机密),
# 明确每级可以用什么工具处理
# 4) 定期复核
# 许可条款会变更,定期(如每年)复核
# 5) 与法务建立常规沟通
# 不要等到出问题才找法务
提示
本文为方向性介绍,不构成法律意见。数据与模型的许可条款会变更,且不同司法辖区的法律要求不同。具体的合规问题,包括商业使用许可、知识产权归属与自由实施判断,应咨询法务与知识产权专业人士。
延伸资源
- 数据源许可:226《ChEMBL》、229《DrugBank》、261《KEGG》;
- 模型许可:192《Boltz》、193《Chai-1》、290《AlphaFold Server》;专利数据:234《SureChEMBL》。