421

数据合规与知识产权:化合物与模型的法律边界

化合物数据与模型涉及复杂的法律边界。这篇讲清数据许可、模型权重许可与知识产权的实际考量。

AI 制药涉及大量第三方数据与模型,它们各自带有不同的许可条款。这些条款在学术研究中常被忽略,但在商业环境中可能造成实质性的法律风险。

常用数据源的许可

数据源 许可 商业使用
ChEMBL(见 226《ChEMBL》 CC BY-SA 可以(需署名 + 相同方式共享)
PubChem(见 227《PubChem》 公共领域为主 可以
PDB(见 236《PDB》 CC0 可以
DrugBank(见 229《DrugBank》 学术免费 需付费许可
KEGG(见 261《KEGG》 学术查询免费 需付费许可
Reactome(见 260《Reactome》 CC BY 4.0 可以
DisGeNET(见 251《DisGeNET》 视版本 需核对
Reaxys / SciFinder 商业订阅 受订阅协议约束
USPTO 反应数据 公开 可以

「CC BY-SA」的传染性需要注意:ChEMBL 采用相同方式共享条款,基于它衍生的数据库可能需要以同样许可发布。用它训练模型是否构成「衍生作品」,在法律上并非完全清晰——涉及商业产品时应咨询法务。

模型权重的许可

模型 许可 商业使用
Boltz(见 192《Boltz》 MIT 无限制
RDKit BSD 无限制
OpenMM、Chemprop、REINVENT4 宽松开源 可以(核对具体条款)
AlphaFold2/3 官方权重 非商业 受限
OpenFold(见 191《OpenFold》 Apache 2.0(代码) 自训权重许可更宽松
Chai-1(见 193《Chai-1》 特定条款 商业需核对
HelixFold3(见 190《HelixFold3》 常为非商业 受限
ESM(见 194《ESM》 视版本 需核对
Rosetta / PyRosetta(见 198《Rosetta》 学术免费 商业需付费

「能 pip install」不等于「能商用」——这是最常见的误解。凡是用于药物研发项目(即使是内部研究),在营利性机构中都属于商业使用。建立一个内部的许可清单,在引入新工具时逐一核对。

训练数据与模型输出的知识产权

  • 用第三方数据训练的模型,其输出归谁?这是一个法律上尚不完全明确的领域,不同司法辖区的判断可能不同;
  • 实务建议
    • 优先使用许可明确宽松的数据(PubChem、PDB)训练用于商业目的的模型;
    • 使用受限数据时,明确其在流程中的作用(是训练数据还是仅用于验证);
    • 保留完整的数据来源记录;
    • 涉及产品化时咨询知识产权律师。
  • AI 生成分子的可专利性:目前多数司法辖区要求发明人为自然人。AI 辅助生成的分子,发明人应为使用 AI 并做出创造性判断的研究人员。这个领域的法律实践仍在演进。

合作中的数据条款

# 与 CRO、平台公司、学术机构合作时必须明确的条款

DATA_TERMS_CHECKLIST = [
    "合作产生的实验数据归谁所有?",
    "对方能否用这些数据训练自己的模型?",
    "对方能否将模型/知识用于服务其它客户?",
    "我们提供的化合物结构如何保密?保密期多久?",
    "对方的员工流动如何影响保密义务?",
    "产生的知识产权(分子、方法)归属如何?",
    "里程碑与分成安排?",
    "合作终止后数据如何处理?",
    "数据存储在哪个司法辖区?跨境传输合规吗?",
    "是否允许对方在论文/宣传中提及?",
]

# 最容易被忽略但影响最大的:
#   「对方能否用合作数据训练自己的模型」
#   → 如果可以,你的专有数据实际上在增强对方的能力
#   → 这在与 AI 平台公司合作时尤其重要

使用第三方 SaaS / 在线服务

  • 结构信息会离开本地:任何在线服务(结构预测、逆合成、对接)都涉及数据外传;
  • 核心风险:未公开的靶点序列、专有化合物结构一旦外传,可能影响专利新颖性或泄露研发方向;
  • 务实原则正式项目的分子与靶点不应提交在线服务;在线服务用于方法评估、教学、处理已公开的分子;
  • 核对服务条款:数据是否被存储?是否用于改进服务(即训练模型)?保留多久?能否要求删除?
  • 注意「本地部署也可能外传」:如 Boltz 的 --use_msa_server 会把序列发到远程 MSA 服务(见 292《Chai Discovery Platform》)。

专利检索的合规使用

  • SureChEMBL(见 234《SureChEMBL》)等工具可用于化学空间分析,但不能替代专业的专利检索
  • 自由实施(FTO)判断必须由专利律师完成:涉及马库什通式的覆盖范围、权利要求的法律解释、同族专利、法律状态——这些计算工具都不处理;
  • 「搜不到」不等于「没被覆盖」:自动抽取有遗漏,且通式覆盖的具体化合物可能从未被例示;
  • 时机:在候选提名前必须完成正式的 FTO 分析。

建立内部合规实践

# 建议的做法

# 1) 维护许可清单
#    每个使用的数据源与工具,记录:
#      名称、版本、许可类型、商业使用是否允许、
#      核对日期、核对人

# 2) 引入新工具的检查流程
#    在集成任何新的数据源或模型前,
#    先完成许可核对并记录

# 3) 数据分级
#    对内部数据分级(公开/内部/机密/高度机密),
#    明确每级可以用什么工具处理

# 4) 定期复核
#    许可条款会变更,定期(如每年)复核

# 5) 与法务建立常规沟通
#    不要等到出问题才找法务

提示

本文为方向性介绍,不构成法律意见。数据与模型的许可条款会变更,且不同司法辖区的法律要求不同。具体的合规问题,包括商业使用许可、知识产权归属与自由实施判断,应咨询法务与知识产权专业人士。

延伸资源