随着 AI 在药物研发中的应用增多,监管机构(FDA、EMA、NMPA 等)陆续发布了讨论文件与指导原则。理解监管的思路,比记住具体条款更重要——因为具体要求会变,而底层逻辑相对稳定。
监管的核心逻辑:基于风险分层
监管关注的不是「你用了 AI」,而是「这个 AI 的输出如果错了,会造成什么后果」。因此要求与风险成正比:
| 风险等级 | 典型场景 | 监管关注度 |
|---|---|---|
| 低 | 研发早期的化合物筛选、内部优先级排序 | 基本不涉及 |
| 中 | 支持性证据(如杂质评估、工艺理解) | 需要方法说明与验证 |
| 高 | 影响患者安全或疗效判断的决策 | 要求严格的验证与文档 |
| 最高 | 直接用于诊断、剂量决定、临床决策 | 可能按医疗器械监管 |
关键含义:研发早期用 AI 做筛选、排序、设计,基本不受监管约束。只有当 AI 的输出成为申报证据的一部分、或直接影响患者时,监管要求才实质性介入。这一点常被误解——很多团队以为「用了 AI 就要被监管」,实际上大部分研发用途并不涉及。
已经明确被接受的场景
- ICH M7 的 (Q)SAR 用于基因毒性杂质评估:这是最明确的案例。指导原则接受用两种互补的计算方法(一种基于专家规则、一种基于统计模型)评估杂质的致突变性;若两者都预测阴性且无相互矛盾,可以免除 Ames 试验。这为计算方法在监管场景中的使用树立了范式:方法互补 + 结果一致 + 专家复核。
- PBPK 建模:用于预测药物相互作用、特殊人群外推、剂量选择,已被广泛接受,且在某些情况下可替代临床研究。要求模型经过验证并提交完整的模型文件与假设说明。
- 群体药代动力学:长期是标准方法。
- 建模与模拟支持临床试验设计:如剂量选择、样本量估计。
监管普遍关注的问题
| 维度 | 关注点 |
|---|---|
| 数据质量与代表性 | 训练数据来源、质量、是否代表目标人群/化学空间 |
| 模型可解释性 | 能否说明模型是如何得出结论的 |
| 验证的充分性 | 如何验证?用什么独立数据集? |
| 适用域 | 模型在什么范围内可信?超出范围怎么办? |
| 可重复性 | 同样输入能否给出同样输出?版本如何管理? |
| 人的监督 | 专家是否复核?如何介入? |
| 偏倚 | 训练数据的偏倚是否会导致不公平结果 |
| 持续监测 | 模型上线后如何监测性能漂移 |
生命周期管理的思路
# 监管越来越强调「模型是有生命周期的」
#
# 1) 开发阶段
# - 明确使用目的与风险等级
# - 数据来源与质量记录
# - 模型选择的依据
#
# 2) 验证阶段
# - 独立数据集验证
# - 适用域定义
# - 性能指标与可接受标准
#
# 3) 部署阶段
# - 版本锁定
# - 输入输出的记录
# - 人工复核流程
#
# 4) 监测阶段
# - 性能漂移监测
# - 何时需要重新验证
# - 变更管理流程
#
# 这与传统的「一次性验证」思路不同 ——
# AI 模型会随数据更新而变化,需要持续管理
实践建议
- 先判断风险等级:内部研发决策用的模型,不需要按监管级别做文档;用于申报证据的才需要。不要过度合规化早期研发工具。
- 但基础实践应该一致:无论是否用于申报,版本管理、实验追踪、数据溯源都是好实践(见 422《MLOps for 药物发现》);
- 早期与监管沟通:如果计划把 AI 结果用作申报证据,应在 pre-IND 等会议中提出并讨论,而不是等到提交时;
- 保留完整记录:训练数据、模型版本、验证结果、每次预测的输入输出——这些在需要时无法追溯补齐;
- 人的监督不可省略:目前的监管框架普遍要求有专家复核,AI 是辅助而非替代决策者;
- 关注具体指导原则的更新:这个领域的监管文件仍在快速演进,本文只讲思路,具体要求应以各机构最新发布为准并咨询法规专业人士。
提示
监管要求随各国机构的指导原则持续更新,本文为方向性介绍。涉及申报的具体合规问题,应以监管机构最新发布的文件为准,并咨询法规事务专业人士。
延伸资源
- 模型验证:419《AI 模型的监管验证》;可信 AI:420《可信 AI Trustworthy AI》;
- MLOps:422《MLOps for 药物发现》;IND 研究:410《IND-Enabling Study》。