418

FDA 对 AI 的监管框架:药物研发中的可信 AI 指引

监管机构对药物研发中 AI 的使用逐步形成框架。这篇讲清风险分层思路、当前已明确接受的场景与合规要点。

随着 AI 在药物研发中的应用增多,监管机构(FDA、EMA、NMPA 等)陆续发布了讨论文件与指导原则。理解监管的思路,比记住具体条款更重要——因为具体要求会变,而底层逻辑相对稳定。

监管的核心逻辑:基于风险分层

监管关注的不是「你用了 AI」,而是「这个 AI 的输出如果错了,会造成什么后果」。因此要求与风险成正比:

风险等级 典型场景 监管关注度
研发早期的化合物筛选、内部优先级排序 基本不涉及
支持性证据(如杂质评估、工艺理解) 需要方法说明与验证
影响患者安全或疗效判断的决策 要求严格的验证与文档
最高 直接用于诊断、剂量决定、临床决策 可能按医疗器械监管

关键含义:研发早期用 AI 做筛选、排序、设计,基本不受监管约束。只有当 AI 的输出成为申报证据的一部分、或直接影响患者时,监管要求才实质性介入。这一点常被误解——很多团队以为「用了 AI 就要被监管」,实际上大部分研发用途并不涉及。

已经明确被接受的场景

  • ICH M7 的 (Q)SAR 用于基因毒性杂质评估这是最明确的案例。指导原则接受用两种互补的计算方法(一种基于专家规则、一种基于统计模型)评估杂质的致突变性;若两者都预测阴性且无相互矛盾,可以免除 Ames 试验。这为计算方法在监管场景中的使用树立了范式:方法互补 + 结果一致 + 专家复核
  • PBPK 建模:用于预测药物相互作用、特殊人群外推、剂量选择,已被广泛接受,且在某些情况下可替代临床研究。要求模型经过验证并提交完整的模型文件与假设说明。
  • 群体药代动力学:长期是标准方法。
  • 建模与模拟支持临床试验设计:如剂量选择、样本量估计。

监管普遍关注的问题

维度 关注点
数据质量与代表性 训练数据来源、质量、是否代表目标人群/化学空间
模型可解释性 能否说明模型是如何得出结论的
验证的充分性 如何验证?用什么独立数据集?
适用域 模型在什么范围内可信?超出范围怎么办?
可重复性 同样输入能否给出同样输出?版本如何管理?
人的监督 专家是否复核?如何介入?
偏倚 训练数据的偏倚是否会导致不公平结果
持续监测 模型上线后如何监测性能漂移

生命周期管理的思路

# 监管越来越强调「模型是有生命周期的」
#
# 1) 开发阶段
#    - 明确使用目的与风险等级
#    - 数据来源与质量记录
#    - 模型选择的依据
#
# 2) 验证阶段
#    - 独立数据集验证
#    - 适用域定义
#    - 性能指标与可接受标准
#
# 3) 部署阶段
#    - 版本锁定
#    - 输入输出的记录
#    - 人工复核流程
#
# 4) 监测阶段
#    - 性能漂移监测
#    - 何时需要重新验证
#    - 变更管理流程
#
# 这与传统的「一次性验证」思路不同 ——
# AI 模型会随数据更新而变化,需要持续管理

实践建议

  • 先判断风险等级:内部研发决策用的模型,不需要按监管级别做文档;用于申报证据的才需要。不要过度合规化早期研发工具。
  • 但基础实践应该一致:无论是否用于申报,版本管理、实验追踪、数据溯源都是好实践(见 422《MLOps for 药物发现》);
  • 早期与监管沟通:如果计划把 AI 结果用作申报证据,应在 pre-IND 等会议中提出并讨论,而不是等到提交时;
  • 保留完整记录:训练数据、模型版本、验证结果、每次预测的输入输出——这些在需要时无法追溯补齐;
  • 人的监督不可省略:目前的监管框架普遍要求有专家复核,AI 是辅助而非替代决策者;
  • 关注具体指导原则的更新这个领域的监管文件仍在快速演进,本文只讲思路,具体要求应以各机构最新发布为准并咨询法规专业人士。

提示

监管要求随各国机构的指导原则持续更新,本文为方向性介绍。涉及申报的具体合规问题,应以监管机构最新发布的文件为准,并咨询法规事务专业人士。

延伸资源