← 返回博客
News预计阅读 10 分钟

FDA 正在为尚无人造出的 AI 设备制定规则

发布于 2026年10月7日
FDA 正在为尚无人造出的 AI 设备制定规则

监管机构通常是反应式的。产品上市,出了问题,然后指南才跟上。FDA 的器械中心刚刚反其道而行。10 月 1 日,它公布了 2027 财年拟议指南议程,而清单靠前的位置上,放着一份针对某类器械的指南草案,而该机构尚未批准过任何一个此类器械。

这一类器械是面向精神健康障碍的生成式 AI 对话设备。FDA 的器械与放射健康中心迄今已批准超过 1,200 款 AI 赋能医疗器械。其中没有一款将生成式 AI 用于精神健康适应症。该机构正在首份申请到来之前撰写证据建议,这是提前设定门槛,而不是以后逐案协商。

这一举措建立在 CDRH 于 8 月发布的一份讨论文件之上,题为《生成式 AI 赋能医疗器械监管考量》。它明确是一份讨论文件,而非政策,并包含 26 个供公众回答的问题。意见征集于 10 月 19 日截止。任何基于大语言模型构建临床产品的人,大约只有两周时间就自己希望如何被监管发表意见。

双轴风险框架

该文件的核心思想是,生成式 AI 设备会以旧有软件规则未曾预料到的方式失效。该机构提议从两个轴来评定风险。一个是错误输出的后果,即错误答案对患者造成多大伤害。另一个是独立程度,即系统在多大程度上自行行动,还是向人类提供建议。

这种组合在精神上并不陌生。为放射科医生标记骨折的放射软件,与不经复核就做出诊断的软件,风险特征不同。新之处在于把它应用于非确定性系统,也就是相同输入可能产生不同输出,并且部署后还能持续调整的系统。传统软件验证假设的是一个固定制品。会漂移的模型不符合这一假设。

为处理这一问题,文件提出了一种仿照临床医生资质认证的方法。其论点是,医生并不是针对他们可能面对的所有场景接受测试。他们通过针对基础知识和推理的结构化评估,然后在监督下执业。FDA 询问,生成式设备是否可以以同样方式评估,即先依据既定标准进行非临床基准测试,再在真实或模拟环境中进行临床确认。

上市后监督承担了更艰难的任务。由于这些系统会变化,文件建议追踪设备自身模型及其下方任何基础模型的性能漂移、幻觉和意外输出。第二部分很重要。对他人模型进行微调的设备制造商,会继承它无法完全看到的行为,而文件直接询问:当制造商并不控制底层模型时,上市前和上市后预期应如何适用。

文件避而不谈的内容

从文件省略了什么来读,方向会更清楚。它从未使用 FDA 过去对锁定算法和自适应算法的区分。它避开了“医疗器械中的软件”和“作为医疗器械的软件”这两个词,而它们曾是一代器械审评的词汇。临床决策支持只出现在一个脚注中。

这些省略看起来是有意为之。旧类别是为一旦验证便表现可预测的软件而建立的。生成式系统模糊了工具与输出之间的界线,而该机构似乎在为一个不继承这些假设的框架腾出空间。这究竟是一次真正的重置,还是同样原则的重新包装,正是利益相关方被要求评论的问题。

指南议程说明了资源投向何处

2027 财年议程的意见征集持续到 11 月 30 日,它告诉你哪些草案在该机构看来已接近定稿。有三项排在最前。第一,将 2025 年 1 月首次起草的 AI 赋能器械软件生命周期指南定稿,该指南涵盖模型在其整个生命周期内如何被监测、更新和再验证,而不仅仅是在获批时。第二,将 2024 年 8 月的预定变更控制计划指南定稿,该指南界定了申办方必须预先规定哪些内容,才能在某些上市后算法变更时无需提交新的申请。第三,将机器人辅助手术器械指南定稿,其中包括 9 月下旬发布的一份单独草案,涵盖器械控制、延迟、网络安全和灭菌。

这三项是在说:部署已经到这里了。预定变更控制计划是让已获批的 AI 功能无需新一轮审评就能持续学习的机制,也是模型一次交付与模型持续改进之间的区别。生命周期指南则把这种许可变成运营要求。二者合在一起,描述了一种作为持续过程而非封存产品来监管的器械。

第三方模型问题

文件中有个问题比其他问题更值得关注。它询问当制造商并不控制底层基础模型时,上市前和上市后预期应如何适用。这种情况如今已是常态而非例外。一个将通用模型包装用于分诊的医院系统,并不是在重新训练它,也无法访问训练数据、微调过程或变更时间表。

该机构自己的表述也承认这一困难。在其设想中,上市后监督必须追踪设备模型及其下方基础模型的漂移,这意味着设备制造商需要了解并非由自己做出、且可能不会被告知的变更。把能力认证的思路延伸到这一情形,就引出了谁获得认证的问题。设备制造商可以证明自己那一层表现正常,却不容易证明其授权使用的某个组件的行为。

值得与早一代 AI 器械规则做个比较。当申办方控制模型、并能预先规定其打算进行的变更时,预定变更控制计划才有效。当模型来自第三方时,该计划必须容纳按别人时间表到来的更新。讨论问题没有一个解决这一点,而答案将在很大程度上决定最终框架是对小型开发者可行,还是只对大到能自建模型的公司可行。

为何时机不寻常

在首份申请之前就撰写指南很罕见,而这里之所以发生,是因为精神健康对话设备是这个问题最难的形式。这些系统以自然语言与患者交谈,这使其输出难以设限、也难以测试。诊断模型返回一个数字。对话模型返回它接下来决定说的任何话。

该机构还必须调和自身的谨慎与要求加速医疗创新的政治压力,而讨论文件两者都有所反映。它倾向于基于风险、负担最小的方法,同时承认仅靠上市前审评无法评估一个会变化的系统。这种张力正是文件以问题而非答案结尾的原因。这也是那 26 个问题值得仔细阅读的原因。它们预示了将塑造首个获批生成式精神健康设备的争论,无论何时有人提交申请。

其他监管机构也在并行推进。英国药品监管机构向议会提交了三项修正案,以推动器械监管现代化,包括在风险分级许可框架下为软件和 AI 器械明确留出空间。日本正在修订其生物制品要求,以纳入更新的分子检测方法。三者的模式相同:规则正在产品到来之前被重建,押注的是提前写规则比事后打官司更便宜。

相关文章