人工智能正在快速进入制药行业——从视觉检测、数据分析到工艺趋势预测、异常识别,AI在帮助企业提高效率、减少人为偏差的同时,也带来了一个必须回答的问题:在GMP环境下,当AI参与影响患者安全、产品质量和数据完整性的重要活动时,我们凭什么相信它?
2025年7月,欧盟药品管理局(EMA)与药品检查合作计划PIC/S同步发布全新GMP附录22《人工智能》(Annex 22),成为全球首个针对制药行业AI应用的专项法规。它与修订后的附录11《计算机化系统》形成双轨监管框架,标志着AI从"技术工具"正式升级为"GMP受控对象"。本文整合三篇权威解读的核心要点,系统梳理Annex 22从适用范围、质量管理基础、预期用途、验收标准、测试验证、可解释性到运行管理的全生命周期监管逻辑与合规要求。

|
|
|
|
|
|
|
|
|
|
|
|
| 生成式AI和LLM | 非关键应用,人工监督+AI |
关键应用(产品放行) |
1. 仅限静态模型
·原因:动态模型的持续学习特性无法保证生产过程的稳定性。
·风险场景:若AI模型在生产中持续学习新数据(如自动调整灭菌温度阈值),可能因异常数据污染导致参数漂移。
·监管逻辑:药品生产必须确保每一步骤的可重复性,静态模型才能满足GMP对工艺稳定性的要求。
2. 必须具备确定性输出
·原因:制药决策容不得“大概合格”。
·监管底线:药品质量必须绝对确定性,任何模糊表述都可能成为法律纠纷的导火索(如患者诉讼中的举证难题)。
3. 生成式AI和LLM的特殊规定
·关键GMP应用:完全禁用。
·非关键应用 :可以使用,但必须有人工监督,且需要合格人员确保输出适合预期用途。法规明确要求所有AI应用需遵循三大原则,这是后续所有操作的前提。AI模型整个生命周期需要人员、文件和风险管理三重保障。
1.人员要求
工艺主题专家:负责定义模型预期用途(如“该模型需识别胶囊填充不足缺陷”);定期监测模型性能,评估环境变化(如光照)是否影响输出。
数据科学家:确保模型算法科学性(如避免训练数据偏见);
QA:监督全流程合规性(如测试数据独立性);
IT:保障系统稳定性(如访问控制、审计追踪)。
2. 文件保障
本节所述活动的所有文档都应可查阅,并由受监管的用户进行审查,无论模型是内部训练、验证和测试,还是由供应商或服务提供商提供。
文件范围(全生命周期覆盖):
· 开发阶段:算法选择依据、训练数据来源及清洗记录、模型参数设置说明;
· 测试阶段:测试计划、测试数据特征描述、偏差报告;
· 运行阶段:性能监控记录、变更控制申请、人工审核记录。
第三方模型特别要求:若使用供应商提供的AI模型(如采购的AI视觉检测系统),需额外索取供应商的模型开发文档(如训练数据合规性声明、验证报告),并纳入企业自身文件管理体系。
3. 风险管理保障:确定控制深度
所有活动需评估其对患者安全、产品质量和数据完整性的影响,决定验证深度。
风险评估矩阵:按"影响程度"(高/中/低)和"发生概率"(高/中/低)划分风险等级,例如:
· 高风险场景(如AI模型用于无菌产品密封性检测):需严格执行全流程测试,测试数据量增加50%;
· 低风险场景(如AI模型用于原辅料标签识别):可简化部分测试步骤(如减少子组测试数量)。
风险回顾频率:若发生模型性能漂移(如准确率下降),需立即启动风险再评估。
模型的预期用途以及其设计用于辅助或自动化的具体任务应基于对模型所集成的过程的深入了解进行详细描述。这应包括对模型预期使用的输入数据以及所有常见和少见变体的全面特征描述;即输入样本空间。应识别任何限制以及可能出现的错误和偏差输入。流程主题专家(SME)应对描述的充分性负责,并且应在开始验收测试之前进行记录和批准。
子群划分:
在适用的情况下,输入样本空间应根据相关特征划分为子群。子群可以根据以下特征定义:
· 决策输出(例如"接受"或"拒绝")
· 过程特定的基线特征(例如地理位置或设备)
· 材料或产品的特定特征
· 自动化任务的特定特征(例如缺陷的类型和严重程度)
人类在环(Human-in-the-loop):当模型用于为人类操作员做出的决策提供输入,且测试该模型的工作已被减少时,预期用途的描述应包括操作员的责任。在这种情况下,操作员的培训和持续绩效应像任何其他手动过程一样进行监控。
1. 测试指标
用于对产品进行分类(例如"接受"或"拒绝")的模型的合适测试指标可以包括但不限于:
· 混淆矩阵
· 灵敏度
· 特异性
· 准确率
· 精确率
· F1分数
2. 验收标准
应建立已定义测试指标的验收标准,以确定模型的性能是否可用于预期用途。对于预期用途中的特定子群体,验收标准可能有所不同。流程主题专家(SME)应负责定义验收标准,并应在验收测试开始前将其文档化并获得批准。
3. 没有下降
模型的验收标准,应至少与其所替代的过程的性能一样高。这意味着,应当了解将被模型替代的过程的性能。
1. 测试数据
· 选择:测试数据应具有代表性,并扩展预期使用的完整样本空间。它应分层,包括所有子群体,并反映模型预期使用中的限制、复杂性以及所有常见和罕见的变体。测试数据选择的标准和理由应有文档记录。
· 足够大:测试数据集及其任何子组都应足够大,以便以足够的统计信心计算测试指标。
· 标签:测试数据的标签应按照确保非常高的正确度的流程进行验证。这可能包括由多个专家进行的独立验证、验证过的设备或实验室测试。
· 预处理:任何对测试数据的预处理,例如转换、归一化或标准化,都应事先指定,并提供理由,说明其代表预期的使用条件。
· 排除:任何测试数据的清理或排除都应记录在案并提供充分的理由。
· 数据生成:生成测试数据或标签,例如通过生成式人工智能,不推荐使用,任何使用都应有充分理由。
2. 测试数据独立性
· 独立性:应实施由技术和/或程序控制组成的有效措施,以确保测试数据的独立性,即用于测试模型的数据在模型开发、训练或验证期间不被使用。这可以通过在完成训练和验证后才收集测试数据,或者在训练开始前从完整的数据池中分离出测试数据来实现。
· 数据分割:如果在模型训练前从完整的数据池中分割出测试数据,那么参与模型开发和训练的员工绝不能接触测试数据。测试数据应通过访问控制和审计追踪功能进行保护,记录对其的访问和更改。测试数据不应在该存储库之外存在任何副本。
· 识别:应记录使用了哪些数据进行测试、何时以及测试了多少次。
· 物理对象:当测试数据来源于物理对象时,应确保用于模型最终测试的对象以前未被用于训练或验证模型,除非特征是独立的。
· 员工独立性:应实施有效的程序性和/或技术性控制,以防止曾接触过测试数据的员工参与对同一模型的训练和验证。在无法保持这种独立性的组织中,可能接触过模型测试数据的员工,只有在与未接触过这些数据的同事一起(以双人合作方式)工作时,才能参与同一模型的训练和验证(四眼原则)。
3. 测试执行:按规定完成验证
· 适合预期用途:测试应确保模型适合预期用途,并且"泛化良好",即模型在来自预期用途的新数据上具有令人满意的性能。这包括检测模型对训练数据可能存在的过拟合或欠拟合情况。
· 测试计划:在启动测试之前,应准备并批准测试计划。它应包含预期用途的摘要、预定义的指标和验收标准、测试数据的参考、测试脚本以及如何计算测试指标的描述。流程主题专家(SME)应参与制定该计划。
· 偏差:任何偏离测试计划、未能满足验收标准或未使用所有测试数据的情况,都应记录、调查并充分说明理由。
· 测试文档:所有测试文档应当保留,包括预期用途的说明、测试数据的特征、实际测试数据,以及在相关情况下的物理测试对象。此外,有关测试数据访问控制和相关审计跟踪记录的文档,也应当像其他GMP文档一样进行保留。
1. 可解释性
·特征归因:在用于关键GMP应用的模型测试过程中,系统应捕获并记录测试数据中对特定分类或决策(例如拒绝)产生影响的特征。在适用的情况下,应使用特征归因技术(例如SHAP值或LIME)或热图等可视化工具来突出对结果有贡献的关键因素。
·特征合理性说明:为了确保模型是基于相关且适当的特征以及风险来进行决策,应该将这些特征的审查作为测试结果批准流程的一部分。
2. 置信度
·置信度分数:在测试用于预测或分类数据的模型时,系统应在适用的情况下记录模型对每个预测或分类结果的置信度分数。
·阈值:用于预测或分类数据的模型应有适当的阈值设置,以确保仅在适当的情况下进行预测或分类。如果置信度得分非常低,应考虑模型是否应将结果标记为"未决定",而不是做出可能不可靠的预测或分类。
1. 变更控制
在部署运行之前,经过测试的模型、其所实现的系统以及它正在自动化或辅助的整个过程都应纳入变更控制。对模型本身、系统或其使用的过程的任何更改,包括对模型用作输入的物理对象的任何更改,都应进行记录和评估,以确定模型是否需要重新测试。任何不进行此类重新测试的决定都应有充分的理由。
2. 配置控制
在投入运行之前,经过测试的模型应当置于配置控制之下,并应采用有效措施来检测任何未经授权的更改。
3. 系统性能监控
模型的性能应按照其指标定期监控,以检测计算机系统中的任何变化(例如,光照条件的恶化或变化)。
4. 输入样本空间监控
应定期监控输入数据是否仍在模型样本空间和预期用途之内。应定义指标以监控输入数据的任何漂移。
5. 人工审核
当模型用于向人工操作员做出的决策提供输入(人工在环)时,并且测试该模型的工作已被减少,应保留此过程的记录。根据过程的重要性和模型的测试水平,这可能意味着根据程序对模型的每个输出进行一致的审核和/或测试。
在多方的合力下,"AI+制药"的监管体系日趋成熟,必将引领全球药品生产与监管进入一个全面智能化、高度协同的新时代。
邵丽竹
何发
眼用制剂直接作用于眼部组织,其质量要求在所有剂型中处于较高水平。辅料的微量变化、包材的相容性、生产工艺中的微生物负荷,均可能影响产品安全性。近年来,国家药品监管部门对眼用制剂的抽检频次和审评标准持续提升,行业整体容错空间进一步收窄。
2026-08-05 小药童
本文围绕人工智能技术赋能医药产业发展,展开路径探索和对策研究。通过对浙江省内医药企业、临床机构及 AI 制药企业进行走访调研,梳理人工智能技术在药品研发、药物临床与药品生产三大领域的应用现状、核心问题与需求痛点。调研显示,人工智能技术在医药领域的应用仍面临数据孤岛、人才短缺、法规不明、成本高昂等诸多挑战。本文最后提出针对性对策与建议,为完善人工智能在医药产业领域的应用提供参考。
2026-08-05 唐谦,郭晶晶,王冠
自 2009 年创立以来,“弗戈制药工程论坛” 已成功举办十七届,逐步成长为制药领域集 “产学研用”于一体的高端对话平台。2026(第十八届)弗戈制药工程论坛将于8月19-20日在苏州盛大启幕,本届论坛设置1大主论坛 + 8场分论坛 + 1场专题培训,聚焦制药生产工艺、工程设计、设备管理与质量合规等核心议题。 “未来药厂工程设计与数字化交付”分论坛将于8月19日下午登场,7场重磅演讲,从AI赋能的数字化工厂到制药工厂碳中和实施路径,从柔性制造到数字化交付全生命周期管理,干货满满,不容错过!
2026-08-04 本网编辑
2026-06-08
2026-07-13
2026-05-20
2026-06-26
2026-06-01
2026-05-25
2026-06-15
本文以某制药产线的灌装机设备为研究对象,采用计算流体动力学(CFD)仿真技术对充氮装置的充氮性能进行分析,并结合分析结果对氮幕结构进行了优化设计。随后,针对优化方案进行性能仿真验证,结果显示优化后的顶空残氧量降低至0.252%。为了进一步验证优化方案的实际效果,将优化方案应用于实际产线进行性能测试,测得的顶空残氧量为0.68%,这一结果满足了小于1%的要求,表明其充氮保护性能已达到国际先进水平。
作者:王志刚、刘依宽、刘佳鑫
评论
加载更多