生成式人工智能服务安全应急响应指南(V1.0-202509)
范围
本指南描述了生成式人工智能服务安全事件的分类、分级方法和应急响应过程的管理措施和技术方法,适用于生成式人工智能服务提供者及相关部门。
规范性引用文件
指南引用了多项国家标准,包括《信息技术安全技术信息安全事件管理》、《网络安全事件分类分级指南》、《信息技术服务运行维护》和《生成式人工智能服务安全基本要求》等。
术语和定义
定义了“生成式人工智能服务”、“生成式人工智能服务提供者”、“生成式人工智能服务安全事件”等关键术语,并明确了违法不良信息的范围。
生成式人工智能服务安全事件分类
- 分类方法:按照GB/T20986-2023标准,分为信息内容安全事件、数据安全事件、网络攻击事件等。
- 常见事件类型:
- 信息内容安全事件:违法信息生成、虚假有害信息生成、煽动教唆信息生成、权益侵害信息生成、歧视性信息生成。
- 数据安全事件:数据泄露、数据篡改、数据投毒。
- 网络攻击事件:模型篡改、拒绝服务、漏洞利用、社会工程。
- 其他安全事件:其他与生成式人工智能服务相关的安全事件。
生成式人工智能服务安全事件分级
- 分级要素:事件影响对象的重要程度、业务损失的严重程度、社会危害的严重程度。
- 分级标准:特别重大事件、重大事件、较大事件和一般事件(一级至四级)。
- 分级规则:综合考虑业务损失和社会危害,取两者中较高的级别确定最终级别。
生成式人工智能服务安全应急响应过程
应急准备
- 管理措施:制定应急策略、安全事件管理计划、应急响应预案、事件升级策略、上下线管理审查程序、建立IRT、培训和技术支持、应急演练。
- 技术方法:建立关键词库与测试题库、数据安全防护与审计、应对网络攻击的安全配置。
- 外部协同:建立与供应商、第三方安全机构、行业主管部门等协同机制。
监测预警
- 管理措施:制定监测策略、执行监测任务、建立预警机制、建立快速响应机制。
- 技术方法:实时监测(模型输入/输出异常内容监测、数据访问行为监测、模型参数变化监测、漏洞扫描)、数据分析、安全预警。
- 外部协同:收集利益相关方提供的监测线索、共享威胁情报和预警信息。
应急处置
- 管理措施:评估与决策、启动应急响应预案、应急调度、排查与诊断、处理与恢复、服务测试评估、事件关闭、服务上线管理审查。
- 技术方法:安全事件分级处置、安全事件报送(即时报送主管部门研判、自行处置定期报送)、安全事件分类处置技术措施(快速隔离、修复漏洞、调整或重新训练模型)、服务恢复测试与评估。
- 外部协同:向其他利益相关方通报安全事件信息、寻求技术支持。
总结改进
- 管理措施:应急响应工作总结、应急响应工作审核、应急响应工作改进。
- 技术方法:经验反馈机制、模拟测试、技术审计、知识管理和更新。
- 外部协同:用管联动、知识协同。
附录A:生成式人工智能服务安全应急响应典型案例
- 案例1:歧视性信息生成事件安全应急响应案例。
- 案例2:虚假信息生成事件安全应急响应案例。