GB/T45654—2025 网络安全技术生成式人工智能服务安全基本要求
本文件规定了生成式人工智能服务在训练数据安全、模型安全、安全措施等方面的要求,适用于服务提供者开展生成式人工智能服务相关活动,也为相关主管部门以及第三方评估机构提供参考。文件重点关注数据来源安全、数据内容管理、数据标注安全、模型训练安全、模型输出安全、模型监测测评、模型更新升级安全、模型环境安全、服务适用人群、场合、用途、服务透明度、收集使用者输入信息用于训练、接受公众或使用者投诉举报、向使用者提供服务、服务稳定持续、端侧模型服务等方面的安全要求。其中,生成内容安全性合格率应不低于90%,模型对应拒答测试题的拒答率不低于95%,对非拒答测试的拒答率不高于5%。文件还提出了针对训练数据及生成内容的主要安全风险(如包含违反社会主义核心价值观的内容、包含歧视性内容、商业违法违规、侵犯他人合法权益、无法满足特定服务类型的安全需求等)和安全评估参考方法。