生成式大模型安全评估白皮书
生成式大模型在近年来取得了显著进展,其快速发展正在重塑全球人工智能技术格局,为数字经济高质量发展和智能化转型注入新的动能。然而,随着技术应用的不断扩展,其潜在的安全风险也逐渐凸显,如“大模型幻觉”、三星公司机密资料泄露等事件,反映了生成式大模型在隐私保护、恶意滥用、技术漏洞及合规性等方面的复杂挑战。
我国高度重视生成式大模型的安全发展,出台了《生成式人工智能服务管理暂行办法》等一系列政策文件,明确了生成式大模型技术在安全性、风险防控和合规性方面的基本原则和监管要求,为技术的健康发展提供了系统指引和政策保障。
生成式大模型的安全风险主要包括伦理风险、内容安全风险和技术安全风险。伦理风险包括加剧性别、种族偏见与歧视、传播意识形态危害国家安全、学术与教育伦理风险以及影响社会就业与人类价值等。内容安全风险包括可信与恶意使用风险(如制造恶意软件、传播虚假信息、违反法律法规)、隐私风险(如侵犯用户隐私信息、泄露企业机密数据)以及知识产权风险等。技术安全风险包括对抗样本攻击风险、后门攻击风险、Prompt注入攻击风险、数据投毒风险以及越狱攻击风险等。
为了应对这些安全风险,需要构建科学化、系统化的生成式大模型安全评估框架,从技术性能、风险防控、合规性等多个维度明确评估指标体系,系统性降低潜在风险,为行业提供权威的技术指导。白皮书从伦理性、事实性、隐私性、鲁棒性等多个维度对生成式大模型的安全性能进行评估,旨在全面涵盖生成式大模型的各类安全风险,为模型的安全部署与监管提供理论依据和实践指导。
白皮书还介绍了国内外生成式大模型的发展历程,及其在人类生产生活中的应用,并通过对大模型安全评估实践案例的分析,探讨大模型在实际应用中面临的安全挑战及其应对策略,以期为生成式大模型的安全使用提供有益参考。