大模型安全挑战与演进之路
大模型全生命周期安全挑战
大模型在训练、部署和业务运营阶段面临不同的安全风险:
训练阶段
- 数据选择与清洗:数据质量直接影响模型成败,需平衡准确性、多样性,识别并去除价值观不符、偏见歧视内容,进行数据血缘分析和隐私信息识别。
- 数据安全:企业核心资产数据面临泄露、篡改风险,需加密存储,防止内部人员恶意操作,并确保数据合规。
部署阶段
- 模型保护:防止数据/模型被窃取,需实现私有化部署下的安全防护。
- 数据合规:需满足语料数据、日志数据的合规要求,防止数据泄露。
业务运营阶段
- 接口安全:保障接口安全,防范投毒反馈等黑产攻击。
- 内容安全:保障提问内容和输出内容安全,特别是防范提示注入攻击和梯度攻击。
大模型安全的演进之路
技术选择
- 安全对齐:虽能解决人类价值观问题,但存在实时性风险和知识需求,模型重新训练耗时。
- 传统内容审核:无法应对多轮对话和指代映射问题。
解决方案
- 内容安全:需与基础模型自身能力适应,关注准确率,包括长文本准确率和带场景输入安全。
开始原生安全之路
原生安全四要素
- 数据清洗:识别并处理数据中的风险内容。
- 安全围栏:构建对抗性防御架构,实现数据流控制和持续评估。
- 安全对齐:通过人类反馈强化学习和有监督精调,强化模型人类价值观对齐。
- 持续运营:通过巡检模型发现错误,前置过滤与错峰巡检优化性能。
关键要点
- 信任域检索:使用安全语料强化基础模型对齐,结合搜索引擎构建时效性信息。
- 大模型防火墙:持续运营评估,使用裁判模型和巡检模型实现例行化巡检。
- 弱化指令跟随:在微调阶段减少指令跟随,降低高级攻击风险。
关注智能体安全
场景安全
- 广告Agent:防范虚假宣传、涉诈风险。
- K12教育Agent:关注早恋、吸烟、游戏沉迷等问题。
安全挑战
- Prompt泄露:未经加固的GPTs易泄露知识库。
- RAG投毒:外部知识库风险需重视,特别是用户参与构建的知识库。
- 责任边界:明确应用与基础模型的责任划分。
防护措施
- 纵深防御架构:结合安全原则,如禁止角色扮演、防护指令、结构化查询等。
- 安全原则:明确指令边界,通过系统指令明确规则,使用结构化查询限定指令空间。
总结
- 通过数据清洗与安全对齐实现模型内生安全。
- 内生安全与外层防护配合,实现纵深安全。
- 关注Agent安全,通过弱点分析发现问题。