Large语言模型(LLMs)虽然能快速构建AI概念验证(PoCs),但在生产环境中面临严峻的安全挑战。企业应实施AI信任、风险和安全管理(TRiSM)控制,以减少错误决策。报告重点分析了LLM系统中的常见安全风险及应对策略。
核心风险
- 常见安全风险:包括提示注入、敏感数据泄露、不当输出处理、过度代理、系统提示泄露、不可靠内容、错误信息和不限界消耗。
- 风险来源:主要源于API调用(如OpenAI)的LLM系统,涉及流式(实时聊天)和批量(智能数据处理)模式,并包含检索增强生成(RAG)和LLM代理组件。
关键数据
- OWASP Top 10安全风险适用于API式LLM系统,其中提示注入、敏感信息泄露和不当输出处理最为突出。
- 医疗、电信、金融行业需遵守HIPAA、COPPA等法规,防止PII泄露。
安全策略
- 分层防御:通过业务、数据、工程、运营全周期实施安全策略,持续更新以应对新风险。
- RACI矩阵:明确数据科学、MLOps、安全运营等部门在风险缓解中的职责(如限制提示范围、权限最小化)。
- LLM护栏:作为Gen AI模型与输出间的安全控制,通过过滤器、规则逻辑或AI方法(如分类器)实现。
解决方案对比
- 云护栏(如Amazon Bedrock Guardrails):降低攻击通过率(如云护栏使攻击通过率降至2.9%),但增加1.19秒延迟。
- 定制护栏(如guardrails.ai框架):将攻击通过率降至0.06%,但延迟达13.9秒。
研究结论
- 护栏可有效缓解多数风险,但需平衡精度与召回率,定制化方案更适配特定场景。
- 误报(如用户请求被阻断)需通过LLM评估和漏洞扫描优化。
- 非结构化风险(如错误信息)仍需专项解决方案。
- 企业应持续更新系统时采用多层安全策略,并关注LLMOps成熟度提升。