1. 背景
- 智能体AI(Agentic AI)由于其规划、推理、工具利用和自主能力,需要更全面的评估,其攻击面和失效模式远超标准LLM或生成式AI模型。
- 智能体AI的持续决策自主性要求我们超越传统红队测试方法来评估和 securing 这些智能体/服务。
- 本项目最初由 DistributedApps.ai 发起,旨在提供一份实用的指南,包含测试智能体AI系统的可操作步骤。
- 该指南基于“跨行业智能体AI顶级威胁”框架,该框架最初由 Ken Huang 创建,并得到了 Precize Inc. 的 Vishwas Manral 和 AI 及网络安全社区许多贡献者的支持。
2. 范围和受众
- 本文档专注于智能体AI系统的实用、可操作的红队测试。
- 不在范围内的内容包括:威胁建模、风险管理、传统应用安全测试、通用AI/ML模型红队测试和缓解措施。
- 主要受众是经验丰富的网络安全专业人员,特别是红队人员、渗透测试人员和智能体AI开发者。
- 次要受众包括AI开发者/工程师、安全架构师和AI安全/治理专业人员。
3. 概述
- 生成式AI(GenAI)系统主要关注单轮交互,而智能体AI系统则设计用于长时间自主运行,可以计划、推理、行动、协调和学习适应。
- 红队人员可以利用许多现有的专业知识,例如应用安全基础知识、API安全、网络安全、GenAI红队技术、软件供应链安全、社会工程技能、隐蔽信道利用和威胁建模。
- 智能体AI的自主性引入了新的安全挑战,例如涌现行为、非结构化通信、可解释性挑战和复杂的攻击面。
- 红队测试智能体AI非常重要,因为它们的非确定性本质意味着输出和行动可能即使输入相同也会有所不同,创建标准测试无法解决的不可预测场景。
4. 详细指南
- 本节提供了如何执行红队测试的详细说明,列出了测试要求、可操作步骤,并在某些情况下提供了示例提示,以指导红队练习。
- 该指南涵盖了12个关键漏洞类别:
- 智能体授权和控制劫持
- 检查器脱节
- 智能体关键系统交互
- 目标和指令操纵
- 智能体幻觉利用
- 智能体影响链和爆炸半径
- 智能体知识库中毒
- 智能体内存和上下文操纵
- 智能体编排和多智能体利用
- 智能体资源和服务耗尽
- 智能体供应链和依赖攻击
- 智能体不可追溯性
- 每个类别都提供了测试要求、可操作步骤和示例提示。
5. 结论
- 智能体AI系统由于其能够计划、推理、行动和适应自主性,引入了全新的安全挑战。
- 该指南提供了一个结构化、可操作的框架,用于识别和减轻特定于智能体AI系统的漏洞。
- 随着这些系统越来越集成到企业和关键基础设施中,主动红队测试必须成为一种持续的功能。
6. 未来展望
- 未来需要关注以下优先领域:
- 自主红队智能体
- 下游行动红队
- 安全多智能体编排
- 标准化指标和基准
- 与监管框架的协调
- 开源安全工具和研究
- 列举了一些先进的红队测试框架和工具,例如 MAESTRO、AgentDojo、Agent-SafetyBench、AgentFence、SplxAI Agentic Radar、Agent Security Bench、Promptfoo LLM Security Database、Pentest Copilot 和 AI Red Teaming Agent。
7. 最终思考
- 智能体AI代表着机遇和风险。虽然这些系统可以增强自动化、优化和自主决策,但它们也引入了传统网络安全方法无法解决的独特安全挑战。
- 红队测试智能体AI系统可以采用结构化的方法,包括准备、执行、分析和报告,以确保系统性地评估和减轻安全漏洞。
- 鼓励红队人员和测试人员就具体的、可衡量的指标达成一致,以衡量安全控制的有效性。