AI Agent 数据流攻与防
核心观点
AI Agent 已从简单的问答工具发展为复杂的业务链路,其安全问题不再局限于模型输出,而是延伸至数据流的全过程。攻击者通过间接注入和数据流劫持等手段,可操控 Agent 的决策和行为,导致数据泄露、业务破坏等风险。
攻击方式
间接注入
攻击者通过控制不可信内容进入 Agent 的决策链,实现数据流劫持。攻击链路包括:
- Seed 投放载荷:攻击者植入恶意内容。
- Trigger 会话触发:通过特定会话触发攻击。
- Hijack 劫持能力:劫持 Agent 的执行能力。
- Impact 影响落地:实现最终攻击目标。
攻击案例
- Hack Copilot:从网页投毒到会话泄露。
- Hack OpenHands:从 Issue 投毒到 Token 泄露。
企业 Agent 应用链路
企业 Agent 的典型数据流链路包括:
- 数据来源:用户、终端、业务系统、RAG、Memory、工具。
- 上下文构建:数据被拉取、裁剪、组合、传入模型。
- 模型上下文:数据在被看见、执行、沉淀后改变边界。
- 数据流向:模型上下文输出与沉淀,最终影响工具调用、日志、Trace、报告、Memory。
数据流边界控制
五类可被打穿的数据流边界
- 模型入口(Gateway):中心化敏感治理,识别、替换、阻断敏感数据。
- 终端(端侧代理):第一跳控制,本地替换、阻断和最小化数据。
- 工具结果(Tool/API):工具结果准入,决定原始结果是否进入模型。
- 业务上下文编译(SDK/Middleware):定义业务对象字段裁剪和结果写回控制。
- 知识与记忆入口(RAG/Memory):治理来源、ACL、可信度、生命周期和污染下架。
边界主战场
- A/B/C 边界:离数据流转最近,易先落地。
- D/E 边界:提供语义和生命周期管理,非后置装饰。
边界治理实践
A Gateway:管模型入口出口
- 模型流量控制:识别应用、用户、租户、会话,检查敏感内容。
- 替换与阻断:高危明文阻断,敏感字段替换成 token 或占位符。
- 响应与日志:检查模型响应敏感内容,脱敏日志。
B 端侧防御:管数据离开可信执行环境前
- 本地识别与替换:在可信环境内识别和替换高敏材料。
- 阻断出站前最小化:确保数据离开前已做最小化处理。
C Tool/API:管工具结果进入模型前
- 工具结果是证据,不是命令:帮助模型判断事实,但不能覆盖系统规则。
- API 能返回≠ 模型能看:进入模型前需解决两类风险。
D/E:业务上下文与长期记忆治理
- D 业务上下文编译:业务对象字段裁剪和写回控制。
- E 知识与记忆生命周期:入库、召回复用、下架管理。
实践 AgentGuard
- 意图拦截网关:面向 Agent 调用链,拦截越狱提示词。
- 多阶段意图识别拦截:实现最小落地闭环。
- 最小落地闭环:看得见、拦得住、可回归。