当前,人工智能技术正经历从“对话智能”向“决策智能”跃迁的关键发展阶段。基于大语言模型的AI智能体已实现质的突破,其功能定位已从基础指令执行单元转型升级为具备复杂认知推理与战略决策能力的智能系统,最终发展为能够自主感知环境态势、独立制定行动方案并高效执行任务的"数字协作伙伴"。这一技术范式的革新显著拓展了人工智能的应用疆域,在金融风险管控、智慧医疗体系、先进制造产业及社会化公共服务等诸多领域,AI智能体正持续推动生产模式与服务形态的深度变革。
然而,技术能力的显著提升亦伴随着潜在风险的同步增长。近期发生的多起人工智能智能体安全事件,充分暴露了该领域现存的脆弱性特征。AI智能体不仅继承了传统大语言模型的模型与数据层面的常见风险(如越狱攻击、对抗样本攻击、提示注入、数据投毒等),还因其具备多模态感知、自主规划与执行等特性,衍生出一系列独特的系统性风险,主要体现在多源感知失效风险、决策幻觉风险、对话记忆污染风险和工具恶意执行风险等方面。
为应对这些挑战,全球各国和标准化组织正在积极推动AI智能体安全标准的制定与治理体系的构建。AI智能体的安全治理思路愈发清晰,其核心目标围绕“安全、可控、可信”三大维度展开:安全性是基础,可控性是底线,可信性则是保障。AI智能体的安全治理应分层推进,形成多维度的治理体系,构建动态防御体系,打造集防护、监测、评测于一体的闭环防护机制。
AI智能体的安全风险贯穿感知、决策、记忆与执行四个层面。感知层作为外部环境多源信息的入口,易受到指令劫持、传感器干扰及协议漏洞等攻击,导致输入环节的不可信性。决策层依托复杂的推理链条与多次模型调用,风险主要表现为逻辑错误的放大和模型幻觉。记忆层在长期存储与调用历史信息过程中,存在内容篡改、恶意植入及隐私数据泄露等隐患。执行层则因链条脆弱和缺乏约束,可能将错误决策转化为失控行为,造成严重后果。尤为突出的是,AI智能体风险具有显著的层级传导特性,单一环节的漏洞即可沿“感知失真—决策误判—执行失控”的路径放大危害。
中国电信自主研发星辰智能体平台,通过集成全流程安全能力,构建覆盖数据安全、模型安全、内容安全、应用安全一体化的安全治理框架,实现平台环境、大模型安全、智能体平台安全、智能体应用安全、应用终端安全全环节安全防护,成为保障AI智能体生态安全的核心支撑。蚂蚁集团针对MCP存在的安全风险,自主研发轻量级MCP安全扫描工具MCPScan,是业界首个结合静态污点分析和智能动态代码关联的多阶段扫描器,有效发现并防御MCP环境下的典型安全问题。中国信通院联合50余家单位发布业界首个智能体安全标准,构建了覆盖多场景、多风险的评测框架,并结合端侧特有的约束与特性,通过自动化技术,突破传统人工评测瓶颈,实现移动端智能体全流程安全分析。
为了更好的推进AI智能体的安全治理,还需要从完善AI智能体安全治理顶层设计、夯实AI智能体安全技术能力和强化AI智能体前沿场景安全布局三个方面持续开展工作。