生成式AI安全风险与火山引擎解决方案
生成式AI产业发展与安全挑战
基础模型能力快速拓展,从文本到多模态表达,并从“调用型”向“智能体化”工作流演进。企业正从“单点试验”转向“平台化建设”,需在性能、合规、成本、可运维性之间找到动态平衡。模型选择从“追最新”转向“适配业务”,强调稳定性、可控性与治理可视。
在模型层,提示词注入、越狱攻击、对抗样本与模型投毒带来输出失真与能力滥用的风险。数据层,训练与推理数据的污染、隐私泄露与越权访问是核心风险源。应用层,插件、工具与外部调用的安全新面貌,需要“意图识别与动态授权”。
生成式AI安全风险
- 监管合规风险:全球各国正加快构建针对人工智能领域的法律法规要求与合规监管框架。中国已建立《网络安全法》、《数据安全法》、《个人信息保护法》三大法律基石,并出台《互联网信息服务算法推荐管理规定》、《互联网信息服务深度合成管理规定》、《生成式人工智能服务管理暂行办法》等法规要求。
- 数据隐私风险:生成式人工智能依赖海量数据,但在数据大规模收集、存储、训练、推理等过程中,存在数据与隐私安全风险。数据收集阶段可能包含个人信息、商业秘密信息、虚假信息、不真实信息、偏见信息等;数据存储阶段存在安全漏洞,可能导致核心数据被批量泄露;模型训练阶段可能被提取训练数据;模型推理阶段可能导致数据被第三方非法获取;内部人员违规操作或者人为疏漏也是常见诱因。
- 生成式AI自身安全风险:AI 基础设施安全风险包括算力滥用、网络隔离薄弱、供应链漏洞、访问控制缺陷等;模型与平台安全风险包括模型泄露、数据隐私泄漏、对抗攻击、后门与中毒、内容安全风险、传统 Web 安全风险等;AI 智能体安全风险包括 Prompt 注入、工具滥用、供应链安全风险、隔离机制失效、传统 Web 安全风险等。
火山引擎生成式AI服务安全保障体系
- 安全责任:火山引擎将自身定位为AI 云原生的可信安全基础设施提供者,以“安全即服务”的方式,承载企业的 AI 工作负载与治理能力,建立客户信任与透明度的长期机制。火山引擎构建“技术领先、治理完善、生态开放”的AI安全能力。
- 合规资质与认证:火山引擎致力于保障平台安全合规,为客户提供服务的大模型均以服务技术支持者的角色完成算法备案与生成式人工智能服务备案,并且针对大模型平台单独开展网络安全等级保护测评。火山引擎积极参与国家标准、行业标准的制定,并通过国际、国内独立第三方专业机构验证大模型相关产品安全合规能力。
- 数据安全与隐私保护设计理念:相较于传统AI,大模型或者生成式AI的数据与隐私安全的关键挑战在于云上大模型的数据安全问题、模型记忆和数据提取攻击问题、黑盒模型的可解释性问题。火山引擎方舟可信人工智能系统(ArkTrustAI System)提出生成式人工智能安全互信计算框架,其旨在结合隐私增强、可信计算等安全计算技术,实现云上模型推理和训练过程中数据和模型的数据安全和隐私保护能力。
- 生成式AI安全技术保障体系:火山引擎基于AI业务,构建了一套以透明可信为核心的“三层级”生成式AI安全保障体系。“三层级”涵盖了AI基础设施安全、模型与平台安全、AI智能体安全。AI 安全研究则是不断发掘新兴安全风险探索防护方案,并为“三层级”安全能力提供技术支持和方向指引。
AI基础设施安全
- 平台基础安全:治理架构与规范体系、内外合规、默认安全、平台基础防护、威胁情报与供应链、攻防演练与外部验证。
- 增强安全方案:固件资产管理与漏洞响应、硬件可信根、可信执行环境。
AI模型与平台安全
- 模型安全:安全原则、模型生命周期安全(数据标注、预训练、后训练与上线)。
- 平台安全:安全互信计算架构、推理会话数据零留存、自持密钥用户完全自主可控、机密推理塑造“硬件级”安全信任根基。
AI智能体安全
- 身份与权限管理:基本原则、安全特点与设计。
- 工具管理与准入:多租户体验模式、单租户部署模式、工具自动化准入、纵深防御与加固(大模型防火墙、Jeddak AgentArmor)。
生成式 AI 行业安全展望
- 安全左移与 AI-Native 安全开发运维(DevSecOps)成为共识:安全不再是模型上线后的“附加品”,而是贯穿于数据采集、模型训练、应用开发到部署运维的全生命周期。
- 从“单点防御”走向“体系化、智能化”:企业需要构建覆盖基础设施、模型、平台到智能体的纵深防御体系。AI 技术也将被更广泛地应用于安全运营。
- 开放生态与责任共担成为主流:AI 安全生态的建设离不开开放协作。云厂商、模型提供方、应用开发者与最终用户需共同承担安全责任。