登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
国际人工智能安全报告:第二次关键更新
信息技术
2025-11-01
-
未知机构
郭生根
核心观点与关键数据
风险管理技术发展
:自2025年1月发布首次关键更新以来,在人工智能风险管理方面取得了重要进展,包括改进训练方法以使模型更可靠且更能抵抗滥用,以及开发新的工具来标记、识别和追踪人工智能生成的内容。
纵深防御策略
:开发者正在采用纵深防御策略,结合训练、部署和部署后监控阶段的安全措施,以限制单个安全防护失效的影响,加强对误用和故障的整体保护。
对抗训练进展
:2025年,训练模型以抵抗恶意攻击的方法持续改进,提示注入攻击的成功率随着时间的推移而下降。然而,测试表明,当给予10次尝试时,熟练的攻击者仍然有一半的时间可以绕过安全措施。
开放权重模型风险
:开权模型落后于顶尖闭权模型不到一年,改变了风险格局。更大的开放可以支持透明度和创新,但也使得控制模型如何被修改和使用的难度加大。
数据中毒攻击
:研究表明,只要训练数据中插入250个恶意文档,攻击者就可以用特定的提示触发模型的非预期行为。此类数据中毒攻击无论模型大小,都需要相对较少的资源来实施。
人工智能内容追踪技术
:研究人员已开发出新的工具来标记、识别和追踪人工智能生成的内容,尽管实施仍然不一致。在正确使用和一致应用的情况下,诸如水印、内容检测和模型识别等技术可以帮助研究人员研究AI模型和系统的传播,追踪它们的输出,并验证人类创建的内容。
前沿人工智能安全框架
:拥有前沿人工智能安全框架的AI公司数量在2025年翻了一番以上:现在至少有12家公司拥有此类框架。这些框架描述了人工智能开发者计划在他们的模型变得越来越强大时实施的测试和风险缓解措施。
研究结论
风险缓解措施的有效性
:目前措施在预防危害方面的有效性往往不确定,并且有效性随时间和应用而变化。有许多机会进一步强化现有的保护技术和发展新的技术。
技术保障措施的局限性
:在整个人工智能生命周期中,开发者可以实施的技朧保障措施可以减少特定的漏洞,但它们存在显著的限制。当前的风险缓解方法可以被复杂的行动者规避,在不同部署环境中效果各异,并且往往执行不一致。
制度化的风险管理方法
:政府、企业和国际组织已开始将其转化为针对通用人工智能的具体治理要求和监督实践。自上次报告(2025年1月)发布以来,一些机构已经引入或更新了规范透明度、模型评估和事件报告等议题相关期望的框架。
基于证据的保证方法
:开发者和部署者开始采用保证工具来证实其通用人工智能产品的可靠性、鲁棒性和治理方面的声明。一种新兴的方法是使用安全案例,这些是结构化论点,它们对可接受的模型或系统行为并提供证据,证明模型或系统将在此范围内运行。
未来研究方向
:开发此类方法对于跟踪进展并确保技术和非技术风险缓解措施与不断发展的能力保持同步至关重要。系统行为并提供证据,证明模型或系统将在此范围内运行。尽管它们当前的采用有限,并且它们是否适合通用人工智能系统仍存在争议,但一些领先的人工智能开发人员现在在其风险管理框架中引用安全案例。
关键数据
提示注入攻击成功率
:根据人工智能开发者为2024年4月至2025年7月间发布的主要模型报告,提示注入攻击的成功率随着时间的推移略有下降,但在尝试十次的情况下,攻击者大约有一半的时间仍然可以成功执行此类攻击。
数据中毒攻击
:最少向模型训练数据中插入250个恶意文档,当给出特定提示时,就可能使其产生不期望的输出。
前沿人工智能安全框架公司数量
:2025年,拥有前沿人工智能安全框架的AI公司数量翻了一番以上:现在至少有12家公司拥有此类框架。
你可能感兴趣
国际人工智能安全报告:首次关键更新
信息技术
未知机构
2025-10-14
2026年国际人工智能安全报告:首次关键更新
信息技术
英国人工智能安全研究所&Mila
2025-10-23
国际AI安全报告-关于先进人工智能安全性的国际科学报告
信息技术
AI行动峰会
2025-01-31
2026年国际人工智能安全报告
信息技术
英国政府
2026-02-02
2024先进人工智能安全国际科学报告-中期报告
信息技术
英国政府
2024-05-22
关键基础设施安全部署人工智能框架-35页
信息技术
Homeland Security
2024-11-14
就业与劳动力关键趋势——第五届地中海联盟就业与劳工部长宣言优先事项第二次监测结果跨国家报告
信息技术
欧洲培训基金会&PPMI
2025-09-10
人工智能与国际安全研究动态第8期:国际智库及媒体对ChatGPT领域动向的评估
清华大学
2023-08-15
人工智能与国际安全研究动态第9期 :国际智库及媒体对人工智能国际治理动态分析
清华大学
2023-09-14
非国家行为体滥用人工智能及其对国际安全的影响
清华大学
2026-03-18