登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
其他报告
/
报告详情
开发者内部AI模型使用风险报告
2026-04-27
IAPS
Angie
内部模型为何带来独特风险
独特风险
:前沿人工智能公司内部模型的潜在风险,与外部部署系统的风险有所不同,有时甚至更大。
风险特征
:
优先访问权限
:内部模型以及使用它们的员工通常可以访问训练基础设施、安全评估流程、模型权重、安全控制以及专有代码库等敏感系统。
缺乏外部监督
:公司内部专用的模型在开发和测试过程中,外部审查有限。
功能更强
:任何公司在特定时间点功能最强的系统,通常在公开发布前会内部部署数周或数月。
更高的滥用风险
:前沿公司的内部人士可能会使用或开发仅有助于模型变体——这些模型版本通常不应用通常用于面向公众的模型的安全过滤器。
加剧风险的因素
:
AI研发自动化
:公司可能更不愿意公开部署那些能显著加速人工智能研发的模型,以免帮助竞争对手。
自动化研发的超人速度
:可能会使人类监督能力面临压力。
特权访问
:用于自动化人工智能研究的AI模型将需要广泛访问公司代码库、训练基础设施和计算资源来运行实验,这种特权访问增加了模型不当行为可能造成的损害。
威胁向量与有害后果
两大威胁向量
:
自主式AI不当行为
:模型可能自行采取有害行动,例如对评估进行微妙干预或秘密行动。
内部威胁
:拥有特权的员工或承包商可能会滥用、窃取或恶意修改内部模型。
有害后果
:
内部人工智能研发的破坏
:一个流氓人类或人工智能模型可能破坏安全和对齐研究,或操纵后续人工智能模型的训练。
直接的灾难性滥用
:人工智能公司内部人员可能利用先进内部模型能力,用于生物武器开发、大规模网络攻击或其他造成广泛危害的行为。
模型权重泄露
:一个恶意的人类或人工智能可以制作并分发未经授权的模型权重副本。
内部使用风险报告的法律依据
三大主要人工智能监管框架
:加利福尼亚州的《前沿人工智能透明度法案》(SB 53)、纽约州的《负责任人工智能安全与教育法案》(RAISE法案)以及欧盟的《通用人工智能实践守则》。
要求
:前沿AI模型的开发者撰写并发布一套前沿AI框架,该框架需包含应对内部使用风险的条款,并提交内部使用风险报告,描述其安全措施及安全措施未能充分解决的风险残留。
本指南
:为公司提供了统一标准,以制作适用于上述三个监管框架的内部使用风险报告。
风险因素与报告范围
风险框架
:AI开发者应致力于构建一个“安全论证”,即一个有证据支撑的结构化论点,证明该AI系统是可接受的、安全的。
风险因素
:针对自主AI和内部人员威胁模型(参见表格1)中的三种风险因素逐一进行讨论:
能力
:模型或内部人员是否具备造成相关损害的技术能力。
动机
:模型或内部人员是否有意造成损害。
机会
:在现有的访问控制、权限、监控和其他安全措施下,模型或内部人员是否有可能在不被发现的情况下获得造成损害的机会。
报告覆盖范围与频率
报告范围
:AI开发者应专注于报告其最高风险内部系统的风险,且报告的全面性应随着模型能力自上次风险报告以来的进步幅度而扩展。
报告频率
:季度报告在许多小变化共同构成对风险轮廓的重大更新时,可作为后备措施。
报告标准
公开摘要的删减
:为保护知识产权或公共安全,公开摘要可能需要根据需要进行删减。
内部威胁报告的单独附件
:开发者还应将内部威胁报告作为一份独立的保密附件提交给监管者。
反驳意见
:报告应当呈现对其自身安全结论的最有力反驳意见。
不确定性
:不确定性应在可能的情况下被明确承认并加以界定。
解释遗漏
:若公司遗漏了本指南中列出的证据类别,则应说明在该公司的具体情况下,该证据为何缺乏信息量。
技术附件
:所有评估的完整方法论细节应在技术附件中提供。
与现有框架保持一致
:报告应在可能的情况下与现有框架保持一致。
与风险相称
:报告的预期深度和广度应与自上次报告以来能力或风险增加的幅度成比例。
自主AI不当行为
证据:含义
:如果模型明显缺乏执行相关不当行为路径的能力,这为安全案例提供了证据。
证据:动机
:若一致性证据支持结论——即模型即便拥有手段和机会也不会采取有害行动——这便为安全案例提供了证据。
证据:机遇
:如果访问控制、监控和其他安全措施能够可靠地阻止模型访问敏感系统,或者在有害行为成功之前就检测到它们,这就能为安全案例提供证据。
内部威胁
证据:含义
:内部威胁的手段结合了内部人员的技能和资源,以及内部模型提供的功能提升能力。
证据:动机
:若已建立完善的审查流程,疲惫不堪的人员数量较少,且威慑机制有力,这便为安全案例提供了依据。
证据:机遇
:如果访问权限范围严格,监控全面,且安全控制可靠地预防或检测内部人员的滥用、泄露和修改,这就为安全案例提供了证据。
你可能感兴趣
互联网传媒行业周报:周观点:Stable Diffusion 3可通过API使用,百度举办AI开发者大会
文化传媒
上海证券
2024-04-22
开发者如何使用生成式AI创建新一代游戏
文化传媒
Google Cloud
2025-08-15
传媒行业周报:ChatGPT升级为AI搜索引擎,GitHub Copilot宣布为开发者引入多模型选择
信息技术
国盛证券
2024-11-03
Create 2025 AI开发者大会:推动模型调用成本进一步下探和应用生态繁荣
招银国际
2025-04-28
2025年平衡AI使用与风险:全球DevSecOps状况报告
信息技术
Black Duck
2025-10-18
美银前沿AI数据追踪器:模型排名、使用数据及Token/GPU成本
信息技术
美银证券
2026-08-17
AI周观察:Claude内部模型引发网安股震荡,交换机市场稳步上升
电子设备
国金证券
2026-03-29
基于内部模型的市场风险资本要求方法
国际清算银行
1995-04-21
开发数据驱动的腐败风险模型以加强比利时的廉正:联邦内部审计的实际考虑
房地产
OECD
2025-10-26
将 “回溯测试 ” 与内部模型方法结合使用以满足市场风险资本要求的监管框架
国际清算银行
1996-01-04