核心观点
- 行业安全承诺滞后于能力发展: 尽管顶级AI公司致力于开发更强大的AI系统,但其在风险管理方面的投入和安全规划仍存在严重不足,导致安全承诺与能力发展之间存在巨大差距。
- 顶级公司与次顶级公司差距显著: Anthropic、OpenAI和Google DeepMind在安全实践中保持领先,但次顶级公司(xAI、Z.ai、Meta、DeepSeek和Alibaba Cloud)在风险评估披露、安全框架完整性和治理结构等方面存在明显差距。
- 存在主义安全是结构性缺陷: 尽管公司加速了通用人工智能(AGI)和超级智能的发展,但它们尚未提出可信的计划来防止灾难性滥用或失去控制。存在主义安全领域仍然是该行业的核心结构性缺陷。
- 安全框架和治理结构亟待改进: 大多数公司的安全框架范围狭窄,阈值定性且不明确,缺乏独立监督机制。同时,公司在内部治理结构、问责制和透明度方面也存在不足。
关键数据
- 排名前三的公司: Anthropic、OpenAI和Google DeepMind。
- 次顶级公司: xAI、Z.ai、Meta、DeepSeek和Alibaba Cloud。
- 存在主义安全评分: 没有公司在该领域获得高于D的评分。
- 风险评估: 没有公司进行过人类提升试验,外部评估也缺乏独立性。
- 当前危害: 公司在安全基准测试中的表现普遍不佳,隐私保护也不到位。
研究结论
- 所有公司必须超越高级别的存在主义安全声明,并制定具体的、基于证据的保障措施,具有明确的触发器、现实的阈值和证明的监控和控制机制,以减少灾难性风险暴露。
- 公司应将新兴治理框架(如欧盟AI行为准则)视为基准,采取切实措施改进安全实践,包括加强独立监督、透明威胁建模、可衡量阈值和明确定义的缓解触发器。
- 随着国际标准和完善监管报告义务的成熟,公司应将这些框架视为向严格、可执行和独立验证的安全措施的转变的锚点。