核心观点
- 行业整体安全准备不足: 尽管所有公司都声称将在十年内实现通用人工智能(AGI),但他们在存在性安全规划方面均未达到 D 以上的分数,缺乏应对 AGI 的有效控制计划。
- 公司间差距扩大: 部分公司在安全方面采取了更严格的措施,而其他公司则忽视了基本的安全保障,自愿承诺的不足凸显了监管缺失的问题。
- 安全评估方法存在缺陷: 即使是行业领导者,其安全测试也存在方法学上的不足,缺乏对风险的明确解释和独立验证,导致对危险能力的检测缺乏信心。
- 信息共享不足: 仅有 OpenAI 发布了完整的举报政策,大多数公司在系统提示和行为规范透明度方面存在不足,且缺乏对重大事件的公开报告机制。
关键数据
- 七家公司评估: Anthropic、OpenAI、Google DeepMind、Meta、xAI、Zhipu AI 和 DeepSeek。
- 评估指标: 涵盖六个领域,包括风险评估、当前危害、安全框架、存在性安全、治理与问责制以及信息共享,共 33 个指标。
- 评分体系: 采用美国 GPA 体系,从 A+ 到 F。
- 总体排名: Anthropic (C+) 位列第一,OpenAI (C) 和 Google DeepMind (C-) 紧随其后,其他公司得分均在 D 级或以下。
研究结论
- 需要加强安全监管: 现有的行业自律机制不足以应对 AGI 带来的风险,需要更严格的监管措施。
- 提高安全透明度: 公司应公开更多关于安全评估方法、系统提示、行为规范和重大事件的信息,以增强外界对其安全工作的信任。
- 改进安全框架: 公司需要制定更全面、更具操作性的安全框架,明确风险识别、评估、处理和治理的流程,并建立独立的监督机制。
- 加大安全研究投入: 公司应增加对安全研究,特别是对对齐和控制、可解释性、可扩展监督以及危险能力评估等方面的投入。