核心观点
- 行业领先者保持领先,但安全框架存在结构性缺陷:Anthropic、OpenAI 和 Google DeepMind 在整体安全实践中保持领先,但它们都存在安全框架结构性缺陷,例如缺乏量化阈值、独立的审计和明确的决策权。
- 欧洲存在不协调现象:尽管欧盟在 AI 安全监管方面处于领先地位,但欧洲顶尖 AI 公司 Mistral 在安全方面的表现最差。
- 全球安全问题:三个公司(美国的 xAI、中国的 DeepSeek 和欧洲的 Mistral)获得不及格的成绩,表明安全问题是一个全球性问题,而非区域性问题。
- 转向军事 AI 使用:从 2024 年到 2026 年,包括 Anthropic、OpenAI、Google DeepMind 和 Meta 在内的公司逐渐放弃了禁止军事应用的立场,转而寻求国防合作伙伴关系。
- 存在风险规避行为:即使行业领先者在安全实践方面也退出了之前的承诺,例如单方面暂停的承诺,一些公司以竞争对手的条件为借口。
- 生存安全是最薄弱的领域:行业在生存安全方面表现最差,没有一家公司获得 C- 以上的成绩。
- 安全言论与实际行为脱节:Google DeepMind、OpenAI 和 xAI 的领导层公开言论与其商业行为和法律立场不一致。
- 安全框架缺乏执行力:尽管美国和欧盟的合规截止日期临近,但 Anthropic、OpenAI、Google DeepMind、Meta 和 xAI 发布并更新了更完善的安全框架,但这些框架有时缺乏量化阈值、独立的审计和明确的决策权。
关键数据
- 排名:Anthropic 排名第一(C+),OpenAI 和 Google DeepMind 分别排名第二和第三(C+ 和 C)。
- 不及格的公司:xAI、DeepSeek 和 Mistral。
- 军事 AI 使用:从 2024 年到 2026 年,包括 Anthropic、OpenAI、Google DeepMind 和 Meta 在内的公司逐渐放弃了禁止军事应用的立场。
- 生存安全:没有一家公司获得 C- 以上的成绩。
研究结论
- 需要外部验证和竞争压力:前沿 AI 安全的信誉不能再依赖于自我管理;它需要外部验证和竞争压力下的实践。
- 需要加强监管和执法:现有的立法为问责制提供了真正的杠杆,但只有严格执行才能发挥作用。
- 需要保持承诺:公司必须保持其公开的阈值和红线,并履行暂停承诺。
- 需要改进方法:需要通过改进方法、与政策制定者、研究人员和从业者更紧密地合作来解决局限性。