核心观点: 该研报由 Future of Life Institute 发布,旨在评估八家领先 AI 公司在管理先进 AI 系统的即时危害和灾难性风险方面的努力。评估结果显示,尽管这些公司在 AI 安全方面取得了一些进展,但整体而言,其安全承诺仍然落后于其能力发展。
关键数据:
- 排名: Anthropic、OpenAI 和 Google DeepMind 位列前三,其中 Anthropic 在所有领域都获得了最高评分。xAI、Z.ai、Meta、DeepSeek 和 Alibaba Cloud 紧随其后,但在风险评估披露、安全框架完整性和治理结构等方面存在较大差距。
- 存在性安全: 该领域仍然是该行业的结构性缺陷。尽管公司加速了通用人工智能(AGI)和超级智能的野心,但还没有一家公司提出了防止灾难性滥用或失去控制的可靠计划。没有公司在“存在性安全”领域获得高于 D 的分数。
- 安全框架: xAI 和 Meta 已经采取了有意义的方法来发布结构化的安全框架,但范围有限,可衡量性和独立监督也有限。
- 风险评估: 更多公司进行了内部和外部评估,但风险范围仍然狭窄,有效性较弱,外部审查远非独立。
- 当前危害: 公司在当前危害评估方面表现不佳,普遍存在安全失败、鲁棒性不足和严重危害控制不力的问题。
- 信息共享: 公司在信息共享和公共信息传播方面表现差异很大。Anthropic 和 OpenAI 领先,而 Meta 和 Alibaba Cloud 落后。
研究结论:
- AI 生态系统中的公司安全承诺持续落后于其能力野心,即使是表现最好的公司也缺乏具体的安全保障、独立监督和可信的长期风险管理策略。
- 存在性安全仍然是该行业的核心结构性缺陷,公司加速 AGI/超级智能的野心与缺乏可信的控制计划之间的差距越来越大,令人担忧。
- 需要采取紧急措施,加大对对齐研究的投资,并显著改进风险管理实践,以应对 AI 技术快速发展带来的风险。