国际组织为推广安全、可靠和值得信赖的人工智能(AI),制定了针对开发先进AI系统的组织行为准则。该准则基于风险方法,适用于学术界、民间社会、私营部门和公共部门等组织,涵盖先进AI系统的设计、开发、部署和使用全生命周期。
核心原则与行动:
- 基于风险的方法: 组织应采取适当措施识别、评估和减轻先进AI系统生命周期中的风险,包括采用内部和外部测试、红色团队测试等,并记录和定期更新技术文档。关注的风险包括化学、生物风险,进攻性网络能力,健康安全风险,自我复制模型风险,社会风险,对民主价值观和人权的威胁,以及特定事件风险。
- 漏洞识别与缓解: 组织应在部署后持续监控漏洞、事件和新风险,采取适当措施解决,并鼓励通过赏金系统等方式促进第三方和用户报告问题。
- 透明度报告: 组织应公开报告先进AI系统的能力、局限性和使用领域,发布透明度报告,包括风险评估、性能限制、安全和社会影响评估、红色团队结果等,确保信息清晰易懂。
- 负责任的信息共享: 组织应与行业、政府、民间社会和学术界共享信息,包括评估报告、安全风险、恶意使用意图等,并参与制定共享标准和最佳实践。
- AI治理与风险管理: 组织应建立风险管理和治理政策,披露隐私政策,并实施问责制和治理流程,定期更新政策,并进行员工培训。
- 安全控制: 组织应投资并实施强大的安全控制,包括物理安全、网络安全和内部威胁防护,保护模型权重和算法,并建立漏洞管理过程。
- 内容身份验证: 组织应开发可靠的内容身份验证和来源机制,如水印,使用户能够识别AI生成的内容,并合作推进该领域的研究。
- 风险缓解研究: 组织应优先考虑研究,投资于有效的缓解措施,以减轻社会、安全和安保风险,并分享研究成果和最佳实践。
- 解决全球挑战: 组织应优先发展先进AI系统,解决气候危机、全球卫生和教育等全球性挑战,并支持数字扫盲计划。
- 国际标准与最佳实践: 鼓励组织参与发展国际技术标准,如水印,并与标准开发组织合作,制定可互操作的标准和框架。
- 数据管理与保护: 组织应采取适当措施管理数据质量,减轻有害偏见,并实施保障措施,尊重隐私和知识产权。
实施与更新:
该准则将通过持续的多利益攸关方协商进行审查和更新,鼓励各国政府制定更持久的治理和监管方法,并支持组织建立内部AI治理结构和自我评估机制。组织应尊重法律、人权和民主价值观,不以破坏的方式开发或部署先进AI系统。