人工智能安全治理框架2.0
核心观点: 该框架旨在应对人工智能快速发展带来的安全风险,构建技术与管理相结合、监管与治理相衔接、国内与国际相协同的治理机制,确保人工智能技术造福于人类。
主要内容:
- 治理原则:
- 包容审慎、确保安全:鼓励创新,严守安全底线。
- 风险导向、敏捷治理:密切跟踪AI发展趋势,探索风险分级,持续优化治理机制。
- 技管结合、协同应对:综合运用技术和管理措施,明确各方安全责任,发挥多种治理机制作用。
- 开放合作、共治共享:推动国际合作,共享最佳实践,建立开放性国际交流合作平台。
- 可信应用、防范失控:推动形成可信人工智能基本准则,确保技术演进安全可控,严防失控风险。
- 风险分类:
- 技术内生安全风险:模型算法安全风险(可解释性不足、偏见歧视、鲁棒性不强、输出决策不可靠、外部对抗攻击、模型缺陷扩散)、数据安全风险(违规收集使用数据、训练数据内容不当、训练数据标注不规范、数据和个人信息泄露)。
- 技术应用安全风险:网络系统安全风险(组件和算力安全、网络暴露面扩大、供应链安全、网络攻击滥用)、信息内容安全风险(输出违法有害信息、混淆事实误导用户、污染网络内容生态)、现实安全风险(经济社会运行安全的新挑战、被违法犯罪活动利用“作恶”、核生化导武器知识能力失控)、认知安全风险(加剧“信息茧房”效应、助力开展认知战)。
- 应用衍生安全风险:社会和环境安全风险(冲击劳动就业结构、挑战资源供需平衡)、伦理安全风险(加剧社会偏见扩大智能鸿沟、冲击教育抑制创新、加剧科研伦理风险、拟人化交互的沉迷依赖、挑战现行社会秩序、“自我意识”觉醒脱离人类控制)。
- 技术应对措施: 针对不同类型风险,从训练数据、模型算法、算力设施、产品服务、应用场景等方面提出安全软件开发、数据质量提升、安全建设运维、测评监测加固等技术手段。
- 综合治理措施: 提出技术研发机构、服务提供者、用户、政府部门、社会组织等各方发现、防范、应对人工智能安全风险的措施手段,以及深化人工智能安全治理国际交流合作等建议。
- 研发与应用的安全指引: 提出模型算法研发、建设部署、运行管理,以及访问使用的引导性安全规范,并针对潜在的技术失控风险,提出可信人工智能基本准则,引导国际社会共识。
- 风险分级原则: 从应用场景、智能化水平、应用规模等维度对人工智能安全风险进行评价分级,进而采取相适应的应对措施。
- 可信人工智能基本准则: 提出人类最终控制、尊重国家主权、价值观对齐、提升系统透明度、促进可客观验证、强化安全防护、前瞻应对、全球协同共治等基本准则。
研究结论: 人工智能安全治理需要多方协同,构建全过程全要素治理链条,培育安全可靠、公平透明的人工智能技术研发和应用生态,积极研究应对人工智能灾难性风险的共识性准则,推动人工智能健康发展和规范应用。