核心观点
人工智能(AI)带来的风险引起了学者、政策制定者、AI公司和公众的广泛关注。然而,由于对AI风险缺乏共同的理解,这可能会阻碍我们全面讨论、研究和应对这些风险的能力。
研究方法
本研究通过创建一个AI风险库来填补这一空白,作为共同参考框架。该库包含一个活数据库,其中提取了来自43个分类的777个风险,可以根据两个主要分类进行筛选,并通过平台轻松访问、修改和更新。网站和在线电子表格。
研究采用了最佳拟合框架综合法来发展AI风险分类法,包括:
- 高级因果关系分类法:将每个风险根据其特征进行分类,包括实体(人类、人工智能)、意图(有意、无意)和时间(部署前、部署后)。
- 中级人工智能风险领域分类法:将风险分为七个类别的人工智能风险,例如歧视与毒性、隐私与安全、错误信息、恶意行为者与滥用、人机交互、社会经济与环境、人工智能系统安全、故障与限制。
研究结果
- 大部分风险(51%)被表示为由人工智能系统而非人类引起(34%),并且是在人工智能模型训练和部署后出现(65%)而非之前(10%)。
- 类似的比例的风险被表示为目的性(35%)和非目的性(37%)。
- 在之前的文件中覆盖最多的风险领域包括:人工智能系统安全性、故障与局限性、社会经济与环境危害、歧视与毒性。
- 人与计算机交互(41%)和虚假信息(44%)讨论得较少。
研究结论
- 本研究构建了一个全面的AI风险库,包括因果关系分类法、领域分类法和活数据库,为更协调、连贯和完整地定义、审计和管理人工智能系统带来的风险奠定了基础。
- 研究发现,对AI风险的强烈和紧迫审查导致了对这些风险缺乏共同的理解,这可能会阻碍我们全面讨论、研究和应对人工智能风险的能力。
- 研究建议,理想化的共同参考框架需要两个相交的层级分类:一个用于精确分解或定义基于其发生的高级条件的人工智能风险(因果关系层级分类),另一个将与人工智能相关联的常见危害和损害分类为可理解和明确不同的领域(领域层级分类)。