核心观点与框架介绍
政策制定者正关注新的人工智能(AI)技术被恶意利用的风险,包括制造虚假信息、指导生物武器制造等。由于AI技术发展迅速且潜在危险尚不明确,评估风险是一项持续挑战。恶意使用风险通常被视为行为可能性和严重性的函数。本报告提出“PPOu框架”评估AI系统被恶意利用的可能性,分为三个阶段:
- 可行性(Plausibility, P):系统X能否执行恶意行为Y?
- 性能(Performance, P):系统X执行恶意行为Y的效果如何?
- 实际使用(Observed use, Ou):系统X是否已在现实中被用于恶意行为Y?
各阶段评估方法与局限性
- 可行性阶段:通过红队测试和压力测试,采用改进提示或微调模型,判断系统是否至少能执行一次恶意行为。挑战在于证明系统“不能”执行,即“能力引出问题”。
- 性能阶段:通过静态基准测试、实验或边际效用分析,评估系统执行恶意行为的质量、可靠性和实用性。基准测试可能存在污染或构建困难,实验需权衡最小化伤害与真实环境效果,边际效用测试需建立相关替代方案和结果指标。
- 实际使用阶段:通过AI提供商监控、开源研究人员和记者调查、犯罪论坛监测、建立事件数据库等方式,发现系统在现实中的恶意使用。挑战在于恶意行为可能被隐藏,且历史使用模式不一定能预测未来趋势。
研究结论与政策建议
PPOu框架帮助政策制定者理解恶意使用研究的类型和不确定性,例如区分可行性评估与性能测试。政策制定者应谨慎对待易被计数的恶意使用案例,并认识到预部署研究可能因认知偏差或未预见能力而误判风险。建议政府资助不同领域和方法学的研究人员,并支持AI安全机构建立更广泛的合作网络。