微软AI红队通过对100多个生成式AI产品进行红队测试,总结出以下八点经验教训:
- 理解系统能力及应用范围:模型能力可以帮助指导攻击策略,但需结合系统应用场景评估潜在风险。简单攻击技术往往比复杂的梯度攻击更有效。
- 系统级视角:AI模型通常作为更广泛系统的一部分,需考虑系统组件的漏洞。AI红队测试不同于安全基准测试,后者无法完全捕捉新型危害类别。
- 工具与武器文化:自动化工具如PyRIT可以帮助覆盖更广泛的风险领域,但需结合人类判断和创造性。大规模测试有助于评估模型非确定性和故障发生可能性。
- 情商的重要性:AI红队测试需要情商,例如评估模型对不同用户情境的回应。红队人员需接触令人不安的内容,并拥有心理健康支持。
- AI责任危害:RAI危害比安全漏洞更主观,难以衡量。需考虑对抗性用户和良性用户两种行为者。
- LLMs放大现有风险并引入新风险:LLMs可能放大现有安全风险,并引入新的风险,例如提示注入和模型规避。
- 网络安全经济学:提高攻击成本是网络安全的关键。持续的红队测试和缓解措施可以提高攻击成本,但无法完全消除风险。
- 政策与法规:监管可以通过要求严格的安全实践和法律后果来提高攻击成本。
微软AI红队开发的威胁模型本体论可以帮助模拟AI系统漏洞,并指导AI红队测试实践。该本体论涵盖了安全、负责任AI和系统级漏洞等多个方面。