核心观点与结论
本文评估了两种自动化识别大型语言模型(LLM)漏洞(即“越狱”)的框架:树形攻击与剪枝(TAP)和声明式自改进Python(DSPy)。
TAP算法通过攻击者LLM生成提示变体,评估者LLM筛选无效变体,目标LLM评估响应,最终找到绕过安全机制的提示。实验发现,TAP在当前模型上仍有效,但效果不如2024年报告,主要原因是LLM的对抗性训练(对齐)改进。通过优化评估者LLM的提示(排除“免责声明”等无效越狱),TAP能更有效地找到真实越狱。TAP适用于从初始提示出发,逐步优化以生成有害输出的场景。
DSPy方法通过自动组合和优化提示来指导LLM生成攻击提示,包括攻击程序和优化程序两层结构。实验表明,DSPy能优化攻击提示生成过程,但现有选择机制相对简单。与TAP相比,DSPy在提示生成和优化方面有优势,但在攻击提示候选选择上不如TAP先进。
研究结论:自动化工具在系统化发现越狱提示方面有用,但与人类红队相比仍有差距,尤其在需要创造力、多轮交互和 nuanced 上下文理解时。未来最佳策略是结合人类专家与自动化系统,自动化工具负责大规模评估,人类专家处理复杂创新尝试。自动化方法可通过整合人类常用技术(如代码注入、多语言提示、token操作等)进一步提升。
关键数据与实验
- TAP参数:分支因子3,树深度6,树宽度6。
- 模型:攻击者使用GPT-4o-mini,评估者使用GPT-4o,目标模型包括GPT-4o、Claude 3.5 Sonnet、Gemini 2.0 Flash和Llama 3.1 70b。
- 结果:初始实验发现大量“虚假越狱”,主要因评估者LLM对“免责声明”评分过高。优化评估者提示后,成功找到真实越狱,Claude 3.5 Sonnet表现最安全。
- DSPy实验:通过优化程序,攻击提示更有效,成功生成接近目标的输出。相比TAP,DSPy在提示优化方面有优势,但在攻击提示选择上稍逊。
未来方向
结合TAP算法与DSPy的优化能力是未来研究的有前景方向。