摘要
本文探讨了大型语言模型(LLMs)在国防部应用中的网络安全挑战,将其风险分为以漏洞为中心的风险和以威胁为中心的风险两大类。
以漏洞为中心的风险包括数据泄露、无意偏见、错误信息和与国防部政策的偏差。数据泄露风险源于LLMs在训练过程中可能记忆并泄露敏感信息,可通过数据预处理、访问控制、加密和差分隐私等技术进行缓解。无意偏见风险源于训练数据中的偏见,可能导致歧视性输出,可通过数据平衡、红队测试和偏见检测算法等方法进行缓解。错误信息风险源于LLMs的不准确性和推理能力有限,可能导致生成错误信息,可通过模型微调、人类在环系统和检索增强生成等技术进行缓解。与国防部政策的偏差风险源于LLMs的输出可能与国防部政策不符,可通过模型微调、人类在环系统和政策合规框架等方法进行缓解。
以威胁为中心的风险包括提示操纵、输入攻击、数据污染和模型损坏。提示操纵风险源于攻击者通过恶意输入提示来操纵LLMs生成有害或意外的输出,可通过响应监控、对抗训练、模型微调和红队测试等方法进行缓解。数据污染风险源于攻击者通过向训练数据中注入恶意样本来破坏LLMs,可通过安全训练流程、数据清理、验证协议和对抗训练等方法进行缓解。
当前,现有的缓解策略在国防部环境中存在一些局限性,例如可扩展性、实时有效性和对国防特定需求的适应性。建议通过增强隐私保护、加强对抗防御、使模型与国防部政策保持一致以及优先考虑人类在环机制和人员培训来弥补这些差距。
最后,本文提出了一个未来研究的路线图,重点关注隐私保护训练、动态数据清理、自适应防御、政策合规、人类在环系统和人员培训等方面。