事项:DeepSeek联合两大机构发布最新论文,提出面向硬件且支持原生训练的稀疏注意力机制NSA,旨在优化Transformer注意力机制。NSA包含动态分层稀疏策略、粗粒度token压缩和细粒度token选择等核心组件,在通用、长文本、思维链推理基准测试中刷新SOTA,显著优于全注意力机制。
评论:
-
技术突破与计算效率提升
- NSA通过硬件级优化(算术强度控制在GPU临界值之上)、动态分层稀疏(32token压缩块+64token选择块)、三重注意力通路(压缩全局6.25%、精选局部25%、滑动窗口8%)实现性能提升。在64K长文本场景下,解码速度提升11.6倍,前向/反向传播加速9倍/6倍。
-
技术创新与高效稀疏注意力部署
- 引入硬件对齐系统和训练感知设计,支持高效推理与完整训练流程。通过专用计算内核和分层token建模,成功部署原生可训练的稀疏注意力架构。
-
基准测试表现
- 通用基准:NSA在9项指标中7项超越全注意力基线,推理能力显著提升(DROP: +0.042,GSM8K: +0.034)。
- 长文本评估:LongBench基准中平均分0.469,优于全注意力(高0.032)和Exact-Top(高0.046),实现完美准确性。
- 思维链推理:8k/16k上下文设置下,NSA-R准确率分别高出Full Attention-R 0.075/0.054,验证稀疏注意力在高级推理任务中的可行性。
投资建议:看好AI大模型垂类应用与商业化落地,建议关注办公、金融、大模型、工业、端侧等领域的相关标的。
风险提示:商业化不及预期、用户付费意愿低、技术迭代速度较快。
一、NSA颠覆性技术突破:从算法到硬件全面进化
(一)NSA实现技术突破,计算效率显著提高
通过硬件级优化、动态分层稀疏、三重注意力通路,64K长文本场景下解码/前向/反向传播加速11.6/9/6倍。
(二)NSA完成技术创新,成功部署高效稀疏注意力机制
引入硬件对齐系统(优化Tensor Core利用与内存访问)和训练感知设计(支持端到端训练),结合专用计算内核实现高效部署。
二、性能测试刷新SOTA,全面碾压传统方案
- 通用基准:NSA总体性能优越,7项指标超越全注意力基线,推理能力显著提升。
- 长文本评估:LongBench平均分0.469,优于全注意力(高0.032)和Exact-Top(高0.046)。
- 思维链推理:8k/16k上下文下准确率分别高出Full Attention-R 0.075/0.054,验证稀疏注意力在高级推理中的可行性。