Deepseek推出专为优化长文本训练与推理设计的注意力机制NSA。该机制针对传统模型在长文本应用下的计算复杂度高和内存访问量大问题,采用三种注意力路径进行优化:(1)粗粒度token压缩,减少数据量;(2)细粒度token选择,减少计算量;(3)滑动窗口,限制需关注的序列长度。此外,NSA通过优化内核设计,提升Tensor core和内存访问效率,将算术强度控制在GPU临界值以最大化资源利用。在64k上下文长度下,NSA架构实现训练段9倍前向加速和6倍反向加速,推理端解码速度提升11.6倍。该架构有望降低大模型中长文本应用的推理成本,加速长文本应用落地。