注意力机制与大模型发展的关系 人类通过选择性关注关键信息提高处理效率,深度学习引入注意力机制(Attention Mechanism)解决长文本处理问题。2017年Transformer模型提出后,注意力机制成为核心模块,解决长序列遗忘问题。稀疏注意力机制将计算复杂度从O(L²)降至亚平方级(如O(L*log L)),突破内存与算力瓶颈,推动大模型上下文长度扩展至128K甚至1M。
DeepSeek在注意力机制方面的技术改进 DeepSeek通过算法、系统、硬件三层面优化提升大模型性能,主要贡献包括:
DSA和NSA给AI产业释放的发展潜能 随着多模态需求增加,输入(x)和输出(y)长度均变长,传统Scaling范式受限。OpenAI o1和DeepSeek-R1通过后训练提升模型能力。DeepSeek-R1-Zero通过强化学习后训练,模型输出长度和AIME精度持续提升。DSA和NSA通过提升计算效率与上下文拓展,为后训练释放更大潜能,推动模型能力突破。
风险提示 国际形势的不确定性。