核心观点
该研报提出了条件记忆作为一种新的稀疏性轴,与现有的条件计算范式(MoE)互补,旨在解决通过动态计算模拟知识检索的低效性。条件记忆通过 Engram 模块实现,该模块现代化了经典的 N-gram 嵌入,以实现可扩展的 O(1) 查找静态模式。
关键数据和研究结论
- 稀疏性分配问题: 研究发现,在固定的参数预算下,将稀疏容量在 MoE 专家和 Engram 嵌入之间进行混合分配,可以优化神经网络计算(MoE)和静态内存(Engram)之间的权衡。实验揭示了一种 U 型缩放定律,表明混合分配严格优于纯 MoE 基线。
- Engram 的扩展: 指导着 Engram 扩展到 27B 参数,在多种领域实现了优于严格等参数和等 FLOPs MoE 基线的性能。值得注意的是,Engram 在知识密集型任务(例如 MMLU+3.4;CMMLU+4.0)中表现出色,但在一般推理(例如 BBH+5.0;ARC-Challenge+3.7)和代码/数学领域(例如 HumanEval+3.0;MATH+2.4)中观察到更大的收益。
- 机制分析: 机制分析表明,Engram 通过减轻主干网络早期层的静态重建,有效地加深了网络,从而提高了复杂推理的有效深度。此外,通过将局部依赖委托给查找,它释放了注意力容量,用于关注全局上下文,从而大幅提高了长上下文检索能力(例如 Multi-Query NIAH: 84.2→97.0)。
- 基础设施感知效率: Engram 建立了基础设施感知效率作为一项一级设计原则。与 MoE 的动态路由不同,Engram 采用确定性地址,支持运行时预取,将通信与计算重叠。实验结果表明,将 100B 参数的嵌入表卸载到主机内存会产生微不足道的开销(<3%)。
研究意义
该研报表明,条件记忆可以作为下一代稀疏模型不可或缺的建模原语,有效地绕过 GPU 内存限制,促进参数的激进扩展。