RNN与Transformer是序列建模的两代核心架构,分别通过状态压缩和全量检索解决序列数据的变长、有序和长程依赖问题。RNN通过循环和隐状态逐步传递信息,但存在串行计算和长程遗忘限制;Transformer利用自注意力机制实现全局交互,支持并行训练和长程依赖建模,成为云端通用基础模型(如GPT、BERT、LLM、VLM、VLA)的主导架构。
关键分歧与权衡:
- 记忆方式:RNN以定长状态概括历史,内存恒定但信息易衰减;Transformer全量保留历史并按需检索,信息保留更充分但内存随长度增长。
- 计算特性:RNN训练串行、推理恒定;Transformer训练并行、推理随长度平方增长。
- 长程依赖:Transformer任意两位置直接交互,路径更短;RNN受状态容量和更新步数限制。
新循环路线与混合架构:
- 线性注意力:将注意力复杂度从平方降至线性,连接注意力与循环结构。
- 状态空间模型(Mamba):训练随长度线性增长,推理成本恒定,适合长序列场景。
- RWKV:结合Transformer训练并行性和RNN推理效率。
- 混合架构:少数层保留全注意力,多数层使用线性注意力或状态空间结构,平衡精度与效率。
研究结论:
- Transformer凭借并行训练和规模化能力成为云端通用基础模型的核心底座。
- RNN的核心价值在长上下文和端侧部署中体现,Mamba、RWKV等新循环路线在效率约束场景中成为重要补充。
- 通用大模型仍以Transformer为底座,物理AI、端侧和车端更可能采用循环类、状态空间或混合架构。
风险提示:
- 技术迭代不及预期、大模型厂商ARR增速放缓、云服务商资本开支不及预期、智能驾驶及机器人商业化落地不及预期。