摘要
本研报旨在系统性地梳理现代混合专家(Mixture of Experts, MoE)架构从理论提出至2025年的技术演进脉络,核心分类依据是门控函数(Gating Function)。MoE架构主要分为三类路由方式:稠密路由(Dense)、软性路由(Soft)和稀疏路由(Sparse)。其中,稀疏路由是当前最高效、最主流的技术范式,主要技术路线包括令牌选择(Token-Choice)、非可训练令牌选择(Non-trainable Token Choice)和专家选择(Expert-Choice)。本报告还梳理了代表性MoE模型,并标注了闭源和开源模型。风险提示包括大语言模型的技术进展不及预期、人工智能行业竞争格局变化带来的不确定性以及算法或功能优化不及预期。
MoE大模型进化树
本报告通过图1展示了MoE大模型的进化树,核心分类依据为门控函数,主要技术路线包括:
- 稠密路由(Dense):激活全量专家进行计算,常见于早期研究或特定微调场景。
- 软性路由(Soft):采用完全可微分的合并策略,通过加权融合令牌或专家,规避离散路由选择的难题。包括:
- 专家合并路径(Expert Merging):将所有专家的参数加权融合成一个临时的单一专家来处理令牌。
- 令牌合并路径(Token Merging):将输入的多个令牌加权融合成聚合体,再送入不同专家处理。
- 稀疏路由(Sparse):仅激活部分专家,是当前最高效、最主流的技术范式。包括:
- 令牌选择(Token-Choice):通过可训练的门控网络,为每个令牌动态选择一部分(top-k)专家,是最主流的稀疏路由方式。
- 非可训练令牌选择(Non-trainable Token Choice):采用固定的、无需训练的规则(如哈希函数)来分配令牌,不含可学习的路由参数。
- 专家选择(Expert-Choice):反向路由模式,由每个专家从一批输入中主动选择自己要处理的令牌,天然地解决了负载均衡问题。
图例与重要说明
- 模型表示:图中实心方框代表闭源模型,空心方框代表开源模型。方框内为模型名称,附在方框外的为参与构建模型的主要单位。
- 代表性厂商:本图谱主要收录了通过官方技术报告、论文或开源社区明确证实已采用MoE架构的代表性模型。OpenAI(GPT系列)与Anthropic(Claude系列)未纳入图中,主要原因是截至目前,这两家公司均未在官方渠道中明确证实其旗舰模型采用了MoE架构。
风险提示
- 大语言模型的技术进展不及预期。
- 人工智能行业竞争格局变化带来的不确定性。
- 算法或功能优化不及预期。