核心观点
- Transformer架构的大模型在算力成本上存在瓶颈,限制了其研发和应用创新。
- MoE(Mixture of Experts)架构是对Transformer架构的优化,通过路由策略和微调实现降本增效,并保持模型能力。
- OpenAI o1大模型引入“思维链”和强化学习,实现更复杂的推理和思考能力,为AI大模型应用提供新范式。
关键数据
- Transformer模型计算复杂度随输入序列长度呈平方增长,需要大量算力资源。
- MoE模型激活参数量远低于Transformer模型,例如Mixtral 8x7B的激活参数量为13B,为Llama 2 70B的五分之一。
- OpenAI o1-preview在数学奥林匹克资格考试中的准确率高达83.3%,在编程比赛中表现优异。
- OpenAI o1-preview输入每百万token要15美元,输出每百万token要60美元,输出成本是推理成本的4倍。
研究结论
- MoE架构有望成为大模型发展的重要路径,在多个领域表现优异,并助力降本增效。
- OpenAI o1大模型加速AGI实现,孕育应用蓝海,但仍有功能待完善和使用壁垒。
- AI大模型技术路线探索将持续进行,未来有望颠覆人机交互模式,成为决策智能伙伴。
- 风险提示:技术迭代不及预期,AI应用市场拓展节奏不及预期,市场竞争加剧。
MoE架构
- MoE架构通过门控函数路由策略,将输入数据分配给不同的专家网络进行处理。
- MoE架构可分为稀疏式、密集式和soft式,不同类型各有侧重。
- MoE模型需要通过路由策略和微调实现负载均衡,提高模型效率。
- LPU芯片设计厂商有望助力MoE模型训练性能提升。
OpenAI o1大模型
- OpenAI o1大模型引入“思维链”技术,实现更复杂的推理和思考能力。
- OpenAI o1大模型结合强化学习,通过自我对弈和试错学习解决问题。
- OpenAI o1大模型在科学、编程、代码等领域表现超越以往大模型。
- OpenAI o1大模型形成数据飞轮效应,通过强化学习和思维链不断改进推理能力。