核心观点
随着Transformer架构大模型训练成本持续攀升,算力投入成为技术升级的瓶颈,亟需探索新的技术路径以提升模型性能和应用范围。当前MoE(混合专家模型)和OpenAI o1的“思维链”是重要突破方向。
关键问题与挑战
- Transformer模型在训练计算量达到一定规模(如“拐点”)后性能才显著提升,但算力成本随模型复杂度和数据量增长而急剧上升。
- Anthropic预测未来三年AI模型训练成本将达百亿甚至千亿美元,巨额投入制约技术进步和效益提升。
技术路径探索
-
MoE框架
- 作为Transformer架构的优化方案,通过路由策略(稀疏式、密集式、soft式)和微调,在不增加过多计算需求的前提下提升模型能力。
- MoE层由𝑁个专家网络+门控网络组成,在NLP、CV等领域表现优异,结合LPU芯片可显著强化推理性能。
-
OpenAI o1的“思维链”
- 创新推理模式模拟人类“慢思考”,具备系统性、逻辑性、批判性和意识性,通过内部思维链优化答案策略。
- 在数学、编程等高难度任务中效果突出,推动AI从通用娱乐领域向专业严肃场景渗透,具有里程碑意义。
研究结论
- MoE和“思维链”是突破大模型算力瓶颈的关键技术,有望实现性能更优、应用更精准的AI模型。
- 推理侧应用模式创新将加速AI价值释放,从通用领域向专业领域拓展。
风险提示
技术迭代不及预期,AI应用市场拓展节奏放缓。
文章来源
《MoE与思维链助力大模型技术路线破局》(2024年9月20日发布)
作者
李博伦(S0880520020004)、伍巍(S0880123070157)