智谱SAO算法通过升级DeepSeek-R1的GRPO算法,显著提升了长/复杂推理能力。其关键在于生成后直接进行强化学习(RL)和过滤机制,有效提高了模型效果。SAO的“一条经验回来就能学”模式,更接近Agent边干活边学习、持续进化的方式,为后续的continue_learning打下基础,展现了智谱在国产模型后训练能力上的领先性。
后训练在Agentic时代的重要性日益凸显。模型能力提升依赖于数据、预训练基座和后训练,后训练能够显著增强模型在实际应用中的表现。智谱GLM-5.3通过强化后训练达到接近K3 2.8T大基座的水平,证明了后训练技术的巨大潜力。未来,持续学习将成为模型进化的关键路径,后训练技术将推动AI应用向更智能、更自适应的方向发展。
智谱GLM-5.3延续了约700B的预训练基座,通过强化后训练显著提升了模型性能,达到接近K3 2.8T大基座的水平。其特点在于结合了SAO算法的优势,能够适应长/复杂推理需求,并通过生成后直接进行RL和过滤机制,有效提升效果。这种后训练路径不仅增强了模型能力,也为后续的持续学习提供了基础,展现了智谱在国产大模型领域的领先地位。
当前AI模型后训练技术正快速发展,成为推动模型能力提升的重要手段。国内外科技巨头纷纷加大投入,探索更有效的后训练方法。智谱SAO算法的推出,代表了国产模型在后训练领域的领先水平。同时,市场对持续学习、自适应AI的需求日益增长,后训练技术将迎来更广阔的应用前景。然而,后训练技术仍面临算法优化、数据质量等挑战,需要持续的技术突破。
本报告提示的主要风险在于技术路线的不确定性。虽然智谱SAO算法展现了强大的后训练能力,但其“一条经验回来就能学”模式是否能够成功落地仍需观察。此外,持续学习路径的成功依赖于算法、算力等多方面支持,存在技术实现难度。同时,AI模型后训练领域竞争激烈,技术迭代迅速,可能面临技术被超越的风险。此外,数据安全和隐私保护也是后训练技术应用中需要关注的重要问题。