智谱Ox Alpha(GLM-5.3Flash)参数规模仅320B总参数、18B激活参数和45层,全面超越GLM-5.2,并在Coding与Agent任务上接近ClaudeOpus4.8。模型通过线性注意力与稀疏注意力混合架构、IndexPool和mHC创新,在保持1M长上下文与原生多模态能力的同时,将注意力计算量和KVCache较GLM-5.3分别降低3.01倍和4.44倍,验证智谱未牺牲能力换取速度,而是通过架构与预训练协同优化,将模型智力和推理效率共同推向新帕累托前沿。匿名测试期间全部流量由国产芯片承载,证明智谱具备全栈能力。
智谱Ox Alpha价格策略极具竞争力。促销期输入/输出价格仅0.075/0.25美元/百万Token,约为V4Flash非高峰价格的1/3、峰值价格的1/5—1/6;常规价格0.15/0.50美元仍低于V4Flash非高峰价格。DeepSWE测试中,模型以更少输出Token实现约63%高分,能力与Token效率均进入闭源模型区间,综合能力领先DeepSeekV4Flash。实际任务成本优势突出,通过架构创新同步提升智能与效率,将模型智力和推理效率共同推向新帕累托前沿,为模型应用空间打开更多可能性。
智谱Ox Alpha发布验证了其预训练Scaling与国产Infra能力。仅320B/18B基座在多数任务上接近更大参数旗舰,证明数据、架构与训练方法有望继续Scaling至更大模型;推理侧通过自研引擎、混合量化及EPD分离式架构,将国产芯片端到端服务性能提升3倍,硬件效率与单Token成本接近主流英伟达GPU。匿名测试期间全部流量由国产芯片承载,验证智谱具备全栈能力,为国产算力产业链持续利好。
智谱Ox Alpha发布验证了开源模型在参数规模、性能和成本控制上的巨大潜力,推动开源模型进入帕累托最优前沿。通过架构创新同步提升智能与效率,证明智谱未牺牲能力换取速度,而是通过架构与预训练协同优化,将模型智力和推理效率共同推向新帕累托前沿。仅320B/18B基座在多数任务上接近更大参数旗舰,证明数据、架构与训练方法有望继续Scaling至更大模型,引领国产开源模型加速智力平权,以更低成本打开模型应用空间。
投资智谱Ox Alpha需关注模型商业化落地和市场竞争风险。虽然智谱Ox Alpha在参数规模、性能和成本控制上表现优异,但AI模型商业化仍处于早期阶段,市场接受度和实际应用场景仍需时间验证。同时,国内外AI巨头持续加大研发投入,开源模型市场竞争激烈,智谱需持续保持技术领先优势。此外,国产算力产业链成熟度仍需提升,可能影响模型推理性能和成本控制效果。