核心观点
- 大模型竞争正从单纯扩张总参数转向架构效率、后训练质量和单位推理成本的综合比拼,模型性价比成为规模化应用的重要变量。
- Agent商业化的核心正在从“偶尔完成任务”转向“稳定、可控、可复现地持续执行”,真实产品反馈闭环和模型工程化能力将比单一Benchmark排名更加重要。
- 国产大模型正在形成“开源权重+高效推理+Agent工具链+企业部署”的竞争范式,头部厂商将围绕开发者生态、云端调用和企业级解决方案展开新一轮竞争。
关键数据
- Hy3模型总参数量295B、激活参数21B,另含3.8B MTP层参数,上下文长度达到256K。
- 在270位专家基于真实工作的内部盲测中,Hy3平均得分为2.67/4,高于GLM-5.1的2.51/4。
- 模型幻觉率由12.5%降至5.4%,多轮问题率由17.4%降至7.9%。
- Hy3采用混合专家架构,在推理、Agent及长上下文任务上表现优异,以较小激活规模比肩参数量为其2—5倍的旗舰开源模型。
研究结论
- 模型竞争已由参数规模和榜单排名,转向Agent能力、推理效率、产品可靠性与安全分发的综合比拼。
- 国产大模型已进入推理效率和开源生态并重的新阶段,建议关注国产算力、大模型、超节点、AI+工业、AI Infra、AI4S和AI+Coding等领域。
- 风险提示包括技术进展不及预期、模型落地不及预期和商业落地不及预期。
竞争格局
- 海外方面,OpenAI启动GPT-5.6系列有限预览,Anthropic发布Sonnet 5,Fable 5恢复全球服务,Mythos 5仍维持有限分发。
- 国内方面,智谱GLM-5.2强化1M上下文与长程任务,腾讯Hy3则以21B激活参数、50多个业务反馈和产品稳定性优化切入。