- 云端模型:能力边界外扩与成本重构并行。
- 海外:大模型加速迭代,Agent能力边界持续外扩。2026年以来,海外头部厂商围绕代码能力与多Agent体系展开密集布局。代码模型方面,智能体时代的推理需求沿着长链复杂推理与实时交互两大方向演进,低延迟优先型Agent(如OpenAI的Codex-Spark)追求交互式AI智能体的低延迟体验,长链复杂推理型Agent(如Claude 4.6)通过提高上下文长度,推动AI在高价值复杂任务中的成功率改善。多智能体框架(如Grok 4.20)加速走向主流架构选择,成为下一阶段Agent化落地的重要产业趋势。模型迭代周期明显进入加速区间,头部厂商模型更新周期缩短至数月。
- 国内:性能快速追赶+性价比优势扩大,带动需求加速释放。国产大模型在性能快速追赶的同时性价比优势持续扩大,如MiniMax M2.5、智谱GLM-5、字节豆包2.0系列、阿里通义千问Qwen 3.5等。成本下探推动多Agent部署由PoC阶段向可规模部署过渡,如MiniMax M2.5上线不足24小时即有全球用户构建超过1万个“专家Agent”。智谱GLM-5发布后需求表现强劲,字节Seedance 2.0显著降低了AI视频创作门槛,激活短视频与用户二创生态。
- 端侧模型:端云协同主线下的效率优化与能力压缩。
- 范式收敛:端云协同成端侧模型主流。端侧模型与云端形成分工明确的协同架构:高频、轻量、强隐私任务优先在端侧完成本地闭环处理;重推理、长生成和高算力任务经端侧打包与调度后上云执行。端侧模型进入“自然语言→API执行”的新范式,如Gemma体系的FunctionGemma模型。
- 多模态:端侧实时交互与执行闭环的关键能力。多模态能力成为端侧模型关键竞争要点,低延迟多模态正成为端侧竞争的胜负手。全双工流式架构成为主流交互范式,视觉Token压缩成为多模态效率竞争关键。
- 模型算法优化:效率优化与能力压缩。
- 模型架构:MoE仍是主流演进方向,但在端侧受限于内存瓶颈,行业处于多路径架构探索阶段,如EdgeMoE等工程化手段和Gated Delta-Net、Manifold-Constrained Hyper-Connections等新架构。
- 低比特量化:4-bit为行业标准配置,行业已开始探索2-bit等更低比特量化技术,如ParetoQ、SmoothQuant、SpinQuant等。
- 推理优化:推理正成为决定任务完成效果与智能体验的关键变量。Attention效率、KV Cache管理与并行解码共同决定端侧模型的实际体验。Diffusion LLM提供了另一条提升推理效率的路径。
- 端侧模型牵引硬件重构:算力、存力与散热协同升级。
- 整机AI功能:从单点功能走向多模态与系统级整合。2024年行业以高频刚需场景为切入点,2025年明显加速向多模态创作能力延展,并进一步向操作系统底层渗透。整机AI竞争正从功能数量比拼,转向多模态体验与系统级整合深度的综合较量。
- 端侧算力方案升级:存储、算力与散热协同演进。在整机级AI能力向多模态等方向升级的背景下,端侧核心部件正围绕内存与功耗等制约端侧体验的关键变量上进行新一轮升级。三星LPDDR6产品在支持更高数据传输速率和内存带宽的同时,实现较上一代约21%的能效提升。三星Exynos 2600芯片首次在移动SoC中引入High-k EMC材料优化热传输路径,使热阻较Exynos 2500降低约16%。高通下一代旗舰平台Snapdragon 8 Elite Gen 6有望率先支持LPDDR6内存,并引入三星HPB(高性能散热方案)。
- 研究结论:端云协同驱动AI入口重塑与硬件范式重构。云端模型能力边界外扩与成本重构并行,端侧模型与云端形成分工明确的协同架构,多模态能力成为端侧模型关键竞争要点,模型算法优化提升效率与能力压缩,端侧算力方案升级实现算力、存力与散热协同升级。未来,端侧AI功能将进一步复杂化、多模态化及持续运行。
- 风险提示:模型能力提升不及预期;端侧AI商业化落地节奏低于预期;终端硬件升级与需求释放不及预期。