核心结论
2026年是AI从训练转向推理主导的拐点。OpenClaw、ClaudeCode等开源与闭源Agent框架迅速普及,算力应用从训练走向智能体等推理需求主导,从问答模式走向智能体循环,从单轮生成升级为多步规划、持续执行,推理首超训练成为算力需求的重心。
推理时代算力需求特征
- 算力重心转移:推理是“7×24永续调用”,需求随用户普及与智能体长任务能力快速增长,中国推理需求已达训练的8倍。
- Token调用量激增:OpenRouter平台周Token处理量从5万亿增长至25万亿,半年增长5倍。
- 国产模型性价比凸显:PinchBench测试中,Qwen3.7成功率92.5%,仅次于ClaudeOpus4.8,Mimo-v2.5、Deepseekv4等国产开源模型排名靠前。
推理时代硬件和软件架构体系
- 智能体框架:OpenClaw等开源框架兴起,推动AI模型使用形态从单次对话转向智能体循环。
- 推理架构特征:资源池化、低延迟互联、推理专用芯片(如GroqLPU)。
- 专用芯片:GroqLPU专为推理设计,遵循“软件优先、可编程流水线、确定性计算、片上存储”原则,摒弃GPU复杂缓存层级,聚焦推理任务数据流优化。
- 异构计算:LPU与GPU结合,预填充阶段用GPU,解码阶段用LPU,实现性能互补。
- 超节点:大量GPU互联系统,统一内存地址空间,超高带宽、超低时延互联,原生可扩展性,适配推理高并发、实时交互和大显存消耗需求。
- 网络互联:超节点互联方案分封闭生态(英伟达、华为)和开放生态(中国移动、腾讯、阿里),以太网交换机凭借普适性和经济性,有望成为AI时代数据中心网络架构主流。
- 光互联技术:OCS(光路交换机)直接实现光信号切换,大幅缩短信号传输时延,降低功耗,市场规模爆发式增长。
推理时代模型层
- 模型迭代加速:Anthropic模型迭代节奏从两个月缩短到六周,ClaudeOpus4.8、GPT-5.5、GLM-5.1、DeepSeekV4、Minimax-M3等前沿模型密集发布。
- 模型能力提升:聚焦Coding、Agentic两项关键能力,模型全面接管工作任务,生产力水平提升。
- 国产模型普惠:DeepSeekV4-Pro模型API永久锁定2.5折定价,每百万tokens输入(缓存命中)0.025元。
- 模型能力提升飞轮效应:Claude编写代码量超80%,工程师日均合入代码量达2024年基准水平的8倍。
- Agent新范式:Harness Engineering通过上下文工程、架构约束、持续管理,实现可控的智能。
商业化与市场趋势
- 海外市场:ChatGPT与Gemini突破9亿用户,Anthropic年化收入ARR达440亿美元,ClaudeCode年化收入达25亿美元。
- 中国市场:AI原生App月活规模达4.4亿,进入用户量+商业化的下半场。
- 商业化拐点已现:AI厂商收入增速远超传统软件时代,模型商业化加速。
建议关注方向
- 交换芯片:盛科通信、曦智科技
- 互联芯片:澜起科技、裕太微、万通发展
- 光互联:中际旭创、新易盛、天孚通信
- 算力租赁:协创数据、宏景科技
- AIDC:商汤-W、东阳光、润泽科技
- 大模型:智谱、MiniMax、商汤-W
- 网络层:网宿科技、恒为科技
- 应用:腾讯控股、阿里巴巴、快手-W、中控技术、鼎捷数智
风险提示
- AI技术突破不及预期
- 大模型应用落地节奏不及预期
- 宏观经济增长不及预期,IT预算不及预期
- 国际环境发生变化