Agent爆发带来的算力缺口是底层逻辑改变带来的质变增长,并且是指数增长。
-
Agent如何引爆算力缺口
- 任务性质质变:从“聊天”到“执行”的算力跃迁。例如千问点外卖背后对token的消耗巨大。
- Token消耗爆炸:传统Chatbot单次交互约2,000 token;Agent启动阶段1-2万token,单步思考20万+ token,完成项目总消耗达百万级,是普通用户的100-1000倍。
- CPU成为核心瓶颈:Agent任务中90.6%端到端延迟消耗在CPU(工具调用、任务拆解、逻辑判断),GPU仅负责不到20%密集计算。
- 并发模式重构:从“用户触发”到“7×24小时自主工作”,长任务并发率从ChatGPT的1%飙升至Agent的30%-40%,资源持续占用不释放。
-
算力核心全面缺货
- 缺卡:Kimi(月之暗面)在2026年2月5日公开求卡,表示“是真的缺卡”,已扩容多次仍缺。
- 存储涨价:存储价格涨了几倍,GPU到存储,CPU也面临缺货延期。
- 先进制程优先排产:多种因素叠加导致缺货爆发,利好国产替代(光刻机、光刻胶)。
-
算力缺口持续到27年
- 硬件供给受限:算力核心硬件(GPU、HBM、先进封装、CPU)的扩产周期都在18-24个月以上。
- 需求指数级增长:算力需求不是“线性增长”,而是指数级+结构性质变,2026-2027年将迎来“训练+推理+边缘”三端共振,进一步拉长缺口周期。
- 区域错配:大多数国家不允许数据出海,跨国企业需在当地建立数据中心。例如特斯拉在美国、龙村、欧洲建立AI训练中心,小鹏在欧洲建立智驾AI训练中心。
- 潜在解决方案:提出在巨轮上建立数据中心复用硬件的设想,数据本地化训练卡可四处跑。