Kimi K3 2.8万亿参数MoE模型部署时采用896个专家均匀分散在多张卡HBM中,单次推理激活16个专家,采用WideEP宽域专家并行方案,推理时产生海量All-to-All通信,重度依赖卡间高速Scale up通信;模型支持100万Token超长上下文,KV Cache需求较大,依赖超节点实现内存池化。K3官方白皮书建议使用≥64卡超节点,超节点已成为推理刚需。
从64卡到10万卡,WAIC超节点方案多点开花。昇腾950超节点以单机柜64张卡基于UB协议实现1024卡集群,可扩展至8192卡;曙光8000由海光芯片通过ScaleFabric实现十万卡集群规模互连;联想问天超节点;新华三UniPoD S80000系列覆盖32卡到1024卡;沐曦股份曦景S600超节点;以及阿里AL128、百度天池等云厂商自研超节点集中亮相。
我们认为,国产算力已迎来超节点时代,产业正从“单卡突破”全面迈入“系统级竞争”的新阶段。国产芯片在先进制程工艺受限的背景下,超节点用系统优势弥补单点不足。MoE推理需要频繁且高速地访问分布在多张GPU上的KV Cache,对片间互联带宽与延迟提出更高要求,超节点可充分满足Agent时代能推理需求。
建议关注:
- ODM:联想/华勤/浪潮等
- 交换:盛科/万通/锐捷等
- AI芯片:寒武纪/海光/芯原等
风险提示:AI发展不及预期、客户导入不及预期等。