核心观点
- AI 产业正从“大模型训练为王”转向“实时推理优先”时代,英伟达收购 Groq 正是这一战略转折的体现。
- 传统 GPU 架构在实时推理场景下存在局限性,Groq 的 LPU 架构通过去除了硬件调度器等复杂控制逻辑,并采用 SRAM 作为片上内存,在推理速度上实现了大幅提升。
- Groq 的 RealScale 技术通过大规模芯片互连,实现了大模型推理的线性扩展。
- 英伟达可能在新的 GPU 架构中引入 LPU 芯粒,未来的 GPU 可能不再是纯粹的 GPU,而是一种混合处理器,以满足低功耗、高存储带宽的推理需求。
关键数据
- 英伟达拟以 200 亿美元收购 Groq。
- Groq LPU 实现了 80 TB/s 片上内存带宽,SRAM 访问延迟仅为纳秒级。
- GroqCard 加速卡采用标准的 PCIe Gen4 x16 接口,但核心能力在于 RealScale 连接器,允许卡与卡之间直接通信。
- GroqNode 服务器内部容纳 8 张 GroqCard,逻辑上表现为一个具有 1.76GB SRAM 的大芯片。
- GroqRack 计算集群通过无交换机的拓扑结构将 64 颗芯片连接起来,模型被层层切分,实现流水线并行。
研究结论
- 低功耗、高存储带宽的推理能力或将是 AI 芯片下一阶段的主战场。
- 相关公司包括寒武纪-U、云天励飞-U、海光信息、芯原股份等。