谷歌云发布第八代张量处理器(TPU 8t)和TPU 8i,分别针对AI模型训练和推理阶段进行优化,体现预训练、后训练与实时推理对基础设施需求的分化。
TPU 8t:预训练性能核心
- 采用3D Torus拓扑,单个Superpod集成9600个芯片,网络结构为3D Torus(ICI)+Virgo Network(东西向)+Jupiter Network(南北向)。
- 升级方向:
- SparseCore、VPU scaling优化、引入FP4,提升嵌入查找、Softmax、Layernorm等操作效率。
- 引入Virgo网络并扩大集群规模,DCN训练带宽提升4倍,支持百万芯片互联。
- 支持更快存储访问,TPUDirect RDMA和TPU Direct Storage实现存储访问10倍提速。
TPU 8i:推理与采样专家
- 专为高并发推理优化,更大片上SRAM,加入集合通信加速引擎(CAE),网络结构用Boardfly替换3D Torus。
- 升级方向:
- SRAM空间提升3倍,支持更大的KV Cache驻留芯片。
- 引入CAE引擎,专用于加速自回归解码与CoT过程,片上集合通信延迟降低5倍。
- 使用Boardfly ICI拓扑,通信密集型任务延迟优化50%。
投资建议
- 谷歌新芯片发布进一步增强高速互联、存储和CPU产业趋势升级:
- 高速互连:TPU 8i ICI带宽翻倍,看好带宽升级及新架构驱动光模块和大端口OCS需求。
- 存储方面:TPU 8t采用216GB HBM3E,TPU 8i采用288GB HBM3E,SRAM增长3倍。
- CPU方面:两款芯片集成Axion CPU,提供充足算力处理复杂任务。
- 建议关注【LITE】【COHR】【NOK】【CIEN】【SNDK】【MU】【INTC】【AMD】【ARM】。
风险提示
- LLM发展不及预期;AI应用商业化不及预期;云厂商Capex投入下降等。