GB系列:AI产业川流汇聚,云端两旺机遇开启
Blackwell架构推出多项技术突破,整体以机柜形式交货。GB200机柜分为NVL36和NVL72两种规格,NVL72在一个机架中配置72个GPU/18个双GB200计算节点。计算托盘包含两个GB200 Grace Blackwell超级芯片,每个芯片集成两个高性能GPU和Grace CPU,通过NVLink-C2C接口连接,提供900 GB/s双向带宽。交换托盘引入第五代NVLink,可连接多达576个GPU,总带宽超过1 PB/s。
Blackwell架构的技术突破包括:
- GPU采用台积电4NP工艺,拥有2080亿个晶体管,通过10 TB/s片间互联技术连接成统一GPU。
- 第二代Transformer引擎针对LLM和MoE模型进行优化,支持FP4数据精度,提升性能和准确性。
- 第五代NVLink技术实现高速互联,NVL72支持130TB/s的GPU带宽,并通过NVIDIA SHARP™技术提升带宽效率。
Blackwell或成推理市场的钥匙,FP4精度潜力较大。模型参数增长速度放缓,但推理和训练运算量高速增长。FP8数据精度因占用比特更少,能提供更多运算量。以NVIDIA H100 Tensor Core GPU为例,FP8的峰值性能相较FP16和BF16接近翻倍。研究表明,FP8训练与BF16收敛性无显著差异,FP8推理可通过KV cache转换提升模型吞吐量约两倍。FP4精度是FP8的继承和发展,GB200推出FP4后,性价比相比H100几乎倍增。GB200 NVL72在FP4精度下,FLOPS相比H100最高提高405%。FP4运算已在大模型运算中广泛应用,研究表明网络使用FP4精度训练无显著精度损失。B系列在推理领域更有优势,引入FP4精度后,大模型在云侧和端侧的协同有望实现跃升。
AI产业川流汇聚,2025年有望云端两旺。B系列推出有望打开推理市场,各类AI终端将迎来持续机遇。AI产业闭环有望刺激云厂商资本开支,云端共振共同发展。建议关注英伟达产业链传统核心厂商,如ODM、PCB厂商等。此外,B系列带来的新兴赛道如铜连接、AEC赛道也值得关注。
风险因素:宏观经济下行风险;下游需求不及预期风险;中美贸易摩擦加剧风险。