您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:申万宏源AI研究二十讲超节点服务器 - 发现报告

申万宏源AI研究二十讲超节点服务器

2026-07-21 未知机构 丁叮叮叮
报告封面

00:00:00 请参会人员务必注意,本次电话会议交流内容仅限参会人员内部参考,任何机构或个人不得以任何形式对电话会议任何内容进行泄露或外发,请勿以任何方式索要、泄露、散布、转发电话会议纪要。任何泄露电话会议纪要等信息的行为均为侵权行为,申万宏源研究保留追究泄露、转发者法律责任的权利。 00:00:32 哎好的,各位投资者大家晚上好,我是申万计算机的崔航啊,那也欢迎各位领导又这个参加我们这个申万嗯AI20讲当中的, 00:00:43 今天我来汇报一下超节点相关的一个呃观点啊。那呃这里面还是做这个超节点的一个这个框架性的一个汇报啊,那因为呃,各位投资者的这个大家呃可能之前的这个基础啊不完全一致啊,那我这里面啊主要讲三个问题啊。 00:01:02 那第一个就是啊,我们说为什么算力系统啊正在从这个巴卡的服务器走向超节点啊,那第二个呢就是呃海外还有国产的方案啊分别是怎么演进的啊。那包括啊这里面比较呃重要的像英伟达包括国内的, 00:01:19 我们现在看到啊,包括这两天wa AI c上啊,可能看到的这个啊华为的啊等等曙光的这些超级点啊,那第3个呢就是。呃,服务器啊,交换芯片包括连接还有光电啊以及散热等等这些环节啊,哪些到底是真正的增量啊?那我们啊,今天可能个股啊和细分的测算不是特别重点啊,那当然我们还是啊也有相关的材料啊,到时候也是可以啊,有一些这个包括测算的部分可以提供给各位投资者进行一个参考啊。 00:01:52 那这里面呢,我们还是先汇报一下重要的概念啊,就是呃算力扩张现在有两个重要的方向啊,那scale out呢就是呃增加节点的数量啊,那相当于这个啊有点像这个增加啊,我们说 货轮的这个这个数量啊。那Scale up呢啊更多的是把单个的节点去做得更强啊,相当于是建造这个更更大的一个货轮啊,那所以呃过去的市场其实呃更熟悉, 00:02:20 像10万卡的一些集群啊,也就像scale out啊,那真正的说超节点的讨论的核心就是把这个几十张啊几百张的卡啊。用这种啊,极高的带宽啊,包括极低的时延去把它连成一个更大的啊,单个的一个计算单元啊那。两者当中呢就是在整个节点内部做这个强耦合啊,那再把多个节点连接成更大的集群啊。那这里面就是啊一句话概括啊,就scale up主要还是解决单个计算域的一个协同的效率啊。那Scale out呢是解决了整个集群的一个规模的一个问题啊。 00:02:58 那为什么以呃。稍等啊,就呃为什么一定要做scale up啊?因为我们看到说嗯大模型的瓶颈啊,现在已经啊不只是算力本身啊,而是说啊数据能不能够及时地去运送到啊计算单元啊。那嗯GPU呢,整个在呃显存的容量带宽包括芯片之间的通信啊,就是这种传输的呃部分啊,有点跟不上这个这个呃GPU的这个发展啊。那这个就是所谓的这个内存强啊,那scaleup的目标呢啊,就是让这个多颗的CPU啊在软件看来啊,就在我们运行的这个软件看来啊,更像是一颗这个超级的CPU啊,能够更直接地去访问彼此的内存啊。 00:03:48 那它采用的是呃这种接近啊内存访问的一些通信语义啊延迟呢,以这种啊,我们现在现在已经到了这个纳秒级别啊,带宽以这个TB每秒去计算啊那。 00:04:01 Go up,no,no.则更像是呃节点之间啊去互发消息啊,那它的延迟会更高啊,软件的这个协调也会更加复杂。所以呃超节点呢,我们说不是说啊,像之前有部分投资者理解的就是把更多的卡塞进机柜而已啊,而是把整个内存互联交换还有系统的软件啊去共同的完成一个重构啊,那这是啊我们说的一个核心啊。那这里面呢,就是我们还是看海外最成熟的这个英伟达的一个路径啊,那英伟达的路线呢基本上可以分成了这么呃几个部分啊那。 00:04:41 Hooper呃,这个这个Hooper时代呢啊解决的是这个嗯大模型的训练问题啊。那Blackwell时代呢就把重点转向了整个的推理效率还有一个系统的规模啊。那像Robin时代 呢, 00:04:56 就进一步的走向,我们说整套的一个数据中心的一个基础设施的一个重构啊。那这里面呢说我们说从这个啊过去可能23年24年啊,大家可能关心的是一些啊这个单科的一些GPU的性能啊,包括我们当时看到说啊一些tops等等啊,就是大家去做一些比较啊,来去衡量说哎某款芯片大概达到了多少啊。但是现在呢确实已经变成了像G P U、C P U、H B M互联啊,包括机柜啊,甚至到供电和冷却系统啊,整个的这个啊组成了一整个的这个竞争单元啊, 00:05:33 所以后面去看路线图的时候啊,我们去关注的就不是每一代的一个算力数字,而是说随着整个系统的集成度。越来越高啊,整个互联规模越来越大之后啊,整个的功耗密度也会越来越高啊。 00:05:47 那这里面呢,就是我们说芯片层面的这个啊三条趋势啊,就计算裸片呢从这个啊单颗走向这种多裸片啊,那HBM的容量和带宽呢也会有一个快速的提升啊。单封装的功耗呢也会持续的上行,也就是说整个的先进封装包括HBM还有散热供电以及高速互联啊,会越来越成为性能能否兑现的一个约束啊。 00:06:12 那从服务层呃服务器层级来说啊,这个变化会更加直观啊。从Hooper时代的这个巴卡系统走向Blackwell的这个NVL72啊,再到这个啊Robin我们说下一代啊,是更大规模的一个互联啊,系统里的整个GPU的数量啊,包括裸片的数量,还有一些聚合的显存,还有一些带宽都是这种啊,几倍级的一个增长啊。 00:06:38 那所以超节点的本质呢,就是把过去分散在。多台服务器之间的这个通信啊,尽量纳入到一个高性能的这个scale up域当中啊,去进行一个完整。那NVLink是呃英伟达超节点的一个核心的一个护城河啊,那它一个方面呢就是不断去提高整个单链路的一个速率啊,另一方面呢是增加每颗GPU的一个链路数量啊,并且能够通过这个nvswitch啊,把点对点连接组织成这个可扩展的一个交换网络啊。所以我们看从Hooper到blacknkwell啊,每颗 的GPU的双向总带宽提升到大概啊1.8TB每秒啊,那我们也预计说像Robin啊会进一步的进行一个翻倍啊。 00:07:27 那超节点能不能具体的做大啊?不是说这个卡的数量,包括我们说啊为什么现在有的芯片厂商已经推出了超节点的方案啊,有的可能要稍微晚一些啊,那它的关键是在于说交换芯片能否在更大规模下啊, 00:07:45 去维持一个低时延和近乎这种呃我们说无阻塞的一种通信模式啊。 00:07:52 那。这里面呢就是呃几个点啊,那呃我们说第1个就是呃有一些这个计算规则的一些变化啊,那呃我们说还是就是在读一些行业参数的时候,有一些口径上的一些变化啊。那第1个呢就是稀疏算力啊,通常比密集算力高啊,那这个是不能直接去横向比较的啊。那第2个呢就是英伟达常用的这种啊双向带宽啊,把整个的发送和接收去进行一个相加啊,所以单向能力并没有说呃实际上的一个同样的一个翻倍啊。那第3个呢就是Robin之后啊,会更更多的去按照裸片而不是说呃物理封装去计数啊。 00:08:35 因此我们说可以看到整个算力带宽还有GPU数量的啊巨大增幅的时候啊,我们确实要确认这个统计的口径啊,那更多的去关注像呃性能系统吞吐包括功耗还有成本啊那。 00:08:52 这张图呢作为一个总览啊,就后面我们会把整个的一个架构进行一个逐一的一个拆解啊。 00:08:57 那嗯,我们说最早的这个安培啊,安培还是呃奠定了说今天AI服务器的一个基础的一个范式啊。那嗯,tensorcore呢主要负责这个AI的计算啊,那MIG呢主要是提高这个资源的利用率啊,那像NVLink和HBM去进行一个解决呃这个数据的供给问题啊,所以这个我们认为说是啊,进行超节点尝试的一个起点的一个基础架构啊。那Hoooker呢是进一步对呃针对说tensorf呃这个呃Transformer去进行一个这个优化啊,并且把这个HBM的容量还有带宽给推高啊。 00:09:38 我们看到像H100和H200啊最重要的变化,当时最重要的变化不是说计算核心有什么巨大的改变啊,而是说整个的显存从80GB提高到提高到了这个140。40GB以上啊,那带宽也明显的一个增加,说明大模型越来越受这个内存的一个约束啊。那当然与此同时,我们说hopper还是以这个巴卡服务器为主啊,那scale up呢主要还是发生在这个呃一台服务器的一个内部啊。那这一页呢就是芯片结构的对比啊,那啊一个核心结论啊,就是整个的计算单元啊,从这呃和这个专用的AI单元啊都有持续增强啊。 00:10:22 那我们直接往系统架构去看啊,那嗯巴卡的时代的时候啊,有两种典型的互联啊。那这种网状的拓扑啊,是GPU之间这个直接拉线啊,就啊有点像我们之前做的这种简单的排列组合的问题啊,就这种呃8个人彼此这个握手啊,然后去规模这个大了之后啊,整个的链路还有调度就会变得啊非常的复杂啊。那英伟达呢就是采用了一种这个所谓的close思路啊,那也就是说把整个的通信压力啊交给了nvswitch啊。那GPU呢,我们看图上啊,就是GPU通过这个交换芯片啊,可以就实现这种近似无阻塞的这种全互联啊,那这个变化其实是很关键的啊,因为。嗯,就直接从这种从直接的这种互联走向了这个。 00:11:16 呃,交换网络之后啊,整个的交换芯片啊就成为了说scarup系统的一个核心的部件啊。所以我们今天的这个国产的超节点啊,无论是采用这种PCI e啊,还是这种以太网衍生的这种协议,本质上都在解决同一个问题啊。就如果用交换结构啊,就是就是如何去用这种啊交换结构啊,去把更多的这个卡啊组织成这种啊,我们说更高效率的这种以计算域的形式去进行一个呈现啊,那巴卡服务器里面,我们说GPU和NVS switch啊都会放在同一块这个HGX基板上面啊那。 00:11:58 嗯,Scale up高速信号呢主要是走的这个PCB啊,那所以呢就是嗯巴卡时代的增量啊,更多的还是集中在板卡包括封装以及芯片的本身啊。那机内的这种啊,高速铜缆还有连接器用量啊,是啊非常有限的啊。那跨服务器的这个scale out呢,就更多的是通通过这种网卡交换机还有光模块去完成啊。所以后面N V、N V L72把整个的这个s scarup啊从一块板拓展到整机柜啊,走线的方式也会从这个PCB变成大量的铜赖啊,这就带来了说这个呃连接环节的这个明显的一个增量啊,这是我们的一个基础。 00:12:45 那我们再看Blackwell啊,那它的变化呢,我们说第一个。就是他用两颗这个大的裸片啊拼接成了一个统一的GPU啊,说明说单颗的芯片已经接近了这个光照的极限啊。那整个性能提升啊要依赖于说新力和有一些这个先进的封装啊。第二个呢就是啊,它强化了这个FP4啊,就是整个更适合于大规模的这个推理啊,战略重点呢,也会从这个训练的峰值啊,转向了这个呃一定程度转向了这个呃推理的这个吞吐,以及这个总的一个成本啊。那第三个呢就是这个Grace CPU啊与这个GPU啊实现这个高速的互联协同啊,那CPU和GPU以及内存啊就变成了一个整体去完成一个设计啊。 00:13:41 也就是说,在整个的Blackwell时代,英伟达把产品从巴卡的模组升级成了一个整柜级的。 00:13:50 这种NVL72啊超节点已经真正的说进入到了这个商业化。那这一页呢主要是展示这个blacknkwell的一个内部结构啊,作为理解双裸片还有这个呃专用的这个推理单元的一个补充啊。那嗯这是比较关键的啊,就是我们看到说嗯GB200的NVL72啊,把72颗这个B200啊GPU放进一个机柜啊,通过这个18颗的这个nvswitch实现一个全互联啊。那计算部分呢由这个呃18个这个呃compute treee啊去组成。那每个托盘呢大概包含就是每个托盘包含4颗的这个B200啊。那交换的部分呢则分别就交给了这个9个switchtree啊去组成。那所有的GPU呢都处在同一个NVLink scale up的域内啊。 00:14:46 所以说从软件的角度上来说,可以把整柜的资源当成一个超级大的这个计算