转发下最近产业群里大佬们的精彩点评: shuiqing总:up就是脑壳内部I/O大带宽互联,out就是嘴巴/耳朵窄带宽 Jiming总:其实up和out都是相对的,嘴相对大脑就是out,会议室大小相对嘴最近NV路线图之后,大家目光又聚焦到了networking。尤其是IB和以太、scale-up和scale-out、NVLINK与UAlink的对比,讨论得热火朝天。转发下最近产业群里大佬们的精彩点评: shuiqing总:up就是脑壳内部I/O大带宽互联,out就是嘴巴/耳朵窄带宽 Jiming总:其实up和out都是相对的,嘴相对大脑就是out,会议室大小相对嘴其实就是up,而连接会议室的视频电话这个context下就成了out。Out和up没有对错好坏之分。如果硬要说,在成本允许的情况下永远是up 比out好,out是被迫的选择。一张显卡能解决的问题,谁愿意SLI呢。本质上这是个成本和性能的tradeoff,背后真正的驱动因素其实应该是模型的大小和架构,实际运营的训练和推理比重等等。目前这个阶段,只能是up和out不断追着需求跑。可能需要稳定一段时间,up和out才能有表清晰的最优tradeoff。当然,这个所谓的最终也只能是阶段性的最优。S总:从架构和实现角度有必要区分吗?从interconnection的角度来说,最终数据都是从一个logic’men到另外一个logic/mem,只是距离和level不同 zar神:Cloud讲弹性,factory讲性能,本质区别。英伟达终于搞懂拥塞控制了,IB那套玩不转, 放弃了,以太规模就上去了。Spectrum X1600统一了,冠冕堂皇,把IB高端技术移植到以太,搞市场的人的嘴…D总:scale up、out的本质区别,是并行计算的数据关联度。目前来看,up 的带宽是out的10倍,还不算latencey,所以,即便是用便宜的铜缆互联,但是交换、散热等等,成本开销巨大。如果把up限定在一个合理的大小,把out的带宽适当扩大一点,会不会是一个更优的解呢?毕竟AI并行计算中,持续扩大out是不可或缺的。昨天发布的以太网Specturm-x800,就是低配版的InfiniBand,IB有的,specturm都有,只是带宽减半。本质上,就是用不同的技术外衣,进行品牌隔离,保护IB的溢价。 F总:选择任何技术都是讲性价比,scale up解决模型并行,scale out解决数据并行J总:如果以太网互联是大趋势,NVL72 单机大颗粒度的节点还有市场么,一个是尽可能scaleout,另一个是up 方向极致扩张 Y博:NVL72/NVL36的目标客群是进入给用户提供日常运营服务阶段的LLM服务提供商, 对于这部分业务来说, 要满足的是持续的基于新产生的数据进行再训练, 或者基于某些客户的客制化需求提供微调服务, 当然更多的是提供推理服务。 以上需求都是基于现有网络规模来说的, 在这个前提下, NVL72的HBD规模以及HBD内的通信能力足够好到数量级降本了。 NVL576的目标客户, 之前有过一个前辈给过一个很好的观点, 也就是认为NVL576的目标客户是下一代模型训练客户, 对于训练客户来说数量级别的降本并不是一个刻不容缓的目标, 能不能降本可能不是首要的, 提供更大的互联规模下的HBD可能是更重要的事情, 贵一点可能不这么重要。 所以对于这部分客户来说NVL576要回答的关键问题可能是实现了576这个规模的HBD没有,而不是以什么成本实现。