产业视角:推理对高带宽内存(HBM)的依赖性是一个关键因素,其重要性甚至超过了对算力的需求。具体观点如下:
-
内存需求分析:
- 以 DeepSeek-R1 为例,整个模型运行需要 671 GB 的 HBM,其中每十亿个参数大致需要 1 GB 的内存。
- 尽管模型中只有约 370 亿个参数处于活跃状态,但整个模型(包括门控函数及权重)都必须常驻内存,且还需要为生成“思考链”保留额外缓存。
-
内存带宽的重要性:
- 在推理过程中,芯片内的内存带宽至关重要,因为所有数据的读写都集中在单个芯片上进行。
-
预训练与推理阶段的差异:
- 预训练阶段更侧重于大量数据和模型参数在多个芯片之间的传输,因此更加依赖数据中心内部或跨数据中心的全互连通信带宽。
- 测试时推理阶段主要依赖单个芯片上高效的内存带宽,从而支持高效的“思考链”生成和处理。