AI算力与互联参数分析
算力参数概览
- 矩阵计算核心:AI算力参数围绕精度与运算效率的权衡展开,FP32 Tensor Core、BF16等新兴数据类型应运而生,以适应AI大模型的训练与推理需求。
- FP32 Tensor Core:作为英伟达张量计算的数据格式,FP32 Tensor Core大幅提升了模型训练性能,如英伟达H200的FP32算力为67TFlops,对应FP32 Tensor Core算力高达989TFlops。
- 国产替代:国内算力厂商如华为海思、寒武纪、龙芯中科等,其产品性能迭代顺利,逼近国际领先水平。例如,昇腾910在FP16算力性能上接近A100,寒武纪思元590性能有望显著提升。
互联参数挑战
- 多卡互联重要性:大模型训练对模型并行的需求显著提升了多卡互联参数的重要性,英伟达NVLink等技术成为关键。
- 性能差异:相比PCIe方案,NVLink能够提供高达900 GB/s的带宽,显著提升通信效率。例如,在大规模高精度计算任务中,H100+NVLink组合的提升尤为明显。
- 国内外差距:寒武纪的MLU-Link桥接卡在互联性能上虽优于PCIe 4.0,但与英伟达NVLink相比仍存在一定差距。
风险提示
- 市场风险:下游需求复苏可能低于预期,影响算力市场的整体增长。
- 技术风险:研发新技术、优化现有技术过程中可能存在技术难题。
- 政策风险:国际政策和技术摩擦可能导致供应链中断,影响算力设备的采购与部署。
行业建议与关注点
- 算力芯片:推荐关注寒武纪(思元590性能提升)、海光信息(深算三号研发进展)、龙芯中科(GPGPU芯片研发)。
- AI应用:关注海康威视、大华股份、乐鑫科技、晶晨股份、恒玄科技、中科蓝讯等企业。
- 服务器:考虑工业富联、沪电股份等公司的服务器业务。
- 服务器存储:看好澜起科技、聚辰股份的存储解决方案。
- 先进封装:聚焦通富微电、长电科技、甬矽电子、华天科技等公司在封装技术上的创新。
此分析旨在提供对AI算力与互联参数的全面理解,以及针对当前市场环境的策略指导。