摘要
本报告探讨了在华为昇腾服务器上部署DeepSeek V3/R1推理的最佳实践,针对不同推理场景的需求,提供了两种不同的部署形态:
- 大规模EP部署策略(基于CloudMatrix 384超节点):利用CloudMatrix 384的超节点组网优势,使用144张卡作为一个Decode实例,实现较低时延下的高并发,当前已达到50ms时延约束下每卡输出1920 Tokens/s。
- 小规模EP部署策略(基于Atlas 800I A2服务器):使用4节点A2服务器作为一个Decode实例,实现较优吞吐下的灵活部署,当前达到了100ms时延约束下每卡输出723∼808 Tokens/s。
报告采用基于vLLM的部署框架,适配EP/DP/TP混合并行策略,满足灵活调度和极致性能的需求。模型层面,采用A8W8(INT8)的动态量化方式,并使用Multi-Token Prediction技术进行加速。算子层面,提出了多种结合数学等价变换、融合算子、缓存复用和流水掩盖等技术的计算和通信算子的优化方案。
报告详细介绍了上述两套部署方案,并列出关键的特性和优化技术。性能分析显示,两种方案均能实现较高的单卡吞吐,并满足实际服务时对首Token时延和Decode时延的要求。
下一步工作
报告还列举了当前部署方案后续要增加的特性和优化方案,包括:
- 低时延场景的极致优化
- Micro-batch优化方案
- 低比特量化方案
- MLA层算子量化支持
- Atlas 800I A2的更大EP部署方案
- 序列负载均衡优化方案