DeepSeek开源了为MoE和EP设计的通信库DeepEP,旨在提升GPU间通信效率,优化节点内和跨节点的all-to-all通信,具备高吞吐和低延迟特性。
DeepEP主要包括两种内核:
- 高吞吐内核:适用于训练/prefill场景,动态融合NVLink(节点内,速度可达153-158GB/s)与RDMA(跨节点,速度43-47GB/s)带宽。
- 低延迟内核:适用于推理场景,通过纯RDMA通信+计算-通信重叠技术,解码延迟压至200微秒内,支持实时交互应用。
在DeepEP通信库下,直接通过RDMA通信即可实现模型推理加速。推荐关注国产算力、以太网和PCIe链接产业链。