DeepSeek-V4概览:百万上下文普惠时代开启
DeepSeek于2026年4月24日正式上线并开源DeepSeek-V4预览版,推出DeepSeek-V4-Pro(1.6万亿总参数,49B激活参数)和DeepSeek-V4-Flash(2840亿总参数,13B激活参数)两个版本。V4系列模型通过架构创新将最大上下文长度提升至100万Token,大幅降低计算与内存成本。在百万Token场景下,V4-Pro的单Token推理FLOPs较V3.2降低3.7倍,KV Cache降低9.5倍;V4-Flash进一步降低至FLOPs的1/9.8、KV Cache的1/13.7。V4-Pro-Max模式在Agent能力、世界知识、推理性能上表现优异,接近世界顶级闭源模型水平,已应用于公司内部Agentic Coding场景。官方预计下半年昇腾950超节点批量上市后,Pro的价格将大幅下调。
架构革新赋能效率跃升——从算法到基建的全链路创新
DeepSeek-V4的高效能得益于多项架构创新,形成从算法到底层基建的全链路优化体系。
- 算法层面:采用CSA与HCA融合的混合注意力机制,搭配流形约束超连接(mHC)与Muon优化器,提升长上下文运算效率,强化模型建模能力,加快训练收敛速度。
- 底层基建方面:通过MoE模块一体化融合内核、领域专用语言TileLang、FP4量化感知训练等多项优化,实现计算、通信与内存访问的高效协同,降低内存占用与计算开销。
- 训练与推理框架层面:通过自动微分模块拓展、异构KV缓存架构设计等策略,全方位提升训练与推理效率。
国产算力协同适配——Day 0双首发,助力产业自主可控
DeepSeek-V4发布当日即实现寒武纪、华为昇腾两大国产芯片的Day 0适配。
- 寒武纪:基于vLLM推理框架完成适配并开源代码,通过自研融合算子库、高性能编程语言及多维度推理框架优化,深度挖掘硬件特性,充分释放模型推理潜能。
- 华为昇腾:昇腾超节点全系列产品全面支持该模型,昇腾950通过融合kernel、多流并行等技术及底层架构升级,实现高吞吐、低时延部署;昇腾A3超节点也完成适配并提供训练参考实现。
投资建议
相关标的包括国内算力、海外算力/存储、CPU、AI应用等。
风险提示
行业竞争加剧的风险;技术研发进度不及预期的风险;特定行业下游资本开支周期性波动的风险。