DeepSeek V4 模型及 AI 技术进展分析
核心观点与关键数据
- DeepSeek V4 模型发布:据 The Information 报道,DeepSeek 将于 2026 年 2 月中旬推出新一代旗舰 AI 模型 DeepSeek V4,其编码能力预计超越 Claude 和 GPT 系列,对标预期中 2025 年 5 月发布的 R2 模型。
- 模型成本与性能:DeepSeek R1 模型的总训练成本为 586 万美元,远低于顶级模型动辄千万美元的成本,其中预训练占 95%,后训练占 5%。
- 国产芯片适配:DeepSeek V3.1 和 V3.2-Exp 已适配国产芯片,采用 UE8M0 FP8 缩放格式训练,并开源 TileLang 和 CUDA 算子,改善 CUDA 生态壁垒。
技术创新与进展
-
稀疏化分配方案(Engram):
- 引入“条件记忆”机制,通过稀疏查找检索固定知识,实现常数时间复杂度知识检索。
- 20%-25% 的稀疏参数预算分配给 Engram 时,模型性能最佳,显著提升通用推理、代码、数学问题的表现。
- 实现计算与内存解耦,缓解 GPU 内存受限问题,为 TB 级超大规模记忆库提供可行路径。
-
mHC 架构创新:
- 基于 Hyper-Connections(HC)改进 ResNet 架构,解决信息通道宽度受限、计算冗余和内存占用问题。
- mHC 使模型训练收敛速度提升约 1.8 倍,提高 MoE 模型的稳定性与可扩展性。
-
长文本输入优化:
- DeepSeek-OCR 和 DeepSeek-OCR2 将文本以图片方式输入,减少 token 数量,解决长文本输入问题。
- 压缩率低于 10× 时,解码精度达 97%;压缩率 20× 时,解码准确率仍约 60%。
-
R1 论文更新与透明度提升:
- R1 论文从 22 页扩展至 86 页,公开更多训练细节,包括训练流程、基础设施、消融实验等。
- 进一步披露 R1 训练成本为 29.4 万美元,验证模型成本控制优势。
V4 潜在创新方向与影响力预测
- 模型成本降低:Engram 和 mHC 架构有望大幅降低模型成本,缓解国内缺芯状况。
- 开源与模型能力超越:若 V4 继续开源且能力超越闭源模型,将冲击海外厂商盈利模式,利好 AI 应用落地。
- 全新架构突破:市场预期 V4 可能采用独立于 Transformer 的全新架构,开启大模型发展新范式,加速 AGI 进程。
- 国产芯片深度融合:V4 可能部分或全部采用国产芯片进行训练,利好国产算力生态建设。
风险提示
- 国际局势不确定性;海外 AI 产业竞争格局变化带来的市场调整风险。