DeepSeek发布第二代MoE架构模型DeepSeek-V2,显著提升了模型的参数量、能力并降低了成本。该模型在中文综合能力评测中与GPT-4-Turbo、文心4.0等模型处于同一梯队,在英文综合能力与LLaMA3-70B并驾齐驱,并在知识、数学、推理和编程领域表现出色。DeepSeek-V2支持高达128K的上下文窗口。
DeepSeek-V2通过创新的模型架构实现了大规模模型的性能提升,相较于主流的Dense和Sparse结构,它采用了MLA(Multi-head Latent Attention)架构,有效减少了计算量和推理所需的显存,使得性能达到了70B~110B Dense模型的能力水平,但消耗的显存仅为同级别Dense模型的1/5至1/100。实测显示,部署在8卡H800机器上时,输入吞吐量超过每秒10万tokens,输出速度超过每秒5万tokens。
在成本方面,DeepSeek-V2的API定价为每百万tokens输入1元、输出2元(32K上下文),远低于GPT-4-Turbo的价格,对于中文能力而言,DeepSeek-V2在全球模型中处于高端位置,但成本却更为低廉,体现出高性价比。此外,DeepSeek-V2通过集成多种有效的训练策略,如长度外推训练的YaRN、高效对齐的GRPO、MLA与混合专家分配等,实现了算法、工程和数据的极致优化。
随着大模型参数量的不断增大,推理侧的成本控制已成为行业关注焦点。模型架构的创新有助于大幅度降低成本,这可能刺激需求增长,促进算力市场的进一步发展。建议投资者关注海光信息、景嘉微、寒武纪、工业富联和浪潮信息等公司。
然而,行业面临的风险包括激烈的竞争和潜在的算力供给不足问题。投资者需谨慎评估这些风险因素对投资决策的影响。