核心观点与关键数据
- DeepSeek-V3 发布:2024年12月底发布,为自研 MoE 模型,参数量671B,激活参数37B,在14.8T token 上进行预训练。
- DeepSeek-R1 发布:2025年1月底发布,性能对标 OpenAI o1 正式版。
- 模型表现:DeepSeek-V3 在多项评测中超越 Qwen2.5-72B 和 Llama-3.1-405B 等开源模型,与 GPT-4o 和 Claude-3.5-Sonnet 等闭源模型性能相当;DeepSeek-R1 在数学、代码、自然语言推理等任务上性能比肩 OpenAI o1 正式版。
- 推理效率:DeepSeek-V3 生成吐字速度从 20 TPS 提升至 60 TPS,相比 V2.5 模型提升3倍。
- 成本降低:DeepSeek-V3 和 R1 在 web 端和 APP 端可免费试用,API 服务定价大幅降低。
研究结论
- 大模型趋势:多模态、复杂推理能力提升仍为大模型迭代趋势。
- 市场反应:DeepSeek-R1 低成本推出加速市场对大模型推理能力提升的认知及需求,有望促进大模型产品商业化落地进程。
- 用户增长:DeepSeek 应用(APP)日活跃用户 DAU 第 5 天超过 ChatGPT,第 15 天达 259 万,成为全球增速最快的 AI 原生应用。
- 投资建议:基础设施供应商(如中科曙光、浪潮信息)、已发布通用大模型或积极探索 AI 行业应用落地的公司(如科大讯飞、昆仑万维、三六零、拓尔思)、具备 AI 应用落地场景的相关标的(如金山办公、福昕软件)有望受益。
风险提示
- 大模型产品迭代不及预期、科技摩擦加剧影响行业发展、AI 产品化商业化落地不及预期风险。