- 核心观点:DeepSeek 通过模型降本和工程创新,推动 AI 应用产业上升,打开 AI 应用产业上升通道,算力需求不降反增。
- 模型降本:
- 降低训练成本:使用较宽的 MOE 架构、共享专家机制、fp8 低精度训练、双管道训练、多 Token 预测等方法。
- 降低推理成本:提出多头潜在注意力 (MLA)、低精度存储和通信、推理阶段动态专家选择等方法。
- 提高模型效果:使用强化学习做 post-training,针对中文做大量风格对齐。
- 算力需求:
- 模型向更高智能维度跃迁需要更多算力。
- AI 应用的推理需要广泛算力。
- 转向对等异构计算需要更多 GPU。
- 从对话到任务、多模态需要更多算力加持。
- DeepSeek 应用:
- 成为全球 DAU 增速最快的 AI 应用,20 天达成 DAU 2000 万。
- 带来潜在的巨大推理算力需求。
- DeepSeek 本地部署:
- 提供更高的灵活性和隐私保护,适合对数据安全有较高要求的场景。
- 模型规模从 1.5B 到 671B 不等,DeepSeek-V3 作为最新版本,拥有 6710 亿参数。
- 本地部署对 PC 硬件要求较高,尤其是大模型版本。
- 构建个人知识库,保护数据隐私,满足个性化需求。
- 中美 AI 差距:
- DeepSeek 取得成果反映出中美在 AI 产业的差距缩小。
- 中国 AI 模型通过算法工程创新取得优秀表现,但先进制程依然是核心瓶颈。
- 中芯国际在先进制程领域布局领先,有望受益于中国 AI 产业的发展机遇。
- DeepSeek R1:
- 具备优异性价比,蒸馏所得小模型推理性能优越。
- API 定价最低仅为 1 元/百万 tokens,性能对标 O1 模型。
- 上线 18 天日活破 1500 万,增速达 ChatGPT 13 倍。
- 驱动 AI 手机、AI PC、AI 眼镜等硬件出货量上行。
- 微软、英伟达、亚马逊等海外巨头已接入 DeepSeek R1 API。
- 开源模型:
- DeepSeek-R1 高性能、低成本、开放性,海内外迅速破圈。
- 开源模型技术思路“滚雪球”,增长曲线或超预期。
- 优质开源模型可更好用于垂类场景,降低成本推动应用繁荣。
- 风险提示:
- 地缘政治风险;大模型迭代进展不及预期;监管风险;商业化进度不及预期。
- 端侧模型落地进展不及预期;AI 技术迭代不及预期。
- AI 技术交流隔离加剧,AI 应用落地不及预期。