DeepSeek公司概况
DeepSeek是私募量化巨头幻方量化旗下的大模型企业,成立于2023年5月。幻方量化曾管理资金规模超160亿美元,年管理费收入超过3亿美元。
DeepSeek-V3
DeepSeek-V3(对标GPT-4o)于2024年12月26日推出,因其显著性能,用户迅速增长。
- 基于Transformer架构的混合专家(MoE)模型,总参数量671B,生成每个token时激活37B参数。
- 训练成本比Llama 405B低一个量级。
- 采用MLA多头潜在注意力机制、MTP多token预测、FP8混合精度训练、DualPipe流水线、MoE负载均衡等技术,提升训练效率,降低训练成本。
DeepSeek-R1
DeepSeek-R1(对标GPT-o1)于2025年1月20日推出,迅速出圈海外。
- 推出后追平GPT-o1,从DeepSeek在美国下载排名201名,迅速登顶第一名,在168个国家位居下载榜第一名。
- DeepSeek-R1-Zero:通过大规模强化学习(RL)训练,无监督微调(SFT),展示卓越推理能力,但存在可读性差和语言混合等问题。
- DeepSeek-R1:结合多阶段训练和少量冷启动数据,解决R1-Zero问题,在推理任务上实现与OpenAI-o1-1217相当的性能。
DeepSeek模型效果
- DeepSeek-V3和R1进入国际顶尖模型行列,R1是综合效果最好的开源模型。
- Qwen2.5-Max、GLM-4-Plus、Step-2-16K-Exp等国产模型也有不俗表现。
- DeepSeek-V3和R1扩充了700亿以下开源模型的能力边界,R1在代码、数学、复杂规划等方面能力显著增强。
DeepSeek不同版本对比
- R1蒸馏版vs.R1满血版:数学、代码等场景性能有明显差距,蒸馏版参数量越小,差距越大。
- R1蒸馏版vs.V3满血版:140亿以上参数的R1蒸馏版深度推理效果强于V3,低参数量R1蒸馏版能力落后于V3。
DeepSeek出圈原因分析
- DeepSeek-R1的卓越性能表现。
- DeepSeek-V3的超低训练开销。
外部评价
- OpenAI奥特曼认为DeepSeek是令人印象深刻的模型,但相信OpenAI会继续开拓前沿。
- Meta扎克伯格认为DeepSeek技术先进,竞争差距很小,但Meta不会减少AI支出。
- Yann LeCun认为开源模型正在超越闭源。
- Anthropic CEO达里奥·阿莫迪认为DeepSeek模型接近7-10个月前美国模型的性能,成本低得多。
- Scale AI创始人亚历山大·王认为DeepSeek可能改变中美在人工智能竞赛中的格局。
- 冯骥认为DeepSeek是国运级别的科技成果,强大、便宜、开源、免费、联网、本土。
- 刘知远认为DeepSeek的意义更像Llama,R1相当于是像2023年初的OpenAI ChatGPT一样,让所有人真正地感受到了震撼。
DeepSeek影响
对全社会的影响
- DS作为现象级应用,对全社会开展人工智能科普再教育,DSC端应用人人装,人人感受人工智能。
- 政府和企业认识到人工智能战略意义,由探索尝试升级为战略布局,市场进入爆发期。
- DS上线20日,日活超4000万,达到ChatGPT 74%,微信、钉钉等头部应用纷纷接入。
- 全国10省省委书记将人工智能作为新春第一会重点部署,B端大模型应用进一步加速。
对市场竞争的影响
- DS开源策略冲击基础模型商业模式,市场竞争从比拼模型能力进入比拼应用、数据、工程化交付能力的第二阶段。
- C端AI应用市场格局重构,新入局者迎来机遇。
- B端客户全面评估DS影响,重新论证基础模型选型。
具体应用案例
- 大模型赋能政务热线应用:服务80+坐席人员,工单填单时间下降,记录完整度提升。
- 大模型辅助政府经济决策:服务北京发改委、广东政数局等多省市项目。
- 大模型赋能公安智能化:利用以图搜图、以文搜图提升检索效率。
- 大模型赋能医疗智能应用:助力中山三院智能化升级。
- 大模型赋能船舶设计:造船规范知识问答、翻模设计。
- 大模型赋能国产大飞机装备运维:基于RAG的装备运维。
- 大模型赋能文博文创:助力国博、外文局等文物创新应用。
DS应用落地面临的挑战
- DS优势在6000亿级语言大模型和R1版推理效果,应用侧落地仍需要多模型组合、多外挂工具,以及大量工程化配合。
- C端AI应用需要通才,B端应用需要专才。
- B端生产场景多数重复使用模型某一重复能力,大量百亿级参数模型即可适用。
- DS满血版推理需大量算力,不适合高实时业务应用场景。
- 让DS高效学会私域知识尚未明显突破。
认识大模型的局限性
幻觉
- 大模型生成与事实不符或逻辑错误的内容。
- 原因:大模型结构和训练机制,缺乏对真实世界的有效建模方式和全息感知能力,训练数据的局限性。
- 应对:建立“大模型结果不一定可信”的认知,对模型输出进行验证。
算力消耗大
- 模型训练和推理都需要大量算力,实时性差,支持的并发低。
知识实时更新能力差
- 大模型参数量大,知识更新速度慢,无法实时将最新事件、社会动态、研究成果加入到模型。
- 缓解手段:联网搜索+检索增强生成(RAG)。
偏见、隐私与安全
- 大模型的输出结果可能包含偏见,易生成有害内容,安全评估与防范难度大。
- 建议:问大模型的问题不要涉及政治敏感、黄赌毒、暴力、歧视等,不要包含国家机密或机构的商业秘密。
认识大模型的优势和特色
- 熟悉大模型的回复特点,掌握提问技巧,激发模型的创造力。