DeepSeek是谁
DeepSeek全称杭州深度求索人工智能基础技术研究有限公司,成立于2023年7月,是幻方量化旗下的AI公司,专注于实现通用人工智能(AGI),具有深厚的软硬件协同设计底蕴。DeepSeek共研发开源十余款模型,目前最受关注的有V3对话模型和R1推理模型,分别于2024年12月26日和2025年1月20日先后发布。
DeepSeek技术路线解析
- R1系列模型训练流程:以V3模型作为基座模型训练,包括冷启动、SFT、强化学习等步骤。
- 成本相关技术:采用混合专家(MoE)架构、多头潜在注意力(MLA)、多词元预测训练(MTP)、FP8混合精度训练等技术降低训练和推理成本。
- 性能相关技术:采用群体相对策略优化(GRPO)等技术提升模型推理能力。
DeepSeek调用与部署
- 云端调用:可通过官方API或第三方API直接调用DeepSeek R1模型服务,或通过云平台创建、部署、微调模型。
- 本地部署:需下载模型,通过Ollama、vLLM等工具启动模型,并借助可视化界面工具与用户交互。
如何使用DeepSeek
- 独立使用:通过自然语言对话获取核心服务,典型场景包括文本创作、信息咨询、知识推理等。
- 工具组合:基于文本指令驱动的工具生态协同,实现“DeepSeek+”创新工作流,典型组合形态包括办公增效、创意设计、AI音视频、编程辅助等。
趋势判断
- 开源模型将推动AI应用生态的加速繁荣,大幅降低传统企业与创业者接入AI的成本与门槛。
- 推理模型或将成为主流形态,尤其适用于多环节、结构复杂的任务。
- 每项业务都需要接入至少一种AI模型,每位工作者都需要能跑端侧AI的个人电脑,每个公司都需建设能支撑AI工作流的AI算力平台。