核心观点
- 大模型技术正经历从能听会说看到、能思考、能执行的关键跃迁,但如何跨越成本、场景、工程化三种鸿沟是关键问题。
- DeepSeek 通过模型系数化、小模型训练蒸馏、大小模型组合等技术,在效果和成本之间取得平衡,为 DeepSeek 发挥实战价值提供启示。
- DeepSeek 的核心技术在于模型系数化,通过超吸收的 MOE 模型结构,在训练和推理上都实现了极致的性能优化,包括使用更少的参数、并行分布专家、混合精度训练、流水线并行等。
- 为了进一步提升效果,DeepSeek 推动了 Time2Vec 和 RE 推理模型的发展,通过生成更多思考的 head 来提升答案准确性,并通过大规模强化学习激发模型的推理能力。
- 百度智能云千帆和百个平台为 DeepSeek 的产业化落地提供技术支撑,包括模型开发和应用开发所需的工具链,以及算力支持。
- DeepSeek 引发了模型与基础设施的协同创新范式,百度智能云通过软硬协同优化,极致降低 DeepSeek 的部署成本,包括自动配比的 PD 分离式架构、专家负载均衡策略、大规模 MPP 支持、芯片层面优化等。
- NVIDIA SDK 对 DeepSeek 进行了优化,包括训练推理优化、数据处理优化、推理服务优化等,并推出了 Damoer 服务,支持 PD 分离和推理加速。
- DeepSeek 的火爆加速了产业落地,百度智能云千帆模型开发平台全面支持 DeepSeek 模型服务和开发,帮助企业进行创新。
- DeepSeek 推动了企业级智能应用的开发范式变革,通过重新设计 AI In-three,跑通深度推理模式,实现同时降本增效。
- DeepSeek 带来了前所未有的用户流量,推动了开发者从技术可行性转向场景落地。
- 百度智能云应用开发平台与 DeepSeek 结合,实现了 AI 搜索、Agent 框架、工作流、RAG 等能力的升级。
- 头部开发者基于 DeepSeek 和百度智能云千帆模型开发平台开发了私人版的 DeepSeek RE,用于信息收集和报告生成。
- 百度智能云客运服务营销应用 Redebase C 融合了 DeepSeek,实现了让 AI 更懂业务语言,并通过对话仿真自叠带系统提升效果。
- 极客公园创始人总裁张鹏、百度智胜研发架构师董大祥、Transfersec 创始人 CEO 张晓辉就 DeepSeek 落地中的协同与挑战进行了圆桌对话。
关键数据
- 百度智能云千帆平台日均调用量已达 16 亿规模,企业应用开发数达到 100 多万。
- DeepSeek RE 推理模型通过强化学习,准确率提升至 28%。
- DeepSeek 一键蒸馏在数学竞赛场景上,成本降低了 30%。
- 百度智能云千帆平台支持 DeepSeek 满血版的相关模型蒸馏工作。
- 百度智能云千帆平台支持离线批量推理,价格是在线服务 API 的 40%。
- 百度智能云千3 DeepSeek 一体机内置了千帆模型开发平台和千帆应用开发平台,并加入了企业文档抽取、企业合同审核等开箱即用的应用。
- 百度智能云客粤旺服务营销一体化平台支持全旅程营销,并通过人机协同提升效果。
- 百度智能云端到端语音语言大模型首次面向 to B 企业落地,就在客粤旺产品中。
研究结论
- DeepSeek 的出现推动了大模型技术的快速发展,加速了产业落地,为企业创新提供了新的机遇。
- 百度智能云千帆和百个平台为 DeepSeek 的产业化落地提供了强大的技术支撑,帮助企业降低成本、提升效果。
- DeepSeek 的落地需要考虑成本、性能、稳定性等因素,需要平台和工具链的支撑。
- 未来模型的发展趋势是多模态、具备思考能力,并且会根据不同场景提供不同尺寸的模型。
- 创业团队需要关注用户场景,创造有意义的角色,并利用平台提供的工具和资源,将 DeepSeek 应用于实际业务中。