DeepSeek V4.1 Flash模型在编程与Agent能力上显著增强,DeepSWE v1.1得分提升至74.2%,AutomationBench提升至54.8%,超过Opus 5与GPT-5.6 Sol。同时,原生多模态拓展工作场景,支持图文理解,可通过截图检查前端页面及办公产物并纠错,推动泛白领场景应用。
DeepSeek V4.1 Flash采用输入输出非对称架构,输入阶段每Token激活8B参数,输出阶段16B,匹配Agent长程任务特征。通过缓存压缩技术,全局KV缓存占用降至上代Flash的1/4,持久KV缓存降至1/8,覆盖输入计算、上下文存储与数据搬运,改善长上下文、多轮调用及高并发Agent的部署经济性。
报告指出,DeepSeek V4.1 Flash的原生多模态能力支持图文理解,可通过截图检查前端页面及办公产物并纠错,推动泛白领场景应用。真实任务反馈进入训练闭环,基于员工及合作伙伴反馈的交互数据、失败案例,重建真实工具与工作流,批量合成可验证任务,强化学习提升能力,强化学习提升能力。高质量反馈与训练环境的厂商将形成持续迭代优势。
当前AI大模型市场,DeepSeek V4.1 Flash通过真实任务反馈进入训练闭环,基于员工及合作伙伴反馈的交互数据、失败案例,重建真实工具与工作流,批量合成可验证任务,强化学习提升能力。报告指出,在最困难的推理及科研类Agent任务上,与领先闭源模型仍有差距。同时,已接入应用WorkBuddy(含CodeBuddy)及OpenCode已全量接入,9月14日起,V4 Pro请求切换至V4.1 Flash并按Flash价格计费,直至V4.1 Pro上线。
阅读这份研报需关注,报告指出在最困难的推理及科研类Agent任务上,与领先闭源模型仍有差距。同时,后续需关注开源推理适配及社区实测口碑,缓存压缩下长任务准确率、稳定性与实际总成本,以及V4.1 Pro等更大模型的能力上限。此外,9月14日起,V4 Pro请求切换至V4.1 Flash并按Flash价格计费,直至V4.1 Pro上线,需关注市场反应。