您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:KimiK3Coding及长程任务能力显著提升定价同 - 发现报告

KimiK3Coding及长程任务能力显著提升定价同

2026-07-16 未知机构 秋穆
报告封面

事件:7月16日晚间,月之暗面正式上线旗舰模型Kimi K3。#总参数达2.8万亿,#为目前国产模型最高,支持多模态理解,1.05M上下文,完整权重计划于7月27日前发布。 提升1【Coding紧追海外领先模型,长程任务表现突出】 K3在Terminal-Bench 2.1得分88.3,紧随GPT-5.6 Sol的88.8,领先Fable 5和Opus 4.8的84.6;DeepSWE得分67.5,低于GPT-5.6 Sol的73.0和Fable 5的70.0,略高于GPT-5.5的67.0。评价长周期工程的FrontierSWE上K3取得81.2,仅次于Fable 5的86.6,超过GPT-5.6 Sol的71.3。#仅从BenchMark看,#K3的Coding能力已接近海外头部模型,#在长程任务上显著加强。 提升2【知识工作、工具调用能力优异,利于Agent工作】 K3在GDPval-AA v2取得1668 Elo,落后于Fable 5的1760和GPT-5.6 Sol的1748,超过Opus 4.8的1600和GLM-5.2的1514;AA-Briefcase取得1548,接近Fable 5的1583,超过GPT-5.6 Sol的1495;BrowseComp达到91.2%,超过GPT-5.6 Sol的90.4和Fable 5的88.0(官方公众号列出的得分和第三方得分存在小幅差异)。#K3在复杂知识工作和工具调用方面已达到前沿水平,为Kimi Work 提升3【KDA架构降低长上下文缓存占用和计算开销】 围绕长上下文及超大规模MoE训推效率进行架构升级。K3采用Kimi Delta Attention混合线性注意力和注意力残差机制,#此前发布的技术报告显示,在48B/3B的Kimi Linear #实验模型采用3:1的KDA/MLA混合比例,#最高减少75%的KV Cache,#并在1M上下文下实现最高约6倍解码吞吐,具体到K3能做到多大程度待官方发布。模型在896个专家中激活16个,叠加训练方法和数据配方的优化,K3相比K2的整体扩展效率提升约2.5倍。 【使用体验】 前端能力突出,审美及设计全球一流,对于已知网页能够高度还原视觉效果;结合Kimi Work后,相比K2.6一次检索直出结果的准确度、指令遵循效果均显著提升,搭配Kimi Work本身较完整的插件/Skill生态,处理办公任务能力加强。思维链偏长,Kimi Work Max思考强度下任务反馈稍慢,可能导致实际token消耗增加。 【定价暂列国产旗舰模型最高】 API每百万tokens输入/输出定价为¥20/¥100 (15),与GPT-5.6 Terra的 15、Claude Sonnet 5的15接近,显著高于GLM-5.2的4.4以及Qwen3.7 Max的7.5。#截至7月16日,#属于目前定价最高的国产旗舰模型,#1M上下文能力面向订阅价格699元/月的Allegro会员开放。