核心观点
- 模型架构创新: Kimi K3 是一个 2.8 万亿参数的混合专家模型,采用 Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes) 架构,有效提升信息流,结合 Stable LatentMoE 技术,在序列长度、网络深度和模型宽度三个维度上实现信息流的扩展,显著提升模型效率。
- 多模态能力: Kimi K3 具备原生视觉能力,使用 MoonViT-V2 编码图像和视频,并通过轻量级投影器将视觉特征映射到共享嵌入空间,实现多模态理解。
- 长上下文处理: Kimi K3 支持 100 万个 token 的上下文窗口,通过逐步扩展上下文窗口大小,并采用 KDA 和 AttnRes 技术,实现高效的长上下文处理。
- 强化学习: Kimi K3 经历了针对通用、代理和编码领域的强化学习,涵盖多种推理努力水平,通过多教师策略蒸馏 (MOPD) 将不同领域的专业能力整合到统一模型中。
- 基础设施创新: Kimi K3 的训练和推理依赖于多项基础设施创新,包括 KDA 算法-系统协同设计、MoonEP 和内存高效的 MoE 预训练框架、百万 token 代理轨迹的 co-located 强化学习系统等。
关键数据
- 模型参数: 2.8 万亿总参数,1040 亿激活参数,100 万 token 上下文窗口。
- 效率提升: 相比 Kimi K2,整体缩放效率提升约 2.5 倍。
- 性能表现: 在长时程编码、代理、知识、推理和视觉任务中均达到前沿水平,整体性能略逊于 Claude Fable 5 和 GPT-5.6 Sol,但始终优于其他开源和专有模型。
研究结论
Kimi K3 建立了一个新的开源前沿,通过结合模型架构创新、多模态能力、长上下文处理、强化学习和基础设施创新,实现了在多个任务上的前沿性能,为研究和部署前沿智能提供了重要支持。