一、核心要点
- 本次会议为东吴传媒互联网及海外科技张良卫团队的Kimi K3技术报告解读电话会议,内容面向机构投资者,非投资建议。
- Kimi K3是全球首个2.8万亿级参数量开源大模型,推理激活参数约1040亿,采用896专家MoE架构(每次推理约激活16个专家),上下文窗口达100万token。
- Kimi K3的核心架构包括自研KDA+MLA混合注意力(3:1比例)、跨深度残差连接、带负载均衡的MoE架构,配备原生多模态视觉分支MoonViT V2,预训练上下文从128k扩至1M,K2资源利用率提升2.5倍,技术实现质的飞跃。
- Kimi K3的后训练流程分为三阶段:SFT冷启动(人在环标注专业数据)、带反RewardHacking机制的RL强化学习、On Policy Distillation(在线蒸馏),关键优化包括Partial Rollout抗长尾、推理预算控制等。
- 评测表现上,K3在Agent长推理类8类任务分数随计算量提升稳步上涨,在Web DevArena等第三方评测超越部分对手,进入第一梯队,部分维度仍有短板;与DeepSeek对比,Kimi K3性能更优,成本高1-2倍,二者通用GPU基建水平接近。
二、风险与关注
- Kimi K3部分维度仍有短板,工具使用、多角色协作等领域表现待提升,未来专用GPU芯片研发或影响DeepSeek的底层优势。