K3总参数量达2.8万亿,支持100万Token上下文和原生视觉处理。其核心优势在于超稀疏MoE与长任务架构的协同:采用896选16的超稀疏专家模型,激活比例仅1.79%;通过Stable LatentMoE扩大专家容量并保持稀疏激活;KDA技术压缩长上下文并保留部分完整注意力,缓解KV Cache和带宽压力;注意力残差机制改善深层信息传递;Mooncake分离式推理和预填充缓存复用重复前缀,编程负载缓存命中率超90%。
长程任务能力是K3的关键竞争力,官方案例包括48小时芯片设计自动化和120多轮递归改进生成ASIC产业交互式研究网站。定价方面,K3每百万Token输入3美元、输出15美元,与Claude Sonnet 5标准价一致,输出价为GPT-5.6 Sol的一半,标志着国产模型首次主动进入海外SOTA价值定价区间。
部署建议显示K3需在64张以上加速器组成的超节点运行,反映其对专家并行和高带宽互联的高要求。K3的发布改变了国产模型在工作流中的定位,从过去处理简单重复任务的角色,升级为可承担复杂研究、长时程编码和知识工作的主力模型。研究结论表明,国产模型已进入主力模型池,并持续冲击全球能力前沿。