核心观点
- 国产大模型Kimi K3发布,参数量达2.8万亿,成为首个面向开源社区开放的3万亿级别大模型,综合智能水平位列全球第三。
- K3模型在架构、训练方法和推理优化等方面进行创新,包括长城任务、MoE架构、SFTT量化感知训练和Mooncake分离式推理架构等,实现长程复杂任务的高效处理和低成本推理。
- 开源模型有助于提升国产大模型的应用渗透率,通过C端用户免费使用和B端企业付费服务构建商业化生态。
- 大模型自我训练和超长任务处理是未来发展方向,K3在超长任务上的突破为国内厂商提供启示。
- 国产大模型在次顶尖水平上加速追赶,在B端领域具备竞争力,未来应用场景将进一步拓宽。
关键数据
- K3模型参数量:2.8万亿
- K3模型上下文窗口:百万token
- K3模型定价:输入价格20元,输出价格100元每百万token
- K3模型扩展效率提升:2.5倍
- K3模型训练数据量:30万亿token
- 大模型训练成本占比:预训练60%,后训练30%~40%,测评和加速20%~30%
- 预训练成本占比未来趋势:降至50%左右
研究结论
- 开源模型有助于提升国产大模型的应用渗透率,构建商业化生态。
- 大模型自我训练和超长任务处理是未来发展方向,K3的突破为国内厂商提供启示。
- 国产大模型在次顶尖水平上加速追赶,在B端领域具备竞争力,未来应用场景将进一步拓宽。