本次电话会议主要对比评测了国产大模型 Kimi K3 与海外大模型 GPT5.6 以及 GLM5.2 在金融投研领域的模型能力。
模型介绍与基准测评:
- Kimi K3 是近期发布的新模型,参数规模达 2.8 万亿,具备多模态能力,在架构和功能上均有明显提升。
- GPT5.6 是前沿的海外模型,在能力上有所提升,但仍是纯文本模型。
- GLM5.2 是上一代国产模型,各方面能力均低于 Kimi K3 和 GPT5.6。
- 在 API 价格方面,Kimi K3 的价格已降至 GPT5.6 的一半,与 GLM5.2 相比也有明显优势。
- 在通用基准测试中,Kimi K3 在编程和 A 能力方面与 GPT5.6 相当,但略逊于 GLM5.2。
金融投研场景评测:
- 估值建模:
- Kimi K3 和 GPT5.6 均能完成任务,但 GPT5.6 在预测逻辑和 Excel 底表质量上更优。
- GLM5.2 存在公式错误和逻辑冲突,导致估值结果不可靠。
- 排名:GPT5.6 > Kimi K3 > GLM5.2
- 主动投研:
- Kimi K3 和 GPT5.6 均能构建投资框架和行业深度报告,但 GPT5.6 在 Wiki 页数量和来源链完整性上更优。
- GLM5.2 缺乏来源页,无法追溯结论的真假。
- 排名:GPT5.6 > Kimi K3 > GLM5.2
- 量化回测:
- Kimi K3 和 GPT5.6 均能完成回测任务,但 GPT5.6 运行时间过长,存在卡顿问题。
- GLM5.2 在数据处理和细节方面存在不足。
- 排名:GPT5.6 > Kimi K3 > GLM5.2
研究结论:
- GPT5.6 在三个任务中均表现最佳,但 Kimi K3 也有明显进步,在成本和效率方面更具优势。
- 国产模型在金融投研场景中已具备较强能力,可满足大部分工作需求。
- 未来希望国产模型能覆盖更多场景,进一步提升能力。