一、GPT 5.6 Sol与Kimi K3发布:能力升级与公开表现
- Kimi K3:以超大规模(2.8万亿参数)和开放权重为特色,强化长时间持续执行复杂任务的能力,但发布首日出现推理速度慢和请求无法响应的情况。
- GPT 5.6 Sol:以Token效率为核心,新增Programmatic Tool Calling机制,更适合步骤较多、持续时间较长的复杂工作流,但未披露参数规模。
- 三模型对比:均支持约100万Token上下文,Kimi K3参数规模最大,GPT 5.6 Sol价格较高,GLM-5.2价格最低。综合得分排名:GPT 5.6 Sol(59分)> Kimi K3(57分)> GLM-5.2(51分)。
二、三类金融投研任务实测点评
2.1 估值任务:中际旭创
- Kimi K3:报告逻辑自洽,但估值模型联动较弱,Excel表部分公式错误,底稿未达到直接使用标准。
- GPT 5.6 Sol:模型联动与检查体系最完整,Excel模型可联动更新,报告逻辑一致。
- GLM-5.2:底稿存在多处公式异常,目标价与投资评级出现逻辑冲突,表现相对较差。
- 估值任务能力总结:GPT 5.6 Sol(综合排名第一)> Kimi K3(排名第二)> GLM-5.2(排名第三)。
2.2 回测任务:沪深300成分股
- Kimi K3:交付较完整,但交易时点与交易约束处理不足,底稿质量较好,报告对策略可执行性及回测局限的讨论不够充分。
- GPT 5.6 Sol:交易时点最严谨,底稿最易复核,但首次执行时运行时间过长,回测区间较短,未计入交易成本,对跌停股票无法卖出的情况处理不完整。
- GLM-5.2:回测区间最长,但同样没有明确区分信号日和执行日,未计入交易成本和不可交易状态,底稿披露不足,部分图表存在显示不完整的问题。
- 回测任务能力总结:GPT 5.6 Sol(综合排名第一)> Kimi K3(排名第二)> GLM-5.2(排名第三)。
2.3 行业研究任务:半导体设备产业链
- Kimi K3:投资框架清晰,但Wiki沉淀不足,报告和投资框架较为完整,但Wiki实际沉淀的公司页面和来源资料较少。
- GPT 5.6 Sol:研究逻辑和来源管理最规范,报告结构清晰,Wiki保留了来源摘要和综合研究页面,资料追溯最方便。
- GLM-5.2:覆盖范围最广,但逻辑支撑较弱,报告展示效果较好,但部分分析逻辑不够清楚,Wiki来源管理和内部链接不完整。
- 行业研究任务能力总结:GPT 5.6 Sol(综合排名第一)> Kimi K3(排名第二)> GLM-5.2(排名第三)。
三、总结
- GPT 5.6 Sol、Kimi K3和GLM-5.2均已具备完成复杂投研任务的基础能力。
- GPT 5.6 Sol:综合表现最好,三个任务均形成了较完整且逻辑一致的交付结果。
- Kimi K3:分析逻辑基本清楚,但底稿质量和长程执行稳定性弱于GPT 5.6 Sol。
- GLM-5.2:三个任务均存在影响可靠性或可使用性的问题。
风险提示
- 历史规律不代表未来,模型存在失效的风险。
- 策略收益可能因交易成本或其他条件改变而下降甚至出现亏损。
- 大模型输出的内容存在一定的随机性和准确性风险。
- 部分应用本身可能存在一定的安全风险。
- 使用AI生成内容时,需要注意相关版权问题。