核心观点与关键数据
-
模型自主迭代与性能提升
- M2.7核心变化在于模型自主构建Agent Harness,驱动强化学习完成100+轮迭代,带动内部评测集效果提升30%。
- 软件工程能力:SWE-Pro达56.22%(近Opus 4.6),VIBE-Pro 55.6%,SWE Multilingual 76.5%,GDPval-AAElo 1495(开源最高)。
- 生产环境故障恢复时间缩短至3分钟以内。
-
Agent能力与评测表现
- 复杂skills场景指令遵循率97%,OpenClaw接近Sonnet 4.6。
- GDPval-AA Elo 1494(超MiMo-V2-Pro、GLM-5、Kimi K2.5,但落后GPT-5.4、Claude Opus 4.6)。
- 幻觉明显下降(AA-Omniscience +1,幻觉率34%,优于Claude Sonnet 4.6、Gemini 3.1 Pro)。
- 分项能力:HLE、TerminalBench Hard等提升,τ²-Bench下滑11pct(收益不均衡)。
-
基础参数与开源策略
- 上下文窗口200K token,定价$0.30/$1.20(持平M2.5),仅支持MiniMax API,暂无多模态。
- 开源权重未公布,M2.5采用MIT协议。
-
效率与成本分析
- 输出token用量增55%(约8700万,高于M2.5的5600万),但优于GLM-5(1.1亿),与Kimi K2.5(8900万)接近。
- 成本优势显著:运行全套评测仅需$176(远低于GLM-5、Kimi K2.5、Gemini3 Flash)。
-
实测反馈与综合评价
- 实质为小版本升级,整体性能与M2.5持平,改进点:
- 指令遵循能力提升(稳定性略降)。
- 长上下文幻觉减少,信息提取满分。
- 编程工程能力增强(频繁输出结构化文件)。
- 不足:硬推理能力退步,复杂问题token消耗增50%-100%,推理速度65 tps未提升。