核心观点与关键数据
太阳模型(Opus 5)发布,定位为用Opus级价格逼近Fable级能力的更具性价比版本。
-
性能提升与性价比
- FrontierBench得分43.3,较Opus 4.8翻倍,超过Fable 5(33.8)和GPT-5.6 Sol(34.4)。
- DeepSWE v1.1得分68.8,略逊于Fable 5(69.7)和GPT-5.6 Sol(72.7)。
- CursorBench 3.2最大算力得分距Fable 5峰值不足0.5%,单任务成本仅为一半。
- #Agent Coding已逼近Fable级,兼具优异性能和性价比。
-
知识工作与工具调用能力增强
- GDPval-AA v2以1861 Elo排名第一,领先Opus 4.8(1593)、Fable 5(1747)及GPT-5.6 Sol(1736)。
- OSWorld 2.0达到70.6%,高于Fable 5(66.1%)。
- BrowseComp达到90.8%,超过Fable 5(87.4)和GPT-5.6 Sol(90.4)。
- #模型处理真实职业任务、执行跨应用计算机操作、网络检索与信息整合能力增强。
-
定价策略
- 价格维持Opus 4.8的每百万输入/输出Token 5/25美元,为Fable 5的50%。
- 已在所有付费套餐、Claude Code、Claude API及主要云平台开放。
- #定位为用Opus级价格逼近Fable级能力的更具性价比版本。
-
Agent提示词影响
- Anthropic Claude Code团队精简系统提示词(删减超80%),核心编码评测指标未下降。
- 结合Superpower等skill搭配GPT-5.6 Sol效果不理想的情况,
- #我们认为随着基模进化,Agent提示词所发挥的作用正在下降。
研究结论
太阳模型(Opus 5)在性能上接近Fable 5,尤其在Agent Coding方面表现突出,同时兼具高性价比。其知识工作、工具调用能力显著增强,定价策略合理。随着模型进化,Agent提示词的重要性下降,这一趋势在最新模型上得到验证。