本周海外AI巨头密集发布新模型,OpenAI推出GPT-5.6系列、xAI发布Grok 4.5、Meta发布MuseSpark 1.1.0。其中,OpenAI的GPT-5.6系列采用三档分层发布策略,编码能力再创新高,TerminalBench 2.1测试中达91.9%(SolUltra),超过mythos5和省流版。模型的中期三大变化趋势日益清晰:1)模型定价分层趋势明显,并非所有任务都需要旗舰模型;2)评估模型时需关注“单位成功任务成本”,而非仅“每百万token价格”,需综合模型效率与价格;3)基模能力与harness设计的重要性界限模糊,两者同等关键。