核心观点
- OpenAI发布GPT-5.5,Codex大更新、GPT-image-2相继发布,全面强化“真实工作”能力;
- Anthropic发布ClaudeOpus4.7与ClaudeDesign,覆盖编程与设计工具市场;
- DeepSeek发布V4,极致低价冲击全球AI定价体系;
- 阿里通义千问Qwen3.6-27B正式开源;
- 腾讯双线出击,混元3D世界模型2.0与Hy3Preview相继亮相;
- 字节Seed3D2.0、月之暗面KimiK2.6、小米MiMo-V2.5密集发布,国内大模型竞争进入多线并发阶段;
- Cursor以500亿美元估值融资,SpaceX寻求收购;
- Google与Amazon双双加码Anthropic;
- DeepSeek启动首轮外部融资。
关键数据
- GPT-5.5在TerminalBench2.0基准测试中取得82.7%的成绩,较GPT-5.4大幅领先;
- GPT-5.5在测试AI独立操作真实电脑的OSWorld-Verified中,成功率达78.7%,超越人类基线;
- GPT-5.5在跨44种职业知识工作的GDPval中,84.9%的任务达到或超过行业专家水平;
- DeepSeekV4-Pro每百万输出Token定价仅3.48美元,全面低于Gemini3.1Pro、GPT-5.5、ClaudeOpus4.7及GPT-5.4等竞品;
- DeepSeekV4-Flash以0.28美元的超低价格下探至轻量模型价位带;
- Qwen3.6-27B拥有270亿参数,支持多模态思考与非思考双模式,在智能体编程方面达到旗舰级表现;
- 腾讯混元Hy3Preview总参数295B、激活参数21B,支持256K上下文,在复杂推理、代码与智能体、上下文学习等能力维度均实现显著提升;
- 字节跳动Seed3D2.0引入两阶段Coarse-to-Fine生成策略,将"整体结构建模"与"几何细节优化"解耦处理;
- KimiK2.6最多支持300个子Agent并行协作,可完成多达4000个协作步骤,单次不间断运行可达13小时;
- MiMo-V2.5支持代码、文本、图像、视频、语音五种模态的原生统一推理,平均推理速度达100至150tokens/s,API调用成本较上一代MiMo-V2-Pro降低约50%。
研究结论
- 国产模型和国产芯片值得关注;
- DeepSeek的进一步在架构设计层面“降本增效”,推动国产模型更普惠实现百万上下文长度;
- 寒武纪、华为昇腾的Day0适配表明,国产芯片在已达到商业可用的成熟度。
风险提示
- 政策落地不及预期风险,技术商业化瓶颈风险,供应链波动风险等。