1. AI重点要闻
1.1 智谱发布GLM-4.5
- 标志国产大模型技术从参数规模竞赛转向能力整合与智能体应用落地。
- 以原生融合智能体能力为核心突破点,通过混合专家架构、高参数效率及开源生态策略重新定义通用人工智能的实践路径。
- GLM-4.5首次在单一模型中实现推理、编码与智能体能力的原生融合,采用混合专家架构,包含GLM-4.5(3550亿参数)和GLM-4.5-Air(1060亿参数)两个版本。
- 在涵盖AGI核心能力的12项评测中,GLM-4.5以63.2综合分位列全球第三,超越DeepSeek-R1与Kimi-K2。
- 智能体能力尤为突出,在网页交互基准BrowseComp中准确率达26.4%,代码修复任务SWE-bench Verified得分64.2。
- 被定位为“能执行、能调度、能构建系统”的智能地基,可独立完成全栈开发,如生成“谷歌搜索”网页、“B站”模拟器等。
- 通过全面开源与低价API策略冲击市场,模型权重在Hugging Face与ModelScope采用MIT协议开源,API定价低至输入0.8元/百万tokens。
1.2 蚂蚁数科发布金融推理大模型Agentar-Fin-R1
- 标志金融垂直领域大模型技术从通用能力向专业化、场景化能力的重大跨越。
- 基于Qwen3架构研发,以“可靠、可控、可优化”为核心设计理念,通过金融知识体系重构、动态训练算法创新与开源生态建设。
- 采用双引擎架构设计,Master Builder引擎将业务逻辑转化为可执行代码,Agent Group引擎实现多智能体协同决策。
- 在FinEval1.0、FinanceIQ等权威金融评测中,Agentar-Fin-R1超越同尺寸开源通用模型及专业金融模型。
- 核心优势体现在智能体任务执行能力、安全合规性和通用能力保留三方面。
- 已深度渗透金融核心业务流程,如在信贷领域将小微企业贷款审批时间从3天压缩至15分钟,坏账率下降18%。
- 通过全面开源策略重塑金融AI竞争格局,开源Agentar-Deepfinance-100K训练数据集与Finova评测基准。
1.3 商汤发布“悟能”具身智能平台
- 标志AI技术从数字世界向物理世界交互的关键跃迁。
- 平台以“开悟”世界模型为核心引擎,通过多模态感知、空间计算与硬件生态协同重新定义具身智能的实践范式。
- 核心技术“开悟”世界模型具备独特的4D真实世界构建能力,可生成多视角视频并保持时空一致性。
- 在感知层面,可嵌入端侧芯片实现实时物体识别与场景分割,导航能力实现厘米级避障精度。
- 交互维度的突破尤为显著,平台通过图文交错思维链技术,使机器人能同时处理视觉输入与语言指令。
- 已展现出跨行业的场景穿透力,在工业和家庭场景中均有应用,如与傅利叶等厂商合作的千万级机器人集群,通过持续回传操作日志优化世界模型。
1.4 京东推出附身智能品牌JoyInside
- 标志人机交互从功能化向情感化跃迁的关键突破。
- 平台以京东JoyAI大模型为核心引擎,通过多模态技术融合与开放生态战略重构了智能硬件产业的底层交互逻辑。
- 构建了"理解-决策-执行"的完整智能闭环,支持系统层搭载主动对话、情绪检测、长期记忆三大模块。
- 差异化优势体现在对多元场景的深度适配,如家庭场景中的魔法原子四足机器狗,儿童教育领域的 心大陆机器人等。
- 通过"附身智能加速计划"实施技术普惠,提供SDK、硬件盒子、API三种接入方案,降低中小厂商的智能升级门槛。
- 重构了智能硬件产业的价值链分工,推动产业资源向设计创新与场景挖掘集中。
2. 企业动态
2.1 字节Seed团队推出Seed Diffusion Preview模型
- 标志离散扩散技术在语言模型领域的重大突破。
- 以结构化代码生成为实验领域,通过四项核心技术革新实现了每秒2146 tokens的推理速度,较同等规模自回归模型提升5.4倍。
- 解决了离散扩散模型的归纳偏置冲突问题,在代码修复基准CanItEdit上的pass@1准确率较自回归模型提升4.8%,达到54.3分。
- 通过同策略学习范式与块级并行扩散采样的协同优化,实现了理论加速到工程落地的跨越。
- 重构了语言模型的技术路线竞争格局,证明了离散扩散模型不仅能突破自回归架构的串行解码瓶颈,还能通过并行生成特性增强复杂任务处理能力。
2.2 通义千问更新Qwen3-30B-A3B
- 标志混合专家架构(MoE)在参数效率与性能平衡上的重大突破。
- 模型总参数量达305亿,包含128个专家网络,但每次推理仅动态激活8个专家(约33亿参数)。
- 在权威评测中,该模型展现出与规模远超自身的闭源模型抗衡的实力,如数学推理测试AIME25得分61.3,代码生成任务LiveCodeBench v6得分43.2。
- 通过端到端优化实现了极低部署门槛,在RTX 3090显卡上运行量化版本时,推理速度达214 tokens/秒,显存占用不足8GB。
- 重构了模型性能与硬件需求的传统关系,开源策略引发连锁反应,通义模型API全球市场份额一周内从7.3%跃升至10.9%。
3. AI行业洞察
3.1 腾讯Robotics X实验室与福田实验室发布具身智能开放平台Tairos
- 标志中国机器人产业从硬件驱动向“软件定义硬件”范式转型的关键突破。
- 平台采用类人类神经系统的分层设计,将复杂智能拆解为可自由组合的三大模型模块:多模态感知模型(右脑)、规划大模型(左脑)、感知行动联合模型(小脑)。
- 平台通过云端仿真环境与工具链的深度整合,破解了具身智能落地的系统工程难题。
- 腾讯明确将Tairos定位为机器人产业的“安卓系统”,通过开放合作构建生态护城河。
- Tairos的发布恰逢全球人形机器人销量突破10万台的市场拐点,其影响已超越技术层面而触及产业范式变革。
4. 技术前沿
4.1 Goedel-Prover-V2:8B参数击败671B的DeepSeek-Prover
- Goedel-Prover-V2是由Princeton Language and Intelligence、清华大学、NVIDIA等机构联合研发的开源定理证明系统,代表了当前自动形式化证明生成领域的最先进水平。
- 核心创新体现在脚手架式数据合成、验证器引导的自我修正以及模型平均技术。
- 性能表现方面,Goedel-Prover-V2在多个基准测试中刷新记录,其旗舰型号32B模型在MiniF2F测试集上达到88.1%的Pass@32准确率,自我修正模式下进一步提升至90.4%。
- 技术实现细节显示,自我修正模式通过两轮迭代优化证明质量,在仅增加25%的token消耗(从32K增至40K)的情况下显著提升性能。
- 与初代Goedel-Prover相比,V2版本在数据合成策略上有显著进化,引入的脚手架式合成能动态构建难度适配的训练样本,使模型证明能力呈现阶梯式提升。
5. 风险提示
以上内容基于历史数据完成,在政策、市场环境发生变化时存在失效的风险;历史信息不代表未来。