AI重点要闻
通义千问发布Qwen-3模型
- 通义千问于4月29日发布Qwen-3模型,旗舰模型为Qwen3-235B-A22B,在多项基准测试中超越DeepSeek-R1、o1、o3-mini、Grok-3、Gemini2.5-Pro等模型。
- 小型模型Qwen3-30B-A3B参数量仅为QwQ-32B的10%,表现更优,甚至Qwen3-4B也能匹敌Qwen2.5-72B-Instruct的性能。
- Qwen-3支持多种思考模式,是全球第三个混合推理模型,也是国内首款混合推理模型。
- Qwen-3在智能体开发方面针对Agent协同与代码能力进行了优化,全面适配AIAgent生态。
- 训练方面,Qwen-3使用的数据量达36万亿个token,涵盖119种语言和方言,预训练过程分为三个阶段,并进行后训练以增强推理能力。
DeepSeek发布数理证明大模型DeepSeek-Prover-V2-671B
- DeepSeek于4月30日发布应用于数理问题形式化定理证明场景的大模型DeepSeek-Prover-V2-671B。
- 该模型训练思路模仿人类数学家,构建递归子目标分解框架,将复杂定理分解为可管理的子目标(Lemma)。
- 训练过程中使用课程学习与强化学习增强推理解题能力,引入双模式推理架构,简单问题采用非链式思考模式,复杂问题采用链式思考模式。
- DeepSeek-Prover-V2模型成功证明AMC竞赛题和高等数学问题。
Grok3.5将于本周推出
- 马斯克于4月29日在社交平台X表示,Grok3.5早期测试版将向SuperGrok订阅者发布。
- 马斯克称Grok3.5是第一个能够准确回答有关火箭发动机或电化学技术问题的人工智能,并能从第一性原理推理并得出互联网上根本不存在的答案。
小米开源推理大模型MiMo-7B-RL
- 小米于4月30日开源其首个推理大模型XiaomiMiMo,发布版本为MiMo-7B-RL。
- MiMo-7B-RL在数学推理和代码竞赛基准上超过o1-mini模型和通义千问的QwQ-32B-Preview模型。
- 训练数据包括25Ttokens的网页、论文、代码和合成数据,采用三阶段数据混合策略,后训练部分精选13万道数学和代码题。
- 设计了SeamlessRollout系统,加速强化学习训练。
企业动态
亚马逊发布AmazonNovaPremier模型
- 亚马逊于5月3日推出AmazonNovaPremier,是Nova系列功能最强大的模型,适用于处理复杂任务,可作为模型蒸馏的教师模型。
- NovaPremier能处理文本、图像和视频,擅长深度理解上下文、多步骤规划以及跨多工具和数据来源精确执行的任务。
- NovaPremier的上下文长度为100万个token,能处理超长文档或大型代码库。
Meta发布ReasonIR-8B模型
- MetaAI于4月30日推出ReasonIR-8B模型,专为推理密集型检索设计,在检索精度、成本和效率上取得突破。
- ReasonIR-8B采用双编码器架构,训练数据包括长达2000个token的多样长度查询和需逻辑推理的困难查询。
- MetaAI已开源ReasonIR-8B模型、训练代码及合成数据工具。
FutureHouse发布科学家智能体
- FutureHouse于5月3日发布四个超人类的AI科学家智能体:Crow(乌鸦)、Falcon(猎鹰)、Owl(猫头鹰)和Phoenix(凤凰)。
- Crow负责精确文献检索,Falcon完成深度文献综述与知识整合,Owl聚焦科研历史脉络梳理,Phoenix为多模态药物研发引擎。
- Crow、Falcon和Owl在搜索精度和准确性上超越顶级搜索模型,如o3-mini、GPT-4.5、Claude-3.7。
AI行业洞察
智能数据标注产业发展观察报告
- 传统人力密集型标注模式加速向智能驱动和平台化转型,产业转型核心路径依托技术驱动革新与平台化新业态。
- 政策端发力,四部门联合发布《关于促进数据标注产业高质量发展的实施意见》,明确提出到2027年产业规模年均复合增长率超20%。
- 市场生态重构,国有企业、政府部门加速释放标注需求,公共数据标注目录编制及政务大模型协同开发成为重点方向。
- 未来挑战在标准化与质量监管与人才培养与就业拉动方面。
InfiGUI-R1
- InfiGUI-R1是基于Actor2Reasoner框架训练的GUI智能体,旨在让AI像人一样在行动前思考,行动后反思。
- Actor2Reasoner框架分为两个阶段:推理注入和深思熟虑增强。
- 推理注入阶段采用空间推理蒸馏技术,将GUI智能体从“行动者”转变为“基础推理者”。
- 深思熟虑增强阶段利用强化学习提升模型的规划和反思能力,通过目标引导和错误回溯方法。
- InfiGUI-R1-3B模型在多个关键基准测试中展现卓越性能。
技术前沿
Paper2Code:科研报告代码复现智能体
- 韩国科学技术院和DeepAuto.ai开发的PaperCoder框架能自动从机器学习论文中生成高质量的代码仓库。
- PaperCoder采用多代理LLM框架,分为规划、分析和生成三个阶段。
- 规划阶段构建高层次路线图,绘制类图和序列图,识别文件依赖关系,生成配置文件。
- 分析阶段对每个文件和函数进行细致解析,理解其预期功能。
- 生成阶段根据先前确定的执行顺序和工件合成整个代码库。
- PaperCoder在实验和评估中表现遥遥领先于其他基线模型。