AI重点要闻
字节旗下AIIDETrae发布国内版
- 字节海外发布的AI原生集成开发环境Trae于3月3日上线国内版,内置豆包1.5Pro大模型,支持DeepSeekR1/V3模型。
- 核心功能:AI驱动的智能编程、多模态交互、全场景开发支持、低门槛与跨平台兼容。
- 目标:AI辅助编程之上的AI结对编程(L3)。
- 字节Marscode团队宣布于2025年4月1日停止维护,显示对Trae的重视。
OpenAI发布GPT-4.5研究预览版
- GPT-4.5号称目前最好的对话大模型,提升识别模式、建立联系和创造性见解能力。
- 扩展无监督学习和推理,提高世界模型的准确性和直觉性。
- 使用可扩展技术方法,提升可操控性、对细微差别的理解能力和自然对话流畅度。
- 结合深度理解与改进的协作能力,更贴合人类协作节奏。
阿里推出QwQ-32b推理模型并开源
- QwQ-32b以320亿参数规模,在数学推理、代码生成等任务中表现媲美甚至超越6710亿参数的DeepSeek-R1。
- 核心特点:参数效率高、创新功能集成、动态推理与智能体能力、高效训练机制。
- 技术路径验证了“强化学习+强大基座模型”在高效推理中的潜力。
Manus通用智能体发布引发AIAgent浪潮
- 中国Monica.im团队推出Manus,在GAIA测试中表现最先进(SOTA)。
- Manus可控制电脑进行规划、自动挂载数据、调用工具执行任务。
- 引发AIAgent浪潮,多个智能体快速跟进,如OWL和OpenManus。
企业动态
AMD推出RadeonRX9000系新显卡9070XT和9070
- 基于RDNA4架构,采用台积电4nm工艺,配备16GBGDDR6显存。
- 核心参数:第二代AI加速器支持FP8数据类型和结构化稀疏性优化,第三代光线追踪加速器。
- 市场定价:RX9070国行起售价4499元,RX9070XT为4999元,主打高性价比。
科大讯飞星火X1模型升级
- 星火X1数学能力对标国际顶尖模型,参数量仅为70B,全面对标DeepSeekR1及OpenAIo1。
- 升级后在中小学作业批改、竞赛级难题解答等任务中表现显著提升。
- 星火医疗大模型X1效果超越GPT-4o和DeepSeekR1,在诊断推荐、健康咨询等场景中表现优异。
腾讯发布混元图生视频模型
- 混元发布图生视频模型“HunyuanVideo-I2V”,可根据图片生成5秒短视频并配背景音。
- 模型参数维持13B,项目已开源。
AI行业洞察
杭州投资智谱
- 智谱AI完成超10亿元人民币战略融资,投资方包括杭州城投产业基金和上城资本。
- 新资金将投向GLM大模型技术体系的迭代升级,计划2025年全面开源模型。
Lmarena.ai公布大模型排名
- Grok3在总体评价中登顶,GPT-4.5与Grok3并列第一。
- DeepSeek-R1在数学能力中并列第一名,在编程能力排名中并列第三名。
技术前沿
Karpathy表达对大模型评估基准失效的担忧
- Karpathy认为当前存在评估危机,MMLU、SWE-BenchVerified、ChatbotArena等基准存在问题。
- 提出将私有评估集组合使用,并依赖“氛围检查”进行判断。
2B参数非SFT模型在视觉推理过程中重现DeepSeek“顿悟时刻”
- VisualThinker-R1-Zero项目在2B参数未经监督微调的模型上,通过纯强化学习实现多模态推理的“顿悟时刻”。
- 在CVBench视觉基准测试中达到59.47%准确率,较基础模型提升30%。
Dynasor-CoT:通过确定性探索实现更高效的思维链
- Dynasor-CoT方法通过思维扫描动态确定思维链终止点,有效节省计算资源。
- 实验发现该方法可以有效降低Token使用,解决大模型自我怀疑问题。