AI重点要闻
- AI模型通过标准图灵测试:加州大学圣地亚哥分校的研究团队声称GPT-4.5以73%的比率被认作人类,显著超越真实人类参与者;LLaMa-3.1-405B获得56%的识别率,与人类无显著差异。
- 智谱发布AIAgent:AutoGLM沉思:智谱发布首个免费且具备深度研究功能和操作能力的智能体AutoGLM沉思,让智谱大模型从“建议者”进化为“实践者”。
- DeepSeek发布百宝箱项目AwesomeDeepSeekIntegrations:收录了诸多DeepSeek应用,帮助开发者一站式搞定诸多工具调用,涵盖大模型本地部署工具、AI文档阅读工具等。
- 亚马逊推出AI智能体NovaAct:亚马逊官方发布AI智能体NovaAct,可在浏览器中执行操作,并发布SDK供开发人员使用,意在凭借自研技术展开竞争。
企业动态
- 百度端到端语音语言大模型发布:百度发布首个基于全新互相关注意力的端到端语音语言大模型,实现超低时延与超低成本,在电话语音频道的语音问答场景中,调用成本较行业均值下降约50%-90%。
- OpenAIo3模型运行成本估算大幅上调:负责维护和管理ARC-AGI的ArcPrizeFoundation对OpenAI的o3“推理”人工智能模型在ARC-AGI基准测试中的成本估算进行了重大修订,解决一个单一的ARC-AGI问题的成本可能高达约3万美元。
- 飞桨新一代框架3.0正式发布:飞桨框架3.0具备动静统一自动并行、大模型训推一体、科学计算高阶微分、神经网络编译器、异构多芯适配等五大新特性。
- Runway发布AI视频生成模型Gen-4:Runway发布AI视频生成模型Gen-4,称这是目前为止保真度最高的AI驱动视频生成工具之一,能够有效利用视觉参考资料,并结合用户的文本指令,创造出风格、主体、地点等要素保持一致的新图像和视频。
AI行业洞察
- OpenAI宣布完成400亿美元超大规模融资:OpenAI宣布完成了一轮规模巨大的私募融资,融资金额高达400亿美元,公司估值在融资完成后达到3000亿美元。
- 国家天文台基于通义千问打造国际首个太阳大模型“金乌”:国家天文台联合阿里云发布国际首个太阳大模型“金乌”,基于通义千问系列开源模型打造,目前在M5级太阳耀斑预报上准确率超91%。
技术前沿
- 美国奥赛题挑战AI数学能力:MathArena团队使用2025年美国数学奥林匹克竞赛题对大模型进行了详细评估,结果显示所有大模型表现均不佳,DeepSeek-R1表现最好,得分为4.76%。
- UQABench:用于评估embedding提示LLM进行个性化问答的基准:UQABench评估框架是首个专门针对用户嵌入提示LLM个性化能力的标准化基准,采用三级评估流程,包括预训练阶段、微调阶段和评估阶段,评估任务包括序列理解、行为预测和兴趣感知。
风险提示
- 以上内容基于历史数据完成,在政策、市场环境发生变化时存在失效的风险;历史信息不代表未来。