登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
中文大模型基准测评2025年年度报告:2026开年特别版:含1月底重磅模型动态评测
信息技术
2026-02-04
-
SuperCLUE团队
周剑
2025年中文大模型关键进展
大模型发展历程
:经历了百模大战与多模态萌芽、多模态爆发与推理突破、智能体崛起与生态重构三个阶段。
2025年关键进展
:低成本颠覆与开源生态崛起(DeepSeek-R1开源推理大模型)、架构创新与智能体落地(MoE架构、多模态融合、Manus等智能体产品)。
SuperCLUE 2025年全年通用基准测评海内外大模型Top3
:
2026年1月:Kimi-K2.5-Thinking、Qwen3-Max-Thinking(国内Top1、Top2),海外Top3为GLM-4.7、ERNIE-5.0、Claude-Opus-4.5-Reasoning。
2025年11月:DeepSeek-V3.2-Special(国内Top1),海外Top3为GPT-5.2(high)、GPT-5.1(high)、Claude-Opus-4.5-Reasoning。
2025年9月:Kimi-K2-Thinking、DeepSeek-V3.2-Exp-Thinking(国内Top1、Top2),海外Top3为Qwen3-Max、openPangu-Ultra-MoE-718B、GPT-5.1(high)。
2025年7月:DeepSeek-V3.1-Thinking(国内Top1),海外Top3为GPT-5(high)、o3(high)、o4-mini(high)。
2025年5月:Doubao-1.5-thinking-pro-250415、SenseNova V6 Reasoner(国内Top1、Top2),海外Top3为o4-mini(high)、Gemini 2.5 Pro Preview 05-06、Claude-Opus-4-Reasoning。
2025年3月:DeepSeek-R1(国内Top1),海外Top3为o3-mini(high)、Claude 3.7 Sonnet、GPT-4.5-Preview7。
2025年年度测评结果与分析
测评介绍
:SuperCLUE 2025年年度中文大模型基准测评包含六大任务:数学推理、科学推理、代码生成、智能体(任务规划)、精确指令遵循、幻觉控制。
全球大模型中文智能指数排行榜
:海外闭源模型占据头部,国产闭源模型追赶,国产开源模型领先海外开源模型。
SuperCLUE模型象限
:海外闭源模型为卓越领导者,国产闭源模型为技术领跑者,国产开源模型为潜力探索者。
SuperCLUE模型能力格局
:全能稳健型、硬核理科型、综合能力待提升区。
SuperCLUE 2025年年度测评六大任务国内Top3
:
数学推理:Qwen3-Max-Thinking、Kimi-K2.5-Thinking、DeepSeek-V3.2-Thinking。
科学推理:DeepSeek-V3.2-Thinking、Qwen3-Max-Thinking、Doubao-Seed-1.8-251228(Thinking)。
代码生成:Kimi-K2.5-Thinking、Qwen3-Max-2025-09-23、Kimi-K2-Thinking。
智能体(任务规划):GPT-5.2(high)、Qwen3-Max-Thinking、Kimi-K2.5-Thinking。
精确指令遵循:Claude-Opus-4.5-Reasoning、ERNIE-5.0、Doubao-Seed-1.8-251228(Thinking)。
幻觉控制:GPT-5.2(high)、GLM-4.7、Doubao-Seed-1.8-251228(Thinking)。
海内外大模型对比分析
:
推理能力:海内外模型高度对齐,国内模型在代码和智能体任务上表现更佳,精确指令遵循和幻觉控制是国内模型的短板。
开闭源大模型对比:闭源模型全方位领先,开源模型在推理能力继续追赶,代码已实现单点突破。
大模型性价比区间分布
:国内模型较海外模型具有更高的性价比,国内头部模型以低于10元/百万Tokens的价格实现了接近国际顶尖模型的性能。
大模型推理效能区间分布
:海外推理模型推理效能整体上显著领先于国内推理模型,国内模型实现“高性能+高效率”已初步显现。
代表性模型分析
:
Kimi-K2.5-Thinking:代码生成、智能体-任务规划、复杂推理能力突出,精确指令遵循和幻觉控制有待提升。
Qwen3-Max-Thinking:复杂推理、智能体-任务规划能力突出,幻觉控制、精确指令遵循、代码生成有待提升。
评测与人类一致性验证
:SuperCLUE得分与LMArena得分具有较高的一致性(皮尔逊相关系数0.8239,斯皮尔曼相关系数0.8321)。
SuperCLUE大模型中文竞技场
介绍
:SuperCLUE大模型中文竞技场是一个大众投票的匿名评测平台,包含编程、图像、视频、音频四大板块。
板块介绍
:
编程竞技场:前端网页竞技场。
图像竞技场:图像编辑竞技场、文生图竞技场。
视频竞技场:文生视频竞技场、图生视频竞技场、参考生视频竞技场。
音频竞技场:语音合成竞技场。
SuperCLUE专项测评基准介绍
Agent系列基准
:
EmbodiedCLUE-VLA:具身智能大脑测评基准。
SuperCLUE-DeepSearch:中文深度搜索测评基准。
AgentCLUE-Mobile:手机GUI Agent测评。
AgentCLUE-CUA:Computer Use Agent测评。
SuperCLUE-DeepResearch:中文深度研究测评基准。
AgentCLUE-General:中文通用AI智能体基准测评。
AgentCLUE-tGeneral:中文通用AI智能体基准测评(纯文本输入)。
Coding系列基准
:
SuperCLUE-SWE:中文软件工程测评基准。
Agentic Coding:Agent 版 SC-SWE(SC-Agent)测评。
SuperCLUE-WebCoding:中文前端开发测评基准。
多模态系列基准
:
SuperCLUE-VLM:中文多模态视觉语言测评基准。
SuperCLUE-Image:中文文生图测评基准。
SuperCLUE-T2V:中文文生视频测评基准。
SuperCLUE-I2V:中文图生视频测评基准。
推理系列基准
:
SuperCLUE-VLR:中文视觉推理测评基准。
文本系列基准
:
SuperCLUE-Mkt:广告营销测评基准。
SuperCLUE-CPIF:中文精确指令遵循测评基准。
SuperCLUE-Faith:中文忠实性幻觉测评基准。
SuperCLUE-Fact:中文事实性幻觉测评基准。
性能系列基准
:
DeepSeek-R1第三方联网搜索能力测试(网页端)。
DeepSeek-R1第三方稳定性测试(API端)。
DeepSeek-R1系列其余系列。
SuperCLUE介绍
SuperCLUE与传统测评的区别
:维度Live更新、无数据污染、测评方式与用户交互一致、独立第三方。
SuperCLUE大模型综合测评基准榜单全景图
:覆盖通用基准体系、文本系列基准、多模态系列基准、推理系列基准、Agent系列基准、AI应用系列基准、性能系列基准。
2025年年度测评模型列表
:23个国内外有代表性的大模型。
联系我们
服务内容
:通用大模型测评、多模态大模型测评、Agent智能体测评、大模型深度研究报告。
联系方式
:contact@superclue.ai。
你可能感兴趣
中文大模型基准测评2025年9月报告
信息技术
SuperCLUE团队
2025-10-16
中文大模型基准测评2025年上半年报告
信息技术
SuperCLUE团队
2025-08-04
中文大模型基准测评2025年5月报告
SuperCLUE团队
2025-05-28
中文大模型基准测评2025年3月报告
金融
SuperCLUE团队
2025-03-20
2024中文大模型阶段性进展年度评估:中文大模型基准测评2024年度报告
信息技术
SuperCLUE团队
2025-01-08
中文大模型基准测评2023年度报告:AI跃迁的2023,中文大模型进展评估
SuperCLUE团队
2023-12-28
中文大模型基准测评2024年10月报告-2024年度中文大模型阶段性进展评估
文化传媒
SuperCLUE团队
2024-11-11
中文大模型基准测评2024年上半年报告— 2024年度中文大模型阶段性进展评估
信息技术
SuperCLUE团队
2024-07-09
中文大模型基准测评报告2023-ChatGPT发布一周年特别报告
金融
SuperCLUE团队
2023-12-17
中文大模型基准测评2024年4月报告
稀宇科技&CLUE
2024-04-30