2024年度关键进展及趋势
- 关键进展时间线:AI大模型发展分为准备期、跃进期、繁荣期和深化期。2024年进入深化期,国内外AI机构取得实质性突破,如OpenAI发布o1、国内发布DeepSeek-V3、SenseChat 5.5-latest等。
- 中文大模型全景图:涵盖通用闭源、通用开源、多模态、文生视频、视觉理解、行业大模型等多个领域。
- 国内外大模型差距:总体趋势上,国内外第一梯队大模型在中文领域的通用能力差距正在扩大。2023年5月至今,国内外大模型能力持续发展,但o1的发布再次拉大差距至15.05分。
- 国内外大模型能力趋势:以DeepSeek-V3为代表的国产模型接近GPT-4o,但o1的推出使差距再次扩大。国内模型在推理速度和性价比方面具有竞争力,端侧小模型表现惊艳。
年度通用测评介绍
- SuperCLUE基准介绍:CLUE基准的发展和延续,独立、领先的通用大模型综合性测评基准,具有产业+用户视角、Live更新题目、独立第三方等特征。
- SuperCLUE大模型综合测评体系:包括通用基准、文本专项、多模态系列、推理系列、Agent系列、AI应用基准等。
- SuperCLUE通用测评基准数据集及评价方式:涵盖理科、文科、Hard三大维度,题目均为原创新题,总量为1325道多轮简答题。
总体测评结果与分析
- SuperCLUE通用能力测评总分:o1以80.4分领跑全球,DeepSeek-V3和SenseChat 5.5-latest取得68.3分领跑国内大模型。
- SuperCLUE模型象限(2024):包括潜力探索者、技术领跑者、实用主义者和卓越领导者四个象限。
- 历月SuperCLUE大模型Top3:国内模型在多个月份的测评中表现优异,如DeepSeek-V3、SenseChat 5.5-latest、360gpt2-o1等。
- 一、二级维度表现:国内头部大模型在文科任务上有一定领先性,在理科、Hard高难度任务上与海外头部模型差距较大。
- 九大任务年度Top5:涵盖Agent、指令遵循、深度推理、代码、计算、语言理解、生成创作、传统安全等任务。
- 综合效能区间分布:部分国产模型在综合效能上很有竞争力,如DeepSeek-V3和Qwen2.5-32B-Instruct。
- 性价比区间分布:国产大模型如DeepSeek-V3、Qwen2.5-72B-Instruct和Qwen2.5-32B-Instruct在性价比上具有竞争力。
- 国内外推理模型能力对比:o1在推理能力上大幅领先,国内外推理模型差距较大。
- Hard、理科、文科成绩及示例:o1在Hard高挑战性任务上具有大幅领先性,国内大模型DeepSeek-V3在中文Hard高挑战性任务上超过Claude 3.5 Sonnet。
- 国内大模型成熟度-SC成熟度指数:国内大模型成熟度较高的能力是【语言理解】和【生成与创作】,【深度推理】、【代码】和【指令遵循】成熟度较低。
- 评测与人类一致性验证:SuperCLUE基准测评的成绩与人类对模型的评估具有高度一致性。
开源模型进展评估
- 开源模型榜单:DeepSeek系列开源模型、Qwen系列开源模型在12月SuperCLUE测评中表现优异,引领全球开源生态。
- 10B级别小模型榜单:Qwen2.5-7B-Instruct和Gemma-2-9b-it分列国内外榜首。
- 端侧5B级别小模型榜单:Qwen2.5-3B-Instruct取得总分46.1分的优异成绩,MiniCPM3-4B同样表现不俗。
智能体Agent基准
- AgentCLUE:可执行多轮智能体测评基准,评估LLM作为执行代理,在多轮对话中调用工具完成任务的能力。
推理基准
- SuperCLUE-CoT:链式推理测评基准,评估模型的思维链推理能力。
- SuperCLUE-Science:科学推理测评基准,评估中文大模型在研究生级别的科学题中的表现。
- SuperCLUE-Math6o:中文数学竞赛基准,评估模型的小学奥数解题能力。
- SuperCLUE-Math6:中文数学多步推理测评基准。
- SuperCLUE-Code3:中文原生等级化代码能力测评基准。
多模态测评基准
- SuperCLUE-Multi:多模态大模型测评框架,包括视频、图像、视觉、语音等各个模型的测评任务。
- SuperCLUE-V:多模态理解测评基准。
- SuperCLUE-Live:实时音视频测评基准。
- SuperCLUE-T2V:文生视频测评基准。
- SuperCLUE-Image:中文文生图测评基准。
- SuperCLUE-TTS:中文语音合成测评基准。
AI产品能力测评基准
- SuperCLUE-Coder:AI代码编程助手测评基准。
- SuperCLUE-AISearch:AI原生搜索产品测评基准。
- SuperCLUE-Voice:AI实时语音产品测评基准。
行业测评基准
- SuperCLUE-Auto:汽车行业测评基准。
- SuperCLUE-ICabin:汽车智能座舱测评基准。
- SuperCLUE-Fin:金融行业测评基准。
- SuperCLUE-Industry:工业行业测评基准。
其他文本专项测评基准
- SuperCLUE-RAG:中文检索增强生成测评基准。
- SuperCLUE-Agent:中文智能体测评基准。
- SuperCLUE-Safety:中文大模型多轮对抗安全基准。
- SuperCLUE-Long:中文长文本测评基准。
- SuperCLUE-200K:大模型中文超长文本测评基准。
- SuperCLUE-Role:中文角色扮演测评基准。
优秀模型案例
- DeepSeek-V3:擅长中文语言和复杂任务。
- SenseChat5.5-latest:擅长数学和安全,以及复杂任务。
- 360zhinao2-o1:擅长复杂推理任务。
- Qwen2.5-3B-Instruct:擅长推理任务。
未来两个月基准发布计划
SuperCLUE将持续完善大模型专项能力及行业能力的测评基准,并征集大模型参与测评。