本研究评估了36个大型语言模型(LLM)在中文语境下的推理能力,并分析了其效率。研究发现:
核心观点
推理能力已成为衡量LLM智能水平的关键指标,本研究旨在建立系统评估框架,对比分析中外LLM的推理表现。
关键数据
-
推理能力排名
- 基本逻辑推理:GPT-o3(97分)第一,Doubao 1.5 Pro(96分)和Doubao 1.5 Pro(Thinking)(95分)紧随其后。
- 情境推理:Gemini 2.5 Flash(92分)第一,Doubao 1.5 Pro(Thinking)(91分)和Gemini 2.5 Pro(91分)并列第二。
- 综合排名:Doubao 1.5 Pro(Thinking)(93分)第一,GPT-5(Auto)(91.5分)第二,GPT-o3(91分)和Doubao 1.5 Pro(90.5分)分别第三、第四。
-
模型类型对比
- 推理模型在情境推理和幻觉控制方面显著优于通用模型,综合排名更高。
- 中国模型(如Doubao、Qwen、DeepSeek)表现突出,整体排名靠前。
效率分析
-
Token效率:
- Baichuan 4-Turbo(1.86)最高,DeepSeek-R1(30.77)、Qwen 3(31.04)等Token消耗过高。
- Gemini系列Token处理效率高,尽管消耗量大但响应速度快。
-
响应时间:
- GPT-4o(5.36秒)最快,DeepSeek-R1(127.59秒)最慢。
- Gemini系列响应速度优于Token消耗相似的模型。
-
API成本:
- 中国模型(如Yi-Lightning)成本优势明显(0.08元/千次),通用模型低于推理模型。
- DeepSeek-R1因Token消耗大,实际成本(6.77元/千次)高于GPT-o4 mini。
研究结论
- 中国LLM在推理任务中表现强劲,Doubao 1.5 Pro(Thinking)兼具高效与高智能,是综合最优模型。
- 推理模型在复杂任务中优势显著,但Token效率与成本需进一步优化。
- 未来模型迭代将提升推理质量、降低延迟和成本,推动LLM在更广泛场景的应用。