- 核心观点:通义千问Qwen2.5-Max在大模型盲测中表现突出,成为非推理类中国大模型的冠军,推动了大模型领域的良性竞争和应用加速。
- 关键数据:
- Qwen2.5-Max在Chatbot Arena榜单中位列全球第七,得分为1332分。
- 在数学和编程等单项能力上排名第一,硬提示(Hard prompts)方面排名第二。
- 技术进展:
- Qwen2.5-Max是超大规模的MoE模型,使用超过20万亿token的预训练数据,并采用精心设计的后训练方案。
- Qwen团队将持续提升数据规模和模型参数规模,并投入强化学习的scaling以实现超越人类的智能。
- 研究结论:
- 国内一流非推理模型的进展有助于推理模型能力的进一步强化。
- 大模型厂商之间的良性竞争加速了应用落地,尤其国内公司进展迅速,有望打开以互联网大厂为核心的AI生态投资机遇。