- 水平:外网测评称GLM-5相当于Claude Opus 4.6的水平,此前ponyalpha被认为逼近Opus 4.5。海外博主AICodeKing给出的评测中,GLM-5代理编程分值589分,全球榜首,超过Claude Opus 4.6的585分。
- 编程能力:GLM-5编程能力有很大提升,agent展现出自主规划意识,解决了前代模型在长程任务中容易忘记细节或缺乏全局规划的问题。它能够进行文件检查、系统架构校验并提出完整方案。
- 参数:根据reddit泄露及YouTube内侧博主测评,GLM-5采用DeepSeek同款的稀疏注意力机制+tokens预测MTP,参数可能达到7440亿(激活参数400亿,激活率5%),上下文200K(GLM4.7参数为3550亿,激活参数320亿,激活率9%,上下文2000)。
- 智能交互:当提示词模糊或模型感到困惑时,GLM-5会主动询问用户以明确需求,类似Claude的行为。
- 上下文召回:博主测评显示,GLM-5在各个长度上下文召回均在98%以上。
- 同组任务成本:海外博主数据表明,GLM-5成本为0.14美元,显著低于Opus-4.6(6.39美元)和Gemini-3-Pro(0.85美元)。
- 总结:GLM-5能力提升反馈集中在“长程任务、复杂工程、工具调用”,多次出现“逼近Opus 4.5”的说法,最新测评甚至提出beat Opus 4.6。在coding能力大幅提升的前提下,成本优势显著。