GPT-5.4发布点评:知识工作与计算机操作能力大幅提升,高推理成本为核心痛点
产品发布
OpenAI于北京时间3月6日凌晨发布GPT-5.4系列模型,包含GPT-5.4 Thinking和GPT-5.4 Pro。该系列模型整合了编程、推理、计算机操控、网页搜索和百万Token上下文功能,并在编程、推理、计算机操控和网页搜索等方面取得显著进步。GPT-5.4的上下文长度达到100万token,目前已在ChatGPT、API和Codex中推出。
模型亮点
-
知识工作场景能力大幅提升:
- 投行内部电子表格建模测试中,GPT-5.4平均得分87.3%(GPT-5.2为68.4%)。
- 大型律所法律评估测试中,GPT-5.4得分为91%。
-
计算机操作能力:
- 作为OpenAI首个具备原生计算机使用功能的通用模型,擅长通过代码操作计算机并发出鼠标和键盘命令。
- OSWorld-Verified电脑操作测试中,GPT-5.4得分达SOTA(75.0%),超越人类平均水平(72.4%)。
- WebArena-Verified浏览器测试中,GPT-5.4得分67.3%。
- BrowseComp网页搜索基准上,GPT-5.4得分82.7%(Pro版达89.3%,创业界最高分)。
模型痛点
- 高推理成本:
- GPT-5.4 API标准版定价:输入2.50美元/百万Token,缓存输入0.25美元/百万Token,输出15美元/百万Token。
- GPT-5.4 Pro版定价:输入30美元/百万Token,输出180美元/百万Token。
- 对比其他模型:
- 谷歌Gemini 3.1 Pro Preview:输入2美元/百万Token,输出12美元/百万Token。
- Anthropic Claude Opus4.6:输入5美元/百万Token,输出25美元/百万Token。