OpenAI展示了最新的推理模型o3/o3-mini,并首次开放给外部研究人员进行安全测试。o3在多个基准测试中取得突破性进展:
- SWE-BenchVerified软件基础测试准确率达71.7%,比o1高22.8个百分点;
- Codeforces竞赛编程评分达2727,超过OpenAI首席科学家(o1评分为1891);
- 美国奥数选拔考试AMIE准确率96.7%,比o1高13.4个百分点;
- 博士级难度科学问答GPQADiamond准确率87.7%,比o1高9.7个百分点;
- 前沿数学基准测试准确率超过25%,远超其他模型的低于2%水平。
o3-mini注重性价比,支持低、中、高三种推理计算选项,其中中档模式下编程和奥数能力优于满血版o1,且延迟显著低于o1-mini。计划在1月底左右正式发布o3-mini,随后发布完整版的o3。