OpenAI发布新一代旗舰生成模型GPT-4o和桌面App,AI助理产品形态迎来巨大变革,多模态交互水平达到新高度。GPT-4o功能全面升级,支持文本、音频和图像任意组合的输入输出,实时语音回应音频输入平均时间仅为320毫秒,视觉感知可理解屏幕截图、照片、包含文本和图像的文章等。GPT-4o在MMLU、GPQA、MATH、HumanEval等推理测试中超越前沿模型,并在MLS基准测试中优于Whisper-v3和Meta、谷歌的语音模型。AI手机将受益于GPT-4o的赋能,有望成为具有数字化人格的AI Agent。