谷歌发布Gemini Omni,实现原生多模态生成,支持图片、音频、视频、文字任意组合输入生成高质量视频,突破物理概念模拟难题,将Gemini的世界知识与推理能力注入视频生成。现场演示中,支持粘土动画解释蛋白质折叠、自拍视频魔改等,并支持多轮对话式编辑。
Gemini 3.5 Flash在多项benchmark上胜出3.1 Pro,输出速度比GPT-5.5和Opus 4.7快4倍以上,已同步成为Gemini App和Google搜索AI Mode的默认模型。
Agent基础设施升级,Antigravity 2.0从IDE升级为独立桌面应用,支持子Agent动态生成与并行执行、异步任务管理、Scheduled Tasks定时任务等,内部日处理token量从3月5000亿飙升至3万亿。Gemini Spark定位为个人AI Agent,基于3.5+Antigravity框架,跑在云端专用虚拟机,7×24小时后台执行跨Gmail/Docs/Sheets/Slides任务,支持自定义skills与语音多任务并行。
谷歌通过模型层(Omni/3.5 Flash)、Agent基础设施层(Antigravity 2.0)、应用层(Spark)三线齐发,补齐全模态理解+全模态生成+全天候Agent三块拼图,竞争策略转向以工程化速度+生态整合能力重新定义ASI入口。国内大模型厂商面临从单点模型对标升级为模型+Agent平台+生态的全栈竞争,建议持续关注Agent开发平台及多模态生成相关产业链。
风险提示:AI技术迭代不及预期;AI应用商业化落地不及预期;宏观经济波动的风险。