本报告聚焦全模态大模型的现实落地,指出2025年底谷歌、OpenAI已实现多模态技术突破,2026年底或迎来全模态技术突破,半年后将传导至产业,2027年底或在现实世界发挥成效。多模态可处理文字、图片、音频、视频等多类信息,提升消费级互联网平台货币化转化率;全模态则让模型可直接感知现实世界、完成任务,无需人工翻译中间环节。报告还分析了模态的信息传递机制、多模态技术路径以及全模态应用价值,包括取消现实向文字的人工翻译、让AI进入多工具工作流等。
多模态技术路径分为拼接式、对齐式、原生统一式,其中原生统一式通过共同学习实现多模态紧密协同,是未来发展方向。视频是多模态走向全模态的关键桥梁,能帮助模型学习动态世界与事件因果。全模态大模型将直接感知现实世界、完成任务,应用价值包括取消现实向文字的人工翻译、推动内容生成从表达型走向生产型、催生智能终端与入口等,还可形成数据飞轮实现高速正反馈。
报告重点分析了全模态大模型的现实落地路径、多模态与全模态的技术差异、模态的信息传递机制、多模态技术路径选择以及全模态应用价值。报告指出,原生统一式是多模态技术未来发展方向,视频是关键桥梁;全模态应用价值包括取消人工翻译、让AI进入多工具工作流、推动内容生成和生产型转变、催生智能终端与入口等。
当前市场已实现多模态技术突破,2025年底谷歌、OpenAI已实现多模态技术突破,2026年底或迎来全模态技术突破,半年后将传导至产业,2027年底或在现实世界发挥成效。多模态技术已应用于提升消费级互联网平台货币化转化率,如淘宝618边看短剧边购物案例。但国内大模型多模态能力目前尚未展现巨大效果,与谷歌、OpenAI相比存在一定差距。
全模态技术落地需关注算力需求、延迟降低、可靠性提升,同时安全、责任界定将成为重要制度性议题。二级市场需关注原生程度、联合推理、实时性、行动性等有效指标,以及模型能力、数据、限制入口、行动权限等未来竞争坐标。当前国内大模型多模态能力尚未展现巨大效果,与谷歌、OpenAI相比存在一定差距,需持续关注技术迭代和竞争格局变化。