- 多模态智能的本质是将文本、图像、音频、视频等映射进统一表示,并在此基础上完成理解、推理、生成与交互,是AI2.0“架构、任务、模态三重收敛”在模态维度的集中兑现。
- 多模态发展历程分为三个阶段:
- 阶段一(2021—2023年)外挂式/组合式:通过视觉编码器、投影层、Q-Former或指令微调把图像接入语言模型,如CLIP、Flamingo、BLIP-2、LLaVA等,但存在细节、空间关系和时序信息损耗。
- 阶段二(2023—2024年)原生多模态:Gemini代表多模态能力从接口层前移到预训练阶段,文本、图像、音频、视频从训练早期共同参与表示学习,提升泛化能力。
- 阶段三(2024年至今)全模态Omni:GPT-4o将文本、视觉和音频输入输出纳入同一实时交互闭环,补齐听、看、说的互动性。
- 主线是对齐位置不断前移、转换损耗逐级下降,Omni阶段进一步将多模态从“统一预训练”推进到“实时统一交互”。
- 未来发展方向:
- 理解与生成统一:存在表征冲突,业界探索纯自回归、扩散及二者融合等范式,可能向“模态表征与生成模块适度解耦、语义与推理主干共享”发展。
- 多模态深度推理:从语言o1扩展至图像、视频和具身场景,加速演进方向包括视觉工具增强、视觉—语言交错推理、多模态潜空间推理、世界模型与行动闭环,但以视觉表示或多模态潜变量为原生载体的推理尚处早期。
- 核心结论:
- 多模态这轮升级的技术支点是Transformer,统一的前提是“任意模态切成token、进入同一个注意力骨干”的序列建模范式,模态进入同一个Transformer的时点不断前移。
- 下一阶段发展或将围绕理解与生成统一、多模态深度推理展开,竞争重点或将是视觉证据利用、时空记忆、预测—行动闭环与推理效率。
- 风险提示:技术迭代不及预期、大模型厂商ARR增速放缓、云服务商资本开支不及预期、智能驾驶及机器人商业化落地不及预期。