一、核心概念
交互型多模态大模型是指跨越单一模态限制,支持文本、音频、图像、视频等模态任意组合输入输出的模型,能做出实时、“类人”的理解和反馈。其特点包括:原生多模态、快速响应、情感表达、记忆。
二、成本下降趋势
OpenAI 大模型成本显著下降,GPT-4o mini 推出后,大模型成本在 2 年内下降两个数量级。预计未来两年内,每百万 tokens 的推理成本将降至美分量级。
三、技术进展
- 海外:OpenAI 发布 GPT-4o,谷歌发布 AI 智能体 Project Astra。
- 国内:商汤发布流式多模态交互大模型“日日新5o”,智谱面向 C 端开放“视频通话”功能。
四、应用爆发原因
- 多模态更符合人类感知方式:人类获取信息主要通过视觉,多模态模型更符合人类感知世界的方式。
- 人机交互模式升级:应用发展的核心是人机交互模式的升级,交互型多模态大模型推动人机交互向自然语言交互发展。
五、应用领域
- 数字智能:教育(个性化教学、语言学习)、编程(代码生成与补全)、医疗健康(智能导诊、健康顾问)、办公(会议助手)、游戏(AI NPC)、情感陪伴(虚拟人物)。
- 具身智能:人形机器人(交互效率、情感智能)、智能座舱(多模态交互、个性化体验)、智能家居(语音交互、情感陪护)。
六、未来形态
- 交互先行,端侧 AI 加速发展:交互型多模态大模型将深度集成于手机等端侧设备,并与手机 OS 深度融合,形成智能生活圈。
- 商业模式:聊天助手 APP、基础模型接入各类应用、超级入口。
七、相关标的
- 交互型多模态大模型:商汤-W、云从科技-UW。
- 数字智能应用:金山办公、科大讯飞、虹软科技、美图公司。
- 具身智能应用:海康威视、大华股份。
- 算力:寒武纪、软通动力、海光信息、浪潮信息、中科曙光、神州数码。