多模态是大语言模型发展的必然趋势
多模态大型语言模型(MLLM)是大语言模型(LLM)和大型视觉模型(LVM)融合的结果,能够接收、推理和输出多模态信息,实现基于图片编写网站、理解图像、光学字符识别(OCR)等能力。
架构对比:原生MLLM具有更好的统一性和效率优势
- 模块化MLLM:采用拼接的“pipeline”形式,视觉编码和语言解码分开处理,依赖预训练单模态模型和额外对齐层,训练简单,但效率低于原生MLLM。
- 原生MLLM:不依赖预训练大语言模型或视觉编码器,直接在全部模态数据上从头开始同步训练,端到端性和统一性强,效率更高,但训练成本和难度更大。
非原生MLLM:通过Pipeline形式连接多模态与LLM
- 典型架构包括编码器、连接器和LLM,以及其他模块(如生成器)。
- 编码器:接收图像、音频或视频,并输出相应的模态特征。
- 连接器:接收编码器提取的特征并处理,帮助LLM更好地理解这些特征。
- LLM:用来生成文本信息。
- 优化方向:提高编码器分辨率,提升LLM推理能力,连接器非基础模型厂商实现MLLM的便捷手段。
原生MLLM:端到端实现多模态,头部厂商的首选架构
- 头部厂商如OpenAI和Google采用原生MLLM架构,展现出指令跟随好、时延短、一致性强的优势。
- 国内头部厂商如阿里巴巴、字节跳动、腾讯等也开始尝试原生多模态架构。
- 预计国内原生多模态模型将在2025年下半年逐渐发力,并在明年成为头部厂商的主流路径。
从大模型到多模态:商业化的必由之路
- 海外商业化更超前,国内出海进展迅速:全球维度,年化收入超过1亿美金的产品绝大多数为海外+多模态+初创公司,头部效应显著。
- 国内维度,年化收入靠前的产品主要为多模态+上市公司,且出海比例高:美图、快手、睿琪软件的AI产品均为多模态产品,且多为出海。
- 多模态产品持续迭代,可用性和商业化均向好:图像生成从高质量到易用性,视频生成国内厂商多模态发力,其他多模态交互AI产品快速崛起。
图像生成:从高质量到易用性,各玩家寻求差异化卖点
- 产品经历了从“追求更高逼真度”到“提升易用性与整合度”的路线。
- 各家产品都在寻求差异化卖点,如Ideogram针对AI绘图文字难题,Leonardo.ai深耕游戏美术领域,Krea主打多模态实时编辑。
- 跨模态融合成为趋势,如图像平台支持视频生成,视频平台增加多语言声音输出,大平台融合多模型能力。
视频生成:国内厂商多模态发力的主要赛道
- Sora发布之前,主要的视频生成产品是海外Runway Gen系列和Pika系列,以及国内爱诗科技Pixverse系列。
- 国内厂商在视频生成赛道加速布局,如MiniMax、智谱、字节跳动、快手等。
- 视频生成各平台竞相突破时长、清晰度和一致性瓶颈,各有特色。
- 商业模式上,大多数产品采用免费+订阅的Freemium策略,并开始布局企业服务和API接口。
其他多模态交互AI产品
- 语音:ElevenLabs主攻高品质语音合成和克隆。
- 音乐:Suno让普通用户能够生成带人声演唱的完整歌曲。
- 3D:Meshy、Luma AI Genie等专注于AI生成3D内容。
- 数字人:Synthesia、HeyGen等定位企业培训、营销的视频生成。
思考:国内大模型的瓶颈,以及国内商业化的难点
- 国内大模型瓶颈:
- 高性能算力受限,单集群大小受限。
- 国内高价值用户数据或较少。
- 全球头部模型愈发闭源,国内资源受限大多跟随。
- 国内商业化难点:
- 模型仍有差距,相比海外头部仍有差距。
- 用户付费习惯一般。
- 国内商业化突破点:
- 多模态应用先行,实现单点到多点扩张。
- 互联网厂商依托自身场景和资源获得先发优势。
- 快手可灵单点获得成功,后续更多类似的国内多模态应用有望带来持续的商业化多点扩张。