报告总结了多模态领域的发展趋势和关键方向,强调了大模型在赋能企业发展的三种模式:大模型+原有业务、开源大模型+AI产品、垂类模型+行业数据。文本、视频、音频是重点关注的三大方向,分别在多模态能力、长文本处理和商业化潜力等方面展现出独特优势。
文本方向:
- 国产大模型追赶:文本领域,国产大模型在追赶海外大模型的同时,已探索出差异化优势,尤其是长文本处理能力。
- 定制化竞争:下一阶段的文本差异化竞争将围绕用户的定制化需求展开,基于庞大用户数据的特征搜集,形成更深层次的产品护城河。
视频方向:
- 产品爆发:2023年被视为AI视频的元年,主要得益于基于Diffusion架构的视频生成模型的兴起。
- DiT架构:Sora采用的DiT架构展现了高可拓展性和在三维空间的优秀表现,但也带来了算力挑战。
- 商业化潜力:高质量视频语料库成为关键优势,拥有此类资源的公司将在竞争中占据有利地位。
音频方向:
- 产品分类:AI音频产品分为TTS、SVC和AI音乐三大类,其中TTS和语音设计市场潜力较大。
- AI音乐:AI音乐产品Suno V3的发布标志着音乐创作市场的变革,有望革新音乐制作流程。
投资建议:
- 文本:关注国产大模型在长文本处理方面的差异化优势。
- 视频:推荐重点关注视频生成领域,特别是基于Diffusion架构的产品。
- 音频:看好TTS和AI音乐市场,特别是AI音乐的创新和应用前景。
风险提示:
- 技术发展不确定性、市场竞争加剧、法律监管风险和供应链安全问题。
投资机会:
- 上游关注语料库建设,如中文在线、华数传媒等;
- 下游关注B端/C端应用场景,如AI音乐社交、广告、电商等,以及影视和游戏行业的AI应用。
这份报告提供了对AI领域多模态发展的深入洞察,强调了中国厂商在追赶国际先进水平方面的机遇与挑战,并给出了具体的投资建议和风险提示,为企业和个人投资者提供了宝贵的参考。