行业深度研究报告概要
1. OpenAI发布视频生成大模型Sora
- Sora:2023年2月15日,OpenAI发布了视频生成大模型Sora,该模型通过文本指令直接生成高清视频,具有高度写实的背景、复杂多角度镜头和情感丰富的多角色叙事能力。
- 技术路径:基于Patches视觉特征标记的Diffusion Transformer模型,借鉴了LLM中Tokens的成功经验,通过Patches实现更灵活的采样和优化的构图。
2. 文生图/视频技术及产品迭代
- 文生图/视频:成为AI应用端焦点,Midjourney和Pika分别在文生图和文生视频领域展现出色性能,实现了广泛的商业化落地。
- Adobe Firefly:作为创意软件巨头,Adobe推出了支持多种文生图功能的下一代产品Firefly。
- T2I与T2V模型:Diffusion模型在T2I领域奠定商业化基础,T2V模型如Pika 1.0和Runway Gen-2,推动了创意产业工作流程的变革。
3. 国内创意软件龙头
- 万兴科技:发布“天幕”大模型,整合文生视频、文生图等功能,AI赋能下订阅收入占比及续约率增长。
- 美图公司:自研视觉大模型MiracleVision 4.0,助力订阅业务收入逐年增长。
4. 投资建议
- 推荐关注创意软件厂商万兴科技、美图公司,以及AI技术龙头虹软科技、科大讯飞。
5. 风险提示
- 海外基础软硬件使用受限的风险。
- AI应用落地不及预期的风险。
- 行业竞争加剧风险。
结论
Sora的问世标志着视频创作领域迎来重大突破,剑指物理世界通用模拟工具。OpenAI基于Patches视觉特征标记的Diffusion Transformer模型,不仅提升了视频生成的灵活性和优化了构图,还确保了生成视频内容的物理世界常识性。文生图和文生视频成为AI应用焦点,海外和国内的领先企业正通过技术创新推动AI在创意领域的深入应用,为用户提供更加丰富和高质量的内容创作体验。未来,随着AI技术的不断进步,预计会有更多创新工具和应用涌现,进一步推动创意产业的革新和发展。