-
OpenAI视频大模型Sora:
- 发布与目标:OpenAI发布视频生成大模型Sora,旨在构建物理世界通用模拟工具,生成长达一分钟的高清视频,支持指定时间长度、分辨率与宽高比。
- 技术路径:基于Patches视觉特征标记的Diffusion Transformer模型,将视觉数据转化为Patches,构建视频压缩网络,提取时空潜在特征,并推广Transformer模型至视频生成领域。
- 算法实现:Patches实现更灵活的采样和优化的构图,通过DALL·E 3 DCS的描述性标题重述与GPT的标题扩写强化语言理解能力。
- 功能解读:具备文生视频、视频编辑、文生图功能,其中文生视频支持3D一致性、远距离相干性和物体持久性、与世界的互动性,并可模拟数字世界,确保“物理世界常识”始终在场。
-
文生图/视频海外标杆:
- 应用焦点:文生图/视频为当下AI应用焦点,Midjourney和Pika位列AI产品流量前茅,AI图片生成约占前十AI产品流量的74%。
- 文生图-T2I:Diffusion模型奠定文生图商业化基石,新老玩家广泛入局,如Adobe Firefly和Midjourney。
- 文生视频-T2V:Latent Video Diffusion模型奠定T2V领域的基石,Runway Gen-2是市面上最早商业化的T2V模型之一,MGC时代大幕下的先行者。
-
文生图/视频国内映射:
- 万兴科技:发布“天幕”大模型整合T2V/I能力,AI赋能订阅及续约率双增,多款产品接入OpenAI GPT系列模型,价格策略调整幅度较小,后续或考虑AI Tokens增值模式。
- 美图公司:自研视觉大模型MiracleVision 4.0,订阅业务收入占比逐年增长,收购站酷强化创意软件业内协同效应。
-
研究结论与推荐关注:
- 文生图/文生视频大模型或将深刻变革内容生产工作流。
- 推荐关注数字创意软件厂商万兴科技、美图公司;AI技术龙头虹软科技、科大讯飞。