核心观点
- 视频大模型发展迅速,国内外差距缩小:自Sora发布以来,国内外已有十多家公司发布或更新视频生成模型,视频时长、分辨率等基础功能差距缩小,未来竞争将转向抢占用户和提升粘性。
- 国内模型表现强劲,部分已进入第一梯队:在文生视频领域,我国Vidu、清影等模型在动作幅度、物理还原度等复杂任务完成性上表现优异;图生视频领域,国内与国外差距进一步缩小。
- 视频大模型具备商用潜力,下游应用正在储能:视频大模型已初步验证商用潜力,未来在办公、广告、电影、游戏等领域具有广阔前景。
关键数据
- Sora模型参数量约30亿,训练数据或达到百万亿级patches。
- Sora训练算力或达到9.8万ZFLOPS,大致需要9096张H100卡训练180天。
- Sora生成1分钟视频算力达到437.4PFLOPS,系生成2k token GPT-4的390.5倍。
研究结论
- 算法方面:视频生成模型算法主要由基于SD逐帧生成和基于时空Patches两种范式构成,前者模型更容易训练,后者训练成本更高但生成视频的长度与一致性更容易得到保障。
- 算力方面:视频生成模型训练和推理算力需求远高于文字等单模态模型,Sora训练算力需求是GPT-4的4.5倍,推理算力需求接近GPT-4的400倍。
- 数据方面:高质量数据是模型能力的保障,用户数量或为开启模型迭代“数据飞轮”的关键。
- 投资建议:建议关注视频大模型厂商(科大讯飞、商汤、云从科技等)、算力(海光信息、寒武纪等)以及接入大模型的应用标的(金山办公、万兴科技等)。
- 风险提示:商业化落地不及预期、国内大模型在缺乏算力支持的情况下迭代速度放缓、国内大模型技术路线产生分歧。