本报告对传媒互联网行业进行了分析,主要关注了Sora视频模型的发布和应用。Sora在一致性方面取得了突破,可以生成摄像机动态运动的视频,并且能够模拟短距离和长距离依赖关系。此外,Sora还能够模拟一些基本交互的物理现象。技术层面,Sora在Diffusion基础上,以Transformer替代传统U-Net架构或进一步提升效果。Transformer的优势在于可以保留原生视频尺寸,生成的视频可以兼容不同的设备类型。高质量数据也是Sora性能提升的关键因素,包括引入re-captioning技术和大量生成合成数据作为训练集。最后,本报告指出,Sora的发布有望加速AI视频技术迭代进程,持续关注AI应用的商业化落地。