Sora是第一个表现出“涌现”能力的视频生成模型,其Diffusion Transformer架构证实了有效scale-up也即是增加算力能够提升视频生成的精细度和效果,是视频生成领域的“GPT-3时刻”。高质量的数据对视频生成模型的训练至关重要,Sora利用自有工具增强训练数据集与提示工程。随着Diffusion Transformer类模型大量应用于图像及视频生成,推理需求将大幅增加,与LLM推理更需要内存带宽的资源需求不同,视觉模型推理将对芯片本身算力和内存容量提出更高要求。Sora高质量的视频生成对影视和游戏行业的影响是最直接而深远的,降低制作门槛并且很有可能重塑影视和游戏制作的流程与格局。