多模态大模型趋势与挑战
- 多模态算力趋势:AI迭代持续带来爆点应用,多模态大模型将带动更多行业变革。业界主要的视频生成模型包括闭源(Sora、海螺AI等)和开源(清影、OpenSora等)模型。视频生成大模型催生新应用及新需求,如AI短剧和算力、存储、网络需求的爆发。
- 多模态算力需求:大模型对集群算力需求快速增长,EFLOPS-day指标显示,从BERT到GPT-4,算力需求呈指数级增长。多模态模型参数持续增长,以Movie Gen 30B为例,集群规模需达6144 H100。
- 多模态算法结构:以扩散技术(diffusion)为主的多模态生成模型(如SORA类、SD类)技术趋于成熟;以LLM Next-Token Prediction为主的多模态生成理解模型(如Qwen2-VL系列)技术趋于成熟;覆盖图文音视频的全模态模型技术尚不成熟。
加速算法及套件
- 热门加速技术:DP(ZeRO、Ring Attention、Ulysses)、CP(Megatron-TP、2D/3D-TP)、TP(Gpipe、1F1B、TeraPipe)、PP(BFPipe、Chimera、FisherPipe、Alpa、Dapple、Colossal-AUTO、Galvatron、Unity)、MoE(Tutel、FasterMoE、FlexMoE、SmartMoE)等。
- MindSpeed-MM研究现状:已支持Gpipe、1F1B、PTD并行、序列并行、虚拟流水线并行、专家并行、重计算技术、分布式优化器(ZeRO-1/2/3)、计算通信并行技术、超长序列优化技术。在研技术包括内存深度优化、MoE负载均衡、自动并行等。
MindSpeed-MM介绍
- 架构设计:全栈联合优化、分层开放,支持长序列、MoE、多模态等典型模型应用。包括MindSpeed大模型加速库套件(CANN)、MindSpeed MM多模态模型套件、MindSpeed LLM大语言模型套件、MindSpeed Core亲和加速模块。
- 模型开发:支持大规模分布式训练,多模态统一架构。软件架构包括预置模型、原生适配接入、主体结构支持灵活搭建多模态生成模型和多模态理解模型,可扩展PredictModel、AEModel、VisionModel、GPTModel等。训练流程包括原子模型开发、配置实例化、模型选择、组合实例化等。
- 加速方法:PP(切分模型权重)、VPP(进一步切分PP stage)、异构PP(灵活切分模型)、动态PP(减少冗余计算和通信)、USP(CP-Ulysses融合、CP-RingAttention跨节点Ring P2P)、ZeRO(分层zero、ZeRO1/3)、编码器离线处理、TP+SP(切分权重和激活值)、多模态异构模型分解训练(独立并行、分离部署)。
典型多模态模型性能
- 性能表现:MindSpeed-MM在多个典型多模态模型上实现性能提升,如OpenSora 1.2、OpenSoraPlan 1.2/1.3、SDXL/SD3/FLUX、LLAVA 1.5、Intern VL 2.0-8B/76B、Qwen2-VL-2B/7B等,NPU性能较业界参考性能提升0.95倍。
应用案例
- TOP客户商业案例:客户类型一(深度使用&联创)包括A客户(智谱CogVideoX扩展参数)、B/C客户(OpenSoraPlan 10B视频模型训练)、D/E客户(FLUX百卡业务训练);客户类型二(开箱即用&POC&特性参考)包括XX银行、XX运营商、某央国企使用Qwen2-VL。
- 原生支持案例:北大OpenSoraPlan + 昇腾MindSpeed-MM实现电影级视频生成;360 + 昇腾MindSpeed-MM训练Qihoo-T2X。