Minimax即将发布新模型H3,这是一款开放通用的统一多模态视频模型。H3支持文本、图片、视频和音频混合输入,最多可输入12份素材;单次生成5-15秒、24FPS的视频,支持1440p分辨率和原生双声道。其能力重点包括复杂动作、物体关系、指令遵循和多参考一致性。
据科技博主实测,H3在多个场景中表现出色:例如,从一张模特图生成完整的墨镜广告;同时处理角色、UI、英文名和交互的赛博朋克案例;以及保留原有人物和版式,仅修改动作与文字效果的动态海报。
H3主打高变现潜力场景。在这些场景中,审美是关键生产力,直接影响客户是否采用及返工次数。广告、电商、游戏和UI是H3的高潜力应用领域,这些场景预算明确、需求高频,且客户常需反复修改人物、商品、文案和版式。H3的推出旨在满足这些高频、高变现潜力的市场需求。