视频模型

MiniMax H3发布并开源:首个全模态统一视频模型,能力逼近闭源最强,价格仅三分之一

2026年8月2日0 次阅读
MiniMax H3发布并开源:首个全模态统一视频模型,能力逼近闭源最强,价格仅三分之一

7月31日,MiniMax正式发布新一代多模态生成模型H3,并宣布近期开源。这是视频生成领域首个能力逼近闭源旗舰的开源全模态统一模型,被业内类比为"多模态领域的DeepSeek R1时刻"。

不再是"视频生成模型",而是全模态统一模型

H3最根本的变化在于:它不再按图片生成、视频生成、音频生成等任务分拆,而是把文字、图片、音频、视频全部放进同一个上下文,用自然语言描述"输入和目标之间的关系",然后统一生成。

这意味着过去需要"先选模式再填参数"的操作方式被彻底取代。比如"参考视频A的运镜、图片B中的人物、音频C的声音,生成新视频"——不再是三个独立开关,而是同一个任务里的不同信息。这种设计思路和语言模型从"几十个NLP任务"统一到"指令微调"的路径完全一致。

四项核心技术重构

H3对模型底层做了全面重构,对应生成模型的四个关键环节:

  • Contextual Omni Representation:重新设计数据标注体系,不只描述目标,还要描述上下文与目标的关系、上下文内部元素间关系、音画对应关系。语言成为泛化的桥梁。
  • H3-VAE:全新Tokenizer,在压缩率、重建质量和latent空间友好度之间取得平衡,获得4倍序列长度收益,这是2K直出和低价的底气。
  • H3-Omni Transformer:理解与生成异构训练架构,精细调优不同workload下的硬件利用率,端到端提升近30%训练吞吐。MiniMax主动放弃了此前表现优异的hailuo-02架构,因为"聪明的技巧在特定任务上有效,简洁的结构才能在未见任务上成功"。
  • In-context Regeneration:输出层新设计,支持在已有内容基础上进行编辑和再生。

实测表现

基于多家媒体和创作者的测评,H3在以下场景表现突出:

多模态融合:上传一段动画视频+一张球状屏幕街景图片,H3识别出球面几何特性,让人物运动遵循球面变形规律,并自动补齐音效。

语音替换与嘴形同步:给视频中的人物配音或改变台词,音色和嘴形还原度高,且能识别并修改画面中原有的文字。

导演级指令跟随:长提示词控制运镜与打光——烛光、硬光、彩虹折射、红蓝对打、金色逆光依次出现,受光区域、面部阴影、金属高光都跟随光源变化,材质感保留完整。

价格与开源生态

H3视频生成定价0.8元/秒(2K分辨率),仅为同类旗舰视频模型的三分之一。开源后,企业可本地部署,结合自身数据优化,满足安全合规要求;芯片厂商和开发者可参与适配,降低使用成本。

MiniMax此前已开源三代M系列文本模型,H3是其首款开源多模态生成模型。官方表示更详细的开源技术报告将在之后发布。

对谁有用

  • 视频创作者:一个模型完成多模态融合、编辑、配音,不再需要多个工具拼接
  • 广告/电商/游戏行业:商用级内容生成,品牌信息呈现和文字渲染能力强
  • 本地部署企业:开源后可私有化部署,数据不出域
  • 国产AI芯片生态:开源模型为芯片适配提供更多选择

---

*基于新京报、品玩等媒体及T8star-Aix等创作者测评转述整理。*

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...