MiniMax H3 开源:2K 视频+原生立体声一次出片,Omni-Reference 把多模态参考揉进一个模型
7 月 31 日,MiniMax 发布了 H3(即 Hailuo 3.0)——这是它首个开源的多模态视频生成模型。一句话概括:一个模型同时理解文字、图片、视频、音频,直接输出 2K 分辨率、带原生立体声的视频,最长 15 秒,一次 API 调用搞定。
三个"第一"值得注意
开源视频模型里首个 2K + 原生音频。 之前开源视频模型基本停在 1080p,且不带声音。H3 直接输出 2K 24fps 画面 + 同步立体声音频,省掉了后期配音对齐的步骤。
Omni-Reference 系统。 传统视频生成工具一次只接受一种参考——要么给张图做图生视频,要么给段视频做动作迁移。H3 的 Omni-Reference 可以同时接收最多 9 张参考图、3 段视频、3 段音频,模型在同一个多模态上下文里理解所有输入,然后一次性生成。这意味着:电商团队可以同时输入产品图、品牌字体、参考动作视频和背景音乐,直接出带产品展示和品牌信息的广告素材;游戏工作室可以输入角色设定图 + 动作参考 + 场景概念图,生成角色一致性的过场动画。
Artificial Analysis 视频编辑榜排名第一。 在含音频的视频编辑评测中,H3 目前位居榜首,文生视频和图生视频也排在前列。
技术上怎么做到的
H3-VAE tokenizer 实现了 4 倍的有效序列长度提升——这是 2K 分辨率在经济上可行的关键。更长的有效序列意味着同样算力能处理更高质量的画面,训练吞吐也提升了约 30%。模型架构上,H3 把视频生成、编辑和多模态理解统一进一个 transformer,而不是像传统方案那样拆成多个专用模型。
定价:2K 档里算便宜
- 2K 生成:$0.13/秒,15 秒视频约 $1.95
- 768p tier:$0.09/秒(内测中,需联系销售)
- 前 5 张参考图免费,额外图片 $0.04/张,参考音频免费
横向对比:Wan 2.6 和 Veo 3.1 虽然更便宜($0.07-0.09/秒),但最高 1080p 且不带音频;Sora 2 是 $0.10/秒。如果需要 2K + 原生音频,H3 目前是最具性价比的选择。MiniMax 声称 H3 成本不到主流 2K 模型的三分之一,独立价格对比也确认了它在 2K 档的竞争力。
开源权重与许可
截至 8 月 2 日,模型权重尚未发布,MiniMax 表示"数天内"上线,关注 HuggingFace 上的 MiniMaxAI 组织页面即可。
许可条款是 MiniMax Community License:
- 非商用:完全免费,无限制
- 商用,年收入 < $20M:免费,需标注"Build with MiniMax"并邮件通知 [email protected]
- 商用,年收入 > $20M:必须单独谈判商业许可
对独立开发者和小团队来说,这个许可相当友好。但大企业需要额外谈判,且 MiniMax 保留了"适用法律法规"的兜底条款。
版权风险不能忽视
MiniMax 目前正处在美国联邦版权诉讼的 discovery 阶段——2026 年 5 月 26 日法官驳回了 MiniMax 的驳回动议,案件进入取证。H3 建立在涉案的 Hailuo 平台之上。
巧合的是,H3 发布同一天,慕尼黑法院裁定 Suno 训练数据侵权——这是欧盟首个认定"将受保护作品存入模型构成复制权侵犯"的判决。虽然 Suno 案是音乐领域、慕尼黑也不是美国法院,但方向明确:AI 训练数据的法律环境在收紧。
这不意味着 H3 的输出违法,但商业团队在采用前需要评估 IP 诉讼风险,尤其是对法律容忍度低的组织或欧盟辖区。
总结
H3 是视频生成领域一个实质性的进步:2K + 原生立体声 + Omni-Reference 多模态参考,把原本需要多步多模型的流程压缩到一个 API 调用。API 今天就能用,开源权重即将发布。需要关注两件事:权重何时真正落地,以及美国版权案如何发展。年收入超过 $20M 的团队或对 IP 风险敏感的组织,建议先做法律评估再上生产环境。
基于多家媒体转述整理。