视频模型

MiniMax H3 满血版开源:8G显存可跑的全模态视频生成模型,2K原生立体声

2026年8月5日0 次阅读
MiniMax H3 满血版开源:8G显存可跑的全模态视频生成模型,2K原生立体声

MiniMax 正式开源了 H3 视频生成模型的满血版权重。这是目前开源视频模型中少有的"全模态"选手——文生视频、图生视频、首尾帧、多参考生成、视频编辑,一个模型全包,还能原生输出 2K 分辨率 + 立体声音频。

H3 是什么

MiniMax H3 是 MiniMax 第三代通用视频生成模型。和前两代(海螺 01/02)不同,H3 从设计之初就打破了"文生视频""图生视频""首尾帧"这些任务边界,用统一的架构处理所有输入组合。

简单说:你给它文字、图片、视频、音频的任意组合,它都能理解并生成视频。比如"参考视频1的希区柯克运镜,让图片2里的人物唱音频3的歌"——这种跨模态指令,H3 直接处理,不需要拆成多个步骤。

核心能力

全模态输入:H3 提供两个模型变体——

  • H3-Base-FL2VA(首尾帧模式):支持零图(纯文生视频)、一图(首帧或尾帧生视频)、两图(首尾帧生视频)
  • H3-Base-Ref2VA(全参考模式):最多 9 张图片 + 3 段视频 + 3 段音频,混合输入最多 12 个文件

输出规格

  • 时长 4–15 秒,24 FPS
  • 分辨率默认短边 768px,2K 可通过 H3-Regenerate-2K 实现
  • 原生 32kHz 立体声音频
  • 支持 21:9、16:9、4:3、1:1、3:4、9:16 等多种画幅
  • 稳定支持中英日韩法德等 11 种语言

价格优势:2K 分辨率下每秒价格不到主流模型的三分之一,768p 下不到主流 720p 的一半。

本地部署:8G 显存起步

开源后社区迅速跟进量化版本。根据实测:

  • NVFP4 量化(4bit):约 12GB 显存,质量有一定损失
  • int8_convrot 量化:约 20GB 显存,质量明显优于 FP4,推荐有条件的用户使用
  • 8G 显存:通过进一步量化/低分辨率模式可跑,但效果受限

ComfyUI 已原生支持 H3(需 ≥ 0.30.0 版本),采样器使用 res_multistep,帧长度需满足 17n+5 的约束。

与 Flux3、Seedance 2.0 对比

B站 UP 主 T8star-Aix 的全网首发测评中,对 H3 与 Flux3 预览版、Seedance 2.0 做了大量并排对比:

  • 美学风格:H3 被称为"视频界的 MJ 模型",有独特的美学倾向,与 Seedance 2.0 的写实路线形成差异
  • 中文理解:H3 在中文提示词跟随上表现突出
  • 首尾帧控制:H3 的首尾帧一致性是亮点之一
  • 多参考生成:9图3视频3音频的混合参考能力,目前开源模型中无竞品

如何上手

  1. HuggingFace 下载:https://huggingface.co/MiniMaxAI/MiniMax-H3
  2. ComfyUI 工作流:https://github.com/HM-RunningHub/ComfyUI_RH_MinMaxH3
  3. 整合包:社区提供了 ComfyUI 整合包,开箱即用

基于多家媒体转述整理,主要来源为 MiniMax 官方博客及开源公告、T8star-Aix B站测评视频。

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...