音乐模型

MiniMax Music 3.0 开源发布:8B+0.6B 双模型架构,最长5分钟完整歌曲生成,支持多语言人声

2026年8月15日1 次阅读
MiniMax Music 3.0 开源发布:8B+0.6B 双模型架构,最长5分钟完整歌曲生成,支持多语言人声

MiniMax 于8月14日正式发布 Music 3.0,这是一款开源权重的音乐生成模型。它的核心能力是:输入歌词和风格描述,就能生成最长5分钟、包含人声演唱的完整歌曲。在开源音乐生成领域,能同时做到"长曲+人声+开源可本地跑"的模型目前并不多见,Music 3.0 的出现填补了这一空白。

这是什么?

Music 3.0 是 MiniMax 推出的第三代音乐生成模型。你只需要提供一段文字描述(比如"复古上海爵士灵魂乐,温暖lo-fi质感,亲密女声")和可选的歌词,模型就会自动完成作曲、编曲、演唱和混音,输出一首完整的歌曲。

与前代相比,Music 3.0 不是简单升级,而是从底层重新设计了整个生成流程——从音乐描述方式、语言建模到音频渲染全部重构。

模型权重已在 GitHub 和 HuggingFace 上开源,本地运行需要 NVIDIA GPU(CUDA)。

技术架构:三层协作

Music 3.0 的架构由三个核心组件构成,各司其职:

8B Global LLM(长程结构建模):基于 Qwen3.5-8B 初始化,负责逐帧预测语义 token,同时建模全局上下文。简单说,它决定了整首歌的"大结构"——主题怎么发展、段落怎么推进、情绪怎么起伏。

0.6B Local LLM(帧级声学细节):随机初始化,在每一帧内沿深度轴预测声学 token。它负责"小细节"——音色质感、咬字发音、乐器音色的微妙变化。

Flow Matching + Flow-VAE(音频渲染):2.4B 的 Flow Matching 模块和 123M 的 Flow-VAE 解码器,将两个 LLM 的连续隐状态融合后重建为最终音频。这条路径跳过了传统方案中"离散 token 直连解码器"的做法,改用连续表示连接语言模型和声学模型,在保持长程一致性的同时提升了发音准确度和音色连贯性。

此外,模型使用8层残差向量量化(RVQ)来分层表示音乐信息:第一层捕捉核心语义和结构,其余七层逐步编码声学残差。这种设计避免了单一 token 层同时承载结构和音质信息,让长序列预测更稳定。

最终输出规格为 32kHz、16-bit 立体声 WAV。

能做什么?

文字生成歌曲:输入一段自然语言描述和歌词,就能得到完整歌曲。描述可以很简洁,比如"轻快流行,女声,钢琴伴奏",也可以很详细,指定 BPM、调性、编曲元素、段落结构等。

多语言人声:支持中文、英文、日语等多种语言的人声演唱,且人声听起来像"演唱"而非"合成"——这是 Music 3.0 重点优化的方向之一。

结构化提示词控制:支持在歌词中使用段落标签(如 [Verse][Chorus][Bridge][Outro]),在描述中指定每段的编曲和情绪走向,实现对歌曲结构的精细控制。

music-caption-rewriter skill:官方提供了一个自动扩展工具,能把简短描述自动转化为包含全局元数据、人声细节和编曲安排的结构化提示词,降低使用门槛。

对谁有用?有什么限制?

音乐创作者:可以快速把灵感变成可听的 demo,省去编曲和录制环节。

开发者:权重开源,可以本地部署,不依赖 API 调用,适合集成到自己的产品中。

当前限制

  • 必须使用 NVIDIA GPU(CUDA),暂不支持其他硬件
  • 目前仅支持非流式生成,无法实时输出
  • 提示词上限 5000 token,声学帧上限 9000
  • 生成的速度、调性、编曲、歌词细节不一定完全匹配每一条要求——模型提供的是"生成性控制"而非"精确符号保证"

总结

MiniMax Music 3.0 在开源音乐生成领域树立了新标杆:5分钟长曲、多语言人声、双模型分层架构、开源可本地运行。对于想要快速出 demo 的音乐人和想要自建音乐生成能力的开发者来说,这是一个值得尝试的新选择。

---

来源

  • [MiniMax 官方博客](https://www.minimax.io/blog/minimax-music-3-0-next-generation-open-weights-production-ready-versatile-music-model)
  • [GitHub 仓库](https://github.com/MiniMax-AI/MiniMax-Music3)

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...