语音模型

MiniMax Speech 2.8 发布:AI语音学会嗯…啊…,10秒克隆你的声音

2026年7月28日1 次阅读
MiniMax Speech 2.8 发布:AI语音学会"嗯…啊…",10秒克隆你的声音

MiniMax Speech 2.8 发布:AI语音学会"嗯…啊…",10秒克隆你的声音

MiniMax 今天发布了 Speech 2.8 语音合成模型。这次升级的核心不是跑分,而是让 AI 说话更像人——它学会了犹豫、呼吸、笑,甚至清嗓子。

让 AI 学会"不完美"

过去 AI 语音最大的破绽不是音色,而是节奏。真人说话会"嗯…"、"啊…"、停顿、换气,这些"不完美"恰恰是真实感的来源。Speech 2.8 引入了原生声音标签(Native Sound Tags),可以在文本中直接插入口语填充词、呼吸声、笑声、清嗓等标记,模型会自动生成对应的自然语音效果。

比如这段话:

> "Hey, it's me. How are ya? (chuckle) I hope you're having an awesome day! We actually had a bit of a crazy launch day yesterday, you know, but (breath) I'm just recovered and ready to roll."

括号里的 (chuckle)、(breath) 会被模型渲染成真实的笑声和呼吸声,而不是被忽略或读成文字。这种能力在有声书、播客、虚拟角色对话等场景中尤其重要——没有这些细节,再好的音色听起来也像机器。

10秒克隆,保真度再进一步

语音克隆方面,Speech 2.8 优化了特征提取流程。只需 10 秒音频采样,就能精确复制说话人的音色、气息感和语速节奏。MiniMax 称结果不只是"听起来像你",而是"就是你"。

从官方英文 demo 来看,克隆后的声音具备三个特点:对话感强(不像播音腔,更像朋友聊天)、节奏自然(会使用填充词和停顿)、中频温暖(音色沉稳有亲和力)。

录音棚级纯净输出

AI 语音常见的另一个问题是背景噪声和数字失真——那种轻微的"电子味"。Speech 2.8 重新设计了音频处理引擎,消除了背景噪声和合成失真,输出质量接近专业录音棚水准。对于有声内容制作来说,这意味着后期降噪和修音的工作量可以大幅减少。

跨语言口音修复

多语言场景下,AI 语音经常出现"口音串扰"——用中文音色说日语时带中文腔,反过来也一样。Speech 2.8 首先修复了中日互译的口音问题,确保每种语言都听起来像母语者。更多语言对的优化正在推进中。

适合谁用?

  • 有声书和播客制作者:声音标签让旁白更有表现力,克隆功能让角色声音保持一致
  • 虚拟角色和游戏:NPC 对话不再千篇一律,犹豫和呼吸让角色更鲜活
  • 多语言内容团队:一个音色覆盖多语言,口音不再串
  • 客服和语音助手:更自然的语气提升用户体验

小结

Speech 2.8 的升级方向很明确:不是追求更高的 MOS 分,而是解决 AI 语音"太完美反而不真实"的老问题。声音标签、高保真克隆、纯净输出、口音修复,每一项都在缩小 AI 和真人之间的感知差距。目前模型已在 MiniMax 平台上线。

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...