语音模型

世界第一开源TTS Breeze 2来了:T8开源ComfyUI整合包及节点,搭配MiniMax H3极致情感演绎

2026年9月4日2 次阅读
世界第一开源TTS Breeze 2来了:T8开源ComfyUI整合包及节点,搭配MiniMax H3极致情感演绎

> 导读:Breeze TTS 2 是 BreezeBlue 于2026年8月25日开源的文本转语音模型,在开源TTS排行榜上排名第一,综合评分超过 IndexTTS 2.5 和 Fish Audio S2Pro。博主 T8star-Aix 第一时间制作 ComfyUI 整合包及配套节点,支持声音设计、克隆、导演三种模式,并可搭配 MiniMax H3 实现极致情感演绎。

---

Breeze TTS 2 简介

Breeze TTS 2 是由 BreezeBlue 团队发布的开源权重文本转语音(TTS)模型,于2026年8月25日在 GitHub 和 Hugging Face 同步开源。根据 Artificial Analysis 的 TTS Elo 排行榜,该模型在开源TTS项目中排名第一,综合评分约100分,超越了此前广受关注的 IndexTTS 2.5 和 Fish Audio S2Pro。

值得注意的是,Breeze TTS 2 不仅是在开源模型中领先,在世界范围内所有TTS项目(包括闭源商业产品)中也能排到第六位,这是一个跨级别的表现。

---

核心功能:声音设计、克隆、导演

T8star-Aix(B站:T8star-Aix)第一时间对 Breeze TTS 2 进行了 ComfyUI 整合,目前已迭代至第8个版本。整合包提供三种核心功能:

1. 声音设计

无需参考音频,直接通过文字描述生成目标声音。例如输入"40岁男性,烟嗓,说话性感",系统即可生成对应音色。同时支持加入情感标记,如 [笑][咳嗽][清嗓子] 等,使生成的语音更加自然。

2. 声音克隆

提供参考音频后进行声音克隆。T8 在整合包中内置了 Whisper 小模型进行逐字稿识别,也可手动输入文本。克隆效果真实感强,音质明显优于之前的 IndexTTS 2.5。

3. 演艺导演

在声音克隆的基础上,额外添加情感指导。例如指定"可爱的女性,但说话很生气",模型能够理解并生成带有情绪张力的语音,既生气又不失可爱感。

---

与 IndexTTS 2.5 的对比

T8 在视频中明确指出,IndexTTS 2.5 虽然支持逐句情感控制,但在中文和英文的表达上仍有不足——速度提升了,但音质下降,有明显的AI味和电子感。

相比之下,Breeze TTS 2 在同样参考音频的情况下,写实感和语气自然度明显更优,且支持笑声、咳嗽等自然音效,效果非常自然。

---

搭配 MiniMax H3 的极致工作流

T8 同步更新了 MiniMax H3 提示词增强节点,新增"表演导演配置"功能,支持"强化"和"极致"两种模式:

  • 强化模式:在基础提示词上适度加强情感表达,变化约10%,适合简单提示词的优化
  • 极致模式:对已有完善提示词进行50%以上的情感内容调整,适合需要深度情感演绎的场景

搭配 Breeze TTS 2 的逐句情感控制,可以实现视频+音频的全流程极致情感演绎。

---

获取方式

  • 整合包:B站视频简介区或评论区链接
  • 国内用户:RunningHub(https://www.runninghub.cn)
  • 海外用户:RunningHub AI(https://www.runninghub.ai)
  • GitHub 模型仓库:BreezeBlue 官方发布页

---

来源说明

本文基于 B站博主 T8star-Aix 于2026年9月3日发布的视频《MiniMax H3神器易主!世界第一开源TTS Breeze 2,T8已开源整合包及节点》整理,视频时长约13分34秒。

交叉印证来源:

  • MindStudio:Breeze TTS 2 开源发布报道(2026-08-27)
  • AI Nexus:Breeze TTS 2 功能介绍(2026-08-28)

*本文依据视频转写内容(SenseVoice API)及公开媒体报道整理,仅供参考。*

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...