Breeze TTS 2:一个 3B 开源 TTS,把语音克隆、声音设计、多人对话全装进 ComfyUI
三分钟看懂版
- 这是什么:Breeze TTS 2 是一个 3B 参数的开源文本转语音模型,8 月下旬在 Hugging Face 开源,支持中英双语。它一次提供三种玩法:给一段参考音频就能克隆声音;用一句自然语言描述就能凭空设计一个声音;在克隆的基础上用指令指挥语气——让它叹气、笑、咳嗽、放慢语速。
- 为什么现在值得看:开源社区第一时间给它做了 ComfyUI 节点(Saganaki22/ComfyUI-Breeze-TTS-2,Apache-2.0),B 站 T8star-Aix 近日发布了中文整合包和在线工作流,把模型、节点、RunningHub 在线入口都打包好了,不想折腾环境的可以直接在浏览器里用。
- 最低门槛:推荐构建下载约 4.5 GiB 权重,实测显存约 5.5 GiB 起步(int8-hybrid,RTX 5090 实测峰值 5.53 GiB)。显存紧张的可以走 RunningHub 在线版。
它能干什么
1. 语音克隆(Voice Clone)
给一段干净的参考音频 + 它的逐字稿,模型就能用这个声音说任何话。参考音频建议 20 秒以内(上限 60 秒)。节点包里还内置了 Whisper 转写节点,帮你自动生成克隆需要的精确文本。
2. 声音设计(Voice Design)
不需要任何参考音频,直接用自然语言描述你想要的声音——比如"低沉的中年男声,语速偏慢,带点疲惫感"。官方基准里这个模式用 CFG 4 来强化描述的约束力。
3. 声音导演(Voice Direction)
克隆一个参考声音,同时用指令控制情绪、语气、节奏和表达方式。英文里写 (laugh)、(sigh)、(clears throat),中文里写 [笑]、[叹气]、[清嗓子],这些语气事件直接内联在文本里,输出 24 kHz 单声道。
4. 多人对话(Multi-Speaker)
这是它最有辨识度的功能:一个节点挂最多 8 个 Speaker,每个可以混搭"克隆的声音"和"设计出来的声音",然后写一份 名字: 台词 格式的剧本(或直接粘贴 LLM 生成的 JSON),一次生成整段对话。每个角色的声音在全部回合中保持一致,说话人之间还能控制停顿时长。写错名字会在生成前直接报错,不烧 GPU 时间。
对做播客、有声书、游戏 NPC 配音、短视频多角色配音的人来说,这一套基本覆盖了" casts + 剧本"的完整链路。
怎么用
本地路线(有 NVIDIA 显卡):
- ComfyUI 需搭配 Transformers 4.57 或 5.3+
- 安装节点包 ComfyUI-Breeze-TTS-2(首次运行自动下载模型)
- 权重四种构建可选:int8-hybrid 是默认推荐(显存比 bf16 低 27%、速度持平);bf16 最快(6.49 GiB)
- 显存参考(RTX 5090 实测):int8-hybrid 峰值 5.53 GiB,bf16 峰值 7.51 GiB;AIMDO 动态显存分页可以在多模型共存时压低实时占用
在线路线(无显卡 / 想先试效果):
视频作者在 RunningHub 挂了 8 个在线工作流(国内外版都有),覆盖音色设计、音色克隆(语气控制 / 指令控制)、多人对话四种场景,链接见文末来源区。B 站视频描述区也有整合包和节点的直接下载地址。
限制和坑
- 许可证不是完全商用友好:节点代码 Apache-2.0,但模型权重走 BreezeBlue 非商业许可,商用需要向 RESONIA, INC. 申请书面授权。拿它做商业配音前先看清这条。
- 全量 INT8 会变慢:最省显存的 int8-convrot 构建 RTF 从 5.64 涨到 9.08(RTX 5090),原因是解码器每帧要跑上千次小矩阵乘,量化开销反超收益。想省显存选 int8-hybrid,别选全量量化。
- 架构上是"三合一":T5Gemma2 文本编码器 + Qwen3 风格主干 + Qwen3-TTS 的 12Hz 编解码器,这意味着本地部署时依赖的 Transformers 版本有硬要求,老 ComfyUI 环境可能要升级。
- 克隆质量取决于参考音频:参考音频要干净、配逐字稿,太长(超 20 秒)官方也不建议。
适合谁 / 不适合谁
适合:想在本地跑 TTS、需要多角色对话配音的内容创作者;想要中文语气的短剧/播客制作者;用 ComfyUI 工作流、想把配音环节和生图生视频串在一起的人。
不适合:需要商用授权又不想谈许可的团队;只有 CPU 的机器(节点按 CUDA 为主设计);对说话延迟有苛刻要求的实时场景(它是离线生成为主,流式能力有限)。
新手第一步
没有显卡的:直接开 RunningHub 在线版"音色设计"工作流,输入一段中文台词加 [笑] [叹气] 试试语气控制,几分钟就能判断声音质量合不合口味。
有显卡的:装节点包,先用 int8-hybrid 构建跑一个 Voice Clone——录 15 秒自己的声音 + 逐字稿,生成一段,再试 Voice Direction 加一条情绪指令,对比差别。
来源区
- 本文基于 B 站 UP 主 T8star-Aix 的视频《最强TTS:Breeze TTS 2开源:自己的声音、角色配音、情绪表演、多人对话全搞定》(描述区提供整合包与在线入口)及以下来源整理:
- 模型页:huggingface.co/BreezeBlue/Breeze-TTS-2(2026-08-25 开源)
- ComfyUI 节点:github.com/Saganaki22/ComfyUI-Breeze-TTS-2(README 基准数据、显存与许可证信息)
- 社区讨论:Reddit r/SillyTavernAI、Medium 上多篇第三方实测文章
- 说明:本篇依据视频描述区、官方仓库文档与多家媒体转述整理,未包含视频逐段解说内容;显存与速度数据引自节点作者的 RTX 5090 基准测试,其他显卡表现可能不同。