语音模型

Audio8 TTS 开源:0.6B 小模型实现 11 语言零样本语音克隆,RTF 仅 0.116

2026年8月3日0 次阅读
Audio8 TTS 开源:0.6B 小模型实现 11 语言零样本语音克隆,RTF 仅 0.116

Audio8 AI 发布了 Audio8 TTS Preview——一个仅 0.6B 参数的多语言文本转语音模型,支持零样本语音克隆,覆盖中英日韩等 11 种语言,Apache 2.0 协议开源,模型权重已上线 HuggingFace。

小模型,大能力

Audio8 TTS 最引人注目的地方在于参数量与能力的反差:6 亿参数的模型,却实现了 11 种语言的零样本语音克隆。你只需要提供几秒钟的参考音频和对应文本,模型就能克隆出相似的声音来朗读新内容。

支持的语言包括中文、粤语、英语、日语、韩语、法语、德语、意大利语、西班牙语、荷兰语和波兰语。开发团队明确表示这是 Preview 版,语言覆盖还有意限制,后续版本会扩展中文方言和更多语种。

DualAR 架构:快慢双自回归

Audio8 TTS 采用 DualAR(双自回归)架构,设计灵感来自 Fish Audio S2 Pro。核心思路是把语音生成拆成两步:

  • Slow AR(24 层,896 宽):先预测每一帧的语义 token,决定"说什么"
  • Fast AR(4 层,896 宽):再预测 codec codebooks,决定"怎么响"

声学端使用 10 个 codebook、每本 4096 条目,内置 44.1kHz 神经 codec——这意味着参考音频编码和波形解码不需要额外加载别的模型,一个 checkpoint 全搞定。推理时两路都用静态 KV 缓存加速。

性能:RTF 0.116,CPU 也能跑

在 NVIDIA H20 上用 BF16 + CUDA Graph + greedy 解码测试,生成约 6 秒音频的 warm p50 延迟仅 0.691 秒,RTF(实时率)0.116——也就是说生成速度是实时的 8.6 倍。

对没有高端 GPU 的用户,Audio8 还提供了 ONNX INT4 版本。权重做 INT4 量化后,在 Apple M2 上运行只需约 1GB 内存,支持流式 PCM 输出和 HTTP 服务。6G 显存的消费级 GPU 跑 BF16 版本也完全够用。

部署方面,Audio8 提供了 SGLang Omni 适配器,支持 OpenAI 兼容 API、动态批处理和分页注意力,适合生产环境。

适合谁用

  • 独立开发者:0.6B 参数 + Apache 2.0,门槛极低,6G 显存就能跑
  • 语音克隆场景:几秒参考音频即可克隆,无需微调
  • 多语言产品:11 语言开箱即用,特别适合东亚市场(中日韩粤)
  • 边缘/嵌入式部署:ONNX INT4 版本在 CPU 上 1GB 内存可运行

当前限制

Preview 版本有几个需要注意的地方:单次输入建议控制在 150 字符以内,超长文本质量会下降;语言覆盖虽然已有 11 种但还不全面;SGLang Omni 适配器需要锁定特定 commit,不能直接用 main 分支最新代码。

---

基于 GitHub 官方仓库、HuggingFace 模型页、Reddit r/speechtech 讨论及 T8star-Aix 测评视频综合整理。

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...