语音模型

Kyutai 一周内给 Pocket TTS 连更四刀:默认英语模型换新,还能训 Muon、跑波兰语

2026年9月22日2 次阅读
Kyutai 一周内给 Pocket TTS 连更四刀:默认英语模型换新,还能训 Muon、跑波兰语

如果你想在普通 CPU 上跑一个质量不错的 TTS,Pocket TTS 可能是绕不开的项目。它由法国开源团队 Kyutai 维护,主打"pip 装完就能用、不靠 GPU",被很多人当成语音 Agent 和低成本播报场景里的默认选项。

最近这一周,这个项目的 GitHub 上连续合入了几个有实际意义的更新。本文基于官方仓库(kyutai-labs/pocket-tts)近 72 小时内及边缘时间点的 4 个 PR 整理,信息均来自项目方公开提交记录。

这次更了什么

1. 新默认英语模型 english_2026-09(9 月 17 日合入)

这是最值得留意的一条。新模型是 6 层结构,由一个 24 层的"鲁棒性微调教师模型"蒸馏而来。它专门修了一个很常见但很坑的用法:很多下游系统喂给 TTS 的语音提示会被截断到单词中间,或者文本末尾没有标点。过去这类"越界输入"会让模型表现不稳定;新模型下它们回到了训练分布内。

项目方给出的数据:LibriSpeech test-clean 448 条提示上,WER 基本持平(0.91% → 0.97%),UTMOS 自然度 4.358 左右;"单词中间截断"场景 WER 从 1.17% 降到 0.89%;400 票双人盲听对比旧模型 english_2026-04,新模型 207:193 小幅胜出。注意这些都是项目方自报的数字,社区可复核但未经第三方验证。

2. 训练支持 Muon 优化器(9 月 19 日合入)

Pocket TTS 一直支持微调自己的模型,这次把 Muon 做成了可选优化器:backbone 的 2D 权重走 Newton-Schulz 正交化动量,embedding 和采样头仍用 AdamW,学习率默认 0.005。对想训新语言、新音色的人来说,多了一个被社区验证过的训练配方。

3. 波兰语社区模型入库(9 月 18 日合入)

6 层波兰语模型由社区训练后合入官方仓库。加上此前的威尔士语、爱沙尼亚语、波斯语等,Pocket TTS 的非英语语言版图还在往外扩。

4. 断连即停,别再白烧算力(9 月 21 日合入)

这是个实用修复:以前客户端中途断开,服务端 worker 线程仍会把剩余文本全部生成完,还占着"不支持并发"的模型跑下一轮请求。现在断连会直接停止生成。做语音服务的同学都知道,这种浪费在长文本场景很肉疼。

为什么值得看一眼

Pocket TTS 的受众很明确:不想为 TTS 付 API 费用、但又想要超过"机器人念经"水平的人。它不追求最低延迟或最强表现力,而是把"够用、能跑、能微调"做扎实。这一周的更新没有炫技成分,全是工程补强——鲁棒性、训练选项、断连行为,都是二次开发者真正会踩到的点。

局限也说清楚:这些是持续迭代而非单次发布事件;文中数字全部来自项目方 PR 描述;如果你想用于生产,建议拿自己的文本集跑一遍盲测再决定。

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...