Irodori-TTS v4 Small 开源:766M 参数日语 TTS,用 Emoji 控制语气和拟声,零样本克隆最长 120 秒参考音频
2026年8月3日4 次阅读
Irodori-TTS v4 Small 开源:766M 参数日语 TTS,用 Emoji 控制语气和拟声,零样本克隆最长 120 秒参考音频
日本开发者 Aratako 发布了 Irodori-TTS v4 Small——一个基于 Flow Matching 的开源日语语音合成模型,MIT 协议,766M 参数。这个模型最引人注目的地方是:你可以在文本里插入 Emoji 来控制说话的语气和拟声效果,比如插入 🤭 让 AI 忍俊不禁地笑,插入 🤧 让它咳嗽,插入 😮💨 让它叹气。同时它还支持零样本语音克隆和纯文字描述生成声音。
这是什么
Irodori-TTS v4 Small 是一个日语 TTS 模型,采用 Rectified Flow Diffusion Transformer(RF-DiT)架构,在 DACVAE 连续潜变量上做 Flow Matching 生成。架构设计参考了 Echo-TTS,音频编解码使用 32 维 DACVAE,输出 48kHz 波形。模型权重和推理代码都在 GitHub 和 HuggingFace 上开源,协议为 MIT。
v4 相比 v3 升级了什么
v4 最大的架构变化是把从零训练的文本编码器换成了预训练的 ModernBERT-ja(310M 参数),这是一个专门为日语优化的 BERT 变体。这个改动带来了几个实际好处:
- 汉字读音更准:在 Joyo Kanji Yomi Benchmark 上,目标汉字的 Kana-CER 从 8.49% 降到了 7.43%,改善明显。
- 长参考音频支持:v3 只能用短参考音频做语音克隆,v4 通过 speaker patching 和随机拼接训练,支持最长 120 秒的参考音频。你可以提供多条同一说话人的短片段,模型会自动拼接。
- 自动时长预测:不用再手动指定输出音频秒数了,模型会根据文本自动估算。
- 内置音频水印:集成了 Sony 的 SilentCipher,生成的音频会自动嵌入不可见水印,方便溯源。
Emoji 风格控制:最有意思的功能
这是 Irodori-TTS v4 最独特的功能。在输入文本中插入特定 Emoji,模型会在对应位置生成相应的语气或拟声效果:
- 🤭 → 忍俊不禁的笑声
- 🤧 → 咳嗽声
- 😮💨 → 叹气
- 😭 → 带哭腔的语气
Emoji 控制可以和文字描述(Caption)叠加使用。比如同一句话、同一个参考音频,只换 Caption 就能让声音从"悲痛欲绝"变成"怒气冲冲"再变成"冷漠敷衍"——音色不变,情绪完全不同,但说话人的音色特征保持一致。
三种使用模式
模型提供了三种灵活的使用方式:
- 纯文字生成:只给文本和一段描述性 Caption(比如"沉稳的中年男性,正式场合,声音低沉"),不需要任何参考音频,模型就能生成对应风格的声音。
- 风格化语音克隆:提供参考音频克隆音色,同时用 Caption 控制情绪和语速。比如用同一个人的声音,分别生成悲伤版、愤怒版、冷漠版。
- 全控制模式:参考音频 + Caption + Emoji 三管齐下,音色、情绪、拟声效果全部可控。
性能与部署
- 量化版本:已发布 INT8、INT4、FP8 量化模型,降低显存需求,适合消费级显卡运行。
- 在线试玩:HuggingFace 上有 Demo Space,可以直接输入日语文本体验。
- API 服务:提供了 OpenAI 兼容的推理 API Server,方便集成到现有工作流。
- 微调支持:支持 PEFT LoRA 微调,可以用自己的数据定制声音。
局限性
- 目前仅支持日语,不支持中文或英文。
- 长参考音频建议用多条短片段拼接而非单条长录音,单条长录音的效果未充分评估。
- 虽然汉字读音整体提升,但句级 Kana-CER 和 Standard CER 比 v3 略差,改进并不均匀覆盖所有指标。
- 模型参数量 766M,虽然不算大,但全精度推理仍需一定显存。
---
来源:
- [GitHub: Aratako/Irodori-TTS](https://github.com/Aratako/Irodori-TTS)
- [HuggingFace: Irodori-TTS-v4-Small](https://huggingface.co/Aratako/Irodori-TTS-v4-Small)