语音模型

Irodori-TTS v4 Small 开源:766M 参数日语 TTS,用 Emoji 控制语气和拟声,零样本克隆最长 120 秒参考音频

2026年8月3日4 次阅读
Irodori-TTS v4 Small 开源:766M 参数日语 TTS,用 Emoji 控制语气和拟声,零样本克隆最长 120 秒参考音频

日本开发者 Aratako 发布了 Irodori-TTS v4 Small——一个基于 Flow Matching 的开源日语语音合成模型,MIT 协议,766M 参数。这个模型最引人注目的地方是:你可以在文本里插入 Emoji 来控制说话的语气和拟声效果,比如插入 🤭 让 AI 忍俊不禁地笑,插入 🤧 让它咳嗽,插入 😮💨 让它叹气。同时它还支持零样本语音克隆和纯文字描述生成声音。

这是什么

Irodori-TTS v4 Small 是一个日语 TTS 模型,采用 Rectified Flow Diffusion Transformer(RF-DiT)架构,在 DACVAE 连续潜变量上做 Flow Matching 生成。架构设计参考了 Echo-TTS,音频编解码使用 32 维 DACVAE,输出 48kHz 波形。模型权重和推理代码都在 GitHub 和 HuggingFace 上开源,协议为 MIT。

v4 相比 v3 升级了什么

v4 最大的架构变化是把从零训练的文本编码器换成了预训练的 ModernBERT-ja(310M 参数),这是一个专门为日语优化的 BERT 变体。这个改动带来了几个实际好处:

  • 汉字读音更准:在 Joyo Kanji Yomi Benchmark 上,目标汉字的 Kana-CER 从 8.49% 降到了 7.43%,改善明显。
  • 长参考音频支持:v3 只能用短参考音频做语音克隆,v4 通过 speaker patching 和随机拼接训练,支持最长 120 秒的参考音频。你可以提供多条同一说话人的短片段,模型会自动拼接。
  • 自动时长预测:不用再手动指定输出音频秒数了,模型会根据文本自动估算。
  • 内置音频水印:集成了 Sony 的 SilentCipher,生成的音频会自动嵌入不可见水印,方便溯源。

Emoji 风格控制:最有意思的功能

这是 Irodori-TTS v4 最独特的功能。在输入文本中插入特定 Emoji,模型会在对应位置生成相应的语气或拟声效果:

  • 🤭 → 忍俊不禁的笑声
  • 🤧 → 咳嗽声
  • 😮💨 → 叹气
  • 😭 → 带哭腔的语气

Emoji 控制可以和文字描述(Caption)叠加使用。比如同一句话、同一个参考音频,只换 Caption 就能让声音从"悲痛欲绝"变成"怒气冲冲"再变成"冷漠敷衍"——音色不变,情绪完全不同,但说话人的音色特征保持一致。

三种使用模式

模型提供了三种灵活的使用方式:

  1. 纯文字生成:只给文本和一段描述性 Caption(比如"沉稳的中年男性,正式场合,声音低沉"),不需要任何参考音频,模型就能生成对应风格的声音。
  2. 风格化语音克隆:提供参考音频克隆音色,同时用 Caption 控制情绪和语速。比如用同一个人的声音,分别生成悲伤版、愤怒版、冷漠版。
  3. 全控制模式:参考音频 + Caption + Emoji 三管齐下,音色、情绪、拟声效果全部可控。

性能与部署

  • 量化版本:已发布 INT8、INT4、FP8 量化模型,降低显存需求,适合消费级显卡运行。
  • 在线试玩:HuggingFace 上有 Demo Space,可以直接输入日语文本体验。
  • API 服务:提供了 OpenAI 兼容的推理 API Server,方便集成到现有工作流。
  • 微调支持:支持 PEFT LoRA 微调,可以用自己的数据定制声音。

局限性

  • 目前仅支持日语,不支持中文或英文。
  • 长参考音频建议用多条短片段拼接而非单条长录音,单条长录音的效果未充分评估。
  • 虽然汉字读音整体提升,但句级 Kana-CER 和 Standard CER 比 v3 略差,改进并不均匀覆盖所有指标。
  • 模型参数量 766M,虽然不算大,但全精度推理仍需一定显存。

---

来源

  • [GitHub: Aratako/Irodori-TTS](https://github.com/Aratako/Irodori-TTS)
  • [HuggingFace: Irodori-TTS-v4-Small](https://huggingface.co/Aratako/Irodori-TTS-v4-Small)

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...