IndexTTS-2.5 开源发布:多语言零样本语音克隆,支持情感与语速精细控制
2026年8月12日2 次阅读
IndexTTS-2.5 开源发布:多语言零样本语音克隆,支持情感与语速精细控制
8月10日,IndexTeam 正式发布 IndexTTS-2.5,这是其开源零样本文本转语音(TTS)系统的最新版本。只需一条参考音频,即可克隆说话人的声音,并支持中文、英文、日语、西班牙语和阿拉伯语五种语言。
相比 2.0 的核心升级
IndexTTS-2.5 在前代基础上带来了多项实用改进:
- 多语言扩展:新增中文、西班牙语和阿拉伯语支持,覆盖全球使用人数最多的几种语言。
- 情感与音色解耦:细粒度情感控制让克隆的声音可以表达不同情绪,同时保持音色稳定,不会因为情感变化而"变声"。
- 语速控制:通过 duration_factor 参数,可在 0.5x 到 2.0x 之间调节语速,适配不同场景需求。
- 发音控制:支持中文拼音、英文 CMU 音素和日文假名三种发音标注方式,对多音字、专有名词等场景更精准。
- 推理加速:相比 IndexTTS-2 推理速度更快。
- 生产部署:新增 vLLM 支持,可直接用于线上服务。
硬件门槛
根据社区实测,8GB 显存即可本地运行,ComfyUI 整合包已由社区开发者 T8star-Aix 制作发布,降低了部署门槛。
获取方式
- 代码仓库:https://github.com/index-tts/index-tts
- 模型权重:HuggingFace(IndexTeam/IndexTTS-2.5)和 ModelScope 均已上线
- 技术论文:https://arxiv.org/abs/2601.03888
基于 GitHub 官方仓库及社区教程整理。