Google 发布 Gemini 3.8 Flash TTS:一句话设计新声音,30 秒克隆真人,登顶 Hume 语音基准
2026年9月24日3 次阅读
Google 发布 Gemini 3.8 Flash TTS:一句话设计新声音,30 秒克隆真人,登顶 Hume 语音基准
9 月 23 日,Google 一口气发布了两个新的文字转语音(TTS)模型:Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS。官方称这是 Gemini 音频家族"表现力最强"的两款模型,当天就同步上线了 Gemini API 和 Google AI Studio。
简单说:以前的 TTS 大多是"从固定音色表里挑一个",这次 Google 的思路变了——用自然语言描述一个角色,直接生成全新的声音。
一句话设计一个声音
你可以用文字告诉模型"我需要一个会喷火的西方恶龙,声音低沉、带着苏格兰口音",它就会生成一个专属声音。官方把这个能力叫"生成式声音设计",覆盖 100 多种语言和方言。
同时,可用的现成声音库也从原来的 30 个扩到了 2000 多个,包括墨西哥西语、魁北克法语、苏格兰英语等地区性变体。设计好的声音可以保存成固定 ID,在多个项目里反复用,表现稳定。
30 秒克隆,但要先征得同意
克隆方面,只需要一段 30 秒的音频样本就能重建一个比较稳定的声音画像。Google 强调这里内置了三道保险:
- 克隆前要做口头同意验证(被克隆的人要出声确认)
- 生成音频全部带 SynthID 水印
- 附带 C2PA 凭证,方便追溯来源
对内容平台和有声书出版方来说,这套"水印 + 来源凭证"的组合是目前主流厂商里比较完整的。
能"导演"每一句话
两个模型都支持逐行控制表演方式:你可以自己写舞台指示(比如"这里压低声音、放慢节奏"),也可以让模型根据剧本自己把握。几个具体能力:
- 双人对白:一个脚本里两个角色,模型自动分配两个声音,还能处理自然的轮流接话
- 非语言提示:脚本里可以写
<laughs>、<sigh>、<gasp>这类表情和呼吸声,也能写"mhm""yeah"这类附和 - 长文生成:官方称连续生成数小时的声音时,音色、节奏、口齿能保持稳定,漂移很少——这是播客和有声书的刚需
基准成绩和价格
Google 在 Hume 的声音设计基准上拿到 71.4 分,排名第一(基于官方公告和多家媒体转述整理)。
价格方面(Google 官方 API 定价):
- Flash TTS:输入 $0.50/百万文本 token,输出 $9/百万音频 token
- Flash-Lite TTS:输入 $0.50/百万,输出 $6/百万
- 两款都有免费额度;付费层用批量模式(batch)打五折
- 注意:2027 年 1 月 1 日起价格会调整(Flash TTS 输出涨到 $18/百万,Lite 涨到 $12/百万)
对谁有用
- 游戏 / 有声书 / 播创作者:不用请配音演员也能给 NPC 和角色配出风格鲜明的声音
- 企业:批量配音、多语言本地化、语音 Agent 的成本可以压得更低
- 开发者:API 已开放,声音 ID 持久可用,方便在应用里搭"角色声音"系统
一点提醒:声音混音(在现有声音上微调音高、节奏、口音)的功能 Google 标注的是"即将上线",还没开放;克隆功能对样本质量和授权要求较高,商用前记得确认素材的版权。