NVIDIA 开源全双工语音模型 VoiceChat 11B:一个模型替代 ASR+LLM+TTS 三件套,448ms 对话延迟还支持工具调用
NVIDIA 发布了 NemotronLabs VoiceChat 11B,一个端到端的全双工语音对话模型。它把语音识别、语言理解和语音合成塞进一个 11B 参数的网络里,对话轮转延迟仅 448 毫秒,还是首个支持实时工具调用的开源全双工语音模型。
一个模型干三件事
传统的语音助手架构是"三件套":先 ASR(语音转文字),再 LLM(理解+生成文字),最后 TTS(文字转语音)。三个模型串联,延迟叠加,中间还要做 API 交接和状态同步。
VoiceChat 11B 的思路完全不同——它用一个 11B 参数的混合 Mamba/Transformer 网络同时完成语音理解、文本推理和语音生成。输入 16kHz 音频流,输出 22.05kHz 语音流,中间不需要任何文字中转。实测平滑轮转延迟 448 毫秒,用户打断时 480 毫秒内让出话轮(take-over rate 1.00)。
全双工:边听边说,随时打断
全双工是 VoiceChat 最核心的能力。模型在说话的同时持续监听用户输入,用户可以随时插话(barge-in),模型会立刻停止输出、让出话轮。这在实际对话中非常关键——谁都不想跟一个"说完才听"的机器人聊天。
在 Full-Duplex-Bench 1.0 基准上,VoiceChat 的平滑轮转 TOR(take-over rate)为 0.82,用户打断 TOR 为 1.00。它在开源全双工模型中排名 VoiceBench #2、Full-Duplex-Bench #2。
首个支持工具调用的开源全双工模型
这是 VoiceChat 最独特的卖点。模型有一个独立的输出通道专门处理工具调用:当对话中需要查天气、查订单、调 API 时,模型在侧通道输出 <TOOLCALL> 脚本,你的代码返回 <TOOL_RESPONSE> 结果。
更巧妙的是"on-hold"机制:运维人员可以为每个工具预设一段话术,模型在等待 API 返回时自动说这段话,避免冷场。比如查天气时说"让我帮您看看今天的天气情况"。
不过限制也很明确:每会话建议最多 5 个工具,不能同时调多个工具,用户不能在工具执行期间打断,系统提示和工具响应必须 ASCII-only 且对 TTS 友好。在 BFCL-v3 口语工具调用基准上,平均准确率 56.1%——能用,但还远不完美。
架构:三大组件拼装
VoiceChat 的架构由三个已有的 NVIDIA 组件加一个新输出路径组成:
- 语音编码器:来自 Nemotron-Speech-Streaming-En-0.6b 的 Fast Conformer,持续编码 16kHz 音频流
- LLM 骨干:NVIDIA Nemotron Nano v2(9B),消费音频 token、预测文本 token
- TTS 解码器:NVIDIA 自研 TTS 解码器 + codec,预测音频码、渲染 22.05kHz 语音
- 工具调用通道:独立的
<TOOLCALL>输出路径
训练使用了约 55 万小时的真实和合成音频数据,基于 SALM-Duplex 和 Audio Flamingo 3 的研究工作。
谁能用?限制不少
硬件门槛:至少需要一块 80GB 显存的 GPU——A100、H100、RTX 6000 Pro 或 B200,且仅支持 x86_64 Linux。没有托管 API,没有推理服务商托管,你得自己跑。
成熟度:NVIDIA 明确标注"仅限研究用途"。已知问题包括:2 分钟音频上下文上限、多轮对话后可能退化成不可恢复的乱语、话轮结束后可能自言自语、用户转录丢词。
适用场景:呼叫中心和客服平台、车载助手、零售点餐、电信 IVR 升级、游戏 NPC 对话、无障碍工具。适合做技术验证和试点,暂不适合生产部署。
开源信息
- 权重许可:OpenMDW-1.1(宽松许可)
- HuggingFace 模型卡:nvidia/NVIDIA-NemotronLabs-VoiceChat-11B
- GitHub:NVIDIA-NeMo/Speech(nemotron-labs-voicechat 分支)
- NGC 容器:nemotron-labs-voicechat
---
*基于 MarkTechPost 报道及 HuggingFace 模型卡整理,发布日期 2026 年 8 月 9 日。*