NVIDIA NemotronLabs VoiceChat 11B:第一个敢开源的全双工语音 Agent 底座
NVIDIA 8 月 9 日通过 Hugging Face 把 NemotronLabs VoiceChat 11B 摆到了桌面上。它的目标用户不是终端消费者——这是给做语音 Agent 的人准备的底座。在全双工这条线上,市面上的开源方案一直在「能听不能说」、「能说不能听」、「能说也能听但不能调工具」三个选项里打转。VoiceChat 11B 把第三个洞补上了:它能在对话里调用外部工具、用旁路 channel 把 <TOOLCALL> 块丢出去、同时让 agent 在工具等结果的那几秒里说一段「保持话术」,对话不会冷场。
它是怎么把延迟压到 448 毫秒的?把以前级联堆栈的 ASR、LLM、TTS 三件全砍掉,换成一张统一网络:Fast Conformer 编码器(来自 Nemotron-Speech-Streaming-En-0.6b,连续编码 16 kHz 音频流)+ Nemotron Nano v2 9B LLM 主干(消费音频 token、预测文本 token)+ NVIDIA 自家 TTS 解码器与 codec(输出 22.05 kHz 音频)。中间再也没有 token 转换和 API 握手,端到端测出来的 smooth turn-taking 延迟是 448 ms。
工程上的几件细节得拆开看:
第一个支持工具调用的开源全双工模型——以前的开源方案都在工具调用这一关上交了白卷。VoiceChat 11B 的做法是开一条独立的输出 channel,工具调用脚本以 <TOOLCALL>[{"name":..., "arguments":...}]</TOOLCALL> 的格式输出,业务代码用 <TOOL_RESPONSE>[...]</TOOL_RESPONSE> 把结果送回去。关键设计是「on-hold 话术」:每个工具可以预置一段在调用瞬间说的话,避免 API 跑 2 秒的时候用户以为对方挂了。这条思路让对话能「假装自然地」等异步结果——是把对话系统的可用性真正往前推了一步。
架构组合件——4 件拼起来:Fast Conformer 编码器 + Nemotron Nano v2 主干 + TTS 解码器 + 一条独立的工具调用输出通道。训练数据大约 55 万小时音频(含真实 + 合成),往上叠 SALM-Duplex 和 Audio Flamingo 3 的研究成果。
性能基准——Full-Duplex-Bench 1.0 上 smooth turn-taking TOR 0.82 / 448 ms、user-interruption TOR 1.00 / 480 ms;pause-handling TOR(越低越好)synthetic 0.153 / Candor 0.255。AU Harness BFCL-v3 语音版:simple 58.5%、multiple 62.5%、parallel 42.5%、parallel-multiple 27.5%、irrelevance 89.6%,平均 56.1%。Full-Duplex-Bench v3 工具调用:tool selection 82.5%、argument accuracy 44.2%、pass@1 33%。NVIDIA 自报在 VoiceBench 上是开源全双工模型第 2 名、Full-Duplex-Bench 1.0 开源第 2 名。
部署门槛与限制——这才是真正值得拎出来讲的几个边界:
- 协议是 OpenMDW-1.1,官方声明「仅可用于研究目的」,商用授权另议。NVIDIA 自己没上线托管 API,NGC 给了容器、HF 给了权重,到此为止。
- 单卡 80 GB 显存(A100 / H100 / H200 / B100 / B200 / RTX-6000),x86_64 Linux,vLLM 运行时——意味着没有 GPU 资源的团队今天还摸不到。
- 上下文上限 2 分钟音频;几轮之后会退化成不可恢复的乱码;turn 结束后偶尔出现 runaway self-talk;用户语音转写偶有丢词。
- 工具调用有硬上限:每个会话最多 5 个工具;不可并行调用多个;工具执行期间用户无法打断(这是为了保证
<TOOLCALL>/<TOOL_RESPONSE>的因果闭合)。 - 系统提示和工具响应必须 ASCII-only 且 TTS 友好——意思是开发这套东西的人要写一份不出现 emoji、不出现全角符号、不出现 Unicode 引号的 prompt。这条对中文场景是个明显短板:VoiceChat 11B 的 Fast Conformer 是英文流,训练集以英语为主。
三个判断要先放下来。
第一,这是一份「底座模型」而不是「产品」。448 ms 延迟、80 GB 单卡、研究用途许可——它今天不是给消费者用的,是给那些正在堆语音 Agent 的工程团队做对照与基线的。它把开源全双工这条线从「能演示」推进到「能跑 eval」,对 Moshi、Audio Flamingo 3、SALM-Duplex 这类竞品的研究者是直接刺激。
第二,on-hold 话术是一个被低估的设计点。传统级联堆栈在工具调用时只能「卡住等结果」,对话体验是断的。VoiceChat 11B 把这条对话空白用一段预设话术填上——它承认了一个事实:语音 Agent 的可用性瓶颈不是延迟本身,是「用户以为对方挂了」的瞬间。这条思路跟 Cosmos 3 把「动作 token」作 first-class 公民(8-08 topicId 178603066)、SeedRealtime 把「何时开口」收进模型内部(8-06 topicId 178597113)是同一种 Agent 时代语音 / 多模态的范式转移——延迟之外,Agent 还需要一套「对话中行为」的明确规则。
第三,2026 H2 全双工赛道的形态越来越清晰。开源侧 NVIDIA 用 NemotronLabs 把工具调用这条线补齐;商业侧 GPT-4o Realtime、Gemini Live、Realtime API 在推托管版本。开源底座的工具调用 + 商用托管的可靠交付会并行存在。对国内团队来说,这条路的两个可移植痛点已经被 NVIDIA 摆到桌面上——一是 OpenMDW 商用许可的边界,二是 ASCII-only 系统提示对中文交互的限制。
它适合谁:能拿 80 GB GPU 做研发的语音 AI 团队(车载语音、客服 CX、游戏 NPC、零售 kiosk、辅助功能);不适合谁:需要立刻上生产的消费者产品、需要中文深度支持的业务、需要现成托管 API 的快速集成方。
事件源:
- 官方模型卡(Hugging Face):https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B
- 官方代码仓库(NeMo Speech 分支):https://github.com/NVIDIA-NeMo/Speech/tree/nemotron-labs-voicechat
- 官方 NGC 容器:https://catalog.ngc.nvidia.com/orgs/nim/nvidia/containers/nemotron-labs-voicechat
- OpenMDW 1.1 许可:https://github.com/OpenMDW/OpenMDW/blob/main/1.1/LICENSE.OpenMDW-1.1
- MarkTechPost 详细技术解读:https://www.marktechpost.com/2026/08/09/nvidia-releases-nemotronlabs-voicechat-11b-an-open-full-duplex-speech-to-speech-model-with-450-ms-turn-taking-and-live-tool-calling
- Full-Duplex-Bench 1.0 论文:https://arxiv.org/abs/2503.04721
- AU Harness BFCL-v3:https://github.com/ServiceNow/AU-Harness
- VoiceBench 论文:https://arxiv.org/abs/2410.17196
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。