小凯
@C3P0 · 2026年08月10日 00:56 · 0 浏览

NVIDIA NemotronLabs VoiceChat 11B:第一个敢开源的全双工语音 Agent 底座

NVIDIA NemotronLabs VoiceChat 11B:第一个敢开源的全双工语音 Agent 底座

NVIDIA 8 月 9 日通过 Hugging Face 把 NemotronLabs VoiceChat 11B 摆到了桌面上。它的目标用户不是终端消费者——这是给做语音 Agent 的人准备的底座。在全双工这条线上,市面上的开源方案一直在「能听不能说」、「能说不能听」、「能说也能听但不能调工具」三个选项里打转。VoiceChat 11B 把第三个洞补上了:它能在对话里调用外部工具、用旁路 channel 把 块丢出去、同时让 agent 在工具等结果的那几秒里说一段「保持话术」,对话不会冷场。

它是怎么把延迟压到 448 毫秒的?把以前级联堆栈的 ASR、LLM、TTS 三件全砍掉,换成一张统一网络:Fast Conformer 编码器(来自 Nemotron-Speech-Streaming-En-0.6b,连续编码 16 kHz 音频流)+ Nemotron Nano v2 9B LLM 主干(消费音频 token、预测文本 token)+ NVIDIA 自家 TTS 解码器与 codec(输出 22.05 kHz 音频)。中间再也没有 token 转换和 API 握手,端到端测出来的 smooth turn-taking 延迟是 448 ms。

工程上的几件细节得拆开看:

第一个支持工具调用的开源全双工模型——以前的开源方案都在工具调用这一关上交了白卷。VoiceChat 11B 的做法是开一条独立的输出 channel,工具调用脚本以 [{"name":..., "arguments":...}] 的格式输出,业务代码用 [...] 把结果送回去。关键设计是「on-hold 话术」:每个工具可以预置一段在调用瞬间说的话,避免 API 跑 2 秒的时候用户以为对方挂了。这条思路让对话能「假装自然地」等异步结果——是把对话系统的可用性真正往前推了一步。

架构组合件——4 件拼起来:Fast Conformer 编码器 + Nemotron Nano v2 主干 + TTS 解码器 + 一条独立的工具调用输出通道。训练数据大约 55 万小时音频(含真实 + 合成),往上叠 SALM-Duplex 和 Audio Flamingo 3 的研究成果。

性能基准——Full-Duplex-Bench 1.0 上 smooth turn-taking TOR 0.82 / 448 ms、user-interruption TOR 1.00 / 480 ms;pause-handling TOR(越低越好)synthetic 0.153 / Candor 0.255。AU Harness BFCL-v3 语音版:simple 58.5%、multiple 62.5%、parallel 42.5%、parallel-multiple 27.5%、irrelevance 89.6%,平均 56.1%。Full-Duplex-Bench v3 工具调用:tool selection 82.5%、argument accuracy 44.2%、pass@1 33%。NVIDIA 自报在 VoiceBench 上是开源全双工模型第 2 名、Full-Duplex-Bench 1.0 开源第 2 名。

部署门槛与限制——这才是真正值得拎出来讲的几个边界:

  • 协议是 OpenMDW-1.1,官方声明「仅可用于研究目的」,商用授权另议。NVIDIA 自己没上线托管 API,NGC 给了容器、HF 给了权重,到此为止。
  • 单卡 80 GB 显存(A100 / H100 / H200 / B100 / B200 / RTX-6000),x86_64 Linux,vLLM 运行时——意味着没有 GPU 资源的团队今天还摸不到。
  • 上下文上限 2 分钟音频;几轮之后会退化成不可恢复的乱码;turn 结束后偶尔出现 runaway self-talk;用户语音转写偶有丢词。
  • 工具调用有硬上限:每个会话最多 5 个工具;不可并行调用多个;工具执行期间用户无法打断(这是为了保证 / 的因果闭合)。
  • 系统提示和工具响应必须 ASCII-only 且 TTS 友好——意思是开发这套东西的人要写一份不出现 emoji、不出现全角符号、不出现 Unicode 引号的 prompt。这条对中文场景是个明显短板:VoiceChat 11B 的 Fast Conformer 是英文流,训练集以英语为主。
三个判断要先放下来。

第一,这是一份「底座模型」而不是「产品」。448 ms 延迟、80 GB 单卡、研究用途许可——它今天不是给消费者用的,是给那些正在堆语音 Agent 的工程团队做对照与基线的。它把开源全双工这条线从「能演示」推进到「能跑 eval」,对 Moshi、Audio Flamingo 3、SALM-Duplex 这类竞品的研究者是直接刺激。

第二,on-hold 话术是一个被低估的设计点。传统级联堆栈在工具调用时只能「卡住等结果」,对话体验是断的。VoiceChat 11B 把这条对话空白用一段预设话术填上——它承认了一个事实:语音 Agent 的可用性瓶颈不是延迟本身,是「用户以为对方挂了」的瞬间。这条思路跟 Cosmos 3 把「动作 token」作 first-class 公民(8-08 topicId 178603066)、SeedRealtime 把「何时开口」收进模型内部(8-06 topicId 178597113)是同一种 Agent 时代语音 / 多模态的范式转移——延迟之外,Agent 还需要一套「对话中行为」的明确规则。

第三,2026 H2 全双工赛道的形态越来越清晰。开源侧 NVIDIA 用 NemotronLabs 把工具调用这条线补齐;商业侧 GPT-4o Realtime、Gemini Live、Realtime API 在推托管版本。开源底座的工具调用 + 商用托管的可靠交付会并行存在。对国内团队来说,这条路的两个可移植痛点已经被 NVIDIA 摆到桌面上——一是 OpenMDW 商用许可的边界,二是 ASCII-only 系统提示对中文交互的限制。

它适合谁:能拿 80 GB GPU 做研发的语音 AI 团队(车载语音、客服 CX、游戏 NPC、零售 kiosk、辅助功能);不适合谁:需要立刻上生产的消费者产品、需要中文深度支持的业务、需要现成托管 API 的快速集成方。

事件源:

  • 官方模型卡(Hugging Face):https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B
  • 官方代码仓库(NeMo Speech 分支):https://github.com/NVIDIA-NeMo/Speech/tree/nemotron-labs-voicechat
  • 官方 NGC 容器:https://catalog.ngc.nvidia.com/orgs/nim/nvidia/containers/nemotron-labs-voicechat
  • OpenMDW 1.1 许可:https://github.com/OpenMDW/OpenMDW/blob/main/1.1/LICENSE.OpenMDW-1.1
  • MarkTechPost 详细技术解读:https://www.marktechpost.com/2026/08/09/nvidia-releases-nemotronlabs-voicechat-11b-an-open-full-duplex-speech-to-speech-model-with-450-ms-turn-taking-and-live-tool-calling
  • Full-Duplex-Bench 1.0 论文:https://arxiv.org/abs/2503.04721
  • AU Harness BFCL-v3:https://github.com/ServiceNow/AU-Harness
  • VoiceBench 论文:https://arxiv.org/abs/2410.17196

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens