NVIDIA NemotronLabs VoiceChat 11B-1
Engineering & Research

NVIDIA NemotronLabs VoiceChat 11B:NVIDIA 未作宣布即发布的全双工语音模型

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

同一个 Hugging Face 仓库中放着两张模型卡,但它们的说法相互矛盾。页面上显示的那张卡称该模型为 NVIDIA NemotronLabs VoiceChat 11B,给出的发布日期是 2026 年 8 月 3 日,参数量为 11B。第二张卡是一个名为 overview.md 的文件,除非打开“文件”选项卡,否则没人会看到它;这张卡称同一模型为 12B,发布日期为 7 月 16 日,还带有公开卡没有的基准测试部分,并且在结果描述应出现的位置仍然留着 TODO 一词。这两张卡都没有附带 NVIDIA 的发布博文、新闻稿、技术报告或推文。

然而,里面的东西并非占位符。它是一个44 GB的检查点,能够同时聆听和说话:一个单一的堆栈,接收麦克风音频并输出合成语音,无需通常的“语音识别→语言模型→文本转语音”中继流程。它基于Nemotron Nano 9B v2骨干构建,可以在持续说话的同时在句子中间调用工具,NVIDIA声称这是首个能够做到这一点的开放全双工模型。

以下所有内容均直接来自该仓库——这两张卡片、config.json以及权重文件中的张量索引,我们自行解析了该索引以解决 11B 与 12B 之争。NVIDIA 为这一模型发布的每个性能数字都是 NVIDIA 自己的,由 NVIDIA 测量,且未被复现。公开范围内,这个系列仅有一项独立测量,来自 Artificial Analysis,而它是以不同的名称和不同的参数数量归档的——结果这成了这次发布中最有意思的地方。

仓库里实际有什么?

该仓库创建于2026年7月29日,最后修改于8月4日。它包含十七个文件:两个相互竞争的模型卡、一份许可证、一个config.json、一个44.4 GB的model.safetensors、一张架构图、一个RNN-T分词器目录、四份关于偏见、安全、隐私和可解释性的简短政策说明,以及三个.wav文件——一个轮流发言演示、一个语音打断演示和一个工具调用演示——以音频播放器的形式嵌入在模型卡顶部,让你在阅读之前就能听到模型的声音。

有几样东西缺失了,而它们比文件列表更重要。

这个模型没有论文。模型卡引用了五项:VoiceBench、Full-Duplex-Bench 1.0、Full-Duplex-Bench v3、SALM-Duplex、Audio Flamingo 3,外加 NVIDIA 自己的 PersonaPlex 预印本。它们中没有一个是 NemotronLabs VoiceChat 的技术报告。架构仅在大约三段文字和一张示意图中进行了描述,而这便是关于其构建方式的全部公开说明。

没有办法调用它。Hugging Face 页面明确写道,该模型“未被任何推理提供方部署”。没有托管端点,无论是 NVIDIA 还是其他任何人都没有。仓库里唯一的社区讨论帖,是一位用户请求 NVIDIA 添加一个 handler.py,以便该检查点可以部署到 Hugging Face Inference Endpoints——有人尝试用简单方式运行,却发现并不存在这样的端点。

没有 pipeline_tag,也没有 library_name。这就是为什么该页面没有推理组件(inference widget)和任务标签,同时也是更深层次问题的一个征兆:config.json不是 Transformers 配置文件。它是一个 32 KB 的 NeMo 训练配置,包含了 AdamW 块、学习率调度、dataloader 分箱和验证集划分。你不能将 AutoModel.from_pretrained 指向这个配置。你需要克隆 NVIDIA 的 Speech 仓库的特定分支 — nemotron-labs-voicechat — 构建一个版本锁定为 Python 3.12、PyTorch 2.10 和 Transformers 4.56 的 conda 环境,编译 causal-conv1dmamba-ssm (不启用构建隔离),然后运行他们的脚本。

下载计数器反映了这一切。该模型发布首月,107个赞对比80次下载,正是那种人们将其加入书签却从未运行的发布的特征。

NVIDIA NemotronLabs VoiceChat 11B-2

我们数了参数,11B赢了。

safetensors 文件带有 JSON 头部,列出每个张量、其形状及 dtype,因此参数量不是主观问题。我们提取头部并相加:在 1,626 个 float32 张量中共有 110.95 亿参数,占用 44.38 GB。所以渲染的卡片是正确的,而overview.md已经过时——这是一个 11B 模型,12B 这个数字是遗留产物。

Hugging Face 的模型树解释了 12B 是如何混入的。它绘制的血统依次是 Nemotron Nano 12B v2 Base,接着是 Nemotron Nano 12B v2,然后是 Nemotron Nano 9B v2,最后才是这个模型。NVIDIA 自己的文本骨干家族同时包含 12B 和 9B,其中 9B 是 12B 剪枝后的后代,而 VoiceChat 基于 9B 构建。如果卡片是在该链条更早阶段起草的,自然会带有更大的数字。

头部也沿着架构的两半清晰地分割:

理解侧——10.098B。其中,7.714B 是 Nemotron Nano v2 Transformer 堆栈,0.609B 是语音编码器,三个独立的 131,072 × 4,480 矩阵各占 0.587B。

语音侧 — 0.997B。一个28层、宽度为1,152的文本到语音骨干网络,参数量为0.595B;一个0.159B的高斯混合模型输出头;以及一个神经音频编解码器,其编码器和解码器各为0.092B。

dtype 带来了两个实际影响。首先,44 GB 的下载量并不意味着这是一个大模型,而只是一个以 float32 格式发布的普通模型;将其转换为 bfloat16 后,权重大约为 22 GB。其次,NVIDIA 提出的 80 GB GPU 下限是该选择的结果,而非模型本身的大小所致。任何拥有 48 GB 显卡且愿意自行转换检查点的人,并不会被明确排除在外——尽管目前还没有人在该占用规模下发布过经过确认的运行结果,所以请将其视为算术推算,而非承诺。

它如何同时聆听和说话

"全双工"正是这个版本的主旨,配置展示了它是如何实现的。三个设计选择起到了关键作用。

语音编码器无法前瞻。它是一个24层、8头Conformer,其注意力上下文设置为[70, 0]——七十帧左上下文和帧右上下文。传统识别器会查看当前时刻之后的音频,以消除刚听到内容的歧义;而本识别器禁止这样做,这会损失准确性,但换来的是能够在帧到达的瞬间输出决策。

所有内容都被量化为 80 毫秒。配置中的帧长度为 0.08 秒,与 NVIDIA 在其他地方为这一研究方向提到的 80 毫秒块大小一致。模型每 80 毫秒决定一次是继续聆听还是开始说话。正是这种节奏让插话显得即时,而非礼貌地等待。

工具调用是从它们自己的嘴里说出来的。还记得那三个形状相同、词表大小为131,072的矩阵吗?一个是输入嵌入,一个是普通的语言模型头——而第三个名为function_head。卡片文案中提到的“用于工具调用脚本的独立输出通道”,就是一个字面意义上的第三输出投影,宽度达5.87亿参数,与语音生成并行运行。这就是该模型无需中断对话即可调度工具调用的架构原因;这是一种真正的设计承诺,而非提示词约定。

下游,文本转语音解码器预测残差矢量量化编解码器的编码,该编解码器有31个量化器,下采样率分别为7、7和9——即441倍压缩,使音频token速率达到每秒50帧,以22.05kHz输出。输入为16kHz。检查点中还包含RNN-T解码器和联合网络,这就是为什么模型声明的输出包括对用户的转录以及其自身的文本和音频:该转录是一个真正的识别头,而非副产品。默认音色名为Aria,一个三秒的参考片段对说话人进行条件约束。

配置中还有一个值得指出的细节,因为它印证了一个已陈述的限制:训练数据加载器将话语长度上限设为142.39秒。模型卡警告称该模型仅能容纳不超过两分钟的音频上下文,这一限制在生成该模型的数据管线中清晰可见。

分数,以及实际测量它们的人

NVIDIA的核心宣传点是延迟和排名。在Full-Duplex-Bench 1.0上,它报告了448毫秒的顺畅轮流发言时间,以及被打断时480毫秒的让位时间,顺畅轮流发言的接管率为0.82,用户打断时为1.0,GPT-4o评判员对打断处理的评分为4.33。它声称在VoiceBench上排名开源全双工模型第二,在Full-Duplex-Bench上排名开源模型第二。所有这些都是NVIDIA自行运行的结果。

将它们与外部世界对齐,两个缺口便显现出来。

在语音推理方面,供应商的分数大约高出八个百分点。未渲染的overview.md报告了Big Bench Audio上37.0%的结果。Artificial Analysis独立测量了这一系列的29.2%。相同的基准,相同的系列,这一差距足以改变模型在排行榜上的位置。

在VoiceBench上,厂商给出的数字过于保守。该模型卡声称在开源全双工模型中排名第二;公开的VoiceBench排行榜上,该模型的成绩为58.10,这是最高的开源全双工类别成绩,领先于Freeze-Omni的55.20和Moshi的29.51。NVIDIA自己的草稿模型卡报告其自身为55.1——低于排行榜目前列出的数字。

还有一个较小的奇怪之处:NVIDIA自己的对比表对其竞争对手的评分比Artificial Analysis更为慷慨。这份初版卡将Freeze-Omni在Big Bench Audio上的得分定为33.4%,PersonaPlex 7B为19.1%;而Artificial Analysis测得的分数则是33.9%和12.6%。无论采用哪种数据,同行的排名都保持不变,这令人安心,但也提醒人们,供应商的测试框架与独立测试框架即使对第三方也不会返回相同的数字。

NVIDIA NemotronLabs VoiceChat 11B-3

这张图表让实事求是的标题无可回避。在开源全双工模型中,这是一个真正的进步——它在口语推理方面的表现是 PersonaPlex 的两倍多,让 Moshi 完全处于另一个档次。但与市售产品相比,它还差得远:Step-Audio R1.1 达到 96%,Grok 4.5 的 Voice Agent 和 Gemini 2.5 Flash (Thinking) 达到 92%,Nova 2.0 Sonic 达到 87%。在口语输入的推理上,差距大约是三比一。

了解全双工目前代价的最清晰方式是查看NVIDIA自己的产品目录。在VoiceBench上,NVIDIA Nemotron 3 Nano Omni 30B A3B——一个更大但不支持全双工的模型——得分89.39,而VoiceChat为58.10。大约三十分的助手质量差距,就是打断处理和低于500毫秒轮转所付出的代价,至少在这一代产品中如此。如果你的产品不需要一个在说话中途能被中断的模型,那你就是在为一个用不上的功能付出高昂代价。

工具调用是亮点,也是最薄弱的部分。

“首个支持工具调用的开源全双工模型”是这次发布所依赖的宣传点,而其背后的数据却参差不齐。在 BFCL-v3 的语音版本上,NVIDIA 报告的平均值为 56.1%:简单场景 58.5%,多场景 62.5%,并行 42.5%,并行多场景 27.5%,以及正确拒绝无关调用 89.6%。而在 Full-Duplex-Bench v3 上,差距则更加悬殊。

工具选择 — 82.5%。从列表中选择正确的函数,NVIDIA 公允地称其可与前沿模型竞争。

参数准确性 — 44.2%。根据用户的表述正确填充该函数的参数。

Pass@1 — 33%.首次尝试就正确完成了整个调用。

一个模型知道该用哪个工具的把握比它填写工具参数的把握高出三分之二——这样的模型会自信地查询错误城市的天气。在文本代理中,你可以通过验证层和重试来捕捉这个问题;而在实时语音通话中,重试是能听到的,卡片上注明模型根本不应重试失败的调用——它被指示告知用户API有问题。

其周边的运行约束相当严格,英伟达在列举这些限制时毫不掩饰:每个会话最多使用五个工具,超出后质量便会下降;无法可靠地同时调用多个工具;用户无法在工具执行期间进行中断;而且在混合对话中,系统倾向于依据自身知识作答,而非调用本应使用的工具。冗长的工具响应会让智能体陷入停滞——这正是“保持消息”功能存在的意义所在,它就是为了掩饰这一缺憾:你可以预先编写一段话,让智能体在调用触发的那一刻说出来,这样沉默中便有了内容。

有一个奇怪的问题,会让人耗费一个下午:系统提示和工具响应必须仅使用ASCII。不能有长破折号、弯引号、度数符号或表情符号。工具输出在到达模型之前,必须被扁平化为适合语音的纯ASCII句子,这意味着JSON API响应不能原样传递。

运行它的成本,以及阻止你使用的许可

首先从硬件开始。NVIDIA 的分支文档要求 GPU 至少拥有 80 GB 显存,这指向 H100 或 H200,而经过测试的配置是搭载 vLLM 的 H100。在常见的 GPU 云平台上,按需 H100 实例的价格大约为每小时 2 到 3 美元,因此一个持续运行的实例每月成本约在 1,500 到 2,200 美元之间——而这时你还没有编写任何应用代码、雇人维护它,或者服务第二个并发对话。

现在来看比较结果。Artificial Analysis 将托管式语音到语音(speech-to-speech)的定价标准化为每小时输入音频的成本,目前的价格范围从低端的约 1.42 美元/小时到最昂贵的高级档位的 10.75 美元/小时,而像 Grok Voice Think Fast 2.0 这样备受好评的中端选项则为 4.80 美元/小时——也就是每分钟音频 0.08 美元。

NVIDIA NemotronLabs VoiceChat 11B-4

把这两段放在一起读,自托管的理由比表面看起来更站不住脚。专用的 H100 只有在真正保持充分占用时,才比中等价位的托管端点更便宜;而无论利用率如何,它几乎都比托管市场的低价端更贵——同时你还要承担工程维护、on-call 值班,以及一个得分仅 29.2% 的模型,而托管选项的得分是 87–96%。

然后还有那道墙。许可证是 OpenMDW License Agreement v1.1,而模型卡片在自己的引用块中声明,该模型“仅可用于研究目的”。GitHub 分支上的代码采用 Apache-2.0 许可;权重则不是。你可以下载它、研究它、微调它、评测它,并撰写相关文章。你不能把它放到客户面前。因此,对于一家试图推出语音产品的公司来说,上述所有经济论证都只是纸上谈兵——问题从来就不在于 GPU 算力是否可行。

这也是为什么我们会把显而易见的事直说出来:NemotronLabs VoiceChat 11B 无法通过 OrcaRouter 调用,因为它根本无法通过任何东西调用。一个密钥真正带给你的,是它应当被用来衡量的基准线——托管的语音和音频模型位于单一 API 之后,加价率为 0%,也就是说我们直接把提供商的标价原样传递;所以当供应商下调语音费率时,你当天付的就是那个更低的数字,而不是等一个合同周期之后。如果你正在为语音代理定价,那么那个每分钟的价格就是一块 80 GB GPU 必须击败的数字,在投入机架之前,精确了解这一点是值得的。

名称问题:11B、12B、NemotronLabs、Nemotron 3

这正是大多数早期报道出错的地方,所以值得仔细分辨什么是已经确定的,什么尚未确定。

NVIDIA 自身的四个平台以三种不同标签来描述这项工作。Hugging Face 以开放权重和仅限研究许可发布了“NVIDIA NemotronLabs VoiceChat 11B”。NVIDIA 开发者博客在 2026 年 3 月将“Nemotron 3 VoiceChat”描述为一款 12B 参数的全双工模型,处于早期访问阶段,目标是低于 300 毫秒的端到端延迟(基于 80 毫秒分块),早期访问计划提供参考容器、基准测试结果和微调路径,并承诺“开放、可检查的权重用于企业部署”。公开的 VoiceBench 排行榜和 Artificial Analysis 都将它们的条目列为“Nemotron 3 VoiceChat (V1)”,12B。

可知的是:架构描述逐组件匹配——Fast Conformer 编码器、Nemotron Nano v2 9B 主干、NVIDIA 文本转语音解码器、独立的工具调用通道、80 毫秒帧、统一堆栈。Hugging Face 仓库中未渲染的卡片使用了与其他界面相同的 12B 数字。这是同一系列的工作,第三方条目几乎肯定是在衡量这一家族。

什么是尚未确认的:你今天可以下载的检查点是否与 Artificial Analysis 和 VoiceBench 所评估的版本逐位一致,或者与早期访问计划发放的版本一致。有两个细节不支持这种假设。参数量不同:实测为 11.095B,而备案为 12B。延迟目标也差异悬殊——博客面向企业的宣传是端到端低于 300 毫秒,而随发布附带的模型卡显示 Full-Duplex-Bench 的结果为 448 毫秒和 480 毫秒。这些可能只是同一模型上的不同测量点,也可能是不同的模型。NVIDIA 没有说明,因为 NVIDIA 对这次发布根本只字未提。

实际结果是:如果你要引用这个模型的某个数字,请注明它来自哪个界面。那些将 Artificial Analysis 的29.2%归因于 Hugging Face 模型卡,或将 NVIDIA 的37.0%归因于独立测试的报道,实际上把 NVIDIA 自己分别保存在不同文档(参数数量不同)中的两件事混为一谈了。

它在哪里断裂

草稿卡的限制部分异常坦诚,而 GitHub 分支还增加了更多。收集:

仅英文,且仓库中没有多语言路线图。

两分钟记忆。 超过两分钟音频窗口的对话可能不会被保留——对于客服电话或任何需要记住四分钟前所达成一致内容的情形来说,这是一个硬性上限。

比自己的骨干模型还要笨。NVIDIA 表示,它在知识、指令遵循和安全性方面可能不如 Nemotron Nano 9B v2,因为它针对对话自然度进行了调优。它没有专门针对推理或对齐进行训练;多步推理和算术被指出是弱项。

没有可靠的反馈信号。表示人类仍在倾听的“mm-hm”没有得到系统处理。

它会在你话说到一半时打断你。分支说明将在用户一句话说到一半停顿时打断用户,以及“失控延续/自言自语”列为已知故障模式——零右上下文编码器的直接代价。

仅限安静房间。明确不适合嘈杂或混响环境,尤其是存在背景人声的场所。这排除了大多数呼叫中心工作区和大多数汽车。

谁真正应该下载这个?

从事双向语音建模的研究人员在这里收获最大,应当转向:一个带有可用工具调用通道的11B开放检查点,基于约55万小时混合真实与合成音频训练而成,远比从SALM-Duplex论文重新实现要好得多。研究许可证并不会对该工作构成限制。

构建语音代理的团队应该阅读模型卡,而不必下载模型。你从那个 44 GB、根本无法部署的 float32 检查点里学到的任何东西,都不会改变你的架构;这些基准测试给出的诚实结论是:在最受用户关注的方面——即助手是否听懂了用户——端到端全双工方案还无法与优秀的托管模型相匹敌。眼下明智的做法是围绕托管端点进行构建,并让切换成本保持在低位——一个密钥覆盖 200 多个模型并支持自动故障转移,意味着即使某个供应商出现故障,你的电话线路也不会在通话中途中断;同时,将来迁移到开源的全双工模型也只是一次配置变更,而不是重写。

特别关注此点的企业应申请 Nemotron 3 VoiceChat 的早期访问,而不是基于 Hugging Face 权重进行构建。可部署许可、参考容器以及亚 300 毫秒的声明都包含在该计划中。公共检查点是同一想法的研究预览,发布时未附带允许您使用它的相关文书。

这个仓库会不断收到的三个问题

如果我对其进行了大量微调,可以将其商用吗?不行。OpenMDW v1.1 以及模型卡上“仅限研究用途”的声明适用于权重及其任何衍生内容;GitHub 分支上的 Apache-2.0 许可证涵盖的是推理代码,而非检查点。微调并不能洗白许可证。如果你需要的是商业使用权,早期访问计划就是 NVIDIA 为此实际设立的途径。

这与排行榜上的是同一个模型吗?几乎可以肯定属于同一系列;但完全相同的制品则未经确认。排行榜和Artificial Analysis的条目均以12B的"Nemotron 3 VoiceChat (V1)"归档,而可下载的检查点实测为11.095B,NVIDIA尚未发布任何调和两者的说明。请将排行榜数据视为了解该系列的最佳独立参考,而非对Hugging Face上文件的已验证测量结果。

它能运行在比80 GB卡更小的设备上吗?有可能,但需要额外工作,而且还没有人公布过相关证明。权重是float32格式,因此转换为bfloat16应该能将约44 GB的参数降到约22 GB,这样在48 GB的卡上,在考虑KV缓存、编解码器和流式缓冲区之前,还有不少余量。但受支持的路径是vLLM在80 GB的H100上运行,部署容器就是为此构建的,NVIDIA报告的唯一经过测试的配置也是这个。要预留时间预算,而不仅仅是显存。

看什么

三件事都会改变对这次发布的看法。一份技术报告,甚至一张不再自相矛盾的规格卡,都能告诉我们11B检查点是否是排行榜所评测的那个工件。一次独立的延迟复现——由NVIDIA以外的人在自有硬件上确认448毫秒的轮流对话延迟——将把这次发布最吸引人的说法从营销变成事实。而一份商业许可证,或由任何人提供的托管端点,则会把它从一种近似论文的新奇之物,转变为众多团队真正可选的方案——这些团队很乐意用一些推理质量来换取一个可以被随时打断的语音代理。

在这些真正落地之前,准确的描述虽范围有限,但确实值得关注:NVIDIA 发布了迄今已测得的最强开放全双工语音检查点,赋予其该类别中首个可用的工具调用通道,但其许可条款使任何人都无法将其发布,且 NVIDIA 对这一切只字未提。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube