
NVIDIA NemotronLabs VoiceChat 11B:NVIDIA 未經宣布即出貨的全雙工語音模型
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B2026-08-1552智能68程式
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
同一個 Hugging Face 儲存庫中有兩張模型卡,彼此互相矛盾。頁面上呈現的那張卡將模型稱為 NVIDIA NemotronLabs VoiceChat 11B,其發布日期為 2026 年 8 月 3 日,並列出 11B 參數。第二張卡名為 overview.md,除非開啟 Files 分頁,否則沒有人會看到;它將同一個模型稱為 12B,發布日期為 7 月 16 日,並包含公開卡未提及的基準測試章節,而且仍留有 TODO 這個詞,放在本應是結果描述的位置。這兩張卡都沒有附帶 NVIDIA 的發布文章、新聞稿、技術報告或推文。
不過,裡面的東西並非佔位符。這是一個 44 GB 的檢查點(checkpoint),可同時聆聽與說話:單一技術棧即可接收麥克風音訊並輸出合成語音,無需經過常見的「語音辨識 → 語言模型 → 文字轉語音」中繼流程。它建構在 Nemotron Nano 9B v2 骨幹之上,能在繼續說話的同時於句子中途呼叫工具,而 NVIDIA 宣稱這是首個能做到這點的開放全雙工模型。
以下所有內容都直接從該儲存庫讀取——兩張卡片、config.json以及權重檔案內的張量索引;我們自行解析了這些內容,以釐清 11B 與 12B 之爭。NVIDIA 為此模型發布的每一項效能數據,都是 NVIDIA 自行測量、未經他人複現的結果。此系列在公開領域中僅有一項獨立測量,來自 Artificial Analysis,而且是以不同的名稱和不同的參數數量歸檔——這正是這次發布最引人注目之處。
儲存庫裡實際上有什麼?
該儲存庫建立於2026年7月29日,最後更新於8月4日。它包含十七個檔案:兩張相互競爭的模型卡、一份授權、一個config.json、一個44.4 GB的model.safetensors、一張架構圖、一個RNN-T分詞器目錄、四份關於偏見、安全性、隱私與可解釋性的簡短政策說明,以及三個.wav檔案——一個輪流發言示範、一個插話示範,及一個工具呼叫示範——以音訊播放器的形式嵌入在模型卡頂部,讓你在閱讀模型介紹之前就能先聽到模型的表現。
有幾件事遺漏了,而且它們比檔案清單更重要。
• 此型號沒有對應的論文。該規格卡引用了五項基準:VoiceBench、Full-Duplex-Bench 1.0、Full-Duplex-Bench v3、SALM-Duplex、Audio Flamingo 3,以及 NVIDIA 自家的 PersonaPlex 預印本。其中沒有一項是 NemotronLabs VoiceChat 的技術報告。其架構僅以約三段文字和一張圖表描述,而這就是該模型如何建造的完整公開說明。
• 根本無法呼叫。Hugging Face 頁面明確指出,該模型「並未由任何 Inference Provider 部署。」無論是 NVIDIA 還是其他任何一方,都沒有託管端點。該儲存庫上唯一開放的社群討論串,是用戶要求 NVIDIA 新增一個handler.py,以便檢查點可以部署到 Hugging Face Inference Endpoints — 有人嘗試用簡單的方式執行它,卻發現根本沒有。
• 沒有 pipeline_tag,也沒有 library_name。這就是為什麼頁面上沒有推論小工具和任務標籤,而這是更深層問題的徵兆:config.json 不是 Transformers 設定檔。它是一個 32 KB 的 NeMo 訓練設定,包含了 AdamW 區塊、學習率排程、dataloader bucket bins 以及驗證分割。你不能把 AutoModel.from_pretrained 指向它。你要複製 NVIDIA 的 Speech 儲存庫的特定分支 — nemotron-labs-voicechat — 建立一個鎖定 Python 3.12、PyTorch 2.10 和 Transformers 4.56 的 conda 環境,在沒有建置隔離的情況下編譯 causal-conv1d 和 mamba-ssm,然後執行他們的腳本。
下載計數器反映了這一切。模型發布的第一個月,107 個讚對比 80 次下載,正說明了這是那種人們收藏了卻從未運行過的發布。

我們計算了參數,而 11B 勝出。
safetensors 檔案會帶有 JSON 標頭,列出每個張量、其形狀與 dtype,因此參數數量並非見仁見智。我們取出標頭並加總:共 11,095 百萬個參數,分佈在 1,626 個 float32 張量中,佔用 44.38 GB。所以渲染出的卡片是正確的,而 overview.md 已過時——這是 11B 模型,12B 的數字是殘留的舊資料。
Hugging Face 的模型樹解釋了 12B 為何可能混入其中。它所畫出的譜系依序是 Nemotron Nano 12B v2 Base、再來是 Nemotron Nano 12B v2、接著是 Nemotron Nano 9B v2,最後才是這個模型。NVIDIA 自家的文字骨幹(text backbone)家族同時包含 12B 與 9B,其中 9B 是從 12B 修剪而來的後代,而 VoiceChat 建立在 9B 之上。在該鏈條較早階段起草的模型卡,自然會帶有較大的數字。
標頭也沿著架構的兩半清楚地分割:
• 理解端 — 10.098B。其中,7.714B 是 Nemotron Nano v2 Transformer 堆疊,0.609B 是語音編碼器,三個獨立的 131,072 × 4,480 矩陣各佔 0.587B。
• 說話端 — 0.997B。 一個 28 層、寬度 1,152 的文字轉語音主幹,參數量為 0.595B;一個 0.159B 的高斯混合輸出頭;以及一個神經音頻編解碼器,其編碼器和解碼器各為 0.092B。
從 dtype 可以得出兩個實際後果。首先,44 GB 的下載內容並不是一個大型模型,而是一個以 float32 發佈的普通模型;將其轉換為 bfloat16 後,權重約為 22 GB。其次,NVIDIA 所稱的 80 GB GPU 最低需求是這個選擇的結果,而非模型本身的大小;任何擁有 48 GB 顯示卡且願意自行轉換 checkpoint 的人,並非明顯無法使用——不過目前還沒有人公佈在該記憶體佔用下的確認運行結果,所以請把它視為推算,而非承諾。
它如何同時聆聽和說話
"Full duplex" 是這次發佈的核心重點,而設定檔展示了它的引入方式。三個設計選擇成就了這一切。
• 語音編碼器無法提前預覽。它是一個 24 層、8 頭 Conformer,其注意力上下文設定為[70, 0] — 七十幀左側上下文和零幀右側上下文。傳統的識別器會窺視當前時刻之後的音頻,以消除對剛才所聽內容的歧義;而這個識別器被禁止這樣做,這會犧牲準確性,但換來在幀到達的瞬間輸出決策的能力。
• 一切都量化為 80 毫秒。配置中的幀長度為 0.08 秒,與 NVIDIA 在其他地方針對這類工作所描述的 80 毫秒區塊大小相符。模型每 80 毫秒就會決定要繼續聆聽還是開始說話。這種節奏正是讓插話(barge-in)感覺即時而非禮貌等候的原因。
• 工具呼叫是從自己的嘴裡說出來的。還記得那三個形狀相同、詞彙量為 131,072 的矩陣嗎?一個是輸入嵌入,一個是普通的語言模型輸出頭——而第三個名為 function_head。卡片說明文字中「用於工具呼叫腳本的獨立輸出通道」是字面意義上的第三個輸出投影,寬達 5.87 億個參數,與語音生成並行運作。這就是模型能夠在不中斷對話的情況下分派工具呼叫的架構原因,而且這是實際的設計承諾,而非提示詞慣例。
在下游,文字轉語音解碼器會為一個具有 31 個量化器、降採樣率分別為 7、7 和 9 的殘差向量量化編解碼器預測編碼——這 441 倍的縮減使音訊 token 速率降至每秒 50 幀,並以 22.05 kHz 輸出。輸入為 16 kHz。檢查點中還有一個 RNN-T 解碼器和聯合網路,這就是為什麼模型聲明的輸出包含一份使用者的轉錄,以及其自身的文字和音訊:該轉錄是真正的辨識頭,而不是副產品。預設語音名為 Aria,而一段三秒鐘的參考片段則作為說話者條件。
設定中還有一項細節值得標記,因為它佐證了一項已說明的限制:訓練資料載入器將語句上限設為 142.39 秒。模型卡警告該模型僅能容納不超過兩分鐘的音訊上下文,而這在產生該模型的資料管線中可見。
分數,以及實際測量它們的人
NVIDIA 的頭條宣稱在於延遲與排名。在 Full-Duplex-Bench 1.0 上,它報告順暢輪替接管需 448 毫秒,被打斷時讓位需 480 毫秒;順暢輪替時的接管率為 0.82,使用者打斷時為 1.0;打斷處理的 GPT-4o 評審分數為 4.33。它宣稱在 VoiceBench 的開放全雙工模型中排名第 2,在 Full-Duplex-Bench 的開放模型中排名第 2。這些都是 NVIDIA 自家執行的結果。
將它們與外面的世界排在一起,兩個缺口便會敞開。
• 在語音推理方面,廠商的數據大約高出八個百分點。未渲染的 overview.md 在 Big Bench Audio 上報告為 37.0%。Artificial Analysis 獨立測量此系列的成績為 29.2%。相同的基準,相同的系列,這個差距足以改變模型在排名中的位置。
• 在 VoiceBench 上,廠商的分數過於保守。該規格卡宣稱在開放全雙工模型中排名第二;公開的 VoiceBench 排行榜將此模型列為 58.10,也就是最高分,在開放全雙工類別中,領先 Freeze-Omni 的 55.20 和 Moshi 的 29.51。NVIDIA 自己的草案規格卡報告其分數為 55.1,低於排行榜目前列出的數字。
還有個較小的怪異之處:NVIDIA 自家的比較表對競爭對手的評分比 Artificial Analysis 更慷慨。這份草稿表在 Big Bench Audio 上將 Freeze-Omni 列為 33.4%、PersonaPlex 7B 列為 19.1%;而 Artificial Analysis 測得的數據分別是 33.9% 和 12.6%。無論採用哪組數據,同級產品的排名順序都不變,這令人欣慰,但也提醒我們:供應商自有的測試框架與獨立測試框架,即使對第三方產品,也不會得出相同的數字。

這張圖表讓誠實的標題無可迴避。在開放的雙工模型中,這是一個真正的進步——它在口語推理上的表現是 PersonaPlex 的兩倍以上,並讓 Moshi 完全屬於另一個級別。與市售產品相比,它還差得遠:Step-Audio R1.1 為 96%,Grok 4.5 的 Voice Agent 和 Gemini 2.5 Flash (Thinking) 為 92%,Nova 2.0 Sonic 為 87%。從口語輸入的推理能力來看,差距大約是三比一。
要看清全雙工目前的代價,最直接的方式就是翻閱 NVIDIA 自家的型錄。在 VoiceBench 上,NVIDIA Nemotron 3 Nano Omni 30B A3B——一個較大但不支援全雙工的模型——得分 89.39,而 VoiceChat 為 58.10。大約三十分的助理品質差距,就是中斷處理與低於 500 毫秒的輪流發言所付出的代價,至少在這一代是如此。如果你的產品不需要一個能在字講到一半時被打斷的模型,那你就是在為一個用不到的功能付出高昂代價。
工具呼叫是主打,但也是最弱的部分。
「首個支援工具呼叫的全雙工模型」是此次發佈所依據的宣稱,而其下方的數字並不均衡。在 BFCL-v3 的口語轉換測試中,NVIDIA 報告的平均值為 56.1%:簡單型 58.5%、多重型 62.5%、平行型 42.5%、平行多重型 27.5%,而在正確拒絕不相關呼叫方面則為 89.6%。在 Full-Duplex-Bench v3 上,差距則更為明顯。
• 工具選擇 — 82.5%。從列表中選取正確的函式,NVIDIA 公允地表示此表現足以與前沿模型匹敵。
• 引數準確度 — 44.2%。根據使用者所述,正確填入該函式的參數。
• Pass@1 — 33%。 在第一次嘗試時就將整個調用正確完成。
一個模型知道它想使用哪個工具的可靠度,比它能填入工具參數的可靠度高出三分之二——這樣的模型會自信地查詢錯誤城市的天氣。在文字代理程式中,你可以透過驗證層和重試來攔截這個問題;但在即時語音通話中,重試是會被聽見的,而卡片註明模型不應重試失敗的通話——它被指示要告訴使用者 API 有問題。
其周邊的運作限制相當嚴格,NVIDIA 列出這些限制時也沒有多加修飾:每個工作階段最多五個工具,超過就會導致品質下降;無法可靠地同時呼叫多個工具;使用者在工具執行期間無法中斷;以及在混合對話中,系統傾向於依自身知識作答,而不是呼叫它本應使用的工具。冗長的工具回應會讓代理程式停滯,而「等待訊息」功能的設計正是為了掩蓋這個問題——你可以預先寫好一段話,讓代理程式在呼叫觸發的當下說出這段話,讓沉默之中多少有點內容。
有個會讓某人耗掉一個下午的怪問題:系統提示詞和工具回應必須是純 ASCII。不能有破折號、彎引號、度數符號或表情符號。工具輸出在到達模型之前,必須先扁平化為適合口語朗讀的 ASCII 句子,這表示 JSON API 回應不能以原始形式直接傳入。
運行成本是多少,以及限制你的授權
從硬體開始。NVIDIA 的分支文件要求至少 80 GB 記憶體的 GPU,這指向 H100 或 H200,而受測配置是搭配 vLLM 的 H100。在常見的 GPU 雲端平台上,隨需 H100 容量每小時約 2–3 美元,因此在撰寫任何應用程式碼、僱用任何人維護、或服務第二個並行對話之前,一個持續運行的實例每月成本約在 1,500–2,200 美元附近。
現在來比較。Artificial Analysis 將託管的語音轉語音定價標準化為每小時輸入音訊的成本。目前的價差範圍從低價端的每小時約 1.42 美元,到最昂貴的高級等級的每小時 10.75 美元,其中備受好評的中階市場選項如 Grok Voice Think Fast 2.0 落在每小時 4.80 美元——即每音訊分鐘 0.08 美元。

將這兩段放在一起讀,自架設的論點比表面上看起來更站不住腳。專用 H100 只有在真正保持忙碌時,才會比中價位的託管端點便宜;而無論使用率如何,它幾乎都比託管市場的低價端更貴——同時你還得承擔工程、待命支援,以及一個得分 29.2% 的模型,而託管選項的得分為 87–96%。
然後還有那道牆。該授權是OpenMDW License Agreement v1.1,且模型卡在其引用區塊中聲明,該模型「僅供研究目的使用」。GitHub 分支上的程式碼採用 Apache-2.0 授權;權重則不是。你可以下載它、研究它、微調它、對它進行基準測試,並撰寫相關文章。你不能把它放在客戶面前。因此,對於試圖推出語音產品的公司來說,上述所有經濟論點都只是紙上談兵——問題從來不在於 GPU 的數學計算是否成立。
這也是為什麼我們會直白地把顯而易見的事說清楚:NemotronLabs VoiceChat 11B 無法透過 OrcaRouter 呼叫,因為它根本無法透過任何管道呼叫。一個金鑰真正能帶給你的是它應該被衡量的基準——託管的語音與音訊模型位於單一 API 之後,零加成,也就是我們直接以供應商的定價轉手,所以當廠商調降音訊費率時,你當天支付的就是較低的數字,而不是等一個合約週期結束。如果你正在為語音代理定價,每分鐘的費用就是一臺 80 GB GPU 必須打敗的數字,而且在你投入一整個機架之前,值得先精確掌握這個數字。
命名問題:11B、12B、NemotronLabs、Nemotron 3
這就是大部分早期報導出錯的地方,所以值得小心釐清哪些是已經確定的、哪些不是。
NVIDIA自身的四個來源以三種不同標籤來描述這項工作。Hugging Face發布了「NVIDIA NemotronLabs VoiceChat 11B」,採用開放權重與僅限研究使用的授權。NVIDIA的開發者部落格於2026年3月將「Nemotron 3 VoiceChat」描述為一款12B參數、處於早期存取階段的全雙工模型,目標是低於300毫秒的端到端延遲,以80毫秒區塊為單位,並透過早期存取計畫提供參考容器、基準測試結果與微調路徑,同時承諾提供「開放、可檢視的權重,以供企業部署」。公開的VoiceBench排行榜與Artificial Analysis均將其條目登錄為「Nemotron 3 VoiceChat (V1)」,12B。
目前可知的是:架構描述在各個元件上完全吻合——Fast Conformer 編碼器、Nemotron Nano v2 9B 主幹、NVIDIA 文字轉語音解碼器、獨立的工具呼叫通道、80 毫秒幀、單一統一堆疊。Hugging Face 儲存庫中未渲染的卡片使用的是其他介面所用的 12B 數字。這是同一條工作脈絡,第三方條目幾乎可以肯定是針對這個系列進行評測。
尚未獲得證實的是:你今天可以下載的檢查點,是否與 Artificial Analysis 和 VoiceBench 所評測的版本,或與早期存取計畫所發放的版本,逐位元組一致。有兩項細節不支持這種假設。參數量不同:實測值為 11.095B,而申報值為 12B。延遲目標也差異懸殊——部落格對企業端的宣傳是端到端低於 300 毫秒,而發布的規格卡在 Full-Duplex-Bench 上測得 448 毫秒和 480 毫秒。這些可能是同一模型的不同量測點,也可能是不同的模型。NVIDIA 沒有說明,因為 NVIDIA 對這次發布根本沒有發表任何說明。
實際的重點是:如果你要引用這個模型的數字,請註明它來自哪個來源。那些將 Artificial Analysis 的 29.2% 歸因於 Hugging Face 模型卡,或將 NVIDIA 的 37.0% 歸因於獨立測試的報導,其實是把 NVIDIA 自己分開放在不同文件(參數量不同)中的兩件事混為一談了。
它會在哪裡中斷
草稿卡的限制部分異常直言不諱,而 GitHub 分支則添加了更多。收集:
• 僅限英文,且儲存庫中沒有多語言路線圖。
• 兩分鐘記憶。超過兩分鐘音訊視窗的對話可能不會被保留——這是支援通話或任何需要記住四分鐘前達成共識之事項的硬性上限。
• 比自身骨幹模型更笨。NVIDIA 表示,它在以下方面可能不如 Nemotron Nano 9B v2:知識、指令遵循以及安全性,因為它是為了對話自然度而調校的。它未經明確的推理或對齊訓練;多步推理和算術被指出是弱項。
• 沒有可靠的回饋信號。 「mm-hm」這種表示人類仍在聆聽的訊號,並未被系統性地處理。
• 它會在你話說到一半時打斷你。 分支說明將「在用戶話語中途停頓時打斷對方」及「失控式續說/自言自語」列為已知的失敗模式——這是編碼器完全沒有右側上下文所導致的直接代價。
• 僅限安靜的房間使用。明確不適用於嘈雜或迴響的環境,尤其是會出現背景說話聲的場所。這排除了大多數客服中心的座席區和大多數汽車。
到底誰應該下載這個
從事雙工語音建模的研究人員在這裡收穫最大,且應該採取行動:一個具備可用工具呼叫通道的 11B 開放檢查點,訓練資料約為 55 萬小時的混合真實與合成音訊,遠比根據 SALM-Duplex 論文重新實作更適合作為起點。研究授權對這項工作並不構成限制。
開發語音代理的團隊應該閱讀卡片,然後跳過下載。你從一個無法發佈的 44 GB float32 檢查點中學到的東西,不會改變你的架構;而這些基準測試真正教會我們的是,端到端全雙工在用戶最在意的事情——也就是助手是否聽懂他們——上,還比不上一個良好的託管模型。與此同時,明智的做法是針對託管端點進行構建,並保持替換成本低廉——一個金鑰支援 200 多個模型,並自動故障轉移,這意味著供應商事故不會讓你的電話線路在通話中途中斷,也意味著日後轉向開放的全雙工模型,只需要修改設定,而不是重寫。
{{1}}特別關注此事的企業,應申請 Nemotron 3 VoiceChat 的早期存取,而非直接基於 Hugging Face 權重進行開發。{{/1}}{{2}}可部署授權、參考容器以及低於 300 毫秒的效能聲明,都在該計畫中。{{/2}}{{3}}公開的檢查點是同一概念的研究預覽版,發布時未附帶允許您使用的相關文件。{{/3}}
這個 repo 會不斷收到的三個問題
如果我大量微調它,能用於商業用途嗎? 不行。OpenMDW v1.1 與模型卡上的「僅供研究用途」聲明規範了權重及任何衍生內容;GitHub 分支上的 Apache-2.0 授權涵蓋的是推論程式碼,而非檢查點。微調並不能洗白授權。如果你需要商業權利,NVIDIA 實際為此設立的途徑是早期存取計畫。
這個模型和排行榜上的那個是同一個模型嗎?幾乎可以肯定屬於同一系列;但完全相同的成品檔案則未經證實。排行榜和 Artificial Analysis 的條目皆以「Nemotron 3 VoiceChat (V1)」、12B 的規格建檔,而可下載的檢查點量測為 11.095B,NVIDIA 也未發布任何能調和兩者的資料。請將排行榜數字視為判斷其血統的最佳現有獨立參考,而非對 Hugging Face 上檔案的實測驗證。
它能在比 80 GB 更小的卡上運行嗎?有可能,但需要一番功夫,而且目前沒有人發表過實證。權重是 float32,所以轉換成 bfloat16 應該能把約 44 GB 的參數降到約 22 GB,在還沒算入 KV cache、codec 和串流緩衝區之前,48 GB 的卡確實有相當多的餘裕。但受支援的路徑是在 80 GB 的 H100 上使用 vLLM;部署容器就是為此建置的,而 NVIDIA 回報的唯一受測配置也是這個。請把時間也算進去,而不只是 VRAM。
看什麼
有三件事會各自改變對這次發布的解讀。一份技術報告,或甚至是一張不再自相矛盾的模型卡,就能告訴我們 11B 檢查點是否就是排行榜所測量的產物。獨立複現的延遲測試——由 NVIDIA 以外的人在自己的硬體上確認 448 毫秒的話輪轉換——會把這次發布最吸引人的宣稱從行銷話術變成事實。而商業授權,或任何人提供的託管端點,則會讓它從與論文沾邊的新奇玩意,變成許多團隊真正可行的選項;這些團隊會很樂意犧牲一些推理品質,換取一個可以被打斷的語音代理。
在這些成果落地之前,精確的描述雖然範圍狹窄但確實引人注目:NVIDIA 發布了迄今為止測量到的最強大的開放全雙工語音 checkpoint,為該類別提供了第一個可用的工具呼叫通道,但授權方式使任何人都無法將其出貨,而且對於這一切,NVIDIA 隻字未提。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
