
Sesame Preview 對比 NVIDIA NemotronLabs VoiceChat 11B:你無法取得授權的聲音,與你無法推出的聲音
- meta新Meta: Muse Spark 1.22026-08-0557智能72程式
- qwen新Qwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 2038 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
- grokxAI: Grok 4.52026-07-0856智能72程式
- tencentTencent: Hy32026-07-0642智能59程式
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42程式
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39程式
- anthropicAnthropic: Claude Sonnet 52026-06-3055智能72程式
- klingKling: Kling 3.0 Turbo2026-06-1757智能52程式57數學
- z-aiZ.ai: GLM 5.22026-06-1653智能69程式60數學
2026 年最受熱議的兩個語音模型有一個共同點,是所有上市報導都不會告訴你的:你無法把其中任何一個放進產品裡。Sesame Preview是免費的消費者助理,其對話語音讓 TestingCatalog 稱之為「市場上最好的語音模式之一」,而它背後的正式模型沒有 API、沒有模型 ID、也沒有可供購買的授權——該公司根本尚未釋出。NVIDIA NemotronLabs VoiceChat 11B是鏡像對照:權重公開,全雙工設計確實是首創,但授權僅限研究用途,所以也沒有人能合法出貨。一個是你能聽到但租不到的語音;另一個是你能持有但賣不掉的語音。這是兩扇上鎖的門之間的比較,而更有用的問題是:你站在哪一把鎖前面。
兩扇鎖著的門,各有不同的鎖。
先從兩者的形態說起,因為名稱隱藏了這兩款產品之間的巨大差異。Sesame Preview 是一款 App,不是 API。它內建四位個性鮮明的代理——Maya(溫暖且富有創造力)、Miles(隨性且敏銳)、Simone(好奇且知性)、Charlie(機智且溫暖)——每位都有各自的聲音與記憶,登入後會在網頁版與行動版之間同步。它會上網搜尋、深入探索、記筆記與設定提醒,並在每次通話結束後發送摘要。預覽版完全免費,沒有付費方案,僅支援英文,登入後每次通話上限為 30 分鐘(未登入則為 5 分鐘),而且它刻意不執行任務:它會協助腦力激盪與研究,但不會替你訂機票。產品中找不到任何 API 金鑰——正式版的語音是 App 的一項功能,而非一個端點。

NVIDIA NemotronLabs VoiceChat 11B 恰恰相反:它是個檢查點,而非產品。它於 2026 年 8 月 3 日無預警地出現在 Hugging Face 上——沒有發布貼文、沒有技術報告、沒有推文;模型卡本身就是公告。它是一個 11B 參數的全雙工語音模型(我們解析了 safetensors 標頭,統計出 1,626 個張量中合計 11.095 billion 個參數),以單一架構構成:Fast Conformer 編碼器以 80 毫秒幀處理 16 kHz 音訊且零右側上下文、Nemotron Nano 9B v2 主幹負責推理、NVIDIA TTS 解碼器輸出 22.05 kHz 音訊、RNN-T 解碼器轉錄使用者語音,以及一個獨立的輸出通道,用於產生工具呼叫腳本而不污染口語回覆。它能同時聆聽與說話,可以在字詞中途被打斷,而 NVIDIA 宣稱它是第一個具備工具呼叫能力的開源全雙工模型。這項宣稱能否經得起現實的檢驗,將在下方專節探討。
「它們分歧的基準——兩個「最佳對話」的候選者,兩套破碎的證據標準」
兩個模型將整個聲譽都押在相同的事情上:對話品質——輪流發言、打斷、自然的時機、真實交流的感受。這就是為什麼它們會被放在同一個標題下。也是比較開始變得奇怪的地方,因為兩位候選人都無法被適當地評分。
Sesame Preview 在任何地方都沒有號碼。生產模型未發布且未列名——沒有模型 ID,沒有出現在 Artificial Analysis 的語音轉語音排行榜上,沒有延遲目標,沒有任何形式的基準測試。TestingCatalog 所稱的「市面上最好的語音模式之一」是評論者的共識,而非實際測量結果,而且也沒有辦法對它進行盲測 A/B 測試。任何人唯一能獨立執行的 Sesame 模型是開放權重的 CSM-1B 基礎模型,而那是文字轉語音的檢查點,並非該應用程式所使用的語音。
NVIDIA NemotronLabs VoiceChat 11B 則有相反的問題:它有數據,但這些數據分散在兩個互不一致的證據標準上。NVIDIA 報告指出,流暢輪換需 448 毫秒,被打斷時讓位需 480 毫秒,對使用者打斷的接管率達到完美的 1.0——這些全部是在 NVIDIA 自家的 Full-Duplex-Bench 1.0 上由廠商測量,沒有任何一項經獨立重現。這個系列的獨立測量則是以不同的名稱和參數數量歸檔——12B 的「Nemotron 3 VoiceChat (V1)」,這個標籤 NVIDIA 從未與 Hugging Face 上的 11B 檢查點對齊——而且在理解面表現不盡理想:根據 Artificial Analysis,Big Bench Audio 得分為 29.2%,對比 NVIDIA 自家卡片上的 37.0%。在 VoiceBench 上,該系列得分為 58.10,是目前公開全雙工模型中最佳的成績。因此,同一個模型一方面是開放全雙工檢查點中的領先者,另一方面在理解所聽內容方面,卻大約以三比一落後於託管即時模型的領先者。

那麼,分歧並不在於何者較佳。而是在於2026年最佳對話的兩位候選者,正以相反且同樣不完整的證據接受評判。評論者說感覺最像人的那個語音,完全沒有任何測量數據;而真正登上排行榜的那個語音,其弱點卻是公開的。你無法拿名聲與數字相比,而在這裡只有一個數字——而且不是個討喜的數字。
Access — 可從 App Store 下載,或 80 GB 的建置版本
如果你想嘗試其中任何一個,起跑線的差異比任何規格都更重要。
Sesame Preview is a download. The official page reads "Preview available now on iOS and Android," and the Android build has been rolling out since mid-July (the Android beta added image upload and voice memos). There is no API key anywhere. A developer who wants Sesame's actual voice has nothing to call — the only Sesame model reachable through an API is the open-weight CSM-1B base, listed at $7 per million characters, and that is the architecture behind the app, not the app's voice: a text-to-speech checkpoint with a 4K context window and no conversational abilities of its own.
NVIDIA NemotronLabs VoiceChat 11B {{1}}並非下載後即可直接執行的模型——你必須自行將它建置部署{{/1}}。Hugging Face 表示該模型「未經任何 Inference Provider 部署」;NVIDIA 亦未代管它;且 repo 中的 config.json 是 NeMo 訓練設定,因此沒有可供 AutoModel 指向的 Transformers 檢查點。{{2}}受支援的做法是建立一個鎖定於 Python 3.12、PyTorch 2.10 與 Transformers 4.56 的 conda 環境,並從原始碼編譯 causal-conv1d 與 mamba-ssm,在配備 80 GB GPU(A100、H100、H200、B200 或 RTX 6000)且執行 vLLM 的機器上運行——或者使用 NVIDIA 的 NGC NIM 容器,一旦你具備該硬體,它便會在 /v1/realtime 提供一個 {{KEEP}}OpenAI Realtime-compatible{{/KEEP}} WebSocket 介面{{/2}}。下載計數器道出了實際取用的情況:該模型推出首月約有 80 次下載,對比 107 個讚。許多人將它加入書籤;但幾乎沒有人實際執行。對於確實打算執行的研究者,有一句誠懇的提醒:此檢查點所基於的推理骨幹 Nemotron Nano 9B v2 本身就是一個現在即可呼叫的託管模型——但環繞它的全雙工模型並非如此,而這個落差正是重點所在。

Price — 免費應用程式、自由重量器材,以及 80 GB 的帳單
這兩個模型都是「免費」的,而這個詞在兩種情況下所起的誤導作用是一樣的。
Sesame Preview is genuinely free — no paid tier, no ads, no data selling — because it is a preview you are being invited to test, and Sesame's monetization is a later problem. NVIDIA NemotronLabs VoiceChat 11B's weights cost nothing to download, but the hardware does: a continuously-running H100-class instance at roughly $2–3 an hour lands near $1,500–2,200 a month before you have written any application code, hired anyone to keep it up, or served a second concurrent conversation — and because the license forbids commercial use, that is money you can only spend on research. Between them sits CSM-1B at $7 per million characters, a hosted price for a model whose default is self-hosting.
當這兩者中任何一個變得可購買時,誠實的衡量標準就是:無論你最終選擇哪個託管語音模型,你都應該支付提供商的標價,不應有任何路由加價——這種直通模式能讓供應商的降價在同一天反映在你的帳單上,而不是等一個合約週期結束。本文中的兩個模型都無法透過 OrcaRouter 呼叫:Sesame 的生產語音根本沒有 API,而 NVIDIA NemotronLabs VoiceChat 11B 也無法透過任何方式呼叫。這個衡量標準適用於你實際能購買的語音服務,而這正是讓一個每百萬字元 7 美元的 TTS 基礎服務,或未來 Sesame 品質的 API,能夠被誠實定價的標準。
記憶 — 記住的應用程式 vs 遺忘的模型
這裡的差距如同峽谷,這正是兩者無法互相替代的最具體原因。Sesame Preview 這個應用程式會記住:每個代理(agent)都攜帶著各自的記憶,當你登入時,記憶會在網頁與行動裝置之間同步;通話最長可達 30 分鐘;無痕模式(Incognito Mode)會讀取過去的記憶,但不會建立新的記憶。相比之下,開源的 CSM-1B 只有 4K 的上下文視窗——約三到四分鐘的文字量——況且它根本沒有耳朵聽你說話。
NVIDIA NemotronLabs VoiceChat 11B 最多只能容納約兩分鐘的音訊上下文——訓練資料載入器將語句長度上限設為 142.39 秒,且模型卡警告,超過兩分鐘時間窗的對話可能不會被保留。對於需要記住四分鐘前雙方達成共識的支援通話而言,光是這個上限就足以讓它出局。再加上發布的檢查點中只有單一固定語音(Aria),不支援語音複製,這個對自身架構公開透明的模型,同時也是記不住客戶、也無法改變自己語音的模型。
每個各自真正不擅長的事
之所以收錄,是因為只停留在優勢層面的比較就是行銷:
• Sesame Preview:沒有 API——你無法將此語音用於產品中,且生產模型尚未發布且未經評測。僅支援英文,無法執行任務,通話上限 30 分鐘,也沒有任何獨立基準測試。唯一開放的模型 CSM-1B 具有 4K 上下文視窗,不支援工具呼叫、沒有聆聽端,也不是該應用程式的語音。
• NVIDIA NemotronLabs VoiceChat 11B:一個僅供研究的授權(OpenMDW v1.1)——你可以下載、研究並微調它,但不能發布它,任何基於它開發的人也不能發布。沒有託管端點,所以「試用」意味著需要 80 GB 的 GPU 和從原始碼建置。僅支援英文,記憶長度上限約 2 分鐘,只有一種固定的語音。NVIDIA 表示,它在知識和指令遵循方面可能不如其自身的主幹模型,並指出多步驟推理和算術能力較弱。它可能會在句子中途打斷你,在幾輪對話後退化為無法恢復的亂語或自言自語,轉錄時會漏字,而且明確不適合嘈雜或有回音的環境。工具呼叫僅適用於純 ASCII 的提示和回應,每次會話最多五個工具,其參數準確率(44.2%)和首次嘗試通過率(33%)意味著它選擇正確工具比填入工具參數更可靠。
該由誰來選擇哪一個
因為兩者都不可調用,誠實的答案始於你試圖要做的事情。
• 體驗2026年最受好評的語音:Sesame Preview,今日免費提供——以應用程式形式。評論者不斷提到的四個代理、中斷處理、駕駛模式可用性:那是消費級產品,而其價值正是你無法衡量的事物。
• 研究全雙工語音建模:NVIDIA NemotronLabs VoiceChat 11B 是同類別中更有趣的下載項目——這是一個 11B 的開放權重檢查點,具備可用的工具呼叫管道、約 55 萬小時的混合訓練音訊,以及迄今為止開源全雙工 VoiceBench 的最佳成績,而且權重完全免費。僅限研究用途的授權不會對這項工作構成限制。
• Build on Sesame's architecture: CSM-1B is the only Sesame model a developer can actually call — $7 per million characters, Apache-2.0, zero-shot voice cloning — with the honest caveat that it is a base text-to-speech model, not the production voice the app uses.
• 本季度推出語音產品: 這些都不是。您需要一個具有商業授權的託管即時語音對語音模型,而安全採用一個您尚未投入生產路徑之模型的方式,是將其與一個經過驗證的模型並行路由,並配備自動故障轉移,如此一來,未經驗證的語音絕不會中斷即時通話。透過一個 API 存取 200+ 個託管模型,按供應商列表價格計費、不額外加價,這正是讓嘗試新推出的語音成為配置變更而非重寫的關鍵。
這個模式值得命名,因為它會一再出現。這兩個模型都距離可呼叫狀態只差一個事件——Sesame 在發布模型 ID 或 API 的那一天;NVIDIA NemotronLabs VoiceChat 11B 在 NVIDIA 發布商業授權或有人代管它的那一天。屆時,正確的做法不是把現有的語音技術棧拆除,而是在舊語音旁邊加入新語音,並以容錯移轉進行路由,就像你對任何新出現、尚未驗證的模型所做的那樣。它們是 2026 年兩個最優秀的「尚未可出貨」語音;而基礎設施早已存在,足以出貨第三個。
什麼會改變這個比較?
{{1}}有四件事將改寫這篇文章。{{/1}} 一個 API 或模型 ID,用於 {{2}}Sesame 的生產級語音{{/2}} — {{3}}一旦發生這種情況,Sesame 就不再只是一個應用程式,而會成為託管語音 API 市場期待已久的競爭者。{{/3}} 商用授權或託管端點,用於 {{4}}NVIDIA NemotronLabs VoiceChat 11B{{/4}},{{5}}這將使其在一夜之間從研究產物變成真正的產品選項。{{/5}} 針對 {{6}}Sesame 語音{{/6}} 的獨立評分 — {{7}}在 Artificial Analysis 的語音對語音排行榜上列出,將使「最佳語音」的說法有可驗證的依據。{{/7}} 以及來自 {{8}}NVIDIA 的一份技術報告,說明 11B 檢查點與排行榜所衡量的 12B「Nemotron 3 VoiceChat (V1)」條目之間的關聯,這是信任該系列任何數據的前提。{{/8}} {{9}}在上述任何一項實現之前,準確的總結很簡單:2026 年兩個最有趣的對話語音都被鎖住了——一個被不會出售的公司鎖住,另一個被不會出貨的授權鎖住。{{/9}}
常見問題
我可以在自己的應用程式中使用任一模型的語音嗎?
No, and the two reasons are the shape of this comparison. Sesame Preview's production voice has no API, no model ID, and no endpoint — it exists only as the app. NVIDIA NemotronLabs VoiceChat 11B is open-weight but research-only (OpenMDW v1.1), self-hosted on an 80 GB GPU, with no hosted inference provider. The only Sesame model a developer can call is CSM-1B at $7 per million characters, and it is a text-to-speech base, not the app's voice.
這兩者之中,哪一個實際上聽起來更像人類?
未知,兩者依據的理由各不相同。Sesame Preview 根本沒有獨立的評分——TestingCatalog 所稱的「市面上最好的語音模式之一」是評論者的共識,而非測量結果。NVIDIA NemotronLabs VoiceChat 11B 的對話時序(448 毫秒輪替、480 毫秒插話讓位)是 NVIDIA 自行回報且未經複現的;而其獨立的 Big Bench Audio 數據(29.2%,根據 Artificial Analysis,歸檔於「Nemotron 3 VoiceChat (V1)」)衡量的是理解力,而非語音的悅耳程度。一個有你能親耳聽到的聲譽;另一個則有回答不同問題的數字。
NVIDIA NemotronLabs VoiceChat 11B 真的免費嗎?
權重是免費的;但模型本身並不便宜。要運行它需要 80 GB 的 GPU(按需使用每小時約 2–3 美元,若持續保持運作,每月約 1,500–2,200 美元),還需要從原始碼自行建置;而 OpenMDW v1.1 授權僅限於研究用途——所以即使花了這些錢,你也不能合法地將其提供給客戶使用。
