
GPT-Live-1 對上 NVIDIA Nemotron VoiceChat 11B:按分鐘計費,還是 80 GB GPU
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 每百萬 tokens
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
GPT-Live-1 與 NVIDIA Nemotron VoiceChat 11B 之間的選擇,並不是兩種語音模型之間的選擇,而是兩種商業模式披著語音模型外衣的選擇。GPT-Live-1 是託管 API,OpenAI 於 2026 年 9 月 10 日開放開發者使用,以每分鐘音訊 0.05 美元計費,完全不涉及你的硬體。NVIDIA Nemotron VoiceChat 11B——以 NVIDIA-NemotronLabs-VoiceChat-11B 之名發布,附有日期為 2026 年 7 月 21 日的 NGC 容器和一個 Hugging Face 檢查點——是一個 110 億參數的開放權重全雙工語音模型,無法在低於 80 GB 的 GPU 上執行。其中一個會按每分鐘通話向你收費;另一個則無論有沒有人來電,都會讓你花錢。
損益平衡點比廠商簡報所暗示的還要簡單
先從雙方都同意的那個數字談起。GPT-Live-1 每分鐘 $0.05,連續通話一小時就是 $3.00。這就是一通永遠在線的語音對話的價格。
現在來計算替代方案的價格。Nemotron VoiceChat 11B 需要一張至少具備 80 GB VRAM 的 GPU——A100、H100、H200、B100、B200 或 RTX 6000 等級的顯示卡,並在 Linux 上運行。在公開市場上租用這類設備,每小時只需個位數低段的美元;而自行擁有這類設備,在計入使用率後,攤銷下來的成本也相去不遠。因此,單一條全天候運作的語音線路大致上打平:租用 GPU 的成本,與 API 的成本差不多,而這還不包括你為了讓任何東西在上面運行所支付的費用。
那是錯誤的比較,而大多數自建與外購的比較文章都止步於此。正確的比較應該以每顆 GPU 為單位,而不是每條產品線,而且這取決於一個 NVIDIA 尚未公布的數字。
• GPT-Live-1 在 Tier 1 帳戶上 — 25 個並行工作階段,每分鐘 1.25 美元,或每小時 75 美元,當全部 25 條線路都上線時
• 在單張 80 GB GPU 上運行 Nemotron VoiceChat 11B — 無論 11B 混合 Mamba/Transformer 模型能在 80 GB 內容納多少個並行工作階段,成本約等於該顯示卡的租用費用
在 80 GB 加速器上跑 11B 模型有很大的餘裕,而 80 GB 這項要求在實務上能換來極大的批次處理容量。如果一張卡甚至能承載六個並行對話,那麼在滿載時,自行託管會比 API 便宜得多。如果只能承載一個半,那就不會。在有人針對真實流量對並行處理進行基準測試之前,誠實的立場是:損益兩平點很可能在規模化時偏向自行託管,而且兩家廠商都沒有給你足以證明的數字。

在開放模型確實更好、而不只是更便宜的地方
延遲的比較比價格的比較更值得審慎處理,因為在這個軸線上,開放模型握有更有利的證據。
• 輪替發言延遲 — Nemotron VoiceChat 11B 在 Full-Duplex-Bench 1.0 上回報,順暢輪替發言的延遲為 448 毫秒,打斷並讓出的延遲為 480 毫秒,使用者打斷接管率為 1.00。由 OpenAI 回報,GPT-Live-1 的數值為 0.8 秒,低於先前的 1.4 秒。
把這兩個數字並排放在一起看,再附上各自的來源,整個圖像就反轉了。NVIDIA 的數字來自一套已發布、公開載明規格的基準測試套件。OpenAI 的數字則來自 OpenAI 自己,是拿自家新模型跟自家前一代相比,而且未經獨立重現。就現有證據而言,在讓語音代理感覺像真人的那件事上,開放權重模型在可量測的程度上確實更快;而託管模型之所以更快,只根據它自家的新聞資料。
NVIDIA 也宣稱創下首例:Nemotron VoiceChat 11B 被描述為首個開放的全雙工模型,能在對話期間支援即時工具呼叫,並使用獨立的輸出通道與預設的等待語句,讓代理在等待外部 API 時能持續說話。模型卡隨附三個音訊樣本,邀請你聆聽的正是這一點——自然的輪流發言,據稱回應時間約 450 毫秒;插話打斷時,模型會立即讓出;以及在對話中途即時呼叫工具。那些樣本出自供應商,佐證了 448 毫秒這個數字,而不是對其進行獨立測試,但至少它們是附在可下載檢查點上的可聽證據,而不是發表文章中的一個數字。這是 GPT-Live-1 以委派解決的同一個架構問題,只是答案不同——開放模型自己撐住通話;託管模型則把任務交給獨立的推理模型,並讓語音層維持對話不中斷。
相似之處與差異之處同樣具有啟發性。兩者都採全雙工,意思是它們會邊說邊聽,而不是輪流發言。兩者都支援中斷與插話。兩者接受的語音訓練規模之大,讓較舊的、先 ASR 再 LLM 再 TTS 的串聯式流程看起來像是三個被硬湊在一起的獨立產品——NVIDIA 的模型檢查點看過約 55 萬小時的語音。

你所放棄的,而且不只是金錢
使用開放模型時,你放棄的第一件事就是語音。釋出的檢查點只使用單一固定語音,名為 Aria,且不支援語音複製或語音庫。GPT-Live-1 提供十二種語音,涵蓋不同口音、方言和語言,而 OpenAI 專為此模型重新後製這些語音。如果你的產品語音是其身分認同的一部分,或者你需要透過單一部署,以聲音各異的代理服務多個市場,那麼單就這一點就幾乎足以讓它出局——而這也是在規格比較中最不容易看見的限制,因為它看起來像是功能數量,而不是產品決策。
第二件你必須放棄的事,是上下文的上限。這個模型帶有約 142 秒的訓練時語句限制,以及一項實務限制:大約只能保留兩分鐘的音訊上下文。一通長達二十分鐘的電話,對這個檢查點來說並不是單一連續的上下文;它是一連串必須由周邊系統管理的區段。託管模型通常會替你處理這些紀錄管理工作。
第三點是你可以用它做什麼。Hugging Face 模型卡載明 openmdw-1.1 授權,而某些關於該發布的報導卻將其描述為僅限研究用途,NGC 容器頁面則將這些元件定位為可供商業或非商業使用。三個來源、三種不同解讀,而唯有授權條款文字為準。這種不一致,正是會在上市前三星期的法務審查中浮現的那類問題。在你著手建置之前就解決它,而不是之後。
第四項是營運。80 GB GPU 不是你可以在悠閒週日關掉的單項支出:即使流量為零,你還是得為這張卡付費,而且你得自己承擔擴充曲線、驅動程式升級、容量規劃,以及這條即時音訊路徑的待命輪值——在這裡,連線中斷就等於客戶流失。在你達到那一步的過程中,也沒有託管式備援可以依靠——Hugging Face 模型卡上的推論供應商欄位明確指出,沒有任何推論供應商部署這個模型,所以沒有這個檢查點的按分鐘計費版本可供製作原型。你要嘛自行託管,要嘛就不要用。這類工作在按分鐘計價的比較中看不見,但在招募計畫上卻非常顯眼。
大多數團隊其實真正該考慮的混合模式
讓這個決策變得可行的框架是:這兩個模型不必是二選一的二元選項。語音代理通常有一個語音層和一個推理層,而靈活性就在推理層。
GPT-Live-1 從設計上就是這樣打造的。它的語音層讓對話持續進行,而思考則透過 Responses API 委派給一般的文字模型——OpenAI 自己發布的 WebRTC 範例,就是將那個後端接到 GPT-5.6 Terra。你技術堆疊中的那一半只是一般的 API 呼叫,按 token 計價,而且供應商有真正的選擇。GPT-5.6 Terra 透過 OrcaRouter 提供服務,價格為每百萬輸入 token $2.00、每百萬輸出 $12.00,具備 1M token 的上下文,並同時開放 /v1/chat/completions 與 /v1/responses,與約 190 個其他可透過單一金鑰存取的模型並列。
這件事對自架專案特別重要,因為它會改變風險概況。如果你架起 Nemotron VoiceChat 11B,而它在你實際流量下撐不住,語音那一半就成了沉沒的 GPU 成本——但推理那一半可以搬移、容錯移轉,或拆分成用便宜模型處理例行回合、用強大模型處理升級情境,完全不必動到音訊路徑。當單一來源依賴中斷時,跨上游供應商的自動容錯移轉,就是糟糕的一下午與糟糕的一季之間的差別。
直接說清楚哪些東西在哪裡可用、哪些不可用:GPT-Live-1 和 Nemotron VoiceChat 11B 都不是由 OrcaRouter 提供的。兩者都來自各自的來源——一個是 OpenAI 的 Live Sessions 端點,另一個是你自己的 GPU。路由的槓桿完全在音訊的下游。

該以哪一個為基礎
• 若你想在本季就推出上線、若你需要不只一種語音、若你的對話經常持續超過兩分鐘的連續語境,或者若你的用量還不足以證明值得負擔一台閒置時仍在計費的 GPU,就選擇 GPT-Live-1。
• 若您已在使用 80 GB GPU,若您需要的是有實證而非僅憑宣稱的低於 500 毫秒輪替發言,若您基於資料落地考量而需要讓音訊留在自家基礎架構內,或者您的通話量已大到 API 每分鐘計費成為帳單上最大一筆費用,請選擇 NVIDIA Nemotron VoiceChat 11B。
• 在 API 上做原型,並對 checkpoint 做基準測試。這個決策取決於一個尚未公開的數字——每張 80 GB 顯卡可承載的並行工作階段數——而唯一能取得它的方法,就是在你自己的流量形態上實測。那是一週的工作量,而這正是站得住腳的基礎架構決策,與包裝成決策的憑空臆測之間的差別。
