一張主視覺標題卡,寫著「GPT-Live-1 vs NVIDIA Nemotron VoiceChat 11B」,副標為「按分鐘計費,還是一張 80 GB GPU」,並有一行「每分鐘 $0.05,對上一張 80 GB 加速卡」;上方兩塊面板:左側顯示雲端輪廓,帶有計量儀表與硬幣圖示,右側顯示伺服器加速卡電路板,帶有晶片圖示與「80 GB VRAM」標籤,角落合成 OrcaRouter 標誌。
Guides & Insights

GPT-Live-1 對上 NVIDIA Nemotron VoiceChat 11B:按分鐘計費,還是 80 GB GPU

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

GPT-Live-1 與 NVIDIA Nemotron VoiceChat 11B 之間的選擇,並不是兩種語音模型之間的選擇,而是兩種商業模式披著語音模型外衣的選擇。GPT-Live-1 是託管 API,OpenAI 於 2026 年 9 月 10 日開放開發者使用,以每分鐘音訊 0.05 美元計費,完全不涉及你的硬體。NVIDIA Nemotron VoiceChat 11B——以 NVIDIA-NemotronLabs-VoiceChat-11B 之名發布,附有日期為 2026 年 7 月 21 日的 NGC 容器和一個 Hugging Face 檢查點——是一個 110 億參數的開放權重全雙工語音模型,無法在低於 80 GB 的 GPU 上執行。其中一個會按每分鐘通話向你收費;另一個則無論有沒有人來電,都會讓你花錢。

損益平衡點比廠商簡報所暗示的還要簡單

先從雙方都同意的那個數字談起。GPT-Live-1 每分鐘 $0.05,連續通話一小時就是 $3.00。這就是一通永遠在線的語音對話的價格。

現在來計算替代方案的價格。Nemotron VoiceChat 11B 需要一張至少具備 80 GB VRAM 的 GPU——A100、H100、H200、B100、B200 或 RTX 6000 等級的顯示卡,並在 Linux 上運行。在公開市場上租用這類設備,每小時只需個位數低段的美元;而自行擁有這類設備,在計入使用率後,攤銷下來的成本也相去不遠。因此,單一條全天候運作的語音線路大致上打平:租用 GPU 的成本,與 API 的成本差不多,而這還不包括你為了讓任何東西在上面運行所支付的費用。

那是錯誤的比較,而大多數自建與外購的比較文章都止步於此。正確的比較應該以每顆 GPU 為單位,而不是每條產品線,而且這取決於一個 NVIDIA 尚未公布的數字。

• GPT-Live-1 在 Tier 1 帳戶上 — 25 個並行工作階段,每分鐘 1.25 美元,或每小時 75 美元,當全部 25 條線路都上線時

• 在單張 80 GB GPU 上運行 Nemotron VoiceChat 11B — 無論 11B 混合 Mamba/Transformer 模型能在 80 GB 內容納多少個並行工作階段,成本約等於該顯示卡的租用費用

在 80 GB 加速器上跑 11B 模型有很大的餘裕,而 80 GB 這項要求在實務上能換來極大的批次處理容量。如果一張卡甚至能承載六個並行對話,那麼在滿載時,自行託管會比 API 便宜得多。如果只能承載一個半,那就不會。在有人針對真實流量對並行處理進行基準測試之前,誠實的立場是:損益兩平點很可能在規模化時偏向自行託管,而且兩家廠商都沒有給你足以證明的數字。

A two-column comparison scoreboard titled 'GPT-Live-1 vs NVIDIA Nemotron VoiceChat 11B - the scoreboard'. The GPT-Live-1 column lists Shape hosted API; Cost $0.05 / minute; Turn-taking 0.8 s, vendor-reported; Voices 12; Tool calling delegated to backend model; Ops burden none, vendor runs it. The Nemotron VoiceChat 11B column lists Shape open weights; Cost one 80 GB GPU, billed while idle; Turn-taking 448 ms on Full-Duplex-Bench 1.0; Voices 1 fixed voice, Aria; Tool calling in-session, separate output channel; Ops burden you run the GPU on Linux. A footer reads 'Nemotron turn-taking figure is a published benchmark; GPT-Live-1 latency is OpenAI's own and unreproduced.'

在開放模型確實更好、而不只是更便宜的地方

延遲的比較比價格的比較更值得審慎處理,因為在這個軸線上,開放模型握有更有利的證據。

• 輪替發言延遲 — Nemotron VoiceChat 11B 在 Full-Duplex-Bench 1.0 上回報,順暢輪替發言的延遲為 448 毫秒,打斷並讓出的延遲為 480 毫秒,使用者打斷接管率為 1.00。由 OpenAI 回報,GPT-Live-1 的數值為 0.8 秒,低於先前的 1.4 秒。

把這兩個數字並排放在一起看,再附上各自的來源,整個圖像就反轉了。NVIDIA 的數字來自一套已發布、公開載明規格的基準測試套件。OpenAI 的數字則來自 OpenAI 自己,是拿自家新模型跟自家前一代相比,而且未經獨立重現。就現有證據而言,在讓語音代理感覺像真人的那件事上,開放權重模型在可量測的程度上確實更快;而託管模型之所以更快,只根據它自家的新聞資料。

NVIDIA 也宣稱創下首例:Nemotron VoiceChat 11B 被描述為首個開放的全雙工模型,能在對話期間支援即時工具呼叫,並使用獨立的輸出通道與預設的等待語句,讓代理在等待外部 API 時能持續說話。模型卡隨附三個音訊樣本,邀請你聆聽的正是這一點——自然的輪流發言,據稱回應時間約 450 毫秒;插話打斷時,模型會立即讓出;以及在對話中途即時呼叫工具。那些樣本出自供應商,佐證了 448 毫秒這個數字,而不是對其進行獨立測試,但至少它們是附在可下載檢查點上的可聽證據,而不是發表文章中的一個數字。這是 GPT-Live-1 以委派解決的同一個架構問題,只是答案不同——開放模型自己撐住通話;託管模型則把任務交給獨立的推理模型,並讓語音層維持對話不中斷。

相似之處與差異之處同樣具有啟發性。兩者都採全雙工,意思是它們會邊說邊聽,而不是輪流發言。兩者都支援中斷與插話。兩者接受的語音訓練規模之大,讓較舊的、先 ASR 再 LLM 再 TTS 的串聯式流程看起來像是三個被硬湊在一起的獨立產品——NVIDIA 的模型檢查點看過約 55 萬小時的語音。

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-VoiceChat-11B, showing the openmdw-1.1 license tag, a model size of 11B params, 3,630 downloads last month, an inference-providers row stating the model isn't deployed by any Inference Provider, a model tree descending from NVIDIA-Nemotron-Nano-12B-v2-Base, three audio samples labelled natural turn-taking at roughly 450 ms response, barge-in where the model yields instantly, and tool calling live, and the description that NVIDIA NemotronLabs VoiceChat is an 11B end-to-end real-time speech full duplex model and the first open full-duplex model to support tool calling.

你所放棄的,而且不只是金錢

使用開放模型時,你放棄的第一件事就是語音。釋出的檢查點只使用單一固定語音,名為 Aria,且不支援語音複製或語音庫。GPT-Live-1 提供十二種語音,涵蓋不同口音、方言和語言,而 Ope​nAI 專為此模型重新後製這些語音。如果你的產品語音是其身分認同的一部分,或者你需要透過單一部署,以聲音各異的代理服務多個市場,那麼單就這一點就幾乎足以讓它出局——而這也是在規格比較中最不容易看見的限制,因為它看起來像是功能數量,而不是產品決策。

第二件你必須放棄的事,是上下文的上限。這個模型帶有約 142 秒的訓練時語句限制,以及一項實務限制:大約只能保留兩分鐘的音訊上下文。一通長達二十分鐘的電話,對這個檢查點來說並不是單一連續的上下文;它是一連串必須由周邊系統管理的區段。託管模型通常會替你處理這些紀錄管理工作。

第三點是你可以用它做什麼。Hugging Face 模型卡載明 openmdw-1.1 授權,而某些關於該發布的報導卻將其描述為僅限研究用途,NGC 容器頁面則將這些元件定位為可供商業或非商業使用。三個來源、三種不同解讀,而唯有授權條款文字為準。這種不一致,正是會在上市前三星期的法務審查中浮現的那類問題。在你著手建置之前就解決它,而不是之後。

第四項是營運。80 GB GPU 不是你可以在悠閒週日關掉的單項支出:即使流量為零,你還是得為這張卡付費,而且你得自己承擔擴充曲線、驅動程式升級、容量規劃,以及這條即時音訊路徑的待命輪值——在這裡,連線中斷就等於客戶流失。在你達到那一步的過程中,也沒有託管式備援可以依靠——Hugging Face 模型卡上的推論供應商欄位明確指出,沒有任何推論供應商部署這個模型,所以沒有這個檢查點的按分鐘計費版本可供製作原型。你要嘛自行託管,要嘛就不要用。這類工作在按分鐘計價的比較中看不見,但在招募計畫上卻非常顯眼。

大多數團隊其實真正該考慮的混合模式

讓這個決策變得可行的框架是:這兩個模型不必是二選一的二元選項。語音代理通常有一個語音層和一個推理層,而靈活性就在推理層。

GPT-Live-1 從設計上就是這樣打造的。它的語音層讓對話持續進行,而思考則透過 Responses API 委派給一般的文字模型——Ope​nAI 自己發布的 WebRTC 範例,就是將那個後端接到 GPT-5.6 Terra。你技術堆疊中的那一半只是一般的 API 呼叫,按 token 計價,而且供應商有真正的選擇。GPT-5.6 Terra 透過 OrcaRouter 提供服務,價格為每百萬輸入 token $2.00、每百萬輸出 $12.00,具備 1M token 的上下文,並同時開放 /v1/chat/completions 與 /v1/responses,與約 190 個其他可透過單一金鑰存取的模型並列。

這件事對自架專案特別重要,因為它會改變風險概況。如果你架起 Nemotron VoiceChat 11B,而它在你實際流量下撐不住,語音那一半就成了沉沒的 GPU 成本——但推理那一半可以搬移、容錯移轉,或拆分成用便宜模型處理例行回合、用強大模型處理升級情境,完全不必動到音訊路徑。當單一來源依賴中斷時,跨上游供應商的自動容錯移轉,就是糟糕的一下午與糟糕的一季之間的差別。

直接說清楚哪些東西在哪裡可用、哪些不可用:GPT-Live-1 和 Nemotron VoiceChat 11B 都不是由 OrcaRouter 提供的。兩者都來自各自的來源——一個是 OpenAI 的 Live Sessions 端點,另一個是你自己的 GPU。路由的槓桿完全在音訊的下游。

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

該以哪一個為基礎

• 若你想在本季就推出上線、若你需要不只一種語音、若你的對話經常持續超過兩分鐘的連續語境,或者若你的用量還不足以證明值得負擔一台閒置時仍在計費的 GPU,就選擇 GPT-Live-1。

• 若您已在使用 80 GB GPU,若您需要的是有實證而非僅憑宣稱的低於 500 毫秒輪替發言,若您基於資料落地考量而需要讓音訊留在自家基礎架構內,或者您的通話量已大到 API 每分鐘計費成為帳單上最大一筆費用,請選擇 NVIDIA Nemotron VoiceChat 11B。

• 在 API 上做原型,並對 checkpoint 做基準測試。這個決策取決於一個尚未公開的數字——每張 80 GB 顯卡可承載的並行工作階段數——而唯一能取得它的方法,就是在你自己的流量形態上實測。那是一週的工作量,而這正是站得住腳的基礎架構決策,與包裝成決策的憑空臆測之間的差別。