「GPT-Live-1 對決 VoxCPM2」的主視覺標題卡,副標為「一場租來的對話,還是一張你自己擁有的 GPU」,搭配一枚標籤寫著「一個是全雙工,一個是文字轉語音——工作性質不同」,以及三張卡片:「GPT-Live-1 — 每語音分鐘 $0.05,僅提供 API,無需安裝任何東西」、「VoxCPM2 — Apache-2.0,20 億參數,約 8 GB VRAM,沒有任何推論服務供應商部署它」,以及「自架吞吐量 — 在 RTF 0.13 下,每 GPU 小時約可產生 7.7 小時音訊,過去 30 天下載次數 393,079 次」,上方疊著一條頁尾橫條寫著「VoxCPM2 基準數據由 OpenBMB 提供;GPT-Live-1 語音數據由 OpenAI 提供且未經重現。」OrcaRouter 標誌合成於右下角。
Engineering & Research

GPT-Live-1 對比 VoxCPM2:一個每分鐘花費 0.05 美元,另一個則需要一張 24 GB 的 GPU

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

比較 GPT-Live-1 與 VoxCPM2 最乾淨俐落的方式,就是注意到:除非你把硬體換算成具體數字,否則它們看起來只像是競爭對手。GPT-Live-1 是 OpenAI 的全雙工語音模型,自 2026 年 9 月 10 日起已在 API 中提供,每分鐘語音收費 0.05 美元,無須安裝任何東西。VoxCPM2 則是 OpenBMB 的 20 億參數開放權重文字轉語音模型,於 2026 年 4 月以 Apache 2.0 釋出,執行時約需 8 GB 的 VRAM,而且沒有任何推論服務供應商部署它——所以如果你想用它,就得自己擁有機器。一個是你按秒租用的對話;另一個是你自己操作的合成器。問題不在於哪個更好,而在於你的工作負載實際上能吸收哪一個。

A two-column scoreboard titled 'GPT-Live-1 vs VoxCPM2 - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Access: hosted API, no weights', 'Price: $0.05 per voice minute', 'Independent score: 69.8% on the AA Speech to Speech Index', 'Hardware you need: none', 'Catch: delegated reasoning bills separately'. Right column VoxCPM2: 'Job: text-to-speech', 'Access: Apache-2.0 weights, self-host only', 'Price: $0 per call plus a GPU', 'Independent score: none, OpenBMB benchmarks only and contested by third-party runs', 'Hardware you need: ~8 GB VRAM, 22 GB peak when serving', 'Catch: no inference provider deploys it'. Footer: 'GPT-Live-1 voice figures OpenAI-reported; VoxCPM2 figures are the model card's own.'

兩款模型,兩項任務,各自一句誠實的規格說明

• 功能——GPT-Live-1 進行對話:它同時聆聽與說話、輪流發言、處理打斷與回饋訊號,並回傳逐字稿。VoxCPM2 則將文字轉為語音。它什麼都聽不見。

• 存取方式 — {{1}}GPT-Live-1{{/1}} 為封閉式託管服務,只要在 Live Sessions 端點後方帶上一個模型 ID 即可使用,而官方發佈的整合範例是透過 WebRTC 運作。{{2}}VoxCPM2{{/2}} 則是可從 Hugging Face 與 ModelScope 下載的檢查點,採 Apache 2.0 授權,可免費用於商業用途。

• 價格 — GPT-Live-1 為每語音分鐘 $0.05,按秒計費,而委派後端另行計量。VoxCPM2 為每次呼叫 $0,外加一張 GPU,開源代管就是全部的費用模式。

• 資源佔用 — GPT-Live-1 不需要你的任何硬體。VoxCPM2 則需要約 8 GB 的 VRAM(Q4 下為 6–8 GB)、Python 3.10+、PyTorch 2.5+ 以及 CUDA 12+。

• 基準測試 —— GPT-Live-1 的每一項語音數據都出自 OpenAI,且未經重現;唯一的獨立排行榜將其列於十一名中的第七名。VoxCPM2 公布的數字屬於 OpenBMB,而針對其多語言宣稱的現有獨立測量結果則指向相反方向。

24 GB 的問題,已定價

VoxCPM2 的服務效能數字,才是決定自行代管究竟只是玩票,還是能登上正式架構的關鍵。在單張 RTX 4090 上,該模型在純 PyTorch 下即時因子約為 0.30,走 Nano-VLLM 路徑則約為 0.13——也就是說,在較快的配置下,每小時 GPU 時間大約可生成 7.7 小時的音訊。這些是模型卡自身提供的數字,而非外部實測;一份在 4090 搭配 CUDA 12.9 上驗證過的獨立服務配方則回報,零樣本合成的穩態即時因子約為 0.120,聲音複製約為 0.139,峰值 GPU 記憶體接近 24 GB 中的 22 GB。這兩組數字都是穩態而非冷啟動——全新行程中的第一個請求要慢得多,而人們說這個模型不能用時,引用的正是那個數字。

把那擺在 API 旁邊看。GPT-Live-1 每分鐘 $0.05,連續對話一小時就是 $3.00。在公開市場租一張 24 GB 顯示卡,每小時落在個位數低段的美元,而自己擁有一張、把使用率算進去之後,攤提下來也差不多。所以這個比較的結果,就跟這類比較通常的落點一樣,只差一個令人不舒服的不對稱:GPU 帳單不管有沒有人跟你的產品對話都會來,而 API 帳單在冷清的日子會縮到零,在忙碌的日子則會衝到五位數。固定型錄的批次合成,完美適合 GPU。全天候開通的電話線,則完美適合計費表。

VoxCPM2 能做到哪些其他開源方案都做不到的事

VoxCPM2 之所以值得如此關注,不是因為它在基準測試中勝出——它大多並沒有——而是因為它能完全不需要任何參考音訊,僅憑文字描述設計出聲音。這在開放權重中是一項真正全新的能力,也改變了任何需要一種尚不存在之聲音的人的工作流程:用文字描述來試聽、用文字描述來反覆調整,然後才決定是否要複製。在此之上,它還支援 30 種語言加上九種漢語方言、透過內建超解析度階段輸出 48 kHz,以及只需 5–10 分鐘的音訊就能進行微調。

證據基礎比功能清單更薄弱。OpenBMB 自家的報告給出英文詞錯誤率 1.84%、中文字元錯誤率 0.97%,以及在 30 種語言上平均 1.68% 的錯誤率;這些數據是在其自家每語言 500 句的測試集上測量,並由另一家廠商的模型評分。在有獨立測試的地方,差距很大:在 MiniMax 的多語言測試集上、以 Whisper-large-v3 評分時,印地語為 19.70,阿拉伯語為 13.05——比自我報告的數字差了數倍。OpenBMB 也警告,語音設計與風格控制在不同次執行之間會產生變動的結果,並建議生成一到三次以得到你想要的輸出,這是在委婉地表示:可用的結果,其每次呼叫成本並不是一次呼叫。

沒有人會納入比較的整合稅

有一個不起眼的細節,決定了 VoxCPM2 是一週的工作量還是一個月。它的 Hugging Face 儲存庫被標記為 voxcpm 而非 transformers,這意味著該網站上幾乎所有其他項目用來載入的函式庫,都無法載入這個模型。修正這個問題的 pull request 已於 2026 年 8 月 4 日開啟,而我們最後查看時仍未合併。將它加入其他 serving stack 的 pull request 則已經合併,而其採用程度也毋庸置疑:截至本次截取時,過去三十天內有 393,079 次下載,並有 27 個 adapter、30 個 finetune、12 個量化版本,以及 100 個建構於該 checkpoint 之上的 Space。

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, captured September 2026: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data', with 1.6k likes, 4.95k followers, 393,079 downloads last month, 2B params in BF16, 27 adapter models, 30 finetunes, 12 quantisations, and an Inference Providers panel reading 'This model isn't deployed by any Inference Provider.'

GPT-Live-1 的等效稅是一項傳輸重寫。其工作階段是圍繞即時連線而非請求-回應音訊端點建構的,而雙重計費意味著每一次委派的推理呼叫、工具呼叫和網頁搜尋,都會在語音分鐘數之上,按後端模型自身的費率計費。從以 token 計量的即時整合遷移的團隊,應將此遷移視為一項工程任務來編列預算,而不是替換模型 ID。

路由層實際上有幫助的地方

OrcaRouter 既不提供 GPT-Live-1,也不提供 VoxCPM2,這件事值得直說,而不是讓本節其餘內容暗示並非如此。GPT-Live-1 的語音層位於 Ope​nAI 自家端點之後;VoxCPM2 則完全沒有任何託管供應商。這兩者都不是你能用我們的 key 呼叫的東西。

路由這個問題之所以仍會出現,是因為這兩個模型都位在一條中段為文字的管線邊緣。VoxCPM2 部署通常是在為某個東西服務——腳本產生器、翻譯步驟、文字正規化工具、決定接下來要說些什麼的對話模型——而這些都是尋常的模型呼叫。GPT-Live-1 工作階段把思考委交給工作階段設定中指定的後端模型,而在 OpenAI 自家的文件裡,那個後端就是 GPT-5.6 Terra,可透過 OrcaRouter 以 OpenAI 的定價取得。用戶端委派又更進一步,讓你自己的應用程式提供後端,這意味著聲音背後的模型可以是任何你能控制的端點。約有 190 個來自十一家上游供應商的模型,都位於 一把按定價計費、零加成的金鑰之後——因此當供應商降價時,這裡當天就會生效,而不是等到續約時才調整——還具備跨供應商的自動容錯移轉,以及能把多個模型組成單次呼叫的路由 DSL。對於整個堆疊中變化最頻繁的那一半來說,這是筆便宜的保險。

有一項提醒應該放在本節,而不是被埋在其中,因為正是這個細節,讓這項比較中 GPT-Live-1 的那一半,比其廠商基準測試所暗示的更未有定論。在獨立的 Artificial Analysis Speech to Speech Index 上,GPT-Live-1 得分 69.8%——在十一款中排名第七,落後於 73.9% 的 GPT-Realtime-2.1 和 79.0% 的 Gr​ok Voice Think Fast 2.0。以每小時輸入音訊 $4.42 計算,該模型是那個排行榜上最便宜的,但它並不是最好的。請為這種可能性做好準備:你最終標準採用的語音層,未必是你會一直保留的那一個。

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with a cost chart placing GPT-Live-1 at $4.42 and GPT-Realtime-2.1 at $10.75 per hour of input audio.

哪一個,做什麼用的?

如果文字比音訊更早存在,就選 VoxCPM2。旁白、有聲書、配音、無障礙、遊戲語音台詞,一個需要還沒有人錄過的聲音的產品——尤其是任何量大、可預測,且值得投入固定資本成本的工作負載。要接受你得自己跑它,接受它周邊的工具鏈仍在逐步穩定,也接受其多語言品質的說法值得你在交到客戶手上之前親自做聆聽測試。

如果另一端是人,就採用 GPT-Live-1。語音代理、電話支援、進件流程,任何模型必須即時判斷對方是否已說完話的情境。支付每分鐘費率,換取不必自己扛下這個問題的特權,並把委外的後端編列為獨立項目,因為那正是通話成本變便宜或變昂貴的地方。

錯誤在於把它們當成同一場評比中可互相替代的選項。對大多數兩者都需要的團隊來說,它們是同一個產品的兩個層次;而唯一真正錯誤的答案,是因為授權條款寫著免費,就選擇自架版,卻沒把讓這件事成立的 GPU 成本算進去。