在白色背景上為「Gemini 3.8 TTS vs VoxCPM2」生成的宣傳主視覺卡片,帶有柔和的藍青色漸層點綴。左側卡片「Gemini 3.8 Flash TTS」列出了 API 端點、Elo 1,260、排名第 2,以及每 100 萬個正規化字元 16.50 美元;右側卡片「VoxCPM2」列出了 Apache 2.0、20 億參數、執行時約需 8 GB VRAM、在純 PyTorch 下即時因子為 0.30,且沒有代管端點。頁腳一行寫著「Elo 數據來自 Artificial Analysis Provider Voice Arena,2026 年 9 月;VoxCPM2 數據來自其模型卡。」OrcaRouter 標誌合成於右下角。
Guides & Insights

Gemini 3.8 TTS vs VoxCPM2:租用語音,還是自行運行?用真實數字來看

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

沒有任何排行榜的欄位會把Gemini 3.8 Flash TTSVoxCPM2並列在一起,而這個缺席正是這項比較中最有用的事實。Gemini 3.8 Flash TTS 是一個託管式端點,在 Artificial Analysis Provider Voice Arena 上以 1,260 的 Elo 位居第 2 名,並有以 token 計價的公開價目表。VoxCPM2 是 OpenBMB 的檢查點——20 億個參數、Apache 2.0、2026 年 4 月發布——沒有任何推論服務供應商代管。你無法租用它。你得自己跑。

所以問題不在於哪個模型聽起來更好,而在於你的工作負載,是為別人的 GPU 按字元付費會得到更好的服務,還是自己擁有 GPU、並且無論它們是否在工作都為此付費,會得到更好的服務。這是一個算術問題,而且和大多數模型比較不同,它在你要投入之前就有一個可以計算出來的答案。

A generated comparison scoreboard for Gemini 3.8 Flash TTS and VoxCPM2, showing access (a hosted API against self-hosted only), size (undisclosed against 2B parameters), licence (vendor terms against Apache 2.0), price ($16.50 per 1M characters against a GPU-hour cost), throughput (not applicable against a real-time factor of 0.13 to 0.30) and independent Elo (1,260 against none).

其中一個是租來的,另一個則由你操作

從每一個實際交到你手上的東西開始。

• 存取 — Gemini 3.8 Flash TTS 僅提供 API,須透過 Gemini API 及其 2026 年 9 月 23 日公告中所指名的 Google 平台來呼叫。VoxCPM2 在正式環境中沒有第一方端點,也沒有推論供應商提供服務;檢查點本身就是產品。

• 授權條款 — VoxCPM2 以 Apache 2.0 授權發布,允許商業使用,無需另行簽訂協議。這確實是相當寬鬆的授權條款,而且並非開放語音權重的預設做法——其中有數個是以僅限研究用途的條款發布,使得商業使用必須回頭透過託管 API 來進行。

• 大小 — VoxCPM2 為 2B 參數,在降低精度下約佔 8 GB 的 VRAM 即可供開發使用,而在 24 GB 的顯示卡上服務峰值約為 22 GB。Google 尚未公布任何一款 Gemini 3.8 TTS 模型的參數量。

• 語音建立 — Gemini 3.8 Flash TTS 能依文字描述進行語音設計、從 30 秒樣本複製語音,並在一次呼叫中完成雙講者對話。VoxCPM2 是單一語音的文字轉語音模型;一段對話需將兩次執行拼接而成。

• 獨立評分——Flash TTS 有這項分數。VoxCPM2 並未出現在 2026 年 9 月 24 日擷取的 Provider Voice Arena 排行榜排名列之中。未登上榜單並非對品質的論斷——這通常意味著還沒有人提交該模型——但這確實意味著沒有第三方偏好分數可供衡量。

A screenshot of the Hugging Face model card for OpenBMB/VoxCPM2, showing the Apache 2.0 licence, the 2 billion parameter checkpoint size, the 30-language coverage, 48 kHz output and the 2 million hours of training audio recorded on the card.

最後這點是雙面刃,值得直說而非輕描淡寫帶過:如果你在做出承諾前需要一個獨立的品質訊號,這兩者中只有一方能提供。

決定一切的數字:即時因子

自行託管語音模型會把按字元計費的帳單,轉換成按 GPU 小時計費的帳單,而這兩種單位之間的匯率,就是模型的即時因子——也就是產出一秒音訊需要多少秒的運算時間。

VoxCPM2 公布的數字在純 PyTorch 下是 0.30,在 Nano-VLLM 下是 0.13。這些數字應理解為吞吐量,而非延遲:在 0.13 時,以實際時間計的一 GPU 小時可產生約 7.7 小時的成品音訊。在 0.30 時,同樣一 GPU 小時則接近 3.3 小時。這些都是模型卡本身提供的數字,由 OpenBMB 實測,而且是此處任何自建或外購決策中最重要的單一輸入。

由此可以得出三件事。

• 服務堆疊比模型更重要。在相同硬體上,從單純的 PyTorch 改用 Nano-VLLM,吞吐量會提升超過一倍。任何根據 0.30 這個數字建立的成本模型,都會將自架成本高估約 2.3 倍。

• 利用率才是關鍵。一張有 90% 時間閒置的租用 GPU,無論價格多低,都不會比 API 便宜。只有當你讓這張卡持續運轉,損益平衡點才會出現。

• 批次處理再次改變了計算方式。即時因子是依每條串流個別測量的;而一台處理並行請求的伺服器會將固定成本攤銷到這些請求上,這正是自架開始勝出的情境。

一小時音訊的成本,雙向皆然

把兩種計費模式放在同一個基準上。一小時成品音訊就是 3,600 秒的產出。

在租用端,Google 以 token 而非字元計費:每百萬個輸入文字 token 為 $0.50,每百萬個輸出音訊 token 為 $9.00,至 2026 年 12 月 31 日止,之後為 $18.00;Flash-Lite TTS 則為 $0.50 和 $6.00,之後為 $12.00。Batch 和 Flex 的 Flash TTS 收費為 $0.25 和 $4.50,而 Flash-Lite TTS 為 $0.25 和 $3.00;Priority 則收費 $0.90 和 $16.00。Artificial Analysis 將標準費率標準化為每百萬字元 $16.50 和 $11.00,這是該排行榜的換算,而非 Google 的報價;在與以字元計費的模型比較時,應使用這個數字。

在自建這一側,根本沒有所謂按字元計價的費率。成本是 GPU 小時,乘上你在上述吞吐量下所需的時數,再加上服務堆疊,再加上維持它運作的人力。VoxCPM2 的優勢在於,第一千小時的邊際成本和第一小時一樣;而它的劣勢在於,第一小時的邊際成本是一張 GPU。

這就是為什麼這個決定格外乾淨俐落:

• 在某個用量以下,API 勝出,而且差距還不小。你每小時的音訊只需支付個位數美元,而不是一筆資本成本,而 Google 的促銷費率讓這個差距在 2027 年 1 月 1 日之前更加擴大。

• 超過那個用量之後,在你已擁有且能持續保持忙碌的硬體上,Apache 2.0 檢查點會決定性勝出——而且不同於研究授權的檢查點,其授權條款完全不會妨礙你將它正式推出。

• 介於兩者之間,老實說,你買到的是選擇權,而不是節省。自架讓你能夠鎖定版本、把音訊留在自己的基礎架構上,並且不必再在意供應商的費率變動。

其中每一個都是正確答案

當你想要文件更完善的產品時,就選 Gemini 3.8 Flash TTS。它具備獨立評分、公開價格、單次呼叫中的雙講者對話、語音設計與複製,而且除了 API 金鑰之外沒有任何營運介面。它的同系列產品 Flash-Lite TTS 在同一介面內提供第二個價格點,正規化後為每百萬字元 $11.00。你換來的是 2027 年 1 月 1 日費率翻倍,以及無法在任何地方執行該模型。

當營運工作本身就是重點時,就選 VoxCPM2。Apache 2.0 意味著商業使用直接被允許,2B 的規模意味著單一加速器就足夠,而在 Nano-VLLM 下 0.13 的即時因子意味著一張普通的顯示卡每小時實際時間就能產出數小時的音訊。你要接受的是,沒有其他人會替你運行它:沒有託管端點、沒有 Arena 排名列、沒有廠商價目表,而你所獲得的每一項品質保證,都是你自己打造並測量出來的。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, with Gemini 3.8 Flash-Lite TTS at rank 6 and no VoxCPM2 row on the board.

這兩個模型都不是由 OrcaRouter 代管的,而這一點值得直接說清楚,而不是含糊暗示並非如此。要呼叫 Gemini 3.8 Flash TTS 的地方,是 Google 自家的 API 以及 Google 指定的那些介面;VoxCPM2 則是你自行部署的檢查點。OrcaRouter 涵蓋的是這個決策之上的那一層——200 多個模型用一把金鑰即可取用以供應商定價且不加價,因此廠商價格一有變動,我們這邊當天就會生效,而不是等到下一個帳單週期,自動容錯移轉讓正在評估中的模型永遠不必成為正式環境的相依項目,還有一套路由 DSL,能在單一語音無法承擔整項工作時,把多個模型組合成一次呼叫。

接下來要看什麼

有兩件事會使這項比較出現實質改變,而這兩者都尚未發生。

第一個是有人在代管 VoxCPM2。它未出現在推理市場,是這兩個模型目前以經濟效益而非品質進行比較的主因——如果有供應商採用它,租用與自有的盤算就不再是決定性因素,而競技場中缺少的那一列,就會變成你想要補上的東西。

第二點是 Google 那邊一月的費率調漲。在優惠費率下,API 便宜到大多數工作負載都不該自架任何東西;到了優惠期後的費率,差距會縮小到一個程度,讓已有 GPU 資源且用量穩定的團隊應該重新試算,而不是理所當然地認為 API 仍然勝出。

在其中一項出現變動之前,決定性輸入並不是排行榜,而是你每個月製作多少小時的音訊,以及這張卡是否忙碌。