
Gemini 3.8 TTS 對決 ElevenLabs:三倍價格能換來什麼
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
在相同用量下,ElevenLabs 的旗艦合成模型成本約為該廠商新款模型的三倍。ElevenLabs Eleven v3每千字元收費 $0.10——即每百萬字元 $100——而Gemini 3.8 Flash TTS每百萬音訊 token 收費 $9.00,Artificial Analysis 將其標準化為每百萬字元 $33.00。計費表上的差距是 3.0 倍,而這是這項比較中最重大的單一事實。耐人尋味的問題不在於這個差距是否真實,而在於每百萬字元多出來的六十七美元實際上買到了什麼,因為答案並不是「更優質的語音」。

三公尺,不是一公尺
首先必須釐清的是,這兩個產品衡量的並不是同一件事,而公布的價目表卻掩蓋了這一點。
• ElevenLabs 以字元計費。Eleven v3 每 1,000 個字元收費 $0.10,每次請求上限為 5,000 個字元。Eleven v3 Conversational 每 1,000 個字元收費 $0.05,而 Flash 與 Turbo 模型同樣每 1,000 個字元收費 $0.05,但請求上限為 40,000 個字元,並宣稱約 75 毫秒延遲,相較於 v3 Conversational 的約 280 毫秒。
• Google 以權杖計費,而音訊權杖並非文字權杖。Gemini 3.8 Flash TTS 的費用為每百萬個輸入文字權杖 $0.50,以及每百萬個輸出音訊權杖 $9.00,並以每生成一秒語音 25 個音訊權杖計量。目前並未公布每次要求的字元數上限。

• Artificial Analysis 對兩者都不計費;它做的是標準化。其 Provider Voice Arena 排行榜上每百萬字元 $100.00 與 $33.00 是推導出來的共同分母,好讓這個排行榜至少能依價格排名。適合用來算比率,不適合用來報價。
所以,3.0x 這個數字的誠實版本是:在唯一可用的同類比較基礎上,Google 的價格大約是三分之一。這對你自己的試算表意味著什麼,取決於你的工作負載是以短字串還是長字串為主——按秒計費的音訊計量和按字元計費的文字計量,會隨著語句變長而急遽分歧,因為靜音、停頓和韻律填充都會消耗音訊 token,卻不會消耗任何字元。
一個已完成工作的月份
將一百萬個字元的文字轉換成語音一次,這大約是一本中等長度小說的篇幅。
• ElevenLabs Eleven v3 — 語音合成費用為 $100.00,外加你需要依自身併發量運行它所選的方案層級。已公布的方案中,Starter 為 $6、Creator 為 $22、Pro 為 $99、Scale 為 $299、Business 為 $990,而字元額度已包含在這些方案內,而非另行計費。
• Gemini 3.8 Flash TTS — 相當於 $33.00,若這項工作可批次處理,則約為 $16.50,因為 Batch 與 Flex 方案會將音訊費率減半至每百萬個詞元 $4.50。Priority 服務則會將其提高到每百萬個詞元 $16.20,或約相當於 $59.40,仍遠低於 ElevenLabs。
• Gemini 3.8 Flash-Lite TTS — 每百萬音訊權杖 $6.00,以相同正規化基準計算約相當於 $22.10,代價是語言數量為 101 種而非 130 種。
把同樣的一百萬個字元以 Google 的促銷定價來計算,差距會進一步擴大,因為兩款新的 Gemini TTS 模型在 2026 年 12 月 31 日之前都是半價,之後價格會翻倍。任何根據九月數字建立商業案例的人,都是在把商業案例建立在一個已公布到期日的折扣上。

比較結果唯一會逆轉的地方,是非常短的語句。按字元計費的計量方式,對三個詞的確認幾乎收不到什麼費用;按秒計費的音訊計量方式,則會對說出那句確認所需的秒數收費,包括它周圍的靜默。如果你的產品是由單句回覆構成的語音介面,這筆帳就會偏向 ElevenLabs。如果它是旁白、有聲書、長篇本地化,或任何文字很長、音訊更長的情況,就會強烈偏向 Google。
品質問題,坦白說
在 Artificial Analysis Provider Voice Arena 上——針對各家供應商自家原生語音進行的盲測兩兩投票——這兩個模型差距懸殊,由 Google 領先。
• Gemini 3.8 Flash TTS — 排名第 2、Elo 1,260、17 分的區間、1,999 個樣本、8 種競技場語音,於 2026 年 9 月發布。
• ElevenLabs Eleven v3 — 排名第 17,Elo 1,167,11 分區間,4,345 個樣本,8 個競技場語音,在排行榜上列為 2026 年 2 月。
它們之間相差 93 點 Elo 積分,而不同於那個排行榜前三名之間的差距,這個差距是真實的:Eleven v3 的區間是 1,156 到 1,178,Gemini 的則是 1,243 到 1,277,兩者並無重疊。Eleven v3 的樣本數是 Gemini 的兩倍以上,因此這項估計也並不薄弱。
對價格論點來說,這是個確實很尷尬的結果,而且與顯而易見的結論相牴觸。ElevenLabs 收費是別人的三倍,在盲測偏好中卻低了十七位。無論多付的那六十七美元能買到什麼,在正面對決中,它都不是聽起來更好的聲音。
ElevenLabs 究竟在賣什麼
ElevenLabs 主要賣的並不是一個語音合成端點,而多數比較之所以出錯,就在於把它的定價當成那樣的端點來看待。這筆錢買到的是:
• 語音庫。ElevenLabs 的共享語音庫有數百種語音,並且是實實在在的產品介面——人們前來 ElevenLabs 往往是為了他們在某處聽到的特定語音,而不是其背後的模型。Gemini 3.8 Flash TTS 搭載 30 種內建的錄音室語音、一條可從自然語言描述生成語音的語音設計路徑,以及一條可從 30 秒樣本複製的複製路徑,並附有同意驗證、SynthID 浮水印和 C2PA 憑證。預設目錄較小;創建特定語音的能力則相當。
• 延遲等級各自成為獨立產品。Flash 和 Turbo 約 75 毫秒、40,000 字元上限,這與約 280 毫秒、5,000 字元的 v3 是不同的產品,而前兩者都比 v3 便宜。如果你的應用程式需要低於 100 毫秒,ElevenLabs 明確販售這一點,而 Google 的發表資料並未對這兩款新的 TTS 模型提出可相比擬的延遲聲明。
• 一個生態系。配音、語音代理、對話端點、附帶併發數的方案結構——這正是 Cartesia 販售電信服務的原因:它是一套技術堆疊,而不是一個模型。
如果你買的是套裝方案,3.0 倍就是你不自己組裝的代價。如果你買的是合成呼叫,你就是在為語音庫和延遲層級付費。
Google 實際上在賣什麼
反面論證比「更便宜」更狹隘,也更有力。
• 語言涵蓋範圍 — Flash TTS 支援 130 種語言,Flash-Lite TTS 支援 101 種,並會從文本自動偵測;相較之下,ElevenLabs 為 Eleven v3 記載的語言為 70 多種。就一輪在地化流程而言,這樣的差異不是功能比較,而是涵蓋範圍的落差。
• 指導 —— 逐行的語音交付控制、在單次呼叫中安排雙講者場景,以及寫入腳本中的非語言提示,例如 <laughs>、<sigh>、<gasp>、|mhm| 和 |yeah|。Google 聲稱 3.8 世代相較於 Gemini 3.1 Flash TTS,改善了長篇一致性與雙講者控制,而這正是這些功能存在的目的。廠商說法,未經重現。
• 語音狀態模型 —— 每個專案可擁有 200 個具狀態的自訂語音,存續時間(TTL)為一年;或使用無狀態語音,透過 voicekey_... 控制代碼來存取,並於七天後失效。這是一項你可以事先規劃的基礎架構決策。
• 輸出控制 — 一元端點上為 WAV 24 kHz 單聲道 16 位元有號 PCM,串流端點上為無標頭 PCM(audio/l16),以及可設定取樣率的 audio/mulaw 和 audio/alaw。
Google 的發布基準是由廠商自行提報,因此應以此角度解讀:在 Hume AI Voice Design Benchmark 上以 71.4 名列第一,在口音建模上以 60.8 排名第一,Flash 與 Flash-Lite 則分別在 Hume Overall Quality Index 上拿下第一與第二,並宣稱在日語、巴西葡萄牙語、越南語、現代標準阿拉伯語、墨西哥西班牙語與印地語中取得盲測偏好的頂尖名次。這些測試沒有任何一次是公開的。本文上方的 Arena Elo 是文中唯一獨立蒐集的數字,而它恰好與廠商宣稱的方向一致。
切換演算
如果你的工作負載屬於長篇、多語言,或用量大到讓 3.0x 成為一筆獨立列項,而且你能接受較小的預設語音目錄、以及沒有公布低於 100 毫秒的層級,那就切換吧。這涵蓋了旁白、配音、無障礙,以及大多數產品內嵌語音。
如果你買的是整套方案——語音庫、延遲分級、配音與代理產品——就繼續留用;或者你的工作負載以極短語句為主,而按秒計費的音訊計量讓你吃虧,也該留下。同樣地,如果你已在 ElevenLabs 上微調出使用者認得的聲音身分,也請留下,因為聲音的延續性本身就是產品特色,而在新模型上重新打造它則是一項專案。
無論走哪條路,明智的做法都是先在真實流量上同時運行一個月再做決定,而這也正是為何不該把任一方直接接進你的程式碼庫。OrcaRouter 以供應商原價、不加任何加成,讓 200 多個模型共用一組金鑰,因此任一實驗室的價格變動當天就會反映到你的帳單上,而不必等到續約,而且自動容錯移轉能讓正式環境的語音路徑持續運作,即使全新的端點出狀況也一樣。我們不代管 ElevenLabs——它的語音合成與代理層是它自家的產品——我們也不代管 Gemini 3.8 TTS 端點,那些來自 Google 的 API。我們所承載的是底下的文字層,以及其上的路由層。
值得關注的數字,是 Eleven v3 在下一次排行榜更新中的 Elo。對於一個收費高出三倍的模型而言,九十三分是相當大的劣勢;而若信賴區間收窄、差距卻未隨之縮小,價格這個論點就不再是一樁交易,而會變成一紙定論。
