
Eleven v4 與 Gemini 3.1 Flash TTS 對比:116 分的差距,以及更便宜的 Google 模型
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 982 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 197 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
今天若要為 Google 的聲音挑選方案,你會挑錯那一個。Google Gemini 3.1 Flash TTS在 Artificial Analysis 的 Provider Voice Arena 中排名第 11,Elo 為 1,203,共出現 3,512 次,價格為每百萬字元 18.31 美元。ElevenLabs Eleven v4於 2026 年 9 月 28 日發布,以 Elo 1,319、1,674 次出現次數位居第 1 名,價格為每百萬 80.00 美元。這看起來像是對上更便宜挑戰者的 116 分差距——直到你注意到 Google 自家的 Gemini 3.8 Flash TTS 在同一榜上排名第三,Elo 為 1,267,標準化價格也更低,為 16.49 美元。真正的較量並非頭條對決所暗示的那一場,而原因在於一個發布日期。
其中一個比它看起來新了十八個月
在排行榜上,Gemini 3.1 Flash TTS 的發布日期為 2026 年 4 月 15 日。Eleven v4 則標示為 2026 年 9 月 28 日。兩者相隔五個半月,這在語音合成領域算不上一個世代,但已足夠長,讓 Google 早已推出後繼產品:Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS 均於 2026 年 9 月 23 日正式推出,比 Eleven v4 早五天,且兩者在同一排行榜上的排名都高於 3.1。Gemini 3.8 Flash-Lite TTS 以 1,241 名列第六,價格為每百萬 11.03 美元。

所以,誠實的比較有三個重點,而不是兩個,而依價格排序才是有趣的部分:
• 排名第 1,ElevenLabs Eleven v4 — Elo 1,319,每百萬個字元 80.00 美元,1,674 次出現,±19 區間
• 第 3 名,Google Gemini 3.8 Flash TTS — Elo 1,267,每百萬個字元 16.49 美元,於 2026 年 9 月 23 日發布
• 第 6 名,Google Gemini 3.8 Flash-Lite TTS — Elo 1,241,每百萬字元 11.03 美元,於 2026 年 9 月 23 日發布
• 排名第 11,Google Gemini 3.1 Flash TTS — Elo 1,203,每百萬字元 $18.31,發布於 2026 年 4 月 15 日,3,512 次出現,±12 區間
注意這些區間對那個排序造成的影響。Gemini 3.1 Flash TTS 估計為 1,203,區間為 ±12,因此它的真實數值大約落在 1,191 到 1,215 之間。Eleven v4 估計為 1,319,區間為 ±19——大約是 1,300 到 1,338。這兩個範圍並未相接,而且它們之間的差距超過一百分。這已經是偏好榜所能呈現的最乾淨結果了。

為什麼樣本數比排名更重要
Gemini 3.1 Flash TTS 的估計背後有 3,512 次出現紀錄;Eleven v4 則有 1,674 次,因為它在這個排行榜上才剛滿一天。較新的模型,其估計每個樣本所承載的不確定性更高,而 ±19 的區間正反映了這一點。如果你是那種會等到數字穩定下來才行動的買家,經驗法則就是:排序優先於區間寬度,那才是你能據以行動的部分。在這裡,排名在兩個方向上都穩穩經得起誤差條的檢驗——領先 3.8 Flash TTS,且在這項比較中不落後於任何人。
競技場也會計入競技場語音數:Eleven v4 有八個,Gemini 3.1 Flash TTS 有七個。這是在盲測中所使用的不同廠商語音數量,也是粗略衡量一家廠商能提供多少預設配音陣容的指標。Eleven v4 的第一名是以八個語音贏得的,這表示這場勝利並非只靠一位幸運的旁白。
Elo 未予定價的能力差異
這些排行榜衡量的是偏好,而非功能涵蓋範圍。四項差異決定實際專案,而它們沒有一項會出現在 Elo 中。
• 腳本指示 — Eleven v4 會說明行內音訊標籤([laughs]、[whispers]、[said angrily in French accent])以及自然語言的詮釋提示;Google 的 3.1 生成功能會說明語音選擇與提示方式,但沒有等效的標籤語法可用於演出指示。
• 語音建立 — Gemini 3.8 世代新增了從文字描述進行語音設計,以及從 30 秒樣本進行語音複製的功能,並在輸出上加入浮水印和來源追溯中繼資料。Gemini 3.1 Flash TTS 早於此,並搭載一組預建的語音集。
• 從真實音訊進行複製——Eleven v4 的 Instant Voice Cloning 只需十秒音訊即可運作,其上還有專業級方案。Google 在 3.8 世代中的複製路徑則要求 30 秒,並加入同意驗證。不同的門檻,不同的同意機制。
• 每次請求的輸入上限 — Eleven v4 載明為 10,000 個字元。Google 的 TTS 模型以權杖而非字元計費,因此沒有可同比的每次請求字元上限,實在不應把這兩種計量方式並列,彷彿它們能夠直接相較。
最後那一點,正是讓採購試算表出錯的地方。ElevenLabs 以每 1,000 個字元報價。Google 則以每百萬個 token 報價,輸入與輸出皆然。Artificial Analysis 把兩者都正規化到以每百萬字元為單位的軸線上——這就是 $80.00 和 $18.31 的由來——但這項正規化是該排行榜的換算,不是任何一家供應商的發票。用它來排名,而不是用來預測。

v4 費率表對這項比較有何影響
有兩週時間,上述的價格比較錯誤地偏向 ElevenLabs,接著又錯誤地對它不利。在 ElevenLabs 的 API 定價頁面上,Eleven v4 列為每 1,000 個字元 $0.022,對比標示的原價 $0.08,並標註為 10 月 12 日前享 72% 折扣。Eleven v4 Turbo 列為 $0.011,對比 $0.04。10 月 12 日之後,促銷數字會消失,而每百萬 $80.00 的牌價會成為你實際支付的費率。
以每月五百萬字元來算一筆帳。Eleven v4 在優惠期間要價 $110,優惠過後則是 $400。Gemini 3.1 Flash TTS 以該看板所列的 $18.31 標準化價格計算,同樣一個月約為 $92——比促銷價還便宜,更只要定價的大約四分之一。一支在九月做基準測試、十一月才出貨的團隊,等於是在一個早已不存在的數字上做出了決定。
路由何處適用,何處不適用
這兩個模型都不在 OrcaRouter 的目錄中。這裡沒有 ElevenLabs 端點,也沒有 Google TTS 端點可供呼叫,而對於「我要怎麼透過你來存取它們」這個問題,誠實的答案是:你無法透過我存取。Eleven v4 是透過 ElevenLabs 自家的 API 存取,而 Gemini 3.1 Flash TTS 則是透過 Google 的 API。說任何其他話都是在虛構一項整合。
在這樣的比較中,單一金鑰的價值就在於決策本身。如果你正在權衡每月 400 美元的端點與每月 92 美元的端點,答案取決於你自己的腳本、你自己的語言,以及你自己的監聽器——而要得到這個答案,就必須以同一段程式碼路徑、相同的請求格式來呼叫兩者,而不是為了跑一次測試就架起兩套供應商整合。OrcaRouter 正是涵蓋了這一層:200 多款模型收在同一個金鑰之後,供應商的定價以0% 加成原樣傳遞,因此供應商的價格變動會在生效當天就反映出來,另外還有自動容錯移轉,可在評估過程中某個上游服務效能下降時接手。
誰應該選哪個
當語音本身就是產品時,就選 Eleven v4。它以 116 分領先排行榜,且區間比其下的模型更乾淨;它是兩者中唯一具備可用於效能指示的內嵌標籤語法文件者,而它的克隆門檻是十秒,而非三十秒。溢價是真的——是標價中標準化價格的四倍——而它買到的是排行榜的頂端。
只有在已經決定採用 Gemini 3.1 Flash TTS 時,才選擇它。它是一款已推出五個月的預覽世代模型,分數低於 Google 自家九月發布的版本,正規化價格卻更高;唯一值得保留它的理由,是既有整合的慣性。如果你有這種慣性,留在 Google 生態系內遷移到 3.8 Flash TTS,就能在不更換供應商的情況下換得 64 點 Elo 分數,以及更低的正規化價格——這是升級同時也是更便宜選項的罕見情況。
對其他人來說,眼下真正的問題是 Eleven v4 對上 Gemini 3.8 Flash TTS,而答案是一場貨真價實的取捨,而不是排名:一邊是 52 點 Elo 和標籤語法,另一邊是每字元大約只有五分之一的成本。10 月 12 日之後,當 ElevenLabs 的促銷結束、你實際要付的就是這個價差時,用同一批腳本把兩者都跑一遍。
