一張為「Gemini 3.8 TTS vs Breeze TTS 2」生成的主視覺卡片,背景為白色,帶有柔和的藍色與青色漸層點綴。左側卡片「Gemini 3.8 Flash TTS」列出 Elo 1,260、排名第 2、8 種競技場語音、語音設計,以及每 100 萬字元(正規化後)16.50 美元;右側卡片「Breeze TTS 2」列出 Elo 1,204、排名第 9、開放權重、30 億參數,以及每 100 萬字元 34.00 美元。頁尾一行寫著「Elo 資料來自 Artificial Analysis Provider Voice Arena,2026 年 9 月;價格資料來自 Google 與 BreezeBlue。」OrcaRouter 標誌合成於右下角。
Guides & Insights

Gemini 3.8 TTS 對決 Breeze TTS 2:授權條款,而非排行榜,決定了這一局

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

五十六點 Elo 積分將Gemini 3.8 Flash TTSBreeze TTS 2在 Artificial Analysis Provider Voice Arena 上隔開,而兩者的誤差範圍並未重疊:該廠商的模型以 1,260 的 Elo 位居第 2 名,涵蓋 1,999 個樣本與 8 種競技場語音,於 2026 年 9 月 23 日發布;Breeze TTS 2 則以 1,204 位居第 9 名,涵蓋 1,390 個樣本,於 2026 年 8 月發布。在價格方面,排序則徹底翻轉——Breeze 的標價為每百萬字元 34.00 美元(經標準化),而 Flash TTS 為 16.50 美元,因此稱霸榜單的模型在帳單上以大約兩倍的差距落敗。

如果比較就到此為止,那會是一篇簡短的內容,而你就會根據自己有多信任那 56 分的差距來做選擇。但這兩個模型並不是同一類的東西。Breeze TTS 2 是一個 30 億參數的開放權重模型,你可以自行下載、檢視並執行,而它的授權條款到頭來比它在排行榜上的名次更重要。Gemini 3.8 Flash TTS 則是一個 API 端點,具備語音設計與雙人對話功能,而且完全沒有權重。在兩者之間做選擇,其實是穿著基準測試外衣的授權與部署問題。

A generated comparison scoreboard for Gemini 3.8 Flash TTS and Breeze TTS 2, showing Arena Elo of 1,260 at rank 2 against 1,204 at rank 9, how you get each model (hosted API against model download), downloadable weights (no against 3B parameters), speakers per call (two against one), normalised price ($16.50 against $34.00 per 1M characters) and terms (vendor terms of service against a research and non-commercial licence).

每一個實際上是什麼

先弄清楚每個模型的特性,再來比較數字,因為除了 Elo 之外,它們幾乎在每個面向都不相同。

• 發佈方式 — Breeze TTS 2 可供下載:權重以 BreezeBlue/Breeze-TTS-2 之名發佈於 Hugging Face,並附帶 PyTorch 程式碼。Gemini 3.8 Flash TTS 則僅提供 API,可透過 Gemini API 及 9 月 23 日公告中提及的 Google 各介面存取。

• 規模 — Breeze TTS 2 是 3B 參數的模型,這正是它之所以能自行託管的原因。Google 並未公布兩款 Gemini 3.8 TTS 模型的參數數量。

• 語音建立 — Gemini 3.8 Flash TTS 能根據書面描述進行語音設計,並從 30 秒樣本複製語音。Breeze TTS 2 隨附一套供應商以千計的語音庫,以及自家的語音設計途徑;該途徑由供應商回報的角色契合度與指示遵循分數,屬於 BreezeBlue 自家的數據,並無獨立對應的評測。

• 對話 — Gemini 3.8 Flash TTS 可在單次呼叫中生成雙說話者對話,並具備輪次層級的風格設定。Breeze TTS 2 是單一語音模型;一段對話是由兩次執行拼接而成。

• 語言 — 依廠商自己的統計,Breeze TTS 2 涵蓋 50 種語言。Google 的發布公告則稱 Flash 模型支援 130 種語言,但這兩項數字衡量的並非同一件事,不應解讀為 130 對 50。

• 延遲 — BreezeBlue 聲稱串流延遲低於 40 毫秒;Google 並未公布 Flash TTS 的對等數據。這兩個數字都未經獨立驗證,而且其中只有一個存在。

授權條款才是真正的分岔路口

這正是排行榜無法向你呈現的部分,也是這兩個模型即便在品質有所重疊之處仍無法彼此替代的原因。

Breeze TTS 2 的權重是以 BreezeBlue 研究與非商業授權條款發布的。同一個儲存庫中的原始碼則是 Apache 2.0。這兩項事實並列在模型卡上,卻在大多數報導中被簡化成「開源」,而這種出錯的方向是要付出金錢代價的:程式碼採用 Apache 2.0,並不代表權重也是 Apache 2.0,而且該模型的商業使用是透過託管 API 進行,而非透過自行託管的檢查點。

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2, showing the research and non-commercial licence applied to the model weights, the Apache 2.0 licence on the accompanying source code, and a weights release date of 2026-08-25.

Google 這一邊完全沒有授權問題,因為根本沒有東西可授權。你買的是推論。你放棄的,正是開放權重通常被購入的理由——能在資料所在之處執行模型、能鎖定某個版本並持續保有它,以及不再按字元計費的能力。

所以,誠實的框架不是開放與封閉之爭。而是:

• 若你的部署必須將音訊保留在自家基礎架構內,Breeze TTS 2 是這兩者中唯一提供途徑的方案,而這條途徑就是研究授權。在據此打造產品之前,請先諮詢法律顧問。

• 如果你的部署方式能呼叫 API,授權問題便會消失,比較也會回歸到品質、價格與功能——而在這三者之中,Flash TTS 在其中兩項上佔有優勢。

• 如果你想要的是無需事先溝通就能商業化的開放權重,這兩個都不是那樣的模型,而競技場上還有其他列。

Elo 差距在何時有意義、何時沒有意義

56 分的差距落在此排行榜針對這兩列所回報的 ±16 與 ±16 信賴區間之外,因此這項排名並非像——比如說——Flash TTS 對上 Gemini 3.8 Flash-Lite TTS 那樣屬於雜訊。但競技場 Elo 只衡量一件事:在盲測比較中,聽者偏好兩段音訊中的哪一段。這是一項偏好訊號,經過彙總而成。

它沒有衡量到的,正是正式生產流程所在意的一切。它不會告訴你,兩個模型各自在處理 40 分鐘的腳本時如何不出現身分漂移、如何唸出你的產品名稱、當輸入包含電話號碼時會如何表現,或是當被要求處理訓練範圍以外的內容時,其失效模式會是什麼樣子。Breeze TTS 2 的 1,390 個樣本與 Flash TTS 的 1,999 個樣本,都大到足以讓整體結果穩定,也小到你的使用情境中沒有任何個別片段被納入其中。

一旦把你要求每個模型執行的任務納入考量,這個差距也比表面上看起來更小。Flash TTS 是在一次呼叫中處理兩位講者,這比 Breeze TTS 2 受評的任務更困難。這會讓那 56 分成為低估還是高估,取決於你的使用情境,而兩家廠商都尚未公布能讓此事定論的消融實驗。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples, and BreezeBlue Breeze TTS 2 Open Weights at rank 9 with an Elo of 1,204 across 1,390 samples, with Cartesia Sonic 3.6, Qwen-Audio-3.0-TTS-Plus, Inworld Realtime TTS-2, Speechify Simba 3.2 and Gemini 3.8 Flash-Lite TTS between them.

每一樣每小時要多少

這兩個價格數字並非可直接互相比較,而假裝它們可以,是關於這場對決的報導中最常見的錯誤。

Google 以權杖計費:輸入每百萬文字權杖 $0.50,輸出每百萬音訊權杖 $9.00,此價格適用至 2026 年 12 月 31 日,之後為 $18.00。Batch 和 Flex 的價格為 $0.25 和 $4.50;Priority 的價格為 $0.90 和 $16.00。同系列模型 Flash-Lite TTS 為 $0.50 和 $6.00,之後為 $12.00。

BreezeBlue 以字元計費:透過代管 API,每百萬個字元為 $34.00。

Artificial Analysis 將兩者都正規化為以每百萬字元為基準,好讓它們能共用同一份榜單,而 $16.50 對上 $34.00 就是這樣來的。這項正規化是該榜單做的,並非任何一家供應商的做法——Google 並未公布 Flash TTS 的每字元費率,而把 $16.50 當成報價、而非換算結果,正是人們最後收到帳單時大吃一驚的原因。

兩個值得事先規劃因應的後果:

• Flash TTS 的費率將於 2027 年 1 月 1 日翻倍。若以促銷價編列預算,與 Breeze TTS 2 的差距會急劇縮小;若以 $18.00 編列預算,則幾乎弭平。

• 自行架設 Breeze TTS 2 並不會讓它免費,而是讓它成為一項資本成本。3B 模型小到足以在一般硬體上執行,但這筆帳只有在用量夠大時才划得來,而且僅限於研究授權允許的使用案例。

選擇,而不假裝只有一個答案

決策樹很短。

如果你需要雙人對話、想要一個依描述設計並保留為 ID 的聲音、你的工作流程可以呼叫 API,而且你能事先規劃因應 12 月 31 日的費率變更,那就選 Gemini 3.8 Flash TTS。它在獨立排行榜上是更好的模型,在帳單上也更便宜;而對於本來就注定要透過 API 呼叫的使用情境來說,它是封閉的這件事並不是問題。

若資料落地或地端推論是硬性需求,若你需要一個真的下載得到的 3B 模型,或者你是在做研究而不是要推出產品——這正是其授權條款所針對的情況——那就選 Breeze TTS 2。別只因為它掛著開放權重的名號就選它;先讀授權條款。

而如果你正在評估這兩者,最省成本的做法就是讓這個選擇保持可逆。OrcaRouter 並未託管這兩個模型——要呼叫 Gemini 3.8 Flash TTS,得用 Google 自家的 API 以及 Google 指定的那些介面;要呼叫 Breeze TTS 2,則得用 BreezeBlue 的託管端點。路由器在此的價值在於堆疊的其他部分:200 多個模型只要一組金鑰,就能以供應商定價,且不加價,因此像一月費率調漲這樣的供應商價格變動,當天就會生效,而不必等到下一個計費週期,自動容錯移轉讓正在評估中的路徑不必同時是正式環境的路徑,還有一套路由 DSL,能在單一語音不夠用時把多個模型組成同一次呼叫。

一句話版本:排行榜說是 Google,授權條款說要看情況,而價格則說在你決定選用哪一個之前,先查一下你的行事曆。