
Gemini 3.8 TTS 對決 Breeze TTS 2:授權條款,而非排行榜,決定了這一局
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
五十六點 Elo 積分將Gemini 3.8 Flash TTS與Breeze TTS 2在 Artificial Analysis Provider Voice Arena 上隔開,而兩者的誤差範圍並未重疊:該廠商的模型以 1,260 的 Elo 位居第 2 名,涵蓋 1,999 個樣本與 8 種競技場語音,於 2026 年 9 月 23 日發布;Breeze TTS 2 則以 1,204 位居第 9 名,涵蓋 1,390 個樣本,於 2026 年 8 月發布。在價格方面,排序則徹底翻轉——Breeze 的標價為每百萬字元 34.00 美元(經標準化),而 Flash TTS 為 16.50 美元,因此稱霸榜單的模型在帳單上以大約兩倍的差距落敗。
如果比較就到此為止,那會是一篇簡短的內容,而你就會根據自己有多信任那 56 分的差距來做選擇。但這兩個模型並不是同一類的東西。Breeze TTS 2 是一個 30 億參數的開放權重模型,你可以自行下載、檢視並執行,而它的授權條款到頭來比它在排行榜上的名次更重要。Gemini 3.8 Flash TTS 則是一個 API 端點,具備語音設計與雙人對話功能,而且完全沒有權重。在兩者之間做選擇,其實是穿著基準測試外衣的授權與部署問題。

每一個實際上是什麼
先弄清楚每個模型的特性,再來比較數字,因為除了 Elo 之外,它們幾乎在每個面向都不相同。
• 發佈方式 — Breeze TTS 2 可供下載:權重以 BreezeBlue/Breeze-TTS-2 之名發佈於 Hugging Face,並附帶 PyTorch 程式碼。Gemini 3.8 Flash TTS 則僅提供 API,可透過 Gemini API 及 9 月 23 日公告中提及的 Google 各介面存取。
• 規模 — Breeze TTS 2 是 3B 參數的模型,這正是它之所以能自行託管的原因。Google 並未公布兩款 Gemini 3.8 TTS 模型的參數數量。
• 語音建立 — Gemini 3.8 Flash TTS 能根據書面描述進行語音設計,並從 30 秒樣本複製語音。Breeze TTS 2 隨附一套供應商以千計的語音庫,以及自家的語音設計途徑;該途徑由供應商回報的角色契合度與指示遵循分數,屬於 BreezeBlue 自家的數據,並無獨立對應的評測。
• 對話 — Gemini 3.8 Flash TTS 可在單次呼叫中生成雙說話者對話,並具備輪次層級的風格設定。Breeze TTS 2 是單一語音模型;一段對話是由兩次執行拼接而成。
• 語言 — 依廠商自己的統計,Breeze TTS 2 涵蓋 50 種語言。Google 的發布公告則稱 Flash 模型支援 130 種語言,但這兩項數字衡量的並非同一件事,不應解讀為 130 對 50。
• 延遲 — BreezeBlue 聲稱串流延遲低於 40 毫秒;Google 並未公布 Flash TTS 的對等數據。這兩個數字都未經獨立驗證,而且其中只有一個存在。
授權條款才是真正的分岔路口
這正是排行榜無法向你呈現的部分,也是這兩個模型即便在品質有所重疊之處仍無法彼此替代的原因。
Breeze TTS 2 的權重是以 BreezeBlue 研究與非商業授權條款發布的。同一個儲存庫中的原始碼則是 Apache 2.0。這兩項事實並列在模型卡上,卻在大多數報導中被簡化成「開源」,而這種出錯的方向是要付出金錢代價的:程式碼採用 Apache 2.0,並不代表權重也是 Apache 2.0,而且該模型的商業使用是透過託管 API 進行,而非透過自行託管的檢查點。

Google 這一邊完全沒有授權問題,因為根本沒有東西可授權。你買的是推論。你放棄的,正是開放權重通常被購入的理由——能在資料所在之處執行模型、能鎖定某個版本並持續保有它,以及不再按字元計費的能力。
所以,誠實的框架不是開放與封閉之爭。而是:
• 若你的部署必須將音訊保留在自家基礎架構內,Breeze TTS 2 是這兩者中唯一提供途徑的方案,而這條途徑就是研究授權。在據此打造產品之前,請先諮詢法律顧問。
• 如果你的部署方式能呼叫 API,授權問題便會消失,比較也會回歸到品質、價格與功能——而在這三者之中,Flash TTS 在其中兩項上佔有優勢。
• 如果你想要的是無需事先溝通就能商業化的開放權重,這兩個都不是那樣的模型,而競技場上還有其他列。
Elo 差距在何時有意義、何時沒有意義
56 分的差距落在此排行榜針對這兩列所回報的 ±16 與 ±16 信賴區間之外,因此這項排名並非像——比如說——Flash TTS 對上 Gemini 3.8 Flash-Lite TTS 那樣屬於雜訊。但競技場 Elo 只衡量一件事:在盲測比較中,聽者偏好兩段音訊中的哪一段。這是一項偏好訊號,經過彙總而成。
它沒有衡量到的,正是正式生產流程所在意的一切。它不會告訴你,兩個模型各自在處理 40 分鐘的腳本時如何不出現身分漂移、如何唸出你的產品名稱、當輸入包含電話號碼時會如何表現,或是當被要求處理訓練範圍以外的內容時,其失效模式會是什麼樣子。Breeze TTS 2 的 1,390 個樣本與 Flash TTS 的 1,999 個樣本,都大到足以讓整體結果穩定,也小到你的使用情境中沒有任何個別片段被納入其中。
一旦把你要求每個模型執行的任務納入考量,這個差距也比表面上看起來更小。Flash TTS 是在一次呼叫中處理兩位講者,這比 Breeze TTS 2 受評的任務更困難。這會讓那 56 分成為低估還是高估,取決於你的使用情境,而兩家廠商都尚未公布能讓此事定論的消融實驗。

每一樣每小時要多少
這兩個價格數字並非可直接互相比較,而假裝它們可以,是關於這場對決的報導中最常見的錯誤。
Google 以權杖計費:輸入每百萬文字權杖 $0.50,輸出每百萬音訊權杖 $9.00,此價格適用至 2026 年 12 月 31 日,之後為 $18.00。Batch 和 Flex 的價格為 $0.25 和 $4.50;Priority 的價格為 $0.90 和 $16.00。同系列模型 Flash-Lite TTS 為 $0.50 和 $6.00,之後為 $12.00。
BreezeBlue 以字元計費:透過代管 API,每百萬個字元為 $34.00。
Artificial Analysis 將兩者都正規化為以每百萬字元為基準,好讓它們能共用同一份榜單,而 $16.50 對上 $34.00 就是這樣來的。這項正規化是該榜單做的,並非任何一家供應商的做法——Google 並未公布 Flash TTS 的每字元費率,而把 $16.50 當成報價、而非換算結果,正是人們最後收到帳單時大吃一驚的原因。
兩個值得事先規劃因應的後果:
• Flash TTS 的費率將於 2027 年 1 月 1 日翻倍。若以促銷價編列預算,與 Breeze TTS 2 的差距會急劇縮小;若以 $18.00 編列預算,則幾乎弭平。
• 自行架設 Breeze TTS 2 並不會讓它免費,而是讓它成為一項資本成本。3B 模型小到足以在一般硬體上執行,但這筆帳只有在用量夠大時才划得來,而且僅限於研究授權允許的使用案例。
選擇,而不假裝只有一個答案
決策樹很短。
如果你需要雙人對話、想要一個依描述設計並保留為 ID 的聲音、你的工作流程可以呼叫 API,而且你能事先規劃因應 12 月 31 日的費率變更,那就選 Gemini 3.8 Flash TTS。它在獨立排行榜上是更好的模型,在帳單上也更便宜;而對於本來就注定要透過 API 呼叫的使用情境來說,它是封閉的這件事並不是問題。
若資料落地或地端推論是硬性需求,若你需要一個真的下載得到的 3B 模型,或者你是在做研究而不是要推出產品——這正是其授權條款所針對的情況——那就選 Breeze TTS 2。別只因為它掛著開放權重的名號就選它;先讀授權條款。
而如果你正在評估這兩者,最省成本的做法就是讓這個選擇保持可逆。OrcaRouter 並未託管這兩個模型——要呼叫 Gemini 3.8 Flash TTS,得用 Google 自家的 API 以及 Google 指定的那些介面;要呼叫 Breeze TTS 2,則得用 BreezeBlue 的託管端點。路由器在此的價值在於堆疊的其他部分:200 多個模型只要一組金鑰,就能以供應商定價,且不加價,因此像一月費率調漲這樣的供應商價格變動,當天就會生效,而不必等到下一個計費週期,自動容錯移轉讓正在評估中的路徑不必同時是正式環境的路徑,還有一套路由 DSL,能在單一語音不夠用時把多個模型組成同一次呼叫。
一句話版本:排行榜說是 Google,授權條款說要看情況,而價格則說在你決定選用哪一個之前,先查一下你的行事曆。
