一張為「Gemini 3.8 TTS vs Gemini 3.1 Flash TTS」生成的主視覺卡片,背景為白色,帶有柔和的藍色與青色漸層點綴。左側卡片「Gemini 3.1 Flash TTS」列出 Elo 1,199、3,430 個樣本、7 個競技場語音與 2026 年 4 月;右側卡片「Gemini 3.8 Flash TTS」列出 Elo 1,260、1,999 個樣本、8 個競技場語音與 2026 年 9 月。頁尾一行寫著「Elo 依據 Artificial Analysis Provider Voice Arena,2026 年 9 月。」OrcaRouter 標誌合成於右下角。
Engineering & Research

Gemini 3.8 TTS 與 Gemini 3.1 Flash TTS:這個家族中唯一真正存在的差距

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

在同一個模型系列內升級通常是個容易的決定,但這次有個小波折,讓它不像表面上看起來那麼容易。Gemini 3.1 Flash TTS——在供應商的 API 上仍列為預覽版——在 Artificial Analysis Provider Voice Arena 中排名第 10,Elo 為 1,199,區間為 12 點。Gemini 3.8 Flash TTS,於 2026 年 9 月 23 日推出,排名第 2,Elo 為 1,260,區間為 17 點。這是 61 點的提升,而且不同於該排行榜上大多數的差距,它經得起誤差範圍的考驗:3.1 的範圍是 1,187 到 1,211,3.8 的範圍是 1,243 到 1,277,而兩者之間有 32 點的空白區。品質升級是真的。價格方面的情況才是奇怪的地方。

A generated two-column scoreboard for Gemini 3.1 Flash TTS and Gemini 3.8 Flash TTS — 3.1 at Arena Elo 1,199, $20.00 per 1M audio tokens, 7 arena voices, 3,430 samples and an April 2026 release; 3.8 at Elo 1,260, $9.00 per 1M audio tokens, 8 arena voices, 1,999 samples and a September 2026 release — over the footer 'Prices per Google; Elo per Artificial Analysis, Sept 2026.'

Google 自家的價目表顯示,音訊輸出費率從 3.1 的每百萬個 token 20.00 美元,降到 3.8 的 9.00 美元——降幅達 55%。Artificial Analysis 則將同樣這兩個模型標準化為每百萬字元 18.30 美元與 33.00 美元,得出的結論卻恰恰相反。兩組數字都已公開;兩者都沒有錯;它們衡量的是不同的東西,而對任何正在規劃遷移的人來說,釐清這兩者之間的差異,正是這項比較中最有用的部分。

這次升級究竟改變了什麼

3.8 世代並非重新調校。有三個層面出現了實質變化。

• 語音數量與語音建立 —— 3.1 Flash TTS 推出了一組預建語音。3.8 Flash TTS 則隨附 30 種預建的錄音室語音,包括 Kore 和 Puck,另外還可透過自然語言描述進行語音設計,以及從 30 秒樣本進行語音複製,並具備同意驗證、SynthID 浮水印,以及輸出上的 C2PA 憑證。語音混音列為即將推出,而非已正式推出。

• 表達控制 — 逐行指導、在單次呼叫中安排雙說話者場景,以及直接寫入腳本的非語言提示,例如 <笑聲><嘆氣><倒抽一口氣>|嗯哼||對啊|。Google 的發布資料宣稱,特別是相較於 3.1,其在長篇一致性與雙說話者劇本控制方面有所改善。這是供應商的說法,背後沒有公開實測可供佐證。

• 語言涵蓋範圍 — Flash TTS 支援 130 種語言,Flash-Lite TTS 則支援 101 種,皆會從文字自動偵測。3.1 Flash TTS 公布的涵蓋範圍較低。

結構性變化在於拆分。3.1 Flash TTS 並沒有單一的後繼者;而是有兩個,而 Google 的說明文件將 Flash-Lite TTS 定位為「主力替代方案」。這很重要,因為這表示遷移是一項層級決策,而不是版本升級。較便宜的層級並不是你目前所用產品的較新版本——它是曲線上的另一個點。

為什麼價格下跌了,但排行榜卻說它上漲了

先從 Google 公布的內容開始,因為那才是你實際會被計費的依據。

Gemini 3.1 Flash TTS Preview — 輸入每百萬文字 token 為 $1.00,輸出每百萬音訊 token 為 $20.00。批次則為 $0.50 和 $10.00。

• Gemini 3.8 Flash TTS 標準 — 即日起至 2026 年 12 月 31 日為 $0.50 與 $9.00,之後為 $1.00 與 $18.00。Batch 與 Flex 為 $0.25 與 $4.50。Priority 為 $0.90 與 $16.20。

• Gemini 3.8 Flash-Lite TTS 標準 — $0.50 與 $6.00,優惠至 2026 年 12 月 31 日,之後為 $1.00 與 $12.00。Batch 與 Flex $0.25 與 $3.00。Priority $0.90 與 $10.80。

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

單就音訊輸出這一項來看,3.8 Flash TTS 的 $9.00 相較於 3.1 的 $20.00 是降價 55%,而 3.8 Flash-Lite TTS 的 $6.00 則是降價 70%。即使在促銷後的 $18.00,Flash TTS 仍低於它所取代的模型。這是會印在發票上的數字,而且明確無疑。

現在來看排行榜。Artificial Analysis 公布的是每百萬字元的數字,讓以不同單位計費的模型可以並列排名;而針對這一對,它給出 3.1 Flash TTS 為 $18.30,3.8 Flash TTS 為 $33.00。單看這個數字,會說這次升級的價格幾乎翻倍。

兩者之所以能調和,在於每字元費率是一種換算,而非價格,而且這兩個模型的換算係數並不相同。將音訊 token 換算成字元,需要同時假設語速與音訊 token 比率——Google 以每秒輸出 25 個 token 計量音訊——還需要選擇要以哪個服務層級作為正規化基準。如果董事會以促銷後的 $18.00 費率將 3.8 正規化,同時以自身的 $20.00 將 3.1 正規化,兩者差距小到任何「每字元秒數」假設上的差異都會主導結果。以寬鬆的語速假設所建立的每字元費率,會美化其所套用的模型。

因此,實際操作上的指示是:編列預算時使用 Google 的 token 費率,而排行榜的字元費率則只用於該排行榜以相同方式衡量之模型之間的比率。不要把兩者混用,也不要把 $18.30 到 $33.00 的變動說成漲價——那是這兩個模型並不共用的正規化所造成的人為產物。

真正的遷移成本是另一回事,那就是優惠窗口。兩個新方案在 2026 年 12 月 31 日之前都維持半價,並於 1 月 1 日翻倍。若以九月的數字做規劃、十一月執行遷移,就會在第一季重新計價。Flash TTS 在 2027 年 1 月的價格為每百萬音訊 token 18.00 美元,仍低於 3.1 的 20.00 美元——所以優惠期過後,這波降價確實存在,只是遠比今天看起來的幅度小得多。

品質提升,以及其背後不是什麼

Arena Elo 是這裡唯一由廠商以外的人所蒐集的數字,也是唯一超出自身誤差範圍的數字。六十一點,從 1,199 到 1,260,其中 3.1 有 3,430 個樣本,3.8 有 1,999 個樣本,而 Arena 聲音是 7 對 8。較新模型的樣本數較低,這會使其區間變寬,即使如此,兩者的範圍仍未重疊。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing the top rows with Cartesia Sonic 3.6 first at Elo 1,273, Google's Gemini 3.8 Flash TTS second at 1,260, Alibaba's Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google's Gemini 3.1 Flash TTS tenth at 1,199 across 3,430 samples.

它背後沒有的東西:除了這個競技場之外,沒有任何獨立基準測試。Google 的發布數據——在 Hume AI Voice Design Benchmark 上以 71.4 名列第一、在口音建模上以 60.8 名列第一、在 Flash 與 Flash-Lite 的 Hume Overall Quality Index 上分別拿下第一和第二,以及在日語、巴西葡萄牙語、越南語、現代標準阿拉伯語、墨西哥西班牙語和印地語中宣稱的盲測偏好最高排名——是供應商引用第三方的基準測試。底層的執行結果並未公開。把它們當作宣稱來看待:方向與競技場結果一致,但不會為該結果增添獨立份量。

棄用問題,以及遷移檢查清單

Google 尚未宣布 Gemini 3.1 Flash TTS Preview 的關閉日期。該公司表示,Flash-Lite TTS 的定位是它的主力替代方案,而這種措辭通常是棄用通知的前奏,而非尾隨其後。如果你仍在使用預覽版模型,正確的解讀是:你有遷移計畫要擬定,而不是有截止期限要趕——而等待那個截止期限,對於一個替代方案已經領先 61 Elo 分的模型來說,是錯誤的策略。

• 檢查你的工作負載需要哪個層級。Flash TTS 支援 130 種語言與完整的交付介面;Flash-Lite TTS 支援 101 種語言,每百萬個音訊權杖收費 $6.00。語言清單才是分界線,而非品質。

• 請依 2027 年 1 月的費率重新定價,而非促銷價。Flash TTS 每百萬個音訊 token 為 $18.00 美元,Flash-Lite 則為 $12.00 美元。

• 判斷這項工作是否可批次處理。Batch 和 Flex 會將兩個級距的音訊費率減半——每百萬個 token 分別為 $4.50 和 $3.00。任何非互動性的工作都不應放在 Standard 級距上。

• 重新檢查任何依賴語音集的項目。預設目錄是 30 個預建語音;你在 3.1 上使用的語音可能需要重新建立,無論是透過語音設計,還是透過 30 秒的複製樣本。

• 重新檢查請求塑形。3.8 模型並未公佈每個請求的字元上限,而且音訊是按秒計量而非按字元計量,因此一段冗長的發言,成本會高於按字元報價所暗示的金額。

• 規劃自訂語音的生命週期。每個專案可有 200 個具狀態語音,存活時間為一年,或使用無狀態的 voicekey_... 控制代碼,這些控制代碼會在七天後到期。

在你決定之前,兩者都先執行

同系列升級、促銷到期與正規化不一致,正是不能一步切換的典型情況。OrcaRouter 目前路由較舊的模型——models/google/gemini-3.1-flash-tts-preview在我們的模型清單上——因此你可以把新模型架設在它旁邊,並在移動正式環境路徑之前,用你自己的流量進行比較。我們不託管 Gemini 3.8 TTS 端點;那些端點來自 Google 自家的 API。我們提供的是一組金鑰即可存取 200+ 個模型,價格為供應商定價且不加價,因此供應商的費率變更會在同一天反映到你的帳單,而不是等到續約時,並且自動容錯移轉,讓全新模型成為你可以嘗試、而不必把面向客戶的路徑押注其上的東西。

值得留意的是,Google 是否會為 3.1 Flash TTS preview 標上日期。對遷移計畫來說,這一行說明文件的價值勝過本文中任何一項基準測試,而它至今仍未寫下。