一張為「Gemini 3.8 Flash TTS 說聲哈囉」生成的主視覺卡片,背景為白色,並帶有柔和的藍色與青色漸層點綴。一張寬版圓角卡片在波形圖示旁標示「30 種錄音室人聲」、「130 種語言」與「按音訊 token 計費」,右側第二張卡片則寫著「Flash-Lite TTS - 101 種語言」。頁尾一行寫著「Gemini API,2026 年 9 月 23 日。廠商數據。」OrcaRouter 標誌合成於右下角。
Guides & Insights

Gemini 3.8 Flash TTS 打招呼:Google 將旗下語音產品線一分為二並降價

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

該廠商於 2026 年 9 月 23 日推出了兩款語音模型,而公告的寫法彷彿頭條賣點是語音品質。但並非如此。Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS是該廠商首次在 Gemini Developer API 上推出的文字轉語音模型,價格低於它們所取代的預覽版模型——而對任何一直在別處按字元付費的人來說,那正是會改變預算項目的部分。Gemini 3.8 Flash TTS 的音訊輸出費率為每百萬個詞元 9.00 美元,適用至 2026 年底。音訊以每秒 25 個詞元計費,換算下來約為每生成一秒語音 0.02 美分。它所取代的模型,Gemini 3.1 Flash TTS Preview,定價為每百萬個音訊詞元 20.00 美元。

故事的另一半是:現在有兩個模型,而不是一個。Google 把產品線拆開了:Flash TTS 搭載完整語言集與較高的音訊速率,Flash-Lite TTS 則搭載較短的語言清單,價格也更便宜。這與自四月以來在 API 上採用的單一預覽模型配置不同,也說明了 Google 認為市場是什麼模樣——少數應用程式需要 130 種語言和語音複製,而多得多的應用程式只需要一個稱職的英語語音來做客服機器人,其他什麼都不需要。

9 月 23 日實際出貨了什麼

截至發布之時,這兩款模型已在 Gemini API 與 AI Studio 中正式全面開放,並未以候補名單限制使用。API 上的名稱為 gemini-3.8-flash-ttsgemini-3.8-flash-lite-tts

• Flash TTS — 支援 130 種語言,會從文字自動偵測語言,內建 30 種錄音室語音,包括 Kore 和 Puck。

• Flash-Lite TTS — 支援 101 種語言,具備相同的語音設計介面,定位為高用量層級。

• 兩者皆是——從自然語言描述進行語音設計、逐行表達指示、雙講者場景編排,以及直接寫入腳本的非語言提示。

輸出 — 一元端點上為 WAV 24 kHz 單聲道 16 位元帶正負號 PCM;串流端點上為無標頭 PCM(audio/l16);亦接受 audio/mulaw 與 audio/alaw,並可設定取樣率。

這份費率表以每百萬個 token 計價,值得完整讀完,因為各級距的差異不只是標題上的數字:

• Flash TTS Standard — 文字輸入 $0.50 / 音訊輸出 $9.00,2026年12月31日之後將調漲至 $1.00 / $18.00。

• Flash TTS Batch 與 Flex — $0.25 / $4.50。

• Flash TTS 優先 — $0.90 / $16.20。

• Flash-Lite TTS Standard — $0.50 / $6.00,將於 2026 年 12 月 31 日後調漲至 $1.00 / $12.00。

• Flash-Lite TTS Batch 與 Flex — $0.25 / $3.00。

• Flash-Lite TTS 優先 — $0.90 / $10.80。

Gemini 3.1 Flash TTS Preview,供比較 — $1.00 / $20.00,批次 $0.50 / $10.00。

值得留意的是推廣期。Google 將兩款新模型一律以半價定價,直至年底,並在同一張表中公布了推廣期屆滿後的數字。任何計算每千分鐘成本的人,都應該採用一月的數字,而非九月的。

A generated scoreboard for Gemini 3.8 Flash TTS with six rows — Arena Elo 1,260 at rank 2, audio out $9.00 per 1M tokens, 130 languages on Flash against 101 on Flash-Lite, 30 prebuilt studio voices plus voice design, cloning from a 30-second sample with SynthID, and GA availability on the Gemini API — over the footer 'Price per Google rate card; Elo per Artificial Analysis Provider Voice Arena, Sept 2026.'

語音設計才是真正嶄新的能力

預建語音只是基本門檻。Google 在 3.8 新增的,是一種用文字描述某個語音並取得它的方法,以及一種從簡短樣本複製語音、且附帶同意檢查的方法。

語音設計採用自然語言提示——語速、音色、口音,這些你原本得花一整個下午試聽挑選的東西——並在沒有參考錄音的情況下回傳可用的語音。語音複製則是反過來運作:你提供 30 秒的樣本,系統會驗證同意,而產生的語音會在生成的音訊上標註 SynthID 浮水印和 C2PA 憑證。語音混音可讓你混合或修改現有的自訂語音,目前列為即將推出,而非已經正式推出。

自訂語音有兩種形式,而它們的行為差異之大,使得這項區別在正式環境中格外重要。具狀態的自訂語音會儲存在專案底下,每個專案上限為 200 個,存活時間為一年。無狀態語音則是透過 voicekey_... 代號來存取,並在七天後過期。如果你的應用程式要為每位客戶配置一個語音,那麼上限和 TTL 這兩個數字就決定了你是否需要自建一套儲存層。

語氣表現控制是「new」的另一半。你可以像指導演員那樣指導一句台詞——節奏、強調、情緒基調——而不只是挑一個聲音然後聽天由命。雙人對話場景可以在單次呼叫中調度。非語言發聲是腳本中的一等元素:<laughs><sigh><gasp> 可作為行內提示,再加上 |mhm||yeah|,用來呈現那些讓合成對話聽起來真的像對話的小小附和聲。據稱長篇朗讀能維持說話者身分、漂移極小,而這正是你生成一段四十分鐘有聲書章節時最先浮現的失效模式。

基準測試,以及由誰執行它們

Google 的發布資料倚賴兩項外部評估和一組競技場名次。這些全都是廠商自行回報的——Google 是在引用它們,而背後的測試運行並未公開——所以請把它們當作宣稱,而非測量結果。

A screenshot of Google's blog post 'Gemini 3.8 text-to-speech says hello', captured in English and dated Sep 23, 2026, showing the header credited to Leland Rechis and Alan Cowen, the 'Introducing Gemini 3.8 Flash TTS and 3.8 Flash-Lite TTS' hero card, and the opening bullets describing the two models.

• Hume AI Voice Design Benchmark — Gemini 3.8 Flash TTS 以 71.4 位居第一,並以 60.8 在口音建模項目中排名第一。

• Hume 整體品質指數 — Flash TTS 居首,Flash-Lite TTS 次之。

• Speech Arena 中的盲測偏好——日語、巴西葡萄牙語、越南語、現代標準阿拉伯語、墨西哥西班牙語與印地語皆名列前茅。

• 相較於 Gemini 3.1 Flash TTS — Google 宣稱在長篇一致性與雙說話者劇本控制上有所進展,而這正是語氣指示功能所鎖定的兩件事。

有一個有紀錄的差異值得指出,因為任何比對來源的人都會感到困惑。那篇部落格文章描述了一個內含 2,000 多種可直接投入生產的語音的語音庫。開發者文件則描述,在 Extended Voice Library 中有「數百」種語音,另有 30 種預建的錄音室語音。第三方報導引述的數字又高了一個數量級。這些從外部無法調和——誠實的解讀是:你預設取得的預建語音集是 30 種,Extended Voice Library 較大且描述模糊,而那些龐大數字指的是包含使用者自建語音的型錄。如果語音數量對你的決策有舉足輕重的影響,請測試你需要的特定語音,而不是相信這三個數字中的任何一個。

如果你在它上面建構,這代表什麼

實際的改變在於,文字轉語音已經從一項專門的支出項目,變成可以跟你的語言 token 放進同一個成本模型裡的東西。以每秒 25 個 token 計算,一小時生成的音訊是 90,000 個音訊 token,而按 Flash-Lite 的促銷費率算,大約是 54 美分。這已經便宜到,真正的問題不再是「我們負擔得起合成語音嗎」,而是「這個介面需要兩個層級中的哪一個」。

第二項實務上的改變是,全新的 TTS 模型正是那種你會想先試用、卻不想把正式環境路徑押在它上面的東西。這正是把新模型放在路由器後面、而不是直接串接的理由:OrcaRouter 讓你只要一組金鑰就能使用 200+ 個模型,價格為供應商定價且不加價,而它的自動容錯移轉意味著,一個在高負載下會不穩的新語音端點,會降級到你已經信任的模型,而不是讓通話中斷。我們不託管 Gemini 3.8 TTS 端點——那些來自 Google 自家的 API——但語音底下的文字層,以及合成呼叫失敗時的備援路徑,才是路由器真正存在的意義。

還缺少什麼

這次發布少了三樣東西,而每一樣都是實實在在的限制,不是吹毛求疵。

目前沒有已發布的獨立評估。Google 的 Hume 數據是廠商引用第三方的基準測試,聊勝於無,但比不上一次稽核。在 Artificial Analysis 或同等機構針對相同模型發表自家的測試結果之前,本文中的每一項品質宣稱都應被視為一種宣稱。

沒有開放權重選項。這兩款模型都是封閉且僅提供 API,這使它們與近來進入同一領域的開放語音模型分屬不同類別。如果你的部署需求是自行執行模型,這次發布並不適用於你。

而促銷定價就此結束。Flash TTS 在 2027 年 1 月的費率是 9 月費率的兩倍,任何以上市數字建立的商業評估,都得在第一季重做。這不是批評——一開始就把兩個數字都公布出來,比大多數做法更誠實——但這才是應該填進試算表的數字。

Google 並未說明 Gemini 3.1 Flash TTS Preview 是否會遭淘汰,只表示 Flash-Lite TTS 被定位為它的主力替代方案。仍在使用預覽版模型的人,應該規劃移轉,而不是等待停用通知。

A generated summary card titled 'Gemini 3.8 TTS: what changed in five lines', listing the split into Flash TTS and Flash-Lite TTS, the audio-out cut to $9.00 per 1M tokens, voice design and 30-second cloning, 130 languages on Flash against 101 on Flash-Lite, and half price until December 31, 2026.