
Gemini 3.8 Flash TTS 打招呼:Google 將旗下語音產品線一分為二並降價
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
該廠商於 2026 年 9 月 23 日推出了兩款語音模型,而公告的寫法彷彿頭條賣點是語音品質。但並非如此。Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS是該廠商首次在 Gemini Developer API 上推出的文字轉語音模型,價格低於它們所取代的預覽版模型——而對任何一直在別處按字元付費的人來說,那正是會改變預算項目的部分。Gemini 3.8 Flash TTS 的音訊輸出費率為每百萬個詞元 9.00 美元,適用至 2026 年底。音訊以每秒 25 個詞元計費,換算下來約為每生成一秒語音 0.02 美分。它所取代的模型,Gemini 3.1 Flash TTS Preview,定價為每百萬個音訊詞元 20.00 美元。
故事的另一半是:現在有兩個模型,而不是一個。Google 把產品線拆開了:Flash TTS 搭載完整語言集與較高的音訊速率,Flash-Lite TTS 則搭載較短的語言清單,價格也更便宜。這與自四月以來在 API 上採用的單一預覽模型配置不同,也說明了 Google 認為市場是什麼模樣——少數應用程式需要 130 種語言和語音複製,而多得多的應用程式只需要一個稱職的英語語音來做客服機器人,其他什麼都不需要。
9 月 23 日實際出貨了什麼
截至發布之時,這兩款模型已在 Gemini API 與 AI Studio 中正式全面開放,並未以候補名單限制使用。API 上的名稱為 gemini-3.8-flash-tts 與 gemini-3.8-flash-lite-tts。
• Flash TTS — 支援 130 種語言,會從文字自動偵測語言,內建 30 種錄音室語音,包括 Kore 和 Puck。
• Flash-Lite TTS — 支援 101 種語言,具備相同的語音設計介面,定位為高用量層級。
• 兩者皆是——從自然語言描述進行語音設計、逐行表達指示、雙講者場景編排,以及直接寫入腳本的非語言提示。
輸出 — 一元端點上為 WAV 24 kHz 單聲道 16 位元帶正負號 PCM;串流端點上為無標頭 PCM(audio/l16);亦接受 audio/mulaw 與 audio/alaw,並可設定取樣率。
這份費率表以每百萬個 token 計價,值得完整讀完,因為各級距的差異不只是標題上的數字:
• Flash TTS Standard — 文字輸入 $0.50 / 音訊輸出 $9.00,2026年12月31日之後將調漲至 $1.00 / $18.00。
• Flash TTS Batch 與 Flex — $0.25 / $4.50。
• Flash TTS 優先 — $0.90 / $16.20。
• Flash-Lite TTS Standard — $0.50 / $6.00,將於 2026 年 12 月 31 日後調漲至 $1.00 / $12.00。
• Flash-Lite TTS Batch 與 Flex — $0.25 / $3.00。
• Flash-Lite TTS 優先 — $0.90 / $10.80。
• Gemini 3.1 Flash TTS Preview,供比較 — $1.00 / $20.00,批次 $0.50 / $10.00。
值得留意的是推廣期。Google 將兩款新模型一律以半價定價,直至年底,並在同一張表中公布了推廣期屆滿後的數字。任何計算每千分鐘成本的人,都應該採用一月的數字,而非九月的。

語音設計才是真正嶄新的能力
預建語音只是基本門檻。Google 在 3.8 新增的,是一種用文字描述某個語音並取得它的方法,以及一種從簡短樣本複製語音、且附帶同意檢查的方法。
語音設計採用自然語言提示——語速、音色、口音,這些你原本得花一整個下午試聽挑選的東西——並在沒有參考錄音的情況下回傳可用的語音。語音複製則是反過來運作:你提供 30 秒的樣本,系統會驗證同意,而產生的語音會在生成的音訊上標註 SynthID 浮水印和 C2PA 憑證。語音混音可讓你混合或修改現有的自訂語音,目前列為即將推出,而非已經正式推出。
自訂語音有兩種形式,而它們的行為差異之大,使得這項區別在正式環境中格外重要。具狀態的自訂語音會儲存在專案底下,每個專案上限為 200 個,存活時間為一年。無狀態語音則是透過 voicekey_... 代號來存取,並在七天後過期。如果你的應用程式要為每位客戶配置一個語音,那麼上限和 TTL 這兩個數字就決定了你是否需要自建一套儲存層。
語氣表現控制是「new」的另一半。你可以像指導演員那樣指導一句台詞——節奏、強調、情緒基調——而不只是挑一個聲音然後聽天由命。雙人對話場景可以在單次呼叫中調度。非語言發聲是腳本中的一等元素:<laughs>、<sigh> 和 <gasp> 可作為行內提示,再加上 |mhm| 與 |yeah|,用來呈現那些讓合成對話聽起來真的像對話的小小附和聲。據稱長篇朗讀能維持說話者身分、漂移極小,而這正是你生成一段四十分鐘有聲書章節時最先浮現的失效模式。
基準測試,以及由誰執行它們
Google 的發布資料倚賴兩項外部評估和一組競技場名次。這些全都是廠商自行回報的——Google 是在引用它們,而背後的測試運行並未公開——所以請把它們當作宣稱,而非測量結果。

• Hume AI Voice Design Benchmark — Gemini 3.8 Flash TTS 以 71.4 位居第一,並以 60.8 在口音建模項目中排名第一。
• Hume 整體品質指數 — Flash TTS 居首,Flash-Lite TTS 次之。
• Speech Arena 中的盲測偏好——日語、巴西葡萄牙語、越南語、現代標準阿拉伯語、墨西哥西班牙語與印地語皆名列前茅。
• 相較於 Gemini 3.1 Flash TTS — Google 宣稱在長篇一致性與雙說話者劇本控制上有所進展,而這正是語氣指示功能所鎖定的兩件事。
有一個有紀錄的差異值得指出,因為任何比對來源的人都會感到困惑。那篇部落格文章描述了一個內含 2,000 多種可直接投入生產的語音的語音庫。開發者文件則描述,在 Extended Voice Library 中有「數百」種語音,另有 30 種預建的錄音室語音。第三方報導引述的數字又高了一個數量級。這些從外部無法調和——誠實的解讀是:你預設取得的預建語音集是 30 種,Extended Voice Library 較大且描述模糊,而那些龐大數字指的是包含使用者自建語音的型錄。如果語音數量對你的決策有舉足輕重的影響,請測試你需要的特定語音,而不是相信這三個數字中的任何一個。
如果你在它上面建構,這代表什麼
實際的改變在於,文字轉語音已經從一項專門的支出項目,變成可以跟你的語言 token 放進同一個成本模型裡的東西。以每秒 25 個 token 計算,一小時生成的音訊是 90,000 個音訊 token,而按 Flash-Lite 的促銷費率算,大約是 54 美分。這已經便宜到,真正的問題不再是「我們負擔得起合成語音嗎」,而是「這個介面需要兩個層級中的哪一個」。
第二項實務上的改變是,全新的 TTS 模型正是那種你會想先試用、卻不想把正式環境路徑押在它上面的東西。這正是把新模型放在路由器後面、而不是直接串接的理由:OrcaRouter 讓你只要一組金鑰就能使用 200+ 個模型,價格為供應商定價且不加價,而它的自動容錯移轉意味著,一個在高負載下會不穩的新語音端點,會降級到你已經信任的模型,而不是讓通話中斷。我們不託管 Gemini 3.8 TTS 端點——那些來自 Google 自家的 API——但語音底下的文字層,以及合成呼叫失敗時的備援路徑,才是路由器真正存在的意義。
還缺少什麼
這次發布少了三樣東西,而每一樣都是實實在在的限制,不是吹毛求疵。
目前沒有已發布的獨立評估。Google 的 Hume 數據是廠商引用第三方的基準測試,聊勝於無,但比不上一次稽核。在 Artificial Analysis 或同等機構針對相同模型發表自家的測試結果之前,本文中的每一項品質宣稱都應被視為一種宣稱。
沒有開放權重選項。這兩款模型都是封閉且僅提供 API,這使它們與近來進入同一領域的開放語音模型分屬不同類別。如果你的部署需求是自行執行模型,這次發布並不適用於你。
而促銷定價就此結束。Flash TTS 在 2027 年 1 月的費率是 9 月費率的兩倍,任何以上市數字建立的商業評估,都得在第一季重做。這不是批評——一開始就把兩個數字都公布出來,比大多數做法更誠實——但這才是應該填進試算表的數字。
Google 並未說明 Gemini 3.1 Flash TTS Preview 是否會遭淘汰,只表示 Flash-Lite TTS 被定位為它的主力替代方案。仍在使用預覽版模型的人,應該規劃移轉,而不是等待停用通知。

