一張為「Create and deploy custom audio」生成的主視覺卡片,副標題為「Gemini 3.8 Flash TTS」,背景為白色,並帶有柔和的藍色與青色漸層點綴。三張編號卡片分別寫著「1 Design a voice from a prompt」、「2 Store it for a year, or hold a seven-day key」與「3 Call /v1/audio/speech」,上方有一行頁尾文字寫著「Gemini API, 23 September 2026. Vendor figures.」。OrcaRouter 標誌合成於右下角。
Guides & Insights

使用 Gemini 3.8 Flash TTS 建立並部署自訂音訊:語音設計、聲音複製,以及決定成敗的兩個時鐘

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS 都讓你用文字描述憑空創造語音,而不必從清單中挑選,而且兩者已於 2026 年 9 月 23 日在 Gemini API 正式推出。人們不斷重複的頭條賣點是語音設計。真正值得事先規劃的,是設計出來的語音之後會如何,因為供應商提供兩種保存方式,並為每一種綁定不同的存續期限。選錯方法,你的產品所依賴的語音一週內就會失效。

這就是目前上市報導中的缺口。這些發布文章說明你可以透過提示讓語音誕生,其中幾篇也提到可從 30 秒的樣本進行複製。但沒有任何一篇詳細說明儲存模型,而這正是決定一套語音管線能否從設定檔重現,還是必須按排程重新布建的關鍵。本文涵蓋完整流程——設計、儲存、呼叫與付費——並採用 Google 所公布的價格與配額。

9月23日發布了什麼

兩個模型,一套 API 結構定義。識別碼分別是 gemini-3.8-flash-tts 與 gemini-3.8-flash-lite-tts,而 Google 的文件明確指出,兩者採用「完全相同的 API 結構定義與提示格式」——在它們之間切換只是更改一個參數,而不是重新改寫。

• 輸入 — 僅限文字。兩個模型都接受文字並回傳音訊;它們並非多模態,也不會回傳文字。

• 輸出 — 一元端點上的 WAV、24 kHz 單聲道 16 位元帶正負號 PCM;無標頭 PCM(audio/l16)位於串流端點;audio/mulaw 與 audio/alaw 可在可設定的取樣率下使用。

• 語言 — Flash TTS 支援 130 種,Flash-Lite TTS 支援 101 種,會從文字自動偵測,而非在請求中宣告。

• 語音 — 文件中列出的 30 種精選錄音室語音(其中包括 Kore 與 Puck),一個可透過 voices 端點查詢、內含「數百種」語音的擴充語音庫,以及下方兩種建立方式。

• 指導 — 逐行演繹控制、以單一腳本編排的雙說話者場景,以及直接寫入逐字稿的非語言提示,例如 <laughs>、<sigh> 和 |mhm|。

之所以會有這兩個層級,是因為工作負載已經分化。Flash TTS 的定位是追求最高聲學保真度與複雜的表演能力;Flash-Lite TTS 則以 Google 自身的說法,是gemini-3.1-flash-tts-preview的「主力替代方案」,瞄準大量配音、朗讀功能與語音代理串接等用途。兩者取代的都是同一個自 2026 年 4 月起就已登上 API 的預覽模型,因此如果你原本使用的是預覽版,這次遷移是層級的抉擇,而非版本升級。

A screenshot of Google's Gemini API text-to-speech documentation, captured in English on 24 September 2026, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) and Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts), and Python sample code that passes a speaker_config with the Kore voice to the interactions endpoint.

設計語音就是一種提示詞,而這改變了審查步驟。

創建介面是這一代真正全新的東西。提示詞驅動的語音是從自然語言描述建構而成——角色、口音、聲音特質——並回傳一組可供重複使用的識別碼。在 API 中,這是一次帶有 store: true 與提示詞輸入的語音建立呼叫;在 Google 自家的範例中,這些描述涵蓋從活力充沛的墨爾本 DJ 到日本龍的範圍。語音一旦建立,就能在語音請求中以識別碼參照,而每次請求的風格指示便可精簡甚至留空,因為角色特質已經內建於該語音之中。

實際後果是工作流程的改變,而不只是多了一項功能。語音選角過去是授權協商或錄音室預約,這意味著語音選擇只在早期進行一次,而且能安然通過審查,因為更換的成本很高。當一個語音只是一段文字時,選角就變成了一種設計權杖——產品經理可以在週二要求重新生成。把描述字串放進版本控制,並將生成的語音 ID 視為建置產物的團隊,將能在不同環境中獲得一致的輸出。在 AI Studio 中手動建立語音的團隊則不會,而失敗情況會看起來像是預備環境與正式環境音訊之間莫名其妙的差異。

那兩個時鐘

這是發布貼文略過不談的部分。Google 讓你以兩種狀態之一保留設計或複製的語音,而它們失效的速度天差地遠。

• 已儲存的語音 — 在啟用儲存功能時建立,會存在於你的專案中,並受每個專案 200 個語音的配額及一年存續時間所規範。

• 無狀態金鑰 — 語音複製可傳回由用戶端管理的金鑰(即 voicekey_… 形式),而非儲存的識別碼,且該金鑰的生命週期為七天。

放在一起看,這一對就是一項設計指令。儲存的語音是一項為期一年的承諾,而且每個專案有 200 個的硬性上限;對於角色陣容固定的產品來說這很寬裕,對於任何要為每位客戶生成新語音的用途卻毫無用處。無狀態金鑰則恰恰相反:沒有配額壓力,但金鑰每週都得重新簽發,這意味著你的應用程式需要一條更新路徑,而你的基礎設施需要儲存會輪換的憑證。兩者都沒有錯。在沒察覺自己選了哪一種的情況下做出選擇,正是語音代理在第八天就噤聲的原因。

複製還附帶另外兩項特性,在你向法務團隊做出任何承諾之前值得先了解。建立複製語音需要取得該聲音擁有者的口頭同意錄音,且必須與參考說話者相符——這是口說驗證,不是勾選框。而輸出帶有來源追溯:每一段音訊都嵌有 SynthID 浮水印,複製語音還會額外帶有 C2PA 內容憑證。這條設計路線刻意選擇較難被濫用的那一條,而這兩道關卡都是結構性的,而非政策宣示。

有一個差異值得提出來,而不是設法解決。Google 的支援模型一覽表將語音設計與語音複製列為兩款 3.8 TTS 模型皆可使用。大多數發布報導則特別把複製描述成 Flash TTS 產品故事的一部分。如果複製功能會影響你在不同層級之間的決定,請對照你打算推出的層級所屬文件來確認,而不是信任任一份摘要。

一小時的音訊成本是多少

Google 對語音是以詞元(token)計費,而非以字元或秒數計費,而且換算方式已經公開:音訊按輸出每秒 25 個詞元計量,也就是每小時 90,000 個詞元。這讓計算變得格外簡潔,而該放進預算的是這個數字,而不是每百萬詞元的費率。

• Flash TTS 標準版 — 每百萬輸入文字 token $0.50,每百萬輸出音訊 token $9.00,優惠至 2026 年 12 月 31 日,之後為 $1.00 與 $18.00。Batch 與 Flex 為 $0.25 與 $4.50;Priority 為 $0.90 與 $16.20。

• Flash-Lite TTS 標準版 — 於同一日期前為 $0.50 與 $6.00,之後為 $1.00 與 $12.00。Batch 與 Flex 為 $0.25 與 $3.00;Priority 為 $0.90 與 $10.80。

• 以秒計——在促銷期間,Flash TTS 換算下來約為每小時生成的音訊 $0.81,促銷期過後約為 $1.62;Flash-Lite TTS 則約為 $0.54,之後為 $1.08。

• 相較於它所取代的模型——gemini-3.1-flash-tts-preview的定價為每百萬 $1.00 與 $20.00,因此音訊輸出這條產品線在 Flash TTS 上下降了 55%,在 Flash-Lite TTS 上則下降了 70%。

不要以促銷價來做規劃。Google 把兩欄都刊在同一張表上,這意味著一月的費率不是日後才會被挖掘出來的傳聞——它今天就已列在價目表上,而任何以 $0.81 為基礎算出的每千分鐘估算,都必須經得起翻倍的考驗。

一個獨立的數字,以及幾個不獨立的

Google 的公告以基準測試結果開頭,而這些結果應該被如實看待。該公司表示,Flash TTS 在 Hume AI 的 Voice Design Benchmark 上以 71.4 拿下第一名,在口音建模以 60.8 居首,且 Flash TTS 與 Flash-Lite TTS 在 Hume 的 Overall Quality Index 上排名第一與第二,並在 Voice Arena 的日語、巴西葡萄牙語、越南語、現代標準阿拉伯語、墨西哥西班牙語與印地語盲測偏好排名中表現強勁。全數為廠商自行報告,沒有任何一項測試是公開的。

那份清單中有一個值得注意的細節。Alan Cowen 被列為 Google 這項公告的作者之一,他是 Hume AI 的創辦人——而該實驗室的 Voice Design Benchmark 正是那個頭條數字的來源。這並不代表這個數字是錯的,Hume 的基準測試也是真實存在的,但這兩者並非彼此獨立,讀者在把 71.4 當作第三方驗證來引用之前,應該先知道這件事。

這項獨立蒐集的數據出自 Artificial Analysis 的 Provider Voice Arena,為本文於 2026 年 9 月 24 日截取:Gemini 3.8 Flash TTS 以 Elo 1,260、在 1,999 個樣本中達 17 點區間位居第二,落後於 Elo 1,273 的 Cartesia Sonic 3.6。Gemini 3.8 Flash-Lite TTS 以 1,235 排名第六。被取代的模型 Gemini 3.1 Flash TTS 則以 1,199、在 3,430 個樣本中排名第十。這是盲測聽眾偏好,而非實驗室自行評估——也是這裡唯一一個並非由 Google 委託取得的品質數字。

A generated scoreboard card titled 'Gemini 3.8 Flash TTS — the scoreboard' with six rows: Arena Elo 1,260 at rank 2 over 1,999 samples; audio out $9.00 per 1M tokens to 31 December 2026; 130 languages on Flash TTS against 101 on Flash-Lite TTS; 30 studio voices plus prompt-based design; stored voices capped at 200 per project with a one-year lifetime; and a stateless voicekey with a seven-day lifetime. The footer reads 'Elo per Artificial Analysis, 24 Sept 2026; price and quotas per Google. Google's Hume AI results are vendor-reported.'

哪裡可以執行,哪裡還不行

兩款模型目前都已在 Gemini API 和 Google AI Studio 中提供,無需等候名單。消費端與企業端產品則是分階段推出,而非已經上線:Flash TTS 即將登陸 Gemini Notebook,Flash-Lite TTS 則將登陸 Google Vids,Gemini Enterprise 的使用權限被描述為即將推出,而語音重混——調整現有語音的音色、音高、語速與口音——被列為未來功能,而非現有功能。如果你的計畫取決於重混功能,那它目前還不存在。

在我們這邊,先說實話:Gemini 3.8 TTS 端點並不在 OrcaRouter 的路由表上。它們所取代的那一代是——google/gemini-3.1-flash-tts-preview已在型錄中,價格與 Google 公布的每百萬權杖 1.00 美元與 20.00 美元相同,因為供應商列表價格原樣轉嫁,不加任何加成,而且它會在相同的/v1/audio/speech端點上回應,而這個端點正是你的 OpenAI 相容 SDK 早已鎖定的目標。對語音工作負載來說,這比聽起來更重要,因為你真正買到的是一個穩定端點,讓你的應用程式可以在其背後的模型變動時持續呼叫。你的程式碼持有的是模型字串;型錄持有的是路由。當 Google 的促銷期在 12 月 31 日結束,而 Flash TTS 價格翻倍時,已路由模型的價格會在同一天變動,而不是等到下一次合約續約——而且模型若故障,會自動容錯移轉,而不是拖垮你的旁白佇列。

A screenshot of the OrcaRouter model page for google/gemini-3.1-flash-tts-preview, captured in English on 24 September 2026, showing the model described as Google's text-to-speech model accessed via OrcaRouter, an input price of $1.00 and output price of $20.00 per 1M tokens, a p50 time-to-first-token of 6.61 seconds and p95 of 10.00 seconds over seven days, an OpenAI-compatible base URL of https://api.orcarouter.ai/v1, and a /v1/audio/speech endpoint.

如果你在正式投入前正在評估這個生成結果,最省成本的實驗是分成兩級來做。把同一份腳本分別交給 Flash TTS 和 Flash-Lite TTS 跑一遍,因為兩者的結構定義完全相同,差別只在一個參數——然後用你自己的音訊來判斷,而不是靠基準測試圖表;並在付費升級前,到 Artificial Analysis 上確認品質差距是否經得起其誤差範圍的檢驗。對大型旁白專案來說,這筆溢價是真金白銀;但對一個把電話號碼唸出來的客服機器人來說,它顯然買不到任何聽眾聽得見的東西。