一張為「Gemini 3.8 TTS:兩隻鵜鶘、兩個模型」生成的主視覺卡片,背景為白色,綴有柔和的藍色與青色漸層。三張卡片分別寫著「Gemini 3.8 Flash TTS — Elo 1,260,排名第 2,8 種競技場語音,每 100 萬音訊 token 9.00 美元」、「Gemini 3.8 Flash-Lite TTS — Elo 1,235,排名第 6,每 100 萬音訊 token 6.00 美元」,以及「雙講者對話 — 支援,語音設計,30 秒複製」。頁尾一行寫著「Elo 依據 Artificial Analysis Provider Voice Arena,2026 年 9 月;定價依 Google 公布為準」。OrcaRouter 標誌合成於右下角。
Guides & Insights

Gemini 3.8 TTS:兩隻鵜鶘、兩個模型,以及一月翻倍的價格

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

要了解該廠商在 2026 年 9 月 23 日發布了什麼,最快的方法就是看當時隨之流傳的示範:兩隻鵜鶘爭論是否要搬到 Pacifica Pier,每隻鳥各用一個聲音,並依腳本輪流對話。Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS 就是該示範背後的兩個模型,兩者皆已在 Gemini API 全面開放使用,而這些鵜鶘可不是噱頭。它們是這一代中前代 Gemini 語音模型完全做不到的第一件事:兩個說話者、一次生成,以及一份控制誰說什麼的腳本。

價格是故事的另一半,而這正是兩款模型分道揚鑣之處。Flash TTS 的計費為每百萬輸入文字 token 0.50 美元,以及每百萬輸出音訊 token 9.00 美元,此費率持續至 2026 年 12 月 31 日,之後為 18.00 美元;Flash-Lite TTS 則依相同時程計費為 0.50 美元與 6.00 美元,之後為 12.00 美元。這些是 Google 自家的費率。經 Artificial Analysis 換算為每百萬字元的基準,以便與其他所有模型並列於同一張比較表後,兩者分別為 16.50 美元與 11.00 美元——Lite 模型大約便宜三分之一,且兩者都遠低於該表榜首所收取的價格。

所以,有趣的問題並不是這些模型好不好。而是你應該以這兩者中的哪一個為基礎來建構,因為它們之間的差距並不是你會從名稱上猜到的那種差距。

9月23日公告實際上包含的內容

兩個模型,而非一個,而且 Google 明確表示它們是分岔,而不是同一事物的小型與大型版本。公告列出了它們登場的五個地方——Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids——而 API 識別碼則很直白:gemini-3.8-flash-tts 與 gemini-3.8-flash-lite-tts。

A screenshot of Google's blog post 'Gemini 3.8 text-to-speech says hello', published September 23, 2026 and credited to Leland Rechis and Alan Cowen, showing the launch announcement for Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS.

能力清單比標題所暗示的還要長。根據 Google 的公告與 Gemini API 語音生成文件:

• 聲音設計 — 你用文字描述一個聲音,就會取得自訂的聲音 ID,而不是從固定清單中挑選。

• 語音複製 — 30 秒的樣本即可產生一組語音 ID,這正是多數團隊實際上會用來製作品牌語音或旁白的方式。

• 雙人對話——鵜鶘案例。腳本以說話者輪替的方式呈現,而非單一散文段落。

• 回合層級樣式 — 文件說明了一種 speech_metadata 註解,會將指示附加到特定回合,而非整個請求。

• 預建語音,以及可透過 GET /v1beta/voices 存取的擴充語音庫。

• 三種音訊編碼——預設為 WAV,並提供 mulaw 與 alaw 以適用於電話形式的管道。

• 僅限文字輸入,僅限音訊輸出。文件對此說得很直白:TTS 模型不接受任何其他輸入模態,也不產生任何其他輸出,而且另有一個獨立的「限制」章節列出這些限制。

公告裡沒提到的,是容量規劃者所需的任何數字。速率限制、配額,以及所設計語音的儲存期限,全都位於文件與定價頁面中,而不是在發布貼文裡;這通常是發布週在展示時順利、在生產環境卻很糟的常見原因。

A screenshot of the Gemini API speech-generation documentation, showing the two model identifiers gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts alongside the speech generation request and response format.

鵜鶘才是真正的新聞。

單一說話者的 TTS 在過去兩年來已經是算是大致解決的問題。過去真正欠缺的,是一個能在長篇腳本中讓兩個身分保持區隔、不發生漂移的模型,而這正是這個示範真正要測試的重點——不是聲音聽起來像不像真人,而是四分鐘之後,說話者 A 是否仍然是說話者 A。

由此可推得兩件事,而這正是此事意義遠超出播客玩物的原因。

第一點是工作單位改變了。使用單一講者模型時,一段二十分鐘的對話,就是二十分鐘的音訊,你得把兩次獨立執行拼接起來,而每一個接縫都是韻律重置的地方。使用雙講者模型時,它是一次呼叫、一個上下文,模型可以對前一句台詞做出反應。這是無法靠後製處理彌補回來的品質差異。

第二點是,腳本格式變成了介面。如果你的流程已經會輸出某種 SSML 形式的內容——每個詞組一則標註——那麼這次生成幾乎可以直接套用。如果你的流程只是把一大段文字交給模型然後期望它自己搞定,你現在就有理由重新調整結構,因為過去隱含的樣式設定,如今是你必須明說出來的東西。這正是該領域其他部分以不同方式做出的相同取捨,而這也是這兩款 Google 模型與檯面上其他所有模型競爭的軸線。

一小時的雙鵜鶘音訊要多少錢

這個 token 數學值得算一次,因為每百萬音訊 token 的數字並不是每小時的數字,而這個差異讓不少人感到意外。

音訊 token 會依輸出音訊每秒的固定速率產生,因此成本取決於完成音訊的長度,而非腳本長度。以 Google 自家 Flash TTS 的費率——每百萬個輸出音訊 token 為 $9.00——來計算,一小時成品在標準層級會落在個位數美元,Lite 模型則是該金額的三分之二。Batch 與 Flex 定價中,Flash TTS 為輸入 $0.25、輸出 $4.50,對比 Flash-Lite TTS 的 $0.25 與 $3.00,對於任何不需要隨需生成的工作還能進一步壓低成本。Priority 的 $0.90 與 $16.00,則適用於確實需要隨需生成的工作。

三個實際後果:

• 重新生成一個段落很便宜;重新生成一整個系列則是一項決策。以這樣的成本來看,語音管線中昂貴的部分不再是推論,而會回到那位負責核准該次錄音的人類身上。

• 文字輸入的費率只是雜訊。對一份幾千字的腳本來說,每百萬個文字 token 收費 0.50 美元,與音訊部分相比不過是捨入誤差。不要為了長度而最佳化腳本。

• 12月31日這個斷崖期限是真的,而且會讓音訊費率翻倍。如果你正在規劃 2027 年的推行計畫,請以促銷後的數字編列預算,而不是上線時的數字,否則你一月就得重新規劃。

獨立的那個數,以及那些不獨立的

這次發布中有一個數字並非來自 Google。在 Artificial Analysis Provider Voice Arena 上,資料擷取於 2026 年 9 月 24 日,Gemini 3.8 Flash TTS 以 Elo 1,260 排名第 2,涵蓋 1,999 個樣本與 8 種競技場語音;而 Gemini 3.8 Flash-Lite TTS 則以 1,235 排名第 6,涵蓋 2,000 個樣本。兩者都落在彼此的信賴區間內,分別為 ±16 與 ±17,因此這份排行榜告訴你,兩者在偏好上於統計上無法區分——這是一個確實有用的結果,因為這意味著對聽眾而言,較便宜的那一款並沒有在可量測的意義上更差。

其餘一切都是 Google 自己的說法,也應如此看待:關於表現力的措辭、語言數量、複製品質。這個競技場給你的只是一個偏好排名,別無其他。它不會告訴你,兩個模型各自如何處理一份 40 分鐘的腳本而不出現漂移、遇到從未見過的專有名詞時會如何表現,或是一個設計過的語音在一週後會變成什麼樣子。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and Gemini 3.8 Flash-Lite TTS at rank 6 with an Elo of 1,235, with Cartesia Sonic 3.6, Qwen-Audio-3.0-TTS-Plus, Inworld Realtime TTS-2 and BreezeBlue Breeze TTS 2 filling the rows between and around them.

Lite 模型也更足以說明這組模型是真正的分級,而非行銷層級。25 分的 Elo 差距落在誤差範圍內,對比 33% 的價差,正是價格敏感管線幾乎每次都該選擇 Lite 的決策樣態——也是延遲敏感管線該往反方向做決定的決策樣態,因為兩者在速度與帳單上都有差異。

該在哪裡執行它,以及那個答案的誠實版本

OrcaRouter 並未託管 Gemini 3.8 TTS 端點。這件事值得直說,而不是暗示並非如此,因為關於這兩個模型,我們能說的實用重點並不是我們提供它們——我們並沒有——而是像 12 月 31 日變更這樣的供應商降價,正是那種讓路由值得存在的事件。

OrcaRouter200 多款模型單一 API 金鑰之後,並以供應商定價提供,不加收任何加成費用,因此供應商的價目表就是你實際支付的價格,而且價目表一旦變動,我們這邊當天就同步生效,不必等到下一個帳務週期。對於正處於遷移途中的語音處理流程來說,容錯移轉層比模型目錄更關鍵:你可以把一條請求路徑指向仍在評估中的模型,卻不必拿正式生產路徑去賭,因為失敗的呼叫可以退回到已經驗證可行的模型。當沒有任何單一嗓音足夠理想時,路由 DSL 能把多個模型組合成一次呼叫;而當答案的正確性比延遲更重要時,模型融合會以一組模型共同回應同一個提示。

就 Gemini 3.8 TTS 模型本身而言,要呼叫它們的地方是 Google 自家的 API,以及 Google 在 9 月 23 日點名的那些介面。這對模型對你的架構所帶來的作用——一次呼叫就能處理兩位說話者、把風格設定當作標註、讓聲音能被描述而不只是被挑選——才是會在上市優惠結束後依然留存的部分。

接下來要看什麼

有三件事將決定這一代是重大躍進還是僅只一項功能。

第一個是漂移。沒有人發表過長篇評估,檢驗雙講者路徑能否在整整一小時內維持身分不變;在有人做到之前,鵜鶘示範就只是個示範。第二個是語音的生命週期。一個設計出來的語音若一週就失效,那只是原型;能從儲存的設定重新推導出來的語音才是產品,而答案取決於你保留的是兩個識別碼中的哪一個。第三個是十二月三十一日之後會發生什麼事:屆時促銷費率結束,語音管線的每小時成本一夜之間翻倍。

這些從發表文章裡都看不出來。這三項在文件中全都看得見,而發表報導正是在那裡就不再讀下去了。