一張為「Gemini 3.8 Live vs Gemini 3.8 TTS」生成的主視覺卡片,背景為白色,帶有柔和的藍色與青色漸層點綴。左欄標題為「在 Live API 上推出」,列出「gemini-3.8-live」、「能聽能說」、「音訊輸入、音訊輸出」;右欄標題為「在 TTS 端點上推出」,列出「gemini-3.8-flash-tts」、「朗讀書面文字」、「文字輸入、音訊輸出」。頁尾一行寫著「兩者都不叫 Gemini 3.8 TTS。」OrcaRouter 標誌合成於右下角。
Guides & Insights

Gemini 3.8 Live 對比 Gemini 3.8 TTS:對話迴圈與朗讀語音共用同一個世代名稱

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Gemini 3.8 Live 是一款語音轉語音模型,於 2026 年 9 月 15 日推出,型號為gemini-3.8-live與gemini-3.8-live-extended-thinking。「Gemini 3.8 TTS」根本不是一個模型——它是發表報導(包括 Google 自家文章的標題)用來統稱那對文字轉語音端點的總括用語,而這對端點於 2026 年 9 月 23 日推出,型號分別為gemini-3.8-flash-tts與gemini-3.8-flash-lite-tts。所以,這不是那種尋常的對比頁面,讓兩個產品爭奪同一項工作。這是一頁關於兩項共用同一個世代編號的工作,也是關於當人們把「Live」和「TTS」這兩個詞當成同一件事的兩種口味時,所犯下的那個特定錯誤。

共享世代號所隱藏的分支

Google 的語音生成說明文件本身就劃清了界線,而這句話很容易在快速瀏覽時被略過:「TTS 功能與透過 Live API 提供的語音生成不同。」同一段文字也解釋了原因,而這個原因是結構性的,並非品質優劣的問題。Live API 是為「互動式、非結構化音訊,以及多模態輸入與輸出」而打造。透過 Gemini API 提供的 TTS「則是為需要精確朗讀文字並具備精細控制的場景所量身打造」。後續的一則附註明確指出輸入形式:TTS 模型只接受文字,並且只回傳音訊。

那個單一限制——輸入文字、輸出音訊、沒有音訊輸入——就是整個比較的核心。Gemini 3.8 Live 模型會聽見對它說話的人。Gemini 3.8 Flash TTS 或 Flash-Lite TTS 模型則永遠聽不見任何人;它讀取一段字串並將它表演出來。其餘一切皆由此而來:針對其中一方存在的基準測試,對另一方毫無意義;計價是按不同單位計量的;而且失效模式根本無法相提並論。

這點很重要,因為這兩個使用案例從外表看起來完全相同。語音代理與旁白管線最終都會輸出聽起來像真人說話的語音。只有其中一個可以被中斷。

「Gemini 3.8 TTS」實際上解析到哪裡

打開 Gemini API 語音生成的支援模型表格,你會發現四個 TTS 項目,卻沒有名為 Gemini 3.8 TTS 的項目。其中兩個屬於這一代:Gemini 3.8 Flash TTS,模型 ID gemini-3.8-flash-tts,支援 130 種語言,以及 Gemini 3.8 Flash-Lite TTS,模型 ID gemini-3.8-flash-lite-tts,支援 101 種語言。另外兩個——Gemini 3.1 Flash TTS Preview 和 Gemini 2.5 Pro Preview TTS——是 Flash-Lite 所取代的預覽世代。

所以當有人說「Gemini 3.8 TTS」時,他們通常指的是 Flash 層級,因為那是發布貼文主打的項目,也是 Arena 排行榜上排名最高的。當他們用這個說法來指稱即時語音代理時,他們指的其實並不存在,因為他們想要的東西位於不同的端點,有不同的名稱和不同的輸入契約。

還有第三個值得指名的碰撞,因為它會產生最糟的建議。Gemini 3.8 Live 不是一款附帶額外功能的文字轉語音模型。它是一款語音轉語音模型,而它每單位成本更高的原因,在於它每單位做的工作更多:聆聽、在發話中途推理、處理插話,而且在 Extended Thinking 變體中,還會在回答前先深思熟慮。

唯一真正能相比的數字

品質分數不會在這兩個家族之間移轉;沒有單一評分板能用同一軸度為旁白者和對話者打分。金錢確實會移轉——只要你誠實地選定單位——而對任何語音事物來說,誠實的單位就是音訊小時。

• 按輸入計量 — Gemini 3.8 Live 依每分鐘音訊計費,輸入每分鐘 $0.005、輸出每分鐘 $0.018;相對地,Gemini 3.8 Flash TTS 依每百萬音訊權杖計費,2026 年 12 月 31 日前為 $9.00,之後為 $18.00
• 按輸出計量 — Gemini 3.8 Live 的雙向音訊,依定價表,同時輸入與輸出每小時約 $1.38,且尚未計入任何提示快取;相對地,Gemini 3.8 Flash TTS 是單向串流,而依 Artificial Analysis 的標準化計算,一百萬字元的成品旁白為 $16.5
• 文字輸入 — Gemini 3.8 Live 將文字與音訊分開列帳,輸入每百萬文字權杖 $0.75、輸出 $4.50;相對地,TTS 端點的文字輸入為每百萬權杖 $0.50
• Flash-Lite 層級 — Gemini 3.8 Live 沒有更便宜的兄弟方案;選擇只有 Live 或 Extended Thinking;相對地,Gemini 3.8 Flash-Lite TTS 定價為每百萬音訊權杖 $6.00,之後 $12.00,而 Artificial Analysis 為每百萬字元 $11.0
• 輸入形態 — Gemini 3.8 Live 為音訊、視訊與文字輸入,音訊輸出;相對地,TTS 端點為文字輸入,音訊輸出

Live 的數字是我們根據 Google 公布的每分鐘費率計算出來的,並非 Google 公布的每小時數字。字元數字是 Artificial Analysis 的標準化結果,當你比較語音合成層級時,應該引用這組數字。請注意,Artificial Analysis 自家的 Speech to Speech 排行榜針對 Live 模型另有一欄每小時輸入音訊成本——Gemini 3.8 Live 約為 $3.50,Extended Thinking 變體約為 $0.84——這又是另一種標準化方式,不應把它拿來跟每分鐘費率表並列,彷彿兩者是同一種測量方式。

A screenshot of Google's Gemini API pricing documentation in English, captured 25 September 2026, showing the speech-generation model index — a limited-access group listing Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking and Gemini 3.1 Flash Live Preview, alongside Gemini 3.8 Flash TTS, Gemini 3.8 Flash-Lite TTS and Gemini 3.1 Flash TTS Preview — above the Gemini 3.8 Flash per-million-token rates: $0.75 input through 31 December 2026 rising to $1.50, $3.75 output including thinking rising to $7.50, $0.075 context caching rising to $0.15, and storage at $0.50 rising to $1.00 per million tokens per hour, with search requests and prompts billed at $14 per 1,000 beyond the monthly free allowance. The page carries no rate-card line for a model named Gemini 3.8 TTS.

選錯會出什麼問題?

這些失效模式之所以具有啟發性,正因為它們彼此如此迥異。

當你需要的是對話迴圈,卻呼叫了 TTS 端點,而且沒有任何錯誤。請求傳回有效的音訊。你會得到對固定字串流暢、朗讀優良的回應,然後是一片沉默——因為從來就沒有任何東西在聆聽。團隊在建立第一個插話(barge-in)測試時發現這件事,並發現「使用者」必須等到整段音訊播放完畢,下一輪才能開始。將對話功能改裝到合成端點上,意味著要在其周圍加入語音辨識、輪替發言政策以及中斷機制;到了這個地步,你已經重建了一套串接式系統,而且你得為兩個模型付費,而不是一個。

當你需要的是旁白,卻呼叫 Live 端點,你就在為自己用不到的能力付費。Live 模型會雙向計量收費,因為它預期會有雙向互動。對有聲書或訓練影片的配音來說,輸入端是一份永遠不會變的腳本,而模型也完全不需要聽到任何東西。你等於買了一個對話迴圈來朗讀文件。

唯一真正難以抉擇的情況,就是串接式架構:先辨識,再推理,然後合成。這種架構並未過時,而且對許多正式環境系統來說,它仍然是正確的選擇,因為它讓你能獨立抽換每個階段,並為每個階段挑選不同的供應商。它的代價是延遲,以及犧牲了單一端到端模型能在對話輪次邊界之間維持的韻律。這種取捨在兩個方向上都是真實存在的。

在路由已存在處

OrcaRouter 並不提供 Gemini 3.8 Live 端點,也不提供 3.8 TTS 端點,而這一點值得在談論路由的任何其他事情之前先說清楚,因為面對這麼龐大的目錄,人很容易假設情況正好相反。這個目錄確實收錄的,是這個家族其餘的成員——google/gemini-3.8-flash,涵蓋在 28 個 Google 模型之中,以及總計超過 200 個模型,只需一組金鑰,即可依供應商原價使用,絕不加價。

這件事對串聯式架構尤其重要。如果你的架構是辨識、接著推理、然後合成,那麼推理階段正是單一金鑰橫跨多家供應商能帶來回報的環節,因為這是你最常替換的階段,也是供應商降價應該當天就反映到你的帳單上、而非等到下一次合約續約的階段。它也是自動容錯移轉發揮價值的階段:一個串聯式架構有三個可能故障點,而中間那一個是做成備援最便宜的地方。

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples and priced at $16.5 per million characters, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0 per million characters. The board lists no model named Gemini 3.8 TTS.

簡短的決策規則

如果模型必須回應某個它原本並非以文字形式取得的內容,你要的是 Gemini 3.8 Live,而且你應該按 Goog​le 的每分鐘音訊費率來編列預算,並預期得思考你需要的是兩種變體中的哪一種。如果文字已經寫好,而工作是把這段文字表演出來,你要的是 Gemini 3.8 Flash TTS 或 Flash-Lite TTS,而且你應該按每百萬字元來編列預算,並依據語言涵蓋範圍,以及品質差距是否值得價格差距來選擇等級。

而如果有人要你比較「Gemini 3.8 Live 與 Gemini 3.8 TTS」,彷彿它們是兩個產品,你能做的第一件有用的事,就是先問清楚是哪個端點。簡報上的名稱並無法對應到單一端點,而這個答案所改變的是架構,不只是帳單。

A generated summary card for Gemini 3.8 Live vs Gemini 3.8 TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — gemini-3.8-live on the Live API, shipped 15 September 2026', 'Gemini 3.8 TTS — not a model ID; resolves to gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts', 'Input contract: Live hears audio and video; TTS reads text only', 'The one shared unit: the hour of finished audio, not the benchmark', and 'Verdict: two jobs, one generation number — ask which endpoint'. A footer line reads 'Prices and language counts are vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.