
Gemini 3.8 Live 對比 Gemini 3.8 TTS:對話迴圈與朗讀語音共用同一個世代名稱
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 36 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 181 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
Gemini 3.8 Live 是一款語音轉語音模型,於 2026 年 9 月 15 日推出,型號為gemini-3.8-live與gemini-3.8-live-extended-thinking。「Gemini 3.8 TTS」根本不是一個模型——它是發表報導(包括 Google 自家文章的標題)用來統稱那對文字轉語音端點的總括用語,而這對端點於 2026 年 9 月 23 日推出,型號分別為gemini-3.8-flash-tts與gemini-3.8-flash-lite-tts。所以,這不是那種尋常的對比頁面,讓兩個產品爭奪同一項工作。這是一頁關於兩項共用同一個世代編號的工作,也是關於當人們把「Live」和「TTS」這兩個詞當成同一件事的兩種口味時,所犯下的那個特定錯誤。
共享世代號所隱藏的分支
Google 的語音生成說明文件本身就劃清了界線,而這句話很容易在快速瀏覽時被略過:「TTS 功能與透過 Live API 提供的語音生成不同。」同一段文字也解釋了原因,而這個原因是結構性的,並非品質優劣的問題。Live API 是為「互動式、非結構化音訊,以及多模態輸入與輸出」而打造。透過 Gemini API 提供的 TTS「則是為需要精確朗讀文字並具備精細控制的場景所量身打造」。後續的一則附註明確指出輸入形式:TTS 模型只接受文字,並且只回傳音訊。
那個單一限制——輸入文字、輸出音訊、沒有音訊輸入——就是整個比較的核心。Gemini 3.8 Live 模型會聽見對它說話的人。Gemini 3.8 Flash TTS 或 Flash-Lite TTS 模型則永遠聽不見任何人;它讀取一段字串並將它表演出來。其餘一切皆由此而來:針對其中一方存在的基準測試,對另一方毫無意義;計價是按不同單位計量的;而且失效模式根本無法相提並論。
這點很重要,因為這兩個使用案例從外表看起來完全相同。語音代理與旁白管線最終都會輸出聽起來像真人說話的語音。只有其中一個可以被中斷。
「Gemini 3.8 TTS」實際上解析到哪裡
打開 Gemini API 語音生成的支援模型表格,你會發現四個 TTS 項目,卻沒有名為 Gemini 3.8 TTS 的項目。其中兩個屬於這一代:Gemini 3.8 Flash TTS,模型 ID gemini-3.8-flash-tts,支援 130 種語言,以及 Gemini 3.8 Flash-Lite TTS,模型 ID gemini-3.8-flash-lite-tts,支援 101 種語言。另外兩個——Gemini 3.1 Flash TTS Preview 和 Gemini 2.5 Pro Preview TTS——是 Flash-Lite 所取代的預覽世代。
所以當有人說「Gemini 3.8 TTS」時,他們通常指的是 Flash 層級,因為那是發布貼文主打的項目,也是 Arena 排行榜上排名最高的。當他們用這個說法來指稱即時語音代理時,他們指的其實並不存在,因為他們想要的東西位於不同的端點,有不同的名稱和不同的輸入契約。
還有第三個值得指名的碰撞,因為它會產生最糟的建議。Gemini 3.8 Live 不是一款附帶額外功能的文字轉語音模型。它是一款語音轉語音模型,而它每單位成本更高的原因,在於它每單位做的工作更多:聆聽、在發話中途推理、處理插話,而且在 Extended Thinking 變體中,還會在回答前先深思熟慮。
唯一真正能相比的數字
品質分數不會在這兩個家族之間移轉;沒有單一評分板能用同一軸度為旁白者和對話者打分。金錢確實會移轉——只要你誠實地選定單位——而對任何語音事物來說,誠實的單位就是音訊小時。
• 按輸入計量 — Gemini 3.8 Live 依每分鐘音訊計費,輸入每分鐘 $0.005、輸出每分鐘 $0.018;相對地,Gemini 3.8 Flash TTS 依每百萬音訊權杖計費,2026 年 12 月 31 日前為 $9.00,之後為 $18.00
• 按輸出計量 — Gemini 3.8 Live 的雙向音訊,依定價表,同時輸入與輸出每小時約 $1.38,且尚未計入任何提示快取;相對地,Gemini 3.8 Flash TTS 是單向串流,而依 Artificial Analysis 的標準化計算,一百萬字元的成品旁白為 $16.5
• 文字輸入 — Gemini 3.8 Live 將文字與音訊分開列帳,輸入每百萬文字權杖 $0.75、輸出 $4.50;相對地,TTS 端點的文字輸入為每百萬權杖 $0.50
• Flash-Lite 層級 — Gemini 3.8 Live 沒有更便宜的兄弟方案;選擇只有 Live 或 Extended Thinking;相對地,Gemini 3.8 Flash-Lite TTS 定價為每百萬音訊權杖 $6.00,之後 $12.00,而 Artificial Analysis 為每百萬字元 $11.0
• 輸入形態 — Gemini 3.8 Live 為音訊、視訊與文字輸入,音訊輸出;相對地,TTS 端點為文字輸入,音訊輸出
Live 的數字是我們根據 Google 公布的每分鐘費率計算出來的,並非 Google 公布的每小時數字。字元數字是 Artificial Analysis 的標準化結果,當你比較語音合成層級時,應該引用這組數字。請注意,Artificial Analysis 自家的 Speech to Speech 排行榜針對 Live 模型另有一欄每小時輸入音訊成本——Gemini 3.8 Live 約為 $3.50,Extended Thinking 變體約為 $0.84——這又是另一種標準化方式,不應把它拿來跟每分鐘費率表並列,彷彿兩者是同一種測量方式。

選錯會出什麼問題?
這些失效模式之所以具有啟發性,正因為它們彼此如此迥異。
當你需要的是對話迴圈,卻呼叫了 TTS 端點,而且沒有任何錯誤。請求傳回有效的音訊。你會得到對固定字串流暢、朗讀優良的回應,然後是一片沉默——因為從來就沒有任何東西在聆聽。團隊在建立第一個插話(barge-in)測試時發現這件事,並發現「使用者」必須等到整段音訊播放完畢,下一輪才能開始。將對話功能改裝到合成端點上,意味著要在其周圍加入語音辨識、輪替發言政策以及中斷機制;到了這個地步,你已經重建了一套串接式系統,而且你得為兩個模型付費,而不是一個。
當你需要的是旁白,卻呼叫 Live 端點,你就在為自己用不到的能力付費。Live 模型會雙向計量收費,因為它預期會有雙向互動。對有聲書或訓練影片的配音來說,輸入端是一份永遠不會變的腳本,而模型也完全不需要聽到任何東西。你等於買了一個對話迴圈來朗讀文件。
唯一真正難以抉擇的情況,就是串接式架構:先辨識,再推理,然後合成。這種架構並未過時,而且對許多正式環境系統來說,它仍然是正確的選擇,因為它讓你能獨立抽換每個階段,並為每個階段挑選不同的供應商。它的代價是延遲,以及犧牲了單一端到端模型能在對話輪次邊界之間維持的韻律。這種取捨在兩個方向上都是真實存在的。
在路由已存在處
OrcaRouter 並不提供 Gemini 3.8 Live 端點,也不提供 3.8 TTS 端點,而這一點值得在談論路由的任何其他事情之前先說清楚,因為面對這麼龐大的目錄,人很容易假設情況正好相反。這個目錄確實收錄的,是這個家族其餘的成員——google/gemini-3.8-flash,涵蓋在 28 個 Google 模型之中,以及總計超過 200 個模型,只需一組金鑰,即可依供應商原價使用,絕不加價。
這件事對串聯式架構尤其重要。如果你的架構是辨識、接著推理、然後合成,那麼推理階段正是單一金鑰橫跨多家供應商能帶來回報的環節,因為這是你最常替換的階段,也是供應商降價應該當天就反映到你的帳單上、而非等到下一次合約續約的階段。它也是自動容錯移轉發揮價值的階段:一個串聯式架構有三個可能故障點,而中間那一個是做成備援最便宜的地方。

簡短的決策規則
如果模型必須回應某個它原本並非以文字形式取得的內容,你要的是 Gemini 3.8 Live,而且你應該按 Google 的每分鐘音訊費率來編列預算,並預期得思考你需要的是兩種變體中的哪一種。如果文字已經寫好,而工作是把這段文字表演出來,你要的是 Gemini 3.8 Flash TTS 或 Flash-Lite TTS,而且你應該按每百萬字元來編列預算,並依據語言涵蓋範圍,以及品質差距是否值得價格差距來選擇等級。
而如果有人要你比較「Gemini 3.8 Live 與 Gemini 3.8 TTS」,彷彿它們是兩個產品,你能做的第一件有用的事,就是先問清楚是哪個端點。簡報上的名稱並無法對應到單一端點,而這個答案所改變的是架構,不只是帳單。

