
Gemini 3.8 實時外洩:兩個全新語音代號,以及為何「實時延伸思考」更為重要
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
本週,有兩個從未出現在任何已發布文件中的字串,出現在一個 GCP 配額頁面上:Gemini 3.8 Live,以及一個名為Live Extended Thinking的東西。它們是由版本追蹤帳號 @testingcatalog 發現,並於 9 月 15 日貼出,同時直白地註明兩者皆未公開。這就是目前為止全部的公開紀錄——沒有模型卡、沒有定價資訊、沒有 API 更新日誌項目,也沒有任何相關承認。但這兩個名稱落在一條極為清晰可辨的脈絡末端。Gemini 3.1 Flash Live仍是該公司自家文件推薦用於 Live API 開發的模型,Gemini 3.5 Live與 Gemini 3.5 Live Experimental 則於 8 月 26 日以 Gemini Audio 家族之姿登場,而同一家族的文字端——Gemini 3.8 Flash——自 9 月 2 日起便持續推出。一個「3.8 Live」將能弭平這道落差。而這兩個代稱中,第二個更耐人尋味。
先講標籤,因為一則外洩消息的成敗全看它們。這不是正式發布。兩個代號都尚未由 Google 宣布、文件化、定價或確認,而且消息來源只有一個追蹤發布動態的帳號。以下關於 Gemini 3.8 Live 與 Live Extended Thinking 的一切都未經證實。以下關於已推出型號的一切——Gemini 3.1 Flash Live、Gemini 3.5 Live、Gemini 3.8 Flash——皆有文件可查、可供核實,而我在全文中都標明了哪個是哪個。
訊號傳達了什麼,又沒有傳達什麼
• 據報導 — 兩個代稱,「Gemini 3.8 Live」與「Live Extended Thinking」,出現在 Google Cloud 配額頁面上,於 9 月 15 日張貼,並附註它們「尚未公開」
• 未經報導——一項公告、一張模型卡、一個價格、一個上下文視窗、一個發布日期、一個 API ID、任何基準測試數據,或來自 Google 的任何確認
• 佐證 —— 截至本文撰寫時,尚無任何佐證。Google 的 Gemini API 模型頁面最後更新於 9 月 4 日,僅列出兩個對話式 Live 模型,gemini-3.1-flash-live-preview 與 gemini-3.5-live-translate-preview,而兩者皆未提供「Live Extended Thinking」變體
• 同一份簡報,另一項主張——同一則 9 月 15 日貼文也預測 Grok 4.7「應該會落在 Opus 5.0 附近,而非 5.1」,並表示其多模態工作「仍有待加強」。那是另一家廠商的模型,而且是預測而非成品;此處提及僅為求來源完整。
• 這個名稱本身的意涵——Google Cloud 的配額項目是按模型劃分的 SKU,這支持它是可計費的 API 模式,而不是消費者版 Gemini 應用程式內的一項功能。這是從該字串出現的表面所做的推論,並非已確認的事實

為什麼配額頁面是模型最先洩漏的地方
這是值得理解的部分,因為它說明了為什麼一個兩字產物值得用一整篇文章來談。配額頁面不是行銷版面。它們是計費與速率限制基礎設施:Cloud 客戶能呼叫的每個模型,在第一次付費請求獲得處理之前,都需要有一筆按專案計的配額項目,而這些項目是由同一項讓模型準備好正式推出的工程工作所佈建。某個 slug 出現在那裡,代表有人已為某個 SKU 建好底層管道——而不是有人草擬了一份新聞稿。
這是一把雙面刃,而誠實的解讀是審慎的那一種。配額項目比研究論文裡的代號走得更遠,因為它暗示了一個預定面向客戶的介面。它也正好是那種在推出前會被建立、測試,然後悄悄改名的東西。這個家族的文字端進展快到足以讓這一點變得具體:Gemini 3.6 Flash 於 7 月 21 日問世,Gemini 3.7 Flash 於 8 月 13 日,Gemini 3.8 Flash 於 9 月 2 日——六週內三次 Flash 發布。一條迭代如此快速的模型產品線,就是會準備比以那些名稱實際推出更多 SKU 的產品線。
Live 產品線一直落後一個版本
這正是讓「Gemini 3.8 Live」成為真正話題、而非命名上的奇聞的原因:Google 的語音模型完全沒有跟上其文字模型的腳步。
• 目前建議使用的 Live API 模型 — gemini-3.1-flash-live-preview,最新更新於 2026 年 3 月,Google 自家的文件仍將其描述為適用於所有 Live API 使用情境的模型
• 其限制——131,072 個輸入詞元與 65,536 個輸出詞元,可接受文字、圖像、音訊和視訊輸入,並輸出文字和音訊
• Gemini Audio 系列,於 8 月 26 日發布——Gemini 3.5 Live、Gemini 3.5 Live Experimental 與 Gemini 3.5 Transcribe,其中 Transcribe 模型將取代 Chirp 3 用於語音轉文字
• 同時,文字產品線——Gemini 3.5 Flash、Gemini 3.6 Flash、Gemini 3.7 Flash 與 Gemini 3.8 Flash——在大約相同的期間內歷經了四個公開版本

所以音訊這條線停在 3.5 世代,而文字這條線已經來到 3.8。「Gemini 3.8 Live」這個代號是第一個證據,顯示 Google 打算把語音重新拉回與文字相同的世代——而對任何正在打造語音代理的人來說,這意味著 Live 工作階段底下的推理能力,可能一次就跳過三個文字模型世代,而不是一個。
為什麼「Live Extended Thinking」是更有趣的 slug
如今,Gemini Live 模型上的思考是一個旋鈕,而不是一個模型。Live API 提供了一個 thinkingLevel參數,有四種設定——minimal、low、medium 和 high——而預設值是 minimal,這是刻意選擇以最佳化最低延遲。這個預設值說明了這項產品的用途:一場將停頓視為錯誤的對話。
一個名為「Live Extended Thinking」的獨立 slug,暗示 Google 正準備將其拆分為兩個產品,而非一個調控旋鈕,而這背後的道理很直接。在語音模型中,延遲與深思之間存在直接衝突——你無法既立即回答,又在回答前仔細思考——因此,單一模型搭配一個切換開關,會迫使每個呼叫端在每次請求時,都只能在這條線上的某一點做出選擇。兩個 SKU 讓客戶能把快速路徑(中斷處理、插話、快速查詢)與慢速路徑(語音代理逐步完成多步驟任務)路由到各自調校不同的端點,而不會讓其中一方拖累另一方。
先例早已存在於 Google 自家八月的發布之中。Gemini 3.5 Live Experimental 被描述為能在「說話的同時直接推理」,並在執行任務時逐步敘述自身進展的變體——一個明確帶有思考色彩的語音模型,以專屬 id 而非某項設定的形式推出。「Live Extended Thinking」讀起來像是那種直覺從實驗性標籤畢業、成為正式命名產品。這是從一個字串推斷而來,而且確實只是推斷——但這正是這條特定產品線過去曾予以回報的那種推斷。
你今天實際可以撥打的電話
這裡沒有任何內容會改變你現在能存取的東西,而這一點值得直說。現在沒有 Gemini 3.8 Live 端點可供呼叫,沒有 Live Extended Thinking 設定可以開啟,也沒有任何方法能購買這兩者的存取權。今天任何販售「Gemini 3.8 Live access」的帳號,賣的只是一個標籤,不是模型。你真正能使用的 Live 模型是 gemini-3.1-flash-live-preview 和 gemini-3.5-live-translate-preview,兩者都透過 Google 自家的 API 以預覽版提供。
文字這一邊則是另一番景象,而這也正是真正可路由的部分。Gemini 3.8 Flash 於 9 月 2 日推出,依 Google 自家定價為每百萬輸入 token 0.75 美元、每百萬輸出 3.75 美元,並預定於 2027 年 1 月 1 日翻倍至 1.50 美元與 7.50 美元——在 OrcaRouter 上便以相同的定價運行,且完全不額外加價。對於一個已預先宣布漲價的模型來說,直通定價比平時更為重要:當 1 月的價格生效時,這裡也會在同一天跟著調整,既不必另外簽約重新議價,也無須修改任何程式碼。

這條語音產品線今天並不在 OrcaRouter 上——任何廠商的 Live 或原生音訊 SKU 也都不在——所以這裡的內容不該被解讀成我們在代管它。路由層真正能派上用場的,是這個故事的另一半。等到 3.8 世代的 Live 模型真的問世,而另一個偏向思考型的變體也在一旁登場時,要在快速語音路徑與深思熟慮的路徑之間做選擇,就會變成一個路由決策,而不是一次改寫:同一個金鑰背後有兩個端點,而且若你當初所依據的預覽版 id 被淘汰,還能自動容錯移轉。對一條今年已經自己改過一次名的產品線來說,這並非假設。
什麼能證實這一點——而什麼又能推翻它?
一篇爆料文章應該告訴你它可能哪裡出錯。就 Gemini 3.8 Live 與 Live Extended Thinking 而言,可供確認的證據既具體又可查核:
• 配額項目對外公開——同一個 slug 出現在 Google Cloud 或 Vertex AI 的模型清單中,並附帶速率限制,而不只是出現在螢幕截圖裡
• 一則 Gemini API 更新日誌條目,或模型頁面上的一列,目前只列出到 gemini-3.1-flash-live-preview 和 gemini-3.5-live-translate-preview
• 一張 DeepMind 模型卡——八月的音訊模型在該處被記錄為「Gemini 3.5 Audio」,即使相關報導稱它們為 Live 和 Transcribe,因此這張模型卡才是能為名稱定案的產物
• 定價資料列,這是將暫存 SKU 變成有人能購買的產品的那唯一要素
• 反證——那些 slug 被重新命名、被併入現有模型的思考設定中,或乾脆再也不出現。對一個配額頁面來說,這三種都是尋常結果,而其中任何一種都意味著這則內容是早了一步,而不是做對了
該留意什麼,以及誰應採取行動
如果你正在 Live API 上建構語音代理,本週你的架構完全不需要改變——你會用來建構的模型仍然是 gemini-3.1-flash-live-preview,而誠懇的建議是把模型 ID 放在設定值後面,並讓第二個 Live 端點保持待命,因為這條產品線已經自己改過一次名稱,而且可能再次改名。如果你正在挑選文字模型,這次外洩與你無關;Gemini 3.8 Flash 正在推出,現已定價且可衡量,而更有用的問題是一月的價格變動,而不是語音代號。
真正該關注的不是發布本身。而是「Live Extended Thinking」會以第二個模型的形式登場,還是作為第一個模型上的第五個設定。如果它是一個獨立的 SKU,Google 就是在告訴開發者:會思考的語音代理與會說話的語音代理是不同產品——而這是一個比名稱中任何版本號都更具影響力的主張。
真正有用之處路由層正是這個故事的另一半。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
