
Gemini 3.8 Live 搭配 Live Avatar:Google 為其語音模型賦予了一張臉
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 36 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 181 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 於 2026 年 9 月 15 日推出——這是 Google 在該供應商 API 上開放的兩個原生即時對話端點,一個針對延遲最佳化,另一個針對深思推理最佳化。9 月 24 日,該公司發布了搭載 Live Avatar 的 Gemini 3.8 Live,它將近乎即時的影片生成與同一套語音迴路搭配,讓模型在說話時擁有面孔。這兩個模型 ID 本身沒有任何改變。改變的是對話被允許呈現的樣貌,以及——影響更為深遠的是——模型在對話仍在進行時被允許對對話做什麼。
9月24日實際上發布了什麼?
DeepMind 的貼文簡短而具體,值得把它的宣稱與其含義分開來看。用 Google 自己的話來說,Live Avatar 將即時影片生成與既有的語音技術堆疊搭配,為 Gemini 的對話式 AI 帶來近乎即時的視覺臨場感。該公司描述精準的嘴型同步、自然的表情與流暢的輪替發言,並提出兩個部署範例:客戶服務與互動式導覽。接著,它說出對任何正在規劃開發的人最重要的一句話——「從今天起,搭載 Live Avatar 的 Gemini 3.8 Live 已在 Gemini Enterprise 推出。」
這就是可用性的全部實情。Live Avatar 並不是 Gemini API 的模型 ID。API 的音訊模型清單裡仍然只有 gemini-3.8-live 和 gemini-3.8-live-extended-thinking,沒有 avatar 這一列,而費率表也沒有 avatar 的計費項目。這項功能落在 Gemini Enterprise 之中,這意味著這則公告的受眾是企業買家,以及代表他們進行整合的開發者,而不是今天用一把金鑰呼叫 Live API 的個別開發者。
貼文中的兩項說法值得精確引用,因為兩者都比常見的發布措辭更強烈。第一項:Live Avatar「具備原生多語言語音對語音同步功能」,而且「能在 97 種語言之間無縫轉換,同時不降低影片保真度,也不會產生視覺漂移。」這個 97 的數字,與 9 月 15 日發布時針對其底層即時對話模型所宣稱的語言數量相同,因此這是把既有的多語言說法重新表述,並附上一項新限制——當語言在句子中途改變時,唇形同步與臉部動畫必須跟得上。第二項:所有輸出都以 SynthID 加上浮水印,「直接織入音訊與視訊輸出之中」。是兩條軌道,不只是人聲。
真正全新的能力是中間那一個
撇開視覺效果不談,最有趣的一段就是談工具呼叫的那段。Google 表示,Live Avatar 背後靠的是「非同步工具呼叫」,能夠「在持續進行對話的同時,於背景觸發工具呼叫並擷取資料,處理複雜任務的同時確保對話流程不中斷」。書中舉的實例是飯店房客辦理入住,模型在背景呼叫工具,同時繼續說話。
那與大多數語音整合所依據的請求-回應架構,確實存在真正的架構差異,而這正是帶有成本的部分。非同步執行意味著模型正在做逐字稿未顯示的工作。在文字流程中,你會看到工具呼叫成為一輪對話。在這裡,它發生在仍在進行中的對話底下,而這就引發了任何並行執行都會引发的相同問題:如果工具呼叫在句子講到一半時無聲無息地失敗,會怎麼樣?呼叫方又要如何得知?Google 的文章沒有說,而模型卡正是應該去找答案的地方。請把「不中斷的對話流暢度」這項說法視為廠商自述,且未經我們能找到的任何第三方實測。
預設頭像,以及限制有趣那一半的允許清單
這套客製化方案分為兩個層級,且只有其中一個層級是普遍提供的。每個企業部署都能取得「多樣化的預設頭像庫」。自訂頭像——從「高品質參考圖像」生成,同時「保留參考對象的相似度、品牌風格或角色身分」——則設有門檻,而 Google 直言:「自訂頭像建立功能目前僅透過企業允許清單提供。」
所以,大多數團隊實際上會想要的那項能力——也就是讓虛擬化身能符合品牌或具名角色形象的那項能力——正是你無法自助取得的那一項。如果你的計畫取決於一位長得像你吉祥物的合成主持人,那你等的是允許清單的決定,而不是模型發布。這是採購上的事實,不是技術上的事實,而且這種事往往會悄悄讓一個季度溜走。

它相對於行內其他部分的位置
Live Avatar 並非在一個空白的產品家族中誕生,而它所處的位置,最容易透過同一兩週內推出的同系列產品來看清。
• 供應形式 — 搭載 Live Avatar 的 Gemini 3.8 Live 是 Gemini Enterprise 內的企業級功能,而 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 則是 Gemini API 端點,具備模型 ID 及公開的每分鐘費率
• 開發者可呼叫他 — Live Avatar 不行,沒有模型 ID,也沒有費率表項目;而兩個 Live 端點則可以,gemini-3.8-live 與 gemini-3.8-live-extended-thinking
• 輸出 — Live Avatar 為音訊加上同步視訊,而 Live 端點僅有音訊
• 語言聲稱 — Live Avatar 支援 97 種語言,具備脣形同步與表情連續性;而 Live 端點支援 97 種語言,並可在對話中途自動切換
• 浮水印 — Live Avatar 在音訊與視訊軌上都加入 SynthID;而 Live 端點則在生成的音訊上加入 SynthID
這兩個 Live 端點本身就是文件記載詳盡的一對。獨立量測顯示,它們在某些軸向上相距甚遠,在另一些軸向上則很接近:在 Artificial Analysis Speech to Speech Index 上,Gemini 3.8 Live Extended Thinking (High) 為 82.6,而 Gemini 3.8 Live 為 76.0,這個差距主要建立在推理品質上,而非對話動態;在對話動態方面,排名則會反轉。Google 自家的數據顯示,兩者在 τ-Voice 任務完成度上分別為 68.6% 與 30.1%,在 Big Bench Audio 上則為 98% 與 92%。Live Avatar 會繼承你在其底下呼叫的那一個,也會繼承它們的定價,因為這個 avatar 是同一套對話迴圈之上的呈現層。

這不會改變什麼
它不會讓模型變得更好。Live Avatar 是一層呈現與協調層:Gemini 3.8 Live 的品質數字仍與 9 月 15 日時相同,而任何需要兩種變體中較強者的人,仍必須選擇 Extended Thinking 並接受其延遲。它不會把影片放進 API 裡。它也不會改變與模型對話的價格,該價格仍依 Live API 的每分鐘音訊費率計費——音訊輸入每分鐘 $0.005、音訊輸出每分鐘 $0.018——而虛擬人像的影片生成並未公開定價,因為它並未單獨販售。
它真正改變的,是那些無需獨立渲染層即可打造的產品集合。過去只會說話、並在螢幕上留下一塊空白面板的支援代理,現在能在工作時維持一張臉,而它在背景進行的工作也不再以冷場的形式顯露。這對介面的形態是實質的改變,對底層模型則是溫和的改變。這兩件事可以同時成立。

值得關注的重點,以及一則路由備註
有三件事能讓這則消息從一項公告變成一個開發決策。自訂虛擬人偶的允許清單必須開放,因為預設虛擬人偶只是展示,自訂虛擬人偶才是產品。視訊軌必須有價格,因為沒有人能對未定價的產出建立單位經濟模型。而且 API 的模型清單中必須出現一個虛擬人偶端點,因為這就是企業級功能與開發者今晚就能呼叫的東西之間的差別。
在我們這邊,有一點值得明確說明,因為人們很容易做出相反的假設:OrcaRouter 並不路由 Gemini 3.8 Live 端點或 Live Avatar,而本文任何內容都不應被解讀為我們有這麼做的聲明。我們確實提供的是 Google 3.8 系列其餘的部分——google/gemini-3.8-flash正是其中之一——以及一份超過 200 個模型的目錄,可透過單一金鑰,以供應商定價、零加價取得。如果 Live Avatar 讓你的架構走向一個必須對客戶所說內容進行推理的代理,那麼那套堆疊中負責推理的那一半,就是你今天就能整合起來的那一半。
