為「Gemini 3.8 Live with Live Avatar」生成的主視覺卡片,置於白色背景上,帶有柔和的藍青色漸層點綴。三張堆疊的卡片寫著「2026年9月15日 — Gemini 3.8 Live 與 3.8 Live Extended Thinking 在 Live API 上推出」、「2026年9月24日 — 發表 Live Avatar,Gemini Enterprise」,以及「今天 — avatar 是企業級功能,不是模型 ID」。頁腳一行寫著「日期依據 Google DeepMind。」OrcaRouter 標誌合成於右下角。
Guides & Insights

Gemini 3.8 Live 搭配 Live Avatar:Google 為其語音模型賦予了一張臉

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 於 2026 年 9 月 15 日推出——這是 Google 在該供應商 API 上開放的兩個原生即時對話端點,一個針對延遲最佳化,另一個針對深思推理最佳化。9 月 24 日,該公司發布了搭載 Live Avatar 的 Gemini 3.8 Live,它將近乎即時的影片生成與同一套語音迴路搭配,讓模型在說話時擁有面孔。這兩個模型 ID 本身沒有任何改變。改變的是對話被允許呈現的樣貌,以及——影響更為深遠的是——模型在對話仍在進行時被允許對對話做什麼。

9月24日實際上發布了什麼?

DeepMind 的貼文簡短而具體,值得把它的宣稱與其含義分開來看。用 Google 自己的話來說,Live Avatar 將即時影片生成與既有的語音技術堆疊搭配,為 Gemini 的對話式 AI 帶來近乎即時的視覺臨場感。該公司描述精準的嘴型同步、自然的表情與流暢的輪替發言,並提出兩個部署範例:客戶服務與互動式導覽。接著,它說出對任何正在規劃開發的人最重要的一句話——「從今天起,搭載 Live Avatar 的 Gemini 3.8 Live 已在 Gemini Enterprise 推出。」

這就是可用性的全部實情。Live Avatar 並不是 Gemini API 的模型 ID。API 的音訊模型清單裡仍然只有 gemini-3.8-live 和 gemini-3.8-live-extended-thinking,沒有 avatar 這一列,而費率表也沒有 avatar 的計費項目。這項功能落在 Gemini Enterprise 之中,這意味著這則公告的受眾是企業買家,以及代表他們進行整合的開發者,而不是今天用一把金鑰呼叫 Live API 的個別開發者。

貼文中的兩項說法值得精確引用,因為兩者都比常見的發布措辭更強烈。第一項:Live Avatar「具備原生多語言語音對語音同步功能」,而且「能在 97 種語言之間無縫轉換,同時不降低影片保真度,也不會產生視覺漂移。」這個 97 的數字,與 9 月 15 日發布時針對其底層即時對話模型所宣稱的語言數量相同,因此這是把既有的多語言說法重新表述,並附上一項新限制——當語言在句子中途改變時,唇形同步與臉部動畫必須跟得上。第二項:所有輸出都以 SynthID 加上浮水印,「直接織入音訊與視訊輸出之中」。是兩條軌道,不只是人聲。

真正全新的能力是中間那一個

撇開視覺效果不談,最有趣的一段就是談工具呼叫的那段。Goog​le 表示,Live Avatar 背後靠的是「非同步工具呼叫」,能夠「在持續進行對話的同時,於背景觸發工具呼叫並擷取資料,處理複雜任務的同時確保對話流程不中斷」。書中舉的實例是飯店房客辦理入住,模型在背景呼叫工具,同時繼續說話。

那與大多數語音整合所依據的請求-回應架構,確實存在真正的架構差異,而這正是帶有成本的部分。非同步執行意味著模型正在做逐字稿未顯示的工作。在文字流程中,你會看到工具呼叫成為一輪對話。在這裡,它發生在仍在進行中的對話底下,而這就引發了任何並行執行都會引发的相同問題:如果工具呼叫在句子講到一半時無聲無息地失敗,會怎麼樣?呼叫方又要如何得知?Google 的文章沒有說,而模型卡正是應該去找答案的地方。請把「不中斷的對話流暢度」這項說法視為廠商自述,且未經我們能找到的任何第三方實測。

預設頭像,以及限制有趣那一半的允許清單

這套客製化方案分為兩個層級,且只有其中一個層級是普遍提供的。每個企業部署都能取得「多樣化的預設頭像庫」。自訂頭像——從「高品質參考圖像」生成,同時「保留參考對象的相似度、品牌風格或角色身分」——則設有門檻,而 Google 直言:「自訂頭像建立功能目前僅透過企業允許清單提供。」

所以,大多數團隊實際上會想要的那項能力——也就是讓虛擬化身能符合品牌或具名角色形象的那項能力——正是你無法自助取得的那一項。如果你的計畫取決於一位長得像你吉祥物的合成主持人,那你等的是允許清單的決定,而不是模型發布。這是採購上的事實,不是技術上的事實,而且這種事往往會悄悄讓一個季度溜走。

A screenshot of the Google DeepMind blog post 'Introducing Gemini 3.8 Live with Live Avatar', captured in English on 25 September 2026, showing the 24 September 2026 date, the authors listed as Shuo-yiin Chang and CJ Zheng on behalf of the Gemini Audio Team, the lede 'Building on the momentum of last week's Gemini 3.8 Live launch', the sentence 'Starting today, Gemini 3.8 Live with Live Avatar is available in Gemini Enterprise', and the section heading 'More natural and multimodal conversations'.

它相對於行內其他部分的位置

Live Avatar 並非在一個空白的產品家族中誕生,而它所處的位置,最容易透過同一兩週內推出的同系列產品來看清。

• 供應形式 — 搭載 Live Avatar 的 Gemini 3.8 Live 是 Gemini Enterprise 內的企業級功能,而 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 則是 Gemini API 端點,具備模型 ID 及公開的每分鐘費率
• 開發者可呼叫他 — Live Avatar 不行,沒有模型 ID,也沒有費率表項目;而兩個 Live 端點則可以,gemini-3.8-live 與 gemini-3.8-live-extended-thinking
• 輸出 — Live Avatar 為音訊加上同步視訊,而 Live 端點僅有音訊
• 語言聲稱 — Live Avatar 支援 97 種語言,具備脣形同步與表情連續性;而 Live 端點支援 97 種語言,並可在對話中途自動切換
• 浮水印 — Live Avatar 在音訊與視訊軌上都加入 SynthID;而 Live 端點則在生成的音訊上加入 SynthID

這兩個 Live 端點本身就是文件記載詳盡的一對。獨立量測顯示,它們在某些軸向上相距甚遠,在另一些軸向上則很接近:在 Artificial Analysis Speech to Speech Index 上,Gemini 3.8 Live Extended Thinking (High) 為 82.6,而 Gemini 3.8 Live 為 76.0,這個差距主要建立在推理品質上,而非對話動態;在對話動態方面,排名則會反轉。Google 自家的數據顯示,兩者在 τ-Voice 任務完成度上分別為 68.6% 與 30.1%,在 Big Bench Audio 上則為 98% 與 92%。Live Avatar 會繼承你在其底下呼叫的那一個,也會繼承它們的定價,因為這個 avatar 是同一套對話迴圈之上的呈現層。

A screenshot of the Artificial Analysis Speech to Speech leaderboard, captured in English on 25 September 2026, showing the AA Speech to Speech Index speed and cost-per-hour-of-input-audio panel. The top index values read 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with a cost axis running to roughly $10.75 per hour. The bar labels are set vertically and are not legible at capture size.

這不會改變什麼

它不會讓模型變得更好。Live Avatar 是一層呈現與協調層:Gemini 3.8 Live 的品質數字仍與 9 月 15 日時相同,而任何需要兩種變體中較強者的人,仍必須選擇 Extended Thinking 並接受其延遲。它不會把影片放進 API 裡。它也不會改變與模型對話的價格,該價格仍依 Live API 的每分鐘音訊費率計費——音訊輸入每分鐘 $0.005、音訊輸出每分鐘 $0.018——而虛擬人像的影片生成並未公開定價,因為它並未單獨販售。

它真正改變的,是那些無需獨立渲染層即可打造的產品集合。過去只會說話、並在螢幕上留下一塊空白面板的支援代理,現在能在工作時維持一張臉,而它在背景進行的工作也不再以冷場的形式顯露。這對介面的形態是實質的改變,對底層模型則是溫和的改變。這兩件事可以同時成立。

A generated summary card for Gemini 3.8 Live with Live Avatar on a white background with soft blue-and-cyan gradient accents. Four rows read 'Announced: 24 September 2026', 'Underlying models: gemini-3.8-live and gemini-3.8-live-extended-thinking, unchanged', 'Availability: Gemini Enterprise; custom avatars by enterprise allowlist', and 'Watermark: SynthID on audio and video'. A footer line reads 'Per Google DeepMind, 24 September 2026; vendor-reported and not independently benchmarked.' The OrcaRouter logo is composited in the bottom-right corner.

值得關注的重點,以及一則路由備註

有三件事能讓這則消息從一項公告變成一個開發決策。自訂虛擬人偶的允許清單必須開放,因為預設虛擬人偶只是展示,自訂虛擬人偶才是產品。視訊軌必須有價格,因為沒有人能對未定價的產出建立單位經濟模型。而且 API 的模型清單中必須出現一個虛擬人偶端點,因為這就是企業級功能與開發者今晚就能呼叫的東西之間的差別。

在我們這邊,有一點值得明確說明,因為人們很容易做出相反的假設:OrcaRouter 並不路由 Gemini 3.8 Live 端點或 Live Avatar,而本文任何內容都不應被解讀為我們有這麼做的聲明。我們確實提供的是 Goog​le 3.8 系列其餘的部分——google/gemini-3.8-flash正是其中之一——以及一份超過 200 個模型的目錄,可透過單一金鑰,以供應商定價、零加價取得。如果 Live Avatar 讓你的架構走向一個必須對客戶所說內容進行推理的代理,那麼那套堆疊中負責推理的那一半,就是你今天就能整合起來的那一半。