
Muse Realtime Avatar 對決 Gemini 3.8 Live:一張臉對上一條語音線
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 180 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
這兩者並非彼此的替代品,而要看穿這一點,最快的方法就是問:各自輸出的是什麼。Muse Realtime Avatar由 Meta 於 2026 年 9 月 23 日發表,回傳的是角色說話的同步影片——你提供一張參考圖像,它就會渲染出那個東西在 448×768 直式畫面中說話、比手勢的模樣。Gemini 3.8 Live由 Google 於 2026 年 9 月 15 日發表,並在同日向開發者全面開放,回傳的則是音訊與文字。它完全沒有影片輸出。把這兩者放進同一個比較並不是錯誤——兩者爭奪的是同一個對話介面,而買家早就在問該以哪一個為基礎來開發——但這個決定不是「哪一個比較好」,而是「這兩款不同的產品,我需要的是哪一款」;而幾乎每一篇把這兩者並列比較的文章都搞錯了這一點,因為它們排出來的基準測試衡量的根本是不同的事情。
以下這種不對稱,應該為底下一切定調。你今天就能從終端機、用一組金鑰呼叫 Gemini 3.8 Live。你根本無法呼叫 Muse Realtime Avatar——沒有 API、沒有價格、沒有日期。Meta 在 Connect 上展示了它,並發布了一篇研究文章;Google 則推出了價目表與模型 ID。那是在拿一項產品與一則公告做比較,而這意味著,有用的問題不是哪一個勝出,而是各自會讓你承諾什麼。
每一個實際上會產出什麼
整場比較盡在這六行,而六行中沒有一行接近。
• 輸出 — Muse Realtime Avatar 會回傳同步的語音與人像影片,兩者由同一串語音符元一起生成;Gemini 3.8 Live 則回傳音訊與文字,模型中完全沒有任何影片生成。
• 開發者存取——Muse Realtime Avatar 則完全沒有:它於 2026 年 9 月 23 日以 Meta 的 Muse 代理能力之名發布,既沒有 API、沒有端點,也沒有公布日期。截至 2026 年 9 月 15 日,Gemini 3.8 Live 已可在 Gemini API 與 Google AI Studio 中使用,並以兩個模型 ID 提供,分別是 gemini-3.8-live 與 gemini-3.8-live-extended-thinking。
• 價格 — Muse Realtime Avatar 沒有公開價格,因為沒有東西可以購買。Gemini 3.8 Live 透過 Live API 公布音訊輸入每分鐘 $0.005、音訊輸出每分鐘 $0.018 的價格。
• 獨立評分 —— Muse Realtime Avatar 完全沒有;它的數字是 Meta 自家的,而且是對照 Meta 自選的基準所測得。Gemini 3.8 Live 在 Artificial Analysis Speech to Speech Index 上拿下 76.0,延伸思考版本則為 82.6 —— 這是第三方數字,屬於另一種等級的證據。
• 延遲 — 這兩個公開數字並非同一種測量,而大多數報導正是在此處出錯。Meta 公布的是 870 毫秒,從你的發言結束到同步語音與視訊回覆的第一個位元組。Google 的數字則由 Artificial Analysis 實測,標準模型到首個音訊為 1.18 秒,推理版本則為 1.35 秒。
• 畫面與語言 — Muse Realtime Avatar 以每秒 25 幀渲染 448×768 的直式影片。Gemini 3.8 Live 支援在對話進行中自動切換 97 種支援語言,並處理近乎即時的視覺輸入。
最後一列包含了人們不斷抹平的那項區別。Gemini 3.8 Live 能看見。它無法展示。Muse Realtime Avatar 能展示。它是否能看見,並非 Meta 那篇文章所談的重點——它是一個由音訊驅動的生成器,以語音符記和參考圖像為條件,而它的工作是產出一張臉,而不是讀取一張臉。

延遲數據無法互相比較,而且差距比看起來更小。
870 毫秒對上 1.18 秒,讀起來像是 Meta 快了 26%。細看這些測量數據,這個比較就站不住腳了。Meta 的數字是從使用者這一輪說話結束,到含有影片的回覆送出第一個位元組為止的時間——而 Meta 的貼文明確表示這是首個位元組的測量值,既不是完整回覆所需時間,也不是通話其餘部分的持續傳輸延遲。一個系統可以做到首個位元組 870 毫秒,卻在第十二秒時仍讓人感覺遲滯。Google 的數字則是首個音訊的時間,而要產生的東西嚴格說來更小,且它是由外部評估者測量,而非由廠商自行量測。
兩者都屬於那種能告訴你系統是對話式、而非輪替式的數字,而兩者都無法告訴你通話進行到第五分鐘時是什麼感覺。如果你要在兩者之間就反應速度做選擇,誠實的立場是:沒有人發表過同基準的比較測量,而唯一能取得這種測量的方式,就是去跑那個可供實際呼叫的。
你現在就能夠建立的基礎,以及你還得等待的部分
Gemini 3.8 Live 具備正式上線決策所需的要素:兩個可鎖定的模型 ID、已公布的每分鐘費率、第三方指數評分,以及明訂的正式推出日期。它也帶有語音產品通常會有的限制——輸入音訊,輸出音訊與文字,且不支援影片生成。
Muse Realtime Avatar 具備研究貼文該有的事物:一套架構、四項由公司自行報告的數據,以及一組已揭露的偏好測試;這些測試是 Meta 針對兩套商用虛擬化身系統所進行,其中一套 Meta 自己報告在舉止表現上與同等水準在統計上無法區分。它缺少的,是購買它的方式。Meta 的貼文也指出,所展示的示範並不全都反映 Muse app 中可用的虛擬化身,而這句話應該主導你圍繞此事所制定的任何計畫。
還有第三種選項值得提出,因為那正是大多數團隊實際上採用的做法。這兩個模型都不是完整的代理。Gemini 3.8 Live 在持續對話的同時,把背景工作交給工具與 API;GPT-Live-1 則完全把它的推理委派給一個獨立的後端模型。對話層是前端,而思考則是對另一個模型發出的另一次呼叫。那第二次呼叫是普通的文字推論,而且是可以路由的。
在 OrcaRouter 上,那一層就是一個端點:一把金鑰,就能取用 15 家供應商的 196 個模型,以供應商定價原價直通、零加成,而且當你選用的模型發生錯誤或逾時,會自動容錯移轉。我們不代管 Gemini 3.8 Live——Live API 是 Google 專屬的——我們也不代管 Muse Realtime Avatar,那根本沒有人在代管。我們提供的是語音代理中,會隨著你的來電者思考得多用力而擴展的那一半,以及你無需重新協商任何事就能更動的那一半。

這兩者可能真正交會的地方
將它們並列比較的理由不在於基準測試。而在於兩者都試圖佔據產品中的同一個位置:使用者與之對話的對象。Google 的賭注是,這個位置是一場對話,而交付成果是一場好的對話——97 種語言、背景工具執行、一個推理變體,能解決 68.6% 的 τ-Voice 客戶服務情境,而標準模型僅能解決 30.1%。Meta 的賭注是,這個位置是一種存在感,而且能看到代理的使用者就是會留在對話中的使用者。
那些押注並非互斥。一個產品有可能使用 Gemini 3.8 Live 來處理語音迴圈,並使用像 Muse Realtime Avatar 這樣的東西來處理視覺層,前提是這個虛擬化身層有一天變得可呼叫。它不能做的是把它們視為可互換,因為其中一個永遠不會給你一張臉,另一個則可能永遠不會給你一個端點。
如何決定
如果你這季要推出語音產品,決定早就替你做好了:Gemini 3.8 Live 可以呼叫,而 Muse Realtime Avatar 不行。請依據這次發布真正爭論的軸線來挑選你的變體——擴展思考模型以略高於四倍的每小時音訊成本,換來 38 個百分點的代理式任務完成率,而標準模型是公開排行榜上最便宜且堪用的語音模型。接著,把委派的推理另外路由,因為帳單和延遲都出在這裡。
如果你正在評估虛擬化身層,老實說,目前還沒有任何東西可以評估。現有的是一篇研究貼文,裡頭有四個由公司自行公布的數字,以及一個示範。真正值得關注的不是那個指數——Muse Realtime Avatar 不會出現在任何指數上——而是 Meta 是否會公布價目表、端點和日期,以及當虛擬化身是在手機上透過行動網路連線運行,而不是在 Connect 示範中運行時,它的 870 毫秒是否依然站得住腳。
在那之前,這個比較的形式比大多數文章所提供的更簡短。其中一個是有價格、型號 ID 和外部評分的產品。另一個則是對某個尚未具備上述任何一項的事物所做的極佳示範。

