為文章〈Muse Realtime Avatar vs Gemini 3.8 Live〉生成的主視覺卡片,標題兩側各有一張圓角卡片。左側卡片在影片影格圖示上方寫著「Muse Realtime Avatar」,下方幾行則為「影片 + 語音輸出」、「448x768 直式,25 fps」以及「9 月 23 日發布,無 API」;右側卡片在麥克風與對話泡泡圖示上方寫著「Gemini 3.8 Live」,下方幾行是「音訊 + 文字輸出」、「音訊輸入 $0.005/分鐘」和「9 月 15 日正式推出,Live API」。副標題寫著「一個渲染出一張臉。另一個運行一條電話線。」OrcaRouter 標誌合成於右下角。
Guides & Insights

Muse Realtime Avatar 對決 Gemini 3.8 Live:一張臉對上一條語音線

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

這兩者並非彼此的替代品,而要看穿這一點,最快的方法就是問:各自輸出的是什麼。Muse Realtime Avatar由 Meta 於 2026 年 9 月 23 日發表,回傳的是角色說話的同步影片——你提供一張參考圖像,它就會渲染出那個東西在 448×768 直式畫面中說話、比手勢的模樣。Gemini 3.8 LiveGoogle 於 2026 年 9 月 15 日發表,並在同日向開發者全面開放,回傳的則是音訊與文字。它完全沒有影片輸出。把這兩者放進同一個比較並不是錯誤——兩者爭奪的是同一個對話介面,而買家早就在問該以哪一個為基礎來開發——但這個決定不是「哪一個比較好」,而是「這兩款不同的產品,我需要的是哪一款」;而幾乎每一篇把這兩者並列比較的文章都搞錯了這一點,因為它們排出來的基準測試衡量的根本是不同的事情。

以下這種不對稱,應該為底下一切定調。你今天就能從終端機、用一組金鑰呼叫 Gemini 3.8 Live。你根本無法呼叫 Muse Realtime Avatar——沒有 API、沒有價格、沒有日期。Meta 在 Connect 上展示了它,並發布了一篇研究文章;Goo​gle 則推出了價目表與模型 ID。那是在拿一項產品與一則公告做比較,而這意味著,有用的問題不是哪一個勝出,而是各自會讓你承諾什麼。

每一個實際上會產出什麼

整場比較盡在這六行,而六行中沒有一行接近。

輸出 — Muse Realtime Avatar 會回傳同步的語音與人像影片,兩者由同一串語音符元一起生成;Gemini 3.8 Live 則回傳音訊與文字,模型中完全沒有任何影片生成。

開發者存取——Muse Realtime Avatar 則完全沒有:它於 2026 年 9 月 23 日以 Meta 的 Muse 代理能力之名發布,既沒有 API、沒有端點,也沒有公布日期。截至 2026 年 9 月 15 日,Gemini 3.8 Live 已可在 Gemini API 與 Goog​le AI Studio 中使用,並以兩個模型 ID 提供,分別是 gemini-3.8-livegemini-3.8-live-extended-thinking

價格 — Muse Realtime Avatar 沒有公開價格,因為沒有東西可以購買。Gemini 3.8 Live 透過 Live API 公布音訊輸入每分鐘 $0.005、音訊輸出每分鐘 $0.018 的價格。

獨立評分 —— Muse Realtime Avatar 完全沒有;它的數字是 Meta 自家的,而且是對照 Meta 自選的基準所測得。Gemini 3.8 Live 在 Artificial Analysis Speech to Speech Index 上拿下 76.0,延伸思考版本則為 82.6 —— 這是第三方數字,屬於另一種等級的證據。

延遲 — 這兩個公開數字並非同一種測量,而大多數報導正是在此處出錯。Meta 公布的是 870 毫秒,從你的發言結束到同步語音與視訊回覆的第一個位元組。Google 的數字則由 Artificial Analysis 實測,標準模型到首個音訊為 1.18 秒,推理版本則為 1.35 秒。

畫面與語言 — Muse Realtime Avatar 以每秒 25 幀渲染 448×768 的直式影片。Gemini 3.8 Live 支援在對話進行中自動切換 97 種支援語言,並處理近乎即時的視覺輸入

最後一列包含了人們不斷抹平的那項區別。Gemini 3.8 Live 能看見。它無法展示。Muse Realtime Avatar 能展示。它是否能看見,並非 Meta 那篇文章所談的重點——它是一個由音訊驅動的生成器,以語音符記和參考圖像為條件,而它的工作是產出一張臉,而不是讀取一張臉。

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Gemini 3.8 Live — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Gemini 3.8 Live'. Rows read: Output — video + voice vs audio + text; Developer access — none, announced only vs Live API and AI Studio; Price — none published vs $0.005/min in, $0.018/min out; Independent score — none vs AA Speech to Speech 76.0; Latency — 870 ms to first byte of voice + video vs 1.18 s to first audio; Frame — 448x768 portrait at 25 fps vs audio only, 97 languages. A footer line reads 'Meta figures company-reported; Google and index figures per Artificial Analysis.'

延遲數據無法互相比較,而且差距比看起來更小。

870 毫秒對上 1.18 秒,讀起來像是 Meta 快了 26%。細看這些測量數據,這個比較就站不住腳了。Meta 的數字是從使用者這一輪說話結束,到含有影片的回覆送出第一個位元組為止的時間——而 Meta 的貼文明確表示這是首個位元組的測量值,既不是完整回覆所需時間,也不是通話其餘部分的持續傳輸延遲。一個系統可以做到首個位元組 870 毫秒,卻在第十二秒時仍讓人感覺遲滯。Google 的數字則是首個音訊的時間,而要產生的東西嚴格說來更小,且它是由外部評估者測量,而非由廠商自行量測。

兩者都屬於那種能告訴你系統是對話式、而非輪替式的數字,而兩者都無法告訴你通話進行到第五分鐘時是什麼感覺。如果你要在兩者之間就反應速度做選擇,誠實的立場是:沒有人發表過同基準的比較測量,而唯一能取得這種測量的方式,就是去跑那個可供實際呼叫的。

你現在就能夠建立的基礎,以及你還得等待的部分

Gemini 3.8 Live 具備正式上線決策所需的要素:兩個可鎖定的模型 ID、已公布的每分鐘費率、第三方指數評分,以及明訂的正式推出日期。它也帶有語音產品通常會有的限制——輸入音訊,輸出音訊與文字,且不支援影片生成。

Muse Realtime Avatar 具備研究貼文該有的事物:一套架構、四項由公司自行報告的數據,以及一組已揭露的偏好測試;這些測試是 Meta 針對兩套商用虛擬化身系統所進行,其中一套 Meta 自己報告在舉止表現上與同等水準在統計上無法區分。它缺少的,是購買它的方式。Meta 的貼文也指出,所展示的示範並不全都反映 Muse app 中可用的虛擬化身,而這句話應該主導你圍繞此事所制定的任何計畫。

還有第三種選項值得提出,因為那正是大多數團隊實際上採用的做法。這兩個模型都不是完整的代理。Gemini 3.8 Live 在持續對話的同時,把背景工作交給工具與 API;GPT-Live-1 則完全把它的推理委派給一個獨立的後端模型。對話層是前端,而思考則是對另一個模型發出的另一次呼叫。那第二次呼叫是普通的文字推論,而且是可以路由的。

在 OrcaRouter 上,那一層就是一個端點:一把金鑰,就能取用 15 家供應商的 196 個模型,以供應商定價原價直通、零加成,而且當你選用的模型發生錯誤或逾時,會自動容錯移轉。我們不代管 Gemini 3.8 Live——Live API 是 Goo​gle 專屬的——我們也不代管 Muse Realtime Avatar,那根本沒有人在代管。我們提供的是語音代理中,會隨著你的來電者思考得多用力而擴展的那一半,以及你無需重新協商任何事就能更動的那一半。

A screenshot of Google's blog post 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated September 15, 2026, showing the announcement headline and the opening of the post introducing the two speech-to-speech models.

這兩者可能真正交會的地方

將它們並列比較的理由不在於基準測試。而在於兩者都試圖佔據產品中的同一個位置:使用者與之對話的對象。Google 的賭注是,這個位置是一場對話,而交付成果是一場好的對話——97 種語言、背景工具執行、一個推理變體,能解決 68.6% 的 τ-Voice 客戶服務情境,而標準模型僅能解決 30.1%。Meta 的賭注是,這個位置是一種存在感,而且能看到代理的使用者就是會留在對話中的使用者。

那些押注並非互斥。一個產品有可能使用 Gemini 3.8 Live 來處理語音迴圈,並使用像 Muse Realtime Avatar 這樣的東西來處理視覺層,前提是這個虛擬化身層有一天變得可呼叫。它不能做的是把它們視為可互換,因為其中一個永遠不會給你一張臉,另一個則可能永遠不會給你一個端點。

如何決定

如果你這季要推出語音產品,決定早就替你做好了:Gemini 3.8 Live 可以呼叫,而 Muse Realtime Avatar 不行。請依據這次發布真正爭論的軸線來挑選你的變體——擴展思考模型以略高於四倍的每小時音訊成本,換來 38 個百分點的代理式任務完成率,而標準模型是公開排行榜上最便宜且堪用的語音模型。接著,把委派的推理另外路由,因為帳單和延遲都出在這裡。

如果你正在評估虛擬化身層,老實說,目前還沒有任何東西可以評估。現有的是一篇研究貼文,裡頭有四個由公司自行公布的數字,以及一個示範。真正值得關注的不是那個指數——Muse Realtime Avatar 不會出現在任何指數上——而是 Meta 是否會公布價目表、端點和日期,以及當虛擬化身是在手機上透過行動網路連線運行,而不是在 Connect 示範中運行時,它的 870 毫秒是否依然站得住腳。

在那之前,這個比較的形式比大多數文章所提供的更簡短。其中一個是有價格、型號 ID 和外部評分的產品。另一個則是對某個尚未具備上述任何一項的事物所做的極佳示範。

A screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the Speech to Speech Index ranking with Gemini 3.8 Live Extended Thinking at 82.6 and Gemini 3.8 Live at 76.0 among the listed rows, alongside panels for time to first audio and cost per hour of input audio.