為文章〈Muse Realtime Avatar vs GPT-Live-1〉產生的主視覺卡片,顯示標題兩側各有一張圓角卡片。左側卡片在人像頭像圖示上方顯示「Muse Realtime Avatar」,並有「視訊 + 語音,單一串流」與「沒有 API,沒有價格,沒有日期」兩行;右側卡片在對話框圖示上方顯示「GPT-Live-1」,並有「每分鐘 $0.05,以秒計費」與「並行工作階段,WebRTC」兩行。副標題寫著「一個賣的是分鐘,另一個賣的是臨場感。」OrcaRouter 標誌合成於右下角。
Guides & Insights

Muse Realtime Avatar vs GPT-Live-1:臨場感對決對話

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

計費單位告訴你每家公司認為自己在賣什麼。GPT-Live-1,Open​AI 的全雙工語音模型,以每分鐘 0.05 美元的固定費率按秒計費,而它的速率限制則以並行工作階段為單位——第 1 級為 25 個,到第 5 級升至 500 個。那是一條電話線的單位。Muse Realtime Avatar,由 Meta 於 2026 年 9 月 23 日發布,沒有計費單位,因為沒有東西可計費:沒有 API、沒有端點、沒有價格、沒有日期。它公布的單位反而是硬體數字——在一顆 NVIDIA GB200 上有 12 個並行即時工作階段。一家公司正以分鐘為單位販售對話。另一家則在向你展示一張臉要花多少成本才能算繪出來,而且還沒決定要把它賣出去。

這兩個模型都算新,但兩者都不是這個詞通常所指的那種「發表」。GPT-Live-1 於 2026 年 7 月 8 日在 ChatGPT 內部上線,直到 9 月 10 日才登上開發者 API——在這兩個月裡,它是一款消費性產品的預設聲音,任何想動手開發的人都碰不到。Muse Realtime Avatar 則於 2026 年 9 月 23 日在 Meta Connect 上發表,在 Meta 自家的研究貼文中做了展示,至今仍是 Muse 代理的一項能力,而不是一款產品。把兩者拿來比較,其實是在比較同一個想法的兩個不同階段:當一個對話模型好到某個程度,下一個問題就變成——它說話的時候,使用者正在看著什麼。

OpenAI 打造了什麼:一場永不中斷的對話

GPT-Live-1 是操作層面上真正要緊的那種全雙工——它不會等你講完才開始運作。它只透過一個端點,也就是 Live Sessions 端點,並且只在一個模型 ID gpt-live-1 之下觸及開發者 API,沒有可鎖定的日期快照,也沒有啟用同類端點。沒有 Chat Completions、沒有 Responses、沒有 Realtime、沒有微調、沒有音訊轉錄或語音端點。影像與視訊輸入明確不受支援。

影響所有後續環節的設計決策是委派。GPT-Live-1 不自行進行艱難的思考。OpenAI 的文件將語音層與獨立的推理後端配對,而在已發佈的 WebRTC 範例中,該後端是 GPT-5.6 Terra。因此,一場 GPT-Live-1 工作階段是兩套計費表同時運轉:語音每分鐘 $0.05,加上後端模型對每一次工具呼叫、搜尋與推理步驟所收取的正常 token 費率。在 Speech to Speech Index 上,這種分裂人格表現為同一個模型出現兩次評分——以 GPT-6 Astra 在中等努力程度下負責思考時為 81.5,以 GPT-5.6 Sol 在低努力程度下為 80.1。這兩種配置之間 1.4 分的差距,比讓 GPT-Live-1 最佳配置登上第一名的 0.2 分領先幅度還要大。

這就是這款模型最真實的樣貌。語音前端是固定的;智慧則是你設定的參數,而它對分數的影響比任何競爭模型都更大。

Meta 打造了什麼:一張會隨著聲音移動的臉

Muse Realtime Avatar 所處理的,是 GPT-Live-1 並未面臨的問題——讓生成的影片與生成的語音保持同步。Meta 的解答是讓兩者成為同一道串流:Muse Realtime Voice 輸出的語音 token 同時承載內容與韻律,而虛擬分身則是一個由音訊驅動的 Diffusion Transformer,取用同一批 token,並以一張參考影像與近期影片潛在表徵的滾動視窗作為條件。沒有任何東西是在事後才對嘴的,因為根本不存在「事後」——聲音、嘴形與表情全都出自同一個流程。

已公布的數字是 Meta 自家的,且是依據 Meta 自行選擇的基準衡量,公司外部沒有任何一項被重現。從你結束一輪發言到同步語音與視訊回覆的第一個位元組,需時 870 毫秒。448×768 直式影片、每秒 25 幀,並以透明疊層加上浮水印,讓觀看者能分辨這不是攝影機畫面。在一台 GB200 上同時執行十二個工作階段,相較 Meta 自家的兩步驟 BF16 基準,容量提升 8 倍,這歸功於四位元量化感知訓練、持久 KV 快取,以及延遲感知的動態批次處理。還有一項 Meta 報告的偏好結果:相較該基準,從 45% 升至 55%,並揭露對商用虛擬化身系統的兩項勝出——另外也揭露,在舉止神態上,對其中一套系統的結果與打平在統計上無法區分。

那份清單中沒有任何一項是比率、端點或日期。

A generated comparison scoreboard titled 'Muse Realtime Avatar vs GPT-Live-1 — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'GPT-Live-1'. Rows read: What it returns — video + voice vs audio + text; Where it runs — Muse app only vs Live Sessions API, WebRTC; Billing unit — none published vs $0.05 per minute, by the second; Scale limit — 12 sessions per GB200 vs 25 to 500 concurrent sessions by tier; Independent score — none vs AA Speech to Speech 81.5 with Astra; Reasoning — inside Muse vs delegated to a separate backend model. A footer line reads 'Meta figures company-reported; GPT-Live-1 index figure per Artificial Analysis and configuration-specific.'

兩公尺長的帳單,以及路由在何處證明其價值

GPT-Live-1 的成本結構不是單一數字,而把它當成單一數字,正是聽起來便宜的語音模型產生昂貴一個月的方式。語音每分鐘 $0.05,按秒計費且不進位,而一次工作階段的前 15 秒會預先計費,但會折抵後續時長,而不是額外加收。工作階段所委派的一切——推理、工具呼叫、任何搜尋——都按後端模型自身的費率另行計費。把委派指向前沿推理模型,並讓它在每一輪都搜尋,你就打造了一條每小時 $3 的開放線路,背後還有一個高階模型。

第二個計量錶是可路由的那一半。在 OrcaRouter 上,GPT-Live-1 工作階段的後端不過就是另一次模型呼叫:單一金鑰背後串接來自 15 家供應商的 196 個模型,以供應商定價原價轉嫁、零加成,並在你所選模型出錯或逾時時自動容錯移轉。你無法路由語音層——Live Sessions 僅是 Open​AI 的端點——但語音層委派出去的一切都落在同一把金鑰上,這表示帳單中隨著你的來電者思考得多用力而擴大的那部分,也正是你不必簽約就能改變的那部分。

相較之下,Muse Realtime Avatar 沒有需要路由的計量器。它是應用程式的一項功能。

A screenshot of the Artificial Analysis Speech to Speech leaderboard showing the Speech to Speech Index ranking, with GPT-Live-1 listed at 81.5 in its Astra configuration alongside the other ranked speech-to-speech models.

關於語音代理用途的兩個賭注

撇開規格不談,兩家公司對這個產品的看法並不一致。Open​AI 的賭注是,對話就是產品本身——語音代理服務就是一條電話線,而要做的事就是讓它感覺起來像一條電話線:永不卡頓、把困難的思考交給背後的模型、按分鐘計費、依同時通話數擴展規模。GPT-Live-1 的 API 介面中每一項選擇都由此而來。以並發數為基礎的速率限制、僅支援 WebRTC 的傳輸方式、刻意窄化的單一端點、不支援視訊輸入或輸出。

Meta 押注的是:臨場感本身就是產品——看得見代理人的使用者,才會留在對話裡;而真正有意思的工程挑戰不在於輪流發言,而在於讓一個渲染出來的角色在整通通話期間保持連貫。這些選擇造就了一個在 GPU 上針對影格率與工作階段密度最佳化的系統,而且完全沒有任何商業化的著力點。

確實有可能兩者都對,而且兩者會被組合起來。一個產品可以把它的對話跑在全雙工語音模型上,並把它的視覺層跑在虛擬化身渲染器上,而今天唯一阻礙這件事的,就是虛擬化身渲染器沒有端點。不可信的是,把它們當成同一筆購買的兩個版本。

誰應該行動,誰應該等待

如果你現在正在打造語音產品,GPT-Live-1 可以呼叫,而 Muse Realtime Avatar 不行,這樣一來決策就結束了。GPT-Live-1 內部真正有意思的選擇,是你委派給哪個後端,因為那才是分數與帳單真正變動的地方——而且那也是技術堆疊中唯一一個你能在不動到語音整合的情況下進行路由、替換與容錯移轉的部分。

如果你想要的是虛擬替身,等待並非被動。值得觀察的事情很具體:Meta 是否公布費率表和端點、是否出現明確日期,以及 870 毫秒能否在手機以行動網路連線時經得起考驗,而不是只在 Connect 示範中成立。Meta 自家的貼文指出,其示範並非全都反映 Muse 應用程式中可用的虛擬替身,而這句話正是值得牢牢記住的。

在這些情況有任何一項改變之前,這個比較只需一句話就能回答。GPT-Live-1 是附上你自選腦袋的一條電話線。Muse Realtime Avatar 則是一張沒有電話號碼的臉。

A screenshot of the OrcaRouter models catalogue page, showing the subtitle '196 models · 15 providers · one API key, one bill', a 'How to call any model' panel with a POST example against the OpenAI-compatible endpoint, and a grid of model cards including DeepSeek V4.1 Flash, GPT-6 Astra, Gemini 3.8 Flash, Qwen3.8 Max and Claude Fable 5.1.