為文章〈Muse Realtime Avatar vs SeedRealtime〉生成的 hero card,標題兩側各有一張圓角卡片。左側卡片在向外播送的視訊影格圖示上方寫著「Muse Realtime Avatar」,下方則是「生成影片」與「Meta,9 月 23 日發表」兩行;右側卡片在螢幕與眼睛圖示上方寫著「SeedRealtime」,下方則是「觀看影片」與「ByteDance,8 月 5 日推出」兩行。副標題寫著「兩者都沒有費率表。」OrcaRouter 標誌合成於右下角。
Guides & Insights

Muse Realtime Avatar vs SeedRealtime:只能觀看的兩款模型

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

這兩者都沒有價目表。Muse Realtime Avatar由 Meta 於 2026 年 9 月 23 日在 Meta Connect 發表,沒有 API、沒有端點、沒有價格、也沒有時程——它是 Meta 的 Muse 代理的一項能力,在一篇題為「Bringing Your Muse to Life」的研究貼文中展示。SeedRealtime由字節跳動 Seed 於 2026 年 8 月 5 日發布,沒有 API、沒有權重、沒有技術報告,也沒有參數量——它存在於字節跳動自家的豆包 App 裡,而字節跳動的貼文只說它已「全面推出」。全球兩大消費級 AI 公司在相隔七週內先後推出影音即時系統,而兩者都買不到。這就是這場比較,而它比那張誰也做不出來的基準測試表更有意思。

它們之間的區別在於影片流動的方向。SeedRealtime 觀看、聆聽,並談論它所看到的事物——音訊、視訊和文字進入一個端對端網路,並將輪流發言從外部的語音活動偵測器移入模型本身。Muse Realtime Avatar 則負責生成:你交給它一張參考圖片、一張照片、一張插圖或一個物體,它就會在整個對話期間以連續影片渲染那個東西說話和比手勢的樣子。SeedRealtime 的影片是輸入。Muse Realtime Avatar 的影片是輸出。兩者都被描述為全雙工,兩者都是視聽的,而它們打著同樣的標籤,卻做著相反的工作。

每個是什麼,以及它位於何處

六行,而最後兩行才是決定一切的關鍵。

影片 — 由 Muse Realtime Avatar 生成,解析度為 448×768 的直式畫面、每秒 25 幀,並疊加透明浮水印,讓觀看者能辨識這並非攝影機直播畫面;SeedRealtime 則負責感知,將影格串流進處理音訊的同一個網路。

架構上的賭注 —— Muse Realtime Avatar 讓語音與視訊共用同一條 token 流,因此由音訊驅動的 Diffusion Transformer 直接取用 Muse Realtime Voice 的語音 token,之後完全不需要對嘴;SeedRealtime 則把輪替發話整合進模型中,誰在何時開口不再是外部語音活動偵測器的決定。

運行環境 — Muse Realtime Avatar 是 Meta 旗下 Muse 代理中的一項功能;SeedRealtime 則內建於 ByteDance 的 Doubao 應用程式中。

開發者存取——兩者都沒有 API。兩者都不公開權重。沒有無伺服器選項、沒有代管端點,也沒有任何第三方平台提供其中任何一個。

價格 — 雙方均未公布,因為雙方都沒有商業報價。

獨立評估——兩套系統皆無。兩家公司針對自家模型所公布的每一項數據都屬於第一方資料,且沒有任何外部評估者測試過其中任何一套。

兩套證據基礎,兩者都屬第一方,而其中一套薄弱得多

這裡的比較不再對稱。Meta 為 Muse Realtime Avatar 公布了四項數據,全部由公司自行報告,並以 Meta 自己挑選的基準來衡量,且無一在該公司之外被重現:從你的發話結束到同步語音與視訊回覆的第一個位元組為 870 毫秒;448×768 直式影片、每秒 25 幀;模型評估次數比其自家基準少 60 倍;在單顆 NVIDIA GB200 上同時執行 12 個即時工作階段,相較 Meta 的兩步驟 BF16 基準,容量提升達 8 倍,這歸功於四位元量化感知訓練與延遲感知動態批次處理。Meta 也發布了與兩套商用虛擬化身系統的偏好比較——對其中一套是 78/22,對另一套是 88/12——並揭露在舉止神態方面,對其中一套的結果在統計上與持平無法區分。這項揭露比那些勝出的結果更有價值;這是大多數發布文章會略去的那種結果。

SeedRealtime 已公布的證據,是一項端到端的人類評估。ByteDance 表示,相較於串聯式系統——將視覺模型接上 ASR 模型、再接上 LLM、再接上文字轉語音的聲音——SeedRealtime 能將影音對話的節奏問題減半,並減少中斷、減少誤觸發,以及讓回覆更慢、更自然。ByteDance 未公布的是樣本數、方法論、標註員人數、以毫秒計的延遲數字、基準測試名稱或分數。一份次級報告引用了一項數據:相較於該團隊先前的模型,對話流暢度提升了 12%。這就是全部的公開證據基礎。

所以,就可驗證性而言,誠實的排名如下:兩者都沒有獨立執行;Meta 的是一組附有明示基線與已揭露負面結果的測量;ByteDance 的則是一項單一偏好主張,其設計並未說明。兩者都無法重現,但只有其中一個具體到足以與之爭辯。

A generated comparison scoreboard titled 'Muse Realtime Avatar vs SeedRealtime — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'SeedRealtime'. Rows read: Video — generated output vs perceived input; Where it runs — Muse app vs Doubao app; Developer access — none vs none; Price — none published vs none published; Published figures — 870 ms first byte, 448x768 at 25 fps, 12 sessions per GB200 vs one human preference claim, no numbers; Independent runs — none vs none. A footer line reads 'Both systems author-reported; neither independently evaluated, and neither is callable.'

各自所做的舉動

這兩個系統都是對同一個問題的解答,而值得看到的是,這兩個解答並不相同。

對一個會「觀看」的系統來說,最難的部分在於知道何時該開口。一個持續接收攝影機畫面與音訊的模型,必須在沒有外部觸發的情況下自行判斷:眼前的人是否已經把話說完、自己是否正被對方對著說話,以及剛進入畫面的物體是否相關。這正是 SeedRealtime 搬進模型內部的問題,而 ByteDance 把這一步做成了跨三種模態、而非兩種——是比 GoogleOpenAI 與 NVIDIA 各自僅針對音訊所做的更困難版本。示範中的行為也由此而來:在多人對話中把聲音與臉孔綁定、有東西進入畫面時未經提示便主動開口,以及引導某人參觀博物館或進行維修。

對一個負責渲染的系統來說,最困難的部分是保持連貫。以短小的因果片段來生成影片,意味著每個片段都以前一個片段為條件,而失效模式就是漂移——到了第三分鐘,角色已經悄悄變成另一個人。Meta 對近期影片潛在表徵的滾動視窗,就是這個問題的解答;而共享符元串流則是另一個失效模式的解答——也就是先產生音訊,之後再套上唇形同步模型時所得到的配音感。

這兩種做法在另一個系統中都不可行。SeedRealtime 沒有可忠實依循的參考影像,因為它並不會渲染任何人。Muse Realtime Avatar 沒有可供追蹤的外部世界,因為它的全部任務就是產生一張能與聲音相符的臉。

A screenshot of the ByteDance Seed blog post 'SeedRealtime: An Audio-Visual Full-Duplex LLM', dated August 5, 2026, showing the headline, the post date, and the opening description of SeedRealtime as a native audio-visual full-duplex model.

為什麼無法呼叫的模型仍然是一個路由問題

這兩個系統都採行委派架構。Muse Realtime Avatar 建立在 Muse Realtime Voice 之上,而後者是某個代理的對話層,其推理運行於 Muse Spark——模型負責的是呈現,而非思考。SeedRealtime 的設計讓對話在背景工作進行時仍能持續,這意味著超出它即時處理能力範圍的工作會被送到其他地方,然後再返回。在這兩種架構中,使用者互動的對象都是前端,而智慧則是其背後一個獨立的文字模型。

那個獨立的文字模型屬於一般推論,而且它是整個堆疊中你真正能購買的部分。在 OrcaRouter 上,它是一個端點,涵蓋 來自 15 家供應商的 196 個模型,以供應商定價原價轉嫁、零加成,並在你選擇的模型發生錯誤或逾時時自動容錯移轉。我們不代管 SeedRealtime——它屬於位元組跳動,內建於豆包之中,沒有東西可以路由。我們也不代管 Muse Realtime Avatar,其他任何人也都沒有。我們所提供的,是這兩套系統把繁重工作交託出去的那一層,也就是當你想讓不同的模型來負責思考時會改變的那一層。

什麼會改變答案?

對 SeedRealtime 而言,欠缺的並不是功能——而是證據。一份包含參數量、基準測試套件,以及已有人工評估說明的技術報告,將能把它的定位從「應用程式內的一項示範」推進到團隊得以據以推論的東西。ByteDance 的貼文也只連向泛用的「試用 Dola」與「在 Playground 中試用」目的地,並未聲稱提供權重或經文件記載的 API,而這正是產品功能、而非模型發布的模式。

對 Muse Realtime Avatar 來說,缺少的那一塊是商業層面:價目表、端點、日期,以及 Meta 尚未完整說明的區域與年齡條款。Meta 的貼文指出,其示範並非全都反映 Muse 應用程式中可用的虛擬替身,而這句話應主導任何圍繞此打造的計畫。

在那其中一項改變之前,這個比較有個異常簡短的形式。兩個模型都是音訊視覺模型,兩者都是全雙工,兩者都是真正令人驚豔的工程,而任何正在讀這段文字的人,都無法從終端機呼叫其中任何一個。差別在於,如果你能這麼做,你會拿它們來做什麼:一個給你一個會說話的角色,另一個給你一個會察覺的系統。

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.