
Muse Realtime Avatar:Meta 為其 Muse Agent 賦予臉孔,每回合只要 870 毫秒
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 180 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
Meta 選擇拿來打頭陣的數字是 870 毫秒。這就是 Muse Realtime Avatar根據 Meta 自己的測量,從你停止說話的那一刻,到同步語音與視訊回覆的第一個位元組抵達,所需花費的時間。對一個必須生成視訊的系統來說,這確實是相當進取的數字,而且值得精確解讀——因為關於 Meta 這款新具身模型,幾乎所有有趣之處都存在於那個數字實際測量的內容,與人們會以為它測量的內容之間的落差裡。
「Muse Realtime Avatar」於 2026 年 9 月 23 日在 Meta Connect 上發表,Meta Superintelligence Labs 同日也在研究貼文〈讓你的 Muse 活起來〉中撰文介紹。它延伸了Muse Realtime Voice,也就是 Meta Muse 代理中的對話層,做法是為它加上一副身體。它不是搭配制式化身的聊天機器人:你交給它一張參考圖像——一張照片、一幅全身插畫、一隻動物、一件家用品——它就會在整段對話期間,以連續影片呈現那個東西說話、比手勢、變換姿態的模樣。祖克柏在台上說,他自己那隻 Muse 所附的虛擬化身名叫 Jolly。
共享的詞元串流,而非脣形同步處理
這套架構是值得理解的部分,因為它解釋了為什麼 Meta 不斷說「embodiment」而不是「avatar」。Muse Realtime Voice 會產生一串語音符元——文章稱之為 VQs——這些符元同時承載了所說內容的資訊及其韻律:節奏、強調、起伏。Muse Realtime Avatar 則消費這同一道串流。它是一個音訊驅動的 Diffusion Transformer,以這些語音符元、你提供的參考媒體,以及近期視訊潛在表徵的滑動視窗為條件,並以短小的因果區塊生成視訊,將每個新的潛在表徵向前饋送,作為下一個的動作脈絡。
共用同一組 token 串流,才能讓聲音、嘴型動作與表情緊密鎖在一起。另一種做法——先產生音訊,再另外跑一個獨立的脣形同步模型來處理它——是多數虛擬化身產業的運作方式,而這也是為什麼那些虛擬化身裡有那麼多看起來像在配音。Meta 的設計從架構上就移除了這道接縫。滾動潛在視窗是這個想法的另一半:少了它,以區塊為基礎的生成器會逐漸漂移,到了第三分鐘,你的角色已經悄悄變成另一個人。

四個已公布的數字,以及每一個實際上衡量的是什麼
Meta 發布的數字,比一篇附屬於消費性功能的研究貼文通常會有的還多。以下四項全都是公司自行報告的數據,由 Meta 以 Meta 自己選擇的基準來衡量;其中沒有任何一項曾在公司外部被重現。
• 從回合結束到首位元組為 870 毫秒。 這是回應起始的指標。它不是取得完整回覆的時間,也不是通話其餘期間持續的傳遞延遲。系統可能首位元組達 870 毫秒,卻在第十二秒仍感覺遲緩。Meta 的文章明確指出這是首位元組量測;省略此限定條件的報導會把它解讀為端到端回應速度,但事實並非如此。
• 448×768 的直式影片,每秒 25 格。這是高長的手機比例畫面,而非橫向畫面;而且 25 fps 是電影感而非流暢感——那是電影的標準格率,低於原生相機畫面所提供的 30 或 60 fps。Meta 表示,示範影片會加上透明浮水印,讓收件者能辨別自己看到的並不是一般的相機畫面。
• 模型評估次數減少 60 倍。下方會妥善說明,因為這個數字最容易被誤讀。
• 在單顆 NVIDIA GB200 上同時執行 12 個即時工作階段。Meta 表示,其服務工作——持久化 KV 快取、快取感知路由、延遲感知動態批次處理、四位元量化感知訓練、融合核心與 CUDA Graph 擷取,皆與 NVIDIA 共同開發——相較於自家的兩步驟 BF16 基準,將容量提升了 8 倍。背後的算術很單純:每個生成步驟產生八個影格,相當於 320 毫秒的播放內容,而模型時間只需 20 毫秒,也就是每帧 2.5 毫秒。無論是 12 還是 8 倍,都是與 Meta 指定的基準相比,而非與其他廠商的硬體相比。
為什麼 60× 不等於快 60×
「壓縮」這項說法,是最常被複述、卻最常被誤解的一點。Meta 的教師模型是一個 40 步的擴散模型,搭配三分支的無分類器引導——每一步進行三次傳遞,因此要產生一段影片需要 120 次模型評估。學生模型則是一個無引導的兩步因果模型,具有固定長度的 KV 快取,透過蒸餾與自我強制訓練,而它對同一段影片只需要兩次評估。也就是說,每段影片的評估次數減少了 60 倍,而且用 Meta 的話來說,品質接近教師模型。
這是逐區塊的運算縮減。評估次數少了六十倍,並不代表使用者等待的時間會縮短為六十分之一,因為在蒸餾之前,延遲本來就有其他成因,蒸餾之後也依然存在。Meta 自家文章中的圖表顯示,這項縮減在品質方面換來了什麼:人類偏好度從 45% 上升到 55%。這才是這個故事誠實的版本——蒸餾的重點在於打造出一個至少能即時運行的系統,而品質代價則被控制在約十個偏好百分點,而不是被完全消除。
該評估,包括那個結果卻相反
Meta 針對兩套商業虛擬化身系統進行了測試,Runway Characters與HeyGen LiveAvatar,並採用相符的虛擬化身身分,讓評分者比較的是動畫本身,而非角色設計。評分者與各系統進行了兩到三分鐘的即時對話,隨後比較視覺品質、同步性、角色一致性與舉止神態。
Meta 表示,相較於 Runway Characters,其偏好度為 78% 比 22%;相較於 HeyGen LiveAvatar,則為 88% 比 12%,且在每一項受評估的面向都更受偏好。接著,這篇文章做了一件大多數供應商評估不會做的事:它揭露了與 Runway Characters 的舉止比較,在統計上無法與勢均力敵區分開來。在一場全面勝出中出現一項平手是小事,但正是這個細節告訴你,這場全面勝出是誠實呈報的,而非只挑對自己有利的結果。
測試的限制比平手本身更重要。兩到三分鐘是很短的對話。評分者是 Meta 的人。而且該貼文本身也提醒,其示範「展示的是模型能力,並不全都反映 Muse app 中可用的虛擬化身」——這正是一個研究團隊直白地表示,你看的影片未必就是你會得到的產品。
你不能用它做什麼
Muse Realtime Avatar 沒有 API。沒有價格、沒有費率表、沒有候補名單,也沒有公布日期。Meta 並未說明使用者或開發者何時能使用它。18 歲以上的 Muse 應用程式是它唯一將推出的平台,而這個虛擬化身會與其他一系列 Muse 功能一同登場——語音自訂、Muse 電子郵件地址、Mac 電腦控制、眼鏡整合——這些功能各有自己的時程,其中一些被稱為「未來幾個月內」推出。
這裡真正重要的比較,並不是與 Runway 或 HeyGen 相比,而是與 Muse 堆疊其餘部分相比。Muse Spark,也就是代理所運行的推理模型,自 Meta 透過 Meta Model API 開放以來,開發者便已可使用,而 Muse Spark 1.2 透過 OrcaRouter 以 meta/muse-spark-1.2 提供服務,每百萬輸入 token 收費 $1.25、每百萬輸出 token 收費 $4.25,供應商標價,零加成,且位於一個已可接受文字、圖像、影片、音訊與檔案的一百萬 token 上下文視窗中。這是 Muse 中你今天就能呼叫的部分。那張臉則是你無法觸及的部分。
這種不對稱值得好好思索,如果你正在規劃任何事情。一個在視訊通話中進行推理的代理,和一個出現在視訊通話中的代理,是受不同限制的不同產品,而只有其中一種會列在價目表上。

接下來要看什麼
有三件事能讓這則公告變成一項決定。第一是 Muse 內部那個虛擬化身的推出日期,因為 Meta 發布的一切都圍繞著一個模型,而它所發布的內容裡,沒有一項是關於你週四就能用得上的產品。第二是在長時間對話中測得的延遲數據,而非首個位元組的延遲——870 毫秒只是起跑槍響,而真實通話要問的是第十分鐘時會發生什麼。第三是這套系統在對抗性條件下能否維持角色設定:使用者刻意轉換話題、節奏加快,或餵給它一張刻意做得像真人的參考圖像。
在那之前,誠實的總結就是那篇研究文章暗示卻未明說的那一個。Muse Realtime Avatar 是一項貨真價實的工程成果,背後有真實的壓縮結果,在受控環境中展示,並由打造它的公司自行評估,對話長度只相當於點一杯咖啡。它不是空頭產品。它也不是你能購買、路由或拿來做基準測試的東西——而這些是不同的宣稱。

