為「Muse Realtime Avatar」生成的主視覺卡片,上方標語為「Meta AI Research - 2026年9月23日」,並有標題,以及三張標示卡片,分別寫著「Muse Realtime Voice - 對話層,串流語音詞元」、「Muse Realtime Avatar - 建構於其上的具象化層,僅供研究」,以及「Muse Spark 1.2 - 目前可在 OrcaRouter 上路由的 Muse 模型」。OrcaRouter 標誌合成於右下角。
Engineering & Research

Muse Realtime Avatar:Meta 打造了什麼、它靠什麼運作,以及為何你仍無法打電話給它

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Muse Realtime Avatar是 Meta 的具身化技術。它會接收 Muse Realtime Voice 所產出的語音串流,並渲染出相應的演出:把它對準一張人物照片,臉部就會以細微的表情變化作出回應;把它對準一張全身插畫,人物就會在說話的同時比手勢、變換姿態。Meta AI Research 於 2026 年 9 月 23 日在一篇名為「Bringing Your Muse to Life」的文章中發表了這項技術。它是研究成果,而非產品——Meta 自家的頁面沒有提供 API、沒有價格、沒有候補名單,也沒有公布日期——所以對於「我今天就能用嗎」,誠實的答案是「不能」。你今天可以呼叫的 Muse 模型是另一個,Meta Muse Spark 1.2。

那個答案值得在第一段就提出,而不是留到最後一段,因為搜尋這個名字的讀者,通常正是在決定要不要把它納入規劃。要圍繞研究來規劃,而不是圍繞某個終點來規劃。

有件事必須先開門見山地說,因為這個頁面打破了一條它應該承認的規則。這個部落格通常會在模型發布的那一週撰寫相關文章。Muse Realtime Avatar 是在這個頁面上線前一週發布的,所以嚴格按照新鮮度時窗來解讀,這個項目本來會被略過。這不是一篇關於某個特定日期事件的新聞報導。這是一個模型的參考頁面,而該模型今天仍在產品目錄的討論中活躍:這是讀者輸入模型自身名稱後所抵達的頁面,其正當性來自我們親自測量的持續搜尋需求,而非發布的新鮮度。此處提及九月的公告,是作為標定該模型時間點的事實,而不是要報導的事件,以下內容也並非第二次公告。我們對那一天的報導是另一篇獨立文章,並且保持獨立。

它在 Muse 家族中的定位

Meta 明確表示,這是同一個系統的兩層,而非兩款產品。用 Meta 的說法,「Muse Realtime Voice 與 Muse Realtime Avatar 構成一套單一的串流系統,串連智慧、語音與具身化。」語音層提供對話智慧,並發出一串語音符元——Meta 稱之為 VQ——這些符元同時承載所說的內容與表達方式。音訊解碼器將這些符元轉為聲音,而化身層則消耗同一串流來生成畫面。共用同一道符元串流,正是讓語音、唇部動作與表情保持同步的關鍵;事後並未另外接上一道獨立的唇形同步處理程序。

所以:Muse Realtime Voice 是對話層。Muse Realtime Avatar 是建構於其上的具身層。兩者都不是你可以呼叫的東西。

同樣要對一個鄰近名稱保持同等謹慎,因為它最有可能被誤認為上述兩者之一。{{KEEP}}Muse Voice Transcribe{{/KEEP}} 是一個逐字稿端點,而且它是真正截然不同的產品。{{KEEP}}Meta{{/KEEP}} 的開發者文件說得很明確:「它僅支援語音轉文字;它不會合成語音,也不提供語音對語音對話 API。」它回傳的是輪次層級的時間戳,而非字詞層級的時間戳,而 {{KEEP}}Meta{{/KEEP}} 在該頁面上將其列為每小時 0.18 美元。它是真實存在、有定價的端點。它不是語音,更絕對不是虛擬化身。

實際上可呼叫的 Muse 模型是 Meta Muse Spark 1.2,這是 Meta 推出的推理模型,具備百萬 token 的上下文,以及文字、圖像、影片、檔案和音訊輸入。那一個今天在這裡就能路由,以供應商的牌價、零加成提供,使用與型錄中其他所有項目相同的金鑰,而且它的即時資訊卡載有完整規格。我們沒有上架 Muse Realtime Avatar。我們在撰寫這篇文章時再次查看了即時模型清單,上面唯一的 Muse 項目就是兩個 Spark 檢查點,1.2 以及它的前身 1.1。講得比這更委婉——說這個系列「部分可用」——就意味著我們路由了實際上並沒有的東西。

A screenshot of Meta's research post 'Bringing Your Muse to Life' as published, showing the headline, the reading time of 10 minutes, a vertical portrait video player, and the opening paragraph introducing Muse Realtime Avatar as an embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

這項技術,以 Meta 自己的說法來表述

Meta 對這套架構的描述簡潔到足以直接引用,而不必轉述。Muse Realtime Avatar 是「一個由音訊驅動、以語音 token 串流、參考媒體,以及近期視訊潛在表徵的滑動視窗為條件的 Diffusion Transformer」,而且它「以短的因果區塊生成視訊」。這句話的後半段才是關鍵所在:每當一個區塊完成,其最新生成的潛在表徵就會成為下一個區塊的動作脈絡。Meta 提出的理由是連貫性——虛擬化身的外觀與舉止會跨輪次延續,同時運算量維持在有界範圍內;這正是讓生成能持續到對話結束為止,而不會漂移或耗盡預算的原因。

出處溯源機制應歸於同一段落,因為 Meta 將其呈現為系統的一部分,而非事後追加的補救措施:生成的影片帶有透過 Meta Video Seal 施加的持久隱形浮水印,Meta 表示這不會為即時路徑增加任何延遲。

Meta 量測了這個東西,並為它公布了四項數據。那些數據——以及每一項各自需要的特定但書,包括那個讀起來像是加速、實際上卻不是的一項——都屬於發布文章,該文會把它們連同脈絡完整呈現。我們不會在這裡重述那些赤裸的數字,因為赤裸的數字正是有但書版本存在所要防止的東西。

我們在當天的 Muse Realtime Avatar 發布文章中報導了這則公告,而該文章仍是完整閱讀這些審慎說法的所在。

名稱不是什麼

有三個假鄰居值得逐一排除,因為僅從名稱來看,每一個都是合理的猜測。

• 它不是 Muse Voice Transcribe。那個端點會將語音轉換成文字,而根據 Meta 自己的描述,它在另一個方向上什麼都不做。如果你需要的是轉錄稿,Meta 有賣,但那是不同的東西,價格也不同。

• 它並不是一項語音複製服務。Meta 的頁面上沒有任何內容描述合成特定人物的聲音、販售語音模型,或接受使用者提供的語音樣本。語音層被描述為產生符記串流;虛擬替身層則被描述為取用該串流。那個說法通常暗示的產品形態——上傳樣本、取得複製語音——並不是這裡所描述的內容,而 Meta 確實發布的示範素材,則被定位為模型能力的示意。

• 這不是 Meta 自家應用程式中的消費級虛擬替身。Meta 為其範例附上一項很容易被忽略、也值得謹記的但書:這些示範「展示的是模型能力,並非全都反映 Muse 應用程式中可用的虛擬替身」,而 Muse 僅供 18 歲以上使用者使用。請照字面解讀。該貼文所展示的部分內容是能力,而非庫存。

第四個名稱值得基於不同理由另行區分。Muse Realtime Avatar 不是 Muse Video,後者是今年大部分時間一直待在公開排行榜上、卻尚未推出的影片生成模型。我們自己關於該情況的頁面——Muse Video:發布日期、API 存取權,以及 Meta Connect 可能改變什麼——帶有一項限制,我們在此逐字重述,而不是加以潤飾:任何引用 Muse Video 特定發布日或價格、卻沒有較新的 Meta 公告的頁面,都是在臆測。同樣的準則也適用於本頁主題,因此本頁兩者都不引用。那篇文章也提供了不該由我們弄混的日期:Muse Video 於 2026 年 7 月 7 日預覽,且尚未發布,這就是為什麼搜尋這個系列會出現屬於另一個模型的日期。

A generated reference card titled 'Muse Realtime Avatar - what is reachable' with six rows: 'Muse Realtime Avatar: research result, no API, no price, no waitlist, no published date'; 'Muse Realtime Voice: the conversational layer it renders, no API announced'; 'Muse Voice Transcribe: a different product, speech-to-text only'; 'Muse Spark 1.2: the Muse model callable today'; 'Muse Video: previewed, not released'; and 'Routable on OrcaRouter: Muse Spark 1.2 and 1.1 only'. A footer reads 'Status per Meta's own pages, read September 29, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

這個頁面的用途,以及什麼會改變它

參考頁面之所以是這裡正確的形式,是有數據可衡量的。在截至 2026 年 9 月 25 日的 28 天內,這個確切詞組在我們的搜尋資源上帶來 164 次曝光、零次點擊,最佳排名位置為 9.3。我們有超過五十個頁面在某處提及這個片段,而幾乎所有那些流量都落在同一篇公告文章上。一個有真實且持續需求、排名就在第一頁之外、卻無法促成任何轉換的詞組,不是需求問題,也不是品質問題——而是頁面問題。先前沒有任何頁面是以這個模型本身為主題。這一頁就是。

這個定位也是為什麼這裡沒有任何內容被包裝成新聞。透過名稱搜尋而來的讀者,想依序知道三件事:這是什麼、是否已經可用,以及它是建立在什麼之上。這些問題都在上方依該順序獲得解答,沒有捏造日期,也沒有指名任何競爭對手。

A screenshot of our own model list filtered to the search term 'muse', showing two results, both under the Meta provider: meta/muse-spark-1.2 and meta/muse-spark-1.1, with Muse Spark 1.2 marked as having a 4M-token context window at $1.25 per million input tokens and $4.25 per million output tokens.

能改變這一頁的,只是一則公告。如果 Meta 為 Muse Realtime Avatar 公布端點、價格、候補名單或日期,可用性這一節就不再是個「沒有」,而會變成一份規格,這一頁也會被改寫,而不是被增補。如果 Meta 推出 Muse Video,上面那一段也會隨之改變。在這兩者之一發生之前,對開發者來說有用的做法並不光鮮:讓你手上既有的介面繼續指向你真正能觸及的模型。目錄中的每一個模型,包括 Meta Muse Spark 1.2,都位於同一個 OpenAI 相容端點與同一把金鑰之後,這意味著要試用這個家族中確實存在的那個部分,代價只是改一個模型字串,而不是簽一份新合約。當具身層變得可以呼叫時,切換成本也應該只是一個字串。