
Muse Realtime Avatar:Meta 打造了什麼、它靠什麼運作,以及為何你仍無法打電話給它
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 1009 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 195 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- xAISpaceXAI: Grok 4.62026-08-1244智能77程式
Muse Realtime Avatar是 Meta 的具身化技術。它會接收 Muse Realtime Voice 所產出的語音串流,並渲染出相應的演出:把它對準一張人物照片,臉部就會以細微的表情變化作出回應;把它對準一張全身插畫,人物就會在說話的同時比手勢、變換姿態。Meta AI Research 於 2026 年 9 月 23 日在一篇名為「Bringing Your Muse to Life」的文章中發表了這項技術。它是研究成果,而非產品——Meta 自家的頁面沒有提供 API、沒有價格、沒有候補名單,也沒有公布日期——所以對於「我今天就能用嗎」,誠實的答案是「不能」。你今天可以呼叫的 Muse 模型是另一個,Meta Muse Spark 1.2。
那個答案值得在第一段就提出,而不是留到最後一段,因為搜尋這個名字的讀者,通常正是在決定要不要把它納入規劃。要圍繞研究來規劃,而不是圍繞某個終點來規劃。
有件事必須先開門見山地說,因為這個頁面打破了一條它應該承認的規則。這個部落格通常會在模型發布的那一週撰寫相關文章。Muse Realtime Avatar 是在這個頁面上線前一週發布的,所以嚴格按照新鮮度時窗來解讀,這個項目本來會被略過。這不是一篇關於某個特定日期事件的新聞報導。這是一個模型的參考頁面,而該模型今天仍在產品目錄的討論中活躍:這是讀者輸入模型自身名稱後所抵達的頁面,其正當性來自我們親自測量的持續搜尋需求,而非發布的新鮮度。此處提及九月的公告,是作為標定該模型時間點的事實,而不是要報導的事件,以下內容也並非第二次公告。我們對那一天的報導是另一篇獨立文章,並且保持獨立。
它在 Muse 家族中的定位
Meta 明確表示,這是同一個系統的兩層,而非兩款產品。用 Meta 的說法,「Muse Realtime Voice 與 Muse Realtime Avatar 構成一套單一的串流系統,串連智慧、語音與具身化。」語音層提供對話智慧,並發出一串語音符元——Meta 稱之為 VQ——這些符元同時承載所說的內容與表達方式。音訊解碼器將這些符元轉為聲音,而化身層則消耗同一串流來生成畫面。共用同一道符元串流,正是讓語音、唇部動作與表情保持同步的關鍵;事後並未另外接上一道獨立的唇形同步處理程序。
所以:Muse Realtime Voice 是對話層。Muse Realtime Avatar 是建構於其上的具身層。兩者都不是你可以呼叫的東西。
同樣要對一個鄰近名稱保持同等謹慎,因為它最有可能被誤認為上述兩者之一。{{KEEP}}Muse Voice Transcribe{{/KEEP}} 是一個逐字稿端點,而且它是真正截然不同的產品。{{KEEP}}Meta{{/KEEP}} 的開發者文件說得很明確:「它僅支援語音轉文字;它不會合成語音,也不提供語音對語音對話 API。」它回傳的是輪次層級的時間戳,而非字詞層級的時間戳,而 {{KEEP}}Meta{{/KEEP}} 在該頁面上將其列為每小時 0.18 美元。它是真實存在、有定價的端點。它不是語音,更絕對不是虛擬化身。
實際上可呼叫的 Muse 模型是 Meta Muse Spark 1.2,這是 Meta 推出的推理模型,具備百萬 token 的上下文,以及文字、圖像、影片、檔案和音訊輸入。那一個今天在這裡就能路由,以供應商的牌價、零加成提供,使用與型錄中其他所有項目相同的金鑰,而且它的即時資訊卡載有完整規格。我們沒有上架 Muse Realtime Avatar。我們在撰寫這篇文章時再次查看了即時模型清單,上面唯一的 Muse 項目就是兩個 Spark 檢查點,1.2 以及它的前身 1.1。講得比這更委婉——說這個系列「部分可用」——就意味著我們路由了實際上並沒有的東西。

這項技術,以 Meta 自己的說法來表述
Meta 對這套架構的描述簡潔到足以直接引用,而不必轉述。Muse Realtime Avatar 是「一個由音訊驅動、以語音 token 串流、參考媒體,以及近期視訊潛在表徵的滑動視窗為條件的 Diffusion Transformer」,而且它「以短的因果區塊生成視訊」。這句話的後半段才是關鍵所在:每當一個區塊完成,其最新生成的潛在表徵就會成為下一個區塊的動作脈絡。Meta 提出的理由是連貫性——虛擬化身的外觀與舉止會跨輪次延續,同時運算量維持在有界範圍內;這正是讓生成能持續到對話結束為止,而不會漂移或耗盡預算的原因。
出處溯源機制應歸於同一段落,因為 Meta 將其呈現為系統的一部分,而非事後追加的補救措施:生成的影片帶有透過 Meta Video Seal 施加的持久隱形浮水印,Meta 表示這不會為即時路徑增加任何延遲。
Meta 量測了這個東西,並為它公布了四項數據。那些數據——以及每一項各自需要的特定但書,包括那個讀起來像是加速、實際上卻不是的一項——都屬於發布文章,該文會把它們連同脈絡完整呈現。我們不會在這裡重述那些赤裸的數字,因為赤裸的數字正是有但書版本存在所要防止的東西。
我們在當天的 Muse Realtime Avatar 發布文章中報導了這則公告,而該文章仍是完整閱讀這些審慎說法的所在。
名稱不是什麼
有三個假鄰居值得逐一排除,因為僅從名稱來看,每一個都是合理的猜測。
• 它不是 Muse Voice Transcribe。那個端點會將語音轉換成文字,而根據 Meta 自己的描述,它在另一個方向上什麼都不做。如果你需要的是轉錄稿,Meta 有賣,但那是不同的東西,價格也不同。
• 它並不是一項語音複製服務。Meta 的頁面上沒有任何內容描述合成特定人物的聲音、販售語音模型,或接受使用者提供的語音樣本。語音層被描述為產生符記串流;虛擬替身層則被描述為取用該串流。那個說法通常暗示的產品形態——上傳樣本、取得複製語音——並不是這裡所描述的內容,而 Meta 確實發布的示範素材,則被定位為模型能力的示意。
• 這不是 Meta 自家應用程式中的消費級虛擬替身。Meta 為其範例附上一項很容易被忽略、也值得謹記的但書:這些示範「展示的是模型能力,並非全都反映 Muse 應用程式中可用的虛擬替身」,而 Muse 僅供 18 歲以上使用者使用。請照字面解讀。該貼文所展示的部分內容是能力,而非庫存。
第四個名稱值得基於不同理由另行區分。Muse Realtime Avatar 不是 Muse Video,後者是今年大部分時間一直待在公開排行榜上、卻尚未推出的影片生成模型。我們自己關於該情況的頁面——Muse Video:發布日期、API 存取權,以及 Meta Connect 可能改變什麼——帶有一項限制,我們在此逐字重述,而不是加以潤飾:任何引用 Muse Video 特定發布日或價格、卻沒有較新的 Meta 公告的頁面,都是在臆測。同樣的準則也適用於本頁主題,因此本頁兩者都不引用。那篇文章也提供了不該由我們弄混的日期:Muse Video 於 2026 年 7 月 7 日預覽,且尚未發布,這就是為什麼搜尋這個系列會出現屬於另一個模型的日期。

這個頁面的用途,以及什麼會改變它
參考頁面之所以是這裡正確的形式,是有數據可衡量的。在截至 2026 年 9 月 25 日的 28 天內,這個確切詞組在我們的搜尋資源上帶來 164 次曝光、零次點擊,最佳排名位置為 9.3。我們有超過五十個頁面在某處提及這個片段,而幾乎所有那些流量都落在同一篇公告文章上。一個有真實且持續需求、排名就在第一頁之外、卻無法促成任何轉換的詞組,不是需求問題,也不是品質問題——而是頁面問題。先前沒有任何頁面是以這個模型本身為主題。這一頁就是。
這個定位也是為什麼這裡沒有任何內容被包裝成新聞。透過名稱搜尋而來的讀者,想依序知道三件事:這是什麼、是否已經可用,以及它是建立在什麼之上。這些問題都在上方依該順序獲得解答,沒有捏造日期,也沒有指名任何競爭對手。

能改變這一頁的,只是一則公告。如果 Meta 為 Muse Realtime Avatar 公布端點、價格、候補名單或日期,可用性這一節就不再是個「沒有」,而會變成一份規格,這一頁也會被改寫,而不是被增補。如果 Meta 推出 Muse Video,上面那一段也會隨之改變。在這兩者之一發生之前,對開發者來說有用的做法並不光鮮:讓你手上既有的介面繼續指向你真正能觸及的模型。目錄中的每一個模型,包括 Meta Muse Spark 1.2,都位於同一個 OpenAI 相容端點與同一把金鑰之後,這意味著要試用這個家族中確實存在的那個部分,代價只是改一個模型字串,而不是簽一份新合約。當具身層變得可以呼叫時,切換成本也應該只是一個字串。
