「Tavus Griffin vs Muse Realtime Avatar」的主視覺標題卡,副標題為「兩張 2026 年的臉,兩個不同的問題」,上方有四個標籤:Griffin:48% 的人認為它是真人;Griffin 音訊到視訊 0.43 秒;Muse Realtime Avatar 首位元組 870 毫秒;Muse Realtime Avatar 448x768、25 fps。
Engineering & Research

Tavus Griffin 對決 Muse Realtime Avatar:2026 年的兩張臉孔,兩個不同的問題

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Tavus Griffin 和 Muse Realtime Avatar 都是為了解決同一個令人尷尬的問題——一個會說話卻沒有臉的語言模型——而它們從相反的兩端來處理這個問題。Griffin 是一種影片對影片的人類互動模型(Human Interaction Model),它透過攝影機觀察參與者,並即時生成對話的另一方;Tavus 於 2026 年 10 月宣布它為提供給精選測試者的研究預覽版。Muse Realtime Avatar 是 Meta 為其 Muse 代理打造的具身化層,於 2026 年 9 月 23 日在 Meta Connect 上發表,它接收音訊並將其轉換成同步的說話肖像。兩者都買不到。差異在於各自試圖做對的是什麼,而當你問每個模型實際接收什麼作為輸入時,這一點就會立刻顯現。

簡短版本

• Griffin 的輸入是 另一端的人——即時參與者的視訊與音訊,它必須讀取、回應,並被其打斷。

• Muse Realtime Avatar 的輸入是代理自身的語音——來自 Muse Realtime Voice 的一連串 token,它會將其轉換成對應的臉部。

• Tavus 以人們是否相信 Griffin 來衡量它,並公布一通一分鐘視訊通話中所得的 48% 數據。

• Meta 以 Muse Realtime Avatar 是否跟得上來衡量它,並公布從回合結束到首位元組為 870 毫秒。

• 兩者皆無公開 API、已公布的價格或正式推出日期。

把這四行放在一起讀,分歧的輪廓就顯而易見。Tavus 是在為對方的信念做最佳化。Meta 則是在為時鐘做最佳化。

Board titled 'Two Faces, Two Measurements'. Tavus Griffin column: input the live participant, video and audio; optimises for whether the other person believes it; headline figure 48% of 54 participants in a one-minute video call; output 720p duplex video at 25 fps; latency 0.43 s average audio to video on H100s; access research preview, selected testers only. Muse Realtime Avatar column: input Muse Realtime Voice's own speech tokens; optimises for the clock, end of turn to first frame; headline figure 870 ms from end of turn to first byte; output 448x768 portrait at 25 fps; capacity 12 concurrent sessions on one NVIDIA GB200; access research post only, no API.

Griffin:必須被相信的模型

Tavus 的論述框架是:Griffin 是第一個人類互動模型,而這項主張背後的架構是一套由兩部分組成、結合持續對話建模與音視覺生成的系統。第一部分是行為性的:它會利用自己能看見和聽見的資訊,決定這個角色每一刻應該做什麼。第二部分是渲染,Tavus 又把它細分為串流語音生成與串流視訊生成。

Tavus 拿出的數字並不是吞吐量數字。在該公司與倫敦瑪麗皇后大學共同進行的一項研究中,54 名參與者中有 26 人——48%——在一分鐘的視訊通話後相信 Griffin 是真實的人,相較之下,其先前由 Phoenix-4.5 臉部生成、Sparrow-2 輪流對話與 Raven-1 視覺組成的技術堆疊,只有 41 人中的 1 人(2.4%)。沒被騙到的參與者通常在前 20 秒內就產生懷疑。在 NVIDIA 的 VideoFDB 基準測試(於 2026 年 9 月評分)中,Tavus 回報 Griffin 在面對面 AI 項目上排名第一,生成分數為 3.83,相較於所回報的最強基準 2.80 與人類參考 3.92;感知分數為 3.73,相較於最佳回報基準 3.44 與人類參考 4.20。這些數字是廠商自行回報的,且僅限於該特定基準測試,但其中與人類對照的數據才是最耐人尋味的地方。

那些數字背後的工程,是一套名為 Tavec 的編解碼器,以及一個自迴歸擴散 Transformer。Tavec 以 48 kHz 運作,每幀 40 個值、每秒 100 幀,不使用任何碼本,解碼器完全具因果性,封包最小可達 10 毫秒——這樣的設計是為了讓一張臉能在句子還沒講完前就開始動起來。視訊路徑以 320 毫秒為單位推送 720p 畫面,其中一個潛在表示等於 25 fps 下的八幀,每個潛在表示跑三個擴散步驟,並在 VAE 中進行 8 倍時間壓縮。三階段蒸餾流程(先做分佈匹配,接著是教師強制自迴歸,然後是自我強制)正是讓它能在即時狀態下跑完這三個步驟的關鍵。官方主打的延遲數據是在 H100 上從音訊到視訊平均 0.43 秒,Tavus 表示這大約是其測得次快方法的一半。聲音複製大約需要一段 10 秒的樣本。

這一切的代價,就是 Tavus 無法將其推出。Griffin-Lite 這個研究預覽版僅提供給一小群精選的早期測試者使用;在發布相關說明中,該公司明確表示,Griffin-Lite 目前不會開放給客戶使用,並預期在若干安全疑慮獲得處理後,很快就會發布 Griffin。Griffin 目前不在 Tavus 平台上,等到「我們找出如何安全發布它的方法」之後才會登上該平台。從部署角度來看,一個在一分鐘通話中有 48% 的時候能令人信以為真的模型,就是一個在一分鐘通話中有 48% 的時候能令人信以為真的模型。

Screenshot of the Tavus website's Griffin announcement, captured 2 October 2026: the headline 'The First Human Interaction Model' under 'Introducing Griffin', a paragraph describing a video-to-video system that listens while the other person talks, and three statistic tiles reading 48% of people believed Griffin was a real person after a one-minute video call, #1 on NVIDIA's independent test of face-to-face AI, and 37% ahead of the next best AI at reacting in the moment, dated October 1st, 2026.

Muse Realtime Avatar:必須跟上腳步的模型

Muse Realtime Avatar 於 2026 年 9 月 23 日在 Meta Connect 發表,同日由 Meta Superintelligence Labs 以〈Bringing Your Muse to Life〉為題撰文介紹。Meta 的論述框架比 Tavus 更狹隘、也更機械化:Muse 代理原本就已擁有聲音,這要歸功於 Muse Realtime Voice,而虛擬化身則是賦予那道聲音一個身體的層次。

已公布的數據是從結束發言到首位元組為 870 毫秒——也就是從使用者停止說話的那一刻,到虛擬化身的第一個視訊位元組準備就緒的那一刻。該虛擬化身以每秒 25 幀渲染 448×768 的人像。Meta 表示,該系統每個區塊的評估次數大約比其基準少 60 倍,而且單一 NVIDIA GB200 可承載 12 個並行即時工作階段,相較於兩步驟 BF16 實作有 8 倍的容量提升。

與 Griffin 在架構上的差異在於資訊的來源。Muse Realtime Avatar 延伸自 Muse Realtime Voice,並共用其語音 token 串流——驅動臉部的是語音模型所產生的同一套 VQ 表徵,而不是對參與者另行建構的視覺理解。這使它成為一個音訊驅動的 DiT 具現層:有效率、與自身的語音模型緊密耦合,且完全不試圖解讀通話另一端的人類。它是代理的嘴巴與臉孔,而不是一個會注視著你的對話夥伴。

Meta 尚未為 Muse Realtime Avatar 發布任何 API、價格或推出日期。那篇研究文章就是全部的公開紀錄。

這兩種設計真正分歧之處

要看清這種分歧,最清楚的方法就是問:當使用者中斷時會發生什麼事。

Griffin 是全雙工的,而且設計上就是要在話說到一半時被打斷——它能在說話的同時觀看與聆聽,這正是為什麼 Tavus 的行銷緊扣「Griffin 學的是對話行為,而不是影片」這個概念。這也是為什麼它的基準測試套件是圍繞感知與反應打造,以及為什麼「在臨場反應上領先次佳系統 37%」會是該公司特地提出的說法。

Muse Realtime Avatar 的 870 毫秒回合結束數字告訴你的卻是相反的故事:它是一條管線,回合結束、音訊 token 解析完成,然後臉才跟上。它很快——870 毫秒對肖像渲染器來說是不錯的數字——但這項量測本身假設了回合邊界存在,而這正是雙工模型生來就要丟棄的假設。

這並不是在批評這兩種設計。Meta 正在為一個存在於 Meta 自家助理介面中的代理打造一張臉,而在那些介面裡,清楚的回合界線是對互動的合理模型。Tavus 正在打造的東西,則必須經得起陌生人在二十秒內判斷螢幕上的人是否為真人。

兩者都不在價目表上——而且 Muse 只有一部分可呼叫。

Tavus Griffin 與 Muse Realtime Avatar 現階段都無法投入生產。Griffin 僅限特定測試者使用;Muse Realtime Avatar 沒有 API、沒有價格,也沒有日期。如果你正在規劃建置,這兩個事實都應納入計畫中。

Muse 堆疊中值得標記的是可及的那一部分。Meta 的 Muse 家族包含 Muse Spark,而它的其中一個檢查點——meta/muse-spark-1.2——已在我們的目錄上線,每百萬輸入 token 收費 1.25 美元、每百萬輸出 token 收費 4.25 美元,對 Meta 的定價零加成。它不是那個虛擬化身:它接受文字、圖像、影片、音訊與 PDF 輸入並回傳文字,具備 1M token 的上下文視窗與可配置的推理強度。但它是 Muse 系列中你真正能呼叫的那一部分,而如果你正在打造有朝一日將坐鎮虛擬化身背後的 agent,語言這一半就是你可以先著手的那一半。OrcaRouter 以 0% 加成轉嫁供應商的定價,因此 Meta 的價格變動當天就會反映在我們的卡片上,而不是等到下一個計費週期;在某個供應商上失敗的請求會改對健康的供應商重試,而不是以逾時的形式浮現。

Screenshot of the OrcaRouter model page for Muse Spark 1.2, showing the model id meta/muse-spark-1.2, a 1M-token context window, text, image, video, file and audio inputs producing text output, a p50 time to first token of 10.00 s, input pricing of $1.25 per million tokens and output pricing of $4.25 per million tokens, and 6.2M tokens of traffic over seven days.

同樣的邏輯也適用於影片領域。我們不路由 Muse Realtime Avatar,也不路由 Tavus Griffin,我們不會聲稱相反。我們確實在路由的是一個目錄,包含超過兩百個模型,涵蓋相同模態,因此一個在文字代理、語音模型與影片生成器之間切換的原型只需使用同一組金鑰,而本文中的這兩個模型仍未發布。

哪一個離出貨更遠?

就公開資訊而言,Muse Realtime Avatar 的距離更遠。它有一篇研究文章,但沒有 API、沒有價格,也沒有日期。Griffin 同樣沒有 API、沒有價格,但它有明確的發布意圖——「在這些安全疑慮獲得解決後很快就會推出」——一個目前就已存在、供特定測試人員使用的具名預覽層級,以及來自獨立測試框架的一疊已發布基準測試結果。這是更進一步的進展,儘管這也伴隨著一項承認:該模型還不夠安全,不能交給客戶。

比較兩者的陷阱,在於把 870 毫秒這個數字當成可以直接和 0.43 秒這個數字相比。它們量的是不同的東西:Meta 量的是從一個對話輪次結束到人像第一個位元組,而 Tavus 量的是連續雙工串流內部的音訊到視訊延遲,而在這種串流中,輪次並不是界線分明的事件。這兩個數字都是真實的,但它們不是同一種量測;任何人把它們放在同一欄呈現,都是在對讀者幫倒忙。

底線

Muse Realtime Avatar 是一個具身化層:音訊輸入,人像輸出,從回合結束到首位元組 870 毫秒,25 fps 下 448×768,沒有 API,也沒有日期。Tavus Griffin 是雙工式人類互動模型:參與者輸入,一張會反應的臉輸出,在 H100 上平均音訊到視訊延遲 0.43 秒,而且有一家廠商願意公布有 48% 的人認為它是真人,同時又聲明客戶無法使用它。Meta 正在打造某個跟得上的東西。Tavus 正在打造某個能通過的東西。兩者都買不到,這意味著今天唯一能做的決定,就是該先從問題的哪一半著手——而對大多數團隊來說,那一半就是底層的語言模型。