Tavus Griffin 的主視覺標題卡,副標為「首個人類互動模型——於 2026 年 10 月 1 日發表」,上方有三個標籤,分別寫著「48% 的人以為是真實人物」、「VideoFDB 生成:3.83,對比人類參考值 3.92」以及「0.43 秒的音訊轉視訊延遲」。頁尾:「所有數據皆由廠商與 NVIDIA 回報;Griffin-Lite 為研究預覽版,尚未正式全面推出。」OrcaRouter 標誌合成於右下角。
Guides & Insights

Tavus Griffin:首個人類互動模型,以及通過影片圖靈測試的 48%

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

五十四人中有二十六人完成了一分鐘的視訊通話,並表示他們的對話對象真的是真人。這就是 Tavus 為Tavus Griffin所主打的數字,該產品於 2026 年 10 月 1 日發表,而這著實是個驚人的結果:在同一套協定下,該公司先前的技術堆疊——由 Phoenix-4.5 渲染臉部、Raven-1 負責感知、Sparrow-2 管理對話輪替動態——在四十一人裡只讓一個人信以為真,也就是 2.4%。這個躍升的兩種顯而易見解讀都是錯的,而區分這兩者正是接下來大部分的內容。Griffin 並不是更優秀的虛擬化身引擎,也不是你能買到的產品。它是一項名為 Griffin-Lite 的研究預覽版,開放給特定受信任的測試者,沒有定價、沒有公開 API,也沒有登上任何獨立影片排行榜。這兩件事同時成立,才是真正的新聞所在。

48% 衡量的是什麼,以及它不衡量什麼

這項研究是面對面圖靈測試,而非偏好調查,而這套流程值得精確說明,因為它是支撐整體論點的關鍵主張。五十四名參與者透過獨立研究平台招募,並被告知會與另一名參與者配對,進行一分鐘的視訊通話,談談他們今年期待什麼。他們的搭檔是一個執行 Griffin-Lite 的 PAL,會即時生成臉部、聲音與回應。只有在調查結束時,他們才被問到是否曾想過搭檔可能不是真人,接著每位參與者都被告知那是 AI。比較組則以相同流程在較舊的技術堆疊上進行,共有四十一名參與者。

輔助數字和標題一樣重要。相信者很有信心——平均達 79%——懷疑者也是,達 81%,而這正是研究想要的:沒有人是在亂猜。超過半數參與者表示,通話期間這個可能性完全沒閃過他們的腦海,而這群人幾乎全都接著說,對方是真實的。確實起疑的參與者,往往在前二十秒內就開始懷疑。那是報告中最令人不自在的一句話,也應該影響你之後如何解讀安全章節。

在一份七分制量表上,該模型在「看起來自然」上平均獲得 5.4 分,在「看起來值得信賴」上獲得 5.6 分,在「參與者是否會喜歡再次與它交談」上獲得 5.8 分——即使在正確辨識出它是 AI 的參與者中,該分數仍維持在 5.4 分——而在「他們是否覺得對話夥伴真的在傾聽」上獲得 5.5 分。最低分是 4.9 分,用於「對話是否自然流暢」。整體來看,這是一個特定的輪廓:Griffin-Lite 在每個當下都很有說服力,但作為一整段歷程就稍微沒那麼有說服力。

獨立基準測試,以及如何解讀其兩條軌道

這些品質數據來自 NVIDIA 的 VideoFDB,這是一項全雙工視聽對話基準測試,會分別在兩條獨立軌道上為模型評分——生成,指的是模型是否產生正確的行為;感知,指的是模型是否理解當下的情境——兩者各有自己的評分標準和自己的排行榜。NVIDIA 建立了這套基準測試,以自家評審依據公開的指標進行評估,並以零到五分制為回應評分。Tavus 並沒有執行這項評測,而這正是引用它的原因。

• 生成 — Griffin-Lite 得分 3.83,次高的已發表系統得分為 2.80(Gemini 2.5 搭配 Anam),而人類真實基準為 3.92。這比最佳可比較系統高出 1.03,並比人類低 0.09。

• 感知 — 3.73,相較於人類參考基準 4.20,而最強的已報告基準為 3.44,即 MiniCPM-o 4.5 在其純音訊配置下的表現。Gemini 2.5 Flash Native 得分 3.17,OpenAI 的 gpt-realtime 得分 2.97。

• 接管率對齊 — 生成部分為 62.8%,感知部分為 73.8%。這項指標衡量模型決定何時開口的判斷,與參考對話中發言時機的吻合程度,而 Tavus 表示這兩項數值都是榜上所有系統中最高的。

在任何人轉述那些數字之前,有兩點但書必須先附加於其上。與人類的生成差距在由語言模型評判的五分量表上是 0.09,這更適合解讀為「在此評分標準上接近人類」,而不是「達到人類水準」。而且感知比較並非同類相比:MiniCPM-o 4.5 與 gpt-realtime 是在純音訊配置下評分,而 Griffin 也會讀取視訊。相較純音訊基準領先 0.29 分是真實的,但它衡量的部分內容,是擁有眼睛的價值。

供應商自家的摘要說明——在 NVIDIA 對面對面 AI 的獨立測試中排名第一,在即時反應方面領先次佳 AI 37%——是對同一份資料的詮釋,而非另一項獨立發現。保留底層的賽道分數,而非那套框架。

A screenshot of NVIDIA's VideoFDB project page, captured 2 October 2026: the heading "VideoFDB — Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents", the note that it is the first benchmark for full-duplex audio-visual-to-audio-visual conversation, the author list (Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini De Mello) credited to NVIDIA, links to leaderboard, paper and Hugging Face dataset, and an abstract arguing that natural conversation is full-duplex.

兩具引擎同時運轉

架構上的主張比圍繞它的行銷宣傳更容易評估,因為這是一項關於什麼會同時運作的主張。Griffin 被描述為兩個並行運作的系統,而不是在各階段之間交接的管線。

第一項是持續對話建模引擎。它會接收人的音訊與視訊,並以規律的亞秒級間隔重新評估這段交流——Tavus 稱之為「迷你輪次」——在每一個間隔決定要維持沉默、發出訊號、附和,還是取得發話權。其輸出不只是話語,還包括一組帶有時序、立場、面部表情與手勢的表達控制。這項設計的要點在於,在句子中途做出的決定會在同一個迷你輪次內就反映在聲音與表情上,而非等到交接之後才出現;這正是讓模型能在被打斷時停下來、在聆聽時點頭,並把思索時的停頓視為輪次結束以外之訊號的原因。

第二個是影音生成引擎,能將那些控制項同時轉化為聲音與像素:一個串流語音生成器和一個串流視訊生成器,由相同訊號驅動,因此語調的變化和表情的變化會落在同一個節拍上。

關於 Tavus 隨此發布的資料,有一點必須誠實說明,因為這些內容很容易被誤認為是實測數據。那個九秒交流的互動式圖表,在頁面本身的文字中已註明為示意用途,並明確表示並非從真實工作階段測量而得。同樣的但書也適用於回合制與全雙工對比的計時圖。真正經過測量的是更下方的延遲數字。

深入串流堆疊

音訊端是圍繞一個名為 Tavec 的編解碼器建構的,這是一個卷積自編碼器,會將 48 kHz 音訊映射成連續潛在表示,每幀 40 個值、每秒 100 幀,且不使用任何碼簿。其解碼器是完全因果的,因此會跨區塊保留狀態,並在不需前瞻的情況下輸出小至 10 毫秒的音訊封包。一分鐘的語音是 6,000 個潛在幀,而不是 288 萬個原始取樣點,這正是讓該序列的成本低到足以讓語音 Transformer 以快於即時的速度進行預測的原因。語音生成器本身是一個自迴歸擴散 Transformer,它以編碼後的說話者前綴為條件——只要約十秒的音訊就能複製一個聲音——並在控制訊號到來時一次生成一個潛在區塊,因此播放會在話語完成之前就開始。

影片端從相同的前提出發:強大的時間壓縮是讓擴散模型快到足以進行對話的關鍵。少步數的自迴歸生成器接收一張參考照片、串流音訊和串流控制,並在每個步驟產生一個潛在表示,每個潛在表示進行三個擴散步驟。一個 VAE 將時間壓縮八倍,因此在 25 fps 下,一個潛在表示是八個影格,也就是 720p 影片的 320 毫秒。較舊的潛在表示會以逐漸降低的解析度保留,以便長時間推演仍可負擔。結果是一個生成器,能即時以 320 毫秒的區塊輸出 720p。

要達到這個目標,需要從一個大型雙向多步擴散教師模型進行三階段蒸餾:透過分佈匹配蒸餾(Distribution Matching Distillation)得到一個少步學生模型,再以教師強制(teacher forcing)將該學生模型轉換為一次生成一個潛在表示的自迴歸模型,最後在模型自身生成的歷史記錄上進行自我強制(self-forcing)訓練,並額外加入一個作用於歷史幀的機制,使得長時間的推演不會漂移。第三階段正是為了解決這類模型通常具有的失效模式——在持續數分鐘的對話中,臉部逐漸退化,或背景緩慢漂移。

延遲數字,那才是真正的產品賣點

在音訊轉視訊的設定下,與四個已發表的串流擴散模型相比——每個模型會接收語音與一張參考影像,並必須生成會說話的臉——Griffin-Lite 的生成器在 H100 上平均達到 0.43 秒的真實音訊轉視訊延遲,也就是從一段音訊抵達到視訊呈現其效果所需的時間。Tavus 形容這是次快方法的一半。它還回報在 DOVER 與 FID 感知品質,以及 THEval(一套說話人頭部評估框架)上名列第一,並在 LSE-C 唇形同步信心度上以 7.27 位居第二,落後於一個基準方法——廠商並指出,LSE-C 會獎勵明顯的嘴部動作,包括超出看起來自然程度的動作。

那些全都是 Tavus 針對自己選定的基準所做的自家量測。它們之所以有用,是因為它們很具體,也因為 0.43 秒這個數字,正是那種在實測中不是站得住腳、就是站不住腳的數字。它們並不獨立,而本文中唯一獨立的評分,就是上方那兩條 VideoFDB 測試軌。

A screenshot of Tavus's own Griffin announcement page at tavus.io/griffin, captured 2 October 2026: the heading "INTRODUCING GRIFFIN", the strapline "The First Human Interaction Model", the description of Griffin as the world's first Human Interaction Model that listens while watching expressions and pauses, and the byline "By: Hassaan Raza, Ioannis Patras, Head of Tavus Research Team".

為什麼沒有可比較的價格

Griffin-Lite 今日以研究預覽形式,開放給一群精選的早期測試者使用,之後將接著更廣泛地發布功能更強大的模型。目前將不開放供客戶使用。使用權限須透過申請表取得。它並未登上 Tavus 平台,而該公司在公告中的結語也直言不諱:Griffin 尚未登上 Tavus 平台,待 Tavus 找出如何安全發布後才會推出。買家通常會比較的所有項目——按秒或按請求計價、模型識別碼、速率限制、SLA、區域清單——目前都還不存在。對於任何想在今日著手開發的人,Tavus 請他們改用 150,000 名開發者和企業已在使用的那批模型,也就是那三個前代模型,而非 Griffin。

那不是一個可以用註腳帶過的技術細節。它改變了這個模型現階段的用途。對那些產品取決於人能否分辨的團隊來說,它是一個評估標的;也是供應商路線圖走向的一個訊號。這不是本季度能用來建立面向客戶路徑的東西。

安全閘門就是發布計畫

Tavus 關於 Griffin 所寫最有趣的內容,並不在於這個模型。而是在於它坦承:那些讓人類互動模型成為更好介面的特性,同樣也讓它更擅長欺騙他人,使對方相信它不是 AI;在安全發布之前,還需要進一步的對齊與安全工作;而該公司正著手開發揭露功能,並與各組織合作進行 AI 安全評估。有鑑於近半數的實測樣本無法分辨,而且能分辨的人大多在二十秒內就看出來,一套經得起隨意交談的揭露機制並非可有可無。

有兩件事會實質改變這篇文章。一份已發布、附有端點與價格的模型卡,會讓 Griffin 從研究成果變成採購問題。而在獨立影片排行榜上出現一筆紀錄——但要注意,這類排行榜是以成對偏好為短片評分,並非為了評分即時對話而打造,因此這種落差可能是永久性的,而非暫時性的——將能為延遲與品質方面的說法提供外部檢驗。在其中一項成真之前,VideoFDB 的賽道是目前可得的最強證據,而它們與人類的差距分別為 0.09 分與 0.47 分。

值得權衡的反論是,基準測試的執行並不等同於部署。NVIDIA 的協定讓每個系統接受相同的輪流發言任務,並由相同的評審評判;它完全沒有說明通話進行到第九個小時會如何表現,當兩個人整整一分鐘互相搶話時會發生什麼事,或者當參考照片把一張臉渲染得很糟時,表情控制是否會退化。Tavus 將針對漂移的訓練——即自我強制階段與歷史機制——回報為正是針對這個問題的修復方案,而在 Tavus 以外的人進行長時間會話並公開發表之前,讀者所能掌握的也就只有這些回報。請將該基準測試視為目前可取得的最佳證據,而非部署結果。

在此期間,可以在它周圍打造什麼

對一個今天就想擁有這類東西的團隊來說,實際的問題是:技術堆疊中哪些部分已經可以買到。對話式視訊介面是一條鏈——語音辨識、語言模型、語音合成,而就 Tavus 的情況而言,還有一個渲染模型——而前三者已經商品化。這些都位於 OrcaRouter 上一個與 OpenAI 相容的端點之後,在同一把金鑰下提供 200+ 個模型,並且供應商標價以 0% 加價直接轉嫁,因此供應商降價當天就會在這裡生效,而不是等到一個合約週期之後。如果你正在組建互動管線,並希望讓生成層保持開放,直到 Griffin 或類似事物成為實際產品,那麼這就是替換只需改動一項設定、而非遷移的地方。Tavus Griffin 本身在這裡不是一個已路由的模型,而只要它還是藏在申請表單後面的預覽版,它就不會是。

真正值得看的不是另一支展示影片。關鍵在於 Tavus 正在打造的揭露工具是否會公開發表,以及是否有第二個研究團隊能重現那套面對面協定。規模這麼大的一次圖靈測試通過,正是那種需要由第二個實驗室來跑一遍的結果。

An explainer scoreboard for Tavus Griffin with six rows: Status: research preview; Pricing: none published; Model type: human interaction model; VideoFDB generation: 3.83 of 5; VideoFDB perception: 3.73 of 5; Open issue: disclosure. Footer: "NVIDIA VideoFDB per Tavus and NVIDIA, September 2026." The OrcaRouter logo is composited bottom-right.