「Tavus Griffin 對決 MiniMax H3」的主視覺標題卡,副標為「當雙工對話模型遇上已正式推出的影片生成器」,上方有四張標籤:Tavus Griffin 研究預覽,僅限測試人員;MiniMax H3 開放權重,已推出;MiniMax H3 在 768P 下每秒 $0.08;Griffin:無 API、無價格。
Guides & Insights

Tavus Griffin 對比 MiniMax H3:雙工對話模型遇上已推出的影片生成器

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Tavus Griffin 與 MiniMax H3 都能在螢幕上呈現出會動、會說話的人,但在那第一印象之後,它們幾乎算不上同一個產品類別。Griffin 是Human Interaction Model——一套用於即時進行雙向對話的影片轉影片系統,由 Tavus 於 2026 年 10 月發表,目前僅限少數早期測試者使用。MiniMax H3 則是全模態影片生成器:你給它一個提示詞,以及可選的圖像、影片和音訊參考,它就會回傳一段完成的短片。其中一個正在閉門評估;另一個則已經可供下載、授權和計費數月。這個差異——不是解析度或影格率——才是決定哪一個屬於你的技術堆疊的關鍵。

每一個實際上是什麼

Griffin 是 Tavus 嘗試打造的一個模型,其行為表現得像參與者,而非渲染器。該公司將其描述為首個 Human Interaction Model,而它發表的架構將工作分為兩部分:Continuous Conversational Modeling,負責決定人設在每個時刻應該做什麼;以及 Audio-Visual Generation,負責串流相符的語音與臉部影像。至關重要的是,它是全雙工的——它在說話時同時觀看與聆聽,因此可以被中斷、能在話語中途做出反應,而且不會等待乾淨的回合結束訊號才回應。Tavus 自己的說法是,先前的系統學會了生成臉部;而 Griffin 的打造目的,是從人們身上學習對話行為。

MiniMax H3 是海螺 3 世代,於 2026 年 7 月 31 日發布,並於 2026 年 8 月 3 日以 MiniMax H3 Community License 開源,公開了 H3-Base-FL2VA 與 H3-Base-Ref2VA 兩個變體。它將文字、圖像、影片與音訊參考讀取為單一統一脈絡,並傳回 4 至 15 秒、768P 或 2K 的片段,具備原生立體聲音訊,透過三階段流程(H3-Context-IR,接著以 768p 運行 H3-Base,再以 H3-Regenerate-2K)生成。它是一款輸入面向異常寬廣、授權真正寬鬆的生成器——這些特質 Griffin 目前一項也沒有。

規格並列對照

Two-card board titled 'One Is a Product'. Left card, MiniMax H3: omni-modal video generator, Hailuo 3 generation; released 31 July 2026 with open weights on 3 August 2026; 4 to 15 seconds at 768P or 2K with native stereo audio; text, image, video and audio inputs in one context; $0.08 per second at 768P and $0.13 at 2K; hosted and billable today. Right card, Tavus Griffin: duplex Human Interaction Model, video to video; announced October 2026 as a research preview; 720p at 25 fps in 320-millisecond chunks; the live participant's video and audio as input; no published price; selected testers only, not for customer use.

為什麼「duplex」是有趣的字

每一款影片生成器,包括 H3 在內,都是根據一段影片片段完成後看起來如何來評判。而 Griffin 被評判的,是影片片段無法呈現的東西:在你打斷它之後的那 200 毫秒內發生了什麼事。那正是 Human Interaction Model 這個框架所指向的問題,也是為什麼 Tavus 的主要數據是行為性的,而非視覺性的。

最常被引用的數字是,48% 的人在經過一分鐘的視訊通話後相信 Griffin 是真實的人——54 名參與者中有 26 人——相較之下,Tavus 先前的 Phoenix-4.5、Sparrow-2 和 Raven-1 技術堆疊只有 2.4%,41 人中有 1 人。Tavus 也報告,未被說服的人往往會在前 20 秒內起疑,這項細節比標題數字更有用:這意味著錯覺要嘛很早就成立,要嘛很早就崩解。

第二組數字來自 NVIDIA 的 VideoFDB 基準測試,評測時間為 2026 年 9 月,Tavus 表示 Griffin 在這項面對面 AI 的獨立測試中拿下第一。在生成方面,Griffin 得分 3.83,而最強的已回報基準(Gemini 2.5 加上 Anam 的組態)為 2.80,人類參考分數為 3.92,任務目標達成率為 62.8%。在感知方面,它得分 3.73,而 MiniCPM-o 4.5 為 3.44、Gemini 2.5 Flash Native 為 3.17、僅使用音訊的 OpenAI gpt-realtime 組態為 2.97,人類參考分數為 4.20,任務目標達成率為 73.8%,共評估了十五個模型。Tavus 也宣稱,Griffin 在即時反應方面領先第二佳的系統達 37%。這些都是廠商自行回報的數字,且立基於 NVIDIA 所建構的基準測試,理應以此角度解讀——但真正值得留意的,是那些與人類比較的分數,因為 3.83 對上 3.92 的人類分數,其差距遠比影片生成歷來所呈現的來得小。

你今天能買到什麼

在此,這兩個模型完全不再具有可比性。

MiniMax H3 是一款產品。它是以託管方式提供,按生成輸出的每秒計價,而其開放變體正放在模型中心等待下載。若你想要一段十五秒、2K、立體聲音訊、內容不存在的片段,今天下午就能擁有;如果你不想租用,也可以自行執行權重。

Tavus Griffin 不是一項產品。Tavus 在 Griffin 的說明文章中明確表示,Griffin-Lite 這個研究預覽版今天已提供給一組精選的早期測試者使用,之後會更廣泛地發布更強大的模型,而且 Griffin 尚未登上 Tavus 平台,只有在該公司弄清楚如何安全發布它之後才會推出。一家供應商對自家最亮眼的成果如此坦率,實屬罕見,而這對規劃來說很重要:你不能把 Griffin 當作相依項目放進產品路線圖,也不能為它定價,因為根本沒有價格。

所以,真正誠實的規劃問題不是「哪個比較好」,而是「哪一個存在於我需要的層級」。

Screenshot of Artificial Analysis's 'AA-Video-T2V v2.0' leaderboard, the Overall board for text-to-video, captured 2 October 2026: Wan 3.0 first at Elo 1,157, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144, MiniMax H3 (768p) fourth at 1,139 and MiniMax H3 Max fifth at 1,134, with samples, release month and per-minute API pricing columns. The board lists MiniMax H3 and MiniMax H3 Max fourth and fifth with audio, though the with-audio filter itself is not applied in this capture.

OrcaRouter 的定位

MiniMax H3 已在我們的目錄中。模型頁面位於 minimax/minimax-h3,計費方式與供應商的計費方式一致:768P 每秒 $0.08,2K 每秒 $0.13。OrcaRouter 以 0% 加價,將供應商的定價原價傳遞出去,因此 MiniMax 的價格一有變動,會在公告當天就顯示在我們的價目表上,而非等到下一個計費週期。Griffin 不在目錄中,而且在 Tavus 向客戶推出之前也不會納入——我們不會託管無法提供服務的模型,而僅限特定測試人員使用的研究預覽版,也不是路由器能夠路由的東西。

實際後果是,這兩個模型中,有一個距離你的應用程式只有一行程式碼之遙,另一個則是一篇附有電話號碼的研究論文。如果你已經在路由多個影片與語言模型,H3 的按秒計費也讓這條路由值得放在自動容錯移轉之後:當請求碰上已飽和的供應商時,會改向健康的供應商重試,而不是直接冒出逾時錯誤;而路由 DSL 讓你能把 2K 工作釘選到特定供應商,同時讓 768P 草稿落在容量最便宜的地方。模型融合是這裡另一個值得提及的槓桿——H3 的每秒價格低到,在生成前花一個文字模型改寫並重新切分提示詞,往往比第一次嘗試失敗所浪費的秒數更便宜。

Screenshot of the OrcaRouter model page for MiniMax-H3, showing the model id minimax/minimax-h3, the description 'omni-modal video generation model (the Hailuo 3 generation), released July 31, 2026', a price of $0.08 per second, p50 time to first token of 375 ms and p95 of 416 ms over seven days.

比較可能翻轉的地方

有三件事會改變這個比較,而且只有三件。

首先,如果 Tavus 讓 Griffin 登上商用 API 並公布價格,那麼整個「對話對比短片」的框架就會變成真正的採購決策,而非排程決策,而 48% 的面對面比例也將開始直接與生成輸出的品質互別苗頭。其次,如果 H3 的即時性表現有所改善——而 MiniMax 一直積極推出新產品——那麼一個能夠串流的按秒計費生成器將會削弱 Griffin 的核心優勢。第三,如果 NVIDIA 或其他中立第三方將 H3 或其後繼版本納入並重新執行 VideoFDB,那麼 Griffin 在面對面 AI 領域拔得頭籌的主張就不再是無法否證的。Tavus 表示,預期在安全疑慮獲得解決後就會很快發布 Griffin;這句話就是整個時程表。

底線

MiniMax H3 和 Tavus Griffin 目前並不是競爭對手,因為兩者之中只有一個買得到。H3 是已推出的開放權重、按秒計價的全模態生成器,有公開價格,以及 4 到 15 秒的輸出視窗;Griffin 則是雙工對話模型,擁有目前任何人發表過的最佳面對面數據,但沒有 API、沒有價格,而且其自家供應商明確表示客戶尚無法使用。如果你今天就需要影片生成,H3 就是答案,而且可以用每秒幾美分來衡量。如果你需要一張可被打斷的即時人臉,那就關注 Tavus——但先把產品的其餘部分打造好,因為發布日期只是一句話,不是一個日期。