
Tavus Griffin 對比 MiniMax H3:雙工對話模型遇上已推出的影片生成器
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Tavus Griffin 與 MiniMax H3 都能在螢幕上呈現出會動、會說話的人,但在那第一印象之後,它們幾乎算不上同一個產品類別。Griffin 是Human Interaction Model——一套用於即時進行雙向對話的影片轉影片系統,由 Tavus 於 2026 年 10 月發表,目前僅限少數早期測試者使用。MiniMax H3 則是全模態影片生成器:你給它一個提示詞,以及可選的圖像、影片和音訊參考,它就會回傳一段完成的短片。其中一個正在閉門評估;另一個則已經可供下載、授權和計費數月。這個差異——不是解析度或影格率——才是決定哪一個屬於你的技術堆疊的關鍵。
每一個實際上是什麼
Griffin 是 Tavus 嘗試打造的一個模型,其行為表現得像參與者,而非渲染器。該公司將其描述為首個 Human Interaction Model,而它發表的架構將工作分為兩部分:Continuous Conversational Modeling,負責決定人設在每個時刻應該做什麼;以及 Audio-Visual Generation,負責串流相符的語音與臉部影像。至關重要的是,它是全雙工的——它在說話時同時觀看與聆聽,因此可以被中斷、能在話語中途做出反應,而且不會等待乾淨的回合結束訊號才回應。Tavus 自己的說法是,先前的系統學會了生成臉部;而 Griffin 的打造目的,是從人們身上學習對話行為。
MiniMax H3 是海螺 3 世代,於 2026 年 7 月 31 日發布,並於 2026 年 8 月 3 日以 MiniMax H3 Community License 開源,公開了 H3-Base-FL2VA 與 H3-Base-Ref2VA 兩個變體。它將文字、圖像、影片與音訊參考讀取為單一統一脈絡,並傳回 4 至 15 秒、768P 或 2K 的片段,具備原生立體聲音訊,透過三階段流程(H3-Context-IR,接著以 768p 運行 H3-Base,再以 H3-Regenerate-2K)生成。它是一款輸入面向異常寬廣、授權真正寬鬆的生成器——這些特質 Griffin 目前一項也沒有。
規格並列對照

為什麼「duplex」是有趣的字
每一款影片生成器,包括 H3 在內,都是根據一段影片片段完成後看起來如何來評判。而 Griffin 被評判的,是影片片段無法呈現的東西:在你打斷它之後的那 200 毫秒內發生了什麼事。那正是 Human Interaction Model 這個框架所指向的問題,也是為什麼 Tavus 的主要數據是行為性的,而非視覺性的。
最常被引用的數字是,48% 的人在經過一分鐘的視訊通話後相信 Griffin 是真實的人——54 名參與者中有 26 人——相較之下,Tavus 先前的 Phoenix-4.5、Sparrow-2 和 Raven-1 技術堆疊只有 2.4%,41 人中有 1 人。Tavus 也報告,未被說服的人往往會在前 20 秒內起疑,這項細節比標題數字更有用:這意味著錯覺要嘛很早就成立,要嘛很早就崩解。
第二組數字來自 NVIDIA 的 VideoFDB 基準測試,評測時間為 2026 年 9 月,Tavus 表示 Griffin 在這項面對面 AI 的獨立測試中拿下第一。在生成方面,Griffin 得分 3.83,而最強的已回報基準(Gemini 2.5 加上 Anam 的組態)為 2.80,人類參考分數為 3.92,任務目標達成率為 62.8%。在感知方面,它得分 3.73,而 MiniCPM-o 4.5 為 3.44、Gemini 2.5 Flash Native 為 3.17、僅使用音訊的 OpenAI gpt-realtime 組態為 2.97,人類參考分數為 4.20,任務目標達成率為 73.8%,共評估了十五個模型。Tavus 也宣稱,Griffin 在即時反應方面領先第二佳的系統達 37%。這些都是廠商自行回報的數字,且立基於 NVIDIA 所建構的基準測試,理應以此角度解讀——但真正值得留意的,是那些與人類比較的分數,因為 3.83 對上 3.92 的人類分數,其差距遠比影片生成歷來所呈現的來得小。
你今天能買到什麼
在此,這兩個模型完全不再具有可比性。
MiniMax H3 是一款產品。它是以託管方式提供,按生成輸出的每秒計價,而其開放變體正放在模型中心等待下載。若你想要一段十五秒、2K、立體聲音訊、內容不存在的片段,今天下午就能擁有;如果你不想租用,也可以自行執行權重。
Tavus Griffin 不是一項產品。Tavus 在 Griffin 的說明文章中明確表示,Griffin-Lite 這個研究預覽版今天已提供給一組精選的早期測試者使用,之後會更廣泛地發布更強大的模型,而且 Griffin 尚未登上 Tavus 平台,只有在該公司弄清楚如何安全發布它之後才會推出。一家供應商對自家最亮眼的成果如此坦率,實屬罕見,而這對規劃來說很重要:你不能把 Griffin 當作相依項目放進產品路線圖,也不能為它定價,因為根本沒有價格。
所以,真正誠實的規劃問題不是「哪個比較好」,而是「哪一個存在於我需要的層級」。

OrcaRouter 的定位
MiniMax H3 已在我們的目錄中。模型頁面位於 minimax/minimax-h3,計費方式與供應商的計費方式一致:768P 每秒 $0.08,2K 每秒 $0.13。OrcaRouter 以 0% 加價,將供應商的定價原價傳遞出去,因此 MiniMax 的價格一有變動,會在公告當天就顯示在我們的價目表上,而非等到下一個計費週期。Griffin 不在目錄中,而且在 Tavus 向客戶推出之前也不會納入——我們不會託管無法提供服務的模型,而僅限特定測試人員使用的研究預覽版,也不是路由器能夠路由的東西。
實際後果是,這兩個模型中,有一個距離你的應用程式只有一行程式碼之遙,另一個則是一篇附有電話號碼的研究論文。如果你已經在路由多個影片與語言模型,H3 的按秒計費也讓這條路由值得放在自動容錯移轉之後:當請求碰上已飽和的供應商時,會改向健康的供應商重試,而不是直接冒出逾時錯誤;而路由 DSL 讓你能把 2K 工作釘選到特定供應商,同時讓 768P 草稿落在容量最便宜的地方。模型融合是這裡另一個值得提及的槓桿——H3 的每秒價格低到,在生成前花一個文字模型改寫並重新切分提示詞,往往比第一次嘗試失敗所浪費的秒數更便宜。

比較可能翻轉的地方
有三件事會改變這個比較,而且只有三件。
首先,如果 Tavus 讓 Griffin 登上商用 API 並公布價格,那麼整個「對話對比短片」的框架就會變成真正的採購決策,而非排程決策,而 48% 的面對面比例也將開始直接與生成輸出的品質互別苗頭。其次,如果 H3 的即時性表現有所改善——而 MiniMax 一直積極推出新產品——那麼一個能夠串流的按秒計費生成器將會削弱 Griffin 的核心優勢。第三,如果 NVIDIA 或其他中立第三方將 H3 或其後繼版本納入並重新執行 VideoFDB,那麼 Griffin 在面對面 AI 領域拔得頭籌的主張就不再是無法否證的。Tavus 表示,預期在安全疑慮獲得解決後就會很快發布 Griffin;這句話就是整個時程表。
底線
MiniMax H3 和 Tavus Griffin 目前並不是競爭對手,因為兩者之中只有一個買得到。H3 是已推出的開放權重、按秒計價的全模態生成器,有公開價格,以及 4 到 15 秒的輸出視窗;Griffin 則是雙工對話模型,擁有目前任何人發表過的最佳面對面數據,但沒有 API、沒有價格,而且其自家供應商明確表示客戶尚無法使用。如果你今天就需要影片生成,H3 就是答案,而且可以用每秒幾美分來衡量。如果你需要一張可被打斷的即時人臉,那就關注 Tavus——但先把產品的其餘部分打造好,因為發布日期只是一句話,不是一個日期。
