「Tavus Griffin vs MiniMax H3」のヒーロータイトルカード。サブタイトルは「双方向会話モデルが、出荷済みの動画生成ツールと出会う」。その下に4つのチップ: Tavus Griffin リサーチプレビュー、テスター限定; MiniMax H3 オープンウェイト、出荷済み; MiniMax H3 768Pで$0.08/秒; Griffin: APIなし、価格なし。
Guides & Insights

Tavus Griffin vs MiniMax H3:Duo 会話モデルが、リリース済みの動画生成ツールと出会う

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Tavus GriffinとMiniMax H3はどちらも、動き、話す人間を画面に映し出すが、その第一印象を超えて見れば、両者が同じ製品カテゴリーに属しているとはほとんど言えない。Griffinはヒューマン・インタラクション・モデルだ——リアルタイムで双方向の会話を行うために作られたビデオ・トゥ・ビデオ・システムであり、Tavusが2026年10月に発表し、現在は限られた初期テスターのグループだけが利用できる。MiniMax H3はオムニモーダルな動画生成ツールだ。プロンプトと、任意で画像・動画・音声の参照素材を渡せば、完成したクリップを返してくれる。一方は非公開の場で評価されている段階にあり、もう一方は何か月も前からダウンロードでき、ライセンスも取得でき、課金対象にもなっている。解像度やフレームレートではなく、この違いこそが、どちらを自分のスタックに組み入れるべきかを決めるのだ。

それぞれが実際に何なのか

Griffinは、Tavusが、レンダラーではなく参加者のように振る舞うモデルを構築しようとする試みです。同社はそれを初のHuman Interaction Modelと表現しており、公開したアーキテクチャは仕事を2つに分割しています。Continuous Conversational Modelingは、ペルソナが瞬間ごとに何をしているべきかを決定し、Audio-Visual Generationは、それに合致する音声と顔をストリーミングします。決定的なことに、これは全二重であり、話しながら見て聞いているため、中断されることができ、発話の途中で反応でき、応答する前にきれいなターン終了シグナルを待ちません。Tavus自身の枠組みでは、以前のシステムは顔を生成することを学んだが、Griffinは人々から会話行動を学ぶために構築されました。

MiniMax H3はHailuo 3世代であり、2026年7月31日にリリースされ、2026年8月3日にMiniMax H3 Community Licenseの下でオープンソース化され、H3-Base-FL2VAとH3-Base-Ref2VAのバリアントが公開されている。テキスト、画像、映像、音声の参照を単一の統合コンテキストとして読み取り、768Pまたは2Kで、ネイティブステレオ音声付きの4〜15秒のクリップを返す。生成は三段階パイプライン(H3-Context-IR、次に768pのH3-Base、次にH3-Regenerate-2K)を通じて行われる。これは並外れて広い入力面と、真に寛容なライセンスを備えたジェネレーターだ——現時点でGriffinに欠けているものすべてを備えている。

仕様を並べて比較

Two-card board titled 'One Is a Product'. Left card, MiniMax H3: omni-modal video generator, Hailuo 3 generation; released 31 July 2026 with open weights on 3 August 2026; 4 to 15 seconds at 768P or 2K with native stereo audio; text, image, video and audio inputs in one context; $0.08 per second at 768P and $0.13 at 2K; hosted and billable today. Right card, Tavus Griffin: duplex Human Interaction Model, video to video; announced October 2026 as a research preview; 720p at 25 fps in 320-millisecond chunks; the live participant's video and audio as input; no published price; selected testers only, not for customer use.

なぜ「duplex」が興味深い言葉なのか

あらゆる動画生成ツールは、H3も含め、完成したクリップがどう見えるかで評価される。Griffinが評価されるのは、クリップには映せないもの、つまり割り込んだ後の200ミリ秒に何が起きるかだ。それこそがHuman Interaction Modelという枠組みが指し示している問題であり、Tavusの目玉となる数値が視覚的ではなく行動に関するものになっている理由でもある。

最も引用されている数字は、1分間のビデオ通話の後で48%の人々がGriffinを実在の人物だと信じたというものだ——54人中26人——これに対し、Tavusの以前のスタックであるPhoenix-4.5、Sparrow-2、Raven-1では2.4%で、41人中1人だった。Tavusはまた、納得しなかった人々は最初の20秒以内に疑い始める傾向があったと報告している。これは見出しの数字よりも有用な詳細だ。つまり、錯覚は早い段階で成立するか、早い段階で崩れるかのどちらかだということだ。

2つ目の数値群は、2026年9月に採点されたNVIDIAのVideoFDBベンチマークによるもので、TavusによればGriffinは対面AIの独立テストで1位となった。生成側では、Griffinは3.83を記録し、報告されている最強のベースライン(Gemini 2.5とAnamの構成)の2.80を上回った。人間の参照スコアは3.92、タスク目標達成率は62.8%だった。知覚では3.73を記録し、MiniCPM-o 4.5の3.44、Gemini 2.5 Flash Nativeの3.17、音声のみのOpenAI gpt-realtime構成の2.97を上回った。人間の参照スコアは4.20、タスク目標達成率は73.8%で、これは評価された15モデル全体にわたる。Tavusはまた、Griffinがその場での反応において次に優れたシステムを37%上回ると主張している。これらはNVIDIAが構築したベンチマークに基づくベンダー報告の数値であり、そのように読むべきだ。ただし、注目に値するのは人間との比較ポイントだ。なぜなら、3.83対人間スコア3.92は、動画生成が歴史的に示してきた差よりもはるかに小さいからだ。

今日購入できるもの

ここで、この2つのモデルはまったく比較にならなくなる。

MiniMax H3は製品だ。ホスティングされており、生成される出力の秒単位で価格が設定され、そのオープンな派生版はモデルハブ上でダウンロードされるのを待っている。存在しないものの15秒、2K、ステレオ音声のクリップが欲しければ、今日の午後には手に入れられるし、それらをレンタルしたくないなら、重みを自分で実行することもできる。

Tavus Griffinは製品ではありません。TavusはGriffinの解説記事で明言しています。研究プレビューであるGriffin-Liteは本日、選ばれた初期テスターの一群に利用可能であり、より強力なモデルのより広範なリリースが続くこと、そしてGriffinはまだTavusプラットフォーム上にはなく、同社が安全にリリースする方法を確立した後に初めて登場することを。これは、ベンダーが自社の最も華々しい成果について示すには異例なほどの率直さであり、計画立案にとって重要です。Griffinを依存要素として製品ロードマップに組み込むことはできず、価格を付けることもできません。存在しないのですから。

だから、正直な計画上の問いは「どちらがより優れているか」ではなく、「自分が必要とする層に存在するのはどちらか」だ。

Screenshot of Artificial Analysis's 'AA-Video-T2V v2.0' leaderboard, the Overall board for text-to-video, captured 2 October 2026: Wan 3.0 first at Elo 1,157, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144, MiniMax H3 (768p) fourth at 1,139 and MiniMax H3 Max fifth at 1,134, with samples, release month and per-minute API pricing columns. The board lists MiniMax H3 and MiniMax H3 Max fourth and fifth with audio, though the with-audio filter itself is not applied in this capture.

OrcaRouterの適用範囲

MiniMax H3 は当社のカタログに掲載されています。モデルページは minimax/minimax-h3 にあり、課金はプロバイダーが課金する方法と同じです。768P で生成出力 1 秒あたり $0.08、2K で 1 秒あたり $0.13 です。OrcaRouter はプロバイダーの定価を0% のマークアップでそのまま反映するため、MiniMax の価格変更は次の請求サイクルではなく、発表された当日に当社のカードへ反映されます。Griffin はカタログに掲載されておらず、Tavus が顧客向けに出荷するまで掲載されることはありません — 当社は提供できないモデルをホストしませんし、選ばれたテスターに限定されたリサーチプレビューは、ルーターがルーティングできるものではありません。

実際的な結果として、この2つのモデルのうち一方はあなたのアプリケーションからコード1行の距離にあり、もう一方は電話番号付きの研究論文のようなものだ。すでに複数の動画モデルと言語モデルをルーティングしているなら、H3の秒単位の課金は、次のようなものの背後に置く価値のあるルートにしている自動フェイルオーバー:飽和したプロバイダーに当たったリクエストはタイムアウトを表面化させるのではなく、健全なプロバイダーに対して再試行され、ルーティングDSLを使えば2Kのジョブを特定のプロバイダーに固定しつつ、768Pのドラフトは容量が最も安い場所に流すことができる。ここで言及すべきもう一つのレバーはモデルフュージョンだ——H3の秒単位の価格は十分に安いので、生成前にテキストモデルを使ってプロンプトを書き直し再カットするのに費やす方が、最初の試行の失敗による無駄な秒数よりも安くつくことがよくある。

Screenshot of the OrcaRouter model page for MiniMax-H3, showing the model id minimax/minimax-h3, the description 'omni-modal video generation model (the Hailuo 3 generation), released July 31, 2026', a price of $0.08 per second, p50 time to first token of 375 ms and p95 of 416 ms over seven days.

比較が逆転しうる場面

この比較を変えるものは3つ、それも3つだけだ。

第一に、TavusがGriffinを公開価格付きの商用APIで提供するようになれば、「会話 対 クリップ」という枠組み全体は、スケジュール調整の判断ではなく真の購買判断となり、48%という対面の数字が生成出力の品質と直接しのぎを削り始める。第二に、H3のリアルタイムに関する状況が改善すれば——MiniMaxは積極的にリリースを続けている——ストリーミング可能な秒単位課金の生成器がGriffinの中核的な優位性を鈍らせるだろう。第三に、NVIDIAや他の中立な第三者がH3またはその後継を加えてVideoFDBを再実行すれば、Griffinが対面AIで初だという主張は反証不可能ではなくなる。Tavusは、安全上の懸念が解消され次第、まもなくGriffinをリリースする予定だと述べている。その一文がタイムラインのすべてだ。

結論

MiniMax H3とTavus Griffinは現時点でライバルではない。なぜなら、購入できるのは片方だけだからだ。H3は出荷済みのオープンウェイトで、秒単位課金のオムニモーダル生成器であり、価格が公表され、出力ウィンドウは4~15秒。Griffinは双方向会話モデルで、これまでに公表された中で最高の対面会話の数値を誇るが、APIも価格もなく、ベンダー自身が顧客はまだ利用できないと明言している。今日動画生成が必要なら、H3が答えであり、秒あたり数セントで測れる。割り込み可能なリアルタイムの顔が必要なら、Tavusを注視すべきだ。ただし、まず製品の残りを構築しよう。リリース日は日付ではなく一文だから。