
Tavus Griffin vs MiniMax H3:Duo 会話モデルが、リリース済みの動画生成ツールと出会う
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 223 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Tavus GriffinとMiniMax H3はどちらも、動き、話す人間を画面に映し出すが、その第一印象を超えて見れば、両者が同じ製品カテゴリーに属しているとはほとんど言えない。Griffinはヒューマン・インタラクション・モデルだ——リアルタイムで双方向の会話を行うために作られたビデオ・トゥ・ビデオ・システムであり、Tavusが2026年10月に発表し、現在は限られた初期テスターのグループだけが利用できる。MiniMax H3はオムニモーダルな動画生成ツールだ。プロンプトと、任意で画像・動画・音声の参照素材を渡せば、完成したクリップを返してくれる。一方は非公開の場で評価されている段階にあり、もう一方は何か月も前からダウンロードでき、ライセンスも取得でき、課金対象にもなっている。解像度やフレームレートではなく、この違いこそが、どちらを自分のスタックに組み入れるべきかを決めるのだ。
それぞれが実際に何なのか
Griffinは、Tavusが、レンダラーではなく参加者のように振る舞うモデルを構築しようとする試みです。同社はそれを初のHuman Interaction Modelと表現しており、公開したアーキテクチャは仕事を2つに分割しています。Continuous Conversational Modelingは、ペルソナが瞬間ごとに何をしているべきかを決定し、Audio-Visual Generationは、それに合致する音声と顔をストリーミングします。決定的なことに、これは全二重であり、話しながら見て聞いているため、中断されることができ、発話の途中で反応でき、応答する前にきれいなターン終了シグナルを待ちません。Tavus自身の枠組みでは、以前のシステムは顔を生成することを学んだが、Griffinは人々から会話行動を学ぶために構築されました。
MiniMax H3はHailuo 3世代であり、2026年7月31日にリリースされ、2026年8月3日にMiniMax H3 Community Licenseの下でオープンソース化され、H3-Base-FL2VAとH3-Base-Ref2VAのバリアントが公開されている。テキスト、画像、映像、音声の参照を単一の統合コンテキストとして読み取り、768Pまたは2Kで、ネイティブステレオ音声付きの4〜15秒のクリップを返す。生成は三段階パイプライン(H3-Context-IR、次に768pのH3-Base、次にH3-Regenerate-2K)を通じて行われる。これは並外れて広い入力面と、真に寛容なライセンスを備えたジェネレーターだ——現時点でGriffinに欠けているものすべてを備えている。
仕様を並べて比較

なぜ「duplex」が興味深い言葉なのか
あらゆる動画生成ツールは、H3も含め、完成したクリップがどう見えるかで評価される。Griffinが評価されるのは、クリップには映せないもの、つまり割り込んだ後の200ミリ秒に何が起きるかだ。それこそがHuman Interaction Modelという枠組みが指し示している問題であり、Tavusの目玉となる数値が視覚的ではなく行動に関するものになっている理由でもある。
最も引用されている数字は、1分間のビデオ通話の後で48%の人々がGriffinを実在の人物だと信じたというものだ——54人中26人——これに対し、Tavusの以前のスタックであるPhoenix-4.5、Sparrow-2、Raven-1では2.4%で、41人中1人だった。Tavusはまた、納得しなかった人々は最初の20秒以内に疑い始める傾向があったと報告している。これは見出しの数字よりも有用な詳細だ。つまり、錯覚は早い段階で成立するか、早い段階で崩れるかのどちらかだということだ。
2つ目の数値群は、2026年9月に採点されたNVIDIAのVideoFDBベンチマークによるもので、TavusによればGriffinは対面AIの独立テストで1位となった。生成側では、Griffinは3.83を記録し、報告されている最強のベースライン(Gemini 2.5とAnamの構成)の2.80を上回った。人間の参照スコアは3.92、タスク目標達成率は62.8%だった。知覚では3.73を記録し、MiniCPM-o 4.5の3.44、Gemini 2.5 Flash Nativeの3.17、音声のみのOpenAI gpt-realtime構成の2.97を上回った。人間の参照スコアは4.20、タスク目標達成率は73.8%で、これは評価された15モデル全体にわたる。Tavusはまた、Griffinがその場での反応において次に優れたシステムを37%上回ると主張している。これらはNVIDIAが構築したベンチマークに基づくベンダー報告の数値であり、そのように読むべきだ。ただし、注目に値するのは人間との比較ポイントだ。なぜなら、3.83対人間スコア3.92は、動画生成が歴史的に示してきた差よりもはるかに小さいからだ。
今日購入できるもの
ここで、この2つのモデルはまったく比較にならなくなる。
MiniMax H3は製品だ。ホスティングされており、生成される出力の秒単位で価格が設定され、そのオープンな派生版はモデルハブ上でダウンロードされるのを待っている。存在しないものの15秒、2K、ステレオ音声のクリップが欲しければ、今日の午後には手に入れられるし、それらをレンタルしたくないなら、重みを自分で実行することもできる。
Tavus Griffinは製品ではありません。TavusはGriffinの解説記事で明言しています。研究プレビューであるGriffin-Liteは本日、選ばれた初期テスターの一群に利用可能であり、より強力なモデルのより広範なリリースが続くこと、そしてGriffinはまだTavusプラットフォーム上にはなく、同社が安全にリリースする方法を確立した後に初めて登場することを。これは、ベンダーが自社の最も華々しい成果について示すには異例なほどの率直さであり、計画立案にとって重要です。Griffinを依存要素として製品ロードマップに組み込むことはできず、価格を付けることもできません。存在しないのですから。
だから、正直な計画上の問いは「どちらがより優れているか」ではなく、「自分が必要とする層に存在するのはどちらか」だ。

OrcaRouterの適用範囲
MiniMax H3 は当社のカタログに掲載されています。モデルページは minimax/minimax-h3 にあり、課金はプロバイダーが課金する方法と同じです。768P で生成出力 1 秒あたり $0.08、2K で 1 秒あたり $0.13 です。OrcaRouter はプロバイダーの定価を0% のマークアップでそのまま反映するため、MiniMax の価格変更は次の請求サイクルではなく、発表された当日に当社のカードへ反映されます。Griffin はカタログに掲載されておらず、Tavus が顧客向けに出荷するまで掲載されることはありません — 当社は提供できないモデルをホストしませんし、選ばれたテスターに限定されたリサーチプレビューは、ルーターがルーティングできるものではありません。
実際的な結果として、この2つのモデルのうち一方はあなたのアプリケーションからコード1行の距離にあり、もう一方は電話番号付きの研究論文のようなものだ。すでに複数の動画モデルと言語モデルをルーティングしているなら、H3の秒単位の課金は、次のようなものの背後に置く価値のあるルートにしている自動フェイルオーバー:飽和したプロバイダーに当たったリクエストはタイムアウトを表面化させるのではなく、健全なプロバイダーに対して再試行され、ルーティングDSLを使えば2Kのジョブを特定のプロバイダーに固定しつつ、768Pのドラフトは容量が最も安い場所に流すことができる。ここで言及すべきもう一つのレバーはモデルフュージョンだ——H3の秒単位の価格は十分に安いので、生成前にテキストモデルを使ってプロンプトを書き直し再カットするのに費やす方が、最初の試行の失敗による無駄な秒数よりも安くつくことがよくある。

比較が逆転しうる場面
この比較を変えるものは3つ、それも3つだけだ。
第一に、TavusがGriffinを公開価格付きの商用APIで提供するようになれば、「会話 対 クリップ」という枠組み全体は、スケジュール調整の判断ではなく真の購買判断となり、48%という対面の数字が生成出力の品質と直接しのぎを削り始める。第二に、H3のリアルタイムに関する状況が改善すれば——MiniMaxは積極的にリリースを続けている——ストリーミング可能な秒単位課金の生成器がGriffinの中核的な優位性を鈍らせるだろう。第三に、NVIDIAや他の中立な第三者がH3またはその後継を加えてVideoFDBを再実行すれば、Griffinが対面AIで初だという主張は反証不可能ではなくなる。Tavusは、安全上の懸念が解消され次第、まもなくGriffinをリリースする予定だと述べている。その一文がタイムラインのすべてだ。
結論
MiniMax H3とTavus Griffinは現時点でライバルではない。なぜなら、購入できるのは片方だけだからだ。H3は出荷済みのオープンウェイトで、秒単位課金のオムニモーダル生成器であり、価格が公表され、出力ウィンドウは4~15秒。Griffinは双方向会話モデルで、これまでに公表された中で最高の対面会話の数値を誇るが、APIも価格もなく、ベンダー自身が顧客はまだ利用できないと明言している。今日動画生成が必要なら、H3が答えであり、秒あたり数セントで測れる。割り込み可能なリアルタイムの顔が必要なら、Tavusを注視すべきだ。ただし、まず製品の残りを構築しよう。リリース日は日付ではなく一文だから。
