「Tavus Griffin vs Seedance 2.5」のヒーロータイトルカード。サブタイトルは「片方は30秒を生成し、片方はあなたが文を言い終えるのを待つ」。その上に4つのチップ: Seedance 2.5 は1パスで30秒、Seedance 2.5 は480pで5秒あたり約0.51ドル、Griffin は音声から動画まで0.43秒、Griffin はまだ顧客に販売できない。
Guides & Insights

Tavus Griffin 対 Seedance 2.5:一方は30秒を生成し、一方はあなたが文を言い終えるのを待つ

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Tavus Griffin と Seedance 2.5 の違いを最も手早く理解する方法は、あなたが話すのをやめたときにそれぞれが何をするかを見ることだ。ByteDance の Seed チームが2026年7月31日にリリースした Seedance 2.5 は動き続ける。プロンプトを渡せば、リターンキーを押す前に選んだ解像度とフレームレートで、音声も同時に備えた最大30秒の動画を1回のパスで生成する。Tavus が2026年10月にリサーチプレビューとして発表した Tavus Griffin は止まる——そしてまた始める。なぜなら、ずっと聞いていたので、言い返すことがあるからだ。一方のモデルは、無人で動く制作エンジン。もう一方は、あなたがそこにいなければ機能しない参加者だ。

30秒をワンテイクで

Seedance 2.5の最大の売りは尺だ。前バージョンが最大15秒だったのに対し、2.5は1回の生成で30秒を生み出す——ウィンドウは2倍で、これは1ショットと1シーンの違いに相当する。さらに複数ラウンドの延長に対応しており、ByteDanceはベータ版で超長時間モードを実演した。そこではモデルは新規に始めるのではなく、自身の出力を継続するよう求められる。

入力サーフェスは、2026年の基準で見ても広い。1回のリクエストで、参照として最大約30枚の画像、10本の動画クリップ、10本の音声クリップを扱うことができ、参照用の動画と音声はそれぞれ約30秒に及ぶ。これは、キャラクター、ロケーション、モーション、サウンドトラックを同時に指定するのに十分な素材量だ。さらにこのモデルには、プロンプトボックスというよりコンポジットスイートのように読める、名前付きのモード群が搭載されている。プリビズ用のホワイトモデルとクレイのモード、グリーンスクリーン、モーション参照、クリエイティブ参照などだ。その上に、タイムスタンプ単位のコントロールと領域単位の編集が乗っており、ここで30秒という枠は単なる長さではなくなり、タイムラインとして機能し始める。

音声と映像は、後から多重化されるのではなく同じパスから出力され、10を超える言語の対話にまたがっている。しかもローンチパートナーのリスト — XCMG、XPeng、Lingchu Intelligence、Weifen Zhifei、Qiongche Intelligence — は、クリエイティブツールの顧客基盤というより、産業・自動車分野の顧客基盤のように見える。ByteDance自身の位置づけでは、Seedance 2.5はインタラクションではなく、完成した映像素材を必要とする人向けだという。

Screenshot of Artificial Analysis's 'AA-Video-T2V v2.0' leaderboard filtered to models with audio, captured 2 October 2026: Wan 3.0 first at Elo 1,157, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144 with 7,526 votes and $34.12 per minute, MiniMax H3 (768p) fourth at 1,139 and MiniMax H3 Max fifth at 1,134, with samples, release month and per-minute API pricing columns.

あなたが話している間だけ存在するモデル

Griffinはシステムの形状が逆であり、Tavusはその形状について異例なほど明確に述べている。TavusはGriffinを最初の「Human Interaction Model」と呼んでいる。会話中に参加者を映像と音声で捉え、その反対側をリアルタイムで生成するビデオツービデオのシステムだ。アーキテクチャは、ペルソナが瞬間ごとに何をすべきかを決定する「Continuous Conversational Modeling」と、対応する音声と顔をストリーミングする「Audio-Visual Generation」に分かれる。全二重なので割り込みが可能で、応答するのにきれいなターン終了シグナルを必要としない。

実装のあらゆる部分は、次のショットではなく、次の1秒のほんの一瞬のために調整されている。Tavec音声コーデックは48kHzで動作し、毎秒100フレームで1フレームあたり40値、コードブックなし、完全に因果的なデコーダ、そして最小10ミリ秒のパケットを備える。映像は720pで320ミリ秒のチャンクとしてストリーミングされ、25fpsで8フレームにつき1つの潜在表現、潜在表現ごとに3回の拡散ステップ、VAEでは8倍の時間圧縮が行われる。3段階の蒸留 — まず分布マッチング、次にティーチャーフォーシング自己回帰、そしてセルフフォーシング — が、3回の拡散ステップをリアルタイムで実行可能にしている。音声から映像へのレイテンシはH100上で平均0.43秒で、Tavusによれば、同社が測定した次に速い手法の約半分だ。音声クローニングには約10秒のサンプルが必要だ。

そして、それをどう計画に組み込むかを決める一文:Tavusは、研究プレビューであるGriffin-Liteが一部の早期テスターに利用可能であること、Griffin-Liteは現時点では顧客向けに利用可能ではないこと、より強力なモデルのより広範なリリースが後続すること、そしてGriffinはまだTavusプラットフォーム上にはなく、安全にリリースする方法を同社が確立し次第登場することを述べている。

それぞれが唱える主張と、それがどれほどの価値を持つか

Seedance 2.5のエビデンスは主に能力に関するものだ。何を受け付けられるか、どれだけ長く実行できるか、いくらかかるか。Griffinのエビデンスは主に効果に関するものだ。ロンドン大学クイーン・メアリー校との研究で、Tavusは次のように報告している。54人中26人 — 48% — が1分間のビデオ通話後にGriffinを実在の人物だと信じたのに対し、以前のPhoenix-4.5、Sparrow-2、Raven-1のスタックでは41人中1人(2.4%)だった。懐疑的な人々はたいてい最初の20秒以内に疑念を抱いた。NVIDIAのVideoFDBベンチマークは、2026年9月に採点されたもので、Tavusの集計によればGriffinが対面AIで首位に立っている。生成は3.83で、報告されている最強ベースラインの2.80と人間の3.92に対して。知覚は3.73で、3.44と4.20に対して。そして即時反応では、次に優れたシステムを37%上回っている。ベンダー報告であり、NVIDIAが構築したベンチマーク上でのものだ — しかし、重みを持つのは人間との比較ポイントだ。

Seedance 2.5 には、「観客がそれを信じたか」を確認するための比較可能な独立したテストは存在しない。それは同モデルの目的ではないからだ。二つのモデルは異なる問いに答えており、どちらの数値群も他方に当てはまることはない。

実際に購入できるもの

Seedance 2.5 は料金表が設定された製品です。ByteDance の ModelArk プラットフォームでは、動画入力なしで100万トークンあたり $10.70、動画入力ありで100万トークンあたり $6.40 に設定されており、480p の5秒 16:9 クリップでおよそ $0.51、同じクリップを 720p にするとおよそ $1.16 になる計算です。アクセスは ByteDance の一般消費者向けアプリ経由、および中国では Volcano Engine Ark 上の API、国際的には BytePlus ModelArk 経由で提供されています。少なくとも1社の販売代理店は米国では利用できないと述べており、最高解像度が 720p なのか 1080p なのかについては情報源によって見解が分かれています — どちらも仕様に書き込む前に知っておく価値があります。

Griffinには料金表も公開APIも日程もない。まさにそれが購入判断のすべてであり、ほとんどの比較記事が認める以上に、その問いをさらに単純化してしまう。

Board titled 'Seconds versus Sentences'. Seedance 2.5 card: what it reads a prompt plus up to 30 images, 10 video clips and 10 audio clips; what it returns up to 30 seconds of video in one pass; audio joint audio and video over 10 languages; latency batch generation, no real-time mode; price about $0.51 per five-second 480p clip on ModelArk; availability shipped 31 July 2026, live on ModelArk. Tavus Griffin card: what it reads the live participant, video and audio; what it returns the other side of the conversation in real time; audio streaming speech with a voice cloned from a ten-second sample; latency 0.43 s average audio to video on H100s; price none published; availability research preview, selected testers only.

ルーターがその真価を発揮する場面

会話を成立させ、さらに完成した映像も生成するエージェント——その両方が必要なものを作っているなら、あなたは2つのベンダー、2つのコンソール、2つの課金システム、そして「リクエストとは何か」についての2つの異なる考え方を相手にすることになります。OrcaRouterが飾りではなく本当に役立つのは、まさにこの継ぎ目です。200を超えるモデルを1つのキーで横断でき、プロバイダの定価を0%のマークアップでそのまま反映するので、ベンダーの値下げが同じ日にカードに届き、自動フェイルオーバーにより、1つの飽和したプロバイダがあなたの障害になることはなく、重要なジョブを特定のバックエンドに固定しつつ下書きは容量が最も安い場所へ流すためのルーティングDSLも使えます。ここではモデル融合も周辺部分で重要です——トークン単位または秒単位で課金される生成器では、高価な生成に費用をかける前に安価なテキストモデルでプロンプトを研ぎ澄ますことが、通常パイプラインで最も高いリターンを生む工程です。

タイトルに挙げた2つのモデルについて正確に言うと、Seedance 2.5もGriffinもOrcaRouterのルートではありません。SeedanceにはByteDance自身のプラットフォームと第三者ディストリビューターを通じて到達できますが、Griffinにはまったく到達できません。カタログが動画側で実際に扱っているのはminimax/minimax-h3、MiniMaxのオムニモーダル生成モデルで、768Pでは出力1秒あたり$0.08、2Kでは1秒あたり$0.13、Seedanceと同じ秒単位で販売されており、現在利用可能です。

Screenshot of the OrcaRouter model page for MiniMax-H3, showing the model id minimax/minimax-h3, the description 'omni-modal video generation model (the Hailuo 3 generation), released July 31, 2026', a price of $0.08 per second, p50 time to first token of 375 ms and p95 of 416 ms over seven days.

よくある質問を簡潔に

Seedance 2.5 と Griffin を同じ製品で動かすことはできますか?アーキテクチャ上は可能で、それは明らかな役割分担です。プリレンダリングできるものは Seedance、ライブサーフェスは Griffin です。商業的には無理です。なぜなら Griffin はまだあなたに販売可能ではないからです。

Griffinは単なるトーキングヘッド生成ツールなのでしょうか?いいえ、そしてTavusはその違いに慎重です — トーキングヘッド生成ツールはテキストを受け取って動画を返すのに対し、Griffinは参加者の映像と音声を入力として受け取り、その場で反応するかどうかで評価されます。

Seedance 2.5はリアルタイムに対応していますか?いいえ。30秒という上限と複数ラウンドの延長モードを備えたバッチ生成ツールであり、レイテンシーは競争軸ではありません。

結論

Seedance 2.5は出荷済みのプロダクションエンジンだ。1パスで30秒、音声の同時生成、最大30枚の画像と10件の動画・音声参照、タイムスタンプおよび領域レベルの制御、ModelArkで5秒の480pクリップが約0.51ドル、720pで約1.16ドル。現在ByteDance自身のプラットフォームを通じて利用可能で、誰も確認できた限りでは、米国では利用できない。Tavus Griffinは製品ではない。双方向のHuman Interaction Modelであり、公表されている実績は、1分間の通話で参加者の48%が人間だと信じたこと、H100上での音声から映像への平均レイテンシが0.43秒であることだ。そしてベンダーは、顧客はまだ利用できないと書面で述べている。今日すぐに映像が必要なら、Seedanceが答えであり、価格は公開されている。話している間に反応する顔が必要なら、答えは、まだ誰もそれを販売していないということだ。