
Tavus Griffin vs Alibaba Wan 2.7:会話型モデル対生成型モデル
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 223 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
をつい比較したくなるのはTavus GriffinとAlibaba Wan 2.7動画の秒単位あたりだが、その比較は成立しない。Wan 2.7には公開された料金表がある——Alibaba Cloudの国際シンガポールエンドポイントで1080pが1分9.00ドル、北京と東京にはより安価なティアがある——一方、Tavus Griffinには料金表が一切ない。Griffin-Liteが2026年10月1日、申請フォームの背後にいる限られた信頼済みテスター向けの研究プレビューとして出荷されたためだ。両者に共通するのは「動画」という一語だけである。それ以外では、両者は異なる問いへの答えだ。一方は会話の中で次に何が起きるべきかを問われ、もう一方は記述されたシーンがどのように見えるかを問われる。興味深い比較は品質ではなく、何かを出力する前にそれぞれがあなたに何を求めるのか、そして何が返ってくるのかである。
違いはループであり、解像度ではない
Wan 2.7はプロンプトからクリップを1つずつ生成する。説明文を書けば、1本の映像が手に入る。それを見て、また次を書く。Wan 2.7は4つのモデルからなるスイートだ — テキストtoビデオ、画像toビデオ、参照toビデオ、そしてビデオ編集 — そしてそのやり取りは根本的にトランザクション的である。つまり、入力、レンダリングされた出力、そしてそれを残すかどうかの判断だ。何を求めるかをまだ決めている間は、何も動き出さない。
Griffinは逆の作りになっている。これは全二重システムだ。音声と映像を取り込み、1秒未満の間隔で会話を再評価し、沈黙すべきか、合図を送るか、あいづちを打つか、ターンを取るかを判断し、ストリーミング音声生成器とストリーミング映像生成器を並行して駆動する表現制御を出力する、Continuous Conversational Modelingエンジンである。1枚の参照写真から720pを320ミリ秒のチャンクで生成し、重要な主張は、文の途中で下された判断が同じミニターン内に声と顔に現れるということだ。この基準となるのは、クリップのリーダーボードではない。あなたがそれを遮れるかどうかだ。
はっきり言えば、Wan 2.7 は「この場面は動きの中でどのように見えるか」という問いに答える。Griffin は「その人物がちょうど間を置いたことを踏まえて、この顔と声は次の200ミリ秒で何をすべきか」という問いに答える。
価格、それが存在する一方の側では
Wan 2.7の公表レートは生成動画1秒あたりで、料金プランはスイート全体で均一ではなく、これがほとんどの比較ページが見落としているポイントです。
• wan2.7-t2v と wan2.7-i2v — 課金は出力の長さのみに基づきます。インターナショナル(シンガポール):720p で $0.10/秒、1080p で $0.15/秒。これはリーダーボードに表示される $9.00/分という数字です。北京と東京では、同じ作業に対して $0.086/秒 と $0.143/秒 が表示されています。
• wan2.7-r2v(reference-to-video) — 入力動画の長さに基づいて課金され、上限は5秒で、さらに出力分が加算されます。5秒の参照動画を15秒の生成に投入すると、20秒分が課金されます。
• wan2.7-videoedit — 出力のみ課金、入力映像は無料。
その数値のそばには、ライフサイクルに関する2つの事実を並べておくべきです。Alibabaは自社のBailianおよびQwen Cloudの各サーフェスで、2026年9月23日まで実施された期間限定の30%ローンチ割引を提供していましたが、現在は終了しています。また、Alibaba CloudのModel Studioの廃止通知(ID 118434)により、2026年10月10日には、wan2.7-r2vやwan2.7-imageを含む複数の旧モデルがオフラインになります。これは世代全体の廃止ではなくバリアント単位のものですが、wan2.7-t2vとwan2.7-i2vは引き続き掲載されており、有効な料金が表示され、ページは最近では9月11日に更新されています。ただし、reference-to-videoが理由で2.7を検討していたのであれば、そのルートには終了日があります。
Griffin との比較には、正直な一文が一つある。Wan 2.7 の隣に並べる価格は存在しない。Tavus が何も公表していないからだ。Griffin-Lite は Tavus プラットフォーム上にない。発表によれば、現時点で顧客利用には提供されない。同社自身の締めくくりの一文では、Griffin は安全にリリースする方法を確立でき次第登場するとしている。秒単位の料金も、リクエスト単位の料金も、無料枠も、エンタープライズ枠もない。Griffin の価格を挙げている人は、それをでっち上げているだけだ。
品質スコア:基準を満たさない2つのボード
この2つのモデルはまったく異なる評価指標でスコア付けされているため、両者間のElo比較は存在しない。
Wan 2.7はArtificial Analysisのビデオアリーナに2つのエントリーがあり、それらは同じ位置にありません——これが、それについて1つの数値を引用する際の罠です。そこでのEloは、短い生成クリップ向けに構築された方法論である、ブラインドの一対比較による人間の選好投票から導出されており、以下の両方の読み取り値は2026年10月2日に読まれたボードからのものです。
• Wan2.7-260612(6月ビルド)のテキストto動画(音声付き)— 13~14位、4,645票でElo 1,032(±10)、$9.00/分。
• 画像から動画(音声付き)における Wan 2.7(4月ビルド)——34件中12位、4,571票で Elo 1,077、$9.00/分。ほぼ同じ票数を抱えながら、それを実質的により上位に位置づけているボードです。
• Wan 3.0、より新しい兄弟モデル — テキストから動画ではElo 1,157で1位、画像から動画では1,164で6位、いずれも毎分$12.00。Wan 2.7を何かと比較する前に知っておくべき数字はこれだ。アリババ自身の次世代モデルは首位級で、2.7は中位のビルドだ。

Griffinは、NVIDIAが2026年9月に独自に構築し採点した全二重音声視覚会話のベンチマークであるNVIDIAのVideoFDB上に位置する。採点には言語モデルによるジャッジを用い、0~5のルーブリックに基づいて行われた。Griffin-Liteは生成トラックで3.83を記録し、人間の参照値3.92、次に高い公開システムの2.80に対して評価された。また知覚トラックでは3.73を記録し、人間の参照値4.20と比較された。Tavusはさらに、H100上で公開されている4つのストリーミング拡散ベースラインに対して、生成器の真の音声から映像へのレイテンシが0.43秒であると報告している。
どちらの数値も正当だが、どちらもそのまま持ち出せるものではない。アリーナ上のEloはクリップの好みに関する投票数であり、VideoFDBは会話行動に関する審査員のルーブリックスコアである。両者をつなぐ橋はなく、低サンプルの罠は逆方向にも働く。アリーナのWan 2.7に対する±10の幅は、隣接モデルとの位置づけが厳密には確定しないほど広く、NVIDIAの人間に対する0.09ポイントの生成ギャップは、5点満点のルーブリックでは「人間の参照に近い」と読むのが誠実で、「人間レベル」と読むには小さすぎる。知覚の比較も同一条件ではない。Griffinが上に位置づけられているシステムのうち、OpenAIのgpt-realtimeやMiniCPM-o 4.5を含むいくつかは、音声のみの構成で採点されている一方、Griffinは映像も知覚する。0.29ポイントのリードの一部は、目があることによるものである。
それぞれがあなたに求めているもの
ここで比較が役に立ちます。なぜなら、入力が製品そのものだからです。
• 入力 — Wan 2.7はテキスト、画像、動画、音声を受け取ります。Griffinはカメラとマイクを通じて生身の人物を捉え、リクエストに応じてクリップを生成することは一切ありません。
• 出力 — Wan 2.7 は動画ファイルを生成し、1回の生成あたり2~15秒、最大1080p、ネイティブ音声付き。Griffin は継続的な会話を生成する。720pの映像を25 fps、320 msのチャンク単位で、リアルタイムに生成し、デコードされ次第再生する。
• 何がそれを操作するか — Wan 2.7 はプロンプトと、最大5枚の被写体画像および5本の参照クリップによって操作され、1リクエストあたりの参照アセットの上限は10です。Griffin は人の動作によって操作されます。つまり、間、視線をそらすこと、ジェスチャー、遮りです。
• タイムホライズン — Wan 2.7 の作業単位は最長15秒のクリップであり、それをユーザーが組み合わせていく。Griffin の作業単位は会話であり、だからこそこのアーキテクチャは、より長い単一生成を目指して格闘するのではなく、ドリフトを解決しなければならなかった — 自己回帰型ジェネレータへの三段階の蒸留、そして長いロールアウトが安定し続けるよう、自ら生成した履歴で訓練することによって。
• 出力コンテナ — Wan 2.7 は、あなたが所有し、編集・グレーディング・配布できるファイルを返します。Griffin は、レンダリング済みのセッションを返します。編集できるファイルは存在しません。なぜなら、ピクセルは参照写真とモデル自身の履歴からチャンクごとに生成され、背景、影、人物が座る椅子も生成の一部だからです。
名指しする価値のある構造的な違いが一つある。Wan 2.7のコストは出力の尺に応じて増え、その品質はプロンプトがどれだけ具体的かによって決まる。Griffinのコストは測定されておらず、その品質は相手側の人間がどれだけ自然かによって決まる。一方はより良いブリーフを書くことで改善でき、もう一方は実在の人間と使うことでしか改善できない。

リファレンスと一貫性、二つのデザインが衝突する場所
Wan 2.7は提供された参照を通じて被写体の一貫性を制御します。被写体画像5枚、参照クリップ5本、合計10個のアセットです。これは写真的なアプローチです — 被写体がどのように見えるかを示せば、生成全体を通じてその外観を維持します。
Griffinは同じ対象を正反対の方法で制御している。1枚の参照画像から、リアルタイムで全フレームのすべてのピクセルを生成し、発表では顔ではなくシーン全体を制御することが明言されている。すなわち、腕や指、椅子の動き、落とされる影、背後の背景までだ。そこでの一貫性は、環境を合成プレートではなく生成対象にすることで達成されている。
どちらのアプローチも厳密に優れているわけではなく、失敗の仕方が異なります。参照条件付き生成は、長いクリップにおいて与えられた被写体から徐々に逸脱することで失敗します。自己回帰的な履歴を用いたチャンク単位の生成は、ドリフト処理が誤っていると長いセッションで迷走することで失敗します。これはまさに、第3の蒸留段階が防ぐために存在する失敗です。Wan 2.7 は、成果物が特定の人物の特定のルックである場合により安全な選択です。Griffin はそのブリーフを争っているわけではありません。
安全性、来歴、およびリリース態勢
Wan 2.7は、圧縮後も残るウォーターマークに匹敵する公開された来歴システムを備えていない——発表は、音声品質と画面上のテキスト精度を依然として改善が必要な領域として挙げており、これは安全性ではなく忠実性に関する注意点である。
グリフィンの安全性に関する話は逆転している。Tavusがそれをプレビュー版にとどめていると公言している理由は、より優れたインターフェースにしているのと同じ特性が、相手が人間と話していると思い込ませるのにもより優れているということであり、数字がその懸念を裏付けている。同社自身のライブ調査では、54人中26人の参加者が相手を実在の人間だと思ったのに対し、以前のPhoenix-4.5 / Raven-1 / Sparrow-2スタックでは41人中1人だった。疑った参加者は、最初の20秒以内に疑う傾向があった。Tavusは、リリース前にさらなるアラインメントと開示の作業が必要だと述べており、開示機能を構築中で、安全性評価について組織と協力しているという。これがこのモデルについて誰かが公表した最も実質的な内容であり、購入できる製品が存在しない理由でもある。
両者をツールとして比較する人にとって、実用的な帰結は単純だ。一方はオンデマンドで生成でき、今日にでも出荷できる。もう一方は評価対象であり、そのリリースはベンダーがまだ解決していない問題によって門前払いされている。
どちらが、何のために?
• 成果物が映像素材なら、Wan 2.7 を選びましょう。既存の素材への指示ベースの編集は、これがとりわけ強く、とりわけ安価にこなせるワークロードです。編集バリアントは出力のみで課金され、入力映像は無料として扱われるからです。reference-to-video バリアントについては、採用を決める前に10月10日の提供終了と照らし合わせて確認する価値があります。
• 今四半期は、何に対してもGriffinを選ばないでください。選べないからです。人が見分けられるかどうかを知る必要がある場合、またはあなたのロードマップが映像素材レイヤーではなくインタラクションレイヤーに依存している場合は、アクセスを申請してください。
• どちらのモデルではなく、その隔たりに注目しよう。Griffinの登場により、より興味深い比較は未来の比較になる。つまり、会話全体を生成するシステムと、シーン全体を生成するスイートを対比させることだ。その両方を実現する最初の製品こそ、この記事を読み返して照らし合わせる価値のあるものになるだろう。
ルーターが適する場合と、適さない場合
これらのモデルはどちらもOrcaRouterのカタログには含まれていません。このセクションでは、まずその点を明言しておく価値があります。Wan 2.7は、Alibaba自身のプラットフォーム——Alibaba Cloud上のModel StudioおよびQwen Cloud——を通じて、またリリース後に統合したサードパーティのクリエイティブツールを通じて利用できます。Tavus Griffinは、リクエストフォームからのみ利用可能です。どちらかがルーティング可能になれば、プロバイダーの定価で表示されます。
動画パイプラインのうちルーティングの問題になるのは、その周辺にあるテキストの部分です。ショットリスト、プロンプト展開、キャプション生成、品質レビューの要約、そして reference-to-video パスに供給されるトランスクリプトや対話の作業は、すべてテキスト呼び出しであり、それらは OrcaRouter の、200 以上の他のモデルと同じ OpenAI 互換エンドポイント上で実行されますプロバイダーの定価で、0% のマークアップも加えずに。そのためベンダーの値下げは、契約サイクルを経た後ではなく当日に反映されます。安価なモデルを一括処理パスに、フロンティアモデルを最終パスに振り分けることは、そこでは第二のベンダー関係を結ぶことではなく設定変更で済みます——これは、生成レイヤーが呼び出せるものになった時点で、生成レイヤーにも当てはまる同じ論拠です。
注目すべき点は、Wan 2.7スイートの参照版と編集版が、10月10日のModel Studio終了後も変わらず存続するかどうか、そしてGriffinの安全性ゲートが、エンドポイントが記載された公開モデルカードを生み出すかどうかだ。この2つの出来事こそが、この比較を設計論考から調達判断へと変えるものになる。

