
Tavus Griffin vs Kling 3:リアルタイムの会話 対 10秒クリップ
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 223 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
この対決の実像は、ルーティングの非対称性にある。Kling 3は、価格とパラメータ群、そして当社自身のカタログへの掲載を持つ、呼び出し可能なモデルである。Tavus Griffinは、申請フォームの奥にいる選ばれた信頼済みテスター向けのリサーチプレビューであり、2026年10月1日に発表されたが、識別子もエンドポイントも公開レートもない。Kling 3.0はOrcaRouterのカタログにkling/kling-v3として掲載され、1リクエストあたり$0.084、プロバイダの定価がそのまま適用され上乗せは一切ない。Griffinはルーティングできない。それは誰も手をつけていないからではない。モデルが聴きながら320ミリ秒単位で720pを生成するリアルタイム全二重セッションは、リクエスト-レスポンス型の呼び出しではなく、仮にTavusが明日ゲートを開放したとしても同じ枠組みには収まらない。つまりこれは、買い手が価格で決着をつける比較ではない。生成された人間が何のためにあるのか、という問いに対する二つの答えの比較なのだ。
Kling 3.0とは実際に何なのか
Kling 3.0は2026年2月5日、4モデル構成のシリーズとして登場しました — Video 3.0、Video 3.0 Omni、Image 3.0、Image 3.0 Omni。最大の特徴は自動マルチショット・シーケンシングで、モデル自身がショットの切り替えを計画します。カスタムモードではショット数と各ショットの長さを設定でき、レビュアーによれば、1つのプロンプトから最大約6つの異なるショットからなる実用的なシーケンスを生成でき、ショットサイズ、カメラワーク、物語のビートをショットごとに指定できます。1回の生成の上限は15秒、下限は3秒です。OrcaRouter側では、マルチショット、被写体・モーション制御、3〜15秒のクリップ、最大ネイティブ4K(公称)を備えたフラッグシップのテキストtoビデオ/画像toビデオモデルとして、POST /v1/video/generations。
音声は同じパスで、ネイティブに生成される。Kuaishou版は中国語、英語、日本語、韓国語、スペイン語に対応し、1つのクリップ内の混在言語の会話を処理し、複数キャラクターのシーンでは各キャラクターに異なる声を結びつけ、地域アクセントも提供する — アメリカ英語、イギリス英語、インド英語;中国語の東北、北京、台湾、広東、四川。リップシンクの一貫性は、独立系のハンズオンレビューで最も多く指摘される弱点であり、あるテストでは5つの会話クリップのうち約2つがリテイクを要したと報告され、報告されたアーティファクトは、水や風の背景音によって音声がこもる雑音の多い環境での会話周辺に集中している。
グリフィンとは実際に何なのか、1段落で
Griffinは会話モードを備えた動画生成器ではない。それは同時に動作する2つのエンジンである。連続会話モデリングエンジンは、人の音声と映像を取り込み、サブ秒間隔でやり取りを再評価し、そのたびに沈黙するか、合図を送るか、相槌を打つか、ターンを取るかを決定し、タイミング、姿勢、表情、ジェスチャーを伝える表現力豊かな制御信号を出力する — 言葉だけではない。音声視覚生成エンジンは、それらの制御信号を音とピクセルに同時に変換する。自己回帰拡散トランスフォーマーが、エンコードされた話者プレフィックスから一度に1つの潜在チャンクで音声を生成し、数ステップの自己回帰動画生成器が、単一の参照写真から25 fpsで320 msのチャンクで720pを生成する。プロンプトも、クリップの長さも、ファイルも存在しない。音声については、H100上で4つの公開ストリーミング拡散ベースラインに対して0.43秒の真の音声-to-映像レイテンシを報告しており、Tavusはこれを次に速い手法の半分であると説明している。
価格、そして片側のテーブル
Kling 3.0の価格設定は、この記事の中で、比較の両側に具体的な数字があり、かつ片側が空になっている唯一の箇所です。
• OrcaRouter 上の Kling 3.0 — 1リクエストあたり $0.084、プロバイダー定価を 0% のマークアップでそのまま適用そのため、Kuaishou の料金改定やプロモーション割引は、契約サイクルを待たずに同日中にここへ反映されます。
• 独立系アリーナ上の Kling 3.0 — 2026年10月2日時点で確認された音声付きテキスト・トゥ・ビデオのボードには、1080p Proティアが$10.08/分、Omni 1080p Proティアが$8.40/分と記載されている。同じボードは Kling 3.0 の4つのティアを4つの異なる価格で評価しているため、「Kling 3.0の価格」は単一の数値ではない。
• Griffin — 価格はありません。Griffin-Liteは、研究プレビューとして選ばれた一部の信頼できるテスターが利用でき、Tavusプラットフォームには搭載されておらず、その独自の発表によると、現時点では顧客向けには利用できません。リクエスト単位の料金も、秒単位の料金も、無料枠も提示できるものはなく、このモデルが登場するのは、Tavusが安全にリリースする方法を確立した後だけです。
それが価格セクションのすべてであり、コンピュートフットプリントから秒単位の見積もりをでっち上げるより、そこに留めておくほうが誠実だ。
スコアボードは測定対象が異なり、一致しない
両モデルはどちらも、それぞれのベンダー以外の誰かによって、相互に比較できない指標で採点されている。
Kling 3.0はArtificial Analysisのビデオアリーナに登場しており、そこではEloが短いクリップに対する人間のブラインドな一対比較の選好から算出される。同日の2つの読み取り結果は異なる話を語っており、ここに名指しする価値のある罠がある。音声付きテキストから動画のボードではKlingの各ティアは中位に位置する一方、音声付き画像から動画のボードでは大幅に上位に位置する。ただし、Klingの各ティアがすべて両方のボードに現れるわけではない。テキストボードにそもそも掲載されているのはProとOmni Pro 1080pのビルドだけであり、720p Standardティアは画像から動画でスコアされているだけで、ほかではまったくない。
• テキストから動画(音声付き)におけるKling 3.0 — 1080p Proは16位、4,844票でElo 1,000、$10.08/分。Omni 1080p Proは16位、2,741票でElo 987、$6.90/分。2つのティアのうち高価な方のスコアが低く、これはこのボードの他のどこでもティアの広がりが見せているのと同じ「結果なし」だ。
• Kling 3.0のimage-to-video(音声付き)— 1080p Proは18~20位、Elo 1,055(±6)、14,896票、$20.16/分;720p Standardは18~20位、Elo 1,051(±6)、14,692票、$15.60/分;Omni 1080p Proは21~22位、Elo 1,044(±8)、2,945票、$16.80/分;Omni 720p Standardは21~24位、Elo 1,036、$13.44/分。
読み取れるのは、Kling 3.0 は与えられた画像から始めるほうがテキストから始めるよりも強く、image-to-video ボードでは投票数が3倍あるため、そこでの位置づけのほうがより適切に定まっているということだ。それは商用制作の大半が使うモードでもある。4つのティアが何をもたらすかに注目してほしい。image-to-video 内では、1分あたり $13.44 から $20.16 という価格帯にわたり16 Elo ポイントの幅があり、4つのうち最も安いものが最下位ではない。Kling 3.0 に多く支払っても、このボードでの順位は上がらない。

GriffinのスコアはNVIDIAのVideoFDBによるもので、これは全二重の音声視覚会話を2つのトラックで採点し、NVIDIAが公表されたルーブリックに対して独自の審査員を用いて構築・実行したものである。Griffin-Liteは生成で5点中3.83を獲得し、人間の参照は3.92、次に高い公表システムは2.80だった。知覚では4.20の人間参照に対して3.73で、テイクオーバー率の整合性は62.8%と73.8%だった。これらの数字は、クリップが1080pで正しく見えるかどうかについては何も語らないし、KlingのEloは、モデルが文の途中で中断できるかどうかについては何も語らない。どちらも唯一誠実な使い方は、それぞれ自身の問いの内側で使うことだ。
誰も測定していないギャップ:レイテンシー対長さ
ここには、どちらのリーダーボードも捉えていないエンジニアリング上の実際の対照があり、製品を計画している人にとって、この比較で最も役立つものだ。
Kling 3.0 は、範囲が限定された生成において、長さと構造を最適化します。最大15秒、最大約6つの計画されたショット、ショット単位の制御。そのコストは出力時間に比例し、品質はプロンプトの具体性に比例します。ユーザーがまだ話している間は、そのどれも動作しません。そしてそれは欠陥ではなく、このカテゴリーの形なのです。
Griffinは無限セッション内でのレイテンシーを最適化する:320ミリ秒のチャンク、25 fps、毎秒未満の間隔で下される決定、会話に終わりがないため計画すべきクリップはない。そのコストは、それが何であれ、レンダリングされた秒数ではなく会話の長さに比例し、その品質はブリーフではなく相手がどれだけ自然であるかに比例する。自身の履歴で訓練された自己回帰生成器への3段階の蒸留が存在するのは、このアーキテクチャの故障モードが悪いショットではなく長いロールアウトにわたるドリフトであるからにほかならない。
二つを並べて見ると、実際上の帰結は、それらが正反対の方向に失敗するということだ。Kling 3.0は目に見える形で早く失敗する——ギリギリのテイクを数セントで削除して再生成でき、リテイクの予算がワークフローに組み込まれている。Griffinは、報告どおりに機能するなら、目に見えない形で遅く失敗することになる。つまり、見かけどおりのものではないという仕方で。そしてそれが、Tavusがそれを保留している理由だ。
ルーターが本当に役立つ場合とそうでない場合
Kling 3.0はOrcaRouterのカタログにkling/kling-v3として、1リクエストあたり$0.084で掲載されています。同じキー、同じOpenAI互換エンドポイントで、他200以上のモデルと並んでいます。これは、Kuaishouのアカウントを持ち、さらにパイプラインが必要とするテキストモデルごとに個別の連携を用意するのとは、まったく違います。当社はプロバイダー価格に何も上乗せしないため、Kuaishouの料金改定は同日に当社側へ反映されます。また、上流プロバイダーが性能低下やレート制限を起こした場合、アプリケーションにエラーを返すのではなく、レスポンスが始まる前に自動フェイルオーバーがリクエストを移します。1回の呼び出しがテキスト呼び出し千回分よりも高くつき得る動画パイプラインでは、上流の不調な1分間をリクエストが生き延びられることのほうが、支払わずに済んでいるマークアップよりも価値があります。
Griffinは当社のカタログにはなく、誰のカタログにもなく、載ることもできません——全二重セッションモデルはルーティングされるリクエストではないからです。アクセス申請を提出することによってのみ到達できます。Tavus自身が、Griffinではなく旧モデルへと、作り手になろうとする人々を誘導していることが、その証拠です。先行する3モデルは、すでに15万人の開発者と企業が利用しているPALsを動かしており、Griffinはそこに含まれていません。

どちらが、何のために?
• 単一のプロンプトから計画されたマルチショットシーケンスには Kling 3.0 を選び、音声なしのアリーナ順位が強く多くの投票を集めている画像から動画への作業に、5言語にわたるキャラクターごとの音声バインディングを伴う多言語ダイアログに、カメラ移動を通じた要素の一貫性に、そして4Kには、そのティアを書面で確認できる場合に選んでください — Kuaishou 自身のドキュメントはネイティブ4Kを主張していますが、そのユーザーガイドには720pと1080pしか記載されておらず、4Kの第三者クレジット料率は情報源によって2倍以上異なります。
• セリフが主目的なら、まずKling 3.0のリップシンクをテストすべきです。独立系の実機レビューが口を揃えて指摘するように、そこが破綻するポイントであり、最も多くの撮り直しを招く失敗だからです。
• Griffin を前提に計画を立てないでください。1分間の通話で、生成された人間と本物の人間を見分けられるかどうか、あるいはインタラクション層がどこへ向かっているかを知ることが、今クリップ層の上に何を構築すべきかを左右するのかどうか——こうした問いに答える必要があるなら、アクセスを申請してください。
・注視すべきは二つであり、一つではない。Kling側では、ティア間の差が価格と連動し始めるかどうか。というのも、現在4つのティアはimage-to-videoにおいて互いにElo 19ポイント以内に収まっている一方、価格は5割増しで異なっており、しかも最安ティアが最下位というわけではないからだ。Griffin側では、開示の仕組みとモデルカードが登場するかどうか。もし登場すれば、この比較はデザイン論ではなく調達判断になり、この記事は書き直しが必要になる。

