
Tavus Griffin 対 Google Veo 3.1:一方は全フレームに電子透かしを入れ、もう一方は部屋の48%を騙した
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 223 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
並べてみると、Tavus GriffinとGoogle Veo 3.1の従来型の比較——1秒あたりの価格、Elo、クリップの長さ——は即座に崩れてしまう。なぜなら、価格が設定されているのはそのうちの一方だけであり、買い手が調べられる指標でスコアが付けられているのも一方だけだからだ。しかしその根底には実際の軸があり、それは品質ではない。合成メディアに対するGoogleの答えは、それを検出可能にすることだ。Veo 3.1の出力にはすべてSynthIDが埋め込まれている。これはピクセルにフレーム単位で、そして音声スペクトルに書き込まれる不可視のウォーターマークであり、加えてファイルの来歴を記録するC2PA Content Credentialsも付随する。さらにGoogleはGeminiアプリに検出器を搭載したので、ユーザーはあるクリップをGoogle AIが作ったのかどうかを尋ねることができる。Tavus Griffinが製品としてではなくプレビューとして存在する理由として挙げられているのは、その裏返しだ。Tavus自身のライブ調査では、54人の参加者のうち26人が、1分間のビデオ通話を終えた時点で相手が実在の人物だと信じていた。これに対し、同社の以前のスタックでは41人中1人だった。Tavusは、自分が何であるかを開示する方法を確立するまで、このモデルを控えていると述べている。このベンダーの一方は検出を売っている。もう一方は現在、検出が重要となる理由そのものであり、そしてそのことを自覚している。
正反対の前提に基づいて作られた2つの製品
Veo 3.1は、意図的に狭い範囲に限定されたクリップ生成ツールです。GoogleのGemini APIでは、1回の生成で4秒、6秒、または8秒のクリップを24 fpsで生成し、ネイティブでは720pです。1080pと4Kは、2026年1月のアップデートで追加されたアップスケーリング処理によって提供されます。延長は1回につき7秒を追加し、最大20回まで繰り返せるため、理論上の上限は約148秒ですが、入力はVeoが生成したクリップで、最大141秒、720p、16:9または9:16でなければならず、また8秒の長さは、延長、参照画像入力、および720pを超えるすべての場合に必須です。4秒の1080pクリップは作成できません。出力はあなたが所有するファイルで、透かしが入り、署名付きの来歴記録が添付されています。
Griffinはファイルを生成しない。会話を実行する。Continuous Conversational Modelingエンジンは音声と映像を取り込み、1秒未満の間隔でやり取りを再評価し、沈黙を保つか、合図を送るか、あいづちを打つか、発話権を取るかを選び、ストリーミング音声生成器とストリーミング映像生成器を同時に駆動する表現制御信号を出力する。映像生成器は、1枚の参照写真から25 fpsで、一度に1つの潜在変数ずつ、320ミリ秒のチャンク単位で720pを生成し、各チャンクをデコードしながら再生する。クリップが存在しないのだから、クリップの長さも存在しない。誰かが話すのをやめるまで続くセッションがある。
その違いが、この比較におけるほぼすべての他の項目を左右している。Veo 3.1の許容範囲は、制作パイプラインが計画を立てる際に前提にできる一連の制約だ——8秒単位のショットリスト、より長いテイクのための延長ラダー、固定の24 fps、既知の解像度ラダー。Griffinの出力は、事前に絵コンテ化できるものではまったくない。なぜなら、それがレンダリングする内容は、次に人が何をするかに依存するからだ。
Veo 3.1の料金、全プラン別
Googleが公開しているGemini APIの料金は音声込みで、出力1秒あたりであり、Veo 3.1のどのレベルにも無料枠はありません。そのAPIでは音声を無効にできません — リクエストごとに生成されます — これは重要です。なぜなら、第三者の情報源が、無音動画が音声込みの金額のおよそ半額になるVertex AIの料金表について述べているからです。Google自身のドキュメントでは、その切り替えは公開されていません。無音の料金が請求に影響するなら、このページを含む比較ページではなく、ご自身のVertexの請求で確認してください。
• Veo 3.1 Standard — 720pおよび1080pで$0.40/秒、4Kで$0.60/秒。
• Veo 3.1 Fast — 720pで毎秒$0.10、1080pで毎秒$0.12、4Kで毎秒$0.30。
• Veo 3.1 Lite — 720pで$0.05/秒、1080pで$0.08/秒、4Kティアはなし。
8秒ルールをこれらの料金に当てはめると、クリエイティブチームが実際に予算計上するのは試行あたりのコストだ。Standardで8秒の1080pテイクが32セント、同じ解像度で4秒のものが80セントなのは、720p未満には8秒の下限が適用されないからであり、8秒の4Kテイク1本は4.80ドルだ。最後の数字こそ、じっくり向き合うべきものだ。使える4Kショット1本を求めて4回試行すると20ドル弱になり、しかも8秒という要件があるため、同じアイデアを半分の尺で試して半額にするわけにはいかない。
Griffinには価格も、無料プランも、いかなる種類の料金表もない。Griffin-Liteは、申し込みフォームを通じて選ばれた信頼できるテスターが研究プレビューとして利用できるもので、Tavusプラットフォーム上にはなく、現時点では顧客利用には提供されないことが発表で明言されている。Tavusのページの締めくくりの一文は、同社が安全にリリースする方法を確立した時点でGriffinが登場するというものだ。購入判断に類するあらゆる点で両者を比較する本記事のどの主張にも、Griffin側の半分に穴があり、どれだけ調べてもそれを埋めることはできない。
2つのスコアボードが実際に測定しているもの
この2つのモデルが異なる指標によって評価されているのは、それらを相互に価格付けするのが難しいのと同じ理由による。
Veo 3.1はArtificial Analysisのビデオアリーナに登場しており、そこでのEloは短いクリップに対する人間のブラインドな一対比較の選好から算出されます。2026年10月2日時点の、音声付きテキスト・トゥ・ビデオボードでご覧ください:
• Veo 3.1 — 第18~21位、2,857票でElo 968(±11)、1分あたり24.00ドル。
• Veo 3.1 Fast — 18~21位、Elo 961(±10)、3,595票以上、$7.20/分。
• Veo 3.1 Lite — 21~24位、2,762票でElo 949(±11)、$4.80/分。 • 画像から動画(音声付き)でのVeo 3.1 — 34件中11位、7,049票でElo 1,082、$24.00/分。これは、どのボードでも最高の順位であり、最も多くの票を集めたものです。
そこから2つのことが導かれる。3つのティアはすべて、互いに19 Eloポイント以内に収まり、信頼区間も重なっている。したがって、標準ティアの秒あたり4倍の価格は、測定可能なブラインドでの選好をもたらすことはない。そして、Google自身の新しいGemini Omni Flashラインは、同じボード上でVeo 3.1のどのティアよりも上位に位置する——7,801票でElo 1,117の7~8位、$9.12/分で、3つのティアすべてを上回りながら、1分あたりのコストは4分の1から5分の1だ——これはVeo 3.1の購入者なら誰もが問うべき疑問であり、この記事が答える場所ではない疑問だ。
Griffinの数値はNVIDIAのVideoFDBに由来する。これはNVIDIAが2026年9月に独自に構築し採点した、全二重の音声・視覚会話のためのベンチマークだ。Griffin-Liteは生成トラックで5点満点中3.83を記録し、これは人間の参照値3.92、および公開されている中で次に高いシステムの2.80に対するもの。知覚トラックでは人間の参照値4.20に対して3.73だった。Tavusはまた、H100上で公開されている4つのストリーミング拡散ベースラインに対する生成器の真の音声-to-映像レイテンシが0.43秒であると報告しており、これを次に速いものの半分だと説明している。
どちらの評価結果も、そのまま他方に移し替えられるものではない。短いクリップの好み投票から得られるEloは、モデルが割り込み可能かどうかについては何も語らないし、会話に対する審査員のルーブリックスコアも、クリップが4Kで正しく見えるかどうかについては何も語らない。しかも、この注意点は双方向に当てはまる。Griffinの人間の参照との0.09ポイント差は、言語モデルが判定する5点満点のルーブリックでは、「近い」と読むのが正直なところだと言えるほど小さい。そして、その知覚面での優位性の一部は、映像入力をまったく使わずに動作するシステムと比較して測定されている。

プロヴェナンス、それこそが真の製品差別化要因
何らかの開示義務を負う事業者にとって、重要なのはこのセクションだけであり、しかもその差は歴然としている。
Veo 3.1の出力は、ピクセル内および音声スペクトル内にフレームごとにSynthIDを保持しており、圧縮、リサイズ、切り抜き、画面録画に耐えるように設計されている。また、C2PA Content Credentialsはファイルの出所と編集履歴を記録し、AdobeやMicrosoftの実装と相互運用可能である。Googleは検出機能をGeminiアプリに搭載済みで、ユーザーは動画をアップロードし、それがGoogle AIによって作成されたものかどうかを尋ねることができ、検出機能は音声トラックまたは映像トラックのどの区間にマークが含まれていたかを報告する。この限界は現実のものであり、明言する価値がある。その検出器はGoogleのモデルのみを認識する。AlibabaやKuaishouの製品ラインアップに匹敵するものはなく、Tavusのものも同様である。

TavusはGriffin向けのウォーターマーク、検出器、コンテンツクレデンシャルのパイプラインを公開していない。公開しているのは、それが必要である理由だ。対面調査は、この失敗モードについて異例なほど率直だ。参加者の半数以上が、通話中にAIの可能性は頭に浮かばなかったと述べ、そのグループのほぼ全員が相手は本物だと結論づけ、疑った人々は最初の20秒以内にそれを見抜く傾向があった。信じた人の自信は平均79%、疑った人は81%だった。これは、その欺瞞性が生成品質の副作用ではないモデルだ — それ自体が生成品質なのだ。
タバスの回答は脚注ではなく発表の中にある。自然なコミュニケーションのための強力なインターフェースとしてHuman Interaction Modelsを機能させるのと同じ特性が、人間を欺いてAIではないと信じ込ませることを可能にする。安全なリリースには、さらなるアラインメントと安全手順が必要であり、同社は安全な開示機能に取り組んでおり、AIの安全性に取り組む組織とも協力している。だからこそゲートが存在する。Griffin-Liteは現時点では顧客向けに利用できない。
Googleがもたらし、Tavusがもたらさないエンタープライズ条件
Veo 3.1 は Vertex AI を通じて提供され、それに伴うリージョン別インフラストラクチャ、IAM、エンタープライズ契約の枠組みを備えています。さらに Google は、管轄区域ごとにモデルの動作を制約しています。人物生成パラメータを通じて、EU、英国、スイス、MENA では成人の被写体のみを許可する一方、その他の地域ではすべてを許可できます。これは文書化された地域対応のポリシー適用範囲であり、規制対象のバイヤーにとっては、リーダーボード上の順位を上回る要素になり得ます。
その形にはコストが伴う。Gemini API 上の Veo 3.1 のモデル ID は依然としてプレビュー ID だ——veo-3.1-generate-preview とその同類——一方、Vertex SKU は一般提供(GA)の命名を採用しており、第三者による報告ではプレビュークォータは本番クォータのおよそ5分の1とされている。Google は古い Veo 3.0 SKU を2026年6月30日に廃止した。これは世代交代がどのように扱われるかを示しており、プレビュー ID 上に構築するものにはこれを価格に織り込む価値がある。コンシューマー向けの提供面も、実際に大きく制限されている。Flow には Google AI Pro または Ultra のサブスクリプションが必要で、EU、英国、インド、インドネシア、中国本土、ロシアではブロックされており、VPN による回避策も提供されていない。
Griffinには読むべき利用規約がありません。なぜなら、サービスが存在しないからです。アクセスはリクエストフォームと研究プレビューです。Tavusは、安全性組織と協力して評価に取り組んでおり、人々にそれらへ参加してほしいと述べています。これは商業的というよりも研究的な姿勢です。
どちらかを手に入れる
Veo 3.1は、Gemini API、Vertex AI、Google AI Studio、Flowを通じて、またGeminiアプリでは720pのみで利用できます。中国以外では、キーを取得するという点で2つのうち圧倒的に容易なほうであり、これは上記の品質に関する主張に反する材料となり、数字にもかかわらずこの比較が興味深いものにとどまる主な理由です。
Griffinはアクセスリクエストを提出し、信頼されたテスターとして選ばれることで利用可能になります。それが調達経路のすべてです。
Veoのパイプラインでルーターが本当に役立つのは、動画モデルの中ではなく、その隣接部分です。Googleのテキストモデル——Gemini 3.5 Flash、Gemini 3.1 Pro Preview、Gemini 3.6 Flash、そして同シリーズのその他のモデル——はOrcaRouterのカタログに揃っており、200以上もの他のモデルと同じOpenAI互換エンドポイントから呼び出せますプロバイダーの定価で、マークアップは0%。ショットリスト、プロンプトの展開、キャプション生成、8秒セグメント間の連続性メモ、レビューの要約はいずれもテキスト作業であり、大量処理には安価なモデルを、最終仕上げにはフロンティアモデルを充てられることが、移行ではなく設定変更だけで済むのは、まさにこの層です。Veo 3.1自体は当社ではルーティングしておらず、Griffinも同様です。このような段落でそうではないかのように匂わせるのではなく、その点ははっきり明言しておく価値があります。
正直どっち
• 成果物に来歴の追跡記録が必要なとき、購入者が規制業種のとき、配布が認証情報を添付したファイルでなければならないとき、または4Kが譲れない条件のときは、Veo 3.1を選びましょう。どのコストモデルでも8秒という下限を見込んでおき、それに依存する顧客向けの導線を構築する前にプレビューIDのライフサイクルを確認してください。
• Griffinを選んではいけません。選べないからです。人が1分間の通話でAIと人間を見分けられるかどうかが疑問なら、またはクリップ層にロードマップをコミットする前にインタラクション層がどこへ向かうのかを知る必要があるなら、アクセスをリクエストしてください。
• デモではなく検出器に注目せよ。Tavusが日常会話でも通用する開示メカニズムを公開すれば、この2社の差はかなり縮まる。もし公開しなければ、Griffinは引用に値する成果であり、Veo 3.1はこの2社のうちコンプライアンスチームの前に出せる唯一のものとして残る。

