「Gemini Agentic Video Understanding」と表示されたヒーロータイトルカード。バッジには「新機能」、サブタイトルには「動画分析コストを3分の2に削減するAPIモード」と表示されている。3つのチップには「Gemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Liteに適用」「2026年9月1日発表」「処理: エージェンティック」とあり、右下にOrcaRouterのロゴがある。
Guides & Insights

Gemini Agentic Video Understanding が登場: 動画分析コストを3分の2削減するAPIモード

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年9月1日、Googleはエージェント型動画理解をGemini 3.7 Flash、Gemini 3.6 Flash、およびGemini 3.5 Flash-Liteに導入しました。これはGemini APIの新しいモードで、動画をフレームの寄せ集めとしてではなく、検索可能なドキュメントとして扱うものです。シニアプロダクトマネージャーのRohan Doshi氏とリサーチディレクターのMario Lučić氏が執筆したGoogle DeepMindの発表は、Geminiが動画入力に対応して以来、Geminiの動画の読み方に対する初の大きな変更です。モデルは従来のように固定サンプルのフレームを黙々と処理するのではなく、回答の途中で、何を、どの速度で、そして視覚フレーム・音声・文字起こしという3つのチャネルのどれを通して見るのかを決定します。見出しとなる効果は(すべてベンダーによる報告で、まだ独立に再現されてはいませんが)、置き換えられる従来のフレーム単位のベースラインと比べて、動画分析のコストが最大66%削減され、トークン消費量が最大88%減少し、回答の正確さが最大7%向上するというものです。

「エージェンティック」が実際に内部で変えるもの

従来の動作は、{{1}}Google{{/1}}が現在「静的」処理と呼んでいるものです。Geminiに動画を入力すると、一定のレート(デフォルトは毎秒1フレーム)でフレームを抽出し、その抽出した全体をモデルに通して、その固定されたグリッドが捉えた内容から回答します。これには構造上の盲点が2つあります。抽出された2つのフレームの間で発生した状態変化は、モデルにとって存在しないも同然です。また、1 FPSで抽出された2時間の動画は、トークンを莫大に消費しますが、そのほとんどは質問とは無関係の映像に費やされます。

エージェンティックな動画理解は、固定グリッドをループに置き換える。モデルは中核となる推論とネイティブ動画ツールを組み合わせ、何を視聴するか、どの速度で視聴するか、どのモダリティ(視覚フレーム、音声トラック、文字起こし)で検査するかを動的に決定する。内部ツールを呼び出してファイルの関連セグメントだけをロードし、質問に実際に必要な瞬間とシグナルを取得してから、取得した内容に基づいて推論する。Googleはこれを、以前に提供したエージェンティックなビジョン機能と同じアーキテクチャパターンだと説明している。モデルはもはやメディアの受動的な消費者ではなく、メディアをツールのように照会するエージェントなのだ。

実際的な結果として、「モデルは何を見たのか?」という問いは、もはやサンプリングの運次第ではなくなる。一瞬のカット、かろうじて見える欠陥、背景ノイズの中で話された一言についての問いにも、モデルは答えが存在するモダリティにおいて、正確にその時間帯をより高い解像度とレートで再スキャンできるため、答えを出せるのだ。

Generated infographic titled 'Agentic vs static video processing — what changes'. Left column 'Static (before)': 'Fixed 1 FPS frame grid', 'Every frame billable', 'Misses between-frame moments', '2-hour video = millions of tokens'. Right column 'Agentic (now)': 'Model decides what to watch', 'Loads only relevant segments', 'Searches frames + audio + transcript', 'Up to 88% fewer tokens'. Footer: 'All deltas vendor-reported by Google, unreproduced.'

数字は、それが何であるかとしてラベル付けされている。

Google自身のベンチマークにおける、エージェント型処理と静的処理の比較は、この発表の核心であり、外部の第三者による再現が行われるまでは、ベンダーの主張として読むべきである。その内部テストセットでは:

• コスト — モデルが固定のサンプル全体ではなく必要なセグメントのみを読み込むことで、分析コストが最大66%低減されます。

• トークン — トークン消費を最大88%削減。特にロングフォーム動画での効果が大きく、発表では10分のガイドから数時間の録画までが具体的に挙げられている。

• 精度 — 同じタスクで最大7%向上。これは、サブ秒単位のイベントやフレーム間のイベントがサンプリングの隙間に落ちるのではなく、可視化されるようになるためです。

Googleは、Gemini 3.7 Flashがテスト対象モデルの「精度対コストのパレート最前線」に位置するとしている。平たく言えば、この3モデルのうちで1ドルあたりの回答品質が最も高いということだ。また、早期アクセスパートナーとしてPonder、Revyl、Mosaic、Resemble.AIの4社を挙げている。これらの企業は一般提供前にこのモードを活用して開発を進めており、これはスライド上の構想ではなく実際の本番利用を示唆する点である。それらのパートナーの成果は公開されていないため、妥当な見解は次の通りだ。メカニズムは本物であり、方向性は明らかに正しく、具体的な数字は独立した測定が行われるまではGoogleの主張にすぎない。

その機能が構築されたユースケース

この発表では、この能力を4つのカテゴリに分類しており、各カテゴリは開発者がリリースできる具体的なワークロードに対応しています。

• サブ秒単位の瞬間検索 — 1 FPSのグリッドでは完全に見逃してしまう、一瞬の状態変化やタイトなカット境界を正確に特定します。これは自動動画編集のユースケースです:シーンチェンジが発生する正確なフレームを見つけること。

• 長時間動画という干し草の山から針を探す検索 — 数百万トークンを消費せずに、数時間の動画に関する特定の質問に答えること。これが「この3時間の通話を視聴する」と「この3時間の通話でクライアントが契約更新に同意したか」の違いである。

• 異常検知 — このモデルは、注目すべき時間ウィンドウをより高いフレームレートで再サンプリングし、高速な動きや微妙な視覚的アーティファクトを検査します。製造品質管理、スポーツ分析、防犯映像が明らかなターゲットです。

• 動作と物体の計数 — 繰り返される身体の動きや個別の物体を時間経過に沿って追跡すること。静止サンプリングでは、計測対象がサンプルレートより速く動く場合に過小評価される。

どのモデルか、そして価格はいくらか

この機能はFlashティアに搭載されており、3つのモデル間の価格差は、それをどこに向けるかを選ぶ際に重要です。

• Gemini 3.7 Flash — プロモーション料金は100万トークンあたり入力$0.75 / 出力$3.75で、2026年12月31日まで確定しています。その後は倍の$1.50 / $7.50になります。この3つの中で、精度対コストのリーダーです。

Gemini 3.6 Flash — 100万トークンあたり$1.50 / $7.50。3つの中で、安定した非プロモーションのオプションです。

{{1}}Gemini 3.5 Flash-Lite — 100万トークンあたり$0.30 / $2.50。{{/1}}予算重視の選択肢であり、{{2}}とにかくトークン単価の安さが重要な大量の動画トリアージ向けです。{{/2}}

この機能は標準のGemini APIトークン価格を使用し、追加料金は発生しないため、88%のトークン削減はそのままこれらの料金に反映されます。静的分析に100ドルかかっていたワークロードは、同じモデルでのエージェント型処理では、精度向上による効果を考慮する前の段階で、およそ12〜34ドルになるはずです。これは、現在、長い動画の再アップロードやフレームサンプリングによってトークンを消費し続けているパイプラインを運用している人にとって、本当に重要な点です。

オンにする方法

このモードは単一の設定フラグで有効になります。リクエスト内の処理設定で「agentic」を渡すだけで、標準APIと同じ入力と価格で動作します。専用エンドポイントも、新しい課金ディメンションも、特別な割り当て枠もありません。Pythonのパスではgoogle-genai SDKのinteractions APIを使用します。たとえば、モデル「gemini-3.7-flash」に動画とテキストプロンプトを入力として渡します。動画は、呼び出しているサーフェスに応じて、直接アップロード、Cloud Storage URI、公開HTTP URL、またはYouTube URLを使用できます。

ビルドする前に知っておくべき実用的な制約が2つあります。動画ファイルはプラットフォームのサイズ制限の対象となり(Enterprise Agent Platformパスでは、1ファイルあたりおよそ15 MB)、Gemini Enterprise Agent Platformは一般的なコンテナ形式(MP4、MOV、AVI、WebM、WMV、MPEG)をサポートしています。つまり、形式の変換はAPI呼び出しの前に行う必要があり、API呼び出し内で行うわけではありません。

現在の動作場所、そして今後の展開先

公開時点では、エージェント型動画理解は、Google AI StudioのGemini APIおよびGemini Enterprise Agent Platformを通じて、動画アップロードとYouTube動画の両方で利用可能です。これは、開発者およびエンタープライズ向けのサーフェスです。コンシューマー向けの2つの展開が発表されていますが、まだ開始されていません。Geminiアプリでは、まもなくFlashおよびFlash-Liteモデルを対象に全ユーザーへ順次展開される予定で、YouTubeの動画視聴ページにある「Ask YouTube」機能については、Googleは今後数か月以内に提供開始予定としています。この機能を評価中の開発者にとって、APIが現在テストできる現実的な場です。コンシューマー向けサーフェスは、このフレーズを一般に浸透させるための流通戦略にすぎません。

また、注目に値するエコシステムのシグナルもあります。この機能は標準的なAPIモードとして提供されるため、Geminiの動画理解をラップするMCPサーバーやエージェントフレームワークのプロジェクト群——会議分析向けのGenVフレームワーク、動画リサーチ用のMCPパッケージ、そしてこの数か月で登場したGemini動画スキル——は、アーキテクチャを変更することなくこれを採用できます。コスト低下を実現するのは、新しいSDKではなく、モードのアップグレードなのです。

パーセンテージを信じる前に確認すべきこと

発表の中のすべての数値——66%、88%、7%、パレート最前線という主張——は、Googleが自社のテストセットで測定したGoogle自身のものであり、そのいずれも社外で再現されてはいない。方向性に疑いの余地はない。関連するセグメントのみを読み込むエージェント型ループが、すべてを読み込む固定グリッドに勝てないはずがないからだ。疑問なのはその規模であり、ワークロードによって異なる——単一の質問を伴う2分のクリップでは、スキップすべきものが多くないため88%のトークン削減は見込めない。一方、的を絞った質問が1つある3時間の通話では、その削減が見込める。正しいテストとは、自分の長尺動画を、静的処理とエージェント型処理の両方で、同じモデル上で一度ずつ実行し、実際のトークンと実際のコストを数えることだ。

Screenshot of the Artificial Analysis model page for Gemini 3.7 Flash at high reasoning, showing an Intelligence Index of 56 (ranked #20 of 187 models), an output speed of 285 tokens per second in the high-reasoning configuration, and a price of $0.75 per 1M input and $3.75 per 1M output tokens.

このテストの経済性は、まさにルーティングレイヤーが存在価値を発揮する場面です。この機能が適用される3つのモデルのうち2つ(Gemini 3.6 FlashとGemini 3.5 Flash-Lite)は、OrcaRouter上でGoogleのリスト価格を0%マークアップでそのまま適用した価格で提供されます。そのため、動画分析の値下げは、Google側で実施された当日に当社側でも有効になります。3つ目で最新のGemini 3.7 Flashは、Google自身のAPIおよび複数のサードパーティプラットフォームから利用できます。エージェント型の動画理解はリリースされたばかりの機能であり、実世界での性能差は未検証のため、自動フェイルオーバーの典型的なユースケースです。動画トラフィックの一部をエージェントモードに振り向け、エラー、レート制限、明らかな品質低下が発生した場合には、ルーターが実績のあるモデルにフォールバックし、新しいモードがトラフィックを獲得するに値するようになるまで、ベースラインの経路を稼働させ続けます。

Screenshot of the OrcaRouter model page for google/gemini-3.6-flash showing a 1M-token context window, $1.50 per 1M input and $7.50 per 1M output tokens, and Vision/Audio/Video/Tools/Reasoning capability chips.

この変更は単なる機能追加ではありません。動画は2年間、扱いにくいマルチモーダル入力であり続けました——非常に表現力豊かでありながら、分析コストは非常に高く、実質的にはサンプリング損失を伴って読み取られていました。エージェント型動画理解は、これら3つの問題すべてにGoogleが初めて本気で取り組んだ回答であり、フラッグシップではなくモデルラインの最安値帯に導入されます。トークン費用を理由に動画ワークロードを避けてきたチームにとって、このモードは今日、計算をやり直す価値があります。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube