英雄標題卡片上寫著「Gemini Agentic Video Understanding」,帶有「新功能」徽章,副標題為「可將影片分析成本降低三分之二的 API 模式」,三個標籤分別為「適用於 Gemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Lite」、「2026 年 9 月 1 日發布」、「處理方式:agentic」,右下角為 OrcaRouter 標誌。
Guides & Insights

Gemini 代理式影片理解正式登場:API 模式將影片分析成本降低三分之二

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026年9月1日,Google 推出了代理式影片理解功能,適用於 Gemini 3.7 Flash、Gemini 3.6 FlashGemini 3.5 Flash-Lite——這是 Gemini API 中的一種新模式,它不再將影片視為一堆影格,而是開始將其視為可搜尋的文件。Google DeepMind 的公告,由資深產品經理 Rohan Doshi 和研究主任 Mario Lučić 撰寫,是自這些模型開始支援影片輸入以來,Gemini 讀取影片方式的首項重大變革:模型不再默默消化固定抽樣的一組影格,而是會在回答途中自行決定要看什麼、以什麼速度看,以及透過三個管道中的哪一個——視覺影格、音訊或逐字稿。最引人注目的效果——全部皆由廠商宣稱,且尚未經獨立複現——是影片分析成本降低最多 66%,Token 消耗減少最多 88%,且回答準確度比它所取代的逐影格基準提升最多 7%。

「agentic」在底層實際上改變了什麼

舊行為正是Google現在所稱的「靜態」處理:將影片餵給Gemini,它會以固定速率取樣影格——預設為每秒一格——把整個樣本送入模型,再根據那個固定網格捕捉到的內容給出答案。這有兩個結構性盲點。發生在兩個取樣影格之間的狀態變化,對模型來說根本不存在。此外,一部兩小時的影片以1 FPS取樣,會消耗巨額token,而其中大部分都花在與問題無關的畫面素材上。

{{1}}代理式影片理解以迴圈取代固定網格。模型將其核心推理與原生影片工具配對,使其能夠動態決定要看什麼、以何種速度觀看,以及透過哪種模態來檢視——視覺畫格、音訊軌道或逐字稿。它呼叫內部工具,僅載入檔案中相關的片段,擷取問題實際所需的時刻與訊號,然後對所提取的內容進行推理。{{2}}Google 形容這與其先前推出的代理式視覺功能採用相同的架構模式:模型不再是被動的媒體消費者;它是一個將媒體當作工具來查詢的代理。{{/2}}{{/1}}

實際的結果是,「模型看到了什麼?」不再取決於抽樣運氣。關於一閃而過的畫面、幾乎看不見的缺陷,或是在背景噪音下說出的一個詞,這類問題都能找到答案,因為模型可以重新掃描確切的時間窗口,以更高的解析度和幀率,在答案所在的模態中進行檢視。

Generated infographic titled 'Agentic vs static video processing — what changes'. Left column 'Static (before)': 'Fixed 1 FPS frame grid', 'Every frame billable', 'Misses between-frame moments', '2-hour video = millions of tokens'. Right column 'Agentic (now)': 'Model decides what to watch', 'Loads only relevant segments', 'Searches frames + audio + transcript', 'Up to 88% fewer tokens'. Footer: 'All deltas vendor-reported by Google, unreproduced.'

這些數字,按其所是來標記

Google 自家的代理式(agentic)與靜態處理基準比較,是這項公告的核心,在外部單位重現之前,應將其視為廠商的說法。在其內部測試集上:

• 成本 — 分析成本最高可降低 66%,因為模型僅載入所需區段,而非整個固定樣本。

• Token — 最高可降低 88% 的 token 消耗,其中以長格式影片的節省最為顯著:該公告特別點名從 10 分鐘的指南到長達數小時的錄影。

• 準確度 — 在相同任務上提升多達 7%,因為亞秒級與幀間事件變得可見,不再落入取樣間隙之中。

Google 將 Gemini 3.7 Flash 定位於受測模型「準確度對成本柏拉圖前緣」(accuracy-to-cost Pareto frontier)之上——說白話點,就是三者中每一塊錢能換到的最佳答案。Google 也點名了四個早期存取合作夥伴——Ponder、Revyl、Mosaic 和 Resemble.AI——他們在正式推出前就已基於該模型進行開發,這種細節顯示的是真實的生產運用,而非只是投影片上的內容。這些合作夥伴的成果皆未公開,因此可信的立場是:機制為真、方向明顯正確,而具體的百分比在獨立驗證之前,都僅是 Google 的說法。

此功能所支援的使用案例

該公告將這些能力分為四大類別,每一類別都對應到開發人員可以交付的具體工作負載:

• 亞秒級瞬間檢索 — 精確定位瞬間的狀態變化和緊密的剪接點,而 1 FPS 的取樣網格完全遺漏了這些。這是自動化影片剪輯的應用場景:找出場景切換發生的確切幀。

• 長影片中的大海撈針搜尋 — 針對數小時影片中的特定問題給出答案,無需消耗數百萬個 token。這正是「看完這通 3 小時的通話」與「客戶是否在這次 3 小時通話中同意續約」之間的區別。

• 異常偵測 — 模型會以較高的幀率重新取樣感興趣的時間視窗,以檢查快速動作與細微的視覺偽影。製造業品管、運動分析和安全監控畫面是顯而易見的應用目標。

• 計算動作與物件 — 追蹤重複的實體動作與不同物件隨時間的變化;當被計算的物體移動速度快於取樣率時,靜態取樣會低估其數量。

哪些型號,以及它們的價格是多少

此功能隨附於 Flash 方案,而三個型號之間的價格差異,對於決定要將它指向何處至關重要:

Gemini 3.7 Flash — 每百萬個代幣的促銷費率為輸入 $0.75 / 輸出 $3.75,已確認持續至 2026 年 12 月 31 日,之後將翻倍為 $1.50 / $7.50。在三者中,它是精確度與成本比的領先者。

Gemini 3.6 Flash — 每百萬個Token 1.50美元 / 7.50美元。這是三者中穩定、非促銷的選項。

Gemini 3.5 Flash-Lite — 每百萬個 token 需 $0.30 / $2.50。預算路線,適用於大量影片分類,此時最便宜的 token 才是重點。

由於該功能使用標準的 Gemini API token 定價,且不另行收費,因此 88% 的 token 減量直接反映在這些費率上。原本靜態分析需花費 100 美元的工作負載,在相同模型上採用代理式處理後,大約只需 12 至 34 美元,這還不包含任何準確度提升——對於目前管線在重新上傳或對長影片進行幀採樣時持續消耗 token 的人來說,這才是真正的重點。

如何開啟

此模式透過單一設定旗標即可啟用——在請求中傳遞 processing "agentic"——且它與標準 API 使用相同的輸入和定價。不需要單獨的端點、沒有新的計費維度、也沒有特殊配額。Python 路徑使用 google-genai SDK 的 interactions API,例如以模型「gemini-3.7-flash」以及影片加文字提示作為輸入;影片可以是直接上傳、Cloud Storage URI、公開 HTTP URL 或 YouTube URL,取決於您呼叫的介面。

在開始建置之前,有兩個實務限制值得先了解:影片檔案須遵守平台的大小限制(在 Enterprise Agent Platform 路徑上,每個檔案約為 15 MB),而 Gemini Enterprise Agent Platform 支援常見的容器格式 — MP4、MOV、AVI、WebM、WMV、MPEG — 因此格式的處理發生在 API 呼叫之前,而非在呼叫之中。

它目前運行的位置,以及它未來的方向

在推出時,代理式影片理解功能可透過 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent Platform,用於影片上傳和 YouTube 影片——這就是開發者與企業端的介面。目前已宣布兩項消費者端 rollout,但尚未上線:Gemini 應用程式,即將在 Flash 和 Flash-Lite 模型中向所有使用者推出;以及 YouTube 影片觀看頁面上的「Ask YouTube」功能,Google 表示將在未來幾個月內推出。對於評估此功能的開發者來說,API 是今天測試的真正所在;消費者端介面則是一場讓這個詞彙普及化的通路策略。

還有一個值得注意的生態系統訊號:由於此能力以標準 API 模式提供,那些封裝 Gemini 影片理解能力的 MCP-server 與 agent-framework 專案——包括用於會議分析的 GenV 框架、影片研究 MCP 套件,以及過去幾個月出現的 Gemini 影片技能——都能在不改變其架構的情況下採用。解鎖成本下降的關鍵是模式升級,而非新的 SDK。

在相信百分比之前,你應該驗證什麼

公告中的每個數字——66%、88%、7%、Pareto 前沿的說法——都是 Google 自己的數據,在 Google 自己的測試集上測得,而且沒有任何一項在 Google 之外被重現。方向沒有疑問:一個只載入相關片段的代理迴圈,必然勝過一個載入所有內容的固定網格。幅度才是未解的問題,而且會因工作負載而異——一段 2 分鐘的影片搭配單一問題,不會看到 88% 的 token 節省,因為沒有多少內容可跳過;一段 3 小時的通話搭配一個針對性問題,就會看到。正確的測試是你自己的長影片,在同一模型上,先以靜態處理跑一次,再以代理式處理跑一次,計算真實的 token 與真實的花費。

Screenshot of the Artificial Analysis model page for Gemini 3.7 Flash at high reasoning, showing an Intelligence Index of 56 (ranked #20 of 187 models), an output speed of 285 tokens per second in the high-reasoning configuration, and a price of $0.75 per 1M input and $3.75 per 1M output tokens.

這項測試的經濟效益,正是路由層證明自身價值的所在。{{1}}Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite(此功能適用的三款模型中的兩款)在 OrcaRouter 上以 Google 定價零加價直接提供{{/1}},因此影片分析降價在 Google 上線當天,我方即同步生效;{{2}}Gemini 3.7 Flash 為最新推出的第三款,可透過 Google 自家的 API 及多個第三方平台取得{{/2}}。由於代理式影片理解是剛發布的能力,其實際應用成效尚未獲得驗證,因此正是自動故障轉移的教科書級案例:{{3}}將一部分影片流量導向代理模式,讓路由器在遭遇錯誤、速率限制或明顯品質衰退時自動回退至經實證的模型,同時維持基準路徑持續運作,直到新模式證明自己能承擔流量為止{{/3}}。

Screenshot of the OrcaRouter model page for google/gemini-3.6-flash showing a 1M-token context window, $1.50 per 1M input and $7.50 per 1M output tokens, and Vision/Audio/Video/Tools/Reasoning capability chips.

這項變革不僅僅是新增功能。兩年來,影片一直是多模態輸入中最棘手的一環——表現力極其豐富,分析成本極其高昂,而且實際上是以取樣損失的方式被讀取。代理式影片理解是Google首次同時正面回應這三個問題的答案,而且它落在其模型系列中最便宜的層級,而非旗艦級。對於那些一直因為token帳單而避開影片工作負載的團隊來說,今天值得重新算一筆帳。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube