主视觉标题卡片上写着“Gemini 智能体视频理解”,配有“新能力”徽章,副标题为“可将视频分析成本降低三分之二的 API 模式”;三个标签分别显示“适用于 Gemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Lite”、“2026 年 9 月 1 日发布”、“处理方式:智能体”;右下角为 OrcaRouter 标志。
Guides & Insights

Gemini 智能体视频理解正式上线:API 模式将视频分析成本降低三分之二

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年9月1日,Google 推出了智能体视频理解,适用于 Gemini 3.7 Flash、Gemini 3.6 FlashGemini 3.5 Flash-Lite——这是 Gemini API 中的一个新模式,它不再将视频视为一堆帧,而是将其视为可搜索的文档。Google DeepMind 的公告由高级产品经理 Rohan Doshi 和研究总监 Mario Lučić 撰写,是自模型首次获得视频输入能力以来,对 Gemini 读取视频方式的首个重大改变:现在,模型不再默默地处理固定的帧样本,而是在回答过程中自行决定要看什么、以何种速度看、以及通过三种渠道中的哪一种——视觉帧、音频或文字记录——来观看。最引人瞩目的效果(全部由供应商报告,且均未被独立复现)是:视频分析成本最高降低 66%,token 消耗最多减少 88%,回答准确率比它所取代的逐帧基线最高提升 7%。

“agentic”到底在底层改变了什么

旧行为就是谷歌现在所称的{{1}}“静态”处理{{/1}}:将视频输入Gemini,它会以固定速率采样帧——默认是每秒一帧——将整个样本送入模型,然后根据该固定网格捕捉到的内容作答。这有两个结构性盲点。对于模型来说,发生在两个采样帧之间的状态变化根本不存在。而且,以1 FPS对两小时视频进行采样,会消耗大量token,其中大部分都花在了与问题无关的画面内容上。

智能体视频理解以循环取代固定的网格。模型将其核心推理与原生视频工具相结合,使其能够动态决定观看什么、以什么速度观看,以及通过哪种模态进行检查——视觉帧、音轨或转录文本。它调用内部工具,仅加载文件中相关的片段,获取问题真正需要的时刻和信号,然后对所提取的内容进行推理。谷歌将其描述为与早前推出的智能体视觉功能相同的架构模式:模型不再是媒体的被动消费者,而是将媒体当作工具来查询的智能体。

实际结果是,“模型看到了什么?”不再取决于采样的运气。关于瞬间剪切、几乎不可见的缺陷或在背景噪声中说出的词语,之所以能够回答,是因为模型可以以更高的分辨率和速率重新扫描精确的时间窗口,在答案所在的模态中进行。

Generated infographic titled 'Agentic vs static video processing — what changes'. Left column 'Static (before)': 'Fixed 1 FPS frame grid', 'Every frame billable', 'Misses between-frame moments', '2-hour video = millions of tokens'. Right column 'Agentic (now)': 'Model decides what to watch', 'Loads only relevant segments', 'Searches frames + audio + transcript', 'Up to 88% fewer tokens'. Footer: 'All deltas vendor-reported by Google, unreproduced.'

这些数字,按其真实身份标注。

谷歌自身的关于智能体处理与静态处理的基准比较是该公告的核心,在外部方复现之前,应将其视为供应商声明。在其内部测试集上:

• 成本 — 分析成本最高可降低66%,因为模型只加载所需的部分,而不是整个固定样本。

• Token — Token 消耗最高可降低 88%,其中长视频的节省最为显著:公告特别提到了从 10 分钟指南到数小时录制的内容。

• 准确性 — 在相同任务上最高提升7%,因为亚秒级和帧间事件变得可见,而不会落入采样间隙中。

Google将Gemini 3.7 Flash定位为处于所测模型的“精度-成本帕累托前沿”——通俗地说,就是三者中每一美元能获得的最佳答案。它还列出了四家早期接入合作伙伴——Ponder、Revyl、Mosaic和Resemble.AI——他们在大众可用之前就已基于该模式进行构建,这种细节表明其背后是真实的生产应用,而非演示文稿。这些合作伙伴的结果均未公开,因此可信的立场是:机制是真实的,方向显然是正确的,具体百分比在独立验证之前仍是Google单方面的说法。

该功能所针对的使用场景

该公告将这一能力分为四个类别,每个类别对应开发者可以交付的一种具体工作负载:

• 亚秒级时刻检索——精确定位1 FPS网格完全无法捕捉的瞬间状态变化和紧凑剪切边界。这正是自动视频剪辑的应用场景:找到场景变化发生的精确帧。

• 长视频"大海捞针"式搜索——在不消耗数百万token的情况下,回答关于数小时视频的具体问题。这就是"观看这3小时通话"与"客户在这3小时通话中是否同意续约"之间的区别。

• 异常检测——模型以更高的帧率对感兴趣的时间窗口进行重采样,以检查快速运动和细微的视觉伪影。制造业质检、体育分析和安防监控录像显然是主要应用场景。

• 对动作和物体进行计数 — 随时间跟踪重复的物理运动和不同的物体,当被计数物体移动速度快于采样率时,静态采样会低估其数量。

有哪些型号,价格是多少

该功能基于 Flash 层级,而三个型号之间的价格差异对于决定将其指向何处至关重要:

• Gemini 3.7 Flash — 输入每百万 tokens $0.75 / 输出 $3.75(促销价),确认有效期至2026年12月31日,之后翻倍至 $1.50 / $7.50。三者中准确度与成本比领先者。

{{1}}• Gemini 3.6 Flash — 每百万 token 售价 $1.50 / $7.50。这是三者中稳定、非促销的选择。{{/1}}

Gemini 3.5 Flash-Lite — 每百万 token 仅需 $0.30 / $2.50。预算之选,专为大规模视频筛选而生,此时最便宜的 token 才是关键所在。

由于该功能使用标准 Gemini API token 定价,且不收取额外费用,因此 88% 的 token 缩减直接体现在这些费率上。在相同模型下,原本静态分析需花费 100 美元的工作负载,在智能体处理下大约只需 12 至 34 美元,这还未考虑准确性提升——对于那些当前管线因重新上传或对长视频进行帧采样而消耗大量 token 的团队来说,这才是真正的重点。

如何打开它?

该模式通过一个配置标志即可启用——在请求中传递 processing "agentic"——并且它与标准API使用相同的输入和定价。无需单独的端点,没有新的计费维度,也没有特殊配额。Python路径使用google-genai SDK的interactions API,例如使用模型"gemini-3.7-flash",输入为视频加文本提示词;视频可以是直接上传、Cloud Storage URI、公共HTTP URL或YouTube URL,具体取决于您所调用的接口表面。

在开始构建之前,有两个实用的限制值得了解:视频文件受平台的大小限制(在 Enterprise Agent Platform 路径下,每个文件约为 15 MB),并且 Gemini Enterprise Agent Platform 支持常见的容器格式——MP4、MOV、AVI、WebM、WMV、MPEG——因此格式处理发生在 API 调用之前,而不是在调用之中。

它现在运行的地方,以及它未来的发展方向。

在发布之初,智能体视频理解可通过 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent Platform 用于视频上传和 YouTube 视频——这就是面向开发者和企业的界面。目前已宣布两项消费者端推出计划,但尚未上线:一个是 Gemini 应用,即将面向所有用户在 Flash 和 Flash-Lite 模型上推出;另一个是 YouTube 视频观看页面上的“Ask YouTube”功能,Google 表示将在未来几个月内推出。对于正在评估该功能的开发者来说,API 是当前真正可测试的地方;消费者端界面则是让这个说法普及开来的分发策略。

还有一个值得关注的生态系统信号:由于该能力以标准 API 模式交付,封装 Gemini 视频理解能力的 MCP 服务器和智能体框架项目——用于会议分析的 GenV 框架、视频研究 MCP 包,以及过去几个月出现的 Gemini 视频技能——无需更改架构即可采用。实现成本下降的关键是模式升级,而非新的 SDK。

在相信百分比之前要核实什么

公告中的每一个数字——66%、88%、7%、帕累托前沿(Pareto-frontier)的说法——都是谷歌自己的数据,是在谷歌自己的测试集上测得的,而且没有一项在公司外部得到过复现。方向本身没有疑问:一个只加载相关片段的智能体循环(agentic loop),不可能输给一个把所有内容都加载进来的固定网格(fixed grid)。真正悬而未决的是量级,而且它会因工作负载而异——一段2分钟的视频配一个简单问题,不会看到88%的token节省,因为本来就没有多少可跳过的内容;而一段3小时的通话配一个精准问题,就能看到。正确的测试方法是用你自己的长视频,在同一模型上分别跑一次静态处理和一次智能体处理,统计真实的token和真实的成本。

Screenshot of the Artificial Analysis model page for Gemini 3.7 Flash at high reasoning, showing an Intelligence Index of 56 (ranked #20 of 187 models), an output speed of 285 tokens per second in the high-reasoning configuration, and a price of $0.75 per 1M input and $3.75 per 1M output tokens.

这项测试背后的经济考量,恰恰是路由层大显身手之处。Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite——此功能所适用的三款模型中的两款——在 OrcaRouter 上以 Google 标价、0% 加价直通的方式提供,因此视频分析降价在 Google 上线当天即在我们这边同步生效;第三款也是最新款的 Gemini 3.7 Flash 则可通过 Google 自有 API 及多个第三方平台获取。同时,由于智能体视频理解是一项刚刚发布的能力,其真实场景中的性能差异尚未得到验证,因此它堪称自动故障转移的教科书式用例:将一部分视频流量指向智能体模式,让路由在出错、速率受限或出现明显质量回退时自动回退到经过验证的模型,同时保持基线路径继续运行,直到新模式凭借实绩赢得流量。

Screenshot of the OrcaRouter model page for google/gemini-3.6-flash showing a 1M-token context window, $1.50 per 1M input and $7.50 per 1M output tokens, and Vision/Audio/Video/Tools/Reasoning capability chips.

这一变化不仅仅是功能新增。两年来,视频一直是多模态输入中的尴尬角色——表现力极为丰富,分析成本极为高昂,而且实际上是以采样损失的方式被读取。智能体视频理解是谷歌首次同时针对这三个问题给出的严肃回应,而且它落位于其模型产品线中最便宜的层级,而非旗舰层级。对于那些一直因 token 费用而回避视频工作负载的团队来说,这种模式值得在今天重新核算一下成本。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube