
Gemini 智能体视频理解正式上线:API 模式将视频分析成本降低三分之二
- google新Google: Gemini 3.8 Flash2026-09-0259智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0258智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0166智能82代码
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
2026年9月1日,Google 推出了智能体视频理解,适用于 Gemini 3.7 Flash、Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite——这是 Gemini API 中的一个新模式,它不再将视频视为一堆帧,而是将其视为可搜索的文档。Google DeepMind 的公告由高级产品经理 Rohan Doshi 和研究总监 Mario Lučić 撰写,是自模型首次获得视频输入能力以来,对 Gemini 读取视频方式的首个重大改变:现在,模型不再默默地处理固定的帧样本,而是在回答过程中自行决定要看什么、以何种速度看、以及通过三种渠道中的哪一种——视觉帧、音频或文字记录——来观看。最引人瞩目的效果(全部由供应商报告,且均未被独立复现)是:视频分析成本最高降低 66%,token 消耗最多减少 88%,回答准确率比它所取代的逐帧基线最高提升 7%。
“agentic”到底在底层改变了什么
旧行为就是谷歌现在所称的{{1}}“静态”处理{{/1}}:将视频输入Gemini,它会以固定速率采样帧——默认是每秒一帧——将整个样本送入模型,然后根据该固定网格捕捉到的内容作答。这有两个结构性盲点。对于模型来说,发生在两个采样帧之间的状态变化根本不存在。而且,以1 FPS对两小时视频进行采样,会消耗大量token,其中大部分都花在了与问题无关的画面内容上。
智能体视频理解以循环取代固定的网格。模型将其核心推理与原生视频工具相结合,使其能够动态决定观看什么、以什么速度观看,以及通过哪种模态进行检查——视觉帧、音轨或转录文本。它调用内部工具,仅加载文件中相关的片段,获取问题真正需要的时刻和信号,然后对所提取的内容进行推理。谷歌将其描述为与早前推出的智能体视觉功能相同的架构模式:模型不再是媒体的被动消费者,而是将媒体当作工具来查询的智能体。
实际结果是,“模型看到了什么?”不再取决于采样的运气。关于瞬间剪切、几乎不可见的缺陷或在背景噪声中说出的词语,之所以能够回答,是因为模型可以以更高的分辨率和速率重新扫描精确的时间窗口,在答案所在的模态中进行。

这些数字,按其真实身份标注。
谷歌自身的关于智能体处理与静态处理的基准比较是该公告的核心,在外部方复现之前,应将其视为供应商声明。在其内部测试集上:
• 成本 — 分析成本最高可降低66%,因为模型只加载所需的部分,而不是整个固定样本。
• Token — Token 消耗最高可降低 88%,其中长视频的节省最为显著:公告特别提到了从 10 分钟指南到数小时录制的内容。
• 准确性 — 在相同任务上最高提升7%,因为亚秒级和帧间事件变得可见,而不会落入采样间隙中。
Google将Gemini 3.7 Flash定位为处于所测模型的“精度-成本帕累托前沿”——通俗地说,就是三者中每一美元能获得的最佳答案。它还列出了四家早期接入合作伙伴——Ponder、Revyl、Mosaic和Resemble.AI——他们在大众可用之前就已基于该模式进行构建,这种细节表明其背后是真实的生产应用,而非演示文稿。这些合作伙伴的结果均未公开,因此可信的立场是:机制是真实的,方向显然是正确的,具体百分比在独立验证之前仍是Google单方面的说法。
该功能所针对的使用场景
该公告将这一能力分为四个类别,每个类别对应开发者可以交付的一种具体工作负载:
• 亚秒级时刻检索——精确定位1 FPS网格完全无法捕捉的瞬间状态变化和紧凑剪切边界。这正是自动视频剪辑的应用场景:找到场景变化发生的精确帧。
• 长视频"大海捞针"式搜索——在不消耗数百万token的情况下,回答关于数小时视频的具体问题。这就是"观看这3小时通话"与"客户在这3小时通话中是否同意续约"之间的区别。
• 异常检测——模型以更高的帧率对感兴趣的时间窗口进行重采样,以检查快速运动和细微的视觉伪影。制造业质检、体育分析和安防监控录像显然是主要应用场景。
• 对动作和物体进行计数 — 随时间跟踪重复的物理运动和不同的物体,当被计数物体移动速度快于采样率时,静态采样会低估其数量。
有哪些型号,价格是多少
该功能基于 Flash 层级,而三个型号之间的价格差异对于决定将其指向何处至关重要:
• Gemini 3.7 Flash — 输入每百万 tokens $0.75 / 输出 $3.75(促销价),确认有效期至2026年12月31日,之后翻倍至 $1.50 / $7.50。三者中准确度与成本比领先者。
{{1}}• Gemini 3.6 Flash — 每百万 token 售价 $1.50 / $7.50。这是三者中稳定、非促销的选择。{{/1}}
• Gemini 3.5 Flash-Lite — 每百万 token 仅需 $0.30 / $2.50。预算之选,专为大规模视频筛选而生,此时最便宜的 token 才是关键所在。
由于该功能使用标准 Gemini API token 定价,且不收取额外费用,因此 88% 的 token 缩减直接体现在这些费率上。在相同模型下,原本静态分析需花费 100 美元的工作负载,在智能体处理下大约只需 12 至 34 美元,这还未考虑准确性提升——对于那些当前管线因重新上传或对长视频进行帧采样而消耗大量 token 的团队来说,这才是真正的重点。
如何打开它?
该模式通过一个配置标志即可启用——在请求中传递 processing "agentic"——并且它与标准API使用相同的输入和定价。无需单独的端点,没有新的计费维度,也没有特殊配额。Python路径使用google-genai SDK的interactions API,例如使用模型"gemini-3.7-flash",输入为视频加文本提示词;视频可以是直接上传、Cloud Storage URI、公共HTTP URL或YouTube URL,具体取决于您所调用的接口表面。
在开始构建之前,有两个实用的限制值得了解:视频文件受平台的大小限制(在 Enterprise Agent Platform 路径下,每个文件约为 15 MB),并且 Gemini Enterprise Agent Platform 支持常见的容器格式——MP4、MOV、AVI、WebM、WMV、MPEG——因此格式处理发生在 API 调用之前,而不是在调用之中。
它现在运行的地方,以及它未来的发展方向。
在发布之初,智能体视频理解可通过 Google AI Studio 中的 Gemini API 以及 Gemini Enterprise Agent Platform 用于视频上传和 YouTube 视频——这就是面向开发者和企业的界面。目前已宣布两项消费者端推出计划,但尚未上线:一个是 Gemini 应用,即将面向所有用户在 Flash 和 Flash-Lite 模型上推出;另一个是 YouTube 视频观看页面上的“Ask YouTube”功能,Google 表示将在未来几个月内推出。对于正在评估该功能的开发者来说,API 是当前真正可测试的地方;消费者端界面则是让这个说法普及开来的分发策略。
还有一个值得关注的生态系统信号:由于该能力以标准 API 模式交付,封装 Gemini 视频理解能力的 MCP 服务器和智能体框架项目——用于会议分析的 GenV 框架、视频研究 MCP 包,以及过去几个月出现的 Gemini 视频技能——无需更改架构即可采用。实现成本下降的关键是模式升级,而非新的 SDK。
在相信百分比之前要核实什么
公告中的每一个数字——66%、88%、7%、帕累托前沿(Pareto-frontier)的说法——都是谷歌自己的数据,是在谷歌自己的测试集上测得的,而且没有一项在公司外部得到过复现。方向本身没有疑问:一个只加载相关片段的智能体循环(agentic loop),不可能输给一个把所有内容都加载进来的固定网格(fixed grid)。真正悬而未决的是量级,而且它会因工作负载而异——一段2分钟的视频配一个简单问题,不会看到88%的token节省,因为本来就没有多少可跳过的内容;而一段3小时的通话配一个精准问题,就能看到。正确的测试方法是用你自己的长视频,在同一模型上分别跑一次静态处理和一次智能体处理,统计真实的token和真实的成本。

这项测试背后的经济考量,恰恰是路由层大显身手之处。Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite——此功能所适用的三款模型中的两款——在 OrcaRouter 上以 Google 标价、0% 加价直通的方式提供,因此视频分析降价在 Google 上线当天即在我们这边同步生效;第三款也是最新款的 Gemini 3.7 Flash 则可通过 Google 自有 API 及多个第三方平台获取。同时,由于智能体视频理解是一项刚刚发布的能力,其真实场景中的性能差异尚未得到验证,因此它堪称自动故障转移的教科书式用例:将一部分视频流量指向智能体模式,让路由在出错、速率受限或出现明显质量回退时自动回退到经过验证的模型,同时保持基线路径继续运行,直到新模式凭借实绩赢得流量。

这一变化不仅仅是功能新增。两年来,视频一直是多模态输入中的尴尬角色——表现力极为丰富,分析成本极为高昂,而且实际上是以采样损失的方式被读取。智能体视频理解是谷歌首次同时针对这三个问题给出的严肃回应,而且它落位于其模型产品线中最便宜的层级,而非旗舰层级。对于那些一直因 token 费用而回避视频工作负载的团队来说,这种模式值得在今天重新核算一下成本。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
