
Gemini Agentic Video Understanding уже здесь: режим API, который сокращает стоимость анализа видео на две трети
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0259Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0258Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0166Интеллект82Кодинг
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
On September 1, 2026, Google introduced agentic video understanding for Gemini 3.7 Flash, Gemini 3.6 Flash, and Gemini 3.5 Flash-Lite — a new mode in the Gemini API that stops treating a video as a pile of frames and starts treating it as a searchable document. Google DeepMind's announcement, written by senior product manager Rohan Doshi and research director Mario Lučić, is the first major change to how Gemini reads video since the models gained the input at all: instead of a model silently chewing through a fixed sample of frames, the model now decides, mid-answer, what to look at, at what speed, and through which of three channels — visual frames, audio, or transcripts. The headline effect, all of it vendor-reported and none of it yet independently reproduced, is that video analysis gets up to 66% cheaper, burns up to 88% fewer tokens, and answers up to 7% more accurately than the frame-by-frame baseline it replaces.
Что «агентность» на самом деле меняет под капотом
Прежнее поведение — это то, что Google теперь называет «статической» обработкой: вы подаете Gemini видео, и он сэмплирует кадры с фиксированной частотой — по умолчанию один кадр в секунду — прогоняет всю выборку через модель и отвечает на основе того, что захватила эта фиксированная сетка. Здесь есть два структурных слепых пятна. Изменение состояния, которое происходит между двумя сэмплированными кадрами, для модели просто не существует. А двухчасовое видео, сэмплированное с частотой 1 кадр/с, стоит целое состояние в токенах, причем большая их часть тратится на кадры, не имеющие отношения к вопросу.
Agentic video understanding replaces the fixed grid with a loop. The model pairs its core reasoning with native video tools that let it dynamically decide what to watch, at what speed to watch it, and through which modality to inspect it — visual frames, the audio track, or the transcript. It invokes an internal tool to load only the relevant segments of the file, fetch the moments and signals the question actually needs, then reasons over what it pulled. Google describes it as the same architectural pattern as the agentic vision feature it shipped earlier: the model is no longer a passive consumer of media; it is an agent that queries the media like a tool.
Практическое следствие таково: вопрос «что увидела модель?» перестаёт быть делом удачи при сэмплировании. Вопрос о кадре длиной в долю секунды, едва заметном дефекте или слове, произнесённом на фоне шума, получает ответ, поскольку модель может повторно сканировать то же самое окно с более высоким разрешением и частотой, в модальности, где скрывается ответ.

Числа, названные своими именами.
Собственное бенчмарк-сравнение Google агентной обработки со статической лежит в основе анонса, и к нему стоит относиться как к заявлению вендора, пока его не воспроизведёт независимая сторона. На внутреннем тестовом наборе:
• Стоимость — до 66% ниже затраты на анализ, так как модель загружает только необходимые сегменты, а не всю фиксированную выборку.
• Токены — снижение потребления токенов до 88%, при этом наибольшая экономия достигается на длинных видео: в анонсе особо отмечаются 10-минутные руководства к многочасовым записям.
• Точность — до 7% выше на тех же задачах, поскольку события длительностью менее секунды и происходящие между кадрами становятся видимыми, а не теряются в промежутках дискретизации.
Google позиционирует Gemini 3.7 Flash как находящийся на «парето-границе соотношения точности и стоимости» среди протестированных моделей — проще говоря, это лучший ответ за доллар из трёх. Он также называет четырёх партнёров раннего доступа — Ponder, Revyl, Mosaic и Resemble.AI, — которые работали с этой моделью до её общего выпуска; подобная деталь говорит о реальном производственном использовании, а не о презентационном слайде. Никаких результатов этих партнёров не опубликовано, поэтому обоснованная позиция такова: механизм реален, направление очевидно верное, а конкретные проценты — это данные Google, пока их не проверят независимо.
Варианты использования, для которых была создана функция
В объявлении данная возможность сгруппирована в четыре категории, каждая из которых соответствует конкретной рабочей нагрузке, которую разработчик может развернуть:
• Субсекундный поиск момента — точное определение изменений состояния и границ склеек, длящихся доли секунды, которые сетка с частотой 1 кадр/с полностью упускает. Это сценарий использования для автоматического видеомонтажа: нахождение точного кадра, в котором происходит смена сцены.
• Поиск иголки в стоге сена в длинных видео — ответ на конкретный вопрос о многочасовом видео, не тратя миллионы токенов. Это разница между «посмотреть этот трёхчасовой звонок» и «согласился ли клиент на продление в этом трёхчасовом звонке».
• Обнаружение аномалий — модель повторно сэмплирует интересные временные окна с более высокой частотой кадров, чтобы анализировать быстрые движения и едва заметные визуальные артефакты. Очевидные цели — контроль качества на производстве, спортивный анализ и записи с камер видеонаблюдения.
• Подсчёт действий и объектов — отслеживание повторяющихся физических движений и отдельных объектов во времени, которое статическая выборка занижает, когда подсчитываемый объект движется быстрее частоты выборки.
Какие модели и сколько они стоят
Эта функция доступна на уровне Flash, и разброс цен между тремя моделями важен для выбора, куда её направить:
• Gemini 3.7 Flash — $0.75 за млн токенов на входе и $3.75 за млн на выходе по акционной ставке, подтверждённой до 31 декабря 2026 года, после чего она удваивается до $1.50 / $7.50. Лидер из трёх по соотношению точности и стоимости.
• Gemini 3.6 Flash — $1.50 / $7.50 за миллион токенов. Стабильный, неакционный вариант из этой тройки.
• Gemini 3.5 Flash-Lite — $0.30 / $2.50 за миллион токенов. Бюджетный вариант для высокообъёмной сортировки видео, где главное — самая низкая цена за токен.
Поскольку функция использует стандартные тарифы на токены Gemini API без дополнительной платы, сокращение расхода токенов на 88% напрямую отражается на этих ставках. Рабочая нагрузка, стоившая $100 при статическом анализе, должна обходиться примерно в $12–$34 при агентной обработке на той же модели, ещё до учёта выигрыша в точности, — а это и есть главная новость для тех, чей конвейер сейчас сжигает токены на повторную загрузку или попытку выбрать кадры из длинного видео.
Как это включить?
Режим включается одним конфигурационным флагом — передайте в запросе processing "agentic" — и работает с теми же входными данными и по тем же ценам, что и стандартный API. Никакого отдельного эндпоинта, новых измерений для биллинга или особой квоты. В Python используется interactions API из google-genai SDK, например с моделью "gemini-3.7-flash" и видео вместе с текстовым промптом на входе; видео может быть прямой загрузкой, URI Cloud Storage, публичным HTTP URL или YouTube URL в зависимости от того, какой интерфейс вы вызываете.
Два практических ограничения, о которых стоит знать перед началом разработки: на видеофайлы действуют лимиты размера платформы (для Enterprise Agent Platform — примерно 15 МБ на файл), а Gemini Enterprise Agent Platform поддерживает распространённые контейнерные форматы — MP4, MOV, AVI, WebM, WMV, MPEG, — так что преобразование форматов выполняется до вызова API, а не внутри него.
Где это работает сейчас и куда оно движется
На момент запуска агентное понимание видео доступно для загружаемых видео и роликов YouTube через Gemini API в Google AI Studio, а также через Gemini Enterprise Agent Platform — это поверхности для разработчиков и предприятий. Анонсированы два потребительских релиза, которые пока не запущены: приложение Gemini, где функция постепенно станет доступна всем пользователям на моделях Flash и Flash-Lite в ближайшее время, и функция «Ask YouTube» на странице просмотра видео в YouTube, которая, по словам Google, появится в ближайшие месяцы. Для разработчика, оценивающего эту возможность, API — честное место для тестирования уже сегодня; потребительские поверхности — это дистрибуционный ход, который закрепит этот термин в обиходе.
Есть также сигнал со стороны экосистемы, который стоит отметить: поскольку эта возможность поставляется как стандартный режим API, проекты MCP-серверов и агентных фреймворков, оборачивающие видеопонимание Gemini — фреймворк GenV для аналитики встреч, MCP-пакеты для видеоисследований и видеонавыки Gemini, появившиеся за последние месяцы, — могут принять её без изменения своей архитектуры. Снижение стоимости обеспечивает именно обновление режима, а не новый SDK.
Что проверить, прежде чем доверять процентам
Каждая цифра в анонсе — 66%, 88%, 7%, утверждение о границе Парето — принадлежит самой Google и измерена на её собственном тестовом наборе. Ни одна из них не воспроизведена за пределами компании. Направление не вызывает сомнений: агентный цикл, загружающий только релевантные сегменты, не может не оказаться эффективнее фиксированной сетки, загружающей всё. Размер экономии — открытый вопрос, и он будет зависеть от сценария: двухминутный ролик с одним вопросом не позволит сэкономить 88% токенов, потому что пропускать почти нечего; трёхчасовой звонок с одним целенаправленным вопросом — позволит. Правильный тест — ваше собственное длинное видео: прогнать его один раз через статическую обработку и один раз через агентную, на одной и той же модели, и посчитать реальные токены и реальные доллары.

Экономика такого теста — именно та область, где слой маршрутизации оправдывает своё существование. Gemini 3.6 Flash и Gemini 3.5 Flash-Lite — две из трёх моделей, к которым применяется эта функция, — обслуживаются на OrcaRouter по прейскурантной цене Google с нулевой наценкой, поэтому снижение цены на видеоанализ вступает в силу у нас в тот же день, что и у Google; Gemini 3.7 Flash, третья и самая новая, доступна через собственный API Google и несколько сторонних платформ. А поскольку агентное понимание видео — функция, выпущенная буквально только что, чьи реальные различия в работе ещё не проверены, это классический случай для автоматического переключения на резерв: направьте часть видеотрафика на агентный режим, позвольте маршрутизатору переключаться на проверенную модель при ошибках, превышении лимитов или очевидной деградации качества, и сохраняйте базовый путь активным, пока новый режим не заслужит этот трафик.

Это изменение — больше, чем просто добавление новой функции. Видео было неудобным мультимодальным входом в течение двух лет: чрезвычайно выразительным, чрезвычайно дорогим для анализа и по существу обрабатываемым с потерей данных при сэмплировании. Агентное понимание видео — это первый серьёзный ответ Google сразу на все три проблемы, и оно появляется на самой дешёвой ступени модельного ряда, а не во флагманской модели. Командам, которые избегали видеонагрузок из-за расходов на токены, стоит пересчитать экономику этого режима уже сегодня.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
