
Gemini Agentic Video Understanding ya está aquí: el modo API que reduce el costo del análisis de video en dos tercios.
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0259Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0258Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0166Inteligencia82Código
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
El 1 de septiembre de 2026, Google presentó la comprensión de vídeo agéntica para Gemini 3.7 Flash, Gemini 3.6 Flash y Gemini 3.5 Flash-Lite — un nuevo modo en la API de Gemini que deja de tratar un vídeo como un montón de fotogramas y empieza a tratarlo como un documento en el que se puede buscar. El anuncio de Google DeepMind, escrito por el gerente sénior de producto Rohan Doshi y el director de investigación Mario Lučić, es el primer cambio importante en la forma en que Gemini lee vídeo desde que los modelos adquirieron esta capacidad de entrada: en lugar de que un modelo procese en silencio una muestra fija de fotogramas, ahora el modelo decide, a mitad de la respuesta, qué mirar, a qué velocidad y a través de cuál de los tres canales — fotogramas visuales, audio o transcripciones. El efecto principal, todo ello reportado por el proveedor y nada de ello reproducido aún de forma independiente, es que el análisis de vídeo resulta hasta un 66% más barato, consume hasta un 88% menos de tokens y responde con hasta un 7% más de precisión que la línea base fotograma a fotograma que sustituye.
Qué es lo que realmente cambia "agentic" bajo el capó
El comportamiento anterior es lo que Google ahora llama procesamiento "estático": se le da un video a Gemini, y este muestrea fotogramas a una velocidad fija — la predeterminada es un fotograma por segundo —, ejecuta toda la muestra a través del modelo y responde basándose en lo que capturó esa cuadrícula fija. Eso tiene dos puntos ciegos estructurales. Un cambio de estado que ocurre entre dos fotogramas muestreados simplemente no existe para el modelo. Y un video de dos horas muestreado a 1 FPS cuesta una fortuna en tokens, la mayoría de ellos gastados en metraje que no tenía nada que ver con la pregunta.
La comprensión agéntica de video sustituye la cuadrícula fija por un bucle. El modelo combina su razonamiento central con herramientas de video nativas que le permiten decidir dinámicamente qué ver, a qué velocidad reproducirlo y mediante qué modalidad inspeccionarlo: los fotogramas visuales, la pista de audio o la transcripción. Invoca una herramienta interna para cargar solo los segmentos relevantes del archivo y recuperar los momentos y las señales que la pregunta realmente necesita; luego razona sobre lo que ha obtenido. Google lo describe como el mismo patrón arquitectónico de la función de visión agéntica que lanzó anteriormente: el modelo ya no es un consumidor pasivo del contenido, sino un agente que consulta el contenido como si fuera una herramienta.
La consecuencia práctica es que «¿qué vio el modelo?» deja de ser una cuestión de suerte en el muestreo. Una pregunta sobre un corte de una fracción de segundo, un defecto apenas visible o una palabra pronunciada bajo un ruido de fondo puede responderse, porque el modelo puede volver a escanear la ventana exacta a mayor resolución y velocidad, en la modalidad donde reside la respuesta.

Los números, etiquetados como lo que son.
La comparación de benchmarks que Google realiza entre el procesamiento agéntico y el estático es el núcleo del anuncio, y debe leerse como una afirmación del proveedor hasta que una parte externa la replique. En su conjunto de prueba interno:
• Coste — hasta un 66% menos de coste de análisis, ya que el modelo carga solo los segmentos que necesita en lugar de toda la muestra fija.
• Tokens — hasta un 88% menos de consumo de tokens, con los mayores ahorros en video de formato largo: el anuncio menciona específicamente guías de 10 minutos hasta grabaciones de varias horas.
• Precisión — hasta un 7% mejor en las mismas tareas, porque los eventos de sub-segundo y entre fotogramas se vuelven visibles en lugar de caer en las lagunas de muestreo.
Google posiciona a Gemini 3.7 Flash como situado en la "frontera de Pareto de precisión frente a coste" de los modelos evaluados — en términos sencillos, la mejor respuesta por dólar de los tres. También nombra a cuatro socios de acceso anticipado — Ponder, Revyl, Mosaic y Resemble.AI — que han estado desarrollando sobre el modo antes de su disponibilidad general, un detalle que sugiere un uso real en producción, no una simple presentación de diapositivas. Los resultados de ninguno de esos socios se han publicado, así que la postura creíble es: el mecanismo es real, la dirección es evidentemente correcta, y los porcentajes concretos son afirmaciones de Google hasta que se midan de forma independiente.
Los casos de uso para los que se construyó la función.
El anuncio agrupa la capacidad en cuatro categorías, cada una de las cuales se corresponde con una carga de trabajo concreta que un desarrollador puede publicar:
• Recuperación de momentos subsegundo: identificación de cambios de estado en fracciones de segundo y de límites de corte muy ajustados que una rejilla de 1 FPS no detecta en absoluto. Este es el caso de uso de la edición automatizada de video: hallar el fotograma exacto en el que ocurre un cambio de escena.
• Búsqueda de aguja en un pajar en videos largos: responder a una consulta específica sobre un video de varias horas sin consumir millones de tokens. Esta es la diferencia entre «mira esta llamada de 3 horas» y «¿aceptó el cliente la renovación en esta llamada de 3 horas?»
• Detección de anomalías: el modelo remuestrea ventanas temporales de interés a una mayor frecuencia de fotogramas para inspeccionar el movimiento rápido y los artefactos visuales sutiles. El control de calidad en fabricación, el análisis deportivo y las grabaciones de seguridad son los objetivos evidentes.
• Contar acciones y objetos: rastrear movimientos físicos repetidos y objetos distintos a lo largo del tiempo, lo cual el muestreo estático subestima cuando lo que se cuenta se mueve más rápido que la frecuencia de muestreo.
Qué modelos y cuánto cuestan
La función está disponible en el nivel Flash, y la diferencia de precio entre los tres modelos es clave para decidir a cuál dirigirla:
• Gemini 3.7 Flash — $0.75 de entrada / $3.75 de salida por millón de tokens a la tarifa promocional, confirmada hasta el 31 de diciembre de 2026, después de lo cual se duplica a $1.50 / $7.50. El líder en relación precisión-costo de los tres.
• Gemini 3.6 Flash — $1.50 / $7.50 por millón de tokens. La opción estable y no promocional del trío.
• Gemini 3.5 Flash-Lite — $0.30 / $2.50 por millón de tokens. La opción económica, para el triaje de vídeo de alto volumen, donde el objetivo es el token más barato.
Como la función utiliza los precios estándar de tokens de la API de Gemini sin ninguna tarifa adicional, la reducción del 88 % en tokens se refleja directamente en esas tarifas. Una carga de trabajo que costaba 100 $ analizar de forma estática debería costar aproximadamente entre 12 $ y 34 $ con procesamiento agéntico en el mismo modelo, antes de cualquier mejora de precisión, que es lo que realmente importa para cualquiera cuyo pipeline actualmente queme tokens al volver a subir o muestrear fotogramas de videos largos.
Cómo encenderlo
El modo se habilita con una única bandera de configuración: pasar el procesamiento "agentic" en la solicitud, y funciona con las mismas entradas y precios que la API estándar. No hay un endpoint separado, ni una nueva dimensión de facturación, ni una cuota especial. La ruta de Python utiliza la API de interacciones del SDK de google-genai, por ejemplo con el modelo "gemini-3.7-flash" y un video más un prompt de texto como entrada; el video puede ser una subida directa, un URI de Cloud Storage, una URL HTTP pública o una URL de YouTube, según la superficie a la que se esté llamando.
Dos restricciones prácticas que conviene conocer antes de desarrollar: los archivos de video están sujetos a los límites de tamaño de la plataforma (en la ruta de Enterprise Agent Platform, aproximadamente 15 MB por archivo), y Gemini Enterprise Agent Platform admite los formatos de contenedor comunes (MP4, MOV, AVI, WebM, WMV, MPEG); por lo tanto, la gestión de formatos se realiza antes de la llamada a la API, no dentro de ella.
Dónde se ejecuta ahora y hacia dónde se dirige.
En el lanzamiento, la comprensión agéntica de video está disponible para cargas de video y videos de YouTube a través de la API de Gemini en Google AI Studio y a través de la Plataforma de Agentes Empresariales de Gemini — esa es la superficie para desarrolladores y empresas. Se anuncian dos implementaciones para consumidores que aún no están activas: la aplicación de Gemini, donde se implementará pronto para todos los usuarios en los modelos Flash y Flash-Lite, y la función "Ask YouTube" de YouTube en la página de visualización de videos, que Google dice que llegará en los próximos meses. Para un desarrollador que evalúa la función, la API es el lugar honesto para probarla hoy; las superficies de consumo son la jugada de distribución que normalizará la frase.
También hay una señal del ecosistema que vale la pena destacar: dado que la capacidad se distribuye como un modo de API estándar, los proyectos de servidores MCP y marcos de agentes que envuelven la comprensión de video de Gemini — el marco GenV para análisis de reuniones, los paquetes MCP de investigación de video y las habilidades de video de Gemini que han aparecido en los últimos meses — pueden adoptarla sin cambiar su arquitectura. La actualización del modo, no un nuevo SDK, es lo que desbloquea la reducción de costos.
Qué verificar antes de confiar en los porcentajes
Cada cifra del anuncio — el 66%, el 88%, el 7%, la afirmación sobre la frontera de Pareto — es de Google, medida en su propio conjunto de pruebas, y nada de ello ha sido reproducido fuera de la empresa. La dirección no está en duda: un bucle agéntico que carga solo los segmentos relevantes no puede dejar de superar a una cuadrícula fija que lo carga todo. La magnitud es la cuestión abierta, y variará según la carga de trabajo: un clip de 2 minutos con una sola pregunta no verá un ahorro de tokens del 88%, porque no hay mucho que omitir; una llamada de 3 horas con una pregunta específica sí lo verá. La prueba correcta es tu propio video de formato largo, ejecutado una vez con procesamiento estático y otra con procesamiento agéntico, en el mismo modelo, contando tokens reales y dólares reales.

La economía de esa prueba es exactamente donde una capa de enrutamiento demuestra su valor. Gemini 3.6 Flash y Gemini 3.5 Flash-Lite — dos de los tres modelos a los que se aplica esta característica — se sirven en OrcaRouter al precio de lista de Google, que se traslada con un margen del 0 %, por lo que un recorte de precio en el análisis de video está activo de nuestro lado el mismo día en que se activa en Google; Gemini 3.7 Flash, el tercero y más nuevo, está disponible a través de la propia API de Google y de varias plataformas de terceros. Y como la comprensión agéntica de video es una funcionalidad recién lanzada cuyas diferencias en el mundo real no se han verificado, es el caso de manual para la conmutación automática por error: dirige una parte del tráfico de video al modo agéntico, deja que el enrutador conmute a un modelo comprobado ante errores, límites de tasa o regresiones evidentes de calidad, y mantén la ruta de referencia activa hasta que el nuevo modo se gane el tráfico.

El cambio es más que una adición de funcionalidad. El video ha sido la entrada multimodal incómoda durante dos años: enormemente expresivo, enormemente costoso de analizar y, en la práctica, leído con pérdida de muestreo. La comprensión de video agéntico es la primera respuesta seria de Google a los tres problemas a la vez, y llega al nivel más económico de su línea de modelos, no al insignia. Para los equipos que han estado evitando cargas de trabajo de video debido a la factura de tokens, el modo merece que se rehagan los cálculos hoy.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
