
Gemini Agentic Video Understanding is hier: de API-modus die de kosten voor videoanalyse met tweederde verlaagt
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0259Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0258Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0166Intelligentie82Coderen
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2658Intelligentie72Coderen
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
On September 1, 2026, Google introduced agentic video understanding for Gemini 3.7 Flash, Gemini 3.6 Flash, and Gemini 3.5 Flash-Lite — a new mode in the Gemini API that stops treating a video as a pile of frames and starts treating it as a searchable document. Google DeepMind's announcement, written by senior product manager Rohan Doshi and research director Mario Lučić, is the first major change to how Gemini reads video since the models gained the input at all: instead of a model silently chewing through a fixed sample of frames, the model now decides, mid-answer, what to look at, at what speed, and through which of three channels — visual frames, audio, or transcripts. The headline effect, all of it vendor-reported and none of it yet independently reproduced, is that video analysis gets up to 66% cheaper, burns up to 88% fewer tokens, and answers up to 7% more accurately than the frame-by-frame baseline it replaces.
Wat 'agentic' daadwerkelijk onder de motorkap verandert
Het oude gedrag is wat Google nu "statische" verwerking noemt: voer Gemini een video en het samplet frames op een vast tempo — de standaard is één frame per seconde — voert de volledige sample door het model en antwoordt op basis van wat dat vaste raster heeft vastgelegd. Dat heeft twee structurele blinde vlekken. Een statusverandering die tussen twee gesamplede frames plaatsvindt, bestaat simpelweg niet voor het model. En een video van twee uur die met 1 FPS wordt gesampled, kost een fortuin aan tokens, waarvan de meeste worden besteed aan beeldmateriaal dat niets met de vraag te maken had.
Agentisch videobegrip vervangt het vaste raster door een lus. Het model koppelt zijn kernredenering aan native videotools, waardoor het dynamisch kan bepalen wat het bekijkt, met welk tempo het dat bekijkt, en via welke modaliteit het iets inspecteert — beeldframes, de audiotrack of het transcript. Het roept een intern hulpmiddel aan om alleen de relevante segmenten van het bestand te laden, haalt de momenten en signalen op die de vraag daadwerkelijk nodig heeft, en redeneert vervolgens over wat het heeft opgehaald. Google beschrijft dit als hetzelfde architectuurpatroon als de agentische visiefunctie die het eerder uitbracht: het model is geen passieve consument van media meer; het is een agent die media als een tool bevraagt.
De praktische consequentie is dat "wat heeft het model gezien?" ophoudt een kwestie van steekproefgeluk te zijn. Een vraag over een fractie van een seconde durende knip, een nauwelijks zichtbaar defect of een woord dat onder achtergrondgeluid wordt uitgesproken, is beantwoordbaar omdat het model het exacte venster opnieuw kan scannen met een hogere resolutie en frequentie, in de modaliteit waar het antwoord leeft.

De cijfers, gelabeld als wat ze zijn
Google's eigen benchmarkvergelijking van agentische versus statische verwerking is de kern van de aankondiging, en die moet worden gelezen als een claim van de leverancier totdat een externe partij deze reproduceert. Op de interne testset:
• Kosten — tot 66% lagere analysekosten, doordat het model alleen de segmenten laadt die het nodig heeft in plaats van het hele vaste monster.
• Tokens — tot 88% lager tokenverbruik, met de grootste besparingen bij long-form video: de aankondiging noemt specifiek handleidingen van 10 minuten tot opnamen van meerdere uren.
• Nauwkeurigheid — tot 7% beter bij dezelfde taken, omdat gebeurtenissen binnen een seconde en tussen frames zichtbaar worden in plaats van in de bemonsteringsgaten te vallen.
Google positioneert Gemini 3.7 Flash als liggend op de 'accuracy-to-cost Pareto-frontier' van de geteste modellen — in gewone taal: het beste antwoord per dollar van de drie. Het noemt ook vier partners met vroege toegang — Ponder, Revyl, Mosaic en Resemble.AI — die al vóór de algemene beschikbaarheid op de modus hebben gebouwd, wat het soort detail is dat wijst op echt productiegebruik in plaats van een slide-deck. Geen van de resultaten van die partners is gepubliceerd, dus het geloofwaardige standpunt is: het mechanisme is reëel, de richting is overduidelijk juist, en de specifieke percentages zijn van Google totdat ze onafhankelijk zijn gemeten.
De use cases waarvoor de feature is gebouwd
De aankondiging verdeelt de functionaliteit in vier categorieën, die elk overeenkomen met een concrete workload die een ontwikkelaar kan leveren:
• Het lokaliseren van momenten in minder dan een seconde — het nauwkeurig vaststellen van toestandsveranderingen van een fractie van een seconde en strakke snijpunten die een 1 FPS-raster volledig mist. Dit is het gebruiksscenario voor geautomatiseerde videobewerking: het exacte frame vinden waarop een scèneovergang plaatsvindt.
• Zoeken naar een speld in een hooiberg in lange content — een specifieke vraag beantwoorden over een video van meerdere uren zonder miljoenen tokens te verbruiken. Dit is het verschil tussen "bekijk dit 3 uur durende gesprek" en "ging de klant akkoord met de verlenging in dit 3 uur durende gesprek."
• Anomaliedetectie — het model hersampelt interessante tijdsvensters met een hogere framesnelheid om snelle bewegingen en subtiele visuele artefacten te inspecteren. Kwaliteitscontrole in productie, sportanalyse en bewakingsbeelden zijn de voor de hand liggende doelen.
• Het tellen van acties en objecten — het bijhouden van herhaalde fysieke bewegingen en afzonderlijke objecten over de tijd, die statische bemonstering ondertelt wanneer het getelde object sneller beweegt dan de bemonsteringsfrequentie.
Welke modellen, en wat ze kosten
De functie draait op de Flash-tier, en de prijsverschillen tussen de drie modellen zijn belangrijk om te bepalen waar je deze op richt:
• Gemini 3.7 Flash — $0,75 in / $3,75 uit per miljoen tokens tegen het promotietarief, bevestigd tot en met 31 december 2026, waarna het verdubbelt naar $1,50 / $7,50. De aanvoerder qua nauwkeurigheid ten opzichte van de kosten van de drie.
• Gemini 3.6 Flash — $1.50 / $7.50 per miljoen tokens. De stabiele, niet-promotionele optie in het trio.
Gemini 3.5 Flash-Lite — $0.30 / $2.50 per miljoen tokens. De budgetbaan, voor videotriage met hoge volumes, waar de goedkoopste token telt.
Omdat de functie gebruikmaakt van de standaard tokenprijzen van de Gemini API zonder extra kosten, komt de tokenreductie van 88% direct tot uiting in deze tarieven. Een workload die $100 kostte om statisch te analyseren, zou onder agentische verwerking op hetzelfde model ruwweg $12 tot $34 moeten kosten, vóór eventuele nauwkeurigheidswinst — en dat is het echte verhaal voor iedereen wiens pijplijn momenteel tokens verbrandt aan het opnieuw uploaden of framebemonsteren van lange video's.
Hoe zet je het aan
De modus wordt ingeschakeld met één enkele configuratievlag — geef "agentic" op als verwerkingsmodus in het verzoek — en werkt met dezelfde invoer en prijzen als de standaard-API. Geen apart endpoint, geen nieuwe facturatiedimensie, geen speciaal quotum. Het Python-pad gebruikt de interactie-API van de google-genai SDK, bijvoorbeeld met model "gemini-3.7-flash" en een video plus een tekstprompt als invoer; de video kan een directe upload, een Cloud Storage-URI, een openbare HTTP-URL of een YouTube-URL zijn, afhankelijk van de interface die je aanroept.
Twee praktische beperkingen die het waard zijn om te weten voordat je gaat bouwen: videobestanden zijn onderworpen aan de limieten voor bestandsgrootte van het platform (op het Enterprise Agent Platform-pad ongeveer 15 MB per bestand), en het Gemini Enterprise Agent Platform ondersteunt de gebruikelijke containerformaten — MP4, MOV, AVI, WebM, WMV, MPEG — dus het omzetten van formaten gebeurt vóór de API-aanroep, niet erin.
Waar het nu draait, en waar het naartoe gaat.
Bij de lancering is agentisch videobegrip beschikbaar voor videouploads en YouTube-video's via de Gemini API in Google AI Studio en via het Gemini Enterprise Agent Platform — dat is het kanaal voor ontwikkelaars en bedrijven. Er zijn twee consumentenuitrollen aangekondigd, maar nog niet live: de Gemini-app, waar het binnenkort via de Flash- en Flash-Lite-modellen voor alle gebruikers wordt uitgerold, en de 'Ask YouTube'-functie van YouTube op de videopagina, die volgens Google in de komende maanden komt. Voor een ontwikkelaar die de functie evalueert, is de API vandaag de eerlijke plek om deze te testen; de consumentenkanalen zijn de distributiezet die de term zal normaliseren.
Er is ook een ecosysteemsignaal dat het vermelden waard is: omdat de functionaliteit als standaard API-modus wordt aangeboden, kunnen de MCP-server- en agent-framework-projecten die Gemini-videobegrip omvatten — het GenV-framework voor meetinganalytics, de MCP-pakketten voor videoresearch en de Gemini-video-vaardigheden die de afgelopen maanden zijn verschenen — dit adopteren zonder hun architectuur te wijzigen. Het is de modus-upgrade, niet een nieuwe SDK, die de kostenverlaging mogelijk maakt.
Wat moet je controleren voordat je de percentages vertrouwt
Elk getal in de aankondiging — de 66%, de 88%, de 7%, de claim over de Pareto-frontier — is van Google zelf, gemeten op Google's eigen testset, en geen daarvan is buiten het bedrijf gereproduceerd. De richting staat niet ter discussie: een agentische lus die alleen relevante segmenten laadt, kan niet anders dan een vast raster verslaan dat alles laadt. De omvang is de open vraag, en die varieert per werklast — een clip van twee minuten met één enkele vraag zal geen 88% tokenbesparing opleveren, omdat er niet veel over te slaan valt; een gesprek van drie uur met één gerichte vraag daarentegen wel. De juiste test is je eigen lange video, eenmaal uitgevoerd met statische verwerking en eenmaal met agentische verwerking, op hetzelfde model, waarbij echte tokens en echte dollars worden geteld.

De kosten-batenanalyse van die test is precies waar een routinglaag zijn bestaansrecht bewijst. Gemini 3.6 Flash en Gemini 3.5 Flash-Lite — twee van de drie modellen waar deze functie betrekking op heeft — worden op OrcaRouter aangeboden tegen Google's lijstprijs, die met 0% opslag wordt doorgegeven. Daardoor is een prijsverlaging voor video-analyse bij ons live op dezelfde dag dat die bij Google live is; Gemini 3.7 Flash, het derde en nieuwste model, is beschikbaar via Google's eigen API en verschillende platforms van derden. En omdat agentische videoverwerking een net uitgebrachte mogelijkheid is waarvan de prestatieverschillen in de praktijk niet zijn geverifieerd, is dit hét schoolvoorbeeld voor automatische failover: stuur een deel van het videoverkeer naar de agentische modus, laat de router bij fouten, rate limits of duidelijke kwaliteitsregressies terugvallen op een bewezen model, en houd het basispad draaiende totdat de nieuwe modus het verkeer heeft verdiend.

De wijziging is meer dan alleen een functietoevoeging. Video is al twee jaar lang de lastige multimodale invoer — enorm expressief, enorm duur om te analyseren en in feite gelezen met samplingverlies. Agentische videoverwerking is Google's eerste serieuze antwoord op alle drie de problemen tegelijk, en het belandt op de goedkoopste laag van de modellenlijn in plaats van op het vlaggenschip. Voor teams die videowerklasten hebben vermeden vanwege de tokenkosten, is het de moeite waard om vandaag de berekening opnieuw te maken.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
