Hero-titelkort med texten 'Gemini Agentic Video Understanding' med märket 'NEW CAPABILITY' och undertiteln 'API-läget som sänker videanalyskostnaden med två tredjedelar', tre chips med texten 'Gäller för Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite', 'Tillkännagavs 1 sep 2026', 'bearbetning: agentisk', och OrcaRouter-logotypen längst ner till höger.
Guides & Insights

Gemini Agentic Video Understanding är här: API-läget som sänker kostnaden för videoanalys med två tredjedelar

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Den 1 september 2026 introducerade Google agentisk videoförståelse för Gemini 3.7 Flash, Gemini 3.6 Flash, och Gemini 3.5 Flash-Lite — ett nytt läge i Gemini API:t som slutar behandla en video som en hög med bildrutor och istället börjar behandla den som ett sökbart dokument. Google DeepMinds tillkännagivande, skrivet av senior produktchef Rohan Doshi och forskningsdirektör Mario Lučić, är den första stora förändringen av hur Gemini läser video sedan modellerna överhuvudtaget fick videostöd: i stället för att en modell tyst tuggar sig igenom ett fast urval av bildrutor bestämmer modellen nu, mitt under svaret, vad den ska titta på, i vilken hastighet och via vilken av tre kanaler — visuella bildrutor, ljud eller transkript. Huvudeffekten, som helt och hållet rapporterats av leverantören och ännu inte oberoende verifierats, är att videoanalys blir upp till 66 % billigare, förbrukar upp till 88 % färre token och svarar upp till 7 % mer exakt än den bildruta-för-bildruta-baslinje den ersätter.

Vad "agentic" egentligen förändrar under huven

Det gamla beteendet är vad Google nu kallar "statisk" bearbetning: mata Gemini med en video, så samplas bildrutor med en fast hastighet – standard är en bildruta per sekund – kör hela provet genom modellen och svarar utifrån vad det fasta rutnätet fångade. Det har två strukturella blinda fläckar. En tillståndsändring som sker mellan två samplade bildrutor existerar helt enkelt inte för modellen. Och en tvåtimmarsvideo samplad med 1 FPS kostar en förmögenhet i tokens, varav de flesta spenderas på material som inte hade något med frågan att göra.

Agentisk videoförståelse ersätter {{1}}det fasta rutnätet med en loop{{/1}}. Modellen kombinerar {{2}}sitt kärnresonemang med inbyggda videoverktyg{{/2}} som låter den dynamiskt avgöra {{3}}vad den ska titta på, i vilken hastighet den ska titta på det, och genom vilken modalitet den ska inspektera det{{/3}} – visuella bildrutor, ljudspåret eller transkriptet. Den anropar ett internt verktyg för att ladda {{4}}endast de relevanta segmenten av filen{{/4}}, hämta {{5}}de ögonblick och signaler som frågan faktiskt behöver{{/5}}, och sedan resonera över det den hämtat. Google beskriver det som {{6}}samma arkitekturmönster som den agentiska visionsfunktion som företaget lanserade tidigare{{/6}}: modellen är inte längre en passiv konsument av media; den är en agent som ställer frågor till mediet som till ett verktyg.

Den praktiska konsekvensen är att "vad såg modellen?" upphör att vara en fråga om samplingstur. En fråga om ett klipp på en bråkdels sekund, en knappt synlig defekt eller ett ord som sagts mot bakgrundsbrus går att besvara, eftersom modellen kan skanna om det exakta tidsfönstret med högre upplösning och frekvens, i den modalitet där svaret finns.

Generated infographic titled 'Agentic vs static video processing — what changes'. Left column 'Static (before)': 'Fixed 1 FPS frame grid', 'Every frame billable', 'Misses between-frame moments', '2-hour video = millions of tokens'. Right column 'Agentic (now)': 'Model decides what to watch', 'Loads only relevant segments', 'Searches frames + audio + transcript', 'Up to 88% fewer tokens'. Footer: 'All deltas vendor-reported by Google, unreproduced.'

Siffrorna, märkta som vad de är.

Googles egen benchmarkjämförelse av agentisk kontra statisk bearbetning är kärnan i tillkännagivandet, och den bör läsas som ett leverantörspåstående tills en extern part replikerar den. På dess interna testsvit:

• Kostnad — upp till 66 % lägre analyskostnad, driven av att modellen endast laddar de segment den behöver istället för hela det fasta urvalet.

• Tokens — upp till 88 % lägre tokenförbrukning, med de största besparingarna på långformat video: tillkännagivandet lyfter specifikt fram 10-minutersguider till flera timmar långa inspelningar.

• Noggrannhet — upp till 7 % bättre på samma uppgifter, eftersom händelser under en sekund och mellan bildrutor blir synliga istället för att hamna i samplingsluckorna.

Google positionerar Gemini 3.7 Flash som att den befinner sig på {{1}}"noggrannhet-till-kostnad-Pareto-fronten"{{/1}} bland de testade modellerna — i klartext, {{2}}det bästa svaret per dollar av de tre{{/2}}. Företaget namnger också fyra partners för tidig åtkomst — {{3}}Ponder, Revyl, Mosaic och Resemble.AI{{/3}} — som har byggt på funktionen före den allmänna lanseringen, vilket är {{4}}den typen av detalj som tyder på verklig produktionsanvändning snarare än ett bildspel{{/4}}. Ingen av dessa partnerns resultat är publicerade, så den trovärdiga hållningen är: mekanismen är äkta, riktningen är uppenbart rätt, och de specifika procentsatserna är Googles tills de mäts oberoende.

Användningsfallen som funktionen byggdes för

Tillkännagivandet grupperar funktionen i fyra kategorier, som var och en motsvarar en konkret arbetsbelastning som en utvecklare kan leverera:

• Hämtning av ögonblick kortare än en sekund — som pekar ut tillståndsförändringar på bråkdelssekunder och snäva klippgränser som ett 1 FPS-rutnät helt missar. Detta är användningsfallet för automatisk videoredigering: att hitta den exakta bildrutan där en scenförändring sker.

• Långformats-sökning efter en nål i en höstack — att besvara en specifik fråga om en flera timmar lång video utan att förbruka miljontals tokens. Detta är skillnaden mellan ”titta på detta 3-timmarssamtal” och ”gick kunden med på förnyelsen i detta 3-timmarssamtal.”

• Avvikelsedetektering — modellen samplar om intressanta tidsfönster med högre bildfrekvens för att inspektera snabba rörelser och subtila visuella artefakter. Tillverkningens kvalitetskontroll, sportanalys och säkerhetsfilmer är de självklara målen.

• Räkna handlingar och objekt — spåra upprepade fysiska rörelser och distinkta objekt över tid, vilket statisk sampling räknar för lågt när det som räknas rör sig snabbare än samplingsfrekvensen.

Vilka modeller, och vad de kostar

Funktionen bygger på Flash-nivån, och prisskillnaden mellan de tre modellerna spelar roll för att välja vart man ska rikta den:

• Gemini 3.7 Flash — 0,75 USD in / 3,75 USD ut per miljon tokens till kampanjpris, bekräftat till och med 31 december 2026, varefter det fördubblas till 1,50 / 7,50 USD. Bäst i noggrannhet per krona av de tre.

Gemini 3.6 Flash — $1,50 / $7,50 per miljon tokens. Det stabila, icke-kampanjmässiga alternativet i trion.

Gemini 3.5 Flash-Lite — $0.30 / $2.50 per miljon tokens. Budgetfilen, för videotriage i hög volym där det billigaste token är poängen.

Eftersom funktionen använder standardprissättning för Gemini API-token utan extra avgift, landar tokenminskningen på 88 % direkt på dessa priser. En arbetsbelastning som kostade 100 $ att analysera statiskt borde kosta ungefär 12 till 34 $ under agentisk bearbetning på samma modell, innan eventuella noggrannhetsvinster — vilket är det verkliga skälet för alla vars pipeline för närvarande bränner tokens på att ladda upp eller frame-sampla lång video.

Hur man slår på den

Läget aktiveras med en enda konfigurationsflagga — skicka med processing "agentic" i begäran — och det fungerar med samma indata och prissättning som standard-API:t. Ingen separat slutpunkt, ingen ny faktureringsdimension, ingen särskild kvot. Python-sökvägen använder google-genai SDK:s interaktions-API, till exempel med modellen "gemini-3.7-flash" och en video plus en textprompt som indata; videon kan vara en direkt uppladdning, en Cloud Storage-URI, en offentlig HTTP-URL eller en YouTube-URL beroende på vilket gränssnitt du anropar.

Två praktiska begränsningar som är värda att känna till innan du bygger: videofiler är föremål för plattformens storleksgränser (på Enterprise Agent Platform-sökvägen, ungefär 15 MB per fil), och Gemini Enterprise Agent Platform stödjer de vanliga containerformaten — MP4, MOV, AVI, WebM, WMV, MPEG — så formathanteringen sker före API-anropet, inte i det.

Var den körs nu, och vart den är på väg.

Vid lanseringen är agentisk videoförståelse tillgänglig för videouppladdningar och YouTube-videor via Gemini API i Google AI Studio och via Gemini Enterprise Agent Platform — det vill säga utvecklar- och företagsytan. Två konsumentutrullningar har tillkännagetts men är ännu inte live: Gemini-appen, där den snart rullas ut till alla användare i Flash- och Flash-Lite-modellerna, och YouTubes ”Ask YouTube”-funktion på videons visningssida, som Google säger kommer under de kommande månaderna. För en utvecklare som utvärderar funktionen är API:et den ärliga platsen att testa den idag; konsumentytorna är distributionsdraget som kommer att normalisera frasen.

Det finns också en signal från ekosystemet som är värd att notera: eftersom funktionen levereras som ett standard-API-läge kan MCP-server- och agentframework-projekten som omsluter Geminis videoanalys — GenV-ramverket för mötesanalys, videoforsknings-MCP-paketen och Gemini-videofärdigheterna som har dykt upp under de senaste månaderna — anta det utan att ändra sin arkitektur. Det är lägesuppgraderingen, inte en ny SDK, som möjliggör kostnadsminskningen.

Vad du bör verifiera innan du litar på procentsatserna

Varje siffra i tillkännagivandet — 66 %, 88 %, 7 %, påståendet om Pareto-fronten — är Googles egna, uppmätta på Googles eget testset, och inget av det har reproducerats utanför företaget. Det råder ingen tvekan om riktningen: en agentisk loop som bara laddar relevanta segment kan inte annat än att slå ett fast rutnät som laddar allt. Magnituden är den öppna frågan, och den kommer att variera med arbetsbelastningen — ett 2-minutersklipp med en enda fråga kommer inte att uppnå 88 % i tokenbesparing, eftersom det inte finns så mycket att hoppa över; ett 3-timmarssamtal med en riktad fråga kommer att göra det. Det rätta testet är din egen långformatsvideo, som körs en gång med statisk bearbetning och en gång med agentisk bearbetning, på samma modell, och räknar riktiga tokens och riktiga dollar.

Screenshot of the Artificial Analysis model page for Gemini 3.7 Flash at high reasoning, showing an Intelligence Index of 56 (ranked #20 of 187 models), an output speed of 285 tokens per second in the high-reasoning configuration, and a price of $0.75 per 1M input and $3.75 per 1M output tokens.

Ekonomin i det testet är precis där ett routningslager visar sitt berättigande. Gemini 3.6 Flash och Gemini 3.5 Flash-Lite – två av de tre modeller som den här funktionen gäller – serveras på OrcaRouter till Googles listpris utan påslag (0 % marginal), så en prissänkning på videoanalys är live hos oss samma dag som den är live hos Google; Gemini 3.7 Flash, den tredje och nyaste, finns tillgänglig via Googles eget API och flera tredjepartsplattformar. Och eftersom agentisk videoförståelse är en nyutgiven funktion vars verkliga skillnader är overifierade, är det ett typexempel på automatisk failover: peka en andel av videotrafiken mot det agentiska läget, låt routern falla tillbaka till en beprövad modell vid fel, hastighetsbegränsningar eller tydliga kvalitetsförsämringar, och håll baslinjesökvägen igång tills det nya läget har förtjänat trafiken.

Screenshot of the OrcaRouter model page for google/gemini-3.6-flash showing a 1M-token context window, $1.50 per 1M input and $7.50 per 1M output tokens, and Vision/Audio/Video/Tools/Reasoning capability chips.

Förändringen är mer än ett funktionstillägg. Video har varit den besvärliga multimodala ingången i två år — enormt uttrycksfull, enormt dyr att analysera, och i praktiken läst med en samplingsförlust. Agentisk videoförståelse är Googles första seriösa svar på alla tre problemen på en gång, och den landar på den billigaste nivån i modellserien snarare än flaggskeppet. För team som har undvikit videoarbetsbelastningar på grund av token-avgiften är läget värt att räkna om idag.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube