Karta tytułowa hero z napisem „Gemini Agentic Video Understanding”, z plakietką „NOWA FUNKCJA” i podtytułem „Tryb API, który obniża koszt analizy wideo o dwie trzecie”, trzy chipy z napisami: „Dotyczy Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite”, „Ogłoszono 1 września 2026”, „przetwarzanie: agentowe”, oraz logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Agentowe rozumienie wideo Gemini już dostępne: tryb API, który obniża koszty analizy wideo o dwie trzecie

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

1 września 2026 roku Google wprowadził agentowe rozumienie wideo dla Gemini 3.7 Flash, Gemini 3.6 Flash oraz Gemini 3.5 Flash-Lite — nowy tryb w interfejsie Gemini API, który przestaje traktować wideo jako stos klatek, a zaczyna traktować je jako dokument, w którym można wyszukiwać. Ogłoszenie Google DeepMind, napisane przez starszego menedżera produktu Rohana Doshiego i dyrektora badań Mario Lučicia, jest pierwszą poważną zmianą w sposobie, w jaki Gemini czyta wideo, od czasu gdy modele w ogóle uzyskały możliwość przyjmowania wideo: zamiast tego, że model po cichu przetwarza stałą próbkę klatek, teraz decyduje w trakcie odpowiedzi, na co patrzeć, z jaką prędkością i za pośrednictwem którego z trzech kanałów — klatek wizualnych, audio lub transkryptów. Najważniejszy efekt — w całości deklarowany przez dostawcę i niepotwierdzony dotąd niezależnie — jest taki, że analiza wideo jest do 66% tańsza, zużywa do 88% mniej tokenów i jest do 7% dokładniejsza niż podejście klatka po klatce, które zastępuje.

Co tak naprawdę zmienia „agentic" pod maską

Dawne zachowanie to to, co Google nazywa teraz przetwarzaniem „statycznym": podajesz Gemini wideo, a ono próbkuje klatki ze stałą szybkością — domyślnie jedną klatkę na sekundę — przepuszcza całą próbkę przez model i odpowiada na podstawie tego, co uchwyciła ta stała siatka. Ma to dwa strukturalne martwe pola. Zmiana stanu, która nastąpi między dwiema próbkowanymi klatkami, dla modelu po prostu nie istnieje. A dwugodzinne wideo próbkowane z szybkością 1 klatki na sekundę kosztuje fortunę w tokenach, z których większość pochłania materiał niemający nic wspólnego z pytaniem.

Agentowe rozumienie wideo zastępuje stałą siatkę pętlą. Model łączy swoje podstawowe rozumowanie z natywnymi narzędziami wideo, które pozwalają mu dynamicznie decydować, co oglądać, z jaką prędkością to oglądać oraz za pomocą której modalności to badać — klatki wizualne, ścieżkę audio lub transkrypt. Wywołuje wewnętrzne narzędzie, aby załadować tylko istotne fragmenty pliku, pobrać momenty i sygnały, których faktycznie potrzebuje pytanie, a następnie rozumuje nad tym, co pobrał. Google opisuje to jako ten sam wzorzec architektoniczny, co funkcja agentowego widzenia, którą wprowadził wcześniej: model nie jest już biernym konsumentem mediów; jest agentem, który odpytyuje media jak narzędzie.

Praktyczną konsekwencją jest to, że „co zobaczył model?" przestaje być kwestią szczęścia w próbkowaniu. Na pytanie o ujęcie trwające ułamek sekundy, ledwo widoczny defekt czy słowo wypowiedziane w szumie tła można odpowiedzieć, ponieważ model może ponownie przeskanować dokładnie to okno w wyższej rozdzielczości i z większą częstotliwością, w modalności, w której znajduje się odpowiedź.

Generated infographic titled 'Agentic vs static video processing — what changes'. Left column 'Static (before)': 'Fixed 1 FPS frame grid', 'Every frame billable', 'Misses between-frame moments', '2-hour video = millions of tokens'. Right column 'Agentic (now)': 'Model decides what to watch', 'Loads only relevant segments', 'Searches frames + audio + transcript', 'Up to 88% fewer tokens'. Footer: 'All deltas vendor-reported by Google, unreproduced.'

Liczby, oznaczone jako to, czym są.

Własne porównanie benchmarkowe Google przetwarzania agentowego i statycznego jest sednem ogłoszenia i należy je traktować jako twierdzenie producenta, dopóki nie zostanie powtórzone przez zewnętrzną stronę. Na wewnętrznym zestawie testowym:

• Koszt — nawet o 66% niższy koszt analizy, dzięki temu, że model ładuje tylko potrzebne segmenty, zamiast całej ustalonej próbki.

• Tokeny — do 88% niższe zużycie tokenów, z największymi oszczędnościami w przypadku długich filmów: ogłoszenie w szczególności wymienia 10-minutowe przewodniki po nagraniach trwających wiele godzin.

• Dokładność — nawet o 7% lepsza w tych samych zadaniach, ponieważ zdarzenia subsekundowe i międzyklatkowe stają się widoczne, zamiast wpadać w luki próbkowania.

Google plasuje Gemini 3.7 Flash na „granicy Pareto dokładność-koszt" wśród testowanych modeli — mówiąc wprost, to najlepsza odpowiedź za dolara z całej trójki. Firma wymienia także czterech partnerów wczesnego dostępu — Ponder, Revyl, Mosaic i Resemble.AI — którzy rozwijali model {{1}}przed ogólną dostępnością{{/1}}, co jest szczegółem sugerującym realne zastosowanie produkcyjne, a nie tylko slajdy z prezentacji. Wyniki żadnego z tych partnerów nie zostały opublikowane, więc wiarygodne stanowisko jest takie: mechanizm jest prawdziwy, kierunek jest oczywiście właściwy, {{2}}a konkretne wartości procentowe{{/2}} to deklaracja Google, dopóki nie zostaną niezależnie zweryfikowane.

Przypadki użycia, dla których stworzono tę funkcję

Ogłoszenie grupuje funkcjonalność w cztery kategorie, z których każda odpowiada konkretnemu zadaniu, które deweloper może wdrożyć:

• Wyszukiwanie momentów w ułamkach sekundy — precyzyjne wskazywanie zmian stanu trwających ułamki sekundy oraz ciasnych granic cięć, których siatka 1 FPS zupełnie nie wychwytuje. To przypadek użycia w automatycznej edycji wideo: znalezienie dokładnej klatki, w której następuje zmiana sceny.

• Wyszukiwanie igły w stogu siana w długich materiałach — odpowiadanie na konkretne zapytanie dotyczące wielogodzinnego wideo bez zużywania milionów tokenów. To różnica między „obejrzyj tę 3-godzinną rozmowę” a „czy klient zgodził się na przedłużenie podczas tej 3-godzinnej rozmowy?”

• Wykrywanie anomalii — model ponownie próbkuje interesujące okna czasowe przy wyższej częstotliwości klatek, aby zbadać szybkie ruchy i subtelne artefakty wizualne. Kontrola jakości w produkcji, analiza sportowa i nagrania z monitoringu to oczywiste zastosowania.

• Liczenie czynności i obiektów — śledzenie powtarzanych ruchów fizycznych i odrębnych obiektów w czasie, które statyczne próbkowanie zaniża, gdy to, co jest liczone, porusza się szybciej niż częstotliwość próbkowania.

Które modele i ile kosztują

Funkcja jest dostępna w warstwie Flash, a rozpiętość cen między trzema modelami ma znaczenie przy wyborze, na który z nich ją skierować:

• Gemini 3.7 Flash — $0.75 za wejście / $3.75 za wyjście na milion tokenów w cenie promocyjnej, potwierdzonej do 31 grudnia 2026 roku, po czym cena podwaja się do $1.50 / $7.50. Lider pod względem stosunku dokładności do kosztów spośród tych trzech.

Gemini 3.6 Flash — 1,50 USD / 7,50 USD za milion tokenów. Stabilna, niepromocyjna opcja w tym trio.

Gemini 3.5 Flash-Lite — 0,30 USD / 2,50 USD za milion tokenów. Opcja budżetowa, do triażu wideo o dużej objętości, gdzie liczy się najtańszy token.

Ponieważ funkcja korzysta ze standardowych cen tokenów Gemini API bez dodatkowych opłat, redukcja tokenów o 88% bezpośrednio przekłada się na te stawki. Obciążenie, które kosztowało 100 dolarów za analizę statyczną, powinno kosztować mniej więcej od 12 do 34 dolarów w przypadku przetwarzania agentowego na tym samym modelu, zanim uwzględni się zyski z dokładności — co jest prawdziwą wiadomością dla każdego, czyj proces obecnie spala tokeny na ponowne przesyłanie lub próbkowanie klatek długich filmów.

Jak to włączyć?

Tryb jest włączany za pomocą pojedynczej flagi konfiguracyjnej — w żądaniu należy przekazać processing „agentic” — i działa z tymi samymi danymi wejściowymi i cenami co standardowe API. Nie ma osobnego endpointu, nowego wymiaru rozliczeń ani specjalnego limitu. Ścieżka Pythona wykorzystuje interfejs interactions API pakietu google-genai SDK, na przykład z modelem „gemini-3.7-flash” oraz wideo i promptem tekstowym jako danymi wejściowymi; wideo może być przesłane bezpośrednio, URI w Cloud Storage, publicznym adresem URL HTTP lub adresem URL YouTube — w zależności od powierzchni, z której korzystasz.

Dwie praktyczne ograniczenia, które warto znać przed rozpoczęciem budowy: pliki wideo podlegają limitom rozmiaru platformy (w przypadku ścieżki Enterprise Agent Platform wynoszą one około 15 MB na plik), a Gemini Enterprise Agent Platform obsługuje popularne formaty kontenerów — MP4, MOV, AVI, WebM, WMV, MPEG — więc przygotowanie formatu odbywa się przed wywołaniem API, a nie w jego trakcie.

Gdzie działa teraz i dokąd zmierza

W momencie premiery, agentowe rozumienie wideo jest dostępne dla przesłanych wideo i filmów z YouTube przez API Gemini w Google AI Studio oraz przez Gemini Enterprise Agent Platform — to jest powierzchnia dla deweloperów i przedsiębiorstw. Ogłoszono dwa wdrożenia konsumenckie, które nie są jeszcze aktywne: aplikacja Gemini, w której funkcja wkrótce będzie udostępniona wszystkim użytkownikom w modelach Flash i Flash-Lite, oraz funkcja „Ask YouTube” na stronie odtwarzania wideo w YouTube, która — według Google — pojawi się w nadchodzących miesiącach. Dla dewelopera oceniającego tę funkcję, API jest dziś najbardziej wiarygodnym miejscem do jej przetestowania; powierzchnie konsumenckie to zagranie dystrybucyjne, które spopularyzuje to sformułowanie.

Istnieje również sygnał ekosystemowy wart odnotowania: ponieważ funkcja jest dostarczana jako standardowy tryb API, projekty serwerów MCP i frameworków agentowych wykorzystujące rozumienie wideo Gemini — framework GenV do analityki spotkań, pakiety MCP do badań wideo oraz umiejętności wideo Gemini, które pojawiły się w ciągu ostatnich miesięcy — mogą ją przyjąć bez zmiany architektury. To modernizacja trybu, a nie nowy SDK, umożliwia obniżenie kosztów.

Co sprawdzić, zanim zaufasz procentom.

Każda liczba w ogłoszeniu — 66%, 88%, 7%, twierdzenie o granicy Pareto — pochodzi od Google, zmierzona na własnym zestawie testowym Google, i żadna z nich nie została odtworzona poza firmą. Kierunek nie budzi wątpliwości: pętla agentowa, która ładuje tylko istotne segmenty, nieuchronnie pokona stałą siatkę, która ładuje wszystko. Wielkość oszczędności to otwarte pytanie i będzie się różnić w zależności od obciążenia — 2-minutowy klip z jednym pytaniem nie da 88% oszczędności tokenów, bo niewiele jest do pominięcia; 3-godzinna rozmowa z jednym celowym pytaniem — tak. Właściwym testem jest własne długie wideo, uruchomione raz w trybie przetwarzania statycznego i raz w trybie agentowym, na tym samym modelu, licząc rzeczywiste tokeny i rzeczywiste koszty.

Screenshot of the Artificial Analysis model page for Gemini 3.7 Flash at high reasoning, showing an Intelligence Index of 56 (ranked #20 of 187 models), an output speed of 285 tokens per second in the high-reasoning configuration, and a price of $0.75 per 1M input and $3.75 per 1M output tokens.

Ekonomika tego testu to dokładnie miejsce, w którym warstwa routingu pokazuje swoją wartość. Gemini 3.6 Flash i Gemini 3.5 Flash-Lite — dwa z trzech modeli objętych tą funkcją — są serwowane na OrcaRouter w cenie katalogowej Google przekazywanej z 0% narzutu, więc obniżka ceny analizy wideo jest aktywna po naszej stronie tego samego dnia, w którym jest aktywna w Google; Gemini 3.7 Flash, trzeci i najnowszy, jest dostępny przez własne API Google oraz kilka platform zewnętrznych. A ponieważ agentowe rozumienie wideo to dopiero co wdrożona funkcja, której rzeczywiste różnice w działaniu nie zostały zweryfikowane, jest to podręcznikowy przypadek automatycznego failoveru: skieruj część ruchu wideo na tryb agentowy, pozwól routerowi przełączyć się z powrotem na sprawdzony model w przypadku błędów, limitów zapytań lub oczywistych regresji jakości, i utrzymuj bazową ścieżkę w działaniu, dopóki nowy tryb nie zasłuży na ten ruch.

Screenshot of the OrcaRouter model page for google/gemini-3.6-flash showing a 1M-token context window, $1.50 per 1M input and $7.50 per 1M output tokens, and Vision/Audio/Video/Tools/Reasoning capability chips.

Ta zmiana to coś więcej niż dodanie funkcji. Wideo od dwóch lat jest niewygodnym multimodalnym wejściem — niezwykle ekspresyjnym, niezwykle kosztownym w analizie i praktycznie czytanym ze stratą próbkowania. Agentowe rozumienie wideo to pierwsza poważna odpowiedź Google na wszystkie trzy problemy naraz, która trafia do najtańszego poziomu linii modeli, a nie do flagowca. Dla zespołów, które unikały obciążeń wideo ze względu na rachunek za tokeny, ten tryb warto dziś przeliczyć od nowa.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube