
Agentowe rozumienie wideo Gemini już dostępne: tryb API, który obniża koszty analizy wideo o dwie trzecie
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0259Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0258Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0166Inteligencja82Kod
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
1 września 2026 roku Google wprowadził agentowe rozumienie wideo dla Gemini 3.7 Flash, Gemini 3.6 Flash oraz Gemini 3.5 Flash-Lite — nowy tryb w interfejsie Gemini API, który przestaje traktować wideo jako stos klatek, a zaczyna traktować je jako dokument, w którym można wyszukiwać. Ogłoszenie Google DeepMind, napisane przez starszego menedżera produktu Rohana Doshiego i dyrektora badań Mario Lučicia, jest pierwszą poważną zmianą w sposobie, w jaki Gemini czyta wideo, od czasu gdy modele w ogóle uzyskały możliwość przyjmowania wideo: zamiast tego, że model po cichu przetwarza stałą próbkę klatek, teraz decyduje w trakcie odpowiedzi, na co patrzeć, z jaką prędkością i za pośrednictwem którego z trzech kanałów — klatek wizualnych, audio lub transkryptów. Najważniejszy efekt — w całości deklarowany przez dostawcę i niepotwierdzony dotąd niezależnie — jest taki, że analiza wideo jest do 66% tańsza, zużywa do 88% mniej tokenów i jest do 7% dokładniejsza niż podejście klatka po klatce, które zastępuje.
Co tak naprawdę zmienia „agentic" pod maską
Dawne zachowanie to to, co Google nazywa teraz przetwarzaniem „statycznym": podajesz Gemini wideo, a ono próbkuje klatki ze stałą szybkością — domyślnie jedną klatkę na sekundę — przepuszcza całą próbkę przez model i odpowiada na podstawie tego, co uchwyciła ta stała siatka. Ma to dwa strukturalne martwe pola. Zmiana stanu, która nastąpi między dwiema próbkowanymi klatkami, dla modelu po prostu nie istnieje. A dwugodzinne wideo próbkowane z szybkością 1 klatki na sekundę kosztuje fortunę w tokenach, z których większość pochłania materiał niemający nic wspólnego z pytaniem.
Agentowe rozumienie wideo zastępuje stałą siatkę pętlą. Model łączy swoje podstawowe rozumowanie z natywnymi narzędziami wideo, które pozwalają mu dynamicznie decydować, co oglądać, z jaką prędkością to oglądać oraz za pomocą której modalności to badać — klatki wizualne, ścieżkę audio lub transkrypt. Wywołuje wewnętrzne narzędzie, aby załadować tylko istotne fragmenty pliku, pobrać momenty i sygnały, których faktycznie potrzebuje pytanie, a następnie rozumuje nad tym, co pobrał. Google opisuje to jako ten sam wzorzec architektoniczny, co funkcja agentowego widzenia, którą wprowadził wcześniej: model nie jest już biernym konsumentem mediów; jest agentem, który odpytyuje media jak narzędzie.
Praktyczną konsekwencją jest to, że „co zobaczył model?" przestaje być kwestią szczęścia w próbkowaniu. Na pytanie o ujęcie trwające ułamek sekundy, ledwo widoczny defekt czy słowo wypowiedziane w szumie tła można odpowiedzieć, ponieważ model może ponownie przeskanować dokładnie to okno w wyższej rozdzielczości i z większą częstotliwością, w modalności, w której znajduje się odpowiedź.

Liczby, oznaczone jako to, czym są.
Własne porównanie benchmarkowe Google przetwarzania agentowego i statycznego jest sednem ogłoszenia i należy je traktować jako twierdzenie producenta, dopóki nie zostanie powtórzone przez zewnętrzną stronę. Na wewnętrznym zestawie testowym:
• Koszt — nawet o 66% niższy koszt analizy, dzięki temu, że model ładuje tylko potrzebne segmenty, zamiast całej ustalonej próbki.
• Tokeny — do 88% niższe zużycie tokenów, z największymi oszczędnościami w przypadku długich filmów: ogłoszenie w szczególności wymienia 10-minutowe przewodniki po nagraniach trwających wiele godzin.
• Dokładność — nawet o 7% lepsza w tych samych zadaniach, ponieważ zdarzenia subsekundowe i międzyklatkowe stają się widoczne, zamiast wpadać w luki próbkowania.
Google plasuje Gemini 3.7 Flash na „granicy Pareto dokładność-koszt" wśród testowanych modeli — mówiąc wprost, to najlepsza odpowiedź za dolara z całej trójki. Firma wymienia także czterech partnerów wczesnego dostępu — Ponder, Revyl, Mosaic i Resemble.AI — którzy rozwijali model {{1}}przed ogólną dostępnością{{/1}}, co jest szczegółem sugerującym realne zastosowanie produkcyjne, a nie tylko slajdy z prezentacji. Wyniki żadnego z tych partnerów nie zostały opublikowane, więc wiarygodne stanowisko jest takie: mechanizm jest prawdziwy, kierunek jest oczywiście właściwy, {{2}}a konkretne wartości procentowe{{/2}} to deklaracja Google, dopóki nie zostaną niezależnie zweryfikowane.
Przypadki użycia, dla których stworzono tę funkcję
Ogłoszenie grupuje funkcjonalność w cztery kategorie, z których każda odpowiada konkretnemu zadaniu, które deweloper może wdrożyć:
• Wyszukiwanie momentów w ułamkach sekundy — precyzyjne wskazywanie zmian stanu trwających ułamki sekundy oraz ciasnych granic cięć, których siatka 1 FPS zupełnie nie wychwytuje. To przypadek użycia w automatycznej edycji wideo: znalezienie dokładnej klatki, w której następuje zmiana sceny.
• Wyszukiwanie igły w stogu siana w długich materiałach — odpowiadanie na konkretne zapytanie dotyczące wielogodzinnego wideo bez zużywania milionów tokenów. To różnica między „obejrzyj tę 3-godzinną rozmowę” a „czy klient zgodził się na przedłużenie podczas tej 3-godzinnej rozmowy?”
• Wykrywanie anomalii — model ponownie próbkuje interesujące okna czasowe przy wyższej częstotliwości klatek, aby zbadać szybkie ruchy i subtelne artefakty wizualne. Kontrola jakości w produkcji, analiza sportowa i nagrania z monitoringu to oczywiste zastosowania.
• Liczenie czynności i obiektów — śledzenie powtarzanych ruchów fizycznych i odrębnych obiektów w czasie, które statyczne próbkowanie zaniża, gdy to, co jest liczone, porusza się szybciej niż częstotliwość próbkowania.
Które modele i ile kosztują
Funkcja jest dostępna w warstwie Flash, a rozpiętość cen między trzema modelami ma znaczenie przy wyborze, na który z nich ją skierować:
• Gemini 3.7 Flash — $0.75 za wejście / $3.75 za wyjście na milion tokenów w cenie promocyjnej, potwierdzonej do 31 grudnia 2026 roku, po czym cena podwaja się do $1.50 / $7.50. Lider pod względem stosunku dokładności do kosztów spośród tych trzech.
• Gemini 3.6 Flash — 1,50 USD / 7,50 USD za milion tokenów. Stabilna, niepromocyjna opcja w tym trio.
• Gemini 3.5 Flash-Lite — 0,30 USD / 2,50 USD za milion tokenów. Opcja budżetowa, do triażu wideo o dużej objętości, gdzie liczy się najtańszy token.
Ponieważ funkcja korzysta ze standardowych cen tokenów Gemini API bez dodatkowych opłat, redukcja tokenów o 88% bezpośrednio przekłada się na te stawki. Obciążenie, które kosztowało 100 dolarów za analizę statyczną, powinno kosztować mniej więcej od 12 do 34 dolarów w przypadku przetwarzania agentowego na tym samym modelu, zanim uwzględni się zyski z dokładności — co jest prawdziwą wiadomością dla każdego, czyj proces obecnie spala tokeny na ponowne przesyłanie lub próbkowanie klatek długich filmów.
Jak to włączyć?
Tryb jest włączany za pomocą pojedynczej flagi konfiguracyjnej — w żądaniu należy przekazać processing „agentic” — i działa z tymi samymi danymi wejściowymi i cenami co standardowe API. Nie ma osobnego endpointu, nowego wymiaru rozliczeń ani specjalnego limitu. Ścieżka Pythona wykorzystuje interfejs interactions API pakietu google-genai SDK, na przykład z modelem „gemini-3.7-flash” oraz wideo i promptem tekstowym jako danymi wejściowymi; wideo może być przesłane bezpośrednio, URI w Cloud Storage, publicznym adresem URL HTTP lub adresem URL YouTube — w zależności od powierzchni, z której korzystasz.
Dwie praktyczne ograniczenia, które warto znać przed rozpoczęciem budowy: pliki wideo podlegają limitom rozmiaru platformy (w przypadku ścieżki Enterprise Agent Platform wynoszą one około 15 MB na plik), a Gemini Enterprise Agent Platform obsługuje popularne formaty kontenerów — MP4, MOV, AVI, WebM, WMV, MPEG — więc przygotowanie formatu odbywa się przed wywołaniem API, a nie w jego trakcie.
Gdzie działa teraz i dokąd zmierza
W momencie premiery, agentowe rozumienie wideo jest dostępne dla przesłanych wideo i filmów z YouTube przez API Gemini w Google AI Studio oraz przez Gemini Enterprise Agent Platform — to jest powierzchnia dla deweloperów i przedsiębiorstw. Ogłoszono dwa wdrożenia konsumenckie, które nie są jeszcze aktywne: aplikacja Gemini, w której funkcja wkrótce będzie udostępniona wszystkim użytkownikom w modelach Flash i Flash-Lite, oraz funkcja „Ask YouTube” na stronie odtwarzania wideo w YouTube, która — według Google — pojawi się w nadchodzących miesiącach. Dla dewelopera oceniającego tę funkcję, API jest dziś najbardziej wiarygodnym miejscem do jej przetestowania; powierzchnie konsumenckie to zagranie dystrybucyjne, które spopularyzuje to sformułowanie.
Istnieje również sygnał ekosystemowy wart odnotowania: ponieważ funkcja jest dostarczana jako standardowy tryb API, projekty serwerów MCP i frameworków agentowych wykorzystujące rozumienie wideo Gemini — framework GenV do analityki spotkań, pakiety MCP do badań wideo oraz umiejętności wideo Gemini, które pojawiły się w ciągu ostatnich miesięcy — mogą ją przyjąć bez zmiany architektury. To modernizacja trybu, a nie nowy SDK, umożliwia obniżenie kosztów.
Co sprawdzić, zanim zaufasz procentom.
Każda liczba w ogłoszeniu — 66%, 88%, 7%, twierdzenie o granicy Pareto — pochodzi od Google, zmierzona na własnym zestawie testowym Google, i żadna z nich nie została odtworzona poza firmą. Kierunek nie budzi wątpliwości: pętla agentowa, która ładuje tylko istotne segmenty, nieuchronnie pokona stałą siatkę, która ładuje wszystko. Wielkość oszczędności to otwarte pytanie i będzie się różnić w zależności od obciążenia — 2-minutowy klip z jednym pytaniem nie da 88% oszczędności tokenów, bo niewiele jest do pominięcia; 3-godzinna rozmowa z jednym celowym pytaniem — tak. Właściwym testem jest własne długie wideo, uruchomione raz w trybie przetwarzania statycznego i raz w trybie agentowym, na tym samym modelu, licząc rzeczywiste tokeny i rzeczywiste koszty.

Ekonomika tego testu to dokładnie miejsce, w którym warstwa routingu pokazuje swoją wartość. Gemini 3.6 Flash i Gemini 3.5 Flash-Lite — dwa z trzech modeli objętych tą funkcją — są serwowane na OrcaRouter w cenie katalogowej Google przekazywanej z 0% narzutu, więc obniżka ceny analizy wideo jest aktywna po naszej stronie tego samego dnia, w którym jest aktywna w Google; Gemini 3.7 Flash, trzeci i najnowszy, jest dostępny przez własne API Google oraz kilka platform zewnętrznych. A ponieważ agentowe rozumienie wideo to dopiero co wdrożona funkcja, której rzeczywiste różnice w działaniu nie zostały zweryfikowane, jest to podręcznikowy przypadek automatycznego failoveru: skieruj część ruchu wideo na tryb agentowy, pozwól routerowi przełączyć się z powrotem na sprawdzony model w przypadku błędów, limitów zapytań lub oczywistych regresji jakości, i utrzymuj bazową ścieżkę w działaniu, dopóki nowy tryb nie zasłuży na ten ruch.

Ta zmiana to coś więcej niż dodanie funkcji. Wideo od dwóch lat jest niewygodnym multimodalnym wejściem — niezwykle ekspresyjnym, niezwykle kosztownym w analizie i praktycznie czytanym ze stratą próbkowania. Agentowe rozumienie wideo to pierwsza poważna odpowiedź Google na wszystkie trzy problemy naraz, która trafia do najtańszego poziomu linii modeli, a nie do flagowca. Dla zespołów, które unikały obciążeń wideo ze względu na rachunek za tokeny, ten tryb warto dziś przeliczyć od nowa.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
