Główna karta tytułowa artykułu o premierze Gemini Omni 1.1 Flash. Duży nagłówek brzmi: „Gemini Omni 1.1 Flash — większa kontrola nad Twoim wideo”. Cztery chipy funkcji brzmią: „Rozszerzenie sceny do 40 s”, „Kontrola pierwszej/ostatniej klatki”, „Szkicowanie w 360p przy ~1/3 kosztów”, „Wyjście 1080p i 4K”. Stopka brzmi: „Wydano 27 sierpnia 2026 r. za pośrednictwem Gemini API.” Logo OrcaRouter jest umieszczone w prawym dolnym rogu.
Guides & Insights

Gemini Omni 1.1 Flash przechodzi w tryb produkcyjny: 40-sekundowe sceny, kontrola klatek i wykończenie 4K

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Gdy dasz modelowi wideo ostatnią sekundę klipu i poprosisz o kontynuację ujęcia, stawiasz na jego pamięć. To właśnie ma wyeliminować Gemini Omni 1.1 Flash — produkcyjne wydanie, które Go​gle wypuściło 27 sierpnia 2026 roku: zamiast sięgać tylko do ostatniej sekundy nagrania podczas rozszerzania sceny, model czyta teraz nawet dziesięć sekund. Przy okazji Go​gle przeniosło najbardziej pożądane elementy sterujące modelu z kolumny eksperymentalnej do produkcyjnej: warunkowanie pierwszą i ostatnią klatką, poziom roboczy 360p, który kosztuje około jednej trzeciej standardowego wyjścia 720p, oraz końcowe rendery do 4K. Cena podstawowego poziomu nie zmieniła się — klip 720p nadal kosztuje 0,10 USD za sekundę — więc ta premiera to opowieść o kontroli i kosztach, a nie o szoku cenowym.

Gemini Omni 1.1 Flash jest następcą podglądu Gemini Omni Flash, który trafił do deweloperów 30 czerwca 2026 roku, i dziedziczy wszystko, co czyniło oryginał niezwykłym: multimodalne dane wejściowe przyjmujące tekst, obrazy, audio i wideo w jednym wywołaniu, natywnie zsynchronizowany dźwięk w każdym klipie oraz konwersacyjną edycję wieloetapową, w której ulepszasz scenę, rozmawiając z modelem, zamiast ponownie tworzyć prompt od zera. To, co wnosi wersja 1.1, to brakujące narzędzia — długość, kadrowanie, rozdzielczość i koszt iteracji są teraz parametrami, które twórca może faktycznie ustawić.

Problem lookbacku, rozwiązany.

Najbardziej doniosłą zmianą jest kontekst. Wcześniejsze wersje modelu, kontynuując klip, odwoływały się wyłącznie do jego ostatniej sekundy, dlatego przedłużenia odbiegały pod względem charakteru, oświetlenia i ruchu kamery. Gemini Omni 1.1 Flash analizuje do 10 sekund wcześniejszego wideo, a przedłużenia działają w 10-sekundowych odstępach, do łącznej sumy 40 sekund. Praktyczna różnica to różnica między „zestawem sąsiadujących klipów” a „sekwencją odbieraną jako jedna scena”. W przypadku 30-sekundowej reklamy lub zapętlonego materiału marki to różnica między montażem a reżyserią.

• Rozszerzenie sceny. Kontynuuj istniejący klip w 10-sekundowych fragmentach do maksymalnie 40 sekund, z maksymalnie 10 sekundami kontekstu wstecznego, aby zachować spójność kontynuacji.

• Kontrola pierwszej/ostatniej klatki. Określ klatkę początkową i końcową ujęcia, a model wygeneruje ciągły film pomiędzy dwiema klatkami kluczowymi — to podstawa orbitowania kamery, przejść zoomem i płynnych pętli.

• Odniesienia wideo. Do trzech sekund materiału referencyjnego można uwzględnić w danych wejściowych multimodalnych, aby zachować postać, kostium i styl ruchu w całych ujęciach.

• Natywne audio. Wygenerowane klipy nadal zawierają zsynchronizowany dialog, efekty dźwiękowe i dźwięk otoczenia, więc wynik to gotowy short, a nie niemy materiał czekający na dodanie ścieżki dźwiękowej.

Kontrolki Veo, pipeline Omni

Ogłoszenie opiera się na sformułowaniu {{1}}„twoje ulubione kreatywne funkcje sterowania z Veo"{{/1}}, i jest to trafny opis tego, skąd pochodzą te funkcje. {{2}}Veo 3.1, osobny jednoprzebiegowy generator wideo o wysokiej wierności od Go​gle,{{/2}} miał już w swoim zestawie narzędzi {{3}}warunkowanie na podstawie klatek kluczowych i upscaling{{/3}}; Gemini Omni 1.1 Flash przenosi ten język sterowania do multimodalnego potoku Omni — gdzie danymi wejściowymi mogą być obrazy, audio i wideo referencyjne, a edycja ma charakter konwersacyjny, zamiast polegać na generowaniu od nowa za każdym razem. Te dwa modele nie są konkurentami w {{4}}ofercie Go​gle{{/4}}; {{5}}dokumentacja API Gemini{{/5}} wskazuje Gemini Omni Flash jako {{6}}domyślny zalecany wybór do generowania wideo{{/6}}, a Veo jako specjalistę od wyższej wierności.

To ma znaczenie z praktycznego powodu: sterowanie znajduje się teraz w modelu, który najprawdopodobniej wywołujesz w codziennej pracy z wideo, a nie w osobnej warstwie premium, do której musisz się dostać, ucząc się drugiego API. Kontrola klatek, szkicowanie i skalowanie w górę współdzielą jeden endpoint i jeden model cenowy.

Przepływ pracy od wersji roboczej do finalnej

Poziom szkicowania 360p to najmniej nagłośniona funkcja w ogłoszeniu i prawdopodobnie najcenniejsza. Podglądy w 360p renderują się nawet o 60% szybciej niż standardowe 720p i kosztują mniej więcej jedną trzecią ceny, co całkowicie zmienia ekonomikę iteracji. Według podawanych stawek za sekundę, 10-sekundowy szkic w 360p kosztuje około 0,30 USD wobec 1,00 USD w 720p — trzy rundy eksploracji za cenę jednego finalnego renderu.

Zamierzony przepływ pracy jest oczywisty: tworzysz storyboard i iterujesz w 360p, a następnie renderujesz jedno ujęcie, które działa w 720p, 1080p lub 4K. Dla zespołu produkującego wersje na social media lub warianty reklam, poziom roboczy zamienia przepływ pracy ograniczony kosztami w taki, w którym ograniczeniem jest eksploracja. Podane tu liczby dotyczące szybkości i kosztów pochodzą od dostawcy — to własne deklaracje firmy Go​gle, jak dotąd niezweryfikowane — ale arytmetyka na ich podstawie jest prosta.

A generated scoreboard titled 'Gemini Omni 1.1 Flash — the scoreboard'. Six rows read 'Max scene length: 40s (10s increments)', 'Lookback context: 10s (was 1s)', 'Resolution: 720p, 1080p, 4K', 'Frame control: first/last frame', 'Draft tier: 360p, ~1/3 cost, ~60% faster', 'Independent benchmark: none yet'. A footer reads 'Vendor-reported; no independent scores yet. 720p $0.10/s per Google.' The OrcaRouter logo is composited in the bottom-right corner.

Obraz cenowy

Podawana wielokrotnie cena 0,10 USD za sekundę to opublikowany przez Go​gle standardowy poziom 720p, niezmieniony od wersji zapoznawczej. Wejście kosztuje 1,50 USD za milion tokenów, niezależnie od tego, czy tokeny te są tekstem, obrazami, dźwiękiem czy wideo, a wyjście tekstowe kosztuje 9,00 USD za milion tokenów — ta sama struktura co w oryginale. Poziom 360p wynosi około 0,03 USD za sekundę, co wynika z opisu Go​gle jako „mniej więcej jedna trzecia kosztów” i co obecnie pokazują oferty resellerów.

To, czego Go​gle nie opublikował, to stawka za sekundę dla nowych poziomów 1080p i 4K. Oferty resellerów podają $0.15 za sekundę dla 1080p i $0.30 za sekundę dla 4K, ale to są szacunki rynkowe, a nie dane Go​gle — traktuj wszelkie budżety produkcji w wysokiej rozdzielczości jako tymczasowe, dopóki oficjalna stawka nie pojawi się na stronie cenowej Gemini API. Dla poczucia skali: w pełni rozszerzona scena 40-sekundowa w 720p kosztuje do $4.00, 10-sekundowy finalny materiał w 4K to około $3.00 według stawki podawanej przez resellerów, a te same 10 sekund w wersji roboczej 360p to około $0.30.

Ceny za sekundę to główny punkt oferty, ale kwota, którą faktycznie płacisz, jest ustalana przez platformę, przez którą kupujesz — {{1}}Go​gle{{/1}} sprzedaje po cenie katalogowej, a resellerzy i bramki API doliczają własne marże. To właśnie dlatego zasada 0% marży ma znaczenie po stronie infrastruktury: OrcaRouter przekazuje cenę katalogową dostawcy wprost, więc gdy stawka modelu się zmienia, cena po naszej stronie zmienia się tego samego dnia, bez warstwy marży między tobą a opublikowaną ceną producenta. Nie przekierowujemy jeszcze ruchu do Gemini Omni 1.1 Flash — {{2}}Go​gle{{/2}} nie udostępniło jeszcze API wideo Omni do routingu przez podmioty trzecie i nie twierdzimy, że hostujemy model, którego nie hostujemy — ale właśnie o tę dyscyplinę cenową chodzi, a gdy ten poziom API zostanie udostępniony, model pojawi się w cenie katalogowej.

A screenshot of the Gemini API Pricing page (ai.google.dev, captured August 28, 2026) showing the developer-docs navigation (Models, Gemini Omni Flash, Veo, Nano Banana, Imagen), the 'Gemini Developer API pricing' heading, and the Free tier card for developers getting started with the Gemini API — Google's own page for the model family's pricing and availability tiers.

Gdzie możesz to wywołać

Gemini Omni 1.1 Flash jest już dostępny pod identyfikatorem modelu gemini-omni-1.1-flash za pośrednictwem interfejsu Gemini API w Go​gle AI Studio, określany jako gotowy do produkcji, a nie wersja zapoznawcza. Jest również dostępny za pośrednictwem platformy Gemini Enterprise Agent Platform dla obciążeń produkcyjnych — ten sam interfejs, z którym już integrują się Adobe, Figma, GMI Cloud i Runway, zgodnie z ogłoszeniem. Po stronie konsumenckiej Go​gle Flow oferuje pełen zestaw funkcji wszystkim subskrybentom AI Plus, Pro i Ultra na całym świecie, a rozszerzenie sceny jest już dostępne w aplikacji Gemini. To nie jest papierowa premiera: API, platforma agentowa i powierzchnie konsumenckie zostały uruchomione tego samego dnia.

Jeśli wypróbowałeś wersję zapoznawczą z czerwca i zniechęcił cię sztywny limit 10 sekund lub niemożność utrzymania spójności sceny, to wydanie odpowiada na te dokładne zarzuty — 40 sekund rozszerzenia, działające referencje wideo i odpowiednia drabina rozdzielczości. Warto też poznać strukturę API: generowanie i edycja przebiegają przez Interactions API, co umożliwia konwersacyjny model edycji wieloetapowej, a response_format to ustawienie, które może przypinać rozdzielczość wyjściową — 360p dla wersji roboczych, pełna rozdzielczość dla wersji finalnych.

A screenshot of the Gemini API developer documentation Models page (ai.google.dev, captured August 28, 2026) showing the docs navigation under 'Gemini API' — Models, Gemini Omni Flash, Nano Banana, Veo, Imagen — and the list of Gemini's generation models. It is the vendor's official developer page for the model family.

Co wciąż nie zostało udowodnione

Mimo wszystkich nowych opcji kontroli, kompromisy, które definiowały oryginał, pozostają aktualne. Wynik to nadal krótkie filmy z zsynchronizowanym dźwiękiem, a nie zamiennik Veo 3.1 — te dwa modele służą do różnych zadań. Spójność postaci między zmianami scen jest poprawiona dzięki 10-sekundowemu podglądowi wstecznemu i referencyjnemu wideo na wejściu, ale pozostaje to słabością generatywną, którą warto sprawdzić na własnym materiale, zamiast zakładać z góry. Każdy wygenerowany klip zawiera znak wodny SynthID, co ma znaczenie dla narzędzi wymagających gwarancji pochodzenia.

I uczciwe zastrzeżenie: nie ma niezależnego benchmarku dla Gemini Omni 1.1 Flash na żadnym publicznym rankingu wideo w chwili pisania tego tekstu. Przyspieszenie o 60% w przypadku wersji roboczych 360p, jakość w 1080p i 4K, niezawodność warunkowania pierwszą/ostatnią klatką — wszystko to deklaracje producenta, niepotwierdzone przez żadną stronę trzecią. Każdy, kto podaje ci dziś wynik jakościowy dla tego modelu, cytuje liczbę, której nikt poza laboratoriami Go​gle nie wygenerował.

Kto powinien się teraz ruszyć?

Trzy grupy od razu zyskują na tym wydaniu. Zespoły, które już budują na Omni API, powinny przełączyć identyfikatory modeli i ponownie przetestować swoje ścieżki rozszerzeń i kontroli klatek — ta aktualizacja to zmiana pola żądania, a nie przebudowa architektury. Każdy, kto potrzebuje krótkich wideo na dużą skalę — warianty reklam, cięcia na social media, zapętlone materiały markowe — powinien wycenić workflow od wersji roboczej do finalnej w 360p, bo właśnie tam kalkulacja kosztów jest naprawdę nowa. A zespoły, które czekały na preview, powinny teraz wypróbować model, ponieważ dwie przeszkody, które czyniły preview bezużytecznym w produkcji — dziesięciosekundowe klipy i brak ciągłości scen — to dokładnie to, co usuwa ta aktualizacja.

Grupa, która powinna się wstrzymać, jest równie dobrze określona: jeśli przed zaangażowaniem budżetu potrzebujesz zewnętrznego benchmarku lub oficjalnej stawki za 4K na sekundę, nikt ich jeszcze nie ma i warto to powiedzieć wprost, zamiast zacierać. Wydanie jest realne, mechanizmy kontrolne są realne, a kwestia cen to jedyna część, która wciąż się zmienia. Śledź stronę cenową Gemini API pod kątem stawek dla 1080p i 4K oraz wypatruj pierwszych niezależnych ocen — w momencie, gdy ktoś inny uruchomi ten model, zastrzeżenie zgłaszane przez dostawcę dotyczące każdej jakościowej deklaracji w tym artykule otrzyma znacznik wyboru lub czerwoną flagę.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube