
Gemini Omni 1.1 Flash przechodzi w tryb produkcyjny: 40-sekundowe sceny, kontrola klatek i wykończenie 4K
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianNOWOŚĆQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
Gdy dasz modelowi wideo ostatnią sekundę klipu i poprosisz o kontynuację ujęcia, stawiasz na jego pamięć. To właśnie ma wyeliminować Gemini Omni 1.1 Flash — produkcyjne wydanie, które Gogle wypuściło 27 sierpnia 2026 roku: zamiast sięgać tylko do ostatniej sekundy nagrania podczas rozszerzania sceny, model czyta teraz nawet dziesięć sekund. Przy okazji Gogle przeniosło najbardziej pożądane elementy sterujące modelu z kolumny eksperymentalnej do produkcyjnej: warunkowanie pierwszą i ostatnią klatką, poziom roboczy 360p, który kosztuje około jednej trzeciej standardowego wyjścia 720p, oraz końcowe rendery do 4K. Cena podstawowego poziomu nie zmieniła się — klip 720p nadal kosztuje 0,10 USD za sekundę — więc ta premiera to opowieść o kontroli i kosztach, a nie o szoku cenowym.
Gemini Omni 1.1 Flash jest następcą podglądu Gemini Omni Flash, który trafił do deweloperów 30 czerwca 2026 roku, i dziedziczy wszystko, co czyniło oryginał niezwykłym: multimodalne dane wejściowe przyjmujące tekst, obrazy, audio i wideo w jednym wywołaniu, natywnie zsynchronizowany dźwięk w każdym klipie oraz konwersacyjną edycję wieloetapową, w której ulepszasz scenę, rozmawiając z modelem, zamiast ponownie tworzyć prompt od zera. To, co wnosi wersja 1.1, to brakujące narzędzia — długość, kadrowanie, rozdzielczość i koszt iteracji są teraz parametrami, które twórca może faktycznie ustawić.
Problem lookbacku, rozwiązany.
Najbardziej doniosłą zmianą jest kontekst. Wcześniejsze wersje modelu, kontynuując klip, odwoływały się wyłącznie do jego ostatniej sekundy, dlatego przedłużenia odbiegały pod względem charakteru, oświetlenia i ruchu kamery. Gemini Omni 1.1 Flash analizuje do 10 sekund wcześniejszego wideo, a przedłużenia działają w 10-sekundowych odstępach, do łącznej sumy 40 sekund. Praktyczna różnica to różnica między „zestawem sąsiadujących klipów” a „sekwencją odbieraną jako jedna scena”. W przypadku 30-sekundowej reklamy lub zapętlonego materiału marki to różnica między montażem a reżyserią.
• Rozszerzenie sceny. Kontynuuj istniejący klip w 10-sekundowych fragmentach do maksymalnie 40 sekund, z maksymalnie 10 sekundami kontekstu wstecznego, aby zachować spójność kontynuacji.
• Kontrola pierwszej/ostatniej klatki. Określ klatkę początkową i końcową ujęcia, a model wygeneruje ciągły film pomiędzy dwiema klatkami kluczowymi — to podstawa orbitowania kamery, przejść zoomem i płynnych pętli.
• Odniesienia wideo. Do trzech sekund materiału referencyjnego można uwzględnić w danych wejściowych multimodalnych, aby zachować postać, kostium i styl ruchu w całych ujęciach.
• Natywne audio. Wygenerowane klipy nadal zawierają zsynchronizowany dialog, efekty dźwiękowe i dźwięk otoczenia, więc wynik to gotowy short, a nie niemy materiał czekający na dodanie ścieżki dźwiękowej.
Kontrolki Veo, pipeline Omni
Ogłoszenie opiera się na sformułowaniu {{1}}„twoje ulubione kreatywne funkcje sterowania z Veo"{{/1}}, i jest to trafny opis tego, skąd pochodzą te funkcje. {{2}}Veo 3.1, osobny jednoprzebiegowy generator wideo o wysokiej wierności od Gogle,{{/2}} miał już w swoim zestawie narzędzi {{3}}warunkowanie na podstawie klatek kluczowych i upscaling{{/3}}; Gemini Omni 1.1 Flash przenosi ten język sterowania do multimodalnego potoku Omni — gdzie danymi wejściowymi mogą być obrazy, audio i wideo referencyjne, a edycja ma charakter konwersacyjny, zamiast polegać na generowaniu od nowa za każdym razem. Te dwa modele nie są konkurentami w {{4}}ofercie Gogle{{/4}}; {{5}}dokumentacja API Gemini{{/5}} wskazuje Gemini Omni Flash jako {{6}}domyślny zalecany wybór do generowania wideo{{/6}}, a Veo jako specjalistę od wyższej wierności.
To ma znaczenie z praktycznego powodu: sterowanie znajduje się teraz w modelu, który najprawdopodobniej wywołujesz w codziennej pracy z wideo, a nie w osobnej warstwie premium, do której musisz się dostać, ucząc się drugiego API. Kontrola klatek, szkicowanie i skalowanie w górę współdzielą jeden endpoint i jeden model cenowy.
Przepływ pracy od wersji roboczej do finalnej
Poziom szkicowania 360p to najmniej nagłośniona funkcja w ogłoszeniu i prawdopodobnie najcenniejsza. Podglądy w 360p renderują się nawet o 60% szybciej niż standardowe 720p i kosztują mniej więcej jedną trzecią ceny, co całkowicie zmienia ekonomikę iteracji. Według podawanych stawek za sekundę, 10-sekundowy szkic w 360p kosztuje około 0,30 USD wobec 1,00 USD w 720p — trzy rundy eksploracji za cenę jednego finalnego renderu.
Zamierzony przepływ pracy jest oczywisty: tworzysz storyboard i iterujesz w 360p, a następnie renderujesz jedno ujęcie, które działa w 720p, 1080p lub 4K. Dla zespołu produkującego wersje na social media lub warianty reklam, poziom roboczy zamienia przepływ pracy ograniczony kosztami w taki, w którym ograniczeniem jest eksploracja. Podane tu liczby dotyczące szybkości i kosztów pochodzą od dostawcy — to własne deklaracje firmy Gogle, jak dotąd niezweryfikowane — ale arytmetyka na ich podstawie jest prosta.

Obraz cenowy
Podawana wielokrotnie cena 0,10 USD za sekundę to opublikowany przez Gogle standardowy poziom 720p, niezmieniony od wersji zapoznawczej. Wejście kosztuje 1,50 USD za milion tokenów, niezależnie od tego, czy tokeny te są tekstem, obrazami, dźwiękiem czy wideo, a wyjście tekstowe kosztuje 9,00 USD za milion tokenów — ta sama struktura co w oryginale. Poziom 360p wynosi około 0,03 USD za sekundę, co wynika z opisu Gogle jako „mniej więcej jedna trzecia kosztów” i co obecnie pokazują oferty resellerów.
To, czego Gogle nie opublikował, to stawka za sekundę dla nowych poziomów 1080p i 4K. Oferty resellerów podają $0.15 za sekundę dla 1080p i $0.30 za sekundę dla 4K, ale to są szacunki rynkowe, a nie dane Gogle — traktuj wszelkie budżety produkcji w wysokiej rozdzielczości jako tymczasowe, dopóki oficjalna stawka nie pojawi się na stronie cenowej Gemini API. Dla poczucia skali: w pełni rozszerzona scena 40-sekundowa w 720p kosztuje do $4.00, 10-sekundowy finalny materiał w 4K to około $3.00 według stawki podawanej przez resellerów, a te same 10 sekund w wersji roboczej 360p to około $0.30.
Ceny za sekundę to główny punkt oferty, ale kwota, którą faktycznie płacisz, jest ustalana przez platformę, przez którą kupujesz — {{1}}Gogle{{/1}} sprzedaje po cenie katalogowej, a resellerzy i bramki API doliczają własne marże. To właśnie dlatego zasada 0% marży ma znaczenie po stronie infrastruktury: OrcaRouter przekazuje cenę katalogową dostawcy wprost, więc gdy stawka modelu się zmienia, cena po naszej stronie zmienia się tego samego dnia, bez warstwy marży między tobą a opublikowaną ceną producenta. Nie przekierowujemy jeszcze ruchu do Gemini Omni 1.1 Flash — {{2}}Gogle{{/2}} nie udostępniło jeszcze API wideo Omni do routingu przez podmioty trzecie i nie twierdzimy, że hostujemy model, którego nie hostujemy — ale właśnie o tę dyscyplinę cenową chodzi, a gdy ten poziom API zostanie udostępniony, model pojawi się w cenie katalogowej.

Gdzie możesz to wywołać
Gemini Omni 1.1 Flash jest już dostępny pod identyfikatorem modelu gemini-omni-1.1-flash za pośrednictwem interfejsu Gemini API w Gogle AI Studio, określany jako gotowy do produkcji, a nie wersja zapoznawcza. Jest również dostępny za pośrednictwem platformy Gemini Enterprise Agent Platform dla obciążeń produkcyjnych — ten sam interfejs, z którym już integrują się Adobe, Figma, GMI Cloud i Runway, zgodnie z ogłoszeniem. Po stronie konsumenckiej Gogle Flow oferuje pełen zestaw funkcji wszystkim subskrybentom AI Plus, Pro i Ultra na całym świecie, a rozszerzenie sceny jest już dostępne w aplikacji Gemini. To nie jest papierowa premiera: API, platforma agentowa i powierzchnie konsumenckie zostały uruchomione tego samego dnia.
Jeśli wypróbowałeś wersję zapoznawczą z czerwca i zniechęcił cię sztywny limit 10 sekund lub niemożność utrzymania spójności sceny, to wydanie odpowiada na te dokładne zarzuty — 40 sekund rozszerzenia, działające referencje wideo i odpowiednia drabina rozdzielczości. Warto też poznać strukturę API: generowanie i edycja przebiegają przez Interactions API, co umożliwia konwersacyjny model edycji wieloetapowej, a response_format to ustawienie, które może przypinać rozdzielczość wyjściową — 360p dla wersji roboczych, pełna rozdzielczość dla wersji finalnych.

Co wciąż nie zostało udowodnione
Mimo wszystkich nowych opcji kontroli, kompromisy, które definiowały oryginał, pozostają aktualne. Wynik to nadal krótkie filmy z zsynchronizowanym dźwiękiem, a nie zamiennik Veo 3.1 — te dwa modele służą do różnych zadań. Spójność postaci między zmianami scen jest poprawiona dzięki 10-sekundowemu podglądowi wstecznemu i referencyjnemu wideo na wejściu, ale pozostaje to słabością generatywną, którą warto sprawdzić na własnym materiale, zamiast zakładać z góry. Każdy wygenerowany klip zawiera znak wodny SynthID, co ma znaczenie dla narzędzi wymagających gwarancji pochodzenia.
I uczciwe zastrzeżenie: nie ma niezależnego benchmarku dla Gemini Omni 1.1 Flash na żadnym publicznym rankingu wideo w chwili pisania tego tekstu. Przyspieszenie o 60% w przypadku wersji roboczych 360p, jakość w 1080p i 4K, niezawodność warunkowania pierwszą/ostatnią klatką — wszystko to deklaracje producenta, niepotwierdzone przez żadną stronę trzecią. Każdy, kto podaje ci dziś wynik jakościowy dla tego modelu, cytuje liczbę, której nikt poza laboratoriami Gogle nie wygenerował.
Kto powinien się teraz ruszyć?
Trzy grupy od razu zyskują na tym wydaniu. Zespoły, które już budują na Omni API, powinny przełączyć identyfikatory modeli i ponownie przetestować swoje ścieżki rozszerzeń i kontroli klatek — ta aktualizacja to zmiana pola żądania, a nie przebudowa architektury. Każdy, kto potrzebuje krótkich wideo na dużą skalę — warianty reklam, cięcia na social media, zapętlone materiały markowe — powinien wycenić workflow od wersji roboczej do finalnej w 360p, bo właśnie tam kalkulacja kosztów jest naprawdę nowa. A zespoły, które czekały na preview, powinny teraz wypróbować model, ponieważ dwie przeszkody, które czyniły preview bezużytecznym w produkcji — dziesięciosekundowe klipy i brak ciągłości scen — to dokładnie to, co usuwa ta aktualizacja.
Grupa, która powinna się wstrzymać, jest równie dobrze określona: jeśli przed zaangażowaniem budżetu potrzebujesz zewnętrznego benchmarku lub oficjalnej stawki za 4K na sekundę, nikt ich jeszcze nie ma i warto to powiedzieć wprost, zamiast zacierać. Wydanie jest realne, mechanizmy kontrolne są realne, a kwestia cen to jedyna część, która wciąż się zmienia. Śledź stronę cenową Gemini API pod kątem stawek dla 1080p i 4K oraz wypatruj pierwszych niezależnych ocen — w momencie, gdy ktoś inny uruchomi ten model, zastrzeżenie zgłaszane przez dostawcę dotyczące każdej jakościowej deklaracji w tym artykule otrzyma znacznik wyboru lub czerwoną flagę.
