
Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash: Jeden ogląda wideo, drugi je tworzy
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Krótka odpowiedź: te dwa modele nie są substytutami, a porównanie ma sens tylko wtedy, gdy przestaniesz traktować „omni” jako kategorię. Qwen3.8-Omni-Flash, który dostawca udostępnił klientom API 18 września 2026 r., przyjmuje tekst, obraz, dźwięk i wideo, a zwraca tekst — to model do odczytywania godzinnego spotkania lub nagrania i mówienia, co się wydarzyło. Gemini Omni 1.1 Flash, który dostawca wydał 27 sierpnia 2026 r., przyjmuje prompt tekstowy lub obrazowy i zwraca wideo z zsynchronizowanym dźwiękiem — to model do tworzenia nagrania. Jeden konsumuje media, drugi je produkuje. Jeśli twój potok potrzebuje obu, potrzebujesz obu, a uczciwe pytanie nie brzmi, który wygrywa, lecz którego tak naprawdę ci brakuje.
Żaden z modeli nie ma otwartych wag, żadnego nie da się routować przez OrcaRouter, a oba są wyceniane na osiach, których nie można wzajemnie przeliczyć — po jednej stronie tokeny, po drugiej sekundy wygenerowanego wideo. To, gdzie naprawdę się pokrywają, jest węższe, niż sugeruje narracja „omni kontra omni”, a tę część wspólną warto precyzyjnie ustalić przed arytmetyką cen, bo właśnie w arytmetyce cen te dwa modele najczęściej porównuje się błędnie.
Błąd kategorii, który warto najpierw wyjaśnić
Materiały premierowe Alibaby porównują Qwen3.8-Omni-Flash z Gemini 3.8 Flash, a wiele późniejszych publikacji sprowadziło to do „przebija Gemini”. To inny model Google niż Gemini Omni 1.1 Flash, i te dwa modele nie są wymiennymi punktami odniesienia: Gemini 3.8 Flash to uniwersalny model multimodalny, a Gemini Omni 1.1 Flash to model do generowania wideo z osobnym cennikiem i osobnym interfejsem API. Każda liczba Qwen kontra Gemini krążąca po premierze — WildClawBench-MM 71,0 wobec 58,9, SpotSoundBench 67,2 wobec 39,7, AgenticVBench 36,8 wobec 45,0 — dotyczy Gemini 3.8 Flash, a nie modelu wideo Omni, i tak czy inaczej żadna z nich nie jest niezależna. Jeśli trafiłeś tutaj z tabelą wyników, która stawia oba modele z tego artykułu na tej samej osi, to prawie na pewno w prawej kolumnie jest niewłaściwy model Google.
Co tak naprawdę robi każde z nich
• Co przyjmuje na wejściu — Qwen3.8-Omni-Flash przyjmuje tekst, obraz, dźwięk i wideo, w tym dźwięk stereo i czterokanałowy dźwięk przestrzenny; Gemini Omni 1.1 Flash przyjmuje polecenia tekstowe i obrazowe oraz do trzech sekund wideo referencyjnego.
• Co zwraca — Qwen3.8-Omni-Flash zwraca tylko tekst; Gemini Omni 1.1 Flash zwraca wideo z natywnie zsynchronizowanym dźwiękiem, w scenach, które można wydłużać do 40 sekund w przyrostach dziesięciosekundowych.
• Możliwości kontroli — Qwen3.8-Omni-Flash udostępnia kontekst, próbkowanie oraz tryb agentowy, który sam decyduje, na co patrzeć; Gemini Omni 1.1 Flash udostępnia kontrolę pierwszej i ostatniej klatki, dziesięciosekundowe okno wsteczne zapewniające ciągłość oraz poziom roboczy 360p, który według Google kosztuje około jedną trzecią ceny i jest około 60% szybszy.
• Rozdzielczość i wykończenie — Qwen3.8-Omni-Flash nie ma rozdzielczości wyjściowej, ponieważ nie generuje żadnych multimediów; Gemini Omni 1.1 Flash generuje wyniki w rozdzielczości 720p, 1080p i 4K.
• Kontekst i czas trwania — Qwen3.8-Omni-Flash obsługuje milion tokenów oraz do godziny ciągłego materiału audio-wideo w jednym wywołaniu; Gemini Omni 1.1 Flash jest ograniczony przez generowany przez siebie klip, a nie przez okno wejściowe.
• Jak płacisz — Qwen3.8-Omni-Flash jest rozliczany za token: 0,15 USD za milion tokenów wejściowych, 0,016 USD za tokeny z pamięci podręcznej i 0,47 USD za tokeny wyjściowe w cenniku międzynarodowym; Gemini Omni 1.1 Flash jest rozliczany za sekundę wygenerowanego wideo, a opublikowana przez Google stawka wynosi 0,10 USD za sekundę dla 720p.
• Otwartość — zamknięta po obu stronach. Brak wag dla obu modeli, a żaden z nich nie jest dziś dostępny do routowania przez nasze API.

Część wspólna to rozumienie wideo i jest ona asymetryczna.
Jedynym miejscem, w którym kupujący mógłby rozsądnie postawić je obok siebie, jest potok przetwarzania, który musi zarówno rozumieć materiał wideo, jak i go tworzyć — powiedzmy, asystent montażu, który czyta długie nagranie, znajduje momenty warte zachowania i generuje montaż. Jeśli chodzi o część rozumiejącą, Qwen3.8-Omni-Flash jest stworzony dokładnie do tego: godzina ciągłego dźwięku i wideo na wywołanie, rozdzielanie mówców oraz tryb agentowy, który podnosi dokładność na firmowym OmniVideoBench z 63,4 do 67,8, jednocześnie zmniejszając liczbę tokenów na zapytanie ze 145 736 do 79 117. Jeśli chodzi o część produkcyjną, Gemini Omni 1.1 Flash to ten, który potrafi wygenerować wynikowy klip z zsynchronizowanym dźwiękiem, a model Qwen nie potrafi wygenerować ani jednej klatki wideo.
Asymetria działa też w drugą stronę i łatwiej ją przeoczyć. Zdolność modelu generowania wideo do rozumienia jest instrumentalna — potrzebuje wystarczająco dużo informacji o scenie, by utrzymać spójność ujęcia przy dziesięciosekundowym przedłużeniu, co jest innym wymaganiem niż odpowiedź na pytanie o to, co powiedziano w trzeciej godzinie spotkania. Model Google ma dłuższy dorobek w zakresie jakości generowania, a krótszy w analizie długich treści; w przypadku modelu Alibaby jest odwrotnie. Jeśli twoim zadaniem jest „znaleźć te trzy minuty, które mają znaczenie w tym nagraniu”, model generowania nie jest właściwym narzędziem. Jeśli twoim zadaniem jest „wygenerować trzydziestosekundowy klip zgodny z tym briefem”, model rozumienia też nie jest właściwym narzędziem.
Dlaczego porównywanie cen ciągle idzie źle
Stawka za sekundę i stawka za token nie dają się przeliczyć, a próba ich przeliczenia prowadzi do dwóch błędów, które dominują w tym porównaniu. Pierwszy to porównywanie całego wygenerowanego klipu ze stawką za token na wejściu i wyciąganie wniosku, że model wideo jest setki razy droższy — co jest prawdą i nie ma znaczenia, ponieważ nie sprzedają tego samego. Drugi to porównywanie wyłącznie cen wejściowych i przeoczenie faktu, że 98-procentowa obniżka cen audio firmy Alibaba dotyczy godzin audio na wejściu, podczas gdy stawka Google dotyczy sekund wideo na wyjściu, więc te dwie „obniżki” nie są nawet po tej samej stronie licznika.
Uczciwie można powiedzieć tyle: zgodnie z metodologią, którą podaje sam Alibaba — dwuminutowa próbka pomnożona przez trzydzieści, wideo w 720p i jedna klatka na sekundę — godzina połączonego wejścia audio i wideo do Qwen3.8-Omni-Flash jest wyceniana na około 0,20 USD, w porównaniu z 3,27 USD w poprzedniej generacji. Wygenerowanie czterdziestu sekund wideo 720p za pomocą Gemini Omni 1.1 Flash przy opublikowanej przez Google stawce 0,10 USD za sekundę kosztuje 4,00 USD, a przygotowanie tych samych czterdziestu sekund w 360p oscyluje wokół 1,20 USD przy przyjętym przez Google założeniu jednej trzeciej kosztu. Oba zestawy liczb pochodzą od dostawców i żaden nie został niezależnie odtworzony. Użyteczny wniosek nie polega na tym, która liczba jest mniejsza, lecz na tym, że analiza godziny materiału i wygenerowanie czterdziestu sekund z niego mieszczą się w tym samym rzędzie wielkości — i to jest prawdziwy powód, dla którego potok produkcyjny robiący jedno i drugie potrzebuje modelu kosztów, a nie zwycięzcy.
To także argument za tym, by trzymać oba na jednym kluczu, a nie na dwóch umowach. Żadnego z modeli omni nie da się dziś trasować przez OrcaRouter: Qwen3.8-Omni-Flash działa wyłącznie na platformach samego Alibaby, a Google nie otworzyło API wideo Omni na trasowanie przez podmioty trzecie, więc nie hostujemy żadnego z nich i nie będziemy udawać, że jest inaczej. W naszym katalogu dostępne są modele siostrzane z każdej rodziny — Qwen3.8-Flash i Gemini 3.8 Flash — oba można dziś wywołać przez jeden punkt końcowy w cenie katalogowej dostawcy z 0% marży, co sprawia, że test A/B na tle własnych wyników każdego z dostawców to kwestia zmiany konfiguracji, a nie drugiej integracji.

Gdzie każdy z nich wygrywa — powiedziane wprost
Qwen3.8-Omni-Flash wygrywa w każdej kategorii mierzonej w godzinach danych wejściowych: transkrypcja spotkań i diaryzacja, streszczanie długich nagrań, intensywne korzystanie z narzędzi agentowych w scenariuszach z dużą ilością dźwięku oraz koszt na godzinę przetworzonych multimediów. Deklarowane przez dostawcę wyniki audio są mocne, a jego słabość tkwi tam, gdzie model nigdy nie był ukierunkowany — w rankingach silnie nastawionych na rozumowanie, w których pierwsze testy przeprowadzone przez strony trzecie umieściły go w 28. percentylu pod względem rozumowania, z wynikiem szybkości w 21. percentylu, na próbie tak małej, że liczby te należy traktować raczej jako zachętę do testowania niż jako werdykt.
Gemini Omni 1.1 Flash wygrywa jakością wyników: generowaniem ujęć z zsynchronizowanym dźwiękiem, ciągłością w rozbudowanych scenach, kontrolą na poziomie klatki i wykończeniem w 4K, którego pipeline dostarczania może po prostu wymagać. Jego przewaga nie tkwi w wyniku benchmarku — polega na tym, że drugi model w ogóle nie potrafi wykonać tego zadania. Słabszy jest we wszystkim, co wymaga utrzymania godziny kontekstu, bo nie jest do tego zbudowany.
Decyzja i to, na co warto uważać
Jeśli wybierasz między nimi, pytanie brzmi, która połowa pipeline'u pozostaje nieobsłużona. Zespół, który już generuje wideo i potrzebuje rozumieć długie nagrania, powinien przetestować Qwen3.8-Omni-Flash na własnym audio w tym tygodniu; zespół, który analizuje media i potrzebuje je produkować, powinien przetestować Gemini Omni 1.1 Flash. Zespół, który potrzebuje obu, ma do czynienia z dwoma dostawcami, dwoma modelami rozliczeń i dwiema integracjami, a to sytuacja, w której pojedyncza warstwa routingu przestaje być udogodnieniem i zaczyna być tym, co sprawia, że model kosztów pozostaje czytelny.
Dwie rzeczy zmieniłyby ten odczyt. Niezależna ocena Qwen3.8-Omni-Flashzastąpiłaby każdą podaną powyżej liczbę dostawcy porównywalnym odpowiednikiem — taki jeszcze nie istnieje, a jego brak to największa pojedyncza luka w tym porównaniu. A opublikowana stawka za wyjście 1080p i 4K od Google pozwoliłaby zweryfikować arytmetykę dla wysokiej półki; dziś te liczby krążą wyłącznie jako szacunki rynkowe, a nie jako własny cennik Google'a.

Na koniec jedna uwaga o sposobie ujęcia tematu. „Omni” przestało już oznaczać cokolwiek precyzyjnego — obejmuje teraz model, który przetwarza godzinę nagrania audio ze spotkania, oraz taki, który renderuje czterdziestosekundowy klip z dźwiękiem, a traktowanie tego słowa jako kategorii sprawia, że nabywcy w końcu porównują stawkę za token ze stawką za sekundę i wyciągają z tego wniosek. Te modele wzajemnie się uzupełniają, a ich zakresy pokrywają się tylko w niewielkim stopniu, i właściwa postawa wobec obu — pięć dni i cztery tygodnie po ich odpowiednich premierach — jest taka sama: mierzyć je na własnym materiale i utrzymywać otwartą drugą ścieżkę.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
