Główna karta tytułowa dla Qwen3.8-Omni-Flash z nadtytułem „Alibaba – Qwen – 18 września 2026", podtytułem „Natywny model omni-modalny Qwen – tekst, obraz, dźwięk i wideo na wejściu, milion tokenów kontekstu, do godziny ciągłego audio-wideo na wywołanie" oraz trzema chipami statystyk o treści „Cena za milion tokenów: 0,15 USD wejście / 0,47 USD wyjście", „Koszt audio względem poprzedniej generacji: o 98% niższy" i „Modalność wyjściowa: tylko tekst".
Guides & Insights

Qwen3.8-Omni-Flash już jest: kontekst 1 mln tokenów, audio tańsze o 98%, tylko tekst na wyjściu

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Premiera udostępniła Qwen3.8-Omni-Flash klientom API dzisiaj, 18 września 2026, a liczbą, którą podano na pierwszym miejscu, jest rachunek, a nie wynik. Za godzinę wejścia audio, Qwen twierdzi, że nowy model kosztuje o 98% mniej niż jego poprzednik Qwen3.5-Omni-Plus; za godzinę połączonego audio i wideo, o 93% mniej. Cała reszta ogłoszenia wynika z tego ujęcia. Qwen3.8-Omni-Flash to natywny model omnimodalny — tekst, obraz, audio i wideo na wejściu, milion tokenów kontekstu, do pełnej godziny ciągłego audio-wideo w ramach jednego wywołania — a Alibaba sprzedaje go nie jako lepsze narzędzie do opisywania mediów, ale jako pierwszy model Qwen zbudowany, aby działać na nich. Hasło brzmi: „Omni Senses. Agentic Delivery.” Haczyk, wyraźnie podany w tych samych materiałach, polega na tym, że model odpowiada tylko tekstem: słyszy i widzi, ale nie mówi.

Nic z poniższego nie zostało niezależnie odtworzone. Model ma zaledwie kilka godzin, nie istnieje jeszcze żadna jego ocena ze strony podmiotów trzecich, a każdy wynik benchmarku i każda cena w materiałach premierowych pochodzą od samego Alibaba. Tam, gdzie liczba pochodzi od dostawcy, tekst mówi o tym w zdaniu, które ją zawiera; a tam, gdzie odczyt pochodzi od krytyka, a nie od dostawcy, jest on wyraźnie przypisany. Jedyna rzecz, która jest dziś niezależnie weryfikowalna — że model działa na platformach Alibaba, a nie w katalogu kogokolwiek innego — jest tym, o czym premiera chce mówić najmniej.

Co faktycznie zostało wydane

Karta specyfikacji jest nietypowo przejrzysta jak na premierę modelu omni-modalnego, co samo w sobie jest sednem tej historii: poprzednia generacja modeli omni w tej rodzinie była składana z osobnych enkoderów percepcji przykręconych do tekstowego LLM, a ten zbudowano bezpośrednio na linii architektury Qwen3.8-Flash, z modalnościami obsługiwanymi natywnie, a nie dosztukowanymi na siłę.

• Wejście — tekst, obraz, dźwięk i wideo, przy czym akceptowany jest dźwięk stereofoniczny i czterokanałowy dźwięk przestrzenny; wyjście to wyłącznie tekst.

• Kontekst — jeden milion tokenów, przy maksymalnym wejściu wynoszącym około 991 tys. (około 983 tys. w trybie myślenia), maksymalnym wyjściu na poziomie 131 tys. oraz budżecie rozumowania sięgającym 262 tys.

• Czas trwania — do jednej godziny ciągłego audio lub audio-wideo na połączenie, a to liczba, która umożliwia realizację przypadków użycia związanych ze spotkaniami i długimi materiałami wideo bez dzielenia na fragmenty.

• Zakres mowy — rozpoznawanie w 74 językach i generowanie mowy w 29 językach w towarzyszących narzędziach; jeden chińskojęzyczny opis wydania podaje 113 języków i dialektów dla wejścia audio.

• Dostępność — platforma Qianwen AI i Alibaba Cloud Model Studio (Bailian), pod identyfikatorem API qwen3-8-omni-flash. Wagi nie są udostępniane. Wariant Realtime jest opisywany jako pierwszy model omni-modalny z lokalizacją źródła dźwięku.

A single-model scoreboard for Qwen3.8-Omni-Flash with six rows: Released 18 Sep 2026, Context 1M tokens, Media per call 1 hour continuous A/V, Price $0.15 in / $0.47 out per M, Output text only, and Independent score none yet. A footer reads 'All figures vendor-reported from Alibaba's launch materials, 18 Sep 2026. No independent evaluation of this model exists at the time of writing.'

Te 98% to twierdzenie o kosztach, a arytmetyka, która za tym stoi, warta jest zobaczenia.

98-procentowa redukcja kosztu godziny dźwięku to znacznie większa liczba niż 98-procentowa redukcja ceny tokena, a różnica między tymi dwiema rzeczami to miejsce, w którym owo ogłoszenie wykonuje swoją pracę. Wartość na godzinę uzyskuje się, wyceniając dwuminutową próbkę i mnożąc ją przez trzydzieści, przy czym wideo jest próbkowane w 720p i z szybkością jednej klatki na sekundę. To uzasadniony sposób podawania obciążenia produkcyjnego, a jednocześnie opis tego, na co proszony jest patrzeć model: jedna klatka na sekundę wystarcza, by wiedzieć, co zostało powiedziane i z grubsza, co działo się na ekranie, ale zdecydowanie nie wystarcza, by analizować operacje na poziomie klatek, oceniać jakość montażu czy wychwycić artefakt w pojedynczej klatce. Mnożone są przez siebie dwie zmiany — prawdziwa obniżka ceny jednostkowej oraz znacznie bardziej agresywna polityka próbkowania — i tylko pierwsza z nich jest ulepszeniem modelu.

Same ceny jednostkowe są konkretne. Ceny międzynarodowe podawane są jako $0,15 za milion tokenów wejściowych, $0,016 za milion buforowanych tokenów wejściowych oraz $0,47 za milion tokenów wyjściowych. Krajowe ceny Bailian podawane są jako ¥0,8 za milion za multimodalne dane wejściowe, w porównaniu z około ¥18 wcześniej. Należy pamiętać, że międzynarodowy i chiński system rozliczeń są odrębne, a podane liczby nie są wymienne; każdy, kto porównuje je bezpośrednio, otrzyma błędny wynik.

To jest ta część wydania, w której routing ma większe znaczenie niż zwykle. OrcaRouter przekazuje cenę katalogową dostawcy przy 0% narzutu, więc tego rodzaju obniżka ceny przez dostawcę dociera do naszych klientów w dniu, w którym zostaje wprowadzona, a nie dopiero przy kolejnym odnowieniu umowy. Jedno naprawdę weryfikowalne porównanie już znajduje się w naszym własnym katalogu: Qwen3.8-Flash, model multimodalny, obok którego powstaje ten model, jest dziś dostępny w routingu za 0,15 USD za milion tokenów wejściowych i 0,47 USD za milion wyjściowych — ta sama cena katalogowa, jaką Alibaba podaje dla nowego modelu omni — i przepuścił 2,47 miliarda tokenów ruchu przez nasze API w siedmiu dniach przed napisaniem tego tekstu, co jest uczciwą miarą tego, jak duży apetyt ma już ten segment. Sam model omni nie znajduje się w naszym katalogu jeszcze, a dopóki tak nie będzie, działa wyłącznie na platformach Alibaby i nigdzie indziej. Nie zamierzamy udawać, że jest inaczej.

Każdy benchmark w ramach premiery porównuje jedną rzecz

Główna informacja to średnia poprawa o ponad 26% w około 30 ewaluacjach — a każda z tych ewaluacji jest porównaniem z Qwen3.5-Omni-Plus. To właściwy punkt odniesienia dla premiery — i to wąski: mówi ci, że rodzina się przesunęła, a nie gdzie wylądowała względem czegokolwiek, za co możesz już płacić.

Poszczególne wartości, wszystkie raportowane przez dostawcę: WildClawBench-MM 71.0, wzrost o 36.5 punktu i największy pojedynczy skok w całym zestawie; UniClawBench 69.6; AgenticVBench wzrost o 22.3 punktu do 36.8; LongAudioSpan 82.7, wzrost o 8.3; OmniVideoBench 63.4, wzrost o 9.6; OmniCap-IF 28.2. Najbardziej rzucająca się w oczy para to diarizacja mówców na AliMeeting, gdzie wskaźnik błędu spada z 88.11 do 3.35, a cpWER z 89.61 do 17.18 — skok tak duży, że zasługuje na wnikliwą analizę, a nie na aplauz. Chińska analiza techniczna tej premiery argumentuje dokładnie w ten sposób, przypisując poprawę w znacznej mierze inżynierii front-endu i diarizacji opakowującej model, a nie własnemu rozumowaniu modelu, i ostrzegając, że system sprawia wrażenie wyspecjalizowanego w słuchaniu, ze stosunkowo słabszym głębokim rozumowaniem wideo. To interpretacja krytyka, a nie zmierzona replikacja, ale rozmiar tej różnicy jest powodem, by mieć ją na uwadze.

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

Druga liczba, którą warto zapamiętać, nie jest wcale wynikiem punktowym. W trybie, który Alibaba nazywa Agentic Understanding, model sam decyduje, na co patrzeć i czego słuchać, zamiast przetwarzać każdą klatkę, gromadząc dowody w rundach od ogółu do szczegółu. W benchmarku OmniVideoBench ten tryb podnosi dokładność z 63,4 do 67,8, jednocześnie zmniejszając liczbę tokenów na zapytanie ze 145 736 do 79 117 — redukcję o 45,7%. Jednoczesny wzrost dokładności i spadek kosztów to najśmielsze twierdzenie w tym komunikacie i to, które najbardziej bezpośrednio wspiera agentowy przekaz.

Porównanie Gemini jest węższe, niż sugeruje zakres.

Stanowisko Alibaby jest takie, że możliwości audio-wideo "zbliżają się" do Gemini 3.8 Flash, podczas gdy ogólna wydajność audio przewyższa Gemini. Po odrzuceniu otoczki, porównania podane przez dostawcę wyglądają następująco. WildClawBench-MM: 71.0 przeciwko 58.9. SpotSoundBench: 67.2 przeciwko 39.7. MMAU: 81.8 przeciwko 76.9. DailyOmni: 85.1 przeciwko 84.0. To prawdziwe luki w audio i narzędziach skoncentrowanych na audio. Są one również wybiórcze. Na AgenticVBench, ranking czystego rozumowania wideo, kolejność się odwraca — Gemini na 45.0 przeciwko 36.8 Qwen — a sama Alibaba przyznaje, że Gemini nadal prowadzi w kilku testach rozumienia wideo. Rozsądne podsumowanie jest takie, że Qwen przejął połowę audio w omni i nadal pozostaje w tyle za połową wideo, co jest innym twierdzeniem niż to, które pojawiło się w nagłówkach.

„Pierwszy omnimodalny model Qwen” wymaga kwalifikatora.

Narracja, że Qwen3.8-Omni-Flash jest pierwszym omni-modalnym modelem Qwen, krążyła dziś szeroko i warto być tu precyzyjnym, bo ta rodzina ma wcześniejszego przedstawiciela, który ma uzasadnione prawo do tego tytułu. Qwen2.5-Omni, model 7B o otwartych wagach wydany w marcu 2025 roku w architekturze Thinker-Talker, również przyjmował na wejściu tekst, obraz, dźwięk i wideo — a generował zarówno mowę, jak i tekst. Tym, co jest tu rzeczywiście pierwsze, jest natywna omni-modalność: jeden model zbudowany na fundamencie Qwen3.8-Flash, a nie tekstowy LLM z doczepionymi enkoderami percepcji, plus brief projektowy stawiający w centrum agenta. Oba stwierdzenia są prawdziwe; tylko jedno z nich jest tym, które zostało powtórzone. Jeśli oceniasz ten model w założeniu, że przed tym tygodniem nie istniał żaden omni model Qwen, błędnie wycenisz ścieżkę aktualizacji z Qwen2.5-Omni, a to porównanie opisaliśmy osobno.

To w narzędziach tak naprawdę tkwi to, co kryje się za twierdzeniem o agentowości.

Dwie rzeczy zostały udostępnione wraz z modelem i mają większe znaczenie, niż sugeruje karta modelu, ponieważ to one zamieniają percepcję w dostarczanie. Qwen-MM-Plugins to wielomodalny zestaw wtyczek dla środowisk agentowych, który daje zewnętrznemu agentowi rozumienie obrazu, dźwięku, wideo i dokumentów, a także pamięć długich wideo oraz edycję wideo; deklaruje obsługę Codex, Claude Code, Qwen Code, Gemini CLI i kilku innych, a wśród dostarczanych nazwanych narzędzi znajduje się Video2Note, które zamienia godziny wideo w zilustrowane notatki PDF. Qwen-Live Harness to otwartoźródłowe środowisko uruchomieniowe do ciągłej, omnimodalnej interakcji w czasie rzeczywistym, działające jako warstwa harmonogramowania, w której użytkownik rozmawia na żywo i deleguje cięższą pracę do agentów działających w tle. Jedno zastrzeżenie z relacji z dnia premiery: strona GitHub Qwen-Live Harness zwracała błąd 404, gdy Gigazine ją sprawdzał, więc traktuj te narzędzia jako zapowiedziane, a nie zweryfikowane, dopóki repozytoria nie zaczną działać.

Zdanie, które premiera grzebie: ono nie mówi.

W przypadku modelu, którego poprzednik generował mowę, fakt, że Qwen3.8-Omni-Flash ma wejście multimodalne i wyjście tekstowe, jest najistotniejszym punktem specyfikacji, a w materiałach pojawia się głównie jako przypis. Oznacza to, że nie można samodzielnie wstawić tego modelu do produktu typu mowa-do-mowy. Dubbing, agent głosowy lub rozmowa w czasie rzeczywistym zbudowane na jego podstawie wymagają zewnętrznego etapu syntezy mowy z tekstu, a w przypadku wideo — zewnętrznego modułu renderującego — i to właśnie dlatego istnieje zestaw wtyczek oraz środowisko testowe na żywo. Praktyczną konsekwencją jest potok przetwarzania o większej liczbie ruchomych elementów niż „jeden model omni” oraz opóźnienie, którego budżet trzeba rozdzielić między wszystkie te elementy.

W tym wydaniu ukryto zgrabną demonstrację tej luki — i tego, do czego model się nadaje. W eksperymencie „model optymalizujący model” Qwen3.8-Omni-Flash autonomicznie poprawił rozpoznawanie dialektu syczuańskiego przez Qwen2.5-Omni-3B, obniżając współczynnik błędów znaków z 25,79% do 15,30% w ciągu dwunastu godzin i tworząc 3413 próbek treningowych w czterech rundach. Model, który potrafi zdiagnozować i naprawić obsługę dialektu mniejszego brata, robi coś, czego API transkrypcji nie potrafi. To, a nie tabela benchmarków, jest najwyraźniejszym argumentem za tym, co ma tu oznaczać „agentic”.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (captured 18 September 2026), headed '199 models - 15 providers - one API key, one bill', with modality tabs reading Text 164, Image 10, Embeddings 5, Video 10 and TTS 10, a 'How to call any model' panel showing the OpenAI-compatible endpoint, and model cards including Qwen3.8 Max (0902) and DeepSeek V4.1 Flash.

Co zmieniłoby naszą ocenę

Uczciwy stan rzeczy jest taki, że to dobrze doprecyzowana premiera z przekonującą narracją cenową, brakiem niezależnej oceny i co najmniej jednym ograniczeniem strukturalnym, które ogłoszenie łagodzi. Trzy rzeczy by to rozstrzygnęły. Wpis w Artificial Analysis lub LMArena zamieniłby liczby dostawcy w porównywalne dane, a takiego wpisu jeszcze nie ma. Test redukcji liczby tokenów o 45,7% przeprowadzony przez podmiot trzeci — twierdzenie, że dokładność rośnie, a koszt spada — potwierdziłby najbardziej użyteczny i najmniej efektowny wynik w komunikacie. A niezależny pomiar diaryzacji AliMeeting pokazałby, czy spadek o 88 punktów należy przypisać modelowi, czy otaczającemu go potokowi przetwarzania.

Do tego czasu rozsądnym podejściem jest to, które stosuje się do każdego modelu w jego pierwszym dniu: wart przetestowania, ale nie wart opierania na nim ścieżki produkcyjnej. Jeśli już kierujesz ruch przez OrcaRouter, praktycznym posunięciem jest pozostawienie obciążenia na modelach, które zmierzyłeś, i potraktowanie Qwen3.8-Omni-Flash jako kandydata, którego warto sprawdzić na tle tamtych modeli na własnych materiałach audio i wideo, a nie na tabeli benchmarków któregokolwiek z dostawców. Jeśli Twoim przypadkiem użycia jest analiza długich spotkań lub mediów po chińsku i angielsku, ekonomia tokenów jest tu wystarczająco mocna, by uzasadnić test już teraz.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie