
Qwen3.8-Omni-Flash pięć dni później: jedne drzwi, brak wag i pierwsze wyniki, które nie pochodzą od Alibaby
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Pięć dni po tym, jak dostawca otworzył Qwen3.8-Omni-Flash dla klientów API, model wciąż ma dokładnie jeden dom. Działa na własnej platformie dostawcy, Qianwen, oraz w jego chmurowej usłudze Bailian; oferty podmiotów trzecich, które pojawiły się od premiery, to pośrednicy przed tymi samymi endpointami, a nie drugie miejsce, w którym model żyje. Nie udostępniono żadnych wag. Liczby z dnia premiery — 98% obniżki kosztu godziny dźwięku, średnio 26% wzrostu w porównaniu z Qwen3.5-Omni-Plus, milion tokenów kontekstu, wyjście wyłącznie tekstowe — pozostają danymi samego dostawcy i nie zostały odtworzone. To, co faktycznie zmieniło się przez pięć dni, to nie model, lecz grunt wokół niego: pojawiła się cienka warstwa wyników podmiotów trzecich, wsparcie frameworków dotarło w dniu zerowym, a porównanie, po które wszyscy sięgają, dotyczy Gemini 3.8 Flash, a nie Qwen3.8-Flash, obok którego ten model powstawał. Każde z nich zasługuje na bliższe spojrzenie, niż dała mu relacja z premiery.
Drzwi są dobrymi drzwiami i są jedyne
Dostępność się poszerzyła, ale nie stała się wielością. Model odpowiada na zapytanie w formacie OpenAI bez zmian, co oznacza, że istniejący kod kliencki w większości działa; psuje się natomiast endpoint, ponieważ hosty międzynarodowe i kontynentalne to osobne usługi z osobnym rozliczaniem. Kod wskazujący na domyślny endpoint albo zawiedzie, albo zostanie rozliczony w niewłaściwej walucie, a historia ceny za godzinę obowiązuje wyłącznie po stronie międzynarodowej. Biblioteki klienckie open source udostępniły wsparcie dla modelu już w dniu premiery, co jest naprawdę przydatne i jednocześnie nie jest drugim dostawcą: biblioteka, która rozmawia z Bailian, jest wygodną nakładką wokół tego samego jedynego źródła dostaw.
To ryzyko strukturalne, które warto nazwać. Model oparty na jednym źródle nie ma ścieżki przełączenia awaryjnego. Jeśli punkt końcowy zacznie ograniczać liczbę żądań, pogorszy jakość albo któryś region przestanie działać, nie ma dokąd się zwrócić — i żadne wsparcie biblioteki klienckiej tego nie zmieni. To także powód, dla którego mówimy o swoim stanowisku wprost, zamiast sugerować coś przeciwnego: Qwen3.8-Omni-Flash nie znajduje się w naszym katalogu. Nie hostujemy go, a czytelnik, który zapisze się w oczekiwaniu, że będzie mógł kierować do niego ruch, zostałby wprowadzony w błąd. To, co da się routować, to reszta rodziny — Qwen3.8-Flash i Qwen3.8-Maxoba działają w naszym API — a OrcaRouter przekazuje cenę katalogową dostawcy bez marży (0%), więc gdy zmieni się cennik modeli omni Alibaby albo w dniu, w którym model omni stanie się dostępny do routowania, zmiana dotrze do klientów tego samego dnia, a nie dopiero przy kolejnym odnowieniu umowy.

Pierwsze wyniki, które nie pochodzą od Alibaby, są skąpe i nie są pochlebne.
Na Artificial Analysis nie ma nic dla tego modelu, a ten brak jest uczciwym nagłówkiem po pięciu dniach: rankingi, które wszyscy cytują dla pokrewnych modeli, wciąż nie mają wiersza dla modelu omni. Lukę wypełniło coś innego. Zewnętrzna platforma ewaluacyjna zaczęła publikować wyniki testów tego modelu, a jej podsumowanie warto przeczytać właśnie dlatego, jak wiele w nim nie zostało powiedziane. Podaje klasyfikację e-maili z dokładnością 99,0% (86. percentyl), etykę na poziomie 95,0% (23. percentyl) i rozumowanie na poziomie 56,0%, co umieszcza w 28. percentylu i nazywa znaczącą słabością; szybkość plasuje się w 21. percentylu, koszt w 58. percentylu, a ogólny wskaźnik sukcesu wynosi 89%.
Podchodź do nich z dużą ostrożnością, i to nie tylko dlatego, że próba jest mała. Ta sama strona datuje premierę modelu na 20 września, dwa dni po tym, jak Alibaba go udostępniła, nie podaje dat przeprowadzenia żadnego z wyników i wyświetla pustą tabelę benchmarków pod podsumowaniem, które opisuje liczby nieobecne w tabeli. To profil wczesnego, słabo nadzorowanego zestawu testowego, a nie rzetelnej ewaluacji, a uczciwa interpretacja jest taka, że są to pierwsze punkty danych spoza dostawcy, a nie pierwsze wiarygodne. Są powodem, by samemu przetestować model, a nie powodem do wyciągania jakichkolwiek wniosków. Kierunek jest jednak zgodny z tym, co materiały samego dostawcy sugerują przez przemilczenie: to model percepcji i długich multimediów, a rankingi mocno nastawione na rozumowanie nie są miejscem, w które był wymierzony.
W wynikach wyszukiwania jest też pułapka, która przez najbliższych kilka tygodni będzie łapać ludzi. Qwen 3.8, model tekstowy, ma Artificial Analysis Intelligence Index na poziomie czterdziestu kilku, a ta liczba została przytoczona w więcej niż jednym podsumowaniu tak, jakby opisywała model omni. Nie opisuje. To różne modele o różnych zadaniach, a model omni nie ma jeszcze żadnego indeksu.

Tabela benchmarków wciąż pokazuje jednego dostawcę porównującego się z samym sobą.
Wynik z premiery — średnia poprawa o ponad 26% w około trzydziestu ewaluacjach — jest mierzony wyłącznie względem Qwen3.5-Omni-Plus. To mówi, że rodzina się rozwinęła. Nie mówi jednak, gdzie model plasuje się na tle czegokolwiek, za co możesz już płacić, a wybiórcze porównania, które krążyły razem z tym wynikiem, też nie zasypują tej luki. Obraz raportowany przez dostawcę względem Gemini 3.8 Flash to autentyczne zwycięstwo w rankingach audio i porażka w tych, które mierzą agentową pracę z wideo: WildClawBench-MM 71,0 przeciwko 58,9 i SpotSoundBench 67,2 przeciwko 39,7 po jednej stronie, AgenticVBench 36,8 przeciwko 45,0 i OmniGAIA 74,0 przeciwko 78,6 po drugiej. Język podsumowania samej Alibaby — wydajność audio-wideo „zbliżająca się” do Gemini, ogólna wydajność audio przewyższająca Gemini — jest ostrożniejszy niż nagłówki, które wygenerował, a to właśnie wersja ostrożna jest trafna.
• Kontekst — 1 mln tokenów, z około 991 tys. maksymalnego wejścia (około 983 tys. w trybie myślenia) i 131 tys. maksymalnego wyjścia.
• Modalność — wejście: tekst, obraz, dźwięk i wideo; wyjście: tylko tekst. Brak generowania mowy w modelu bazowym.
Czas trwania — do jednej godziny ciągłego dźwięku lub materiału audio-wideo na wywołanie, co pozwala pracować ze spotkaniami i długimi multimediami bez dzielenia na fragmenty.
• Pokrycie językowe — rozpoznawanie 74 języków oraz 39 dialektów chińskich w materiałach premierowych, a w innych źródłach podaje się szersze liczby (113 języków i dialektów) w przypadku wprowadzania dźwięku.
• Szczegóły wejścia — akceptowane są stereo i czterokanałowe audio przestrzenne, a wariant Realtime opisano jako pierwszy omnimodalny model zdolny zlokalizować cel na podstawie jego dźwięku.
• Cena — 0,15 USD za milion tokenów wejściowych, 0,016 USD za tokeny z pamięci podręcznej, 0,47 USD za tokeny wyjściowe po stronie międzynarodowej oraz oddzielny, nieporównywalny cennik dla Chin kontynentalnych.
Te 98% to prawda, a to nie jest twój rachunek
Według własnej metodologii Alibaby — dwuminutowa próbka pomnożona przez trzydzieści, wideo próbkowane w 720p z jedną klatką na sekundę — godzina wejścia audio spada z 0,28 USD do poniżej 0,01 USD, a godzina połączonego audio i wideo z 3,27 USD do 0,20 USD. To duże, konkretne, raportowane przez dostawcę obniżki — i to obniżki dotyczące jednej pozycji kosztowej. Liczy się to, jaki udział w Twoim obciążeniu ma ta pozycja. Potok przetwarzania, który wydaje większość swoich tokenów na wyjście, na kontekst z pamięci podręcznej albo na klatki wideo próbkowane gęściej niż raz na sekundę, odnotuje na fakturze znacznie mniejszą zmianę procentową, niż obiecuje nagłówek, a nagłówek dotyczy wejścia audio, a nie całości. Dolicz wyjście tekstowe, a luka znów się powiększa: wszystko, co musi odpowiadać głosem, potrzebuje drugiego modelu, a ten model jest rozliczany osobno.
To jest ten element obrazu, w którym routing się opłaca. Wartością routera przekazującego dalej nie jest zniżka — chodzi o to, że płacisz według własnego cennika dostawcy i że obciążenie można rozłożyć na kilka modeli, dzięki czemu model z jednego źródła jest komponentem, a nie zależnością. Model omni, który jest jedynym, do jakiego możesz się zwrócić, stanowi pojedynczy punkt awarii zarówno w warstwie dostępności, jak i cenowej.

Co tak naprawdę powiedziałyby ci pięć dni produkcji
Trzy rzeczy rozstrzygnęłyby otwarte pytania. Niezależny pomiar wyniku diaryzacji AliMeeting — spadek wskaźnika błędów z 88,11 do 3,35 i cpWER z 89,61 do 17,18 — pokazałby, czy należy to przypisać modelowi, czy diaryzacji i inżynierii front-endu wokół niego, czemu co najmniej jedna chińska analiza techniczna przypisuje większość zysku. Powtórzony test redukcji liczby tokenów w trybie agentowym, w którym dokładność wzrosła z 63,4 do 67,8 na OmniVideoBench, a liczba tokenów na zapytanie spadła ze 145 736 do 79 117, potwierdziłby najbardziej użyteczne twierdzenie w wydaniu: że model może jednocześnie stawać się lepszy i tańszy. A wiersz Artificial Analysis lub arena zamieniłby każdą z powyższych liczb dostawców w coś porównywalnego, co jest warunkiem wstępnym, by model został wybrany, a nie tylko wypróbowany.
Do tego czasu rozsądne podejście to takie samo jak w przypadku każdego pięciodniowego modelu z jednym hostem i bez niezależnej ewaluacji: warto go przetestować na własnym audio i wideo, ale nie warto czynić go jedyną ścieżką w Twoim pipeline. Jeśli Twoje obciążenie to analiza długich spotkań lub mediów w języku chińskim albo angielskim, a koszty są zdominowane przez godziny materiału wejściowego, a nie tokeny wyjściowe, kalkulacja ekonomiczna jest tu wystarczająco korzystna, by uzasadnić test w tym tygodniu. Jeśli Twoje obciążenie wymaga odpowiedzi głosowej albo rozwiązania zapasowego na wypadek pogorszenia działania dostawcy, model w obecnej postaci nie może być pełnym rozwiązaniem — i żadna ilość wsparcia frameworków od dnia zerowego tego nie zmieni.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
