
Qwen3.8-Max kontra Qwen 3.8: jeden rdzeń 2.4T, wynajęty lub uruchomiony — po odświeżeniu 0902
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2 września 2026 roku firma Alibaba wypuściła datowaną aktualizację Qwen3.8-Max — kompilację, którą oznacza jako Qwen3.8-Max-0902 — i w tym samym tygodniu niezależny ranking kodowania umieścił nową kompilację na 1. miejscu. Wersja do pobrania tego samego rdzenia o 2,4 biliona parametrów, czyli model, który większość ludzi ma na myśli, pisząc „Qwen 3.8” bez sufiksu, wciąż pozostaje na punkcie kontrolnym z 12 sierpnia: wyłącznie tekstowa, z rozumowaniem na stałe włączonym i o setki gigabajtów za duża, żeby dało się ją uruchomić na czymkolwiek mniejszym niż stojak z procesorami graficznymi. Ta luka między hostowanym flagowcem a otwartymi wagami nie istniała w sierpniu. Dziś to właśnie ona stanowi całe porównanie — i dlatego ten sam model wciąż jest sprzedawany pod dwiema nazwami.
Qwen3.8-Max to flagowy model hostowany przez Alibaba: model o 2,4 biliona parametrów z architekturą rzadkiej mieszanki ekspertów; na token aktywnych jest w nim około 95 miliardów parametrów. Działa w płatnym API od 3 sierpnia i oferuje multimodalne okno kontekstowe na 1 milion tokenów. Qwen 3.8 jako samodzielna nazwa to otwarte wydanie tego samego pokolenia — najważniejszy jest tu Qwen3.8-2.4T-A95B, czyli wagi opublikowane przez Alibaba 12 sierpnia na niestandardowej licencji. To nie są dwa różne modele — tańszy i droższy. To ten sam mózg sprzedawany na dwa sposoby, a przeprowadzona we wrześniu runda doszkalania zaczyna te dwie oferty od siebie oddalać. Ten artykuł pomaga ustalić, na który „Qwen 3.8” tak naprawdę patrzysz, co zmieniła aktualizacja 0902 i którą ścieżką — płatne API czy uruchamianie wag — warto dziś podążać.
Para, która nie jest rywalizacją
Zanim przejdziemy do dat i cennika, architektura: Qwen3.8-Max i Qwen3.8-2.4T-A95B dzielą drobnoziarnisty projekt MoE z 512 ekspertami na warstwę (10 kierowanych plus jeden współdzielony na warstwę), 92 warstwami oraz hybrydowym stosem, w którym 69 z 92 warstw wykorzystuje uwagę liniową — Gated DeltaNet w połączeniu z uwagą bramkowaną — z pełną uwagą przeplataną dla pracy nad długim kontekstem. Dlatego karta modelu może deklarować kontekst miliona tokenów w API i dlatego otwarta wersja osiąga natywne 262K, które rozszerza się do miliona przy odpowiedniej konfiguracji serwowania. Różnice między tymi dwiema nazwami nie leżą w architekturze wag; są na krawędziach, a krawędzie przesunęły się od 2 września.
• Parametry — Qwen3.8-Max: 2,4T łącznie / ~95B aktywnych, MoE. Qwen3.8-2.4T-A95B: ten sam rdzeń, ta sama liczba aktywnych parametrów.
• Dostępność — Qwen3.8-Max: hostowane API, dostępne od 3 sierpnia, odświeżone jako Qwen3.8-Max-0902 2 września. Qwen3.8-2.4T-A95B: wagi do pobrania, opublikowane po raz pierwszy 12 sierpnia, od tego czasu brak nowszego checkpointu.
• Modalność — Qwen3.8-Max: wejście tekstu, obrazu i wideo. Qwen3.8-2.4T-A95B: tylko tekst.
• Kontrola rozumowania — Qwen3.8-Max: przełączniki myślenia, w tym tryb bez myślenia. Qwen3.8-2.4T-A95B: myślenie zawsze włączone, z tylko pokrętłem wysiłku rozumowania (niskie / wysokie / ekstra wysokie).
• Narzędzia — Qwen3.8-Max: natywne wywoływanie funkcji, pięć wbudowanych narzędzi i ustrukturyzowane dane wyjściowe. Qwen3.8-2.4T-A95B: brak natywnej warstwy narzędziowej; to, co otrzymasz, zależy od frameworka wnioskowania, za pomocą którego go udostępnisz.
Co zmieniło odświeżenie z 2 września
Build 0902 to etap po treningu, a nie nowa architektura. Alibaba skierowała go na dwie rzeczy, z których Qwen3.8-Max już słynął — kodowanie oraz „cowork”, czyli jej nazwę na długohoryzontową pracę agentową i biurową — a liczby, które się wokół niego pojawiły, są powodem, dla którego ta aktualizacja ma znaczenie. Na niezależnej liście rankingowej Code Arena: WebDev Qwen3.8-Max-0902 zadebiutował z wynikiem 1691 Elo, co oznacza skok o 22 punkty względem poprzedniego builda i wystarczyło do zajęcia pierwszego miejsca od razu po debiucie. Alibaba przedstawia również ten build jako model z najwyższym wynikiem na krzywej Pareto stosunku kosztów do wydajności na tym rankingu, przy łącznej stawce około 5 dolarów za milion tokenów — czyli cenie katalogowej 2 i 6 dolarów ważonej ruchem agentowym o dużej liczbie odpowiedzi, mniej więcej jednej czwartej kosztu podobnego wywołania modelu granicznego gdzie indziej. Te liczby to mieszanka, którą czytelnik powinien rozróżniać: wynik 1691 Elo to niezależny rezultat z areny; ujęcie krzywej Pareto to własna charakterystyka Alibaby tego niezależnego rankingu.
Wewnętrzne ewaluacje Alibaby dla przebiegu 0902 – raportowane przez producenta i niezreplikowane niezależnie – wskazują ten sam kierunek: Terminal-Bench 3.0 rośnie z 11,3 do 29,0, ProgramBench z 10,5 do 28,0, JobBench z 53,4 do 64,0, a WorkArena Elo z 1 348 do 1 468. Należy je odczytywać jako „odświeżenie przesunęło osie agentowe i kodowania”, a nie jako zweryfikowane wyniki. Po stronie ogólnej inteligencji Intelligence Index serwisu Artificial Analysis plasuje Qwen3.8-Max na poziomie 56 – konkurencyjnie, ale to nie powód, żeby po niego sięgać; powodem są wyniki w kodowaniu i zadaniach agentowych.
To, co przeoczyła większość doniesień, to fakt, że post-training z 0902 jest w chwili pisania tego tekstu dostępny wyłącznie przez API. Alibaba nie opublikował otwartego checkpointu odświeżonego modelu — wagi Qwen3.8-2.4T-A95B na Hugging Face wciąż pochodzą z wydania z 12 sierpnia. Oznacza to, że hostowany Qwen3.8-Max i rdzeń dostępny do pobrania nie są już tym samym modelem, jakim były w połowie sierpnia. API ma wrześniowy post-training; wagi nie. Jeśli całym powodem uruchamiania otwartego wydania było wierne odtworzenie tego, co robi flagowy model, to założenie to po cichu przestało być aktualne 2 września.

Pięć miejsc, w których naprawdę się różnią
Pomijając wspólną architekturę, praktyczne różnice układają się w przejrzysty sposób. Modalność jest pierwszym kryterium: jeśli Twoje obciążenie obejmuje obrazy lub wideo — zrzuty ekranu, wykresy, dokumenty z rysunkami, klatki wideo — tylko Qwen3.8-Max je przyjmuje, a jego okno 1M tokenów jest natywne, a nie rozszerzeniem. Otwarte wagi są przeznaczone wyłącznie do tekstu. Kontrola rozumowania to drugie kryterium: hostowane API może działać z wyłączonym myśleniem, co ma znaczenie w ekstrakcji wrażliwej na opóźnienia i prowadzonej na dużą skalę, gdzie łańcuch myśli jest czystym narzutem; otwarta wersja nie może go wyłączyć. Narzędzia to trzecie kryterium: wywołania funkcji, pięć wbudowanych narzędzi i tryb JSON są częścią produktu hostowanego, podczas gdy otwarta wersja zależy od tego, co zapewnia Twoja warstwa serwująca.
Kontekst jest bardziej złożony, niż sugerowałaby karta specyfikacji. Obie strony mogą osiągnąć mniej więcej milion tokenów, ale model hostowany robi to natywnie z wejściem multimodalnym, podczas gdy otwarta wersja z natywnym kontekstem 262K musi zostać rozszerzona w konfiguracji, a każdy token tego rozszerzonego okna jest tekstem. Ograniczenia wyjściowe również się różnią — API pozwala na maksymalnie około 131K tokenów wyjściowych, a otwarta wersja jest zazwyczaj skonfigurowana z podobnym limitem, ale praktyczny limit po stronie otwartej wyznacza twój stos serwerowy, a nie model.
Ile faktycznie kosztuje każda trasa
W tym miejscu obie dostawy przestają być w ogóle porównywalne. Qwen3.8-Max ma cenę katalogową: $2.00 za milion tokenów wejściowych, $6.00 za milion tokenów wyjściowych i $0.25 za milion tokenów wejściowych z pamięci podręcznej. Ponieważ OrcaRouter przekazuje ceny katalogowe dostawcy bez marży, jest to stawka, jaką płacisz tutaj, a gdy Alibaba ją zmieni, nowa cena obowiązuje już tego samego dnia. Migawka 0902 jest przypięta osobno jako qwen/qwen3.8-max-0902 dla zespołów, które chcą powtarzalnego działania — ta sama cena, te same możliwości, ale stały punkt kontrolny zamiast modelu aktualizowanego na bieżąco. W ruchu OrcaRouter 7-dniowa mediana czasu do pierwszego tokena dla Qwen3.8-Max wynosi około 2–4 sekund, a Artificial Analysis mierzy około 45–48 tokenów wyjściowych na sekundę: nie jest on wolny, ale rozwlekły, dlatego zadania agentowe na tym modelu mogą pochłonąć zaskakującą liczbę tokenów mimo niskiej stawki.

Qwen3.8-2.4T-A95B nie ma ceny katalogowej, ponieważ ceną jest twoja infrastruktura. Wagi BF16 zajmują około 4,9 TB, a nawet oficjalna kompilacja FP8 to około 2,4 TB, więc to sprzęt w skali szaf rackowych: najmniejsze udokumentowane konfiguracje serwowania zaczynają się od około ośmiu GPU B300 lub GB300, a pełna szafa GB300 NVL72 jest referencyjnym wdrożeniem. Agresywna kwantyzacja obniża próg — wersja NVFP4 mieści się w około 1,3 TB, a warstwowa kwantyzacja 1-bitowa Unslotha kompresuje model do około 397 GB, co wreszcie sprawia, że wykonalny staje się pojedynczy dobrze wyposażony węzeł — ale każda z tych ścieżek zakłada, że operujesz GPU w skali centrum danych. Zewnętrzni dostawcy serwujący otwarty checkpoint sprzedadzą ci tokeny poniżej ceny za token w modelu Max, ale w zamian tracisz wejście multimodalne, tryb non-thinking, natywne narzędzia i post-training 0902, a żaden niezależny benchmark samego tego checkpointu nie został dotąd opublikowany. Karta modelu samego Alibaba jest szczera co do tej zależności: opisuje Qwen3.8-Max jako oficjalną wersję zbudowaną na Qwen3.8-2.4T-A95B, dodającą wejście wizyjne, obsługę trybu non-thinking, domyślny kontekst 1M i wbudowane narzędzia na bazie otwartego rdzenia.

Niezależne liczby a deklaracje producentów
Uczciwość co do źródeł ma tu większe znaczenie niż w większości porównań, ponieważ obie strony dysponują dowodami z bardzo różnych okresów. Qwen3.8-Max został oceniony niezależnie: wynik Code Arena: WebDev 1,691 dla wersji 0902 oraz wskaźnik inteligencji Artificial Analysis równy 56 to pomiary podmiotów trzecich, a cennik, który czyni twierdzenie o granicy Pareto interesującym, jest opublikowaną taryfą. Qwen3.8-2.4T-A95B jeszcze tego nie ma — opublikowana przez Alibabę tabela benchmarków opisuje rdzeń klasy Max, a nie niezależne uruchomienie dostępnego do pobrania checkpointu, więc otwarta strona tego porównania to nadal w dużej mierze „producent twierdzi, że rdzeń osiąga takie wyniki”. Jeśli decydujesz między nimi na podstawie możliwości, traktuj podawane liczby otwartych wag jako twierdzenia, dopóki nie sprawdzi ich niezależna strona trzecia.
Kto powinien wybrać, które
Decyzja wynika z powyższej listy. Sięgnij po hostowanego Qwen3.8-Max — dziś, konkretnie w wersji 0902 — gdy potrzebujesz wrześniowego post-treningu, wejścia obrazu lub wideo, trybu bez myślenia, natywnych narzędzi i ustrukturyzowanych danych wyjściowych albo okna na milion tokenów bez wdrażania infrastruktury. To jest pozycja na granicy możliwości w kodowaniu i zadaniach agentowych, a przy $2/$6 i $0.25 za wejście z pamięci podręcznej jest agresywnie wycenione jak na to, co oferuje.
Wybierz Qwen3.8-2.4T-A95B, gdy kontrola przeważa nad wygodą: potrzebujesz wag na własnym sprzęcie lub u dostawcy, którego już obsługujesz, chcesz mieć stały punkt kontrolny, który możesz audytować i odtworzyć, albo Twój stały wolumen sprawia, że koszt na token jest dominującym składnikiem i jesteś gotów uruchomić MoE o wielkości 2,4T. Zaakceptuj listę kompromisów — tylko tekst, myślenie zawsze włączone, brak natywnych narzędzi, brak jeszcze post-treningu 0902 — i zweryfikuj warunki licencji dla swojego przedziału przychodów, ponieważ niestandardowa licencja Qwen3.8-Max nie jest licencją Apache 2.0 i nakłada dodatkowe warunki na dużych operatorów komercyjnych.
Jeśli Twoje obciążenie jest wysokowolumenowe, oparte na pojedynczym GPU lub wrażliwe na opóźnienia, żadna z tych opcji może nie być właściwym wyborem — siostrzany model tej generacji o 27 miliardach parametrów, Qwen3.8-27B, jest do tego stworzony i został osobno omówiony w naszym porównaniu Qwen3.8-27B vs Qwen3.8-Max.
Jak wypróbować obie opcje, nie ryzykując całego stacka?
Najczystszy sposób na rozstrzygnięcie tej kwestii to uruchomienie obu stron na własnych promptach — i właśnie w tym miejscu warstwa routingu udowadnia swoją przydatność, zamiast być do tego sztucznie doczepianą. Qwen3.8-Max oraz przypięta migawka Qwen3.8-Max-0902 są dostępne przez jeden endpoint zgodny z OpenAI na OrcaRouter, więc przełączenie między aktualizowanym na bieżąco flagowcem a odtwarzalnym punktem kontrolnym to zmiana identyfikatora modelu, a nie ponowne wdrożenie. Gdy zespół decyduje się przenieść otwarte wagi do własnej infrastruktury, DSL routingu może stanowić front samohostowanego endpointu vLLM lub SGLang obsługującego Qwen3.8-2.4T-A95B i umieścić go w tym samym grafie wywołań — masowy ruch trafia do własnego wdrożenia, trudne prompty i żądania multimodalne przelewają się do hostowanego Qwen3.8-Max, z automatycznym przełączaniem awaryjnym między nimi. Wypróbowanie w ten sposób nowego punktu kontrolnego to tylko zmiana konfiguracji, a nie migracja, czyli dokładnie to, czego potrzebujesz, gdy obie strony tego porównania wciąż rozwijają się w różnym tempie.
Najważniejsze
Qwen3.8-Max i Qwen 3.8 to nie dwa modele konkurujące o to samo zadanie. To jeden rdzeń o parametrach 2,4 biliona, dostarczany jako wynajmowane API i jako możliwe do pobrania wagi, a odświeżenie z 2 września sprawiło, że te dwie dostawy oznaczają co innego. Wynajmując API, otrzymujesz potrening z 0902, który zapewnił prowadzenie w Code Arena: WebDev, a do tego wizję, tryb niemyślący, natywne narzędzia i natywne okno miliona tokenów, w cenie 2/6 dolarów z 0,25 dolara za wejście z pamięci podręcznej. Uruchamiając otwarte wagi, otrzymujesz tę samą architekturę zamrożoną w stanie z 12 sierpnia — tylko tekst, rozumowanie włączone na stałe — bez niezależnych wyników i z rachunkiem za sprzęt w centrum danych. Jeśli zależą ci na wrześniowych zyskach w kodowaniu i działaniach agentowych, tylko jedna z tych dwóch nazw ma je dziś. Jeśli bardziej liczy się powtarzalna kontrola, tylko jedna z tych dwóch nazw należy do ciebie.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
