
Recenzja Qwen3.8-Max: flagowy model Alibaby z 2.4T parametrów za $2/$6 — build 0902 na szczycie Code Arena WebDev
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Alibaba Qwen zapowiedział Qwen3.8-Max na World AI Conference w Szanghaju 19 lipca 2026 roku i przez dwa tygodnie był to najbardziej komentowany model, którego nikt nie potrafił właściwie wycenić. Nie było cennika, tabeli benchmarków, karty modelu, licencji ani liczby aktywnych parametrów — tylko nagłówek o 2,4 biliona parametrów i twierdzenie, że model zajmuje „drugie miejsce, ustępując jedynie Claude Fable 5."
3 sierpnia 2026 roku to się zmieniło. Qwen3.8-Max jest ogólnie dostępny: opublikowany cennik po 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych, punkt końcowy zgodny z OpenAI i DashScope, pełna tabela benchmarków oraz otwarte wagi, które pojawiły się 12 sierpnia. Tydzień później, 14 sierpnia, został uruchomiony w DigitalOcean Serverless Inference jako „Day 0 launch partner” Alibaby — pierwszy duży zachodni dostawca chmury, który go udostępnił. 2 września Alibaba wydała nazwaną odświeżoną wersję, Qwen3.8-Max-0902, dodatkowo dotrenowaną na Coding i Cowork, która według Qwen wzmacnia wydajność w złożonych pracach korporacyjnych i naukowych. Ta recenzja została napisana w oparciu o fakty dotyczące GA, z uwzględnieniem startu dnia zerowego i wersji 0902, i odpowiada na pytanie, które zespoły faktycznie mają teraz, gdy model można kupić: czy Qwen3.8-Max jest gotowy na ruch produkcyjny, czy nadal jest modelem z listy obserwacyjnej?
Krótka odpowiedź brzmi: model rozwinął się bardziej, niż większość oczekiwała — szczególnie ceny są agresywne w sposób, który na nowo wycenia granicę możliwości, a odświeżenie z 2 września kładzie jeszcze większy nacisk na dwie rzeczy, w których model już był dobry — kodowanie i pracę zespołową. Niezależna ocena, która się od tego czasu pojawiła, jest naprawdę dobra, ale niesie ze sobą zastrzeżenie, które warto przeczytać, zanim skierujesz do niego ruch.
TL;DR. Qwen3.8-Max jest teraz w wersji ogólnie dostępnej (GA) w cenie 2/6 USD za 1 mln tokenów — stałej dla całego kontekstu 1M tokenów, bez dopłaty za długie prompty — i bije cenowo Kimi K3 (3/15 USD) oraz Claude Opus 5 (5/25 USD) na tokenach wyjściowych, które są głównym czynnikiem kosztów w pracy wymagającej rozumowania. Alibaba opublikowała solidną tabelę benchmarków (Terminal-Bench 2.1: 86,6; GPQA Diamond: 92,6; OSWorld-Verified: 86,1), a skok w kodowaniu względem poprzednika jest ogromny: FrontierSWE 73,5 wobec 40,7. Tyle że tabela jakości to tabela samej Alibaby, a pierwszy niezależny arbiter — indeks Artificial Analysis Intelligence — już się wypowiedział: Qwen3.8-Max zdobywa 56 punktów przy koszcie 1,14 USD za zadanie, dorównując Claude Opus 4.8 (56) i ustępując o jeden punkt liderowi wśród modeli o otwartych wagach, Kimi K3 (57), przy koszcie za zadanie wyższym o 25%. Liczba aktywnych parametrów nie jest już niewiadomą: 95 mld aktywnych z 2,4 bln wszystkich parametrów — potwierdzono to w oficjalnej karcie modelu, co wreszcie pozwala osobom z zewnątrz oceniać ekonomikę serwowania. Od czasu pierwotnej publikacji tej recenzji otwarto też drugą ścieżkę zarządzaną: 14 sierpnia Qwen3.8-Max wystartował na DigitalOcean Serverless Inference jako partner Alibaby od dnia zerowego, a opublikowane przez DigitalOcean parametry serwowania — skalowanie fazy prefill do ok. 16 000 tokenów/s i ok. 1937 tokenów wyjściowych/s przy 256 równoczesnych żądaniach bez żadnych błędów — to pierwsze twarde dane o opóźnieniach od dostawcy innego niż Alibaba. 2 września Alibaba odświeżyła flagowy model jako Qwen3.8-Max-0902, dodatkowo dotrenowany na zbiorach „Coding” i „Cowork”; Qwen twierdzi, że nowy snapshot jest mocniejszy w złożonych obciążeniach korporacyjnych i naukowych — to deklaracja producenta, bez niezależnych danych dotyczących pracy korporacyjnej czy naukowej. Część odpowiedzialna za kodowanie w wersji 0902 ma już własny niezależny wynik z areny: Qwen3.8-Max-0902 zadebiutował na 1. miejscu tablicy Code Arena: WebDev z 1691 punktami — o 22 więcej niż poprzednia wersja i przed Claude Opus 5 oraz Kimi K3 — według Alibaby, powołującej się na bieżące zestawienie zewnętrznej areny. Historia agentowego handlu zyskała tablicę wyników w tym samym tygodniu: w CommerceAgentBench, nowym benchmarku zespołu Accio z Alibaby zbudowanym na replikach stanowych rzeczywistego oprogramowania handlowego, Qwen3.8-Max osiąga najlepszy wynik wśród modeli o otwartych wagach — 156 łącznych przejść w trzech środowiskach testowych, o dwa więcej niż DeepSeek V4 Pro — to tabela prowadzona przez producenta, a nie przez niezależnego arbitra. Werdykt: model jest obecnie realnie dostępny i wystarczająco tani, by uzasadnić porządną ewaluację — ale należy kierować do niego ruch rozmyślnie, a nie hurtowo.
Najważniejsze wnioski
• GA od 3 sierpnia 2026 r. Era podglądów i kampanii kredytowych dobiegła końca; istnieje prawdziwy cennik i prawdziwy punkt końcowy.
• $2 / $6 za 1M tokenów, jeden stały poziom dla kontekstu 1M. Większość konkurentów pobiera dodatkowe opłaty za długie prompty. Alibaba tego nie robi, co ma ogromne znaczenie przy pracy z długimi dokumentami i dużymi repozytoriami.
• Tabela benchmarków Alibaby jest imponująca, ale niezaudytowana: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, PaperBench 93.0, IFBench 82.8, OSWorld-Verified 86.1, OmniDocBench 1.5 92.1.
• Prawdziwa historia to skok pokoleniowy w kodowaniu: FrontierSWE 73.5 (z 40.7) i DeepSWE 1.1 56.6 (z 21.6) — czyli niemal podwojenie w obu przypadkach.
• Pierwszy niezależny wynik już jest: Qwen3.8-Max uzyskuje 56 w AA Intelligence Index przy 1,14 USD za zadanie — o 10 punktów więcej niż Qwen3.7-Max (46), na równi z Claude Opus 4.8 (56), o jeden punkt za Kimi K3 (57). Ogólny ranking LMArena nadal nie ma publicznego wyniku.
• Aktywne parametry potwierdzone na poziomie 95B — oficjalna karta modelu podaje łącznie 2.4T i 95B aktywowanych, zamykając największą otwartą kwestię w kalkulacjach kosztów serwowania.
• Wagi otwarte są już dostępne — Qwen3.8-2.4T-A95B (BF16) i Qwen3.8-2.4T-A95B-FP8 pojawiły się na Hugging Face 12 sierpnia na podstawie niestandardowej licencji Qwen3.8-Max, a nie Apache 2.0. Opcja on-premise Qwen3.8-27B została wydana 14 sierpnia na licencji Apache 2.0.
• Druga zarządzana ścieżka została otwarta 14 sierpnia. Qwen3.8-Max jest dostępny na DigitalOcean Serverless Inference jako „partner startu w dniu zero” firmy Alibaba — NVFP4 na NVIDIA HGX B300, 2/6 USD z 0,20 USD za wejście z pamięci podręcznej, serwowany przy natywnym kontekście 262K otwartego checkpointu. Zmierzone przez DigitalOcean wartości (prefill ~16 tys. tokenów/s, zero błędów przy 256 jednoczesnych żądaniach) to pierwsze dane o wydajności serwowania na zarządzanej platformie poza Alibaba.
• Odświeżenie z 2 września: Qwen3.8-Max-0902. Firma Alibaba dotrenowała flagowy model na Coding i Cowork i udostępnia go na QwenCloud w tej samej cenie $2/$6 i z kontekstem 1M. Qwen twierdzi, że wydajność w zastosowaniach biznesowych i naukowych jest lepsza — to wciąż deklaracje producenta — natomiast w zakresie kodowania tego samego dnia pojawił się niezależny wynik na arenie: ta wersja zadebiutowała na 1. miejscu w Code Arena: WebDev z wynikiem 1 691 (punkt Code Arena poniżej).
• CommerceAgentBench: lider modeli open-weight z wynikami od producenta. Zespół Accio z Alibaba opublikował w tym tygodniu CommerceAgentBench — 107 zadań o długim horyzoncie w stanowych replikach rzeczywistego oprogramowania handlowego i biznesowego, ocenianych na podstawie stanu w środowiskach Accio, OpenClaw i Pi. Qwen3.8-Max prowadzi wśród modeli open-weight z łączną liczbą 156 zaliczeń, o dwa więcej niż DeepSeek V4 Pro; zamknięty model Claude Opus 5 zajmuje pierwsze miejsce w klasyfikacji ogólnej z wynikiem 191, a ranking to własne zestawienie Alibaba, nie niezależnego arbitra.
• Code Arena: WebDev #1 — niezależny wynik areny dla builda 0902. Qwen3.8-Max-0902 zadebiutował na szczycie listy Code Arena: WebDev z 1 691 punktami — o 22 więcej niż poprzedni build i przed Claude Opus 5 oraz Kimi K3 — a także przewodzi na tej liście na granicy Pareto pod względem stosunku kosztu do wydajności przy mieszanej cenie ~5 USD/MToken, czyli około jednej czwartej mieszanej ceny Claude Opus 5. Oficjalne konto QwenCloud potwierdziło tę pozycję. W przeciwieństwie do CommerceAgentBench, ta lista jest prowadzona przez podmiot zewnętrzny: to arena z anonimowym głosowaniem ludzi, a nie tabela Alibaby, chociaż „zadebiutowanie na #1” to ogłoszenie Alibaby dotyczące zestawienia w danym momencie.
Uwaga dotycząca dokładności: tabela benchmarków Qwen3.8-Max w tej recenzji pochodzi od Alibaba i nie została niezależnie zreplikowana. Wynik Artificial Analysis Intelligence Index (56 przy 1,14 USD za zadanie) został niezależnie zmierzony przez AA na oficjalnym API Alibaba — to pierwszy niezależny arbiter tego modelu. Cennik pochodzi z karty stawek GA Alibaba Model Studio. Repozytoria z otwartymi wagami (Qwen3.8-2.4T-A95B i Qwen3.8-2.4T-A95B-FP8), wartość 95B aktywnych parametrów oraz tekst licencji pochodzą z pierwszej ręki: z własnej organizacji Qwen na Hugging Face, zweryfikowane 13 sierpnia 2026 r. Dostępność na DigitalOcean, jego karta stawek, pomiary wydajności serwowania oraz punktowy test GPQA z wynikiem 88 na skwantowanej wersji pochodzą z własnej dokumentacji DigitalOcean i poradnika społeczności, opublikowanych wraz z ogłoszeniem z 14 sierpnia; określenie „partner uruchomieniowy dnia zerowego” to język ogłoszenia Alibaba. Tam, gdzie cytujemy liczby konkurencji, pochodzą one z Artificial Analysis lub od dostawcy wymienionego w tekście. Odświeżenie Qwen3.8-Max-0902 ogłoszone 2 września jest w całości deklarowane przez dostawcę: jego specyfikacje, opis treningu uzupełniającego Coding-and-Cowork oraz deklarowane zyski w zastosowaniach korporacyjnych i naukowych pochodzą z własnego ogłoszenia Qwen i strony modelu w QwenCloud, a żadna z tych liczb nie została niezależnie odtworzona. Pozycja w Code Arena: WebDev omówiona w sekcji benchmarków jest jedynym wyjątkiem: ta tablica wyników to prowadzona przez stronę trzecią arena z głosowaniem na ślepo, a nie tabela Alibaba — choć „debiut na 1. miejscu z wynikiem 1 691” to ogłoszenie przez Alibaba zestawienia w danym momencie, a wyniki na arenie zmieniają się w miarę gromadzenia głosów. Przedstawiony poniżej wynik CommerceAgentBench należy do tej samej kategorii: benchmark został zbudowany i opublikowany przez Accio, zespół Alibaba International, więc jego tabele są raportowane przez Alibaba — to benchmark o otwartym kodzie źródłowym, ale nie niezależny arbiter w taki sposób, w jaki jest nim Artificial Analysis. Tabele benchmarkowe dostawców są co do zasady optymistyczne — traktuj je jako hipotezę do przetestowania na własnym obciążeniu, a nie jako ostateczny ranking.

Czym jest Qwen3.8-Max?
Qwen3.8-Max to flagowy model rodziny Qwen firmy Alibaba: rzadki model Mixture-of-Experts z 2,4 biliona parametrów, oknem kontekstowym 1M tokenów i natywnym multimodalnym wejściem. Akceptuje tekst, obrazy i wideo, a zwraca tekst. Obsługuje tryb myślenia, wywoływanie funkcji, wbudowane narzędzia i ustrukturyzowane dane wyjściowe, a także jest udostępniany przez kompatybilny z OpenAI endpoint /v1/chat/completions, co oznacza, że większość istniejących integracji wymaga zmiany adresu URL bazy, a nie przepisania. Obecny produkcyjny snapshot, wydany 2 września, to Qwen3.8-Max-0902, dodatkowo dotrenowany na Coding i Cowork.
Rzeczywiste liczby kontekstu są nieco bardziej konkretne niż marketingowe „1M”. Metadane chmury Alibaba podają okno o długości 983 616 tokenów z włączonym trybem myślenia, maksymalne wejście wynoszące około 991 tys. tokenów oraz maksymalne wyjście wynoszące 131 072 tokenów. Ten limit wyjściowy jest wyjątkowo hojny i ma znaczenie w zadaniach takich jak generowanie całych plików kodu lub tworzenie długich raportów, gdzie niższe limity zmuszają do dzielenia na fragmenty i sklejania. Otwarty checkpoint, który DigitalOcean teraz udostępnia, to inna konfiguracja: jego karta modelu podaje natywnie 262 144 tokenów, z możliwością rozszerzenia do około 1 010 000, więc serwowanie przez strony trzecie, które uruchamiają otwarty model bazowy, zwykle pozostanie przy mniejszej natywnej liczbie.
Liczba aktywnych parametrów jest teraz publiczna, a nazwa repozytorium ją zawiera: A95B oznacza 95 miliardów aktywowanych. Oficjalna karta modelu Qwen3.8-2.4T-A95B podaje „2.4T łącznie i 95B aktywowanych" — to drobnoziarnista mieszanka ekspertów (Mixture-of-Experts) z 512 ekspertami, z których na token aktywnych jest 10 routowanych plus jeden wspólny. Ta liczba znaczy więcej niż liczba 2,4T z nagłówka. W przypadku modelu gęstego całkowita liczba parametrów w przybliżeniu mówi, ile kosztuje wnioskowanie; w przypadku modelu MoE nie mówi prawie nic — liczy się tylko liczba aktywnych parametrów, bo to one są faktycznie uruchamiane dla każdego tokena. Model 2,4T aktywujący 30B zachowuje się zupełnie inaczej — pod względem opóźnień i ekonomii serwowania — niż model aktywujący 200B. Przy 95B aktywnych koszt obliczeń na token jest tego samego rzędu co w modelu gęstym w okolicach 90B — to ułamek tego, czego wymagałby gęsty model 2,4T — i właśnie ta liczba wreszcie sprawia, że poniższe pytanie o samodzielne hostowanie znajduje odpowiedź.
Odświeżenie z 2 września: Qwen3.8-Max-0902
2 września 2026 roku Qwen wypuścił swoją pierwszą nazwaną odświeżoną wersję produkcyjną. Qwen3.8-Max-0902 zachowuje tę samą architekturę sparse-MoE z 2,4 biliona parametrów, te same 95 miliardów aktywnych parametrów oraz to samo okno kontekstowe o długości 1M tokenów, ale został dodatkowo dotrenowany pod kątem dwóch możliwości — Coding i Cowork — i jest dostępny w API QwenCloud jako qwen3.8-max-0902 (widnieje również jako qwen3.8-max-2026-09-02). To obecnie wersja zalecana, a nie gałąź poboczna: niedatowany punkt końcowy qwen3.8-max firmy Alibaba obsługuje teraz snapshot 0902, więc wywołanie standardowej nazwy modelu kieruje do odświeżonej wersji, natomiast datowany identyfikator jest dla zespołów, które chcą przypiąć dokładnie tę kompilację. Od 3 września snapshot jest też wystawiany jako odrębny, routowalny identyfikator modelu w zarządzanych API zewnętrznych dostawców. Cennik nie drgnął: 2 USD za 1M tokenów wejściowych, 6 USD za 1M tokenów wyjściowych, z tymi samymi stawkami za pamięć podręczną.
Twierdzenia o wydajności pochodzą od Qwena. Ogłoszenie i strona modelu QwenCloud opisują możliwości kodowania, które „wyznaczają nowe standardy” w projektach na skalę inżynierską i długofalowym autonomicznym rozwoju, „znacznie ulepszone” doświadczenie agenta współpracującego w orkiestracji wielu narzędzi i kompleksowej realizacji zadań, a także — jak ujmuje to firma — lepszą wydajność w złożonych zadaniach korporacyjnych, badaniach naukowych i długotrwałych przepływach pracy. Pierwsza niezależna weryfikacja pojawiła się tego samego dnia. Qwen3.8-Max-0902 zadebiutował na 1. miejscu listy Code Arena: WebDev — zewnętrznej areny z głosowaniem „w ciemno” dla agentowego tworzenia stron internetowych, projektu znanego wcześniej jako WebDev Arena — z 1 691 punktami, o 22 więcej niż poprzednia wersja i wyprzedzając Claude Opus 5 oraz Kimi K3, jak podaje Alibaba, powołując się na bieżącą listę — lokatę tę oficjalne konto Qwena potwierdziło tego samego dnia, odsyłając do API QwenCloud. To, czego ten wynik dowodzi, a czego nie, zostało szczegółowo omówione w sekcji o benchmarkach poniżej. Pozostałe twierdzenia dotyczące tej odświeżonej wersji — rozumowanie w środowiskach korporacyjnych, praca naukowa i ogólna długofalowa autonomia — nadal pochodzą wyłącznie od producenta, więc zachowaj dyscyplinę, która obowiązywała przy sierpniowej tabeli: traktuj je jako hipotezę, dopóki nie potwierdzi ich analiza Artificial Analysis lub rzeczywiste obciążenie robocze.
To, co „Cowork” oznacza w praktyce, czyni to odświeżenie interesującym. Qwen3.8-Max z ery GA już stawiał na autonomię długiego horyzontu — 16-dniowy build oh-my-cli, wirtualny biznes liczący ponad 2000 rund — a build 0902 to Alibaba, który jeszcze mocniej stawia na tę oś: agenci koordynujący wiele narzędzi i realizujący zadanie end-to-end, zamiast udzielać jednorazowych odpowiedzi. W tym samym tygodniu zespół Accio z Alibaby opublikował CommerceAgentBench — benchmark zaprojektowany do bezpośredniego pomiaru właśnie tej osi: 107 zadań długiego horyzontu w stanowych replikach rzeczywistego oprogramowania komercyjnego i biznesowego, w których Qwen3.8-Max przewodzi wśród modeli open-weight — szczegóły w sekcji poświęconej benchmarkowi poniżej. Dla zespołów oceniających model pod kątem zastosowań w przedsiębiorstwach to teza, którą należy sprawdzić w pierwszej kolejności, ponieważ jest też najtrudniejsza do zweryfikowania na podstawie tabeli wyników benchmarku.
Ceny: najbardziej agresywny element tej premiery
Alibaba Model Studio podaje Qwen3.8-Max za $2.00 za 1M tokenów wejściowych i $6.00 za 1M tokenów wyjściowych. Wyjście obejmuje tokeny myślenia, co ma znaczenie, ponieważ konfiguracje wymagające intensywnego rozumowania rozliczają swoje wewnętrzne rozważania według stawki za tokeny wyjściowe. Ekonomia pamięci podręcznej: trafienia w pamięci podręcznej dla tokenów wejściowych kosztują $0.25 za 1M, jawne tworzenie pamięci podręcznej $2.50, a jawne odczyty pamięci podręcznej $0.17.
Strukturalnie interesującą częścią nie jest główna liczba, lecz płaski poziom. Alibaba pobiera te same $2/$6 niezależnie od tego, czy prompt ma 5 000 tokenów, czy 900 000. Większość konkurentów stosuje dopłatę za długi kontekst właśnie dlatego, że obsługa promptu liczącego blisko milion tokenów jest kosztowna. To, że Alibaba bierze ten koszt na siebie, to celowa próba zagarnięcia rynku, wymierzona dokładnie w te zadania, w których długi kontekst jest sednem: przegląd kodu w całym repozytorium, analiza umów i dokumentów, synteza badań na podstawie wielu dokumentów.
Przykład praktyczny. Załóżmy, że uruchamiasz agenta analizującego repo: 200 000 tokenów wejściowych kontekstu kodu i 8 000 tokenów wyjściowych na jedno wywołanie.
• Za wywołanie: 0,2M × $2 = $0,40 wejście, plus 0,008M × $6 = $0,048 wyjście. ≈ $0,45 za wywołanie.
• Przy 1000 połączeń dziennie: ≈ 448 $/dzień, czyli około 13 400 $/miesiąc.
• To samo wywołanie do Claude Opus 5 przy stawkach $5/$25: $1.00 + $0.20 = $1.20 — około 2.7× więcej.
• Przy cachowaniu promptów w stabilnym kontekście kodu, wejście z pamięci podręcznej po 0,25 USD obniża stronę wejściową z 0,40 USD do 0,05 USD, redukując koszt połączenia do ≈ 0,10 USD — czyli prawie 4,5-krotną redukcję przy powtarzającym się ruchu.
To właśnie różnica w cache’owaniu jest miejscem, gdzie kryje się prawdziwy budżet. Jeśli twój agent przy każdej turze ponownie odczytuje w większości niezmieniony kontekst — co opisuje większość agentów do kodowania i wsparcia — efektywna cena jest znacznie bliższa $0.25/$6 niż $2/$6. Zespoły, które pomijają konfigurację cache, rutynowo przepłacają 3–4× w tym modelu.
Dla porównania w cenach katalogowych: Qwen3.8-Max $2/$6; jego własny poprzednik Qwen3.7-Max $2.50/$7.50; Kimi K3 $3/$15; GPT-5.6 Terra $2/$12; Claude Opus 5 $5/$25. Pod względem wejścia Qwen jest jedynie konkurencyjny. Pod względem wyjścia — strony, która dominuje w wydatkach na rozumowanie i pracę agentową — jest najtańszym modelem pretendującym do miana czołowego na tej liście.
Niezależny pomiar Artificial Analysis ujawnia drugą stronę tych tanich tokenów. Na swoim Intelligence Index Qwen3.8-Max kosztuje 1,14 USD za zadanie — ponad dwukrotnie więcej niż 0,53 USD u poprzednika i 25% więcej niż 0,86 USD u Kimi K3 mimo że cennik Kimi K3 wynosi 3/15 USD za token. Różnica ma charakter behawioralny, a nie wynika z podwyżki cen: model wykonywał średnio 64 kroki na zadanie GDPval-AA w porównaniu z 14 dla Qwen3.7-Max, a ponieważ harness wysyła ponownie całą konwersację na każdym kroku, tokeny wejściowe wzrosły około 15-krotnie, a wyjściowe o ~45%. Tanie tokeny nie oznaczają tanich agentów — gadatliwość, którą zauważyli testerzy wersji preview, ma teraz wyceniony koszt. Ponieważ OrcaRouter przekazuje ceny listowe z zerową marżą za jednym punktem końcowym zgodnym z OpenAI, to pytanie 1,14 USD kontra 0,86 USD można zmierzyć na identycznych promptach bez drugiego kontraktu.

Tabela benchmarków i co tak naprawdę mierzy każda liczba
Podczas GA Alibaba opublikowało tabelę, którą wstrzymało na podglądzie. Zgłoszone wyniki:
• Terminal-Bench 2.1 — 86.6. Sprawdza, czy model potrafi obsługiwać prawdziwą powłokę do samego końca: uruchamiać polecenia, czytać dane wyjściowe i odzyskiwać się po błędach. To najbliższy odpowiednik tego, czy może działać jak agent kodujący, a nie tylko sugerujący kod.
• GPQA Diamond — 92.6. Pytania z fizyki, chemii i biologii na poziomie studiów magisterskich, zaprojektowane tak, aby były odporne na wyszukiwanie. Wysoki wynik wskazuje na prawdziwe rozumowanie naukowe, a nie na zapamiętywanie. Wynik 92.6 plasuje się na szczycie obecnego rankingu.
• PaperBench — 93.0. Odtwarzanie wyników z artykułów naukowych — czytanie metodologii i ponowne jej implementowanie. Nagradza ciągłe, wieloetapowe rozumienie.
• IFBench — 82.8.Wykonywanie instrukcji w warunkach ograniczeń: format, długość i instrukcje negatywne. Co istotne, jest to najniższy wynik w tabeli samego Alibaby, co jest spójne z zarzutami z okresu podglądu, że model jest tak dokładny, że ignoruje limity zakresu.
• OSWorld-Verified — 86.1. Obsługa komputera: sterowanie rzeczywistym GUI pulpitu, aby wykonywać zadania. Mocna pozycja tutaj wspiera pozycjonowanie agentowe.
• OmniDocBench 1.5 — 92.1. Parsowanie dokumentów — tabele, układ, mieszany tekst i grafiki. Łączy się z kontekstem 1M w stałej cenie, aby stanowić realny argument za pipeline'ami dokumentów.
• FrontierSWE — 73.5, wzrost z 40.7 poprzednika. DeepSWE 1.1 — 56.6, wzrost z 21.6.
Te dwa ostatnie zasługują na podkreślenie. Niemal podwojenia wyników na trudnych benchmarkach inżynierii oprogramowania w ciągu jednej generacji to nie są normalne przyrosty i są zgodne z decyzją Alibaby o promowaniu tego modelu wśród programistów, a nie wśród użytkowników czatu. Jeśli wynik FrontierSWE przetrwa niezależną replikację, Qwen3.8-Max jest poważnym modelem do kodowania, a nie tylko dużym.
Zastrzeżenie z zapowiedzi zmniejszyło się, ale nie zniknęło. Powyższa tabela została przygotowana przez Alibaba na własnym harnessie, w warunkach, których nikt inny nie może sprawdzić.Tabele dostawców są wybierane, a nie losowane — laboratoria publikują wyniki na tych benchmarkach, na których dobrze wypadają. Ale od 6 sierpnia jest już prawdziwie niezależny arbiter: według Artificial Analysis Qwen3.8-Max uzyskał 56 w Indeksie Inteligencji przy 1,14 $ za zadanie, zmierzone na oficjalnym API Alibaby — skok o 10 punktów względem 46 poprzednika, na równi z Claude Opus 4.8 (56) i o jeden punkt za Kimi K3 (57). Na agentowym rankingu GDPval-AA firmy AA model osiąga 1 739 Elo, wyprzedzając Kimi K3 (1 685) i GPT-5.6 Sol (1 730); wyżej jest tylko Claude Opus 5 (1 852). Zastrzeżenia samego AA zasługują na równą wagę: wcześniejszy przebieg dał 53, zanim naprawiono problemy z endpointem, a ponowny test na oficjalnym API przyniósł 56; AA-Omniscience spadł o 10 punktów ze względu na wskaźnik halucynacji, który wzrósł z 23% do 40%; a koszt za zadanie jest wysoki właśnie dlatego, że model mozolnie przerabia znacznie więcej kroków. Ogólny ranking LMArena nadal nie ma publicznego wyniku.
Premiera DigitalOcean dodała trzeci punkt danych, tym razem dotyczący wersji skwantowanej, a nie flagowej. Wewnętrzna kontrola DigitalOcean wag NVFP4, które serwuje, uzyskała wynik 88 w GPQA Diamond, wobec opublikowanych przez Alibaba 92,6 dla niekwantowanej wersji flagowej. Sam DigitalOcean określa to porównanie jako „punkt orientacyjny, a nie kontrolowane porównanie” — różnice dotyczą trzech osi (baza o otwartych wagach zamiast hostowanej wersji flagowej, NVFP4 zamiast BF16 oraz inny stos ewaluacyjny) — ale jest to pierwsza niezależna weryfikacja rzeczywistego wdrożenia serwerowego tych wag i przypomnienie, że otwarty checkpoint nie jest co do bajta liczbą z tabeli Alibaba.
CommerceAgentBench: tablica wyników agentowego handlu
Wraz z odświeżeniem zespół Accio z Alibaba International opublikował CommerceAgentBench — benchmark zaprojektowany tak, aby oceniać dokładnie te długoterminowe zadania, które Qwen nieustannie promuje. Agent rozpoczyna każde zadanie w nowym kontenerze, w jednej z 14 offline'owych replik rzeczywistego oprogramowania handlowego i biznesowego — publikowanie produktów, rezerwacja frachtu, administrowanie witryną sklepową, operacje płatnicze, analiza dostawców — a ocenianie jest oparte na stanie: zadanie jest zaliczane tylko wtedy, gdy bazowe usługi zastępcze oraz wygenerowane pliki faktycznie ulegną zmianie, więc agent, który opisze wiarygodny przebieg pracy bez zmiany stanu, nie otrzymuje żadnych punktów. Zestaw obejmuje 107 zadań realizowanych przez interfejsy CLI, przeglądarkowe, pliki/dokumenty oraz API/MCP, uruchamianych za pomocą trzech środowisk testowych — Accio, OpenClaw i Pi — a kod tych środowisk (Apache 2.0) oraz dane zadań (CC BY 4.0) są dostępne do wglądu i ponownego uruchamiania.
W opublikowanych tabelach Qwen3.8-Max osiąga najlepszy wynik open-weight: 56 z 107 zadań na platformie Accio, 47 na OpenClaw i 53 na Pi — łącznie 156 zaliczeń, o dwa więcej niż DeepSeek V4 Pro (154). Cała przewaga open-weight pochodzi z platformy Accio; na OpenClaw i Pi oba modele remisują. Lider open-weight nie jest jednak liderem całego zestawienia: zamknięty model Claude Opus 5 dystansuje stawkę z 191 zaliczeniami łącznie, czyli o 35 więcej. Sama tabela jest też dziełem Alibaba — Accio to zespół Alibaba, a repozytorium wprost wskazuje ograniczenia audytu: platforma Accio ma charakter wyłącznie referencyjny i nie można jej odtworzyć z samego pobrania repozytorium (ścieżką wielokrotnego uruchomienia jest OpenClaw), wyniki na poziomie poszczególnych zadań nie mają niezmiennych publicznych sum kontrolnych, a wiersze Qwen opierały się na protokole replikacji treści rozumowania, aby pozostać porównywalne. Potraktuj to jako punkt danych deklarowany przez producenta na tej samej osi agentycznej, którą OSWorld-Verified i podejście GDPval-AA firmy AA mierzą z różnych stron — warto sprawdzić go na własnych przepływach pracy, ale nie jest to rozstrzygający ranking.
Code Arena WebDev: niezależny arbiter builda 0902
Code Arena to właśnie ten niezależny dowód, jakiego zabrakło przy tej aktualizacji. To zewnętrzny ranking agentowego tworzenia aplikacji webowych — projekt znany wcześniej jako WebDev Arena — w którym głosujący na ślepo porównują parami wyniki modeli i wybierają ten, który woleliby wdrożyć, a głosy są przeliczane na ocenę w stylu Elo. Na tablicy WebDev model Qwen3.8-Max-0902 zadebiutował na szczycie z 1 691 punktami — o 22 więcej niż poprzednia wersja — wyprzedzając Claude Opus 5 i Kimi K3. Ta pozycja ma też przewagę kosztową: przy mieszanej cenie ~5 USD za milion tokenów — stawce cennikowej 2/6 USD z wagą przesuniętą w stronę mieszanki obfitującej w tokeny wyjściowe, jaką realnie generuje tworzenie aplikacji webowych — wersja 0902 jest najwyżej punktowanym modelem na granicy Pareto tablicy. Kosztuje przy tym około jednej czwartej mieszanej ceny Claude Opus 5 (~20 USD/M) i znacznie mniej niż ~12 USD/M Kimi K3; to dlatego oba modele leżą poza granicą Pareto, mimo że zajmują 2. i 3. miejsce w punktacji. Alibaba ogłosiła tę pozycję 2 września, a oficjalne konto Qwena potwierdziło ją, kierując użytkowników do QwenCloud. Ten wynik nie pochodzi jednak od Alibaba — w przeciwieństwie do powyższej tabeli benchmarków lub uruchomienia CommerceAgentBench tuż powyżej, wynik powstaje bowiem na zewnętrznej arenie na podstawie głosów ludzkich preferencji.
Dwa zastrzeżenia trzymają sprawę w ryzach. Po pierwsze, oceny na arenie są chwilowe: 1691 to wynik, przy którym zatrzymała się tablica, gdy Alibaba ogłosił debiut — i będzie się on przesuwał w miarę gromadzenia głosów. Należy więc czytać go jako mocny sygnał dotyczący kodowania w developmentzie webowym, a nie trwałą koronę. Po drugie, obejmuje to tylko tę jedną oś. Odświeżone deklaracje dotyczące zastosowań enterprise, naukowych i ogólnych długoterminowych wciąż nie mają niezależnego arbitra, dlatego tabela dostawców oraz wskaźnik AA Index 56 na modelu bazowym pozostają punktami odniesienia dla wszystkiego, co wykracza poza agentową pracę front-endową. Po trzecie, cena graniczna to wybór modelowy, a nie nowy cennik: wartość ~5 USD/MToken wynika z połączenia niezmienionych cen katalogowych 2 USD/6 USD przy założeniu intensywnego użycia po stronie generowania tokenów. Trzeba więc traktować ją jako ranking efektywności kosztowej na warunkach areny, a nie jako przecenę ze strony Alibaba.

Otwarte wagi, Qwen3.8-27B i kwestia on-premise
Obietnica Alibaby dotycząca otwartych wag została dotrzymana. 12 sierpnia 2026 r. Qwen opublikował na Hugging Face dwa repozytoria — Qwen3.8-2.4T-A95B w BF16 oraz Qwen3.8-2.4T-A95B-FP8 — każde z 213 plikami wag. Licencja to niestandardowa licencja Qwen3.8-Max, a nie Apache 2.0; w polu licencji na Hugging Face widnieje „other". Warunki zezwalają na użycie, modyfikację, dystrybucję i fine-tuning, w tym do celów komercyjnych, pod warunkiem podania autorstwa, a także dwa progi zależne od skali: produkty z ponad 100 milionami aktywnych użytkowników miesięcznie lub miesięcznym przychodem powyżej 20 milionów dolarów muszą widocznie wyświetlać nazwę modelu, a firmy świadczące usługi Model-as-a-Service lub AI-Work-Assistant z łącznym przychodem za ostatnie dwanaście miesięcy powyżej 50 milionów dolarów potrzebują osobnej licencji od Qwen. Większość zespołów mieści się w tych progach; jeśli Twoja firma je przekroczy, przeczytaj tekst licencji, zanim na niej cokolwiek zbudujesz. Liczniki pobrań potwierdzają świeżość — 978 w repozytorium BF16 i 3851 w repozytorium FP8 w chwili pisania tego tekstu, czyli mało jak na wydanie z czołówki i spójne z repozytorium utworzonym 8 sierpnia i upublicznionym dopiero 12 sierpnia, a nie takim, które było widoczne przez tydzień. Jeszcze jedna uczciwa uwaga: otwarty checkpoint to model bazowy, wyłącznie tekstowy, z trybem myślenia zawsze włączonym, podczas gdy hostowane API Qwen3.8-Max dodaje wejście obrazowe, opcjonalny tryb bez myślenia i pełny kontekst 1M — pobranie wag daje Ci model, ale nie wszystkie funkcje API.
Samodzielne hostowanie flagowego modelu wciąż pozostaje poza zasięgiem większości zespołów, ale teraz jest to poza zasięgiem ze znaną matematyką. Pełny zestaw wag o 2,4 bln parametrów to mniej więcej 4,9 TB w BF16 i około 2,4 TB w FP8, ponieważ każdy ekspert musi rezydować w pamięci, mimo że tylko 95 mld z nich jest aktywowanych na token. Przy kwantyzacji 4-bitowej to rząd wielkości 1,2 TB wobec około 141 GB na H200, więc zanim obsłużysz choćby jeden token, potrzebujesz ośmiu lub więcej akceleratorów z najwyższej półki. To, co dodaje obecnie jawna liczba aktywowanych parametrów, to strona przepustowości: przy 95 mld aktywowanych parametrów na token koszt obliczeniowy na token jest porównywalny z modelem gęstym z klasy ~90 mld parametrów — to ułamek kosztów, jakie narzuciłby gęsty model o 2,4 bln parametrów — więc gdy wagi są już rezydentne, koszt na token nie jest koszmarem, na jaki wskazuje całkowita liczba parametrów. To połączenie dużej zajętości pamięci i umiarkowanego kosztu obliczeniowego na token jest właśnie powodem, dla którego Alibaba może wycenić output na 6 USD/1M, i kieruje zespoły samodzielnie hostujące model w stronę węzłów wielo-GPU uruchamiających checkpointy FP8, a nie czegokolwiek na pojedynczym GPU.
Wybór DigitalOcean dotyczący serwowania modelu to działający przykład tej matematyki w produkcji. Uruchamia on model w kwantyzacji NVFP4 na procesorach graficznych NVIDIA HGX B300 specjalnie po to, aby wagi 2,4T zmieściły się na pojedynczym węźle, unikając routingu ekspertów między węzłami — to wdrożenie na żywo 4-bitowej ekonomii, którą ta sekcja dotąd analizowała na papierze. Kompromis jest dokładnie taki, jaki mierzy powyższa kontrola GPQA: mniejszy ślad pamięciowy przy pewnej mierzalnej stracie jakości względem niekwantyzowanego flagowca.
To właśnie sprawia, że Qwen3.8-27B jest ważniejszą premierą dla większości czytelników — w przeciwieństwie do flagowego modelu, jego wagi pojawiły się zgodnie z harmonogramem. 14 sierpnia 2026 r. Qwen opublikował Qwen/Qwen3.8-27B na Hugging Face i ModelScope na licencji Apache 2.0: gęsty model 27B, natywnie multimodalny, z natywnym kontekstem 262 tys. tokenów rozszerzalnym do 1 mln i konfigurowalnym trybem reasoning_effort. Daniel Han z Unsloth szacował, że będzie on działać w około 17 GB VRAM — na pojedynczej karcie prosumenckiej — i to można już teraz przetestować: oficjalne repozytorium zawiera BF16 safetensors (około 55,6 GB w 18 shardach), a kwantyzacje GGUF pojawiają się w repozytoriach społeczności. Schemat wydawniczy tej generacji jest już kompletny: wagi flagowego modelu 2.4T ukazały się najpierw, 12 sierpnia, a dwa dni później pojawił się mały model dla wdrożeń lokalnych. Śledziliśmy jego premierę w naszym wpisie o dacie premiery Qwen3.8-27B.
Gdzie Qwen3.8-Max znajduje zastosowanie: cztery scenariusze
1. Analiza długich dokumentów i umów. To najlepsze dopasowanie. Stała stawka za 1M tokenów plus OmniDocBench 92.1 oznacza, że możesz przesłać 400-stronicowy dokument w jednym wywołaniu bez dopłaty i bez dzielenia na fragmenty. Konkurenci pobierający opłaty za długi kontekst sprawiają, że to samo zadanie jest znacznie droższe. Na ścieżce DigitalOcean pamiętaj, że obsługuje ona otwarty model bazowy z kontekstem 262K — to wciąż duży dokument, ale nie pełny milion.
2. Agenci kodowania w skali repozytorium. Terminal-Bench 86.6 i FrontierSWE 73.5 to potwierdzają, a ceny cache sprawiają, że iteracyjna praca nad stabilną bazą kodu jest tania. Najpierw należy przetestować latencję przy własnej współbieżności, ponieważ recenzenci z okresu preview uznali model za dokładny, ale powolny podczas długich przebiegów agentowych, a serwowanie GA to coś zupełnie innego niż serwowanie preview. Wynik GDPval-AA osiągnięty przez AA — czołowe 1 739 Elo kosztem 64 kroków na zadanie — jest niezależnym potwierdzeniem obu stron tego kompromisu. Pomiary DigitalOcean z 12 sierpnia — niemal liniowe skalowanie zagregowanej przepustowości do ~1 937 tokenów wyjściowych na sekundę przy 256 równoczesnych żądaniach, z zerową liczbą błędów i bez wykrytego nasycenia — są pierwszym punktem danych z platformy zarządzanej w tej kwestii, choć są to własne liczby DigitalOcean dotyczące jego własnego serwowania, a nie bezpośrednie porównanie z serwowaniem Alibaba.
3. Pipeline'y dokumentów i zrzutów ekranu. Wejście wideo i obrazu oraz OSWorld-Verified 86.1 sprawiają, że jest wiarygodny w przypadku przepływów pracy odczytujących ekrany — automatyzacja QA, triage wsparcia na podstawie zrzutów ekranu, zadania zbliżone do RPA. Ponownie — wejście multimodalne to funkcja hostowanego API; ścieżka open-base DigitalOcean jest tylko tekstowa.
4. Gdzie byśmy tego jeszcze nie umieścili. Interaktywne UX o krytycznym znaczeniu dla opóźnień oraz wszelkie regulowane obciążenia wymagające powtarzalnej ewaluacji. W pierwszym przypadku chcesz mieć zmierzoną przepustowość, którą kontrolujesz. W drugim przypadku powtarzalność ma teraz kartę modelu i licencję do cytowania, ale tabela benchmarkowa Alibaby wciąż nie jest zreplikowana — a regresja Omniscience AA (wskaźnik halucynacji do 40%) przypomina, że niezależny wynik działa w obie strony.

Jak uzyskać dostęp do Qwen3.8-Max
Jest kilka praktycznych ścieżek. Bezpośrednio przez Alibaba Model Studio / DashScope — albo własne API Qwen, czyli QwenCloud — dostajesz powyższą kartę stawek oraz najwcześniejszy dostęp do nowych, datowanych migawek — wersja Qwen3.8-Max-0902 z 2 września pojawiła się tam najpierw, zanim trafiła na inne endpointy — kosztem wdrożenia nowego dostawcy i zarządzania kolejnym kluczem. Qwen Chat i aplikacja Qwen to najszybszy sposób, żeby zobaczyć zachowanie modelu przed pisaniem kodu. Pobranie otwartych wag z Hugging Face to czwarta ścieżka dla zespołów, które chcą prowadzić własną infrastrukturę — z zastrzeżeniami dotyczącymi rozmiaru i licencji opisanymi powyżej. Korzystanie z rutera to opcja, którą powinna rozważyć większość zespołów produkcyjnych, ponieważ oddziela decyzję o migracji od decyzji o ewaluacji.
Od 14 sierpnia 2026 r. istnieje naprawdę nowa opcja: Qwen3.8-Max jest dostępny w DigitalOcean Serverless Inference, które Alibaba ogłosił jako swojego „Day 0 launch partner” — to określenie samego Alibaby, choć wpis należy do DigitalOcean i broni się sam. DigitalOcean udostępnia checkpoint o otwartych wagach (identyfikator modelu platformy: qwen3.8-max), skwantowany do NVFP4 na procesorach graficznych NVIDIA HGX B300 we współpracy technicznej z Inferact, jako w pełni zarządzany interfejs API typu serverless: jeden punkt końcowy, płatność za rzeczywiste użycie, bez infrastruktury do zarządzania. Jego cennik odpowiada cennikowi Alibaby — 2,00 USD za wejście / 6,00 USD za wyjście za 1 mln, z wejściem z pamięci podręcznej po 0,20 USD — i udostępnia natywny dla otwartej bazy kontekst 262K z zawsze włączonym trybem myślenia, zamiast multimodalnego trybu hostowanego flagowca o ~1 mln tokenów. Ten limit kontekstu ma znaczenie, jeśli Twoje obciążenie wymaga długich sekwencji: pełny tryb milionotokenowy pozostaje dostępny tylko przez API Alibaby.
To, co ścieżka DigitalOcean dodaje poza geografią, to pierwsze twarde dane o serwowaniu od dostawcy innego niż Alibaba. Własne pomiary DigitalOcean względem ich produkcyjnego punktu końcowego, wykonane 12 sierpnia, pokazują, że prefill skaluje się liniowo przy mniej więcej 16 000 tokenów/sek — praktyczna zasada: TTFT ≈ (input ÷ 16 000) + 0,7 s, więc ~1,1 s przy ~1 080 tokenach i ~15,8 s przy ~254K — a zagregowana przepustowość osiąga ~1 937 tokenów wyjściowych/sek przy 256 równoczesnych żądaniach z zerową liczbą błędów i nie znaleziono punktu nasycenia. To są liczby DigitalOcean na ich własnym wdrożeniu, a nie kontrolowany bake-off, ale są to pierwsze dane dotyczące opóźnień i współbieżności dla tego modelu poza chmurą Alibaba, i bezpośrednio odpowiadają na obawę „dokładny, ale wolny” z ery podglądu.
Qwen3.8-Max jest już dostępny na OrcaRouter jako qwen/qwen3.8-max, a odświeżenie z 2 września można kierować pod własnym identyfikatorem z datą — qwen/qwen3.8-max-0902 — oba w tej samej cenie katalogowej $2.00 / $6.00. OrcaRouter stosuje 0% marży i przekazuje ceny dostawcy bez zmian, więc obie trasy kosztują tyle samo, co korzystanie bezpośrednie. Nasza własna telemetria serwowania pokazuje obecnie p50 czasu do pierwszego tokenu wynoszący 1,64 sekundy w oknie 7 dni. To pomiar opóźnienia po naszej stronie, a nie deklaracja dostawcy, i warto zestawić go z raportami z epoki wersji zapoznawczej o „najwolniejszym modelu, jakiego używałem”: pochodziły one od jednego recenzenta prowadzącego godzinne, agentowe buildy na infrastrukturze preview i należy je ponownie przetestować na wydaniu GA, zamiast powtarzać jako aktualny fakt.
Praktyczna wartość ścieżki routingu polega na tym, że Qwen3.8-Max znajduje się za tym samym endpointem zgodnym z OpenAI co modele, które już uruchamiasz, więc ewaluacja to tylko zmiana stringu modelu. Możesz skierować na niego 5% ruchu produkcyjnego, porównać go z dotychczasowym modelem na identycznych promptach i zachować fallback — czyli dokładnie taką postawę, na jaką zasługuje model z niezreplikowaną tabelą dostawcy. Ta sama postawa jest właściwym sposobem na przetestowanie wdrożenia DigitalOcean: uruchom na nim fragment ruchu z fallbackiem, zamiast stawiać produkcyjną ścieżkę na dwutygodniowym stacku serwującym.

Ograniczenia i uczciwe ryzyka
• Tabela dostawców wciąż niezaudytowana. Niezależny wynik już jest (AA Index 56), ale własna tabela benchmarkowa Alibaby pozostaje niezreplikowana, a pomiar AA wskazuje na regresję Omniscience przy wskaźniku halucynacji sięgającym 40%. Niezależna ocena pomaga; nie czyni jednak tabeli dostawców audytowalną.
• Ścieżka DigitalOcean to otwarta baza, a nie flagowy produkt. Udostępnia checkpoint z kontekstem 262K, tylko tekst, myślenie zawsze włączone, kwantyzację NVFP4 — a własne testy wyrywkowe DigitalOcean osiągają 88 w GPQA Diamond wobec opublikowanych przez Alibaba 92,6, co DigitalOcean określa jako różnicę orientacyjną, a nie kontrolowaną. Jeśli potrzebujesz pełnego multimodalnego API o milionie tokenów, to nadal jest ono hostowane przez Alibaba.
• Qwen3.8-27B wydano, ale numeracja pochodzi od producenta. Wagi modelu 27B pojawiły się 14 sierpnia na licencji Apache 2.0, zamykając lukę w ofercie on-premise — ale deklarowane wyniki benchmarków pochodzą wyłącznie od Alibaba i nie zostały niezależnie potwierdzone, a kwantyzacje tworzone przez społeczność wciąż były publikowane w momencie tej aktualizacji.
• Licencja niestandardowa, a nie Apache 2.0. Licencja Qwen3.8-Max pozwala na komercyjne użycie z podaniem autorstwa, ale zawiera dwa progi skali — widoczne wyświetlanie nazwy modelu powyżej 100 mln MAU lub 20 mln USD miesięcznych przychodów oraz osobną licencję dla firm świadczących usługi MaaS/AI-Work-Assistant o przychodach powyżej 50 mln USD za ostatnie dwanaście miesięcy. Przeczytaj ją, zanim przekroczysz te progi.
• Rozwlekłość i dryfowanie od instrukcji.IFBench 82.8 to najsłabszy wynik we własnej tabeli Alibaba, a testerzy wersji preview wielokrotnie widzieli, jak model wychodził poza zakres — dodając niepotrzebne funkcje. Dane AA wreszcie pokazują to konkretnie: 64 kroki na zadanie GDPval-AA to właśnie to, co podnosi koszt do 1,14 USD, czyli o 25% więcej niż w przypadku Kimi K3. Urocze w demie, drogie, gdy wynik jest rozliczany po 6 USD/1M, i destabilizujące, gdy potrzebujesz dokładnych formatów.
• Ograniczenia treści. Podobnie jak inne czołowe modele hostowane w Chinach, odpowiedzi na tematy politycznie wrażliwe są ograniczone. Istotne, jeśli Twój produkt obsługuje zapytania otwarte.
• Tokeny myślenia rozliczane są jako dane wyjściowe. Przy włączonym rozumowaniu rzeczywiste koszty przewyższają naiwne szacunki. Mierz przy rozumowaniu skonfigurowanym tak, jak faktycznie będziesz je wdrażać.

Często zadawane pytania
Czy Qwen3.8-Max jest już dostępny?
Tak. Ogólna dostępność nastąpiła 3 sierpnia 2026 r., wraz z opublikowanym cennikiem i API zgodnym z OpenAI i DashScope. Obecny migawka produkcyjna — Qwen3.8-Max-0902, wydana 2 września — jest aktywna w API QwenCloud i to ona obsługuje standardowy punkt końcowy qwen3.8-max. To zmiana w stosunku do statusu zapowiedzi z 19 lipca, gdy dostęp był ograniczony do Qwen Chat, aplikacji Qwen i kampanii kredytowej Qoder.
Czym jest Qwen3.8-Max-0902?
Qwen3.8-Max-0902 to produkcyjne odświeżenie Qwen3.8-Max z 2 września 2026 r.: ten sam flagowy model sparse-MoE o 2,4 bln parametrów i kontekście 1 mln tokenów, dodatkowo dotrenowany na Coding i Cowork, dostępny w API QwenCloud w tej samej cenie $2/$6. Qwen twierdzi, że nowa migawka jest mocniejsza w złożonych zadaniach korporacyjnych i naukowych — to deklaracja producenta, niepotwierdzona jeszcze niezależnymi benchmarkami — natomiast w obszarze kodowania ma już niezależny wynik: #1 na tablicy Code Arena: WebDev z 1691 punktami i szczyt swojej krzywej Pareto efektywności kosztowej przy łącznej cenie ~$5/MToken, zgodnie z ogłoszeniem Alibaba o umieszczeniu na liście areny na żywo, potwierdzonym przez konto QwenCloud Qwen.
Ile kosztuje Qwen3.8-Max?
$2.00 za 1 mln tokenów wejściowych i $6.00 za 1 mln tokenów wyjściowych, cena stała dla pełnego kontekstu 1 mln tokenów, bez dopłaty za długi prompt. Trafienia w pamięci podręcznej dla tokenów wejściowych kosztują $0.25 za 1 mln, jawne tworzenie pamięci podręcznej $2.50, a odczyty z pamięci podręcznej $0.17. Tokeny myślenia są rozliczane według stawki wyjściowej. W indeksie Intelligence Index serwisu Artificial Analysis zmierzony koszt modelu wynosi $1.14 za zadanie — zobacz sekcję o cenach, dlaczego jest to więcej niż wynikałoby z przeliczenia tokenów. DigitalOcean w swojej ofercie serverless podaje te same stawki $2/$6, z danymi wejściowymi z pamięci podręcznej po $0.20.
Ile parametrów ma Qwen3.8-Max?
Łącznie 2,4 biliona parametrów, w rzadkiej konfiguracji mieszaniny ekspertów. Liczba aktywnych parametrów — czyli wartość, która faktycznie determinuje koszt i opóźnienie serwowania — została obecnie potwierdzona na 95 miliardów aktywowanych parametrów, zgodnie z oficjalną kartą modelu Qwen3.8-2.4T-A95B (512 ekspertów; 10 routowanych plus jeden wspólny aktywny na token).
Czy wagi Qwen3.8-Max są otwarte?
Tak — od 12 sierpnia 2026 r. Qwen opublikował Qwen3.8-2.4T-A95B (BF16) i Qwen3.8-2.4T-A95B-FP8 na Hugging Face, każdy z 213 plikami wag. Licencja to niestandardowa licencja Qwen3.8-Max (Hugging Face wymienia ją jako „other"), a nie Apache 2.0: pozwala na użycie komercyjne z podaniem autorstwa i obejmuje dwa progi zależne od skali. Otwarty checkpoint jest wyłącznie tekstowy, z zawsze włączonym trybem myślenia; hostowane API dodaje obsługę obrazów, opcjonalny tryb bez myślenia i pełny kontekst 1M.
Czy Qwen3.8-Max został poddany niezależnym testom porównawczym?
Tak — stan na 6 sierpnia 2026 r. Artificial Analysis wycenia go na 56 w swoim Indeksie Inteligencji przy 1,14 USD za zadanie, mierzone na oficjalnym API Alibaba: to skok o 10 punktów względem Qwen3.7-Max (46), wyrównanie z Claude Opus 4.8 (56) i jeden punkt za Kimi K3 (57). Powyższa tabela benchmarkowa pozostaje jednak raportem Alibaba i nie została powtórzona, a ogólna lista liderów LMArena wciąż nie ma publicznego wyniku. Obraz niezależnej areny zmienił się 2 września: odświeżenie 0902 zadebiutowało na 1. miejscu na tablicy Code Arena: WebDev tej samej platformy z wynikiem 1691 punktów — to rezultat głosowania osób trzecich prowadzonego na ślepo, nie tabela Alibaba — a granica opłacalności Code Arena umieszcza go jako najwyżej ocenianą wartość na tablicy przy łącznym koszcie około 5 USD/MToken. Kontrola wyrywkowa DigitalOcean jego skwantowanej wersji (88 w GPQA Diamond) jest pierwszą weryfikacją przez osobę trzecią wdrożenia serwującego i ma charakter wyraźnie poglądowy, a nie kontrolowany. Jedna uwaga do kolumny „niezależne”: CommerceAgentBench, w którym Qwen3.8-Max prowadzi wśród modeli o otwartych wagach, nie jest drugim niezależnym sędzią — Accio, które go zbudowało i opublikowało, to zespół samego Alibaba.
Czy Qwen3.8-Max jest lepszy od Qwen3.7-Max?
Według danych samego Alibaba, wyniki są znacznie lepsze: {{1}}FrontierSWE 73.5 wobec 40.7 i DeepSWE 1.1 56.6 wobec 21.6{{/1}} to niemal podwojenia w trudnych zadaniach inżynierii oprogramowania. {{2}}Jest również tańszy od poprzednika, który kosztował 2,50/7,50 USD.{{/2}} {{3}}Niezależnie, AA szacuje skok pokoleniowy na 10 punktów w swoim Intelligence Index (56 wobec 46).{{/3}} Oba twierdzenia dostawcy nadal należy zweryfikować na własnym obciążeniu.
Czy mogę samodzielnie hostować Qwen3.8-Max?
W praktyce nie. Pełny zestaw wag 2,4 T to mniej więcej 4,9 TB w BF16, ok. 2,4 TB w FP8 i ok. 1,2 TB w kwantyzacji 4-bitowej — przy mniej więcej 141 GB na H200 oznacza to osiem lub więcej GPU z najwyższej półki. Przy 95 mld aktywnych parametrów na token koszt obliczeniowy na token jest stosunkowo niewielki, ale to zajętość pamięci jest czynnikiem ograniczającym. Serwowanie NVFP4 DigitalOcean na B300 to praktyczny dowód, że 4-bitowy model mieści się na pojedynczym węźle. Qwen3.8-27B — według doniesień ~17 GB VRAM — to realistyczna opcja on-premise, a jego wagi udostępniono 14 sierpnia 2026 r. na licencji Apache 2.0 — obecnie są do pobrania, a nie tylko zapowiadane.
Czym jest Qwen3.8-27B?
{{1}}Znacznie mniejszy model zapowiedziany wraz z flagowym, pozycjonowany jako praktyczna ścieżka wdrożeń on-premise. To gęsty model o 27B parametrów, natywnie multimodalny, z natywnym kontekstem 262K tokenów, możliwym do rozszerzenia do 1M, wydawany na licencji Apache 2.0.{{/1}} {{2}}Jego wagi trafiły na Hugging Face i ModelScope 14 sierpnia 2026 r.{{/2}} {{3}}Daniel Han z Unsloth informuje, że działa on w około 17GB pamięci VRAM — czyli na pojedynczej karcie konsumenckiej z wyższej półki.{{/3}} {{4}}Deklarowane wyniki benchmarków pochodzą od Alibaba i nie zostały niezależnie zweryfikowane.{{/4}} {{KEEP}}...{{/KEEP}}
Czy Qwen3.8-Max jest multimodalny?
Tak — przyjmuje wejście tekstowe, obrazowe i wideo, a zwraca tekst. Obsługuje również tryb myślenia, wywoływanie funkcji, wbudowane narzędzia i ustrukturyzowane wyniki. Punkt kontrolny z otwartymi wagami jest wyłącznie tekstowy; wejście multimodalne to funkcja hostowanego API, której nie oferuje ścieżka DigitalOcean.
Czy Qwen3.8-Max jest dostępny na DigitalOcean?
Tak — od 14 sierpnia 2026 roku. DigitalOcean Serverless Inference udostępnia checkpoint o otwartych wagach (NVFP4 na NVIDIA HGX B300) w cenie 2,00/6,00 USD za 1M, z 0,20 USD za wejście w pamięci podręcznej, kontekstem 262K tokenów, tylko tekst, myślenie zawsze włączone. Alibaba nazywa DigitalOcean swoim „partnerem startowym dnia 0”; sam wpis należy do DigitalOcean i jest niezależny od tego sformułowania. Zmierzone wartości DigitalOcean: prefill ~16K tokenów/s i ~1 937 tokenów wyjściowych/s przy 256 równoczesnych żądaniach i zerowej liczbie błędów.
Czy mogę używać Qwen3.8-Max przez OrcaRouter?
Tak. Jest dostępny jako qwen/qwen3.8-max, a migawka z 2 września jako osobny identyfikator z datą — qwen/qwen3.8-max-0902 — w tej samej cenie katalogowej $2.00/$6.00, z 0% narzutu. Koszt routingu jest taki sam jak przy bezpośrednim dostępie, za pośrednictwem kompatybilnego z OpenAI punktu końcowego, którego już używasz. Nasza 7-dniowa telemetria pokazuje p50 czasu do pierwszego tokena wynoszący 1,64 sekundy.
Czy powinienem dzisiaj przełączyć na to ruch produkcyjny?
Nie w całości. Cennik i pierwszy niezależny wynik sprawiają, że poważna ocena jest tania i warta przeprowadzenia teraz, ale przy koszcie na zadanie o 25% wyższym niż w przypadku Kimi K3, zdyscyplinowanym posunięciem jest podział ruchu między obecne rozwiązanie a nowe na identycznych promptach, z przygotowanym mechanizmem awaryjnym — a nie migracja. Opcja DigitalOcean dodaje drugie zarządzane wdrożenie, względem którego można testować, co czyni ocenę jeszcze tańszą.
Sedno sprawy
Qwen3.8-Max przez dwa tygodnie był najciekawszym modelem, którego nie można było kupić. W wersji GA jest to jednak zupełnie inna propozycja: płaskie stawki $2/$6 za milion tokenów to agresywna wycena, stawki za cache sprawiają, że iteracyjna praca agentów jest tania, a skok generacyjny na FrontierSWE i DeepSWE — jeśli się powtórzy — sprawia, że jest to prawdziwy model do kodowania, a nie tylko popis skali. Otwarte wagi udostępnione 12 sierpnia na realnej licencji zamieniły zapowiedź „open weights coming" w fakt, a ogłoszona 14 sierpnia ścieżka DigitalOcean od pierwszego dnia — ze zmierzonymi parametrami serwowania i odczytem z cache za 0,20 USD — wzmacnia argument „wypróbuj tanio" i daje zespołom zarządzane wdrożenie u zewnętrznego dostawcy do porównania z własnym API Alibaba. Odświeżenie Qwen3.8-Max-0902 z 2 września utrzymuje tę tezę w mocy: te same stawki $2/$6 i kontekst 1M, z większym post-trainingiem ukierunkowanym na kodowanie i pracę kolaboracyjną, do których model był już stworzony. Odświeżenie dodało też niezależny ranking oparty na ludzkich preferencjach dla tej tezy o kodowaniu: Qwen3.8-Max-0902 zadebiutował na 1. miejscu listy WebDev w Code Arena z 1 691 punktami, przed Claude Opus 5 i Kimi K3, a przy średniej cenie ~$5/MToken jest najwyżej punktowanym modelem na granicy Pareto kosztów i wydajności dla tego rankingu. Wynik CommerceAgentBench opublikowany w tym samym tygodniu przez zespół Accio z Alibaba — z Qwen3.8-Max prowadzącym wśród modeli o otwartych wagach w benchmarku zbudowanym na realnych procesach handlowych — daje tej tezie o pracy kolaboracyjnej konkretną tablicę wyników, choć prowadzoną przez dostawcę.
Zmieniło się to, że zarówno sędzia, jak i wagi już wylądowały — a werdykt jest w większości dobry, z prawdziwymi gwiazdkami. AA plasuje Qwen3.8-Max na 56 punktach Indeksu Inteligencji, co jest autentycznym skokiem pokoleniowym i sytuuje go na równi z Claude Opus 4.8, choć ta sama karta wyników pokazuje Kimi K3 o punkt wyżej przy 25% niższym koszcie na zadanie, a także sygnalizuje 10-punktowy spadek Omniscience przy rosnącym wskaźniku halucynacji. Kwestia aktywnych parametrów jest rozstrzygnięta — 95 mld aktywnych parametrów, co potwierdzono na karcie modelu — a licencja została opublikowana: to licencja autorska, a nie Apache 2.0. To, co się nie zmieniło: tabela benchmarków samego Alibaby wciąż nie doczekała się replikacji, koszt na zadanie wciąż jest wysoki, bo model wykonuje bardzo wiele kroków, otwarty model bazowy serwowany na DigitalOcean to model nieco inny, niż wskazują sztandarowe liczby flagowca (kontekst 262K, NVFP4, doraźny test GPQA: 88 wobec 92,6), a wyniki benchmarkowe Qwen3.8-27B pochodzą od producenta, mimo że jego wagi zostały już udostępnione. To połączenie nie czyni z Qwen3.8-Max złego zakładu — w tej cenie jest bliski obowiązkowemu eksperymentowi — ale oznacza, że właściwa postawa to: oceniać agresywnie, kierować ruchem świadomie, trzymać plan awaryjny. Teraz trzeba obserwować, czy liczba kroków agentowych stojąca za kosztem 1,14 USD za zadanie jest czymś, co Twój wolumen pracy jest w stanie wchłonąć, czy przewaga buildu 0902 w Code Arena: WebDev utrzyma się w miarę napływu głosów, czy jego zyski w Coding i Cowork powtórzą się na rzeczywistych obciążeniach, czy przewaga CommerceAgentBench wśród modeli open-weight — dwa zagregowane przebiegi na własnym harnessie Alibaby — przetrwa niezależne uruchomienie, czy wyniki benchmarkowe 27B się obronią, oraz czy zmierzona przepustowość wdrożenia na DigitalOcean utrzyma się pod realnym ruchem — to zadecyduje, czy „drugi po Fable 5" było pozycjonowaniem, czy proroctwem.

Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
