
Qwen3.8-Max vs Qwen3.7-Max: dwa poziomy Max, 16 punktów indeksu i promocja, która odwraca cenę
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 495 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 186 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Cztery dni temu dostawca powiedział nam, że Qwen3.8-Max nie jest modelem, który wydał w sierpniu. W komunikacie prasowym z 22 września 2026 r., z konferencji Apsara w Hangzhou, firma ujawniła, że jej flagowy model ukończył 33 iteracyjne cykle w pełni zautomatyzowanego treningu i prac po treningu w ciągu ponad miesiąca, a powstała w ten sposób wersja podniosła jego Artificial Analysis Intelligence Index z 40 do 45. Identyfikator modelu nigdy się nie zmienił. Liczba stojąca za nim już tak.
To ma największe znaczenie w jednym konkretnym miejscu: w porównaniu między Qwen3.8-Max a Qwen3.7-Max, czyli poziomem Max, który zastąpił. Qwen3.8-Max osiągnął ogólną dostępność 3 sierpnia 2026; Qwen3.7-Max zadebiutował w maju. Na papierze wygląda to jak łatwy wybór międzypokoleniowy — nowszy flagowiec, wyższy wynik, idziemy dalej. Liczby mówią coś bardziej niezręcznego. Starszy poziom jest trzy do czterech razy szybszy, około pięć razy tańszy na ukończone zadanie i identyczny z nowszym pod względem czystych benchmarków wiedzy. Nowszy poziom jest multimodalny, dramatycznie lepszy w pracy agentowej i tańszy według międzynarodowego cennika. To, po który powinieneś sięgać, zależy od pytania, które większość porównań pomija: czy kupujesz wiedzę, czy kupujesz wywołania narzędzi.
Co właściwie głosi ujawnienie Apsary
To ujawnienie jest oświadczeniem dostawcy, opublikowanym przez Alibaba w jej własnej witrynie prasowej, i tak należy je odczytywać. To, co stwierdza, jest konkretne: przez ponad miesiąc w pełni zautomatyzowanych przebiegów obejmujących projektowanie potoków, walidację danych, iteracyjne eksperymentowanie i diagnozowanie błędów, Qwen3.8-Max ukończył 33 cykle, a autonomiczna optymalizacja treningu oraz techniki po treningu przyniosły zmianę wyniku. Alibaba opisała również drugi eksperyment w zakresie projektowania układów scalonych, w którym model przeprowadził ponad 60 godzin samodoskonalenia w całym cyklu projektowym, wykonał ponad 10 000 wywołań narzędzi EDA i wytworzył moduły magistrali układów scalonych klasy produkcyjnej, jednocześnie zmniejszając powierzchnię układu o 42% bez deklarowanego kompromisu w zakresie wydajności. Wszystko to jest relacją firmy Alibaba o jej własnym modelu, nieodtworzoną przez nikogo spoza firmy.
Sama zmiana wyniku nie jest jednak twierdzeniem dostawcy. Indeks należy do Artificial Analysis, a 45 widnieje na stronie Qwen3.8 Max (0902) tego podmiotu trzeciego. Wartość 40, od której się przesunął, znajduje się na stronie tej samej organizacji dla kompilacji z 3 sierpnia, która jest teraz oznaczona jako przestarzała i wskazuje na obecną. Zatem delta to przyczyna zgłoszona przez dostawcę, przypisana do niezależnie ocenionego efektu, co jest mocniejszą pozycją niż każda z tych połówek osobno. Jest to również, w momencie pisania tego tekstu, najbardziej konkretny publiczny dowód, jaki ktokolwiek ma, że czołowe laboratorium zmieniło mierzoną zdolność swojego flagowego modelu bez wydania nowego numeru wersji.
Dwie inne rzeczy dotyczące wydania łatwo przeoczyć i obie mają kluczowe znaczenie. Po pierwsze, Alibaba potwierdziła, że Qwen 4 jest w trakcie treningu, a serie Qwen 4.5 i Qwen 5 mają według prognoz osiągnąć skalę 5–10 bilionów parametrów. Po drugie, istnieje datowany snapshot odświeżonego modelu. Alibaba przypięła wersję po treningu jako qwen3.8-max-0902 w dniu 2 września, a ma ona osobny routing. To przypięcie jest praktyczną odpowiedzią na wszystko, co implikuje ujawnienie RSI, i jeszcze do tego wrócimy.
Tablica wyników
Sześć wymiarów, obie strony, z jawnie zachowaną dyscypliną w zakresie źródeł, ponieważ obie kolumny nie są w równym stopniu zweryfikowane.
• Okno kontekstu — Qwen3.8-Max 1,000,000 tokenów vs Qwen3.7-Max 1,000,000 tokenów (identyczne)
• Maksymalna długość wyjścia — 131,072 tokenów vs 131,072 tokenów według własnych stron modeli Alibaby (identycznie; warto zauważyć, że nasza strona katalogowa dla Qwen3.7-Max podaje 64,000 — rozbieżność, którą sygnalizujemy, a nie przemilczamy)
• Modalność wejściowa — tekst, obraz i wideo vs tylko tekst
• Międzynarodowa cena katalogowa za 1 mln tokenów — 2,00 USD za wejście / 6,00 USD za wyjście w porównaniu z 2,50 USD za wejście / 7,50 USD za wyjście; ten sam cennik nalicza już obu modelom 1,65 USD / 4,951 USD w Pekinie, Frankfurcie i Wirginii
• Artificial Analysis Intelligence Index — 45 vs 29
• Niezależna prędkość wyjściowa — 39,7 tokena/s vs 211,3 tokena/s, mierzona względem tej samej klasy porównawczej 211 modeli, w której Artificial Analysis ocenia nowszą warstwę jako wyraźnie wolną, a starszą jako wyraźnie szybką
Ostatnie dwa wiersze to cały artykuł. W tej samej rodzinie indeksów nowszy poziom ma 16 punktów przewagi. Pod względem szybkości pozostaje ponad pięciokrotnie w tyle.

Skąd pochodzi 16 punktów — a skąd nie
Rozłóż Index na części, a kształt modernizacji stanie się jasny — i nie jest to kształt, który sugeruje marketing.
Jeśli chodzi o wiedzę i rozumowanie, oba modele są praktycznie na równi. GPQA Diamond: 92,8 vs 92,3. Humanity's Last Exam: 43,1 vs 40,5. Odtwarzanie w długim kontekście: 80,33 vs 79. SciCode: 52,1 vs 49,5Jeśli Twoje obciążenie polega na odpowiadaniu na pytania w oparciu o duży korpus, skok międzypokoleniowy to błąd zaokrąglenia. Płacenie za niego wielokrotności byłoby trudne do uzasadnienia.
W zadaniach agentowych i programistycznych przepaść otwiera się gwałtownie. Terminal-Bench 2.1: 88.76 vs 74.53. Indeks kodowania Artificial Analysis: 76.2 vs 66. A największa rozbieżność w zestawie dotyczy zadania użycia narzędzi bankowych, w którym Qwen3.8-Max odnotowuje 47.84 wobec Qwen3.7-Max, który osiągnął 11.75 — czterokrotna różnica dokładnie w tej zdolności, którą – jak mówi opis RSI – optymalizowały zautomatyzowane cykle: projektowanie potoków, walidacja danych, iteracyjne eksperymentowanie, diagnozowanie błędów. Model, który spędza miesiąc na ulepszaniu własnej pętli treningowej, to model, który stał się lepszy w pętlach.
Jedno szczere zastrzeżenie dotyczące tych poszczególnych wierszy. Obie strony modeli należą do tej samej rodziny wersji Intelligence Index (v4.3 i v4.3.2), co sprawia, że nagłówkowe porównanie 45 do 29 jest uczciwe. Wiersze dla poszczególnych benchmarków nie pochodzą z tej samej kohorty: dane Qwen3.7-Max na poziomie zadań pochodzą z majowego okna ewaluacji, natomiast dane Qwen3.8-Max z serii wrześniowej. Patrz na kierunek zmian, a nie na trzecią cyfrę znaczącą.
Pytanie o cenę to dwa pytania
W międzynarodowym cenniku Alibaby nowszy Max jest tańszy od tego, którego zastąpił: $2.00 / $6.00 za Qwen3.8-Max wobec $2.50 / $7.50 za Qwen3.7-Max, za milion tokenów. Obniżka o 20% w obu kierunkach wraz z postępem generacji jest nietypowa i warta odnotowania sama w sobie. Ekonomia pamięci podręcznej również sprzyja nowszemu poziomowi — niejawna pamięć podręczna przy $0.25 wobec $0.50, odczyt jawnej pamięci podręcznej przy $0.17 wobec $0.25.
To jest pierwsze pytanie i ma regionalną odpowiedź, którą większość omówień spłaszcza. Alibaba pobiera za oba modele $1,65 za tokeny wejściowe / $4,951 za tokeny wyjściowe w Pekinie, Frankfurcie i Wirginii. 20-procentowa różnica istnieje tylko w przypadku międzynarodowej karty dla Singapuru. Jeśli Twój ruch trafia do pozostałych trzech regionów, tokeny wejściowe i wyjściowe kosztują dziś tyle samo dla obu wariantów Max, a decyzja sprowadza się do czystych możliwości — wtedy nowszy model wygrywa we wszystkim poza przepustowością i nie ma już żadnych obliczeń do wykonania.
Drugie pytanie to pułapka. Qwen3.7-Max obecnie nie kosztuje 2,50 / 7,50 USD. Jest oferowany w cenie 1,25 / 3,75 USD — połowa ceny katalogowej, czyli stawka promocyjna. To sprawia, że warstwa poprzedniej generacji jest dziś tańszą opcją, i to zdecydowanie. Oznacza to również, że cena, którą można zmierzyć w tym tygodniu, nie jest ceną, do której byś się zobowiązywał. Sama strona modelu Alibaby wyraźnie stwierdza, że opublikowana tabela pokazuje oryginalne ceny „z wyłączeniem jakichkolwiek promocji ograniczonych czasowo” i odsyła do konsoli po aktualne oferty. Promocja z założenia jest stawką, która może się skończyć. Jeśli tak się stanie, Qwen3.7-Max nie stanie się jedynie droższy niż obecnie; stanie się o 25% droższy od modelu, który go przewyższa.
Przekazujemy stawkę dostawcy bez narzutu (0%), więc zarówno cena katalogowa, jak i promocja obowiązują po naszej stronie tego samego dnia, w którym się zmieniają — co jest wygodne przy porównywaniu, ale niepomocne, jeśli próbujesz zaplanować budżet. Buduj model na podstawie karty cen katalogowych, a stawkę promocyjną traktuj jako dodatkowy potencjał.

Liczba, która odwraca argument o kosztach
Cena tokena to nie to samo, co koszt zadania. Artificial Analysis publikuje wskaźnik kosztu na zadanie, który uwzględnia ekonomię pamięci podręcznej, objętość rozumowania i długość odpowiedzi, a według tego miernika ranking odwraca się całkowicie: 5,41 USD za zadanie w Intelligence Index dla Qwen3.8-Max wobec 1,15 USD dla Qwen3.7-Max. Premia 4,7×, przy stawce za token, która jest albo o 20% niższa, albo identyczna — w zależności od regionu.
Różnica polega głównie na gadatliwości. W tej samej ewaluacji nowszy model wygenerował 190 mln tokenów wyjściowych w porównaniu ze starszym, który wygenerował 120 mln, a aby dojść do odpowiedzi, prowadzi długie rozumowanie. Jeśli płacisz za token wyjściowy w przypadku dużego wolumenu umiarkowanie trudnych zadań, nowszy Max nie jest tańszym modelem przy żadnej cenie tokena w żadnym z cenników. Jest modelem droższym, a katalogowa cena tokena to niewłaściwe narzędzie do podejmowania tej decyzji.
Szybkość i to, co pokazuje nasz własny ruch
Luka w przepustowości jest wystarczająco duża, by zmienić architekturę. Artificial Analysis umieszcza Qwen3.8-Max na poziomie 39,7 tokena na sekundę — w swoim podsumowaniu określa ten model jako wyraźnie wolny — w porównaniu z 211,3 dla Qwen3.7-Max, który określa jako wyraźnie szybki. To różnica między modelem, który stawiasz za interaktywnym interfejsem, a takim, którego stawiasz za kolejką — a w przypadku Qwen3.8-Max to pierwsza rzecz, którą pokazuje Ci nasz własny panel statystyk.
Nasza własna telemetria z naszego środowiska testowego z siedmiu dni do 25 września opowiada nieco bardziej zniuansowaną historię na temat opóźnień i wiąże się z zastrzeżeniem: to nasze pomiary na naszym routingu, a nie kontrolowany benchmark. Qwen3.8-Max wykazywał medianę 2 611 ms do pierwszej odpowiedzi przy 54,7 tokena na sekundę ze współczynnikiem błędów 2,45%; przypięta kompilacja 0902 wykazywała medianę 3 360 ms przy 46,2 tokena na sekundę ze znacznie czystszym współczynnikiem błędów 0,66%. Qwen3.7-Max miał medianę 4 509 ms, ale 169,8 tokena na sekundę ze współczynnikiem błędów 3,80%. Tak więc starszy tier odpowiada wolniej na starcie, a potem strumieniuje trzy razy szybciej, jednocześnie częściej zawodząc. Jeśli Twoje obciążenie ma charakter skokowy, ta różnica we współczynniku błędów jest warta większej uwagi niż mediana.
Oba poziomy są dostępne na jednym kluczu OrcaRouter wraz z przypiętym snapshotem, z automatycznym przełączaniem awaryjnym między dostawcami. W przypadku takiego porównania o to chodzi w praktyce: testowanie własnych promptów na obu generacjach Max to zmiana konfiguracji, a nie drugi kontrakt.

Odtwarzalność jest teraz czynnikiem decydującym
Oto część ujawnienia Apsara, której nikt nie wycenił. Aktywny identyfikator modelu, którego zmierzona zdolność przesunęła się z 40 do 45 w ciągu miesiąca, bez zmiany wersji i bez ogłoszenia w tym czasie, jest zagrożeniem dla odtwarzalności. Jeśli zachowanie Twojego produktu jest funkcją ruchomego identyfikatora, masz model, który może się poprawić — albo przesunąć — pod zamrożonym zestawem ewaluacyjnym, buforowaną biblioteką promptów lub zatwierdzonym zestawem regresyjnym.
Oba pokolenia oferują datowane snapshoty i to jest środek zaradczy. Qwen3.7-Max jest udokumentowany przez Alibaba jako funkcjonalnie równoważny z qwen3.7-max-2026-05-20, wraz z kolejnymi datowanymi kompilacjami z 2026-05-17 i 2026-06-08. Qwen3.8-Max ma qwen3.8-max-0902, wrześniową kompilację po treningu dostrajającym, do której odnosi się to 45. Jeśli wdrażasz cokolwiek, co wymaga odtwarzalności, przypnij datowany identyfikator, a ten zmienny traktuj jako cel środowiska stagingowego. Cykle RSI są cechą zmiennego identyfikatora; przypięcie to sposób, w jaki z nich rezygnujesz.
Jedna kwestia nazewnicza warta poznania, żeby nie odczytać katalogu błędnie. Alibaba wymienia trzecią formę z datą, qwen3.8-max-2026-09-02, obok aliasu 0902; odnoszą się do tej samej kompilacji. Oryginalne wydanie z 3 sierpnia nie jest już dostępne w routingu po naszej stronie — obsługujemy Qwen3.8-Max, jego przypięcie 0902, oraz Qwen3.7-Max.
Kto powinien wybrać, które
Decyzja nie rozbija się o to, który model jest lepszy. Rozbija się o to, co kupujesz.
Pozostań przy Qwen3.7-Max, jeśli Twoje obciążenie jest wyłącznie tekstowe, oparte na wiedzy, a nie na narzędziach, i wrażliwe na przepustowość — klasyfikacja masowa, ekstrakcja, wyszukiwanie w długim kontekście, zbiorcze streszczanie. W GPQA Diamond i przy przywoływaniu informacji z długiego kontekstu plasuje się w odległości jednego punktu od nowszego modelu, strumieniuje trzy do czterech razy szybciej i kosztuje 1,15 USD za zadanie w porównaniu z 5,41 USD. To także właściwy wybór dla każdego, kto chce tanią drugą opinię w konfiguracji fuzji lub routingu, ponieważ przy swojej promocyjnej stawce należy do zupełnie innej klasy cenowej. Dwa zastrzeżenia: promocja to promocja, a Artificial Analysis już oznaczyło ten model jako przestarzały, zastąpiony przez Qwen3.8-Max. Nie rozpoczynaj na nim wieloletniego zobowiązania.
Przejdź na Qwen3.8-Max, jeśli spełniony jest którykolwiek z tych warunków: potrzebujesz danych wejściowych w postaci obrazu lub wideo, których Qwen3.7-Max w ogóle nie obsługuje; twoje obciążenie robocze ma charakter agentowy, z długimi łańcuchami wywołań narzędzi lub wieloetapowymi pętlami kodowania, gdzie 88,76 wobec 74,53 w Terminal-Bench 2.1 i czterokrotna różnica w korzystaniu z narzędzi decydują o tym, czy coś zostanie wydane, czy nie; albo obowiązuje cię międzynarodowy cennik dla Singapuru, gdzie nowszy model jest po prostu o 20% tańszy i nie ma żadnego kompromisu do rozważenia. Przypnij qwen3.8-max-0902, jeśli potrzebujesz, aby zachowanie pozostało niezmienne.
Jeśli jesteś w Pekinie, Frankfurcie lub Wirginii, wybór jest prostszy, niż sugeruje jakiekolwiek porównanie: oba poziomy Max kosztują $1.65 / $4.951 za milion tokenów. Identycznie. Przy takich stawkach niepłacenie niczego ekstra za wejście multimodalne, o 16 punktów wyższy Index i czterokrotnie lepszy wynik w korzystaniu z narzędzi to nie decyzja, to gratis — a jedynym powodem, by pozostać przy Qwen3.7-Max, staje się surowa przepustowość.
Dwa pytania, na które warto odpowiedzieć bezpośrednio
Czy trening 33-cyklowy oznacza, że model zmienił się w ramach istniejącego ruchu API? To właśnie sugeruje ujawnienie i dlatego istnieje datowane przypięcie. Alibaba opisuje ulepszony model jako „zaktualizowany Qwen3.8-Max”, co jest pływającym identyfikatorem, a nie nowym. Jeśli do września włącznie miałeś obciążenia na pływającym identyfikatorze, obsługiwał je model, którego zmierzona zdolność zmieniła się w tym okresie. Alibaba nie opublikowała dziennika zmian dla kompilacji pośrednich, więc jedynym niezawodnym sposobem, aby wiedzieć, jakie zachowanie masz, jest przypięcie.
Czy twierdzenie o RSI zostało niezależnie zweryfikowane? Wynik, który wygenerował, tak — Indeks należy do Artificial Analysis, a 45 widnieje na ich stronie. Mechanizm stojący za tym to opis własnego procesu treningowego samego Alibaby, bez zewnętrznej replikacji, bez opublikowanego protokołu oceny i bez strony trzeciej obserwującej 33 cykle. Traktuj „33 iteracyjne cykle” jako twierdzenie dostawcy, a „45 po 40” jako zmierzoną parę. To nie są tego samego rodzaju stwierdzenia, a różnica jest powodem, dla którego nagłówek warto czytać uważnie, a nie powtarzać.
Następną rzeczą, którą warto obserwować, nie jest Qwen 4. Chodzi o to, czy promocja Qwen3.7-Max z ceną obniżoną o połowę przetrwa pojawienie się modelu, który ma go zastąpić. Jeśli nie przetrwa, bardzo wiele zespołów odkryje, że porównywały cenę katalogową z rabatem i że starszy z dwóch modeli był przez cały czas droższy.
