Główna karta tytułowa dla „Qwen3.8-Max vs Qwen3.7-Max” z podtytułem „Dwa poziomy Max, 16 punktów indeksu i promocja, która odwraca cenę” oraz stopką informującą, że dane Qwen3.8-Max pochodzą z ujawnienia Alibaby z 22 września 2026 r. i Artificial Analysis, natomiast dane Qwen3.7-Max pochodzą z Artificial Analysis.
Guides & Insights

Qwen3.8-Max vs Qwen3.7-Max: dwa poziomy Max, 16 punktów indeksu i promocja, która odwraca cenę

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Cztery dni temu dostawca powiedział nam, że Qwen3.8-Max nie jest modelem, który wydał w sierpniu. W komunikacie prasowym z 22 września 2026 r., z konferencji Apsara w Hangzhou, firma ujawniła, że jej flagowy model ukończył 33 iteracyjne cykle w pełni zautomatyzowanego treningu i prac po treningu w ciągu ponad miesiąca, a powstała w ten sposób wersja podniosła jego Artificial Analysis Intelligence Index z 40 do 45. Identyfikator modelu nigdy się nie zmienił. Liczba stojąca za nim już tak.

To ma największe znaczenie w jednym konkretnym miejscu: w porównaniu między Qwen3.8-Max a Qwen3.7-Max, czyli poziomem Max, który zastąpił. Qwen3.8-Max osiągnął ogólną dostępność 3 sierpnia 2026; Qwen3.7-Max zadebiutował w maju. Na papierze wygląda to jak łatwy wybór międzypokoleniowy — nowszy flagowiec, wyższy wynik, idziemy dalej. Liczby mówią coś bardziej niezręcznego. Starszy poziom jest trzy do czterech razy szybszy, około pięć razy tańszy na ukończone zadanie i identyczny z nowszym pod względem czystych benchmarków wiedzy. Nowszy poziom jest multimodalny, dramatycznie lepszy w pracy agentowej i tańszy według międzynarodowego cennika. To, po który powinieneś sięgać, zależy od pytania, które większość porównań pomija: czy kupujesz wiedzę, czy kupujesz wywołania narzędzi.

Co właściwie głosi ujawnienie Apsary

To ujawnienie jest oświadczeniem dostawcy, opublikowanym przez Alibaba w jej własnej witrynie prasowej, i tak należy je odczytywać. To, co stwierdza, jest konkretne: przez ponad miesiąc w pełni zautomatyzowanych przebiegów obejmujących projektowanie potoków, walidację danych, iteracyjne eksperymentowanie i diagnozowanie błędów, Qwen3.8-Max ukończył 33 cykle, a autonomiczna optymalizacja treningu oraz techniki po treningu przyniosły zmianę wyniku. Alibaba opisała również drugi eksperyment w zakresie projektowania układów scalonych, w którym model przeprowadził ponad 60 godzin samodoskonalenia w całym cyklu projektowym, wykonał ponad 10 000 wywołań narzędzi EDA i wytworzył moduły magistrali układów scalonych klasy produkcyjnej, jednocześnie zmniejszając powierzchnię układu o 42% bez deklarowanego kompromisu w zakresie wydajności. Wszystko to jest relacją firmy Alibaba o jej własnym modelu, nieodtworzoną przez nikogo spoza firmy.

Sama zmiana wyniku nie jest jednak twierdzeniem dostawcy. Indeks należy do Artificial Analysis, a 45 widnieje na stronie Qwen3.8 Max (0902) tego podmiotu trzeciego. Wartość 40, od której się przesunął, znajduje się na stronie tej samej organizacji dla kompilacji z 3 sierpnia, która jest teraz oznaczona jako przestarzała i wskazuje na obecną. Zatem delta to przyczyna zgłoszona przez dostawcę, przypisana do niezależnie ocenionego efektu, co jest mocniejszą pozycją niż każda z tych połówek osobno. Jest to również, w momencie pisania tego tekstu, najbardziej konkretny publiczny dowód, jaki ktokolwiek ma, że czołowe laboratorium zmieniło mierzoną zdolność swojego flagowego modelu bez wydania nowego numeru wersji.

Dwie inne rzeczy dotyczące wydania łatwo przeoczyć i obie mają kluczowe znaczenie. Po pierwsze, Alibaba potwierdziła, że Qwen 4 jest w trakcie treningu, a serie Qwen 4.5 i Qwen 5 mają według prognoz osiągnąć skalę 5–10 bilionów parametrów. Po drugie, istnieje datowany snapshot odświeżonego modelu. Alibaba przypięła wersję po treningu jako qwen3.8-max-0902 w dniu 2 września, a ma ona osobny routing. To przypięcie jest praktyczną odpowiedzią na wszystko, co implikuje ujawnienie RSI, i jeszcze do tego wrócimy.

Tablica wyników

Sześć wymiarów, obie strony, z jawnie zachowaną dyscypliną w zakresie źródeł, ponieważ obie kolumny nie są w równym stopniu zweryfikowane.

• Okno kontekstu — Qwen3.8-Max 1,000,000 tokenów vs Qwen3.7-Max 1,000,000 tokenów (identyczne)

• Maksymalna długość wyjścia — 131,072 tokenów vs 131,072 tokenów według własnych stron modeli Alibaby (identycznie; warto zauważyć, że nasza strona katalogowa dla Qwen3.7-Max podaje 64,000 — rozbieżność, którą sygnalizujemy, a nie przemilczamy)

• Modalność wejściowa — tekst, obraz i wideo vs tylko tekst

• Międzynarodowa cena katalogowa za 1 mln tokenów — 2,00 USD za wejście / 6,00 USD za wyjście w porównaniu z 2,50 USD za wejście / 7,50 USD za wyjście; ten sam cennik nalicza już obu modelom 1,65 USD / 4,951 USD w Pekinie, Frankfurcie i Wirginii

• Artificial Analysis Intelligence Index — 45 vs 29

• Niezależna prędkość wyjściowa — 39,7 tokena/s vs 211,3 tokena/s, mierzona względem tej samej klasy porównawczej 211 modeli, w której Artificial Analysis ocenia nowszą warstwę jako wyraźnie wolną, a starszą jako wyraźnie szybką

Ostatnie dwa wiersze to cały artykuł. W tej samej rodzinie indeksów nowszy poziom ma 16 punktów przewagi. Pod względem szybkości pozostaje ponad pięciokrotnie w tyle.

A two-column comparison scoreboard: left column 'Qwen3.8-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text / image / video, International price per 1M $2.00 / $6.00, AA Intelligence Index 45 and Output speed 39.7 tok/s; right column 'Qwen3.7-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text only, International price per 1M $2.50 / $7.50, AA Intelligence Index 29 and Output speed 211.3 tok/s; a footer credits Alibaba's 22 Sep 2026 disclosure and Artificial Analysis.

Skąd pochodzi 16 punktów — a skąd nie

Rozłóż Index na części, a kształt modernizacji stanie się jasny — i nie jest to kształt, który sugeruje marketing.

Jeśli chodzi o wiedzę i rozumowanie, oba modele są praktycznie na równi. GPQA Diamond: 92,8 vs 92,3. Humanity's Last Exam: 43,1 vs 40,5. Odtwarzanie w długim kontekście: 80,33 vs 79. SciCode: 52,1 vs 49,5Jeśli Twoje obciążenie polega na odpowiadaniu na pytania w oparciu o duży korpus, skok międzypokoleniowy to błąd zaokrąglenia. Płacenie za niego wielokrotności byłoby trudne do uzasadnienia.

W zadaniach agentowych i programistycznych przepaść otwiera się gwałtownie. Terminal-Bench 2.1: 88.76 vs 74.53. Indeks kodowania Artificial Analysis: 76.2 vs 66. A największa rozbieżność w zestawie dotyczy zadania użycia narzędzi bankowych, w którym Qwen3.8-Max odnotowuje 47.84 wobec Qwen3.7-Max, który osiągnął 11.75 — czterokrotna różnica dokładnie w tej zdolności, którą – jak mówi opis RSI – optymalizowały zautomatyzowane cykle: projektowanie potoków, walidacja danych, iteracyjne eksperymentowanie, diagnozowanie błędów. Model, który spędza miesiąc na ulepszaniu własnej pętli treningowej, to model, który stał się lepszy w pętlach.

Jedno szczere zastrzeżenie dotyczące tych poszczególnych wierszy. Obie strony modeli należą do tej samej rodziny wersji Intelligence Index (v4.3 i v4.3.2), co sprawia, że nagłówkowe porównanie 45 do 29 jest uczciwe. Wiersze dla poszczególnych benchmarków nie pochodzą z tej samej kohorty: dane Qwen3.7-Max na poziomie zadań pochodzą z majowego okna ewaluacji, natomiast dane Qwen3.8-Max z serii wrześniowej. Patrz na kierunek zmian, a nie na trzecią cyfrę znaczącą.

Pytanie o cenę to dwa pytania

W międzynarodowym cenniku Alibaby nowszy Max jest tańszy od tego, którego zastąpił: $2.00 / $6.00 za Qwen3.8-Max wobec $2.50 / $7.50 za Qwen3.7-Max, za milion tokenów. Obniżka o 20% w obu kierunkach wraz z postępem generacji jest nietypowa i warta odnotowania sama w sobie. Ekonomia pamięci podręcznej również sprzyja nowszemu poziomowi — niejawna pamięć podręczna przy $0.25 wobec $0.50, odczyt jawnej pamięci podręcznej przy $0.17 wobec $0.25.

To jest pierwsze pytanie i ma regionalną odpowiedź, którą większość omówień spłaszcza. Alibaba pobiera za oba modele $1,65 za tokeny wejściowe / $4,951 za tokeny wyjściowe w Pekinie, Frankfurcie i Wirginii. 20-procentowa różnica istnieje tylko w przypadku międzynarodowej karty dla Singapuru. Jeśli Twój ruch trafia do pozostałych trzech regionów, tokeny wejściowe i wyjściowe kosztują dziś tyle samo dla obu wariantów Max, a decyzja sprowadza się do czystych możliwości — wtedy nowszy model wygrywa we wszystkim poza przepustowością i nie ma już żadnych obliczeń do wykonania.

Drugie pytanie to pułapka. Qwen3.7-Max obecnie nie kosztuje 2,50 / 7,50 USD. Jest oferowany w cenie 1,25 / 3,75 USD — połowa ceny katalogowej, czyli stawka promocyjna. To sprawia, że warstwa poprzedniej generacji jest dziś tańszą opcją, i to zdecydowanie. Oznacza to również, że cena, którą można zmierzyć w tym tygodniu, nie jest ceną, do której byś się zobowiązywał. Sama strona modelu Alibaby wyraźnie stwierdza, że opublikowana tabela pokazuje oryginalne ceny „z wyłączeniem jakichkolwiek promocji ograniczonych czasowo” i odsyła do konsoli po aktualne oferty. Promocja z założenia jest stawką, która może się skończyć. Jeśli tak się stanie, Qwen3.7-Max nie stanie się jedynie droższy niż obecnie; stanie się o 25% droższy od modelu, który go przewyższa.

Przekazujemy stawkę dostawcy bez narzutu (0%), więc zarówno cena katalogowa, jak i promocja obowiązują po naszej stronie tego samego dnia, w którym się zmieniają — co jest wygodne przy porównywaniu, ale niepomocne, jeśli próbujesz zaplanować budżet. Buduj model na podstawie karty cen katalogowych, a stawkę promocyjną traktuj jako dodatkowy potencjał.

A screenshot of Alibaba Cloud Model Studio's 'Recommended models' documentation overview page, showing the console navigation on the left, the line 'Alibaba Cloud Model Studio offers Qwen and third-party models for text, image, audio, and video.', an 'Updated at: 2026-09-24 20:17:58' stamp, and category cards covering Text generation (listing qwen3.8-max and qwen3.7), Image & video, World models, and Audio & speech.

Liczba, która odwraca argument o kosztach

Cena tokena to nie to samo, co koszt zadania. Artificial Analysis publikuje wskaźnik kosztu na zadanie, który uwzględnia ekonomię pamięci podręcznej, objętość rozumowania i długość odpowiedzi, a według tego miernika ranking odwraca się całkowicie: 5,41 USD za zadanie w Intelligence Index dla Qwen3.8-Max wobec 1,15 USD dla Qwen3.7-Max. Premia 4,7×, przy stawce za token, która jest albo o 20% niższa, albo identyczna — w zależności od regionu.

Różnica polega głównie na gadatliwości. W tej samej ewaluacji nowszy model wygenerował 190 mln tokenów wyjściowych w porównaniu ze starszym, który wygenerował 120 mln, a aby dojść do odpowiedzi, prowadzi długie rozumowanie. Jeśli płacisz za token wyjściowy w przypadku dużego wolumenu umiarkowanie trudnych zadań, nowszy Max nie jest tańszym modelem przy żadnej cenie tokena w żadnym z cenników. Jest modelem droższym, a katalogowa cena tokena to niewłaściwe narzędzie do podejmowania tej decyzji.

Szybkość i to, co pokazuje nasz własny ruch

Luka w przepustowości jest wystarczająco duża, by zmienić architekturę. Artificial Analysis umieszcza Qwen3.8-Max na poziomie 39,7 tokena na sekundę — w swoim podsumowaniu określa ten model jako wyraźnie wolny — w porównaniu z 211,3 dla Qwen3.7-Max, który określa jako wyraźnie szybki. To różnica między modelem, który stawiasz za interaktywnym interfejsem, a takim, którego stawiasz za kolejką — a w przypadku Qwen3.8-Max to pierwsza rzecz, którą pokazuje Ci nasz własny panel statystyk.

Nasza własna telemetria z naszego środowiska testowego z siedmiu dni do 25 września opowiada nieco bardziej zniuansowaną historię na temat opóźnień i wiąże się z zastrzeżeniem: to nasze pomiary na naszym routingu, a nie kontrolowany benchmark. Qwen3.8-Max wykazywał medianę 2 611 ms do pierwszej odpowiedzi przy 54,7 tokena na sekundę ze współczynnikiem błędów 2,45%; przypięta kompilacja 0902 wykazywała medianę 3 360 ms przy 46,2 tokena na sekundę ze znacznie czystszym współczynnikiem błędów 0,66%. Qwen3.7-Max miał medianę 4 509 ms, ale 169,8 tokena na sekundę ze współczynnikiem błędów 3,80%. Tak więc starszy tier odpowiada wolniej na starcie, a potem strumieniuje trzy razy szybciej, jednocześnie częściej zawodząc. Jeśli Twoje obciążenie ma charakter skokowy, ta różnica we współczynniku błędów jest warta większej uwagi niż mediana.

Oba poziomy są dostępne na jednym kluczu OrcaRouter wraz z przypiętym snapshotem, z automatycznym przełączaniem awaryjnym między dostawcami. W przypadku takiego porównania o to chodzi w praktyce: testowanie własnych promptów na obu generacjach Max to zmiana konfiguracji, a nie drugi kontrakt.

A screenshot of OrcaRouter's own model page for Qwen3.7-Max (models/qwen/qwen3.7-max) in the dark theme, showing the Qwen3.7-Max heading, its model description, and the stat and price panel for the tier.

Odtwarzalność jest teraz czynnikiem decydującym

Oto część ujawnienia Apsara, której nikt nie wycenił. Aktywny identyfikator modelu, którego zmierzona zdolność przesunęła się z 40 do 45 w ciągu miesiąca, bez zmiany wersji i bez ogłoszenia w tym czasie, jest zagrożeniem dla odtwarzalności. Jeśli zachowanie Twojego produktu jest funkcją ruchomego identyfikatora, masz model, który może się poprawić — albo przesunąć — pod zamrożonym zestawem ewaluacyjnym, buforowaną biblioteką promptów lub zatwierdzonym zestawem regresyjnym.

Oba pokolenia oferują datowane snapshoty i to jest środek zaradczy. Qwen3.7-Max jest udokumentowany przez Alibaba jako funkcjonalnie równoważny z qwen3.7-max-2026-05-20, wraz z kolejnymi datowanymi kompilacjami z 2026-05-17 i 2026-06-08. Qwen3.8-Max ma qwen3.8-max-0902, wrześniową kompilację po treningu dostrajającym, do której odnosi się to 45. Jeśli wdrażasz cokolwiek, co wymaga odtwarzalności, przypnij datowany identyfikator, a ten zmienny traktuj jako cel środowiska stagingowego. Cykle RSI są cechą zmiennego identyfikatora; przypięcie to sposób, w jaki z nich rezygnujesz.

Jedna kwestia nazewnicza warta poznania, żeby nie odczytać katalogu błędnie. Alibaba wymienia trzecią formę z datą, qwen3.8-max-2026-09-02, obok aliasu 0902; odnoszą się do tej samej kompilacji. Oryginalne wydanie z 3 sierpnia nie jest już dostępne w routingu po naszej stronie — obsługujemy Qwen3.8-Max, jego przypięcie 0902, oraz Qwen3.7-Max.

Kto powinien wybrać, które

Decyzja nie rozbija się o to, który model jest lepszy. Rozbija się o to, co kupujesz.

Pozostań przy Qwen3.7-Max, jeśli Twoje obciążenie jest wyłącznie tekstowe, oparte na wiedzy, a nie na narzędziach, i wrażliwe na przepustowość — klasyfikacja masowa, ekstrakcja, wyszukiwanie w długim kontekście, zbiorcze streszczanie. W GPQA Diamond i przy przywoływaniu informacji z długiego kontekstu plasuje się w odległości jednego punktu od nowszego modelu, strumieniuje trzy do czterech razy szybciej i kosztuje 1,15 USD za zadanie w porównaniu z 5,41 USD. To także właściwy wybór dla każdego, kto chce tanią drugą opinię w konfiguracji fuzji lub routingu, ponieważ przy swojej promocyjnej stawce należy do zupełnie innej klasy cenowej. Dwa zastrzeżenia: promocja to promocja, a Artificial Analysis już oznaczyło ten model jako przestarzały, zastąpiony przez Qwen3.8-Max. Nie rozpoczynaj na nim wieloletniego zobowiązania.

Przejdź na Qwen3.8-Max, jeśli spełniony jest którykolwiek z tych warunków: potrzebujesz danych wejściowych w postaci obrazu lub wideo, których Qwen3.7-Max w ogóle nie obsługuje; twoje obciążenie robocze ma charakter agentowy, z długimi łańcuchami wywołań narzędzi lub wieloetapowymi pętlami kodowania, gdzie 88,76 wobec 74,53 w Terminal-Bench 2.1 i czterokrotna różnica w korzystaniu z narzędzi decydują o tym, czy coś zostanie wydane, czy nie; albo obowiązuje cię międzynarodowy cennik dla Singapuru, gdzie nowszy model jest po prostu o 20% tańszy i nie ma żadnego kompromisu do rozważenia. Przypnij qwen3.8-max-0902, jeśli potrzebujesz, aby zachowanie pozostało niezmienne.

Jeśli jesteś w Pekinie, Frankfurcie lub Wirginii, wybór jest prostszy, niż sugeruje jakiekolwiek porównanie: oba poziomy Max kosztują $1.65 / $4.951 za milion tokenów. Identycznie. Przy takich stawkach niepłacenie niczego ekstra za wejście multimodalne, o 16 punktów wyższy Index i czterokrotnie lepszy wynik w korzystaniu z narzędzi to nie decyzja, to gratis — a jedynym powodem, by pozostać przy Qwen3.7-Max, staje się surowa przepustowość.

Dwa pytania, na które warto odpowiedzieć bezpośrednio

Czy trening 33-cyklowy oznacza, że model zmienił się w ramach istniejącego ruchu API? To właśnie sugeruje ujawnienie i dlatego istnieje datowane przypięcie. Alibaba opisuje ulepszony model jako „zaktualizowany Qwen3.8-Max”, co jest pływającym identyfikatorem, a nie nowym. Jeśli do września włącznie miałeś obciążenia na pływającym identyfikatorze, obsługiwał je model, którego zmierzona zdolność zmieniła się w tym okresie. Alibaba nie opublikowała dziennika zmian dla kompilacji pośrednich, więc jedynym niezawodnym sposobem, aby wiedzieć, jakie zachowanie masz, jest przypięcie.

Czy twierdzenie o RSI zostało niezależnie zweryfikowane? Wynik, który wygenerował, tak — Indeks należy do Artificial Analysis, a 45 widnieje na ich stronie. Mechanizm stojący za tym to opis własnego procesu treningowego samego Alibaby, bez zewnętrznej replikacji, bez opublikowanego protokołu oceny i bez strony trzeciej obserwującej 33 cykle. Traktuj „33 iteracyjne cykle” jako twierdzenie dostawcy, a „45 po 40” jako zmierzoną parę. To nie są tego samego rodzaju stwierdzenia, a różnica jest powodem, dla którego nagłówek warto czytać uważnie, a nie powtarzać.

Następną rzeczą, którą warto obserwować, nie jest Qwen 4. Chodzi o to, czy promocja Qwen3.7-Max z ceną obniżoną o połowę przetrwa pojawienie się modelu, który ma go zastąpić. Jeśli nie przetrwa, bardzo wiele zespołów odkryje, że porównywały cenę katalogową z rabatem i że starszy z dwóch modeli był przez cały czas droższy.