Karta tytułowa hero dla Qwen3.8 Max Prime, oferowanej przez Alibaba warstwy serwowania o przepustowości 1.5-2x dla flagowego modelu Qwen3.8-Max, z chipami specyfikacji wskazującymi te same 2.4T łącznie i ~95B aktywnych, Prime w cenie $3.301/$9.902, standard w cenie $1.65/$4.951.
Guides & Insights

Qwen3.8 Max Prime: Alibaba stawia drugą kartę stawek obok swojego flagowca

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

22 września 2026 r. na Konferencji Yunqi w Hangzhou, linia biznesowa MaaS firmy Alibaba ogłosiła poziom usług, który nazywa trybem Prime — 优速模式 — i umieściła nowy identyfikator modelu w cenniku dla niego: qwen3.8-max-prime. Ten identyfikator nie jest nowym modelem. To jest Qwen3.8-Max, flagowy model typu sparse mixture-of-experts o 2,4 biliona parametrów, który osiągnął ogólną dostępność 3 sierpnia 2026 r., dostarczany przez szybszą ścieżkę. Qwen3.8 Max Prime ma te same wagi, to samo okno kontekstowe, te same narzędzia i te same limity użycia co model bazowy. Różni się przepustowością i ceną, a cena jest w przybliżeniu dwukrotnie wyższa.

To już drugi raz w ciągu siedmiu tygodni, gdy Alibaba zmieniła sposób sprzedaży Qwen3.8-Max, nie zmieniając tego, czym on jest. 2 września firma wypuściła odświeżoną wersję po treningu, oznaczoną jako Qwen3.8-Max-0902, skupioną na kodowaniu i pracy agentowej, dostępną wyłącznie przez API. 22 września dodano poziom szybkości. Żadna z nich nie była premierą, a potraktowanie którejkolwiek jako premiery będzie cię kosztować.

Scoreboard infographic for Qwen3.8 Max Prime: underlying model Qwen3.8-Max GA August 3 2026, 2.4T total and ~95B active parameters, throughput 1.5-2x standard, Prime price $3.301/$9.902, standard price $1.65/$4.951, no independent Prime score yet.

Czym tak naprawdę jest tryb Prime

Własna dokumentacja Aliba​by opisuje tryb Prime jako kanał dla „scenariuszy wrażliwych na szybkość generowania" — asystentów kodowania AI, wieloetapowego rozumowania agentów, rozmów w czasie rzeczywistym — i wprost podaje korzyść: TPS wzrasta do 1,5–2 razy w porównaniu ze standardowym API. Nie ma żadnego nowego parametru do ustawienia. Wystarczy zmienić wartość model na identyfikator Prime i jesteś na szybkim pasie.

Dokumentacja jest równie jednoznaczna co do tego, co się nie zmienia: „Możliwości obsługiwane przez model i ograniczenia użytkowania są takie same jak w przypadku oryginalnego modelu”. Zatem nie ma większego kontekstu, nie ma lepszego trybu rozumowania, nie ma dodatkowej powierzchni narzędziowej. To ten sam stos obsługi, tyle że z większym zapasem za nim.

The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.

Cennik, przeczytaj uważnie

Międzynarodowa strona cennika Aliba{{1}}ba{{/1}} wymienia oba identyfikatory obok siebie, co sprawia, że porównanie jest wyjątkowo przejrzyste. Za milion tokenów:

• Wejście — qwen3.8-max-prime 3,301 USD vs qwen3.8-max 1,65 USD

• Wyjście — qwen3.8-max-prime 9,902 USD vs qwen3.8-max 4,951 USD

• Trafienie w pamięć podręczną — qwen3.8-max-prime 0,413 USD w porównaniu ze stawką odczytu z pamięci podręcznej dla standardowego identyfikatora, którą ta sama strona podaje jako pozycję rabatową

• Współczynnik — 2,0× zarówno na wejściu, jak i na wyjściu — to nie zaokrąglone przybliżenie, lecz dosłowna arytmetyka opublikowanych liczb

W chińskim cenniku ta sama proporcja 2× obowiązuje w juanach: 24 ¥ za input i 72 ¥ za output za milion w przypadku Prime ID wobec 12 ¥ i 36 ¥ dla wersji standardowej, przy trafieniach cache po 3 ¥.

Szeroko cytowana stawka premierowa dla Qwen3.8-Max to 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych. To nagłówek, z którym ukazały się sierpniowe materiały, a nie liczba z dzisiejszego międzynarodowego cennika. Jeśli modelujesz wydatki, korzystaj z cennika dla swojego regionu, a nie z nagłówka premierowego, i sprawdź go ponownie, zanim podejmiesz zobowiązanie — Aliba​ba zaktualizowała tę stronę dwa razy od 2 września.

Screenshot of Alibaba Cloud's international Model Studio pricing page listing the qwen3.8-max-prime and qwen3.8-max model IDs side by side, with Prime at $3.301 per million input tokens and $9.902 per million output tokens against $1.65 and $4.951 for the standard ID.

Reguła ograniczania to prawdziwa funkcja

Wiersz, który większość osób pomija, jest tym, który ma największe znaczenie w środowisku produkcyjnym. Dokumentacja Aliba​ba Prime stwierdza, że gdy Twoje zużycie osiągnie limit tempa, jeśli platforma wciąż ma wolne zasoby, nie zostanie zastosowane ograniczanie przepustowości, więc przepustowość faktycznie dostępna dla Ciebie nie spadnie poniżej podanego limitu.

To miękki pułap z twardym minimum, co ma inny kształt niż standardowy limit poziomu. Oznacza to, że wartość 1,5–2× jest obietnicą dotyczącą minimum, a nie ograniczeniem pułapu: przy rywalizacji o zasoby otrzymujesz limit, a przy niewykorzystanej przepustowości możesz otrzymać więcej. W przypadku pętli agenta, która wykonuje dziesiątki sekwencyjnych wywołań, ta asymetria jest warta więcej niż sam mnożnik TPS, ponieważ to opóźnienie ogonowe najwolniejszego wywołania decyduje o tym, czy Twój workflow się zakończy.

Dynamiczne limity TPM dla modeli standardowych są stopniowane według miesięcznych wydatków w Model Studio — ta sama rodzina dokumentacji pokazuje bazowy identyfikator qwen3.8-max na poziomie 5 000 000, 10 000 000 i 20 000 000 TPM w poszczególnych poziomach; są odświeżane co miesiąc. Prime nie usuwa tej struktury; zmienia to, jak daje się we znaki.

Screenshot of the Artificial Analysis model page for Qwen3.8-Max on the 0902 build, showing an Intelligence Index of 45 and a measured cost per task of $5.41 on the standard ID.

Czego jeszcze nikt nie zmierzył

Oto szczera luka. Wartość 1,5–2× jest deklarowana przez dostawcę. Nie ma niezależnego pomiaru przepustowości w trybie Prime, który moglibyśmy znaleźć, a to ma znaczenie, ponieważ własne niezależne wyniki standardowej wersji nie wypadają korzystnie pod względem szybkości.

Artificial Analysis, które ocenia modele na własnym stanowisku testowym, przyznaje obecnie Qwen3.8-Max w kompilacji 0902 wartość Intelligence Index na poziomie 45, przy GPQA Diamond na 92,8%, Terminal-Bench Hard na 38,9% i Humanity's Last Exam na 43,1% — a jego zmierzony koszt na zadanie szacuje na 5,41 USD. To niezależne dane dla standardowej wersji SKU, zarejestrowane 2026-09-24. Przypominają one również, że indeks został zrewidowany od czasu sierpniowych materiałów o premierze, więc nie zestawiaj starszej wartości indeksu z obecną i nie nazywaj tego trendem.

To, czego AA nie ma, to wiersz Prime. Dopóki ktoś tego nie zmierzy, twierdzenie o szybkości należy wyłącznie do firmy Aliba​ba, a właściwą postawą jest przetestowanie tego na własnym obciążeniu, a nie zakładanie, że to najwyższa półka.

Co to oznacza dla decyzji o routingu

Prime to poziom, który Aliba​ba sprzedaje we własnym API, i to jedyne miejsce, w którym można go zdobyć. Nie hostujemy tutaj qwen3.8-max-prime. Qwen3.8-Maxoraz jego datowaną wersję Qwen3.8-Max-0902, oba na tym samym kluczu co reszta rodziny Qwen3.8 — Qwen3.8, Qwen3.8-Flash, Qwen3.8-27B — obok ponad 200 innych modeli, z ceną katalogową dostawcy przekazywaną bez marży (0%). To ostatnie jest powodem, dla którego odświeżenie z 2 września i każda przyszła zmiana stawek za Max trafiają do nas tego samego dnia, w którym pojawiają się u Aliba​by.

Praktyczny podział wygląda następująco. Kieruj domyślny ruch na standardowym ID przez router, gdzie failover chroni cię, jeśli pojedyncza ścieżka dostawcy ulegnie degradacji. Przenieś konkretne wywołania, w których opóźnienie zegarowe jest produktem — interaktywne uzupełnienie, krok agenta o napiętym czasie — do Prime, i wyceniaj tę decyzję względem 2×, a nie względem 1,5×.

Kto powinien przejść, a kto powinien poczekać

Przełącz się, jeśli twoi użytkownicy czekają na tokeny: autouzupełnianie, tura czatu, pętla edycji kodu, której przygląda się człowiek. W górnej części zakresu prędkości Prime jest kosztowo neutralny w przeliczeniu na sekundę usuniętego opóźnienia — płacisz dokładnie dwa razy więcej za dokładnie połowę czasu. W dolnej części zakresu płacisz 2× za 1,5×, co oznacza 33% dopłaty za każdą zaoszczędzoną sekundę. Jeśli twoje obciążenie to zadanie wsadowe wykonywane przez noc, ta dopłata nie daje ci niczego, czego potrzebowałeś.

Wstrzymaj się, jeśli Twój model kosztów opiera się na nagłówku premiery $2/$6, albo jeśli Twoje żądania są mocno obciążone danymi wejściowymi. Twierdzenie dostawcy o szybkości dotyczy TPS — tokenów wyjściowych na sekundę — a prefill to inny etap potoku. Żądanie z długim kontekstem płaci podwójnie za tokeny wejściowe, niezależnie od tego, czy wynik przychodzi szybciej. Zmierz ten przypadek, zanim go zmigrujesz.

I sprawdź datę na swojej karcie stawek. Qwen3.8-Max jest na rynku od 3 sierpnia, został raz odświeżony i raz przepakowany, a mimo to ma wciąż siedem tygodni. Nowością jest tier, a nie model.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie