
Qwen3.8 Max Prime: Alibaba stawia drugą kartę stawek obok swojego flagowca
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 584 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 187 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
22 września 2026 r. na Konferencji Yunqi w Hangzhou, linia biznesowa MaaS firmy Alibaba ogłosiła poziom usług, który nazywa trybem Prime — 优速模式 — i umieściła nowy identyfikator modelu w cenniku dla niego: qwen3.8-max-prime. Ten identyfikator nie jest nowym modelem. To jest Qwen3.8-Max, flagowy model typu sparse mixture-of-experts o 2,4 biliona parametrów, który osiągnął ogólną dostępność 3 sierpnia 2026 r., dostarczany przez szybszą ścieżkę. Qwen3.8 Max Prime ma te same wagi, to samo okno kontekstowe, te same narzędzia i te same limity użycia co model bazowy. Różni się przepustowością i ceną, a cena jest w przybliżeniu dwukrotnie wyższa.
To już drugi raz w ciągu siedmiu tygodni, gdy Alibaba zmieniła sposób sprzedaży Qwen3.8-Max, nie zmieniając tego, czym on jest. 2 września firma wypuściła odświeżoną wersję po treningu, oznaczoną jako Qwen3.8-Max-0902, skupioną na kodowaniu i pracy agentowej, dostępną wyłącznie przez API. 22 września dodano poziom szybkości. Żadna z nich nie była premierą, a potraktowanie którejkolwiek jako premiery będzie cię kosztować.

Czym tak naprawdę jest tryb Prime
Własna dokumentacja Alibaby opisuje tryb Prime jako kanał dla „scenariuszy wrażliwych na szybkość generowania" — asystentów kodowania AI, wieloetapowego rozumowania agentów, rozmów w czasie rzeczywistym — i wprost podaje korzyść: TPS wzrasta do 1,5–2 razy w porównaniu ze standardowym API. Nie ma żadnego nowego parametru do ustawienia. Wystarczy zmienić wartość model na identyfikator Prime i jesteś na szybkim pasie.
Dokumentacja jest równie jednoznaczna co do tego, co się nie zmienia: „Możliwości obsługiwane przez model i ograniczenia użytkowania są takie same jak w przypadku oryginalnego modelu”. Zatem nie ma większego kontekstu, nie ma lepszego trybu rozumowania, nie ma dodatkowej powierzchni narzędziowej. To ten sam stos obsługi, tyle że z większym zapasem za nim.
The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.
Cennik, przeczytaj uważnie
Międzynarodowa strona cennika Aliba{{1}}ba{{/1}} wymienia oba identyfikatory obok siebie, co sprawia, że porównanie jest wyjątkowo przejrzyste. Za milion tokenów:
• Wejście — qwen3.8-max-prime 3,301 USD vs qwen3.8-max 1,65 USD
• Wyjście — qwen3.8-max-prime 9,902 USD vs qwen3.8-max 4,951 USD
• Trafienie w pamięć podręczną — qwen3.8-max-prime 0,413 USD w porównaniu ze stawką odczytu z pamięci podręcznej dla standardowego identyfikatora, którą ta sama strona podaje jako pozycję rabatową
• Współczynnik — 2,0× zarówno na wejściu, jak i na wyjściu — to nie zaokrąglone przybliżenie, lecz dosłowna arytmetyka opublikowanych liczb
W chińskim cenniku ta sama proporcja 2× obowiązuje w juanach: 24 ¥ za input i 72 ¥ za output za milion w przypadku Prime ID wobec 12 ¥ i 36 ¥ dla wersji standardowej, przy trafieniach cache po 3 ¥.
Szeroko cytowana stawka premierowa dla Qwen3.8-Max to 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych. To nagłówek, z którym ukazały się sierpniowe materiały, a nie liczba z dzisiejszego międzynarodowego cennika. Jeśli modelujesz wydatki, korzystaj z cennika dla swojego regionu, a nie z nagłówka premierowego, i sprawdź go ponownie, zanim podejmiesz zobowiązanie — Alibaba zaktualizowała tę stronę dwa razy od 2 września.

Reguła ograniczania to prawdziwa funkcja
Wiersz, który większość osób pomija, jest tym, który ma największe znaczenie w środowisku produkcyjnym. Dokumentacja Alibaba Prime stwierdza, że gdy Twoje zużycie osiągnie limit tempa, jeśli platforma wciąż ma wolne zasoby, nie zostanie zastosowane ograniczanie przepustowości, więc przepustowość faktycznie dostępna dla Ciebie nie spadnie poniżej podanego limitu.
To miękki pułap z twardym minimum, co ma inny kształt niż standardowy limit poziomu. Oznacza to, że wartość 1,5–2× jest obietnicą dotyczącą minimum, a nie ograniczeniem pułapu: przy rywalizacji o zasoby otrzymujesz limit, a przy niewykorzystanej przepustowości możesz otrzymać więcej. W przypadku pętli agenta, która wykonuje dziesiątki sekwencyjnych wywołań, ta asymetria jest warta więcej niż sam mnożnik TPS, ponieważ to opóźnienie ogonowe najwolniejszego wywołania decyduje o tym, czy Twój workflow się zakończy.
Dynamiczne limity TPM dla modeli standardowych są stopniowane według miesięcznych wydatków w Model Studio — ta sama rodzina dokumentacji pokazuje bazowy identyfikator qwen3.8-max na poziomie 5 000 000, 10 000 000 i 20 000 000 TPM w poszczególnych poziomach; są odświeżane co miesiąc. Prime nie usuwa tej struktury; zmienia to, jak daje się we znaki.

Czego jeszcze nikt nie zmierzył
Oto szczera luka. Wartość 1,5–2× jest deklarowana przez dostawcę. Nie ma niezależnego pomiaru przepustowości w trybie Prime, który moglibyśmy znaleźć, a to ma znaczenie, ponieważ własne niezależne wyniki standardowej wersji nie wypadają korzystnie pod względem szybkości.
Artificial Analysis, które ocenia modele na własnym stanowisku testowym, przyznaje obecnie Qwen3.8-Max w kompilacji 0902 wartość Intelligence Index na poziomie 45, przy GPQA Diamond na 92,8%, Terminal-Bench Hard na 38,9% i Humanity's Last Exam na 43,1% — a jego zmierzony koszt na zadanie szacuje na 5,41 USD. To niezależne dane dla standardowej wersji SKU, zarejestrowane 2026-09-24. Przypominają one również, że indeks został zrewidowany od czasu sierpniowych materiałów o premierze, więc nie zestawiaj starszej wartości indeksu z obecną i nie nazywaj tego trendem.
To, czego AA nie ma, to wiersz Prime. Dopóki ktoś tego nie zmierzy, twierdzenie o szybkości należy wyłącznie do firmy Alibaba, a właściwą postawą jest przetestowanie tego na własnym obciążeniu, a nie zakładanie, że to najwyższa półka.
Co to oznacza dla decyzji o routingu
Prime to poziom, który Alibaba sprzedaje we własnym API, i to jedyne miejsce, w którym można go zdobyć. Nie hostujemy tutaj qwen3.8-max-prime. Qwen3.8-Maxoraz jego datowaną wersję Qwen3.8-Max-0902, oba na tym samym kluczu co reszta rodziny Qwen3.8 — Qwen3.8, Qwen3.8-Flash, Qwen3.8-27B — obok ponad 200 innych modeli, z ceną katalogową dostawcy przekazywaną bez marży (0%). To ostatnie jest powodem, dla którego odświeżenie z 2 września i każda przyszła zmiana stawek za Max trafiają do nas tego samego dnia, w którym pojawiają się u Alibaby.
Praktyczny podział wygląda następująco. Kieruj domyślny ruch na standardowym ID przez router, gdzie failover chroni cię, jeśli pojedyncza ścieżka dostawcy ulegnie degradacji. Przenieś konkretne wywołania, w których opóźnienie zegarowe jest produktem — interaktywne uzupełnienie, krok agenta o napiętym czasie — do Prime, i wyceniaj tę decyzję względem 2×, a nie względem 1,5×.
Kto powinien przejść, a kto powinien poczekać
Przełącz się, jeśli twoi użytkownicy czekają na tokeny: autouzupełnianie, tura czatu, pętla edycji kodu, której przygląda się człowiek. W górnej części zakresu prędkości Prime jest kosztowo neutralny w przeliczeniu na sekundę usuniętego opóźnienia — płacisz dokładnie dwa razy więcej za dokładnie połowę czasu. W dolnej części zakresu płacisz 2× za 1,5×, co oznacza 33% dopłaty za każdą zaoszczędzoną sekundę. Jeśli twoje obciążenie to zadanie wsadowe wykonywane przez noc, ta dopłata nie daje ci niczego, czego potrzebowałeś.
Wstrzymaj się, jeśli Twój model kosztów opiera się na nagłówku premiery $2/$6, albo jeśli Twoje żądania są mocno obciążone danymi wejściowymi. Twierdzenie dostawcy o szybkości dotyczy TPS — tokenów wyjściowych na sekundę — a prefill to inny etap potoku. Żądanie z długim kontekstem płaci podwójnie za tokeny wejściowe, niezależnie od tego, czy wynik przychodzi szybciej. Zmierz ten przypadek, zanim go zmigrujesz.
I sprawdź datę na swojej karcie stawek. Qwen3.8-Max jest na rynku od 3 sierpnia, został raz odświeżony i raz przepakowany, a mimo to ma wciąż siedem tygodni. Nowością jest tier, a nie model.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
