Hero-titelkaart voor Qwen3.8 Max Prime, Alibaba's servicelaag met 1,5-2x doorvoer voor het Qwen3.8-Max-vlaggenschip, met specificatiechips die hetzelfde totaal van 2,4T en ~95B actief vermelden, Prime tegen $3.301/$9.902, standaard tegen $1.65/$4.951.
Guides & Insights

Qwen3.8 Max Prime: Alibaba zet een tweede tariefkaart naast zijn vlaggenschip

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op 22 september 2026 kondigde de MaaS-businessline van Alibaba tijdens de Yunqi Conference in Hangzhou een servicelaag aan die het Prime mode — 优速模式 — noemt, en zette daarvoor een nieuwe model-ID op de tariefkaart: qwen3.8-max-prime. Die ID is geen nieuw model. Het is Qwen3.8-Max, het sparse mixture-of-experts-vlaggenschip met 2,4 biljoen parameters dat algemeen beschikbaar werd op 3 augustus 2026, geleverd via een snellere route. Qwen3.8 Max Prime heeft dezelfde gewichten, hetzelfde contextvenster, dezelfde tooling en dezelfde gebruikslimieten als het basismodel. Wat verschilt, is de doorvoer en de prijs, en de prijs is ongeveer twee keer zo hoog.

Dit is de tweede keer in zeven weken dat Alibaba heeft veranderd hoe Qwen3.8-Max wordt verkocht, zonder te veranderen wat het is. Op 2 september bracht het bedrijf een post-trained refresh uit onder de naam Qwen3.8-Max-0902, gericht op coderen en agentisch werk, alleen via de API. Op 22 september kwam daar de snelheidsvariant bij. Geen van beide was een lancering, en als je ze wel als zodanig leest, kost je dat geld.

Scoreboard infographic for Qwen3.8 Max Prime: underlying model Qwen3.8-Max GA August 3 2026, 2.4T total and ~95B active parameters, throughput 1.5-2x standard, Prime price $3.301/$9.902, standard price $1.65/$4.951, no independent Prime score yet.

Wat Prime mode eigenlijk is

Alibaba's eigen documentatie beschrijft Prime-modus als een kanaal voor "scenario's die gevoelig zijn voor uitvoersnelheid" — AI-codeerassistenten, redeneringen van agents in meerdere stappen, realtimegesprekken — en noemt het voordeel duidelijk: TPS wordt verhoogd tot 1,5 tot 2 keer die van de standaard-API. Er is geen nieuwe parameter om in te stellen. Je zet de modelwaarde op de Prime-ID en je zit op het snelle spoor.

De documentatie is even expliciet over wat niet verandert: "Door het model ondersteunde mogelijkheden en gebruiksbeperkingen zijn dezelfde als bij het originele model." Er is dus geen grotere context, geen betere redeneermodus, geen extra tool-oppervlak. Het is dezelfde servingstack met meer ruimte erachter.

The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.

De tariefkaart, zorgvuldig lezen

Aliba​ba's internationale prijzenpagina zet de twee ID's naast elkaar, wat de vergelijking ongewoon overzichtelijk maakt. Per miljoen tokens:

• Invoer — qwen3.8-max-prime $ 3,301 vs qwen3.8-max $ 1,65

• Uitvoer — qwen3.8-max-prime $ 9,902 vs qwen3.8-max $ 4,951

• Cachehit — qwen3.8-max-prime $0,413 versus een cache-leestarief op de standaard-ID die dezelfde pagina als kortingsregel vermeldt

• Verhouding — 2,0× voor zowel invoer als uitvoer, geen afgeronde benadering maar de letterlijke rekenkundige uitkomst van de gepubliceerde getallen

Op de tariefkaart voor China geldt dezelfde factor 2× in yuan: ¥24 voor input en ¥72 voor output per miljoen voor de Prime ID tegenover ¥12 en ¥36 voor de standaardversie, met cachehits op ¥3.

Het veel geciteerde lanceringscijfer voor Qwen3.8-Max is $2 voor input en $6 voor output per miljoen. Dat is de kop waaronder de berichtgeving van augustus verscheen, en het is niet het tarief dat vandaag op de internationale tariefkaart staat. Als je de uitgaven modelleert, gebruik dan de tariefkaart voor jouw regio in plaats van de lanceringskop, en controleer die opnieuw voordat je je vastlegt — Aliba​ba heeft deze pagina sinds 2 september twee keer herzien.

Screenshot of Alibaba Cloud's international Model Studio pricing page listing the qwen3.8-max-prime and qwen3.8-max model IDs side by side, with Prime at $3.301 per million input tokens and $9.902 per million output tokens against $1.65 and $4.951 for the standard ID.

De throttling-regel is de echte functie.

De regel waar de meeste mensen vluchtig overheen lezen, is juist degene die het belangrijkst is voor productie. In de Prime-documentatie van Alibaba staat dat wanneer je verbruik de limiet bereikt, als het platform nog resources beschikbaar heeft, je niet wordt afgeknepen, dus de doorvoer die daadwerkelijk voor je beschikbaar is, zal niet onder de opgegeven limiet zakken.

Dat is een zacht plafond met een harde ondergrens, wat een andere vorm is dan een standaard tierlimiet. Het betekent dat het cijfer van 1,5–2× een belofte is over de ondergrens, niet een bovengrens op het plafond: bij concurrentie krijg je de limiet, en bij onbenutte capaciteit kun je meer krijgen. Voor een agent-loop die tientallen sequentiële calls afvuurt, is die asymmetrie meer waard dan de ruwe TPS-multiplier, omdat het de tail latency op de traagste call is die bepaalt of je workflow wordt voltooid.

Standaardmodel dynamische TPM-limieten zijn gelaagd op basis van maandelijkse Model Studio-uitgaven — dezelfde documentatiefamilie toont de basis-ID qwen3.8-max op 5.000.000, 10.000.000 en 20.000.000 TPM verspreid over de tiers, maandelijks vernieuwd. Prime verwijdert die structuur niet; het verandert hoe die bijt.

Screenshot of the Artificial Analysis model page for Qwen3.8-Max on the 0902 build, showing an Intelligence Index of 45 and a measured cost per task of $5.41 on the standard ID.

Wat nog niemand heeft gemeten

Hier is het eerlijke gat. Het getal van 1,5–2× is door de leverancier opgegeven. Er is geen onafhankelijke meting van de doorvoer in Prime-modus die wij kunnen vinden, en dat maakt uit, want de eigen onafhankelijke cijfers van de standaardbuild zijn niet flatteus als het op snelheid aankomt.

Artificial Analysis, dat modellen op zijn eigen testomgeving meet, kent Qwen3.8-Max op de 0902-build momenteel op de Intelligence Index een score van 45 toe, met GPQA Diamond op 92,8%, Terminal-Bench Hard op 38,9% en Humanity's Last Exam op 43,1% — en stelt de gemeten kosten per taak op $5,41. Dat zijn onafhankelijke cijfers voor de standaard-SKU, vastgelegd op 2026-09-24. Ze zijn ook een herinnering dat de index is herzien sinds de berichtgeving over de lancering in augustus, dus zet een oudere indexwaarde niet naast een actuele en noem het geen trend.

Wat AA niet heeft, is een Prime-rij. Totdat iemand het meet, is de snelheidsclaim alleen die van Aliba​ba, en de juiste houding is om het op je eigen werkbelasting te testen in plaats van uit te gaan van het topsegment.

Wat dit betekent voor de routeringsbeslissing

Prime is een tier die Aliba​ba via zijn eigen API verkoopt, en dat is de enige plek om eraan te komen. Wij hosten qwen3.8-max-prime hier niet. Wat OrcaRouter wel routeert, is de standaard Qwen3.8-Max en de bijbehorende datumgebonden pin Qwen3.8-Max-0902, beide op dezelfde key als de rest van de Qwen3.8-familie — Qwen3.8, Qwen3.8-Flash, Qwen3.8-27B — naast 200-plus andere modellen, met de lijstprijs van de provider doorgegeven tegen 0% markup. Dat laatste is de reden waarom de refresh van 2 september en elke toekomstige wijziging van het Max-tarief op onze kant dezelfde dag landen als bij Aliba​ba.

De praktische opsplitsing ziet er als volgt uit. Laat je standaardverkeer op de standaard-ID via een router lopen, waar failover je beschermt als één enkel providerpad verslechtert. Verplaats de specifieke calls waar wall-clocklatentie het product is — de interactieve completion, de strakke agentstap — naar Prime, en weeg die beslissing af tegen de 2× in plaats van tegen de 1,5×.

Wie moet overstappen, en wie moet wachten?

Schakel over als je gebruikers op tokens wachten: een autocomplete, een chatbeurt, een code-bewerkingslus waarbij een mens meekijkt. Aan de bovenkant van het snelheidsbereik is Prime kostenneutraal per seconde verwijderde latentie — je betaalt precies het dubbele voor precies de helft van de tijd. Onderaan het bereik betaal je 2× voor 1,5×, wat een premie van 33% per bespaarde seconde is. Als je workload een batchjob is die 's nachts draait, levert die premie je niets op wat je nodig had.

Wacht: als je kostenmodel is gebaseerd op de introductieprijs van $2/$6, of als je verzoeken inputintensief zijn. De snelheidsclaim van de leverancier gaat over TPS — outputtokens per seconde — en prefill is een andere fase in de pijplijn. Een verzoek met een lange context betaalt dubbel voor inputtokens, ongeacht of de output sneller aankomt. Meet dat scenario voordat je het migreert.

En check de datum op je tariefkaart. Qwen3.8-Max is sinds 3 augustus op de markt, is één keer vernieuwd en één keer opnieuw verpakt, en is nog steeds zeven weken oud. De tier is het nieuws; het model niet.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt