Gegenereerde titelkaart voor Step 5 Preview vs Qwen 3.5 Max Prime met de tekst 'één indexpunt, vier dollar en achtendertig cent', met drie statistiekchips: Artificial Analysis Intelligence Index 44 tegen 45, kosten per indextaak $1.03 tegen $5.41, en prijs per miljoen tokens $2.70 tegen $9.902. Het OrcaRouter-logo staat in een witte strook rechtsonder.
Guides & Insights

Step 5 Preview vs Qwen 3.8 Max Prime: één indexpunt, vier dollar en achtendertig cent

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Begin met het ding dat een zoekvak je niet zal vertellen. Qwen 3.8 Max Prime is geen model. Het is een serveerroute — dezelfde Qwen3.8-Max gewichten die de leverancier op 3 augustus 2026 algemeen beschikbaar maakte, verkocht onder een tweede model-ID tegen precies het dubbele van de internationale tariefkaart. Step 5 Preview, het gesloten vlaggenschip van StepFun, opende zijn API op 20 september 2026 en is een model in de gewone zin: één endpoint, één prijs, één set gewichten die je niet in handen kunt houden. De eerlijke versie van deze confrontatie zet dus een gemeten model tegenover een ongemeten niveau, en de rekensom die eruit volgt is botter dan beide leveranciers op een slide zouden zetten. Op de onafhankelijke Artificial Analysis Intelligence Index liggen de twee één punt uit elkaar, 44 tegen 45, en op het punt van wat een voltooide taak kost, liggen ze $1,03 tegen $5,41 uit elkaar. Eén punt, vier dollar en achtendertig cent, per taak — en dat is nog voordat je hebt betaald voor de snelheid die Prime daadwerkelijk in rekening brengt.

Wat volgt is dat getal uiteengerafeld: waar het vandaan komt, waarom de standaard Qwen ID al de duurdere helft van de vergelijking is voordat Prime ook maar iets verdubbelt, en wat de extra vier dollar per taak wel en niet koopt.

De naam doet het werk dat het product niet doet

Alibaba kondigde Prime aan — 优速模式, snelle modus — tijdens de Yunqi-conferentie op 22 september 2026 en publiceerde het als een regel op de tariefkaart van Model Studio. Alibaba's eigen documentatie is ondubbelzinnig over wat er verandert: de uitvoersnelheid stijgt naar 1,5 tot 2 keer de standaard-API, en, in de woorden van de leverancier, zijn de mogelijkheden en gebruiksbeperkingen identiek aan het oorspronkelijke model. Geen nieuw aantal parameters, geen nieuw endpointcontract, geen mogelijkheid die de standaard-ID mist. Je verandert de modelnaam in de request body en je zit op de snelle baan.

Generated two-column comparison scoreboard for Step 5 Preview and Qwen 3.8 Max Prime across six shared rows: what the name refers to, 'a model' against 'a serving lane for Qwen3.8-Max'; Artificial Analysis Intelligence Index 44 against 45, measured on the standard Qwen ID with no Prime row; cost per index task $1.03 against $5.41; output price $2.70 against $9.902 per million tokens; output speed 87 against 35.4 tokens per second, again measured on the standard ID; and weights, 'proprietary, BF16 checkpoint promised 15 October' against 'proprietary, none'. A footer reads that index, speed and cost-per-task figures are per Artificial Analysis and were measured on the standard Qwen3.8-Max ID rather than on Prime, and that rate cards are Alibaba's international list price and StepFun's own. The OrcaRouter logo sits in a white strip at the bottom right.

Dat maakt de zoekterm een valstrik. Iemand die op zoek is naar een Qwen-flagship dat nieuwer is dan Qwen3.8-Max, vindt "Prime" en leest dat als een versienummer. Het is een prijs. Alles wat de naam aan capaciteit doet vermoeden, wordt geleverd door Qwen3.8-Max zelf: een sparse mixture-of-experts-model met 2,4 biljoen parameters, met ongeveer 95 miljard actieve parameters per token, 512 experts per laag, en een context van 983.616 tokens op de configuratie die de onafhankelijke raad heeft getest.

Step 5 Preview heeft geen vergelijkbare ambiguïteit en heeft het tegenovergestelde probleem. StepFun vermeldt het met ongeveer 600 miljard totale parameters, waarvan 27 miljard actief, tekst-, beeld- en video-invoer, een contextvenster van 1M tokens en een gedocumenteerd uitvoerplafond van 64.000 tokens, waarbij redeneerinspanning op laag, gemiddeld of hoog kan worden ingesteld. Het is propriëtair. Een BF16-checkpoint is toegezegd voor 15 oktober 2026, maar is nog niet uitgeleverd; community-mirrors van een BF16-build circuleren op Hugging Face sinds de dag dat de API opende, maar heruploads zijn geen release en StepFun heeft geen aankondiging over open weights gepubliceerd.

Dus het paar is echt onevenwichtig nog voordat er ook maar één benchmark landt: een model in preview dat misschien een download wordt, tegenover een serving-tier met een nieuwe prijs van een model dat dat niet zal worden.

Wat één indexpunt kost

Beide modellen zijn door dezelfde onafhankelijke beoordelaar getest, en dit is waar de vergelijking ongemakkelijk wordt voor het goedkoper-per-token-verhaal. Lees verder op 10 oktober 2026:

• Index — Step 5 Preview 44, ruim boven een mediaan van 26 voor vergelijkbare modellen. Qwen3.8-Max op de 0902-build, 45. Eén punt.

• Kosten per voltooide indexeringstaak — $1,03 tegenover $5,41. Meer dan vijf keer beter.

• Outputprijs — $2,70 tegen $6,00 per miljoen tokens op de standaard-ID, wat $9,902 wordt zodra je overstapt naar Prime. Step 5 Preview is 2,2 keer goedkoper dan standaard en 3,7 keer goedkoper dan Prime.

Invoerprijs — $1,00 tegenover $2,00 standaard en $3,301 op Prime. Het spiegelbeeld van de uitvoerkolom, en degene die er meer toe doet zodra je de kostenopsplitsing hieronder leest.

• Cachetreffer — $0,10 per miljoen tokens op Step 5 Preview, een korting van 90 procent; $0,25 op Qwen3.8-Max, een korting van 87,5 procent die de eigen pagina van de leverancier naar 88 procent afrondt.

• Uitvoertokens per seconde — 87 tegen 35,4. Hier is Qwen de langzame, en dan nog met een factor van ongeveer tweeënhalf.

De kolommen per token en de kolom per taak komen niet overeen, en de kolom per taak is degene die je moet geloven, om een reden die pas zichtbaar wordt als je de kostenopsplitsing opent. Bij de index-run van Step 5 Preview is $0,85 van de $1,03 aan de inputzijde en $0,17 output. Bij die van Qwen3.8-Max is $4,76 van de $5,41 aan de inputzijde en $0,65 output. De stickerprijzen liggen ruwweg een factor twee uit elkaar; de rekeningen per taak liggen een factor vijf uit elkaar, omdat de Qwen-run ongeveer 9,9 miljard inputtokens door de harness duwde tegenover 5,5 miljard voor Step 5 Preview, en omdat het grootste deel van dat volume cacheverkeer is dat opnieuw wordt gelezen tegen welke korting de leverancier ook geeft, in plaats van tegen het hoofdtarief.

Step 5 Preview wordt door het bestuur omschreven als zeer uitgebreid, met ongeveer 160 miljoen outputtokens in de hele suite, tegen een mediaan van 82 miljoen — en Qwen3.8-Max wordt in exact dezelfde bewoordingen omschreven, met ongeveer 190 miljoen tegen dezelfde mediaan. Geen van beide is een model dat beknopt antwoordt. Als outputlengte is wat je hoopte te optimaliseren, dan helpt geen van beide kolommen je.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), showing an Intelligence Index of 45 ranked 32 of 227 with a comparable-model median of 26, speed ranked 190 of 227, cost ranked 105 of 227 and verbosity ranked 103 of 227, pricing of $2.00 per million input tokens and $6.00 per million output tokens with an 88 percent cache discount, a measured cost of $5.41 per index task, 190 million output tokens generated across the run against an 82 million median, about 35 output tokens per second, and a 984k-token context.

Er zit een gat in de vergelijking, en het is Prime-vormig

Elk getal in de vorige sectie is gemeten op de standaard Qwen3.8-Max ID. Niets daarvan is gemeten op Prime.

Dat is geen technisch detail. Het hele voorstel van Prime is dat tokens sneller aankomen, en het enige snelheidscijfer op het board voor deze familie is de 35,4 outputtokens per seconde van de standaard-ID — met afstand de langzaamste van de drie hier besproken ID's, en de enige rij waarin Qwen3.8-Max niet alleen duur is, maar zichtbaar ondermaats presteert. Als Prime de bovenkant van het door Alibaba opgegeven bereik levert, wordt die 35,4 ongeveer 70, nog steeds onder de 87 van Step 5 Preview, terwijl het 3,7 keer zoveel kost per outputtoken. Als het de onderkant van het bereik levert, wordt het ongeveer 53.

Dat zijn schattingen die zijn gebaseerd op een door de leverancier opgegeven vermenigvuldigingsfactor, niet op metingen, en ze zouden als zodanig moeten worden aangeduid. Voor zover wij kunnen nagaan, heeft niemand een onafhankelijke doorvoertest van Prime mode gepubliceerd. Het cijfer van 1,5 tot 2× is van Alibaba zelf, en het is de enige dragende claim waarop het hele niveau rust.

Het enige structurele detail dat in het voordeel van Prime pleit, is de throttlingregel, en die is gemakkelijk over het hoofd te zien. Alibaba's documentatie stelt dat onder Prime, wanneer het aanroepvolume de rate limit bereikt, het verzoek niet wordt beperkt als het platform nog reservebronnen heeft — zodat de voor jou beschikbare doorvoer niet onder de opgegeven limiet zakt. Dat is een zachte bovengrens met een harde ondergrens: bij capaciteitsdruk krijg je de limiet, bij onbenutte capaciteit kun je meer krijgen. Voor een agentlus die tientallen sequentiële aanroepen afvuurt, weegt dit zwaarder dan de mediaan, omdat de traagste aanroep bepaalt wanneer de lus eindigt. Het is ook de duidelijkste verklaring waarom Prime überhaupt als product bestaat. Alibaba verkoopt een positie in de wachtrij uit capaciteit die het al heeft gebouwd, en rekent het dubbele voor het recht om daar als eerste uit te worden bediend.

Wat de twee tariefkaarten zeggen als je ze naast elkaar legt

Alibaba publiceert zijn Qwen-rijen naast elkaar, wat het rekenwerk van deze tier ongewoon overzichtelijk maakt. Op de internationale pagina staat in de Prime-rij $3,301 voor input en $9,902 voor output per miljoen tokens, tegenover $1,65 en $4,951 voor de standaard-ID en voor de bijbehorende 0902-pin. Dat is precies 2,0 in beide kolommen — geen afgeronde benadering, maar de letterlijke verhouding van de gepubliceerde getallen. Op de Engelse prijspagina van StepFun staat Step 5 Preview voor $1,00 input, $0,10 bij een cache-hit en $2,70 output, waarbij de input bij een cache-miss de kosten omvat van het schrijven van nieuwe inhoud naar de cache. Het door de leverancier gepubliceerde cache-hit-percentage is een korting van 90 procent; het onafhankelijke panel noteert 95 procent op basis van dezelfde materialen, en het is goed om te weten tegen welke van de twee je je model afzet.

Zet de drie kaarten in één kolom en het patroon is duidelijk. Prime-output: $9.902. Standaard Qwen-output: $6.00 volgens de registratie van het scorebord en $4.951 op de eigen internationale pagina van Alibaba. Step 5 Preview-output: $2.70. En op het goedkope spoor dat niemand aanprijst, is de cache-read van Step 5 Preview $0.10 tegenover $0.25 bij Qwen — wat belangrijker is dan de outputkolom voor elke workload die zijn prefix herhaalt.

Eén waarschuwing over verouderde cijfers, want deze familie is in zeven weken tijd meer dan eens opnieuw geprijsd. De veel geciteerde $2 voor input en $6 voor output voor Qwen3.8-Max vormen de headline van de augustuslancering, en dat is nog steeds wat het Singapore-tabblad van Alibaba toont. De internationale en wereldwijde rijen vermelden nu $1,65 en $4,951. Als je bestedingen modelleert, gebruik dan de tariefkaart voor jouw regio en lees die opnieuw op de dag dat je je vastlegt.

Twee manieren om de 2× te lezen

Omdat Prime hetzelfde model is voor het dubbele van de prijs van de standard ID, is de meerprijs gemakkelijk te beprijzen en moeilijk te rechtvaardigen. Aan de bovenkant van Alibaba's assortiment betaal je 2× voor 2× de snelheid, wat kostenneutraal is per seconde verwijderde latentie. Aan de onderkant betaal je 2× voor 1,5×, een meerprijs van 33 procent per bespaarde seconde. Geen van beide uitersten is onredelijk voor interactief werk; geen van beide is verdedigbaar voor een nachtelijke batch. Daarom is het standaardadvies over de tier — latentiegevoelige calls op Prime, al het andere op de standard ID — ook het juiste advies.

De vergelijking met Step 5 Preview is waar de redenering van vorm verandert, en dit is het deel dat de 'vs'-framing zichtbaar maakt. Prime concurreert helemaal niet met Step 5 Preview op prijs. De standaard-ID is al duurder per outputtoken dan Step 5 Preview, vijf keer duurder per voltooide taak, en scoort één punt hoger. Prime vermenigvuldigt de kostenkant van een vergelijking die al aan het verliezen was en koopt snelheid terug waar Step 5 Preview gratis meer van heeft. Als snelheid is wat je van deze familie nodig hebt, is de eerlijke uitspraak dat het model aan de andere kant van deze pagina je 87 tokens per seconde geeft bij $2,70 per miljoen outputtokens, en de snelle route geeft je een bereik dat, volgens Alibaba's eigen cijfers, piekt op ongeveer 70 bij $9,902.

Dat is geen argument dat Step 5 Preview wint. Het is een argument dat de waarde van Prime volledig intern is binnen de eigen productlijn van Alibaba, en dat de onderbouwing ervoor berust op workloads waarin de voorsprong van Qwen3.8-Max van één punt in de index, zijn context van 983.616 tokens of zijn andere takenprofiel werk doen dat een Step 5 Preview-context van 1M tokens niet doet. En dat is de vergelijking die nog niemand kan uitvoeren, omdat de Prime-rij op geen enkel onafhankelijk leaderboard bestaat.

Generated rate-card infographic comparing three published price lists in one column: Qwen 3.8 Max Prime at $3.301 input and $9.902 output per million tokens, the standard qwen3.8-max and qwen3.8-max-0902 IDs at $1.65 and $4.951 on Alibaba's international page against the $2 and $6 still shown on its Singapore tab, and Step 5 Preview at $1.00 input, $0.10 cached input and $2.70 output from StepFun's English pricing page. A footer reads that the Prime row is exactly 2.0 times the standard row on both columns and that all figures are vendor list prices read on 10 October 2026.

Waar dit voor een koper op neerkomt

Geen van deze twee staat op OrcaRouter. Step 5 Preview is bereikbaar via de eigen API van StepFun en een handjevol platforms van derden; Prime is een Alibaba Cloud Model Studio-tier die wordt aangeboden op een endpoint dat aan een workspace is gebonden; en je kunt beide beweringen in dezelfde minuut dat je ze leest aan onze catalogus toetsen, wat een betere test is dan ons op ons woord te geloven.

Wat wij routeren is een ander product in dezelfde familie, en het is toevallig precies degene waar de rekensom van dit artikel steeds op terugkomt. De standaard Qwen3.8-Max en zijn gedateerde pin Qwen3.8-Max-0902 staan in de catalogus onder dezelfde sleutel als hun zustermodellen Qwen3.8-Max-Preview, Qwen3.8-Flash en Qwen3.8-27B, naast meer dan 200 andere modellen, met de lijstprijs van de provider doorgegeven tegen 0 procent opslag. Daaruit volgen twee dingen, en beide zijn van belang voor de beslissing hierboven. Het eerste is dat een wijziging van de tariefkaart bij Alibaba aan onze kant opduikt op dezelfde dag dat Alibaba die publiceert — precies de eigenschap die je wilt van een leverancier die deze familie al twee keer in zeven weken opnieuw heeft geprijsd. Het tweede is dat je uitgangspunt ophoudt een gok op één leverancier te zijn: de standaard-ID is de tier die je het waarschijnlijkst op je standaardpad houdt, en door die achter een routeringslaag te houden in plaats van een directe integratie, wordt de Prime-beslissing omkeerbaar per endpoint in plaats van per contract.

Als je moet kiezen tussen de twee namen in de titel van dit artikel, is de tweedeling eenvoudig. Kies voor Step 5 Preview wanneer je de score wilt, de video- en beeldinvoer en de korting van 90 procent op de cache, en accepteer dat je een preview huurt waarvan de checkpoint een belofte voor 15 oktober is in plaats van een licentie. Kies alleen voor Qwen 3.8 Max Prime als je al gecommitteerd bent aan Qwen3.8-Max en op je eigen prompts hebt gemeten dat de 35 tokens per seconde van de standaard-ID je geld kosten — en weeg die beslissing af tegen de 2× in plaats van tegen de 1,5×, want de top van het gamma van een leverancier is niet het getal dat je in productie zult zien.

De meting die dit zou beslechten bestaat niet, en het is de moeite waard dat ronduit te zeggen in plaats van het mooier voor te stellen. Iemand moet Prime door een testharnas halen dat ook Step 5 Preview draait, een doorvoerverdeling publiceren in plaats van een vermenigvuldigingsfactor, en een kosten-per-taakcijfer naast het indexpunt zetten dat het koopt. Tot dan zijn de enige cijfers die beide partijen delen de twee tariefkaarten, en die zeggen hetzelfde vanuit tegenovergestelde richtingen: de snelle baan is de duurste manier om een Qwen3.8-Max-token te kopen, en de langzaamste manier om een seconde kloktijd te kopen tegen wat het alternatief voor dezelfde seconde rekent.