
Step 5 Preview vs GPT-6 Astra: Tien keer de inputprijs voor negen indexpunten
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Deze twee modellen werden zeventien dagen na elkaar aangekondigd en hun prijzen lijken van verschillende planeten te komen. Step 5 Preview, het sparse mixture-of-experts-model met 600B parameters van StepFun dat op 20 september 2026 werd aangekondigd, rekent $1,00 per miljoen inputtokens en $2,70 per miljoen outputtokens. GPT-6 Astra, het vlaggenschip van de leverancier dat op 3 september 2026 werd uitgebracht, rekent $10,00 en $50,00 voor dezelfde eenheden onder een inputdrempel van 272K tokens — en $20,00 en $75,00 daarboven. Dat is tien keer de inputprijs en ongeveer achttien keer de outputprijs voor een model dat negen punten hoger scoort op de onafhankelijke Intelligence Index, 53 tegen 44. Of Astra beter is, staat niet ter discussie. Of het verschil dertig extra dollar per miljoen outputtokens waard is voor jouw workload, is dat wel, en het antwoord verschuift twee keer in de loop van dit stuk.
Waar elk model voor is
Step 5 Preview is gebouwd en verkocht voor agentisch werk: AI-codering, software-engineering, professioneel kenniswerk, financiën. De architectuur is daarop afgestemd — 600B totale parameters met ongeveer 27B actief per token, een 1M-tokencontext, tekst- en beeldinvoer, en redeneren met uitgebreid denken. StepFun sloeg de hele Step 4.x-lijn over om hier te komen, en ging direct van Step-3.7-Flash naar Step 5.
GPT-6 Astra is OpenAI's algemeen inzetbare vlaggenschipmodel: een context van 1M tokens, tot 128K uitvoertokens, invoer in tekst, afbeeldingen en bestanden, uitvoer in tekst, een kennisafsluitdatum van 30 april 2026, en ondersteuning voor redeneren, programmeren en agentische workflows. Het is het model waar een onderneming naar grijpt wanneer het antwoord juist moet zijn en de tokenrekening niet de beperkende factor is.
• Intelligentie-index — Step 5 Preview 44 vs GPT-6 Astra 53
• Parameters — Step 5 Preview 600B totaal / 27B actief vs GPT-6 Astra niet bekendgemaakt
• Context en outputplafond — beide een context van 1M tokens; Astra vermeldt een venster van 1.050.000 tokens en een outputlimiet van 128K, StepFun heeft geen outputplafond gepubliceerd
• Invoermodaliteit — tekst en afbeeldingen versus tekst, afbeeldingen en bestanden
• Uitvoersnelheid — Step 5 Preview 99,8 tokens/sec vs GPT-6 Astra 59,3 tokens/sec
• Prijs per 1 miljoen tokens — $1,00 invoer / $2,70 uitvoer vs. $10,00 invoer / $50,00 uitvoer onder 272K invoer, oplopend tot $20,00 / $75,00 daarboven
• Cache — Step 5 Preview 95% korting vs GPT-6 Astra een 90% korting op lezen met een cache-schrijftarief van $12,50 per miljoen
• Kosten per Intelligence Index-taak — Step 5 Preview $0,71 vs GPT-6 Astra $3,26

De factuur, regel voor regel
De prijsstelling van Step 5 Preview is vast en goedkoop: $1,00 in, $2,70 uit, met een cachekorting van 95% waardoor gecachte input in de buurt van $0,05 per miljoen tokens komt. Bij een 7:2:1-mix van cachehits, input en output — de conventie die deze blog hanteert voor agentverkeer — komt het gecombineerde tarief uit op ongeveer $0,51 per miljoen tokens, en de kosten per Intelligence Index-taak komen uit op $0,71, de 27e van de 200. De kanttekening is breedsprakigheid: het model produceerde 160M outputtokens op die Index tegenover een mediaan van 92M, waardoor de ruwe tokentellingen hoger uitvallen dan wat het prijskaartje doet vermoeden.
De prijsstelling van GPT-6 Astra is getrapt, en de tier is het deel dat aandachtig lezen waard is. Onder 272K invoertokens per aanvraag is het $10,00 en $50,00; daarboven $20,00 en $75,00. De tier wordt gekozen op basis van het aantal invoertokens van elke aanvraag zelf, wat belangrijker is dan het klinkt voor een model dat wordt aangeprezen om zijn context van 1M tokens — één enkele aanroep met een grote context overschrijdt de grens en verdubbelt het tarief voor de hele aanvraag. Cache-leesbewerkingen kosten $1,00 per miljoen, een korting van 90%, en cache-schrijfbewerkingen kosten $12,50 per miljoen. Bij dezelfde 7:2:1-verhouding komt het gemengde tarief uit op ongeveer $7,70 per miljoen tokens, en de kosten per Index-taak zijn $3,26, de 71e van 200.
Astra slaat wat betreft uitvoerigheid de andere kant op, en is hier het beknopte model: 60M outputtokens op de Index tegenover 160M van Step 5 Preview, 27e van 200 op die maatstaf. Minder tokens tegen een hoger tarief verkleint de kloof, maar de ruwe veelvoud overdrijft die verkleining. Het dicht de kloof niet — het kosten-per-taakcijfer verrekent uitvoerigheid, cachegedrag en prijsstelling al met elkaar, en $3,26 tegenover $0,71 is nog steeds een verschil van 4,6 keer.
Wat de negen indexpunten opleveren
De belangrijkste cijfers van Astra zijn die van OpenAI zelf en niet gereproduceerd: 96,1 op GPQA Diamond, 72,6% op OSWorld 2.0, 97,6% op FrontierMath Tier 4, 57,2% op Humanity's Last Exam met tools, en ongeveer 57,9% op Terminal-Bench 4.0. Het ARC-AGI-3-cijfer is het cijfer waar je voorzichtig mee moet omgaan — OpenAI rapporteert 99,9% onder zijn eigen provider-adapter-harness en 62,7% op de standaardharness, en een verschil van 37 punten tussen harnessen zegt minstens evenveel over de harness als over het model.
De gepubliceerde cijfers van Step 5 Preview bevinden zich in hetzelfde bereik op de agentische taken waarvoor het is gebouwd, en er kleeft hetzelfde voorbehoud aan: 33,3% op Terminal-Bench 4.0, 80,5 op ProgramBench, 67,7 op DeepSWE v1.1 en 49,0 op StepCodeBench, allemaal afkomstig van StepFun en geen ervan onafhankelijk gereproduceerd. Verschillende leveranciers, verschillende testharnassen, geen gedeelde run — wat precies de reden is waarom de onafhankelijk gemeten kloof van negen punten een bruikbaarder getal is dan welke van deze dan ook.
Dat verschil is reëel en het is niet klein. Op een ranglijst van 200 modellen staan 53 en 44 op de derde en vierentwintigste plaats, en het onderscheid komt tot uiting als een andere klasse van taken in plaats van een andere score op dezelfde taak: de gepubliceerde overwinningen van Astra clusteren bij redeneren over een lange horizon en computergebruik, en dat is waar de top van de ranglijst uitloopt. Als jouw workload daar ligt, zijn de negen punten meer waard dan de factuur.
Eén kanttekening bij de score van Astra. Artificial Analysis herziet de Intelligence Index, en cijfers voor hetzelfde model lopen uiteen tussen snapshots die weken uit elkaar liggen — 52,8, 53 en 54,7 komen allemaal voor in materiaal dat binnen dezelfde maand over dit model is gepubliceerd. De 53 op de huidige modelpagina is het getal dat je moet gebruiken, en elke vergelijking die een oudere Astra-snapshot naast een actuele Step 5 Preview-waarde zet, meet met twee verschillende meetlatten.

Snelheid en latentie zijn twee verschillende vragen
Wat de generatiesnelheid betreft, is de onafhankelijke benchmark ondubbelzinnig: 99,8 outputtokens per seconde voor Step 5 Preview tegenover 59,3 voor GPT-6 Astra, dat ook langzamer is dan het gemiddelde van 70 tokens per seconde over de gemeten modellen. In een interactieve codeerloop is dat het verschil tussen een suggestie en een pauze, en het stapelt zich gedurende een sessie op zoals een cachekorting dat doet.
Latentie is het gecompliceerdere verhaal, en één enkel getal geeft daar een misleidend beeld van. Astra routeert redenering voordat het output uitzendt, dus tijd tot eerste token en tijd tot een bruikbaar antwoord zijn niet dezelfde meting, en gepubliceerde cijfers erover lopen sterk uiteen, afhankelijk van of redenering wordt meegeteld. In ons eigen verkeer van de afgelopen zeven dagen is de mediane tijd tot eerste token van GPT-6 Astra 6,72 seconden, met een 95e percentiel van 10,00 seconden — het getal dat een aanroeper via ons endpoint daadwerkelijk ervaart. Artificial Analysis stelt de tijd tot eerste token van Step 5 Preview op 2,96 seconden in zijn eigen testomgeving, en die twee cijfers zijn niet op dezelfde manier gemeten, dus ze moeten niet van elkaar worden afgetrokken.
Waar de cache-asymmetrie daadwerkelijk terechtkomt
Beide modellen geven een flinke korting op herhaalde prefixen en beide rekenen kosten voor het schrijven ervan, en het verschil tussen hen is twintigvoudig bij het lezen. De cachekorting van 95% van Step 5 Preview brengt gecachte input op bijna $0,05 per miljoen tokens. GPT-6 Astra leest cache voor $1,00 per miljoen — een korting van 90% op een basistarief dat tien keer hoger ligt — en schrijft het voor $12,50 per miljoen.
Voor een agent-loop die bij elke beurt dezelfde systeemprompt en repositorycontext opnieuw verzendt, is het leestarief wat zich opstapelt, en de diepere korting op het goedkopere model is meer waard dan de ondiepere korting op het dure model. Astra's mix komt nog steeds uit op ongeveer $7,70 per miljoen tokens tegenover $0,51 voor Step 5 Preview bij dezelfde 7:2:1-mix — een vijftienvoudig verschil dat tijdens een lange sessie niet kleiner wordt, maar groter.
Beide vanaf één sleutel uitvoeren
GPT-6 Astra is live op OrcaRouter onder openai/gpt-6-astra tegen OpenAI's lijsttarieven — $10,00 en $50,00 per miljoen onder de drempel van 272K, $20,00 en $75,00 daarboven — doorgegeven zonder enige opslag, zodat een prijswijziging van de leverancier dezelfde dag nog bij ons live is in plaats van bij de volgende factureringscyclus. Onze eigen zevendaagse telemetrie op dat endpoint toont de hierboven genoemde mediane tijd tot het eerste token van 6,72 seconden en een 95e percentiel van 10,00 seconden, naast 277,9M tokens aan verkeer erdoorheen in de afgelopen week.
Step 5 Preview staat niet in onze catalogus en we routeren het niet. Het draait op StepFun's eigen API en Studio, en dat is de enige plek waar het draait tot het checkpoint van 15 oktober arriveert. Die asymmetrie is geen gebrek in de vergelijking; het ís de vergelijking. De goedkope helft van deze matchup is de helft die je elders moet aanroepen, en de helft die je vandaag in productie kunt nemen bevindt zich achter één API voor meer dan 200 modellen: GPT-6 Astra tegen de bovenstaande tarieven, GLM-5.3 voor $1,26 en $3,96, DeepSeek V4 Pro, Claude Opus 5 en de rest, met automatische failover tussen providers die een pad stabiel houdt wanneer de capaciteit van een provider verschuift, en de routing-DSL waarmee een taak goedkoop kan beginnen en alleen opschaalt wanneer dat nodig is. Die escalatieregel is het echte antwoord op een prijsverschil van tien keer: het grootste deel van een workload heeft niet de top van het bord nodig, en een routeringslaag is hoe je stopt met betalen voor het deel dat dat niet nodig heeft.

Wie moet welke kiezen
Als je workload een langetermijnagent is die een moeilijke taak goed moet uitvoeren — computergebruik, onderzoek in meerdere stappen, werk waarbij een fout antwoord meer kost dan de tokens — dan is de voorsprong van negen punten van GPT-6 Astra het goedkoopste deel van de beslissing, en de factuur is wat de capaciteit kost. Gebruik het als escalatiedoel, niet als standaard, en let op de 272K-drempel: één enkel te groot verzoek verdubbelt het tarief voor alles erin.
Als je workload uit hoogvolume-agentische tekst bestaat — codegeneratie, refactors, gestructureerde extractie, de inner loop van een codeerassistent — dan ligt Step 5 Preview voor op alles waar de factuur en de klok om geven, en het is onwaarschijnlijk dat negen indexpunten standhouden bij een taakverdeling die niet bovenaan het scorebord staat. De addertjes zitten niet in de prestaties: het model is propriëtair, zonder gepubliceerde licentie, zonder toestemming voor commercieel gebruik en zonder checkpoint tot 15 oktober. Je kunt het aanroepen; je kunt het niet bezitten, fine-tunen of er een afgeleide van uitbrengen.
Als het antwoord niet voor de hand ligt, is het patroon een tiersplitsing in plaats van een keuze. Leid algemeen verkeer naar een model uit de middenklasse en reserveer Astra voor de verzoeken die het hoogste niveau nodig hebben — beide uiteinden van die regel zitten aan onze kant achter één sleutel, dus de splitsing kost een routeringsregel in plaats van een tweede contract. Het betalen van vlaggenschiptarieven voor werk dat een model uit de middenklasse correct afmaakt, is de fout waar het in deze vergelijking eigenlijk om gaat.
