
Step 5 Preview vs Claude Opus 5: Zeven indexpunten voor zeven keer de rekening
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Het lanceermateriaal van StepFun voor Step 5 Preview opent met één vergelijkende claim: één taak erop kost een achtste van dezelfde taak op Claude Opus 5. Beide modellen staan nu op hetzelfde onafhankelijke leaderboard, dus die claim kan worden gecontroleerd in plaats van bediscussieerd. Artificial Analysis liet elk door Intelligence Index v4.3.2 lopen — tien evaluaties — en publiceerde wat elke run kostte, waarbij Claude Opus 5 werd gescoord op zijn eigen maximale reasoning-effort-instelling. Step 5 Preview: 44 op de index, $922,84 om de run te voltooien. Claude Opus 5: 51 op de index, $7.274,74. Dat is 7,9 keer zoveel geld voor 7 punten aan score, en de verhouding die StepFun noemde blijkt de juiste te zijn. Wat de verhouding verbergt, is het interessante deel, want de kloof is niet in de eerste plaats een prijskloof. Het is een kloof in breedsprakigheid die de kleren van een prijskloof draagt, en het scheiden van de twee verandert welk model je voor welke workload moet zetten.
Twee runkosten, één board, en wat er daadwerkelijk in zit
De totale kosten van een run vormen de zuiverste enkele vergelijking die hier beschikbaar is, omdat beide modellen dezelfde vragen onder dezelfde testopstelling hebben beantwoord en geen van beide leveranciers dat cijfer heeft aangeleverd. Het is ook het cijfer dat het meest waarschijnlijk verkeerd wordt gelezen, dus het loont om er nader op in te gaan.
• Indexscore — Step 5 Preview 44 vs Claude Opus 5 51, Claude Opus 5 scoorde op de maximale instelling voor redeneerinspanning
• Totale kosten om de index te voltooien — Step 5 Preview $922,84 vs Claude Opus 5 $7.274,74
Gemengde prijs bij een 7:2:1-mix van cache-hit / invoer / uitvoer — Step 5 Preview $0,51 per 1 miljoen tokens vs Claude Opus 5 $3,85
• Uitvoertokens gegenereerd tijdens de index-run — Step 5 Preview 160M vs Claude Opus 5 140M
• Lijstprijs — Step 5 Preview $1,00 in / $2,70 uit vs Claude Opus 5 $5,00 in / $25,00 uit
Bekijk rij drie en vijf samen en de rekensom is niet langer een rechtstreekse prijsvergelijking. Het gemengde tarief van Step 5 Preview is 7,5 keer goedkoper, en het lijsttarief is 5 keer goedkoper voor input en 9,3 keer goedkoper voor output — dus het gemengde tarief doet werk dat de inputprijs niet doet. Dat komt doordat het gemengde tarief naar output toe gewogen is, en output is waar de twee modellen het sterkst uiteenlopen. Claude Opus 5 rekent 9,3 keer het outputtarief van Step 5 Preview, en beide modellen schrijven heel wat: 140M outputtokens voor Claude Opus 5 tegen een mediaan van 92M over de modellen die de index scoort, en 160M voor Step 5 Preview tegen dezelfde mediaan van 92M.
Dus de eerlijke lezing is beperkter dan "het goedkope model is een koopje." Step 5 Preview is goedkoper op elk vlak, en het is geen zuinig model — het schrijft 74% meer uitvoer dan het mediane model waartegen het wordt afgemeten, wat precies het gedrag is dat de prijs wordt geacht te bestraffen. Claude Opus 5 schrijft 52% meer dan de mediaan en rekent 9,3 keer zoveel voor elk van die tokens. Een aanroeper die de uitvoerlengte beperkt, krijgt een andere verhouding dan een die dat niet doet.
De vraag is niet wat beter is. Het is waar het omslagpunt ligt.
Stel dat de index een redelijke proxy is voor het werk dat je daadwerkelijk uitstuurt — langetermijn-agenttaken, code, meerstaps toolgebruik. Dan is het omslagpunt eenvoudig te formuleren: Claude Opus 5 moet per taak minstens 7,9 keer nuttiger zijn voordat het zijn prijs waard is, en op de index is het 7 punten beter op een schaal van 100. Die twee feiten hoeven niet dezelfde kant op te wijzen, want een indexverschil van 7 punten betekent niet dat het 16% beter is in alles. Het is het samengestelde resultaat van tien evaluaties, en de samenstelling is belangrijker dan het totaal.
Dat is het argument om je druk te maken om de vorm van de twee scores in plaats van om het hoofcijfer. De Terminal-Bench 4.0-score van Step 5 Preview is 33,3% — een echt agentisch resultaat, voor op DeepSeek V4.1 Flash met 26,8% — maar niets in de gepubliceerde gegevens laat tot nu toe zien dat het Claude Opus 5 evenaart op de langetermijnevaluaties waarin het model van Anthropic het sterkst is. StepFuns eigen materiaal geeft dit toe in de formulering: op ALE-CLI, FrontierFinance en DRACO plaatst het bedrijf Step 5 Preview op de tweede plaats, achter hetzij GPT-6 Astra, hetzij Claude Opus 5, en voor op de andere open modellen in de vergelijking. Een tweede plaats voor een vijfde van de prijs is een echt goed resultaat. Het is ook niet de eerste plaats, en de taken waarin een model als tweede eindigt, zijn meestal juist de taken waar een eerste plaats nodig was.
De andere asymmetrie is wat er gebeurt bij een slechte aanroep. Een fout antwoord van een goedkoop model dat vier seconden en 2.000 tokens vergde, kost je de nieuwe poging; hetzelfde foute antwoord van Claude Opus 5 tegen 25 dollar per miljoen outputtokens kost je de nieuwe poging plus de deliberatie. Als je pipeline bij een fout opnieuw probeert — de meeste agentlussen doen dat — is de effectieve kostenpost per succesvolle taak het getal dat ertoe doet, en dat is niet dezelfde verhouding als de lijstprijs, omdat de twee modellen niet even vaak zullen falen. Niemand heeft dat getal nog voor Step 5 Preview gepubliceerd.

Het specificatiecontrast, dimensie voor dimensie
• Indexscore — Step 5 Preview 44 vs Claude Opus 5 51, beide op Intelligence Index v4.3.2, Claude Opus 5 met zijn maximale instelling voor redeneerinspanning
• Prijs per 1M tokens — Step 5 Preview $ 1,00 in / $ 2,70 uit vs Claude Opus 5 $ 5,00 in / $ 25,00 uit
• Cachekorting — Step 5 Preview 95% vs Claude Opus 5 90%
• Context — beide 1M tokens; StepFun heeft geen uitvoerplafond gepubliceerd en dat van Anthropic is 128K
• Invoer — beide accepteren tekst en afbeeldingen; beide leveren alleen tekst op
• Uitvoersnelheid — Step 5 Preview 99,8 tokens/sec vs. Claude Opus 5 55,3 tokens/sec
• Bedieningsoppervlak — Step 5 Preview biedt uitgebreid redeneren; Claude Opus 5 vervangt temperature en top_p door een adaptieve regelaar voor redeneerinspanning
• Gewichten — Step 5 Preview vandaag gesloten, BF16-checkpoint gepland voor 15 oktober; Claude Opus 5 volledig propriëtair
• Onafhankelijk bewijs — beide gescoord door Artificial Analysis; de agentische benchmarkrijen van StepFun zijn door de leverancier uitgevoerd en niet gereproduceerd
Twee rijen verdienen een toelichting. Het snelheidsverschil is reëel en in de praktijk groter dan de tabel suggereert: 99,8 tokens per seconde tegenover 55,3 betekent een model dat op dezelfde uitvoer ruwweg twee keer zo snel klaar is, en de tijd tot het eerste token van Step 5 Preview van 2,96 seconden tegenover 56,84 seconden van Claude Opus 5 op hetzelfde scorebord is iets van een heel andere orde — al meet dat tweede cijfer de redeneerconfiguratie met maximale inspanning, waarbij het model beraadslaagt voordat het iets uitstuurt. Het is niet de latentie die een productieaanroep te zien krijgt. Tegenover het standaardeindpunt meldt onze eigen catalogus een p50-tijd tot het eerste token van 6,73 seconden voor Claude Opus 5, en dat is het getal waarop je moet rekenen als je niet bewust om maximale beraadslaging vraagt.
De rij met cachekorting is degene die stilzwijgend herhaalde workloads bepaalt, en die begunstigt Step 5 Preview, 95% tegen 90%. Een agentlus die bij elke aanroep dezelfde systeemprompt en repositorycontext opnieuw verstuurt, leeft bijna volledig van die korting, waardoor een verschil van vijf punten zich gedurende een lange sessie opstapelt.

Waar Claude Opus 5 nog steeds het enige antwoord is
Niets hierboven pleit tegen het model van Anthropic. Het kost wat het kost omdat het doet wat de index probeert te meten, en het doet dat bijna aan de top van de ranglijst — 51 op Intelligence Index v4.3.2, zeven punten voorsprong op Step 5 Preview en binnen bereik van de koplopers van de huidige generatie. De workloads waarin een geaggregeerde kloof van 7 punten het werkelijke verschil onderschat, zijn juist de gevallen waarin geen ruimte is voor een antwoord dat niet het beste is: een refactor van meerdere uren waarin de faalmodus een subtiele gedragsverandering is, een financieel model waarin de redeneerketen auditeerbaar moet zijn, een migratie waarin een verkeerde beslissing een week later wordt ontdekt. In die gevallen is de retry niet goedkoop en is de deliberatie het product.
De workloads waarbij het verschil er niet toe doet, zijn de taken die zijn opgebouwd uit talloze kleine beslissingen: classificatie- en routeringsstappen, extractie, samenvatting, testscaffolding, de duizend calls die een agent doet tussen de twee calls die er echt toe doen. Daarbij is een model met een score van 44 dat in de helft van de tijd antwoordt tegen een vijfde van de inputprijs geen compromis. Het is de juiste standaardkeuze, waarbij het dure model wordt gereserveerd voor de stap die goed moet zijn.
De split uitvoeren zonder twee integraties uit te voeren
De praktische versie van deze vergelijking is een getrapte pijplijn, en de reden dat teams er geen bouwen is inkoop en niet techniek — twee leveranciers, twee contracten, twee SDK's, twee sleutels om te roteren. Claude Opus 5 staat in onze catalogus voor $5,00 en $25,00, en de goedkopere tekstmodellen die je ervoor zou zetten staan in dezelfde catalogus, allemaal achter één sleutel voor meer dan 200 modellen, met de lijstprijs van de provider doorgegeven tegen 0% opslag. Step 5 Preview staat niet op die lijst — het draait op StepFuns eigen API, en totdat de gewichten er zijn is dat de enige plek waar het draait. Het opzetten van de gelaagdheid over de modellen die wij wél routeren is een routing-DSL-expressie in plaats van een codewijziging — stuur de routineaanroepen naar het kleine model, escaleer naar het dure model op een betrouwbaarheids- of complexiteitsvoorwaarde, en houd beide benen achter hetzelfde endpoint.
Automatische failover is hier om een specifieke reden van belang, en niet als een generieke functie. Step 5 Preview opende zijn API op de dag van de aankondiging, zonder gepubliceerde gewichten en zonder een bekendgemaakte servervloot; het is een preview-endpoint van een paar dagen oud, en preview-endpoints zijn qua capaciteit beperkt op een manier waarop volwassen endpoints dat niet zijn. Claude Opus 5 wordt aangeboden door veel onafhankelijke providers, en dat is de redundantie die een preview niet kan bieden. Een bewezen model als terugvalpoot aanhouden — aan onze kant betekent dat een productiemodel uit de catalogus, niet de preview — is hoe je een echt kwaliteitssignaal krijgt op je eigen workload zonder dat je productiepad afhankelijk wordt van een vloot die nog wordt gedimensioneerd.

De beslissingsregel
Als je workload bestaat uit een klein aantal zeer moeilijke taken, is Claude Opus 5 niet de dure optie — het is de goedkope optie, omdat het op een na beste antwoord meer kost dan het verschil. Als je workload bestaat uit een groot aantal gewone taken met daarin een klein aantal moeilijke, dan is Step 5 Preview tegen $1,00 en $2,70 met 95% cachekorting de betere standaardkeuze, en het verschil van 7 punten is grotendeels een afrondingsfout bij werk dat het niet nodig had.
Wat die berekening zou veranderen, is onafhankelijk bewijs over faalpercentages en over de rijen voor langetermijn-agentische taken. StepFuns eigen cijfers zetten het model op de tweede plaats in de evaluaties waarop het zijn lancering baseerde, en geen enkele derde partij heeft die gereproduceerd. Houd het checkpoint van 15 oktober in de gaten voor twee dingen: of de licentie de fine-tuning toestaat waarmee je een gat van 7 punten op je eigen data kunt dichten, en of de breedsprakigheid aanhoudt zodra het achtervoegsel 'preview' verdwijnt. Het eerste zou de verhouding veranderen; het tweede heeft die al eens verschoven.
