
Step 5 Preview aangekondigd: wat het 600B-vlaggenschip van StepFun daadwerkelijk levert, en wat er nog ontbreekt
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
StepFun heeft Step 5 Preview op 20 september 2026 aangekondigd — een sparse mixture-of-experts-vlaggenschip met 600 miljard parameters, met 27B actieve parameters per token, een contextvenster van 1M tokens, native beeldinvoer en een score van 44 op de Artificial Analysis Intelligence Index. De API ging dezelfde dag open. Wat niet openging, is het model zelf: de Hugging Face-repository stepfun-ai/Step-5-Preview-BF16 was er al tegen de middag van de aankondiging en bevat precies één bestand, .gitattributes, zonder gewichten, zonder licentie, zonder modelkaart en zonder configuratie. StepFuns eigen materialen plaatsen de open-weights-release op 15 oktober 2026. De eerlijke samenvatting in één regel van deze lancering is dus dat het model vandaag aanroepbaar is en over ongeveer drie en een halve week downloadbaar, en dat zijn twee verschillende dingen. Dit is ook hetzelfde model dat deze blog eerder vandaag behandelde als een onaangekondigde leak, gebenchmarkt onder een testtag voordat StepFun een productpagina had gepubliceerd — een nuttige herinnering dat een preview van leak naar lancering kan gaan zonder dat er ook maar één cijfer verandert.
De repo is een placeholder, en dat is het verhaal.
Wanneer een leverancier gewichten publiceert, is de repository het bewijs. Er is een licentiebestand, een config met een parameteraantal erin, een README met het beoogde gebruik en de evaluatietabel, en safetensors-shards waarvan de totale grootte je vertelt of de parameterclaim klopt. stepfun-ai/Step-5-Preview-BF16 heeft niets daarvan. Het Hugging Face API-record ervoor toont een aanmaaktijdstempel van 2026-09-20T03:52Z, nul downloads, twee likes, een leeg config-object, geen pipeline_tag, geen licentie en één enkel zusterbestand. De StepFun-organisatiepagina vermeldt het, en vermeldt geen enkele andere Step 5-repository — geen FP8-build, geen NVFP4-build, geen GGUF, geen van de kwantisatievarianten die Step-3.7-Flash in juni vergezelden.
Lees dat als planning, niet als een mysterie. Het BF16-achtervoegsel in de repositorynaam verraadt het: een lab dat van plan is eerst een bfloat16-checkpoint te publiceren — het formaat waarvan je fine-tunet en kwantiseert, voordat de FP8- en NVFP4-servingbuilds arriveren — noemt de repository zo op het moment dat die wordt aangemaakt en vult die later. StepFun heeft in zijn eigen aankondigingsmateriaal 15 oktober genoemd. Tot dan is de repository een bewering over een intentie, en het enige dat die bewijst, is dat StepFun de naamruimte heeft gereserveerd.
Dit is om een praktische reden belangrijk. Het Preview-achtervoegsel en de ontbrekende gewichten zijn hetzelfde signaal dat dezelfde kant op wijst: het model is aanroepbaar, de prijsstelling staat vast, en het artefact dat je op je eigen hardware zou draaien bestaat nog niet. Elk plan dat uitgaat van een zelfgehoste Step 5 Preview vóór medio oktober is een plan zonder artefact erachter.
Wat er daadwerkelijk werd aangekondigd
De positionering van StepFun is smal en specifiek: Step 5 Preview is een basismodel voor agentisch werk in de praktijk — AI-codering, software-engineering, professioneel kenniswerk en financiën — met de nadruk op lange context, meerbeurtige toolaanroepen en aanhoudende uitvoering in plaats van op chatkwaliteit. Het bedrijf sloeg de Step 4.x-lijn volledig over en ging van Step-3.7-Flash direct naar Step 5, wat op zichzelf een signaal is over hoe groot een stap het dit acht.
Eén detail over de datering is het vermelden waard, want het is precies het soort ding dat een inkoopkalender in de war stuurt: Artificial Analysis dateert dit model op 18 september 2026, twee dagen vóór de eigen aankondiging van StepFun. De ranglijst geeft een model een score zodra die er toegang toe heeft, en dat gat van twee dagen is de gebruikelijke vertraging tussen het moment waarop een model aanroepbaar wordt en het moment waarop een leverancier erover schrijft. De aankondiging van StepFun — 20 september, met de API en Studio die dezelfde dag opengaan — is de datum die je moet aanhalen, en de datum van 15 oktober voor de gewichten komt uit dezelfde materialen.
De specificatie zoals gepubliceerd:
• Totaal aantal parameters — 600B, sparse mixture-of-experts
Actief per token — 27B, ongeveer 4,5% van het totaal, een ongewoon ijle verhouding
• Contextvenster — 1M tokens
• Invoer — tekst en afbeeldingen native; uitvoer is alleen tekst
• Redeneren — ja, met uitgebreid nadenken
• Prijs — $1,00 per miljoen inputtokens, $2,70 per miljoen outputtokens, met 95% korting op caching
• Beschikbaarheid — API en Studio open vanaf 20 september; gewichten gepland voor 15 oktober
De efficiëntieclaim waarmee StepFun vooroploopt, is dat de 600B/27B-opsplitsing het model op de Paretofrontier plaatst — capaciteit per eenheid rekenkracht — en het bedrijf presenteert het als drie generaties van hetzelfde streven, van Step-3.5-Flash via Step-3.7-Flash tot dit. Het is een coherent verhaal, en de sparse ratio is het mechanisme: bij 27B actief liggen de servingkosten per token in de band van een veel kleiner model, terwijl het totaal van 600B vooral een kwestie van geheugenvoetafdruk is.
Beweringen van leveranciers, en de cijfers van derden daarnaast
Er komen twee soorten cijfers voor in het lanceermateriaal, en die moeten niet op dezelfde manier worden gelezen. De eigen evaluaties van StepFun vormen de eerste categorie: een kostenclaim voor één taak van een achtste van Claude Opus 5; een tweede plaats achter ofwel GPT-6 Astra ofwel Claude Opus 5 op ALE-CLI, FrontierFinance en DRACO; een 24 uur durende optimalisatierun voor GPU-kernels die de piekprestaties van de MLA-kernel opvoerde tot 508 TFLOPS, tegenover de 493 van Claude Opus 5; een geautomatiseerd post-trainingexperiment dat Qwen3-30B-A3B van 53,3% naar 60% bracht op AIME24; DeepSWE v1.1 op 67,7% en het interne StepCodeBench op 49,0%. StepFun heeft StepCodeBench zelf gebouwd — 553 code-repositories, negen taaktypen, 33 programmeertalen — wat het een redelijk instrument maakt om zijn eigen model te meten, en geen onafhankelijk instrument.
De tweede klasse wordt door iemand anders gemeten, en dat is het onderdeel waarmee je rekening moet houden bij je planning. Artificial Analysis geeft Step 5 Preview een score van 44 op Intelligence Index v4.3.2, waarmee het op de 24e plaats van 200 modellen staat — gelijk met Kimi K3, één punt achter GLM-5.3, en gelijk aan de medium reasoning-effort-instelling van Claude Opus 5. Op Terminal-Bench 4.0 noteert hetzelfde scorebord 33,3%, voor DeepSeek V4.1 Flash met 26,8% en ruim voor Kimi K3 met ongeveer 12,6%. De outputsnelheid wordt gemeten op 99,8 tokens per seconde en de tijd tot het eerste token op 2,96 seconden — beide uit dezelfde onafhankelijke run, en beide het soort cijfer dat bepaalt of een agent-loop interactief aanvoelt.
Eén cijfer van een derde partij pleit de andere kant op en verdient het om naast de prijs te staan. Dezelfde indexrun gebruikte 160M outputtokens voor Step 5 Preview tegenover een mediaan van 92M over de beoordeelde modellen — het model is breedsprakig. Bij $2,70 per miljoen outputtokens is die breedsprakigheid niet gratis: 160M tokens output is ruwweg $432 van de $922,84 die de run in totaal kostte, en bij een model dat drie keer zoveel rekent, zou het de dominante factuurregel zijn. Een lage headline-prijs en een hoog tokenaantal per taak zijn twee helften van één getal, en de kosten per indextaak — $0,71 — zijn het getal dat beide al bevat.

Wat het lek goed deed, en het enige dat het niet beslechtte
De eerdere berichtgeving van deze blog was gebaseerd op een evaluatierun die opdook vóór enige aankondiging, en markeerde de beweringen die niet konden worden bevestigd. De aankondiging loste de meeste daarvan op. Het 600B/27B-paar is nu door de leverancier opgegeven in plaats van afgeleid. Het contextvenster van 1M tokens staat nu in StepFun's eigen specificatie in plaats van alleen op een forum van een derde partij. De prijs van $1,00 en $2,70 is de prijs. De naam is Step 5 Preview, niet een alternatief waarover geruchten de ronde deden.
Wat de aankondiging niet deed, is de tegenstrijdigheid over het contextvenster oplossen die de berichtgeving over het lek naar boven bracht. Een aparte configuratie van een derde partij die in ontwikkelaarstooling circuleert, vermeldde het model met 350.000 tokens context en een maximale output van 64.000 tokens. Een venster van 1M en een venster van 350k zijn verschillende producten met verschillende geheugenkosten, en een outputplafond van 64k is een harde beperking voor precies het langdurige agentische werk waarvoor dit model wordt verkocht. De aankondiging van StepFun zegt 1M en vermeldt geen outputplafond. Het is de moeite waard om te weten op welke van de twee je routering terechtkomt voordat je een pipeline bouwt die van het antwoord afhankelijk is, en dat is een vraag voor de documentatie van de leverancier, niet voor een leaderboard.
Het andere dat de lancering niet veranderde, is onafhankelijke reproductie. Elke benchmarkrij hierboven die niet van Artificial Analysis afkomstig is, is van StepFun zelf, uitgevoerd op de testharnassen van StepFun, en geen enkele derde partij heeft de agentische resultaten gereproduceerd. Het patroon van dit jaar bij de vlaggenschepen van Chinese AI-laboratoria is dat de geaggregeerde index standhoudt en de uitgelichte rijen van de leverancier afwijken; gebruik de geaggregeerde index als het planningsgetal.
Wat u vandaag kunt bellen, en wat u in de tussentijd kunt routeren.
Step 5 Preview staat niet in onze catalogus, en OrcaRouter routeert het niet — er is een publieke API en een Studio aan StepFuns kant, en daar draait het. Wat we wel hebben, is de set modellen waarmee het wordt vergeleken, achter één sleutel: DeepSeek V4.1 Flash voor $0,15 in en $0,60 out per miljoen, GLM-5.3 voor $1,26 en $3,96 tegen de $1,40 en $4,40 die Z.ai vermeldt, Claude Opus 5 voor $5,00 en $25,00, en Kimi K3 daarnaast. Dat is de praktische vorm van de komende drie weken: een preview om tegen te benchmarken, en een set productiemodellen waar je echt op kunt vertrouwen, bereikbaar via één API voor meer dan 200 modellen, met de lijstprijs van de provider doorgegeven tegen 0% opslag — dus als de prijsstelling van StepFun vóór oktober verandert, beweegt het bedrag dat je betaalt dezelfde dag mee, niet pas bij verlenging.
Automatische failover is in dit venster meer waard dan gewoonlijk, omdat de faalmodus van een preview niet is dat hij slecht is — het is dat hij capaciteitsbeperkt is. Een model dat op de dag van de aankondiging zijn API opende en nog geen weights heeft, is een model waarvan de servingvloot nog wordt gebouwd, en een preview-endpoint dat om 2 uur 's nachts degradeert, sleurt je agent-loop mee. Zet de preview achter een router met een bewezen model als fallback, en je krijgt een kwaliteitssignaal op je eigen workload zonder een productiepad in te zetten op een onbewezen vloot.

De datum die ertoe doet, is 15 oktober.
Alles hierboven is op één specifieke manier voorlopig: de gewichten zijn wat een model permanent maakt. Een gesloten preview voor $1,00 en $2,70 is een goede prijs van één enkele leverancier, en een BF16-checkpoint onder een gepubliceerde licentie is een prijs die geen enkele leverancier nog beheerst. StepFun heeft zich voor 15 oktober aan het tweede verbonden, en de repositorynaam die het al heeft gereserveerd zegt bfloat16 eerst.
Wat je tussen nu en dan in de gaten moet houden, is beperkt en controleerbaar. Loopt de repository vol — en onder welke licentie? Bevestigt een configuratiebestand 600B totaal en 27B actief? Publiceert StepFun het uitvoerplafond samen met het contextvenster, waarmee de 350k/64k-vraag wordt opgelost? Blijft de prijs gelden zodra de preview zijn achtervoegsel verliest? Die vier antwoorden bepalen of Step 5 Preview een model wordt dat je zelf host, een model dat je huurt, of een model dat je één keer benchmarkt en laat liggen. Totdat de repository meer dan een .gitattributes bevat, is de aankondiging het begin van het verhaal en niet het einde ervan.

Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
