Gegenereerde titelkaart voor Step 5 Preview met de tekst 'Step 5 Preview — het lek tot nu toe', met zes specificaties als rijen met label en waarde: totaal aantal parameters ongeveer 600B, geactiveerd per inferentie ongeveer 27B, invoer tekst en afbeelding, contextvenster 1M tokens, AA Intelligence Index 44, en prijs $1,00 in en $2,70 uit per 1M tokens. Een voettekst luidt: 'Alle cijfers zijn van derden en niet gecontroleerd - StepFun heeft dit model niet aangekondigd.' Het OrcaRouter-logo staat in de rechteronderhoek.
Guides & Insights

Step 5 Preview: Het onaangekondigde 600B-vlaggenschip van StepFun staat al op de ranglijst

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Step 5 Preview heeft een positie op de ranglijst, een gepubliceerde prijs, een gemeten uitvoersnelheid en een Intelligence Index-score van 44 — dezelfde score als Kimi K3, een model dat ongeveer vijf keer zo groot is. Wat het niet heeft, is een lancering. StepFun heeft het niet aangekondigd, de eigen platformdocumentatie van StepFun vermeldt het niet, en er zijn geen gewichten om te downloaden. Elk cijfer hieronder komt van een derde partij die toegang kreeg voordat de leverancier iets openbaar zei, waardoor dit een stuk is over wat we tot nu toe weten, in plaats van een review. Lees de cijfers als bewijs van wat eraan komt, niet als een specificatieblad.

Het lek is het verhaal

Het eerste publieke spoor van Step 5 Preview is een evaluatierun. Artificial Analysis heeft er een live modelpagina voor, gescoord via StepFun's eigen API onder de testtag step-5-preview-b, waarbij het platform het model dateert op 18 september 2026. Die pagina is de bron van de 44, de prijsstelling, de snelheidsmeting en de benchmarkrijen in dit artikel.

Daarentegen is de leverancierszijde leeg. De documentatie voor ontwikkelaars van StepFun vermeldt modellen tot Step 3.7 Flash en Step 3.5 Flash en stopt — geen step-5, geen preview-vermelding. De Hugging Face-organisatie stepfun-ai heeft geen Step 5-repository, wat past bij een vlaggenschip met gesloten gewichten in plaats van bij een omissie. Meldingen uit de community op Chinese ontwikkelaarsforums wijzen op een mogelijke onthulling tijdens het AGI Frontier-evenement in Shanghai op 19 september, wat ongeveer een dag zou zijn nadat de evaluaties naar buiten kwamen. Op het moment van schrijven heeft niemand buiten StepFun een officiële specificatie, een officiële prijs of een officiële naam voor de uit te leveren versie.

De naamgeving zelf is de eerste aanwijzing dat dit een preview is en geen lancering. StepFun sloeg de Step 4.x-lijn volledig over en ging naar Step 5. Een model dat onder een Preview-suffix wordt uitgebracht, en dat wordt gebenchmarkt voordat het een productpagina heeft, is een model dat de leverancier nog aan het kalibreren is — prijzen, routering en limieten kunnen allemaal nog veranderen voordat het algemeen beschikbaar is.

Hoe de specificatie eruitziet, voor zover iemand kan nagaan

Dit zijn de cijfers die circuleren, en het zijn de meest herhaalde beweringen van het lek — wat niet hetzelfde is als de meest bevestigde ervan:

• Totaal aantal parameters — ongeveer 600B, tegenover ongeveer 2,8T voor Kimi K3

• Geactiveerd per inferentie — ongeveer 27B, ruwweg 4,5% van het totaal, een ongewoon ijle mixture-of-experts-verhouding

• Invoermodaliteiten — tekst en afbeeldingen; uitvoer is alleen tekst

• Redeneren — ja, met uitgebreid nadenken

• Contextvenster — 1M tokens op Artificial Analysis; een afzonderlijke configuratie van een derde partij die in ontwikkelaarstools circuleert, vermeldt 350.000 met een maximale uitvoer van 64.000

• Gewichtsbeschikbaarheid — gesloten, geen repository

Die tegenstrijdigheid rond het contextvenster is het waard om ronduit te signaleren, want niemand heeft die opgelost. Een venster van 1M tokens en een venster van 350k tokens zijn verschillende producten met verschillende geheugenkosten, en het tweede cijfer gaat gepaard met een outputlimiet van 64k waarover het eerste niets zegt. Als je van plan bent een pipeline voor lange documenten op te zetten op basis van het 1M-getal, is de 350k-configuratie de reden om te wachten op een leverancierspagina. De parameteraantallen hebben een vergelijkbare onzekerheid: de tracker van DataLearner registreert de MoE-architectuur en parameteraantallen voor Step 5 Preview nog steeds als niet beschikbaar, wat betekent dat het 600B/27B-paar — het meest geciteerde feit over dit model — ook een van de minst officieel bevestigde is.

Het interessante getal is 27B, niet 600B

Sparse mixture-of-experts-modellen besteden alleen rekenkracht aan de experts waarnaar een token daadwerkelijk wordt gerouteerd, dus het geactiveerde aantal is het getal dat bepaalt hoe het model zich in productie gedraagt. Met ongeveer 27B actief verricht Step 5 Preview per token werk in dezelfde orde van grootte als modellen die een fractie van zijn omvang hebben, terwijl het totaal van 600B grotendeels een kwestie van geheugenbeslag is.

Hieruit volgen twee consequenties, en beide zijn zichtbaar in de metingen van derden. De serveerkosten hangen samen met de geactiveerde parameters, wat deels verklaart waarom de prijs is zoals die is. En de snelheid per token profiteert ook: Artificial Analysis meet 99,8 outputtokens per seconde, goed voor een 42e plaats van de 200 modellen, tegen een mediaan van 64,6. De tijd tot het eerste token bedraagt 2,96 seconden tegen een mediaan van ongeveer 3,57 seconden. Als de 600B/27B-verdeling klopt, is dit een model dat ontworpen is om goedkoop te serveren in plaats van goedkoop te hosten — een belangrijk onderscheid als jij degene bent die voor de GPU's betaalt in plaats van voor de tokens.

Waar het belandt op de Intelligence Index

Artificial Analysis scoort Step 5 Preview met 44 op Intelligence Index v4.3, die tien evaluaties omvat. Dat is de 25e van de 200 modellen op de ranglijst en ruim boven het mediane model dat de index scoort, dat op 25 staat.

• Intelligentie-index — Step 5 Preview 44 vs Kimi K3 44

• Direct boven — GLM-5.3 en Claude Opus 5, beide op 45

• Direct daaronder — DeepSeek V4.1 Flash met 40 en DeepSeek V4 Pro met 36

• Terminal-Bench 4.0 — Step 5 Preview 33,3% tegen Kimi K3 op ongeveer 12,6%, en tegen DeepSeek V4.1 Flash op 26,8%

• SciCode — 59% voor Step 5 Preview, op hetzelfde niveau als Kimi K3

• Uitvoersnelheid — 99,8 tokens per seconde versus een mediaan van 64,6 in het veld

De kop is het gelijkspel met Kimi K3, en de eerlijke lezing is nauwer dan de koppen doen vermoeden. Een model met 2,8 biljoen parameters evenaren op een geaggregeerde index met in totaal 600 miljard is een echt efficiëntieresultaat, maar de aggregatie verbergt de vorm ervan: het verschil op Terminal-Bench 4.0 in het voordeel van Step 5 Preview is dramatisch, terwijl het SciCode-resultaat een exacte gelijkstand is. Geaggregeerde pariteit op één index is geen pariteit overal, en een preview-build is het minst betrouwbare moment om aan te nemen dat de verschillen standhouden.

Nog een discrepantie die het vermelden waard is: Artificial Analysis rapporteert 44, terwijl de onafhankelijke tracker van DataLearner dezelfde run op 43,6 registreert. Dat is een afrondingsverschil in plaats van een meningsverschil over de capaciteiten, maar het is wel het soort ding dat de algemene strekking over de cijfers van dit model onderstreept — het zijn metingen door derden van een niet-aangekondigd model, uitgevoerd op enigszins verschillende momenten, en geen ervan is door StepFun bevestigd. Geen van deze benchmarks is door de leverancier gerapporteerd, wat aan twee kanten snijdt: niemand bij StepFun heeft hier een cijfer geclaimd, en niemand bij StepFun heeft er ook maar een onderschreven.

Screenshot of the Artificial Analysis model page for Step 5 Preview, headed 'Step 5 Preview Intelligence, Performance & Price Analysis', showing StepFun as the creator, a release date of September 2026, an Intelligence Index of 44 at rank 25 of 200, an output speed of 99.8 tokens per second at rank 42 of 200, input pricing of $1.00 and output pricing of $2.70 per million tokens with a 95% cache discount, $0.71 per Intelligence Index task, verbosity of 160M output tokens, and technical specifications listing reasoning as supported, input modality as text plus image, and a 1M token context window.

De prijs, en de breedsprakigheid die daaraan knaagt

Prijzen zijn het onderdeel van dit lek dat het snelst een budget zal beïnvloeden. Via de API van StepFun noteert Artificial Analysis het volgende:

• Input — $1,00 per miljoen tokens, tegenover een mediaan van $1,88 voor vergelijkbare modellen

• Uitvoer — $2,70 per miljoen tokens, tegen een mediaan van $10,00

• Cache — een cachekorting van 95%, waardoor cachehits op ongeveer $0,05 per miljoen tokens uitkomen

• Gemengd — ongeveer $0,51 per miljoen tokens bij een 7:2:1-verhouding van cachehits tot input tot output

• Kosten per Intelligence Index-taak — $ 0,71

• Kosten van een volledige index-run — in totaal $918,34

Output tegen $2,70 is de regel die er het meest toe doet, want het is minder dan een vijfde van wat Kimi K3 rekent voor dezelfde miljoen tokens tegen $15,00. Maar er is een addertje onder het gras dat een vergelijking per token verbergt, en Artificial Analysis meet het direct: verbositeit. Step 5 Preview genereerde 160M outputtokens om de Intelligence Index te voltooien, tegenover een mediaan van 90M voor het veld en een rang van 65e van 200 op die maatstaf.

Reken dat eens door. Bij $2,70 per miljoen kosten 160 miljoen outputtokens ongeveer $432 — ongeveer de helft van de totale kosten van $918,34 voor de hele indexrun, besteed aan de breedsprakigheid van het model zelf in plaats van aan de taken. Laat dezelfde 160 miljoen tokens door het outputtarief van $15,00 van Kimi K3 gaan en je zit op $2.400, en daar komt het prijsvoordeel vandaan. Maar de praktische waarschuwing is voor iedereen die kosten schat door een tokentelling van een ander model over te nemen: Step 5 Preview schrijft ongeveer 1,8 keer zoveel als de mediaan, dus een outputzware workload krijgt tegelijkertijd het goedkopere tarief en meer tokens. De korting blijft bestaan, maar is kleiner dan $1,00/$2,70 tegenover $3,00/$15,00 doet lijken, en de grootte ervan hangt volledig af van hoe breedsprakig je prompts het model maken.

De cachekorting van 95% is de andere hefboom, en die is ongewoon agressief. Een workload met intensief hergebruik van prompts — een lange systeemprompt, een vast document, een gedeelde codebase — komt veel dichter bij het gemengde tarief van $0,51 dan bij het invoertarief van $1,00. Dat gemengde cijfer gaat uit van een verhouding van 7:2:1, wat een modelaanname is en geen garantie, maar het is de juiste vorm van rekenwerk om op je eigen verkeer los te laten.

A generated two-column comparison scoreboard titled 'Step 5 Preview vs Kimi K3 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, total params about 600B, active params about 27B, Terminal-Bench 4.0 33.3%, SciCode 59%, and price $1.00 / $2.70. The right column gives Kimi K3 the rows AA Index 44, total params about 2.8T, active params not disclosed, Terminal-Bench 4.0 about 12.6%, SciCode 59%, and price $3.00 / $15.00. A footer reads 'Step 5 Preview figures third-party via Artificial Analysis and unaudited; Kimi K3 figures per Artificial Analysis. Prices per 1M tokens.' The OrcaRouter logo sits in the bottom-right corner.

Waar vroege testers tegenaan lopen

Dit zijn individuele rapporten van ontwikkelaarsforums en sociale berichten in de dagen rond het lek, geen metingen, en ze moeten dienovereenkomstig worden gewogen:

• Het aanroepen van tools is de meest voorkomende klacht — verkeerde toolnamen geselecteerd, en er werden bewerkingen geprobeerd zonder eerst het doelbestand te lezen

• Fouten gemeld voorbij ongeveer 340.000 tokens aan context, wat de faalmodus is om in de gaten te houden als het 1M-venster het werkelijke getal blijkt te zijn

• Inhoudsfiltering die de uitvoer afkapt bij sommige prompts

• Indrukken over capaciteiten lopen uiteen: sommige testers plaatsen het boven GLM-5.3 Flash, anderen plaatsen het onder DeepSeek V4.1 Flash

Een niet-uitgebrachte preview-build die faalt bij het gebruik van tools is geen schandaal — daar is het preview-label voor bedoeld. Maar het betekent wel dat de 44 niet gelezen moet worden als een belofte over agentische betrouwbaarheid, omdat de Intelligence Index niet test waar de vroege testers het meest over klagen.

Hoe je het eigenlijk zou noemen — en wat je in de tussentijd kunt gebruiken

OrcaRouter routeert Step 5 Preview niet. Er is geen publiek endpoint en geen weights, dus er valt niets te routeren, en geen enkel platform van derden kan op dit moment eerlijk het tegenovergestelde beweren. Iedereen die je vandaag vertelt waar je het kunt aanroepen, beschrijft een evaluatie-endpoint, geen product.

De modellen waarmee het wordt vergeleken, zijn een ander verhaal. Kimi K3, GLM-5.3 en DeepSeek V4.1 Flash zijn allemaal beschikbaar via OrcaRouter, naast 199 modellen van 15 providers achter één API-sleutel en één factuur. Prijzen worden tegen de listprijs van de provider doorgegeven, met 0% opslag, wat bij een model als dit meer dan gebruikelijk van belang is: als de $1,00/$2,70 van Step 5 Preview bij de lancering standhoudt en daarna verandert, beweegt een pass-through-route dezelfde dag mee, in plaats van volgens het prijsaanpassingsschema van iemand anders.

Wanneer het eenmaal aanroepbaar wordt, is de verstandige manier om een model dat aan een nog niet uitgebracht model grenst te draaien, de manier waarop je elk model zou draaien dat je nog niet vertrouwt: achter een route met automatische failover, zodat een fout bij het aanroepen van een tool of een fout met een lange context doorschakelt naar een model dat werkt, in plaats van je applicatie mee naar beneden te halen. Dat is het patroon waar de vroege rapporten hier specifiek voor pleiten: een preview-build met gemelde problemen bij het aanroepen van tools en fouten met lange context is precies het model waar je een fallback achter wilt, niet een die je op zichzelf op een productiepad wilt.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models showing 199 models from 15 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a 'How to call any model' card showing a POST request to the OrcaRouter chat completions endpoint.

Wat zou ervoor zorgen dat dit van een lek een release wordt?

Drie dingen om in de gaten te houden, in volgorde van hoeveel ze zouden beslechten. Ten eerste, een modelpagina en prijsstelling op het eigen developerplatform van StepFun — op het moment dat step-5 in de modellenlijst verschijnt, vervangt de specificatiesheet van de leverancier elke interpretatie door derden in dit artikel, inclusief het 600B/27B-paar en de 1M-contextclaim. Ten tweede, de oplossing van de tegenstrijdigheid tussen 1M- en 350k-context; een uitvoerlimiet van 64k onder een 1M-venster is een wezenlijk verschil voor iedereen die long-document- of agentic-pipelines bouwt, en het is momenteel onopgelost. Ten derde, of de prijsstelling een lanceringshouding of een permanente lijn is — preview-prijzen voor Chinese topmodellen zijn in het verleden verschoven zodra de capaciteit krap werd, en $2,70 per miljoen outputtokens is agressief genoeg om die vraag op te roepen.

Totdat op zijn minst de eerste daarvan beschikbaar komt, is de eerlijke samenvatting dat Step 5 Preview een werkelijk efficiënt model lijkt — met in totaal 600B dat geaggregeerd werk van 2,8T-klasse verricht, tegen een prijs die het veld meerdere malen onderbiedt — met een niet-geverifieerde specificatie, een echte breedsprakigheidsheffing, en een reputatie op het gebied van tool-calling die nog niet is verdiend. De moeite waard om rekening mee te houden. Nog niet de moeite waard om er een productiepad op te verwedden.

Vergeleken in dit artikel4

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt