Genererat titelkort för Step 5 Preview med texten 'Step 5 Preview — läckan så här långt', som listar sex specifikationer som etikett-och-värde-rader: totalt antal parametrar cirka 600B, aktiverade per inferens cirka 27B, indata text och bild, kontextfönster 1M tokens, AA Intelligence Index 44, och pris $1.00 in och $2.70 ut per 1M tokens. En sidfot lyder 'Alla siffror är tredjeparts och ogranskade – StepFun har inte annonserat den här modellen.' OrcaRouter-logotypen sitter i nedre högra hörnet.
Guides & Insights

Step 5 Preview: StepFuns oannonserade 600B-flaggskepp finns redan på topplistan

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Step 5 Preview har en placering på topplistan, ett publicerat pris, en uppmätt utdatahastighet och en Intelligence Index-poäng på 44 – samma poäng som Kimi K3, en modell som är ungefär fem gånger så stor. Vad den inte har är en lansering. StepFun har inte tillkännagivit den, StepFuns egen plattformsdokumentation listar den inte, och det finns inga vikter att ladda ner. Varje siffra nedan kommer från en tredje part som fick tillgång innan leverantören hade sagt något offentligt, vilket gör detta till en artikel om vad vi vet så här långt snarare än en recension. Läs siffrorna som bevis för vad som är på väg, inte som ett specifikationsblad.

Läckan är nyheten

Det första offentliga spåret av Step 5 Preview är en utvärderingskörning. Artificial Analysis har en live-modellsida för den, poängsatt genom StepFuns eget API under testtaggen step-5-preview-b, där plattformen daterar modellen till den 18 september 2026. Det är från den sidan som 44:an, prissättningen, hastighetsmätningen och benchmark-raderna i den här artikeln kommer.

I kontrast till detta är leverantörssidan tom. StepFuns utvecklardokumentation listar modeller upp till Step 3.7 Flash och Step 3.5 Flash och stannar där – inget step-5, ingen post för förhandsversion. Stepfun-ais Hugging Face-organisation har inget Step 5-arkiv, vilket stämmer med ett flaggskepp med stängda vikter snarare än ett förbiseende. Communityrapporter på kinesiska utvecklarforum pekar på en möjlig avtäckning vid AGI Frontier-evenemanget i Shanghai den 19 september, vilket skulle vara ungefär en dag efter att utvärderingarna dök upp. I skrivande stund har ingen utanför StepFun en officiell specifikation, ett officiellt pris eller ett officiellt namn för den version som släpps.

Namngivningen i sig är den första ledtråden till att detta är en förhandsvisning och inte en lansering. StepFun hoppade helt över Step 4.x-serien och gick direkt till Step 5. En modell som släpps med suffixet Preview, och som benchmarkas innan den ens har en produktsida, är en modell som leverantören fortfarande kalibrerar – prissättning, routning och gränser kan alla ändras före den allmänna tillgängligheten.

Hur specifikationen ser ut, så vitt någon kan bedöma

Det här är siffrorna som cirkulerar, och de är läckans mest upprepade påståenden — vilket inte är samma sak som dess mest bekräftade:

• Totalt antal parametrar — omkring 600B, mot cirka 2,8T för Kimi K3

• Aktiverade per inferens – cirka 27B, ungefär 4,5 % av det totala, en ovanligt gles mixture-of-experts-kvot

• Indatamodaliteter — text och bilder; utdata är endast text

• Resonemang — ja, med utökat tänkande

• Kontextfönster — 1M tokens på Artificial Analysis; en separat tredjepartskonfiguration som cirkulerar bland utvecklarverktyg listar 350 000 med en maximal utdata på 64 000

• Vikttillgänglighet — stängd, inget arkiv

Den där motsägelsen kring kontextfönstret är värd att påpeka rent ut, eftersom ingen har löst den. Ett fönster på 1M tokens och ett fönster på 350k tokens är olika produkter med olika minneskostnader, och den andra siffran kommer med ett utdatatak på 64k som den första inte säger något om. Om du planerar en pipeline för långa dokument på grundval av 1M-siffran, är 350k-konfigurationen skälet att vänta på en leverantörssida. Parameterantalen har en liknande mjukhet: DataLearners tracker registrerar fortfarande MoE-arkitektur och parameterantal för Step 5 Preview som otillgängliga, vilket innebär att 600B/27B-paret — det enskilt mest citerade faktumet om den här modellen — också är ett av de minst officiellt bekräftade.

Det intressanta talet är 27B, inte 600B

Glesa mixture-of-experts-modeller lägger bara beräkningskraft på de experter som en token faktiskt dirigeras till, så det aktiverade antalet är det som styr hur modellen beter sig i produktion. Med omkring 27B aktiva utför Step 5 Preview arbete per token i samma intervall som modeller en bråkdel av dess storlek, medan 600B totalt till stor del är en fråga om minnesavtryck.

Två konsekvenser följer, och båda syns i tredjepartsmätningarna. Serveringskostnaden följer aktiverade parametrar, vilket är en del av förklaringen till varför priset ligger där det ligger. Och hastigheten per token gynnas också: Artificial Analysis mäter 99,8 utdatatokens per sekund, vilket ger en 42:a plats bland 200 modeller, mot en median på 64,6. Tiden till första token ligger på 2,96 sekunder mot en median på omkring 3,57 sekunder. Om uppdelningen 600B/27B stämmer är detta en modell utformad för att vara billig att serva snarare än billig att hosta – en viktig skillnad om det är du som betalar för GPU:erna snarare än för tokens.

Var den hamnar på Intelligensindexet

Artificial Analysis poängsätter Step 5 Preview till 44 på Intelligence Index v4.3, som omfattar tio utvärderingar. Det är 25:e av 200 modeller på listan och väl över medianmodellen som indexet poängsätter, vilken ligger på 25.

• Intelligensindex — Step 5 Preview 44 vs Kimi K3 44

• Direkt ovanför — GLM-5.3 och Claude Opus 5, båda på 45

• Direkt nedanför — DeepSeek V4.1 Flash på 40 och DeepSeek V4 Pro på 36

• Terminal-Bench 4.0 — Step 5 Preview 33,3 % mot Kimi K3 på ungefär 12,6 %, och mot DeepSeek V4.1 Flash på 26,8 %

• SciCode — 59 % för Step 5 Preview, i nivå med Kimi K3

• Utdatahastighet — 99,8 tokens per sekund jämfört med en fältmedian på 64,6

Rubriken är dött lopp med Kimi K3, och den ärliga tolkningen är snävare än rubrikerna antyder. Att matcha en modell med 2,8 T parametrar på ett aggregerat index vid totalt 600 B är ett verkligt effektivitetsresultat, men aggregatet döljer dess form: gapet i Terminal-Bench 4.0 som gynnar Step 5 Preview är dramatiskt, medan SciCode-resultatet är ett dött lopp. Aggregerad paritet på ett index är inte paritet överallt, och en förhandsversion är det minst tillförlitliga tillfället att anta att gapen kommer att hålla.

Ännu en diskrepans värd att nämna: Artificial Analysis rapporterar 44, medan DataLearners oberoende tracker registrerar samma körning som 43,6. Det är en avrundningsskillnad snarare än en oenighet om förmåga, men det är den typ av sak som understryker poängen med den här modellens siffror i allmänhet – de är tredjepartsavläsningar av en icke tillkännagiven modell, tagna vid något olika tidpunkter, och ingen av dem har bekräftats av StepFun. Ingen av dessa benchmarks är leverantörsrapporterade, vilket kan slå åt båda hållen: ingen hos StepFun har hävdat en siffra här, och ingen hos StepFun har heller stått bakom en.

Screenshot of the Artificial Analysis model page for Step 5 Preview, headed 'Step 5 Preview Intelligence, Performance & Price Analysis', showing StepFun as the creator, a release date of September 2026, an Intelligence Index of 44 at rank 25 of 200, an output speed of 99.8 tokens per second at rank 42 of 200, input pricing of $1.00 and output pricing of $2.70 per million tokens with a 95% cache discount, $0.71 per Intelligence Index task, verbosity of 160M output tokens, and technical specifications listing reasoning as supported, input modality as text plus image, and a 1M token context window.

Priset, och den mångordighet som tär på det

Prissättningen är den del av den här läckan som snabbast kommer att påverka en budget. Via StepFuns API registrerar Artificial Analysis följande:

• Indata — 1,00 USD per miljon tokens, jämfört med en median på 1,88 USD för jämförbara modeller

• Utdata – 2,70 USD per miljon tokens, jämfört med en median på 10,00 USD

• Cache — en cacheringsrabatt på 95 %, vilket ger cacheträffar på ungefär 0,05 USD per miljon tokens

• Blandat — cirka $0,51 per miljon tokens vid en fördelning på 7:2:1 mellan cacheträffar, indata och utdata

• Kostnad per Intelligence Index-uppgift — $0,71

• Kostnad för en fullständig indexkörning – 918,34 USD totalt

Utdata för $2.70 är den rad som betyder mest, eftersom den är mindre än en femtedel av vad Kimi K3 tar för samma miljon tokens till $15.00. Men det finns en hake som en jämförelse per token döljer, och Artificial Analysis mäter den direkt: mångordighet. Step 5 Preview genererade 160M utdatatokens för att slutföra Intelligence Index, mot en median på 90M för fältet och en placering som 65:e av 200 i det måttet.

Räkna igenom det. Med $2,70 per miljon kostar 160 miljoner utdatatoken omkring $432 – ungefär hälften av den totala kostnaden på $918,34 för hela indexkörningen, som gick till modellens egen ordrikedom i stället för till uppgifterna. Kör samma 160 miljoner token genom Kimi K3:s utdatapris på $15,00 och du landar på $2 400, vilket är där prisfördelen kommer ifrån. Men den praktiska varningen gäller alla som uppskattar kostnader genom att lyfta ett tokenantal från en annan modell: Step 5 Preview skriver ungefär 1,8 gånger medianen, så en utdatatung arbetsbelastning får både den billigare taxan och fler token samtidigt. Rabatten består, men den är mindre än vad $1,00/$2,70 mot $3,00/$15,00 får den att se ut som, och hur stor den är beror helt på hur pratsam modellen blir av dina prompter.

95-procentrabatten för cache är den andra hävstången, och den är ovanligt aggressiv. En arbetsbelastning med omfattande återanvändning av prompter – en lång systemprompt, ett fast dokument, en delad kodbas – hamnar mycket närmare det blandade priset $0.51 än indatapriset $1.00. Den blandade siffran förutsätter ett förhållande på 7:2:1, vilket är ett modellantagande snarare än en garanti, men det är rätt sorts aritmetik att köra mot din egen trafik.

A generated two-column comparison scoreboard titled 'Step 5 Preview vs Kimi K3 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, total params about 600B, active params about 27B, Terminal-Bench 4.0 33.3%, SciCode 59%, and price $1.00 / $2.70. The right column gives Kimi K3 the rows AA Index 44, total params about 2.8T, active params not disclosed, Terminal-Bench 4.0 about 12.6%, SciCode 59%, and price $3.00 / $15.00. A footer reads 'Step 5 Preview figures third-party via Artificial Analysis and unaudited; Kimi K3 figures per Artificial Analysis. Prices per 1M tokens.' The OrcaRouter logo sits in the bottom-right corner.

Vad tidiga testare stöter på

Dessa är enskilda rapporter från utvecklarforum och inlägg i sociala medier dagarna kring läckan, inte mätningar, och de bör viktas därefter:

• Verktygsanrop är det vanligaste klagomålet — fel verktygsnamn väljs, och redigeringar försöks utan att först ha läst målfilen

• Fel som rapporteras bortom ungefär 340 000 token i kontext, vilket är det felbeteende man bör se upp med om 1M-fönstret visar sig vara den verkliga siffran

• Innehållsfiltrering avkortar utdata för vissa prompter

• Uppfattningarna om kapaciteten går isär: vissa testare sätter den över GLM-5.3 Flash, andra placerar den under DeepSeek V4.1 Flash

En ej släppt förhandsversion som misslyckas med verktygsanvändning är inte en skandal — det är vad förhandsversionsmärkningen är till för. Men det betyder att 44 inte bör läsas som ett löfte om agentisk tillförlitlighet, eftersom Intelligence Index inte testar det som de tidiga testarna klagar mest på.

Vad du faktiskt skulle kalla det — och vad du kan använda under tiden

OrcaRouter dirigerar inte Step 5 Preview. Det finns ingen publik endpoint och inga vikter, så det finns inget att dirigera, och ingen tredjepartsplattform kan ärligt påstå något annat ännu. Den som säger till dig var du kan anropa den i dag beskriver en utvärderingsendpoint, inte en produkt.

De modeller som den mäts mot är en annan historia. Kimi K3, GLM-5.3 och DeepSeek V4.1 Flash är alla tillgängliga via OrcaRouter, tillsammans med 199 modeller från 15 leverantörer bakom en enda API-nyckel och en enda faktura. Prissättningen förs vidare till leverantörens listpris med 0 % påslag, vilket spelar större roll än vanligt för en modell som den här: om Step 5 Previews $1.00/$2.70 ligger kvar vid lanseringen och sedan ändras, ändras en pass-through-väg samma dag i stället för enligt någon annans omprissättningsschema.

När den väl blir anropbar är det förnuftiga sättet att köra en modell som ännu inte släppts men ligger nära ett släpp detsamma som du skulle köra vilken modell som helst som du ännu inte litar på – bakom en rutt med automatisk failover, så att ett fel i ett verktygsanrop eller ett fel med lång kontext går vidare till en modell som fungerar i stället för att ta ner din applikation med sig. Det är mönstret som de tidiga rapporterna argumenterar för just här: ett förhandsbygge med rapporterade problem med verktygsanrop och långa kontextfel är precis en sådan modell som du vill ha en fallback bakom, inte en du vill ha på en produktionsväg på egen hand.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models showing 199 models from 15 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a 'How to call any model' card showing a POST request to the OrcaRouter chat completions endpoint.

Vad skulle göra att detta går från en läcka till ett släpp?

Tre saker att hålla ögonen på, i ordning efter hur mycket de skulle avgöra. För det första: en modellsida och prissättning på StepFuns egen utvecklarplattform – i samma stund som step-5 dyker upp i modellistan ersätter leverantörens specifikationsblad varje tredjepartsuppgift i den här artikeln, inklusive paret 600B/27B och påståendet om 1M kontext. För det andra: lösningen på kontextmotsägelsen mellan 1M och 350k; ett utdatatak på 64k under ett fönster på 1M är en betydelsefull skillnad för alla som bygger pipelines för långa dokument eller agentiska flöden, och den är för närvarande olöst. För det tredje: huruvida prissättningen är en lanseringshållning eller en permanent linje – förhandsprissättning på kinesiska flaggskeppsmodeller har en historia av att förändras när kapaciteten blir ansträngd, och $2,70 per miljon utdatatoken är tillräckligt aggressivt för att väcka den frågan.

Fram till dess att åtminstone den första av dem har landat är den ärliga sammanfattningen att Step 5 Preview framstår som en verkligt effektiv modell – 600B totalt som utför aggregerat arbete i 2,8T-klass, till ett pris som underbjuder fältet flera gånger om – med en overifierad specifikation, en reell mångordighetskostnad och ett rykte om verktygsanrop som ännu inte har förtjänats. Värt att planera kring. Ännu inte värt att satsa på en produktionsväg.

Jämförda i den här artikeln4

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen