Genererat titelkort med titeln ”Step 5 Preview – vad repot säger” som listar sex rader: totalt antal parametrar 600B, aktiverade per token 27B, kontextfönster 1M tokens, indata text och bild, AA Intelligence Index 44 och pris 1,00 USD in / 2,70 USD ut. En sidfot lyder ”StepFun annonserade den 20 september 2026; vikter väntas den 15 oktober 2026. Indexsiffra enligt Artificial Analysis.”
Engineering & Research

Steg 5 Förhandsversionen är tillkännagiven: Vad StepFuns 600B flaggskepp faktiskt levererar, och vad som fortfarande saknas

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

StepFun meddelade Step 5 Preview den 20 september 2026 — ett sparse mixture-of-experts-flaggskepp med 600 miljarder parametrar, varav 27B parametrar aktiva per token, ett kontextfönster på 1M tokens, inbyggd bildinmatning och en poäng på 44 i Artificial Analysis Intelligence Index. API:et öppnades samma dag. Vad som inte öppnades är själva modellen: Hugging Face-repositoriet stepfun-ai/Step-5-Preview-BF16 fanns redan på eftermiddagen samma dag som tillkännagivandet och innehåller exakt en fil, .gitattributes, utan vikter, utan licens, utan modellkort och utan konfiguration. StepFuns egna material anger att släppet med öppna vikter sker den 15 oktober 2026. Så den ärliga sammanfattningen i en rad av denna lansering är att modellen går att anropa idag och går att ladda ner om ungefär tre och en halv vecka, och det är två olika saker. Detta är också samma modell som denna blogg tidigare idag rapporterade om som en otillkännagiven läcka, benchmarkad under en testtagg innan StepFun hade publicerat en produktsida — en påminnelse om att en förhandsversion kan gå från läcka till lansering utan att ett enda nummer ändras.

Repot är en platshållare, och det är hela historien

När en leverantör publicerar vikter är arkivet beviset. Det har en licensfil, en konfiguration med ett parameterantal i sig, en README med det avsedda användningsområdet och utvärderingstabellen, samt safetensors-shards vars totala storlek talar om huruvida parameterpåståendet är verkligt. stepfun-ai/Step-5-Preview-BF16 har inget av det. Hugging Face API-posten för den visar en skapandetidsstämpel på 2026-09-20T03:52Z, noll nedladdningar, två gillningar, ett tomt konfigurationsobjekt, ingen pipeline_tag, ingen licens och en enda syskonfil. StepFuns organisationssida listar den, och listar inget annat Step 5-arkiv — ingen FP8-bygge, ingen NVFP4-bygge, ingen GGUF, inga av de kvantiseringsvarianter som åtföljde Step-3.7-Flash i juni.

Läs det som schemaläggning, inte som ett mysterium. BF16-ändelsen i repots namn är det avslöjande tecknet: ett labb som avser att publicera en bfloat16-checkpoint först – formatet som man finjusterar och kvantiserar utifrån, innan FP8- och NVFP4-byggena för servering kommer – namnger repot på det sättet vid skapandet och fyller det senare. StepFun har angett den 15 oktober i sitt eget annonseringsmaterial. Fram till dess är repot ett anspråk på en avsikt, och det enda det bevisar är att StepFun har reserverat namnrymden.

Detta är viktigt av en praktisk anledning. Preview-suffixet och de saknade vikterna är samma signal som pekar i samma riktning: modellen är anropbar, prissättningen är fastställd, och artefakten du skulle köra på din egen hårdvara finns inte ännu. Varje plan som förutsätter en självhostad Step 5 Preview före mitten av oktober är en plan utan artefakt bakom sig.

Vad tillkännagavs egentligen?

StepFuns inramning är snäv och specifik: Step 5 Preview är en basmodell för agentiskt arbete i verkligheten – AI-kodning, mjukvaruutveckling, professionellt kunskapsarbete och finans – med tonvikt på lång kontext, verktygsanrop över flera turer och uthållig exekvering snarare än på chattkvalitet. Företaget hoppade helt över Step 4.x-serien och gick från Step-3.7-Flash direkt till Step 5, vilket i sig är ett uttalande om hur stort steg företaget anser att detta är.

En dateringsdetalj är värd att påpeka, eftersom det är en sådan sak som trasslar till en inköpskalender: Artificial Analysis daterar den här modellen till den 18 september 2026, två dagar före StepFuns eget tillkännagivande. Nämnden poängsätter en modell när den kan nå den, och den tvådagarsluckan är den vanliga fördröjningen mellan att en modell blir anropbar och att en leverantör skriver om den. StepFuns tillkännagivande – den 20 september, med API:t och Studio som öppnar samma dag – är datumet att hänvisa till, och viktdatumet den 15 oktober kommer från samma material.

Specifikationen i publicerad form:

• Totalt antal parametrar – 600B, gles mixture-of-experts

• Aktiva per token — 27B, ungefär 4,5 % av totalen, en ovanligt gles andel

• Kontextfönster — 1M tokens

• Indata – text och bilder inbyggt; utdata är endast text

• Resonemang — ja, med utökat tänkande

• Pris — 1,00 $ per miljon indatatoken, 2,70 $ per miljon utdatatoken, med 95 % cacherabatt

• Tillgänglighet — API och Studio öppnar från och med den 20 september; vikterna planeras till den 15 oktober

Effektivitetsanspråket som StepFun leder med är att 600B/27B-uppdelningen placerar modellen på Pareto-fronten – kapacitet per beräkningsenhet – och företaget ramar in det som tre generationer av samma strävan, från Step-3.5-Flash via Step-3.7-Flash till denna. Det är en sammanhängande berättelse, och sparsitetsförhållandet är mekanismen: vid 27B aktiva ligger serveringskostnaden per token i intervallet för en mycket mindre modell, medan 600B totalt mest är en fråga om minnesavtryck.

Leverantörspåståenden och tredjepartssiffrorna bredvid dem

Två typer av siffror förekommer i lanseringsmaterialet, och de bör inte läsas på samma sätt. StepFuns egna utvärderingar är den första typen: ett kostnadspåstående för en enskild uppgift på en åttondel av Claude Opus 5; andra plats bakom antingen GPT-6 Astra eller Claude Opus 5 på ALE-CLI, FrontierFinance och DRACO; en 24-timmars GPU-kerneloptimeringskörning som höjde MLA-kernens topprestanda till 508 TFLOPS mot Claude Opus 5:s 493; ett automatiskt efterträningsexperiment som flyttade Qwen3-30B-A3B från 53,3 % till 60 % på AIME24; DeepSWE v1.1 vid 67,7 % och dess interna StepCodeBench vid 49,0 %. StepFun byggde StepCodeBench själv – 553 kodrepositorier, nio uppgiftstyper, 33 programmeringsspråk – vilket gör det till ett rimligt instrument för att mäta StepFuns egen modell och inte ett oberoende sådant.

Den andra klassen mäts av någon annan, och det är den delen man måste planera utifrån. Artificial Analysis ger Step 5 Preview 44 poäng på Intelligence Index v4.3.2 och placerar den på 24:e plats av 200 modeller – i nivå med Kimi K3, en poäng efter GLM-5.3 och i nivå med Claude Opus 5:s inställning för medelhög resonemangsinsats. På Terminal-Bench 4.0 noterar samma resultattavla 33,3 %, före DeepSeek V4.1 Flash på 26,8 % och långt före Kimi K3 på omkring 12,6 %. Utdatashastigheten uppmäts till 99,8 tokens per sekund och tiden till första token till 2,96 sekunder – båda från samma oberoende körning, och båda av det slag som avgör om en agentloop känns interaktiv.

En siffra från tredje part drar i motsatt riktning och förtjänar att stå bredvid priset. Samma indexkörning använde 160M utdatatokens för Step 5 Preview, jämfört med en median på 92M bland de modeller som fick poäng – modellen är ordrik. Vid 2,70 USD per miljon utdatatokens är den ordrikheten inte gratis: 160M utdatatokens är ungefär 432 USD av de 922,84 USD som körningen kostade totalt, och på en modell som tar tre gånger så mycket betalt skulle det vara den dominerande posten på fakturan. Ett lågt annonserat pris och ett högt antal tokens per uppgift är två halvor av samma tal, och kostnaden per indexuppgift – 0,71 USD – är den som redan innehåller båda.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second at rank 45 of 200, cost per Intelligence Index task $0.71 at rank 27 of 200, verbosity 160M output tokens at rank 64 of 200, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

Vad läckan hade rätt om, och det enda den inte avgjorde

Den här bloggens tidigare rapportering skrevs utifrån en utvärderingskörning som dök upp före något tillkännagivande, och den flaggade de påståenden som den inte kunde bekräfta. Tillkännagivandet löste de flesta av dem. Paret 600B/27B är nu tillverkarens uppgift i stället för något som antagits. Kontextfönstret på 1M token finns nu i StepFuns egen specifikation i stället för bara på en tredjeparts resultattavla. Priset på $1.00 och $2.70 är priset. Namnet är Step 5 Preview, inte ett ryktat alternativ.

Vad tillkännagivandet inte gjorde var att lösa den motsägelse kring kontextfönstret som läckagerapporteringen tog upp. En separat tredjepartskonfiguration som cirkulerar i utvecklarverktyg angav modellen till 350 000 tokens i kontext med en maximal utdata på 64 000 tokens. Ett fönster på 1M och ett fönster på 350k är olika produkter med olika minneskostnader, och ett tak på 64k utdata är en hård begränsning för precis det långsiktiga agentiska arbete som den här modellen säljs för. StepFuns tillkännagivande säger 1M och nämner inget tak för utdata. Det är värt att veta vilken av dem din routning till slut hamnar på innan du bygger en pipeline som är beroende av svaret, och det är en fråga för leverantörens dokumentation snarare än för en resultattavla.

Det andra som lanseringen inte förändrade är den oberoende reproduktionen. Varje benchmarkrad ovan som inte kommer från Artificial Analysis är StepFuns egen, körd i StepFuns egna testramverk, och ingen tredje part har reproducerat de agentiska resultaten. Mönstret från årets kinesiska labbflaggskepp är att det aggregerade indexet håller och att leverantörens rubrikrader glider; behandla det aggregerade värdet som planeringssiffran.

Vad du kan anropa idag och vad som ska dirigeras under tiden

Step 5 Preview finns inte i vår katalog, och OrcaRouter dirigerar inte den — det finns ett publikt API och en Studio på StepFuns sida, och det är där den körs. Vad vi däremot har är den uppsättning modeller som den mäts mot, bakom en enda nyckel: DeepSeek V4.1 Flash till $0.15 in och $0.60 ut per miljon, GLM-5.3 till $1.26 och $3.96 mot de $1.40 och $4.40 som Z.ai listar, Claude Opus 5 till $5.00 och $25.00, och Kimi K3 vid sidan av dem. Det är den praktiska formen för de kommande tre veckorna: en förhandsversion du kan benchmarka mot, och en uppsättning produktionsmodeller du faktiskt kan lita på, nåbara via ett API för fler än 200 modeller med leverantörens listpris vidarebefordrat till 0 % påslag — så om StepFuns prissättning ändras före oktober ändras priset du skulle betala med den samma dag, inte vid förnyelse.

Automatisk failover är värd mer än vanligt i detta fönster, eftersom felmoden för en förhandsversion inte är att den är dålig — det är att den är kapacitetsbegränsad. En modell som öppnade sitt API på tillkännagivandedagen och ännu inte har några vikter är en modell vars serveringsflotta fortfarande byggs, och en förhandsändpunkt som försämras klockan 2 på natten tar din agentloop med sig. Sätt förhandsversionen bakom en router med en beprövad modell som reserv och du får en kvalitetssignal på din egen arbetsbelastning utan att satsa en produktionsväg på en obeprövad flotta.

Screenshot of the Hugging Face repository page for stepfun-ai/Step-5-Preview-BF16, showing the repository created on September 20, 2026 with one contributor, a single initial commit and a single file listed, .gitattributes at 1.52 kB, with no model card, no license and no configuration.

Datumet som spelar roll är den 15 oktober.

Allt ovanstående är provisoriskt på ett specifikt sätt: vikterna är det som gör en modell permanent. En stängd förhandsvisning för $1.00 och $2.70 är ett bra pris från en enda leverantör, och en BF16-checkpoint under en publicerad licens är ett pris som ingen enskild leverantör kontrollerar längre. StepFun har förbundit sig till det andra alternativet för den 15 oktober, och repositorienamnet som det redan har reserverat säger bfloat16 först.

Vad man bör hålla utkik efter mellan nu och då är smalt och kontrollerbart. Fylls repot – och med vilken licens? Bekräftar en konfigfil 600B totalt och 27B aktiva? Publicerar StepFun utdatataket tillsammans med kontextfönstret, vilket löser frågan om 350k/64k? Håller priset när förhandsversionen tappar sitt suffix? De fyra svaren avgör om Step 5 Preview blir en modell du självhostar, en modell du hyr eller en modell du benchmarkar en gång och sedan lämnar. Tills repot har mer än en .gitattributes i sig är tillkännagivandet början på historien snarare än slutet på den.

Generated two-column infographic titled 'Step 5 Preview — live today vs promised October 15'. The left card 'Callable now' lists rows: API and Studio open September 20, price $1.00 in / $2.70 out, AA Intelligence Index 44, 1M-token context, output speed 99.8 tokens/sec. The right card 'Promised October 15' lists rows: BF16 weights, licence terms, config with parameter counts, output ceiling. A footer reads 'The announcement covers the left card; the right card is unconfirmed until the repository is filled.'

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen