Genererat titelkort med rubriken ”Step 5 Preview vs Claude Opus 5 — prisskillnaden” med två kolumner: Step 5 Preview vid AA Index 44, pris $1,00 indata / $2,70 utdata, kostnad för indexkörning $922,84 och utdatahastighet 99,8 tokens/sek; Claude Opus 5 vid AA Index 51, pris $5,00 indata / $25,00 utdata, kostnad för indexkörning $7 274,74 och utdatahastighet 55,3 tokens/sek. En sidfot lyder ”7,9 gånger kostnaden för 7 indexpoäng. Båda enligt Artificial Analysis Intelligence Index v4.3.2 vid maximal resonemangsansträngning.”
Guides & Insights

Step 5 Preview vs Claude Opus 5: Sju indexpoäng för sju gånger räkningen

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

StepFuns lanseringsmaterial för Step 5 Preview inleds med ett enda jämförande påstående: en enskild uppgift på den kostar en åttondel av samma uppgift på Claude Opus 5. Båda modellerna finns nu på samma oberoende resultattavla, så påståendet kan kontrolleras i stället för att diskuteras. Artificial Analysis körde båda genom Intelligence Index v4.3.2 – tio utvärderingar – och publicerade vad varje körning kostade, där Claude Opus 5 poängsattes med sin egen inställning för maximal resonemangsansträngning. Step 5 Preview: 44 i indexet, 922,84 dollar för att slutföra körningen. Claude Opus 5: 51 i indexet, 7 274,74 dollar. Det är 7,9 gånger pengarna för 7 poäng i resultat, och den kvot som StepFun angav visar sig vara den korrekta. Det intressanta är vad kvoten döljer, för gapet är inte i första hand ett prisgap. Det är ett mångordighetsgap som bär ett prisgaps kläder, och att skilja de två åt förändrar vilken modell du bör ställa framför vilken typ av arbetsbelastning.

Två körningskostnader, ett kort och vad som faktiskt finns inuti dem

En total körningskostnad är den renaste enskilda jämförelse som finns här, eftersom båda modellerna svarade på samma frågor under samma testuppställning, och ingen av leverantörerna tog fram siffran. Det är också den siffra som mest sannolikt misstolkas, så den är värd att titta närmare på.

• Indexpoäng — Step 5 Preview 44 mot Claude Opus 5 51, Claude Opus 5 uppnådde sin högsta inställning för resonemangsansträngning

• Total kostnad för att slutföra indexet — Step 5 Preview $922.84 mot Claude Opus 5 $7,274.74

• Blandat pris vid en mix om 7:2:1 av cacheträffar / indata / utdata — Step 5 Preview $0.51 per 1 miljon tokens jämfört med Claude Opus 5 $3.85

• Utdatatoken som genererades under indexkörningen — Step 5 Preview 160M vs Claude Opus 5 140M

• Listpris — Step 5 Preview $1,00 in / $2,70 ut vs Claude Opus 5 $5,00 in / $25,00 ut

Tittar man på rad tre och fem tillsammans slutar aritmetiken vara en rak prisjämförelse. Step 5 Previews blandade taxa är 7,5 gånger billigare, och listpriset är 5 gånger billigare för indata och 9,3 gånger billigare för utdata – så blandningen gör ett arbete som indatapriset inte gör. Det beror på att blandningen är viktad mot utdata, och utdata är där de två modellerna skiljer sig mest. Claude Opus 5 debiterar 9,3 gånger Step 5 Previews utdatapris, och båda modellerna skriver väldigt mycket: 140 M utdatatokens för Claude Opus 5 mot en median på 92 M bland de modeller som indexet poängsätter, och 160 M för Step 5 Preview mot samma median på 92 M.

Så den ärliga tolkningen är snävare än ”den billiga modellen är ett fynd”. Step 5 Preview är billigare på varje axel, och den är inte en sparsam modell – den skriver 74 % mer utdata än den medianmodell som den mäts mot, vilket är precis det beteende som priset är tänkt att bestraffa. Claude Opus 5 skriver 52 % mer än medianen och debiterar 9,3 gånger så mycket för var och en av dessa tokens. En anropare som begränsar utdatalängden får en annan kvot än en som inte gör det.

Frågan är inte vilket som är bättre. Det är var skärningspunkten ligger.

Anta att indexet är en rimlig proxy för det arbete du faktiskt skickar – långhorisontella agentiska uppgifter, kod, verktygsanvändning i flera steg. Då är brytpunkten enkel att ange: Claude Opus 5 måste vara minst 7,9 gånger mer användbar per uppgift innan den är värd sin kostnad, och på indexet är den 7 punkter bättre på en 100-poängskala. Dessa två fakta behöver inte peka i samma riktning, eftersom en indexskillnad på 7 punkter inte motsvarar 16 % bättre på allt. Det är aggregeringen av tio utvärderingar, och sammansättningen spelar större roll än totalen.

Det är argumentet för att bry sig om formen på de två poängen snarare än rubriken. Step 5 Previews resultat på Terminal-Bench 4.0 är 33,3 % — ett verkligt agentiskt resultat, före DeepSeek V4.1 Flash på 26,8 % — men inget i det publicerade materialet visar ännu att det matchar Claude Opus 5 på de utvärderingar över lång horisont där Anthropics modell är starkast. StepFuns eget material medger detta i formuleringen: på ALE-CLI, FrontierFinance och DRACO placerar företaget Step 5 Preview tvåa, efter antingen GPT-6 Astra eller Claude Opus 5, och före de andra öppna modellerna i jämförelsen. En andraplats till en femtedel av priset är ett genuint bra resultat. Det är inte heller förstaplatsen, och de uppgifter där en modell slutar tvåa är vanligtvis de uppgifter som behövde en förstaplats.

Den andra asymmetrin är vad som händer vid ett dåligt anrop. Ett felaktigt svar från en billig modell som tog fyra sekunder och 2 000 tokens kostar dig omförsöket; samma felaktiga svar från Claude Opus 5 till 25 dollar per miljon utdatatokens kostar dig omförsöket plus betänketiden. Om din pipeline gör om försöket vid fel – det gör de flesta agentloopar – är den effektiva kostnaden per framgångsrik uppgift det tal som spelar roll, och det är inte samma förhållande som listpriset, eftersom de två modellerna inte kommer att misslyckas i samma takt. Ingen har publicerat den siffran för Step 5 Preview ännu.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

Specifikationskontrasten, dimension för dimension

• Indexpoäng — Step 5 Preview 44 mot Claude Opus 5 51, båda på Intelligence Index v4.3.2, Claude Opus 5 med sin högsta inställning för resonemangsinsats

• Pris per 1 miljon tokens — Step 5 Preview $1,00 in / $2,70 ut jämfört med Claude Opus 5 $5,00 in / $25,00 ut

• Cacherabatt — Step 5 Preview 95 % vs Claude Opus 5 90 %

• Kontext — båda 1M tokens; StepFun har inte publicerat något tak för utdata och Anthropics är 128K

• Indata — båda accepterar text och bilder; båda ger endast text som utdata

• Utdatahastighet — Step 5 Preview 99,8 tokens/sek mot Claude Opus 5 55,3 tokens/sek

• Kontrollpanel — Step 5 Preview exponerar utökat tänkande; Claude Opus 5 ersätter temperature och top_p med ett adaptivt reglage för resonemangsansträngning

• Vikter – Step 5 Preview stängde idag, BF16-checkpoint planerad till 15 oktober; Claude Opus 5 proprietär genomgående

• Oberoende bevis – båda poängsatta av Artificial Analysis; StepFuns agentiska benchmarkrader är leverantörskörda och inte reproducerade

Två rader förtjänar en kommentar. Hastighetsgapet är verkligt och större än tabellen antyder i praktiken: 99,8 tokens per sekund mot 55,3 är en modell som blir klar ungefär dubbelt så snabbt på samma utdata, och Step 5 Previews tid till första token på 2,96 sekunder mot Claude Opus 5:s 56,84 sekunder på samma resultattavla är en helt annan sak – även om den andra siffran mäter max-effort-konfigurationen för resonemang, där modellen överlägger innan den ger ifrån sig något. Det är inte den latens ett produktionsanrop ser. Jämfört med standardändpunkten rapporterar vår egen katalog en p50-tid till första token på 6,73 sekunder för Claude Opus 5, vilket är siffran att planera efter om du inte medvetet begär maximal överläggning.

Raden för cacherebatt är den som tyst avgör återkommande arbetsbelastningar, och den gynnar Step 5 Preview, 95 % mot 90 %. En agentloop som skickar samma systemprompt och repository-kontext igen vid varje anrop lever nästan helt på den rabatten, så en skillnad på fem procentenheter förstärks under en lång session.

Generated two-column comparison scoreboard titled 'Step 5 Preview vs Claude Opus 5 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, price $1.00 / $2.70, cache discount 95%, output speed 99.8 tokens/sec, context 1M tokens, and weights due October 15. The right column gives Claude Opus 5 the rows AA Index 51, price $5.00 / $25.00, cache discount 90%, output speed 55.3 tokens/sec, context 1M tokens, and weights proprietary. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2 at maximum reasoning effort. StepFun agentic rows are vendor-run.'

Där Claude Opus 5 fortfarande är det enda svaret

Inget av det ovanstående talar emot Anthropics modell. Den kostar vad den kostar eftersom den gör det indexet försöker mäta, och den gör det nära toppen av listan – 51 på Intelligence Index v4.3.2, sju punkter före Step 5 Preview och inom räckhåll för ledarna i den nuvarande generationen. De arbetsbelastningar där ett sammanvägt gap på 7 punkter underskattar skillnaden är de som inte tolererar ett svar på andra plats: en refaktorering som tar flera timmar, där felmoden är en subtil beteendeförändring; en finansiell modell där resonemangskedjan måste vara granskningsbar; en migrering där ett felaktigt beslut upptäcks en vecka senare. I dessa är omförsöket inte billigt och övervägandet är produkten.

Arbetsbelastningarna där gapet är irrelevant är de som byggs upp av många små beslut: klassificerings- och routingsteg, extrahering, sammanfattning, testscaffolding, de tusen anrop en agent gör mellan de två anrop som faktiskt spelar roll. För dem är en modell på 44 som svarar på halva tiden till en femtedel av indatapriset ingen kompromiss. Det är standardvalet, med den dyra modellen reserverad för steget som måste bli rätt.

Köra delningen utan att köra två integrationer

Den praktiska versionen av den här jämförelsen är en nivåindelad pipeline, och anledningen till att team inte bygger en är upphandling snarare än ingenjörsarbete – två leverantörer, två avtal, två SDK:er, två nycklar att rotera. Claude Opus 5 finns i vår katalog för $5,00 och $25,00, och de billigare textmodellerna som du skulle sätta före den finns i samma katalog, alla bakom en enda nyckel för fler än 200 modeller med leverantörens listpris vidarebefordrat med 0 % påslag. Step 5 Preview finns inte med på den listan – den körs på StepFuns egen API, och tills vikterna släpps är det den enda platsen den körs på. Att sätta samman nivåindelningen över de modeller vi faktiskt dirigerar är ett routing-DSL-uttryck snarare än en kodändring – skicka rutinanropen till den lilla modellen, eskalera till den dyra vid ett konfidens- eller komplexitetsvillkor och håll båda benen bakom samma slutpunkt.

Automatisk redundansväxling spelar roll här av en specifik anledning, inte som en generisk funktion. Step 5 Preview öppnade sitt API på tillkännagivandedagen utan publicerade vikter och utan någon offentliggjord serveringsflotta; det är en förhandsvisnings-endpoint som är några dagar gammal, och förhandsvisnings-endpoints är kapacitetsbegränsade på ett sätt som mogna sådana inte är. Claude Opus 5 betjänas av många oberoende leverantörer, vilket är den redundans som en förhandsvisning inte kan erbjuda. Att behålla en beprövad modell som reservben — på vår sida betyder det en produktionsmodell från katalogen, inte förhandsvisningen — är hur man får en verklig kvalitetssignal på sin egen arbetsbelastning utan att göra sin produktionsväg beroende av en serveringsflotta som fortfarande dimensioneras.

Screenshot of the OrcaRouter model page for Claude Opus 5 at www.orcarouter.ai/models/anthropic/claude-opus-5, showing the model id anthropic/claude-opus-5, the max output and context figures of 128K and 1M tokens, input pricing of $5.00 and output pricing of $25.00 per million tokens, a p50 time to first token of 6.73 seconds, 59.7M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

Beslutsregeln

Om din arbetsbelastning är ett litet antal mycket svåra uppgifter är Claude Opus 5 inte det dyra alternativet – det är det billiga, eftersom det näst bästa svaret kostar mer än skillnaden. Om din arbetsbelastning är ett stort antal vanliga uppgifter med ett litet antal svåra uppgifter i sig, är Step 5 Preview till $1.00 och $2.70 med 95 % cacherabatt det bättre standardvalet och gapet på 7 punkter är mest ett avrundningsfel för arbete som inte behövde det.

Det som skulle ändra den beräkningen är oberoende underlag om felfrekvenser och om de långsiktiga agentiska raderna. StepFuns egna siffror placerar modellen på andra plats i de utvärderingar som företaget byggde sin lansering kring, och ingen tredje part har reproducerat dem. Håll ögonen på checkpointen den 15 oktober för två saker: om licensen tillåter den finjustering som skulle låta dig täppa till en 7-poängs lucka med dina egna data, och om mångordigheten håller i sig när preview-suffixet tas bort. Det första skulle ändra kvoten; det andra har redan ändrat den en gång.