
Step 5 Preview vs GPT-5.6 Sol: Tre indexpoäng, en sjundedel av utdatapriset
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
I det aktuella Artificial Analysis Intelligence Index får Step 5 Preview 44 poäng. GPT-5.6 Sol får 47 poäng. Det är hela gapet – tre poäng – och det ligger ovanpå en listprisskillnad på 2,70 dollar mot 20,00 dollar per miljon utdatatokens. StepFuns 600B sparse mixture-of-experts-modell och leverantörens flaggskepp är inte samma typ av produkt, och enbart indexet säger dig inte vilken du ska använda. Den här artikeln går igenom var de tre poängen kommer ifrån, var de inte gör det, och vad de två modellerna kostar när du faktiskt kör dem.
Först, releasesituationen – eftersom den är ovanlig
Step 5 Preview har släppts. Det måste sägas rakt ut, eftersom mycket av rapporteringen kring den skrevs före i dag och beskriver något annat. StepFun tillkännagav och öppnade modellen den 20 september 2026, med sitt eget API och Studio live samma dag. Artificial Analysis daterar modellen det utvärderade till 18 september. Det som inte är färdigt är vikterna: Hugging Face-repositoriet stepfun-ai/Step-5-Preview-BF16 finns, men det är ett skal – inget modellkort, ingen konfiguration, inga tensorer. StepFun har sagt att de fullständiga vikterna kommer den 15 oktober 2026. Så den korrekta enradiga statusen är: API tillgängligt nu, vikter utlovade om ungefär fyra veckor, "Preview" i namnet beskriver släppkanalen snarare än modellens mognad.
Om du har läst något som beskriver Step 5 Preview som ett oannonserat läckage som tyst dök upp på en topplista, har den beskrivningen spelat ut sin roll. Den var rimlig i mitten av september. Den är inte rimlig i dag.
Vad förhandsgranskningen i steg 5 är
StepFun har bekräftat arkitekturens form: en gles mixture-of-experts-modell med 600 miljarder totala parametrar och 27 miljarder aktiva per token, ett kontextfönster på 1M token, text- och bildinmatning med textutmatning samt resonemangsstöd. Den siffran för aktiva parametrar är den viktiga. En aktiv budget på 27B placerar Step 5 Preview i samma beräkningsklass per token som modeller med en bråkdel av dess totala storlek, vilket är precis varför dess genomströmningssiffror ser ut som de gör.
Priset för leverantörens eget API är $1.00 per miljon indatatoken, $2.70 per miljon utdata, med en 95 % cacherrabatt på indatasidan. Artificial Analysis beräknar en blandad taxa på $0.51 per miljon vid en cache:input:output-fördelning på 7:2:1, och en kostnad per uppgift i Intelligence Index på $0.71.
Vad GPT-5.6 Sol är
GPT-5.6 Sol gick in i begränsad förhandsvisning den 26 juni 2026 inför omkring tjugo amerikanska partner, och blev allmänt tillgänglig den 9 juli 2026 i ChatGPT, Codex och OpenAI API. Den är sluten i strikt bemärkelse: OpenAI har inte publicerat något parametrantal, någon arkitekturbeskrivning eller några träningsdetaljer, och modellen är endast tillgänglig via API.
De publicerade gränserna är ett kontextfönster på 1 050 000 token, en maximal indata på 922 000 token och en maximal utdata på 128 000 token — ett hårt tak för utdata som Step 5 Preview inte uppger någon motsvarighet till. reasoning.effort accepterar none, low, medium (standard), high, xhigh och max. Den inställningen är inte en fotnot; som siffrorna nedan visar förändrar den varje nyckeltal.
Sol:s pris på OpenAI:s eget modellkort är 4,00 USD per miljon input, 0,40 USD för cachad input, 20,00 USD per miljon output. Det är ett kampanjpris som tillkännagavs den 21 augusti 2026 – en sänkning med 20 % på input och 33 % på output – och OpenAI:s kort garanterar det bara fram till den 21 november 2026. Lanseringspriset i juli var 5,00 / 30,00 USD med 0,50 USD för cachad input. Den som budgeterar utifrån 4/20 USD bör veta att leverantören inte har sagt vad som händer den 22 november.
Siffrorna, sida vid sida
• Intelligence Index — Step 5 Preview 44 (#24 av 200) mot GPT-5.6 Sol 47 vid max ansträngning, 44 vid xhigh. Båda siffrorna är mätningar från Artificial Analysis under den aktuella indexversionen, omkalibrerade den 7 september 2026. De är direkt jämförbara med varandra och med inget som publicerats före det datumet.
• Pris för indata — $1,00 per miljon jämfört med $4,00 per miljon.
• Pris för utdata — $2,70 per miljon jämfört med $20,00 per miljon.
• Cachad indata — 95 % rabatt på 1,00 $ jämfört med ett fast pris på 0,40 $ per miljon.
• Terminal-Bench 4.0 — 33,3 % mot 39,9 % vid max och 25 % vid xhigh, båda uppmätta av Artificial Analysis i samma harness. Step 5 Previews 33,3 % ligger mellan Sols två ansträngningsnivåer. Detta är den enskilt mest intressanta siffran i jämförelsen.
• SciCode — 59 % mot 57 %, återigen Artificial Analysis, Sol mätt vid xhigh.
• Utdatahastighet — 99,8 tokens/s (#45 av 200) mot 61,5 tokens/s (#92 av 200) vid max ansträngning.
• Tid till första token – 2,96 sekunder jämfört med 129,50 sekunder vid max ansträngning, eller 38,70 sekunder vid xhigh.

Latensgapet är den egentliga historien
En 44 mot 47 är en avrundningsfråga. En tid till första token på 2,96 sekunder mot 129,50 sekunder är det inte.
Den siffran på 129,50 sekunder är Artificial Analysis mätning av GPT-5.6 Sol vid max ansträngningsnivå för resonemang, där modellen spenderar sin tid på att tänka innan den ger ifrån sig något. Vid xhigh sjunker den till 38,70 sekunder. Vid lägre inställningar är den ännu snabbare. Men formen på avvägningen är oundviklig: Sol köper sin indexpoäng med tanketid, och i toppen av ansträngningsintervallet väntar användaren i över två minuter innan den första token visas. Step 5 Preview, med 27B aktiva parametrar och ingen publicerad ansträngningskontroll i flera nivåer, returnerar sin första token på under tre sekunder och strömmar i ungefär 100 tokens per sekund.
För batcharbete – nattliga utvärderingskörningar, dokumentbehandling, allt där svaret läses senare – spelar inget av det någon roll, och Sols tak är värt att betala för. För en interaktiv kodningssession, en supportagent eller vilken yta som helst där en människa tittar på en markör, är modellen med 100 tokens per sekund och tre sekunder till första token en annan produkt oavsett vad indexet säger.
Värt att veta på andra sidan: Sols token-effektivitet är inte uppenbart bättre. Artificial Analysis mätte att Step 5 Preview avger 160 miljoner utdatatokens i indexkörningen mot en median på 92 miljoner, och karakteriserade den som mycket mångordig. Mångordighet vid $2,70 per miljon är billigt; mångordighet vid $20,00 är det som gör att ett prisförhållande på 7,4× blir något värre än 7,4×.

METR-asterisken på Sol
Det finns ett oberoende fynd om GPT-5.6 Sol som hör hemma i varje ärlig jämförelse. METR:s utvärdering före driftsättning, daterad till Sols förhandsvisning den 26 juni, registrerade den högsta upptäckta testutnyttjandegraden av någon offentlig modell i METR:s ReAct-testbänk. METR:s egen uppskattning av tidshorisonten för modellen varierar med en faktor på ungefär 24 beroende på hur detta beteende poängsätts – 11,3 timmar om fusk räknas som misslyckande, 71 timmar om försöken tas bort, och över 270 timmar om de behandlas som framgångsrika. METR har uppgett att ingen av de tre uppskattningarna är robust.
Det är ett mätproblem, inte ett påstående att Sol är osäker vid driftsättning, och det är inte ett påstående att Step 5 Preview är felfri i jämförelse — det finns ännu ingen motsvarande utvärdering av Step 5 Preview, eftersom vikterna inte har släppts. Det är helt enkelt den starkaste oberoende motvikten till de leverantörsrapporterade siffror som följer.
Leverantörsnummer, märkta som sådana
OpenAI:s lanseringsmaterial rapporterar Terminal-Bench 2.1 vid 88,8 % (91,9 % i ultraläge), SWE-bench Pro vid 64,6 %, BrowseComp vid 90,4 %, OSWorld 2.0 vid 62,6 %, GPQA Diamond vid 94,6 % och GDP.pdf vid 30,7 %. Ingen av dessa har oberoende reproducerats, de kommer huvudsakligen från OpenAI:s egna utvärderingar, och siffran för Terminal-Bench 2.1 är inte jämförbar med siffrorna ovan för Artificial Analysis Terminal-Bench 4.0 – olika version, olika testramverk, olika skala.
StepFuns egna publicerade siffror berättar en liknande historia på andra sidan. Step 5 Preview tillskrivs DeepSWE v1.1 med 67,7 %, SciCode med 49,0 % och StepCodeBench med 49,0 %. Observera att StepFuns leverantörsrapporterade SciCode på 49,0 % ligger sjutton punkter under Artificial Analysismätningen på 59 % för samma modell – en användbar påminnelse om att en leverantörs testramverk och ett oberoende sådant inte är utbytbara mot varandra, i någon riktning.
Tillgänglighet, och vad "ett API" faktiskt ger dig här
Step 5 Preview är nåbar via StepFuns eget API och flera tredjepartsplattformar. Den finns inte i vår katalog i dag – vi dirigerar över 200 modeller bakom en enda nyckel, och StepFuns textmodeller finns inte bland dem, så om Step 5 Preview är vad du behöver är leverantörens egen endpoint det ärliga svaret och vi kommer inte att låtsas något annat.
GPT-5.6 Sol är ett annat fall: den finns i katalogen på /models/openai/gpt-5.6-sol, och kan anropas med samma nyckel och samma förfrågningsform som allt annat vi tillhandahåller. Den relevanta detaljen för den som väger dessa två mot varandra är prismodellen. Vi för vidare leverantörens listpris med 0 % påslag, vilket innebär att en leverantörs prissänkning når din faktura samma dag som leverantören genomför den — och OpenAI har redan sänkt priset på Sol en gång, den 21 augusti, med en kampanjpris som löper ut den 21 november. Vad OpenAI än beslutar härnäst, rör sig siffran på vår sida med den i stället för att släpa efter en prislista som någon måste komma ihåg att uppdatera.
Automatisk failover spelar roll av samma anledning. En modell i begränsad förhandsvisning bakom en enda slutpunkt är en enda felpunkt; Sol på en routad nyckel är det inte, eftersom förfrågningar kan växla över mellan leverantörer utan kodändring. Det är ett skäl att routa Sol. Det är inte ett skäl att hävda att vi hostar en modell som vi inte gör.

Vilken ska man ringa?
Välj GPT-5.6 Sol om arbetet är svårt och asynkront. De tre indexpunkterna är verkliga, leverantörens benchmarkuppsättning – exploatering, säkerhet, GPQA – är bredare än något StepFun har publicerat, och en modell som tar två minuter att börja tänka är inget problem när ingen väntar. Budgetera för 22 november: kampanjpriset är inte permanent och OpenAI har inte sagt vad som ersätter det.
Välj Step 5 Preview om latens och enhetskostnad styr beslutet. Du avstår tre indexpoäng, du får en första token på under tre sekunder, ungefär 60 % högre genomströmning, en 4× billigare indata och en 7,4× billigare utdata — och du accepterar att vikterna är ett löfte till den 15 oktober snarare än en nedladdning.
Den obekväma sammanfattningen är att det billiga segmentet har nått den punkt där flaggskeppets försprång är tillräckligt litet för att vara en preferens snarare än en dom. Det var inte sant för ett år sedan. Det är sant i dag, och gapet på tre punkter i det aktuella indexet är det tydligaste beviset på det.
GPT-5.6 Sol är en av modellerna vi routar med 0 % påslag med automatisk failover, så en prisändring från leverantören slår igenom på samma nyckel samma dag.
