
Step 5 Preview vs A.X-K2: En 600B API-modell mot en nedladdning på 690B
- OrcaNYOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M tokens
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
Step 5 Preview och A.X-K2 är de två halvorna av ett beslut som fortsätter dyka upp den här hösten: hyra en frontierklassmodell från ett API, eller ta hem ett flaggskepp med öppna vikter och köra det själv. StepFuns Step 5 Preview är hyralternativet – tillkännagavs den 20 september 2026 och kunde anropas samma dag för $1.00 per miljon indatatoken och $2.70 per miljon utdatatoken, ungefär 600 miljarder parametrar totalt med 27 miljarder aktiva, en kontext på 1M token och en oberoende poäng på 44 i Artificial Analysis Intelligence Index. SK Telecoms A.X-K2 är nedladdningsalternativet – släppt den 12 augusti 2026 under Apache 2.0, cirka 688 till 692 miljarder parametrar totalt, varav 33 miljarder aktiva, en kontext på 262K token och en indexpoäng på 21. Den ena är större, den ena är prissatt, och den som är prissatt är den som får mycket högre poäng. Den inversionen är hela jämförelsen, och den är värd att förstå innan du väljer sida av princip.
Den vanliga inramningen av dessa två modeller är nationell: Koreas suveräna AI-flaggskepp mot ett av Kinas mest aggressiva labb. Den inramningen är inte användbar för ett driftsättningsbeslut. Det som är användbart är att A.X-K2 är den enda i paret som du kan hålla, och Step 5 Preview är den enda i paret som du kan köpa per token. Allt annat följer av den uppdelningen.
Siffrorna, hållna till sina källor
Det enda måttet för en jämförelse på lika villkor är Intelligence Index, och det är oberoende på båda sidor: 44 för Step 5 Preview mot en median på 26 bland jämförbara modeller, och 21 för A.X-K2 mot en median på 18 i dess jämförelseklass för öppna vikter, båda mätta av samma tredje part på samma skala. Lästa i skrivande stund är dessa dagens siffror — poängen på detta index förändras när utvärderaren kalibrerar om, och en tidigare avläsning av samma A.X-K2-sida visade ett högre tal. Allt annat i den här jämförelsen kommer med en attribution som du måste bära omkring på.
• Oberoende intelligens – Step 5 Preview: 44 på Artificial Analysis Intelligence Index jämfört med A.X-K2: 21 på samma index, oberoende mätt.
• Totala / aktiva parametrar — Step 5 Preview: cirka 600B totalt, 27B aktiva enligt StepFun jämfört med A.X-K2: cirka 688–692B totalt, 33B aktiva enligt SK Telecom-material och indexkortet.
• Kontextfönster — Step 5 Preview: 1M tokens per StepFun mot A.X-K2: 262K tokens.
• Modalitet — Step 5 Preview accepterar text och bild; A.X-K2 stöder endast text.
• Pris — Step 5 Preview: 1,00 USD per miljon indata och 2,70 USD per miljon utdata, publicerat av leverantören, jämfört med A.X-K2: inget kommersiellt API-pris publicerat överhuvudtaget.
• Var det körs — Step 5 Preview: StepFuns eget API och Studio, plus partnerytor under kampanjfönster mot A.X-K2: din hårdvara, från en nedladdning.
• Släpp — Step 5 Preview tillkännagavs 20 september 2026 vs A.X-K2 släpptes 12 augusti 2026.
• Licens — Step 5 Preview: sluten förhandsversion med BF16-vikter utlovade till 15 oktober 2026 vs A.X-K2: Apache 2.0.
A.X-K2: det tyngre instrumentet, med det tunnare bevisunderlaget
SK Telecom byggde A.X-K2 som efterträdaren till A.X K1, och arkitekturen är direkt inriktad på kostnaden för långa kontexter: ett mixture-of-experts-upplägg med 256 experter och 8 aktiva per token, tränat nativt i FP8, med en mekanism som företaget kallar Sparse Gated Attention. Det är ett rejält ingenjörsarbete, och det är anledningen till att en modell med nästan 700 miljarder parametrar totalt över huvud taget kan serveras av en organisation som inte är en hyperscaler.
Det den inte har är oberoende bekräftelse. SK Telecom rapporterar en genomsnittlig förbättring på 32,2 poäng över fjorton benchmarks jämfört med A.X K1, ett hopp på omkring 83,9 poäng på långkontext- och agentutvärderingar, 97,1 på AIME 2026, 80,5 på det koreanska kunskapsbenchmarket KMMLU-Pro och 91,6 på CLIcK, och säger att den matchar eller slår nyligen släppta Qwen- och DeepSeek-versioner inom matematik och koreanskt språkarbete. Varenda en av dessa är leverantörens egen siffra. Den oberoende poängen – 21 på Intelligence Index – ligger över medianen på 18 i sin jämförelseklass för öppna vikter men ligger tjugotre poäng under Step 5 Preview, och A.X-K2:s styrkor ligger inom områden där just det indexet inte väger särskilt tungt: dess nio utvärderingar är till stor del engelskspråkiga, resonemangs- och agentcentrerade, och inte en enda av dem är ett benchmark för koreanska.
Inget av det gör A.X-K2 till en sämre modell än dess poäng. Det gör dess poäng till en nedre gräns för vad den presterar för en koreanskspråkig eller matematikintensiv arbetsbelastning, enligt leverantörens ord, tills ett oberoende labb publicerar dessa utvärderingar. Kostnadssidan är mer konkret: en referensdriftsättning av den här viktklassen kräver fyra GPU:er av B300-klass och ungefär 656 GiB i FP8. Det är priset för nedladdningen, och till skillnad från en tokenräkning skalas det inte ner igen när experimentet är över.
Förhandsvisning av steg 5: den du kan prova över HTTP idag
Fördelen med Step 5 Preview är inte att den är större eller mer öppen – den är ingetdera – utan att den är prissatt, anropbar och oberoende poängsatt, och att den har varit gratis att prova i tre partnersytor under oktober. För ett team som utvärderar i stället för att självhosta är den kombinationen värd mer än en Apache 2.0-licens, eftersom den förvandlar ett hårdvarubeslut till ett API-anrop. StepFuns journal över modellen är dock tunn på de vanliga ställena: paret på 600B/27B parametrar och kontextfönstret på 1M tokens är leverantörens egna siffror, dess utlovade vikter har inte släppts, och den oberoende resultattavlans mest användbara siffra om den är möjligen inte poängen 44 utan verbositeten – ungefär 160 miljoner genererade utdatatoken över indexets uppgiftssvit mot en median på nära 82 miljoner, och A.X-K2 ligger ännu längre bort på omkring 230 miljoner mot en median på 140 miljoner. För en modell som debiterar $2,70 per miljon utdatatoken utgör det gapet skillnaden mellan en billig utvärdering och en dyr produktionsvana.
Varför den större modellen får lägre poäng
Parameterantal är inte poäng, och den här kombinationen visar det tydligt. A.X-K2:s extra cirka 300 miljarder totala parametrar ger en täthet som syns där dess egen utvärderingssvit belönar — djup i koreanska, matematik, bred kunskap — medan indexet som båda modellerna finns med i mestadels är engelskt, resonemangstungt och agentcentrerat, där byggarna bakom Step 5 Preview tycks ha finjusterat medvetet. Den 27B-aktiva designen gör också StepFun-modellen betydligt billigare att serva vid varje given genomströmning, vilket är anledningen till att ett hostat pris överhuvudtaget finns.
Det finns en andra, mindre smickrande tolkning som drar i motsatt riktning. A.X-K2 har funnits sedan 12 augusti och Step 5 Preview sedan 20 september; den nyare modellen har färre veckor av oberoende granskning, och dess 44 kan ännu komma att ändras i takt med att fler utvärderingar kommer in. Båda siffrorna är preliminära på samma sätt som förstakvartalspoäng för alla modeller är preliminära. Skillnaden är att A.X-K2:s preliminära poäng är det bästa beviset som någon utanför SK Telecom har, medan Step 5 Preview:s preliminära poäng vilar på ett specifikationsblad från leverantören som en tredje part åtminstone delvis har reproducerat.
Serveringsekonomi, vilket är där beslutet faktiskt ligger
Om du kan anropa den betalar du 1,00 USD för indata och 2,70 USD för utdata per miljon tokens och sedan är du klar – ingen upphandling, inga GPU:er, ingen drift. Om du laddar ner den betalar du för hårdvaran, elen, kvantiseringsarbetet och utvärderingsramverket, och du får behålla dina prompts och dina data inom din egen perimeter. A.X-K2 med 33B aktiva parametrar är inte en laptopmodell; referenskonfigurationen är ett litet kluster. Den slutna förhandsvisningen av Step 5 Preview erbjuder ingen perimeter alls förrän den 15 oktober, då BF16-vikterna utlovas – och tills dessa filer dyker upp i repositoryt är det datumet ett åtagande snarare än ett alternativ.

Det här är punkten där ett routningslager förtjänar sin plats i stället för att bara göra reklam för sig självt. De flesta team vill inte svara på ”hyra eller äga” en gång för alla; de vill veta vad en modell gör med deras trafik innan de köper hårdvara för den och sedan behålla möjligheten att byta om svaret ändras. OrcaRouter routar inte Step 5 Preview och det routar inte A.X-K2 – båda ligger utanför vår katalog i dag. Det som görs är att sätta mer än 200 modeller bakom en enda API-nyckel och en enda faktura med 0 % påslag, där leverantörens listpris förs vidare oförändrat, så den jämförelseuppsättning du kör något av de nya flaggskeppen mot är samma uppsättning som du kan anropa redan i eftermiddag, och automatisk failover håller en produktionsväg levande medan du fortfarande bestämmer dig.


Vilken ska man välja?
Välj Step 5 Preview om din arbetsbelastning är allmän resonemangsförmåga, agentisk kodning eller något med lång kontext, om du vill betala per token i stället för att köpa hårdvara, och om bildinmatning spelar roll – den vinner på den oberoende poängen, på kontextlängd, på latens till ett första svar och på variationen av modaliteter, och den är den enda av de två som du kan köra i en upphandlingsfri pilot den här månaden.
Välj A.X-K2 om ditt språk är koreanska, om din arbetsbelastning är matematikintensiv, eller om data helt enkelt inte får lämna din infrastruktur – och gå in i det med vetskapen att du accepterar SK Telecoms benchmarktabell på tro, att hårdvarukostnaden är verklig och att den oberoende poäng du kan peka på är tjugotre poäng lägre. Om den avvägningen verkar fel är det ärliga svaret inte att välja det andra flaggskeppet; det är att benchmarka båda på din egen trafik, vilket är den enda jämförelse som ingen av leverantörernas siffror kan ersätta.
Ingen av modellerna är det säkra standardvalet. Step 5 Preview är det billiga, avvägda, anropbara alternativet med sina vikter fortfarande på väg; A.X-K2 är det tyngre, suveräna, nedladdningsbara alternativet med sina bevis fortfarande utestående. Välj den begränsning som faktiskt binder ditt team – perimetern eller notan – och släpp den andra.
