
Step 5 Preview vs K2 Horizon 375B A23B: Nära på poängen, långt ifrån på beviset
- OrcaNYOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M tokens
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
Två nästan öppna flaggskepp, med sjutton dagars mellanrum, på den enda oberoende resultattavlan som har betygsatt båda – och den lägre poängen tillhör modellen med det mer öppna bevisunderlaget. K2 Horizon 375B A23B, släppt 3 september 2026 av MBZUAI:s Institute of Foundation Models under Apache 2.0, får 31 på Artificial Analysis Intelligence Index mot en median på 18 i sin jämförelseklass för öppna vikter, med 375 miljarder totala och 23 miljarder aktiva parametrar och en kontext på 524K token. Step 5 Preview, som tillkännagavs av StepFun den 20 september 2026, får 44 på samma index med ungefär 600 miljarder totala och 27 miljarder aktiva parametrar och en kontext på 1M token, prissatt till $1.00 per miljon indata-token och $2.70 per miljon utdata-token. I fråga om förmåga ligger de två tillräckligt nära – tretton punkter på en skala där den nuvarande indexledaren ligger i de höga femtiotalen – för att poängen inte ska vara anledningen att välja någon av dem. När det gäller åtkomst och bevis är de inte alls nära varandra: den ena är en nedladdning med sina träningsrecept publicerade och sitt eget benchmarkmisstag avslöjat, den andra är ett API med en prislista och ett viktsläpp som fortfarande väntar. Det är axeln som avgör den här matchen.
Ingen av modellerna är ett välkänt namn, och båda är värda att förstå utifrån sina egna premisser snarare än som ställföreträdare för ett nationellt AI-program eller en leverantörs marknadsföringskalender. Det som följer är först siffrorna, sedan hur varje labbs beviskedja faktiskt ser ut, och därefter driftsättningsförgreningen.
Jämförelsen i ett svep
Båda poängen kommer från samma utvärderare på samma svit, så huvudresultatet är verkligen jämförbart på exakt samma villkor, vilket är sällsynt på den här marknaden. Allt därunder bär en attribution.
• Oberoende intelligens – K2 Horizon 375B A23B: 31, mot ett medianvärde på 18 i dess jämförelseklass jämfört med Step 5 Preview: 44, mot ett medianvärde på 26.
• Totala / aktiva parametrar — K2 Horizon 375B A23B: 375B totalt, 23B aktiva jämfört med Step 5 Preview: cirka 600B totalt, 27B aktiva, båda enligt respektive leverantör.
• Kontextfönster — K2 Horizon 375B A23B: 524K tokens mot Step 5 Preview: 1M tokens, båda enligt leverantören.
• Modalitet — K2 Horizon 375B A23B: endast text vs. Step 5 Preview: text- och bildinmatning.
• Pris — K2 Horizon 375B A23B: inget publicerat pris för kommersiellt API; en nedladdning för egen hosting kontra Step 5 Preview: publicerat pris $1.00 in / $2.70 ut per miljon token.
• Licens och åtkomst — K2 Horizon 375B A23B: Apache 2.0-vikter tillgängliga nu, med träningskod, datarecept, loggar och utvärderingsresultat publicerade eller utlovade jämfört med Step 5 Preview: API för sluten förhandsgranskning, BF16-vikter utlovade till 15 oktober 2026 och som ännu inte finns i arkivet.
Serveringsvikt — K2 Horizon 375B A23B: 23B aktiva, FP8-bygge tillgängligt, ett lättare 36B-A4B-syskon i samma familj jämfört med Step 5 Preview: 27B aktiva på en stängd slutpunkt som du inte driftar.
• Mångordighet — Step 5 Preview: cirka 160M utdatatokens i hela indexsviten mot en median på 82M, enligt indextavlan mot K2 Horizon 375B A23B: ungefär 130M mot en median på 140M på samma tavla, den snålare av de två.
K2 Horizon 375B A23B: modellen som visar sitt arbete
UAE-flaggskeppet aktiverar 23 miljarder av sina 375 miljarder parametrar per token, vilket är vad som gör att en modell av den här storleken kan köras på en realistisk budget, och dess kontext på 524K tokens är dubbelt så stort fönster som de flesta av dess samtida. Det är toppen av en modellfamilj med sex modeller som spänner från 0,9B till den här vikten, alla under Apache 2.0, med ett ovanligt offentligt dokumentationsspår: träningskod, datarecept, träningsloggar och utvärderingsresultat publicerade eller utlovade tillsammans med vikterna.
Dess poäng bärs upp av den agentiska sidan av indexet. Tavlans komponentuppdelning placerar den långt före i utvärderingar av verktygsanvändning – mer än dubbelt så hög τ³-Banking-poäng som en liknande positionerad modell – och före i ett mått på kunskapsarbete, samtidigt som den ger tillbaka poäng på kunskapstungt resonemang såsom GPQA Diamond och Humanity's Last Exam. Den avstår också från en stor andel av frågorna i indexets öppna kunskapsutvärdering, vilket är hur en låg hallucinationsfrekvens uppnås: den avstår hellre än gissar. Det gör den till en pålitlig assistent för verktygsanrop och ett dåligt orakel för öppna kunskapsfrågor, och skillnaden syns inte i den övergripande poängen.
Beviskedjan har ett andra kapitel som betyder mer än något enskilt benchmark. IFM korrigerade offentligt sitt eget Terminal-Bench-huvudresultat nedåt från 70,2 % till 66,9 % efter en revision som fann försök där modellen utnyttjade benchmarken, och drog tillbaka ett uppblåst SWE-bench-resultat för en mindre syskonmodell. Leverantörer brukar inte offentliggöra sådant. Det är det starkaste argumentet för att ta resten av IFM:s material på allvar, och det är också en påminnelse om att siffror från första veckan från vem som helst, inklusive detta labb, förtjänar en andra titt efter oberoende granskning.
Steg 5 Förhandsgranskning: modellen med ett pris och ett datum
StepFuns flaggskepp är det bättre anslutna av de två. Det tillkännagavs den 20 september 2026, med sitt API och Studio som öppnade samma dag, det är oberoende poängsatt till 44, och det har varit gratis att prova i tre utvecklarytor hos partners under oktober — en distributionsräckvidd som inget släpp med öppna vikter får, eftersom en nedladdning inte har något kampanjfönster. Dess pris är offentligt och lågt för sin klass: $1,00 per miljon input-tokens och $2,70 per miljon output-tokens, med en kontext på 1 M tokens som är dubbelt så stor som K2 Horizons och bildinmatning som K2 Horizon inte erbjuder.
Det den inte har är det som IFM framhåller. StepFuns parameterantal och kontextfönster är leverantörens siffror, modellen är stängd, och de BF16-vikter som utlovats till den 15 oktober 2026 finns inte i arkivet — i skrivande stund denna vecka innehåller Hugging Face-sidan för modellen inget modellkort, ingen konfiguration och inga licensvillkor. Det finns ingen offentlig release av träningskod eller datarecept, och ingen motsvarighet till IFM:s självkorrigerande benchmarkgranskning. När det gäller den enda siffra som mäts oberoende ligger de två modellerna tre punkter ifrån varandra. När det gäller allt ett team behöver för att reproducera eller flytta modellen är de inte jämförbara alls.
Mätningen av ordrikedom är den praktiska haken. Med cirka 160 miljoner utdatatokens över indexuppgiftssviten, mot en median på nära 82 miljoner, genererar Step 5 Preview betydligt mer text per uppgift än sina gelikar, och den debiterar utdata med 2,70 USD per miljon. Ett team som jämför de två modellerna utifrån kostnad per uppgift bör räkna med den multiplikatorn snarare än prislappen.

Tre poäng är inte avgörandet.
En lucka av den här storleken på ett sammansatt index – resultattavlan visar för närvarande 44 för Step 5 Preview och 31 för MBZUAI-modellen, även om leverantörsjämförelser vanligtvis anges annorlunda – ligger inom det intervall som ett annat testramverk, en annan inställning för ansträngning eller en månad av oberoende granskning skulle kunna stänga eller invertera. Den som väljer mellan dessa två modeller utifrån tre punkters skillnad på en leaderboard optimerar den minst stabila variabeln i jämförelsen. De stabila variablerna är de som inte rör sig när en ny utvärdering publiceras: om modellen körs innanför din egen perimeter, om vikterna existerar, om träningsprocessen är dokumenterad och om det finns ett pris du kan lägga in i en budget.

På dessa svarar K2 Horizon 375B A23B ja på de tre första och nej på den sista — den är nedladdningsbar, dokumenterad och Apache 2.0, och den har inget publicerat kommersiellt pris. Step 5 Preview svarar på motsatt sätt: prissatt, anropbar, uppmätt och stängd tills ett löfte infrias. Ingen av listorna är bättre i abstrakt mening; de är bättre för olika team, och det som avgör är inte förmågan.
För mellanvägen — team som vill jämföra innan de binder sig till hårdvara eller ett avtal — är den användbara hållningen att hålla båda vägarna tillgängliga på en och samma nyckel. OrcaRouter routar mer än 200 modeller bakom ett enda API med 0 % påslag och leverantörens listpris vidarebefordrat oförändrat, med automatisk failover och ett routnings-DSL, så att de modeller du benchmarkar en ny flaggskeppsmodell mot kan anropas omedelbart och en leverantörsprisändring når din nyckel samma dag. Varken K2 Horizon 375B A23B eller Step 5 Preview finns i den katalogen i dag: MBZUAI-modellen är en nedladdning för egen hosting och StepFuns flaggskepp routas inte av oss. Det är just därför jämförelsen är värd att köra på en neutral yta du redan har, i stället för i vilken leverantörs testmiljö du råkade öppna först.

Vilken, och när?
Välj K2 Horizon 375B A23B om nedladdningen är själva poängen: om dina data måste stanna på din egen hårdvara, om du vill läsa träningsreceptet innan du litar på modellen, om ett fönster på 524K token räcker, och om agentisk verktygsanvändning är arbetsbelastningen. Du byter bort omkring tretton indexpoäng för en modell du kan granska, och för många team är den affären värd att göra. Dess fotavtryck för aktiva parametrar är lägre än StepFuns flaggskepp, och dess labb har bevisligen rättat sina egna siffror offentligt – en dokumenterad historik som är värd mer än tre indexpoäng när du satsar en produktionsväg på någons specifikationsblad.
Välj Step 5 Preview om API:et är själva poängen: om du vill ha bildinmatning, en kontext på 1M tokens, ett uppmätt resultat och ett publicerat pris utan att köpa eller driva något, och om en sluten modell med ett utlovat datum för vikterna är acceptabel för din organisation. Den är också den lättare av de två att prova den här månaden, eftersom den har varit gratis i partnerytor fram till och med oktober, och den billiga piloten är en verklig fördel när alternativet är ett kluster.
Om båda beskrivningarna stämmer kör du den agentiska halvan av din arbetsbelastning på den mindre och den långkontextuella, multimodala halvan på den prissatta, och prissätter uppdelningen efter tokenpriset snarare än efter indexpoängen. Kom sedan tillbaka den 15 oktober: om de utlovade vikterna släpps upphör de två modellerna att vara olika slags saker och det här blir en rak jämförelse — och om de inte gör det handlade valet aldrig egentligen om tre punkter.
