
Step 5 Preview vs K2 Horizon 375B A23B: Dicht bij elkaar qua score, ver uit elkaar qua bewijs
- OrcaNIEUWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 mln tokens
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
Twee bijna-open vlaggenschepen, zeventien dagen na elkaar, op het enige onafhankelijke scorebord dat beide heeft gescoord — en de lagere score is voor het model met het meer open bewijsspoor. K2 Horizon 375B A23B, uitgebracht op 3 september 2026 door MBZUAI's Institute of Foundation Models onder Apache 2.0, scoort 31 op de Artificial Analysis Intelligence Index tegen een mediaan van 18 in zijn open-weights-vergelijkingsklasse, met 375 miljard totale en 23 miljard actieve parameters en een context van 524K tokens. Step 5 Preview, aangekondigd door StepFun op 20 september 2026, scoort 44 op dezelfde index met ruwweg 600 miljard totale en 27 miljard actieve parameters en een context van 1M tokens, geprijsd op $1,00 per miljoen inputtokens en $2,70 per miljoen outputtokens. Qua capaciteit liggen de twee dicht genoeg bij elkaar — dertien punten op een schaal waar de huidige koploper van de index in de hoge vijftig zit — dat de score niet de reden is om een van beide te kiezen. Qua toegang en qua bewijs liggen ze helemaal niet dicht bij elkaar: de ene is een download met gepubliceerde trainingsrecepten en een toegegeven eigen benchmarkfout, de andere is een API met een prijslijst en een gewichtsrelease die nog steeds op zich laat wachten. Dat is de as die deze confrontatie beslist.
Geen van beide modellen is een bekende naam, en beide zijn het waard om op hun eigen merites te worden begrepen in plaats van als proxy voor een nationaal AI-programma of de marketingkalender van een leverancier. Wat volgt: eerst de cijfers, dan hoe het bewijsspoor van elk lab er daadwerkelijk uitziet, en dan de deployment-tweesprong.
De vergelijking in één doorgang
Beide scores komen van dezelfde evaluator op dezelfde suite, dus de headline is echt een appels-met-appels-vergelijking, wat zeldzaam is in deze markt. Alles daaronder is voorzien van een bronvermelding.
• Onafhankelijke intelligentie — K2 Horizon 375B A23B: 31, tegenover een mediaan van 18 in zijn vergelijkingsklasse vs Step 5 Preview: 44, tegenover een mediaan van 26.
• Totaal / actieve parameters — K2 Horizon 375B A23B: 375B totaal, 23B actief tegenover Step 5 Preview: ongeveer 600B totaal, 27B actief, beide volgens hun leveranciers.
• Contextvenster — K2 Horizon 375B A23B: 524K tokens vs Step 5 Preview: 1M tokens, beide volgens opgave van de leverancier.
• Modaliteit — K2 Horizon 375B A23B: alleen tekst vs Step 5 Preview: tekst- en beeldinvoer.
• Prijs — K2 Horizon 375B A23B: geen gepubliceerde commerciële API-prijs; een self-hostdownload versus Step 5 Preview: $1,00 in / $2,70 uit per miljoen tokens, gepubliceerd.
Licentie en — K2 Horizon 375B A23B: 2 gewichten beschikbaar, met trainingscode, datarecepten, logs en evaluatieresultaten of toegezegd vs. Step 5 Preview: gesloten preview-API, BF16-gewichten beloofd voor 15 oktober 2026 en nog niet aanwezig in de repository.
• Serveergewicht — K2 Horizon 375B A23B: 23B actief, FP8-build beschikbaar, een lichter 36B-A4B-broertje in dezelfde familie vs Step 5 Preview: 27B actief op een gesloten endpoint dat u niet beheert.
• Uitgebreidheid — Step 5 Preview: ongeveer 160M outputtokens over de indexsuite tegen een mediaan van 82M, volgens het indexboard, versus K2 Horizon 375B A23B: ruwweg 130M tegen een mediaan van 140M op hetzelfde board, de zuinigere van de twee.
K2 Horizon 375B A23B: het model dat zijn werkwijze toont
Het UAE-vlaggenschip activeert 23 miljard van zijn 375 miljard parameters per token, waardoor een model van deze omvang op een realistisch budget kan draaien, en de context van 524K tokens is twee keer zo groot als het venster van de meeste van zijn tijdgenoten. Het is de top van een familie van zes modellen die loopt van 0,9B tot dit gewicht, allemaal Apache 2.0, met een ongewoon openbaar paper trail: trainingscode, datarecepten, trainingslogs en evaluatieresultaten die samen met de gewichten zijn gepubliceerd of toegezegd.
De score wordt gedragen door de agentische kant van de index. De componentenopsplitsing van het scorebord zet het ruim voorop bij evaluaties van toolgebruik — meer dan het dubbele van de τ³-Banking-score van een vergelijkbaar gepositioneerd model — en voorop bij een maatstaf voor kenniswerk, terwijl het punten inlevert op kennisintensief redeneren zoals GPQA Diamond en Humanity's Last Exam. Het wijst ook een groot deel van de vragen in de openkennisevaluatie van de index af, en dat is hoe een lage hallucinatiegraad wordt bereikt: het onthoudt zich van een antwoord in plaats van te gokken. Daardoor is het een betrouwbare assistent voor het aanroepen van tools en een zwak orakel voor open kennis, en dat onderscheid is niet zichtbaar in de hoofdscore.
Het bewijsspoor heeft een tweede hoofdstuk dat meer ertoe doet dan welke afzonderlijke benchmark dan ook. IFM corrigeerde zijn eigen Terminal-Bench-kop publiekelijk naar beneden van 70,2% naar 66,9% nadat een audit trials vond waarin het model de benchmark uitbuitte, en trok een opgeblazen SWE-bench-resultaat in voor een kleinere variant. Leveranciers publiceren dat gewoonlijk niet. Het is het sterkste argument om de rest van IFM's materiaal serieus te nemen, en het is ook een herinnering dat cijfers uit de eerste week van wie dan ook, inclusief dit lab, een tweede blik verdienen na onafhankelijke toetsing.
Stap 5 Voorvertoning: het model met een prijs en een datum
Het vlaggenschip van StepFun is het best aangesloten van de twee. Het werd op 20 september 2026 aangekondigd, met zijn API en Studio die dezelfde dag openden, het heeft een onafhankelijke score van 44, en het was in oktober gratis uit te proberen in drie ontwikkelaarsoppervlakken van partners — een distributiebereik dat geen enkele open-weight release krijgt, omdat een download geen promotievenster heeft. De prijs is openbaar en laag voor zijn klasse: $1,00 per miljoen inputtokens en $2,70 per miljoen outputtokens, met een 1M-tokencontext die twee keer zo groot is als die van K2 Horizon, en beeldinvoer die K2 Horizon niet biedt.
Wat het niet heeft, is precies datgene waar IFM mee vooroploopt. De parameteraantallen en het contextvenster van StepFun zijn leverancierscijfers, het model is gesloten, en de BF16-gewichten die voor 15 oktober 2026 waren beloofd, staan niet in de repository — vanaf deze week bevat de Hugging Face-pagina voor het model geen modelkaart, geen configuratie en geen licentievoorwaarden. Er is geen openbare release van trainingscode of data-recept, en geen equivalent van IFM's zelfgecorrigeerde benchmarkaudit. Op het ene cijfer dat onafhankelijk wordt gemeten, liggen de twee modellen drie punten uit elkaar. Op alles wat een team nodig heeft om het model te reproduceren of te verplaatsen, zijn ze totaal niet vergelijkbaar.
De verbositeitsmeting is de praktische complicatie. Met ongeveer 160 miljoen outputtokens over de hele index-taaksuite tegenover een mediaan van bijna 82 miljoen genereert Step 5 Preview aanzienlijk meer tekst per taak dan vergelijkbare modellen, en het brengt output in rekening tegen $2,70 per miljoen. Een team dat de twee modellen vergelijkt op kosten per taak, zou die vermenigvuldigingsfactor moeten meenemen in plaats van het gepubliceerde tarief.

Drie punten zijn niet de beslissing
Een gat van deze grootte op een samengestelde index — het bord geeft momenteel 44 aan voor Step 5 Preview en 31 voor het MBZUAI-model, hoewel vergelijkingen tussen leveranciers doorgaans anders worden weergegeven — valt binnen het bereik dat een andere harness, een andere effort-instelling of een maand van onafhankelijke controle zou kunnen dichten of omkeren. Wie op basis van drie punten op een ranglijst tussen deze twee modellen kiest, optimaliseert de minst stabiele variabele in de vergelijking. De stabiele variabelen zijn degenen die niet verschuiven wanneer een nieuwe evaluatie verschijnt: of het model binnen je perimeter draait, of de gewichten bestaan, of het trainingsproces gedocumenteerd is, en of er een prijs is die je in een budget kunt opnemen.

Op die punten antwoordt K2 Horizon 375B A23B ja op de eerste drie en nee op de laatste — het is downloadbaar, gedocumenteerd en Apache 2.0, en er is geen gepubliceerde commerciële prijs. Step 5 Preview antwoordt het tegenovergestelde: geprijsd, aanroepbaar, gemeten en gesloten totdat een belofte wordt nagekomen. Geen van beide lijsten is in abstracto beter; ze zijn beter voor verschillende teams, en de beslissende factor is niet het vermogen.
Voor de middenweg — teams die willen vergelijken voordat ze zich vastleggen op hardware of een contract — is de nuttige aanpak om beide routes beschikbaar te houden op één key. OrcaRouter routeert meer dan 200 modellen achter één enkele API met 0% markup en geeft de lijstprijs van de provider door, met automatische failover en een routing-DSL, zodat de modellen waarmee je een nieuw vlaggenschipmodel vergelijkt direct oproepbaar zijn en een prijswijziging van een leverancier dezelfde dag je key bereikt. Noch K2 Horizon 375B A23B noch Step 5 Preview staat vandaag in die catalogus: het MBZUAI-model is een self-hostdownload en het vlaggenschip van StepFun wordt niet door ons gerouteerd. Dat is precies waarom de vergelijking de moeite waard is op een neutraal oppervlak dat je al hebt, in plaats van op de playground van welke leverancier je ook maar het eerst hebt geopend.

Welke, en wanneer?
Kies K2 Horizon 375B A23B als de download het belangrijkste is: als je data op je eigen hardware moet blijven, als je het trainingsrecept wilt lezen voordat je het model vertrouwt, als een venster van 524K tokens genoeg is, en als agentisch toolgebruik de workload is. Je ruilt ongeveer dertien indexpunten in voor een model dat je kunt inspecteren, en voor veel teams is die ruil de moeite waard. De actieve-parameter-voetafdruk is kleiner dan die van het StepFun-vlaggenschip, en het lab heeft aantoonbaar zijn eigen cijfers publiekelijk gecorrigeerd — een trackrecord dat meer waard is dan drie indexpunten wanneer je een productietraject inzet op iemands specificatieblad.
Kies Step Preview als het om de API gaat: als u beeldinvoer wilt, een context van 1M tokens, een gemeten en gepubliceerde prijs zonder te kopen of te exploiteren, en als een gesloten model met een gewichtsdatum acceptabel is voor uw organisatie. Het is deze maand ook een van de twee om te proberen, want het was tot en met oktober gratis in partner-oppervlakken, en de goedkope pilot is een echt voordeel wanneer het alternatief een cluster is.
Als beide beschrijvingen passen, draai je het agentische deel van je workload op de kleinere en het longcontext-, multimodale deel op de geprijsde, en prijs je de splitsing op het tokentarief in plaats van op de indexscore. Kom dan op 15 oktober terug: als de beloofde weights arriveren, houden de twee modellen op verschillende soorten dingen te zijn en wordt dit een rechtstreekse vergelijking — en als ze niet arriveren, ging de keuze nooit echt om drie punten.
