
Step 5 Preview vs Muse Glimmer: De Frontier API en het laptopmodel
- OrcaNIEUWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 mln tokens
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
Op een leaderboard liggen Step 5 Preview en Muse Glimmer niet dicht bij elkaar: 44 tegen 17 op de Artificial Analysis Intelligence Index — een gat van zevenentwintig punten op een schaal waarvan de huidige koploper in de hoge vijftig zit — dat geen enkele hoeveelheid tuning zal dichten. Op de vraag die een team daadwerkelijk moet beantwoorden — waar draaien mijn tokens — zijn het directe concurrenten. Step 5 Preview is het vlaggenschip van StepFun, aangekondigd op 20 september 2026, met ongeveer 600 miljard totale parameters en 27 miljard actieve, een context van 1M tokens, geprijsd op $1,00 per miljoen inputtokens en $2,70 per miljoen outputtokens, en alleen via een netwerk bereikbaar. Muse Glimmer is het open-weight agentische model van Meta Superintelligence Labs met 30 miljard parameters, uitgebracht op 10 augustus 2026 onder Apache 2.0, geleverd in 4-bit kwantisatie zodat het onder 20 GB geheugen past en op één consumenten-GPU draait met het netwerk losgekoppeld. De juiste manier om deze combinatie te lezen is niet 'welke slimmer is'. Het is 'welke van de twee beperkingen — capaciteit of perimeter — degene is die je workload niet kan verplaatsen.'
De vergelijking is ook een nuttige correctie op een gewoonte die deze markt heeft opgepikt: een samengestelde indexscore behandelen als de volledige waarde van een model. De kloof van zevenentwintig punten is reëel, en het is niet het enige getal in het dossier. Op het gebied van long-context retrieval plaatst dezelfde onafhankelijke commissie Muse Glimmer binnen een half punt van open-weight modellen uit een veel grotere gewichtsklasse, en Meta's eigen agentische benchmarks zijn respectabel voor een model dat op een laptop draait. Ondertussen is de meest geciteerde zwakte van Step 5 Preview helemaal niet capaciteit maar uitvoerigheid, en het is gesloten totdat de beloofde gewichten op 15 oktober beschikbaar komen.
Twee modellen, twee volledig verschillende objecten
Step 5 Preview is een mixture-of-experts-systeem dat wordt aangeboden via de infrastructuur van StepFun: ongeveer 600B totale parameters, 27B actief per token, tekst- en beeldinvoer, een contextvenster van 1M tokens, en een onafhankelijke Intelligence Index-score van 44 tegen een mediaan van 26 bij vergelijkbare modellen. De uitvoer draait op 87 tokens per seconde tegen een gemiddelde van 78 volgens de meting van diezelfde ranglijst, en het genereerde ongeveer 160 miljoen uitvoertokens over de index-taaksuite, waar het mediane model ongeveer 82 miljoen produceert — ruwweg het dubbele aan tekst per werkeenheid, gefactureerd tegen $2,70 per miljoen. De BF16-gewichten werden beloofd voor 15 oktober 2026 en staan nog niet in de repository, dus vandaag bestaat het model voor u alleen als API.
Muse Glimmer is het tegenovergestelde object. Het is een 30B-parametermodel dat is getraind via logit-distillatie van Meta's grotere Muse Spark-teacher, en vervolgens fijn afgestemd op agentische data met een lange context en versterkt voor toolgebruik. Meta levert het gekwantiseerd naar 4-bit, wat het geheugen terugbrengt van meer dan 55 GB bij volledige precisie naar minder dan 20 GB — binnen een VRAM-envelop van 24 GB of 32 GB — en het werd door Meta getest op een Nvidia RTX 5090 en op Apple M4 Max- en M5 Max-silicon. Het verwerkt tekst- en beeldinvoer in meer dan honderd talen, ondersteunt een context van 131.072 tokens die uitbreidbaar is tot 262.144, en is gebouwd om een doel aan te nemen, het op te splitsen in stappen, tools aan te roepen en een mislukte aanroep opnieuw te proberen in plaats van te stoppen. Het is Apache 2.0 en het werkt offline.
• Onafhankelijke score — Step 5 Preview: 44 tegen een mediaan van 26 in zijn klasse vs Muse Glimmer: 17 op dezelfde index in zijn hoge configuratie.
• Schaal — Step 5 Preview: ongeveer 600B totaal, 27B actief per StepFun vs. Muse Glimmer: 30B totaal, gekwantiseerd naar 4-bit onder 20 GB.
• Contextvenster — Step 5 Preview: 1M tokens vs Muse Glimmer: 131.072, uitbreidbaar tot 262.144, volgens Meta.
• Prijs — Step 5 Preview: $1,00 in / $2,70 uit per miljoen tokens, gepubliceerd versus Muse Glimmer: geen kosten per token; je levert de GPU.
• Waar het draait — Stap 5 Preview: de servers van de leverancier, via HTTP vs Muse Glimmer: je eigen hardware, offline.
• Licentie — Step 5 Preview: besloten preview, gewichten toegezegd voor 15 oktober 2026 vs Muse Glimmer: Apache 2.0, nu downloadbaar.
• Lang-contextretrieval — Muse Glimmer scoort op de evaluatie van het indexboard voor lang-contextredenering, binnen een half punt van modellen die ettelijke keren duurder zijn en dicht genoeg bij de meting van Step 5 dat het verschil niet betekenisvol is.
De zevenentwintig punten, en wat ze niet meten
Een 30B-model dat is gedistilleerd om in 20 GB geheugen te draaien, zal op een algemene intelligentie-index verliezen van een 600B-vlaggenschip, en Meta's eigen materiaal beweert niet het tegendeel — een van zijn formuleringen zegt onomwonden dat Glimmer niet is ontworpen om het ruwe redeneervermogen van cloudmodellen op volledige schaal te evenaren. De score van 17 is dus geen oordeel over de engineering; het is het verwachte resultaat van het afwegen van een ander doel. De juiste vraag is welke van jouw taken de kloof daadwerkelijk dekt.
De long-contextinterpretatie is waar de twee het dichtst bij elkaar komen en waar de intuïtie tekortschiet. Muse Glimmer scoort 80,0 op de long-contextredeneerevaluatie van het leaderboard — een score die voor een frontiermodel niets bijzonders zou zijn en bijzonder is voor een model dat op een consumenten-GPU draait. Als je werk bestaat uit retrieval, samenvatting of extractie over lange documenten, is een lokaal model op dat niveau niet duidelijk het verkeerde gereedschap, en het feit dat het verzoek je machine nooit verlaat, is een eigenschap die je tegen geen enkele prijs via een API kunt kopen.
Dan is er het deel van de vergelijking dat de cijfers van Meta niet laten zien. Een peer-reviewed studie naar multi-agentorkestratie testte Muse-Glimmer-30B in een gecontroleerde opzet — dezelfde taak, dezelfde harness, dezelfde consultants — en stelde vast dat het geen enkele van de kandidaten die door grotere frontier-modellen waren geproduceerd, wist te herstellen, en dat het bij alle drie de pogingen in elke setting faalde. Dat is één enkele studie van één configuratie, en het is het soort bewijs dat een modelpagina nooit naar voren brengt. Voor agentische pijplijnen waarin een zwakkere orchestrator moet herstellen van de fout van een sterker model, is het het meest relevante resultaat voor besluitvorming in dit stuk, en het is de moeite waard om het te lezen voordat je een van de door de leverancier gerapporteerde benchmarks van Meta bekijkt.
Ter volledigheid: die benchmarks zijn van Meta zelf en niet gereproduceerd: 76,0% op SWE-Bench Verified, 51,2% op SWE-Bench Pro, 51,7% op TerminalBench 2.1, 65,9% op OSWorld-Verified, 83,5% op GPQA Diamond, 22% op Humanity's Last Exam en 75,5 op MCP-Atlas. Ze worden afgezet tegen modellen in dezelfde grootteklasse, en ze beschrijven een capabele lokale agent in plaats van een frontier-redeneerder.

Waar de grens eigenlijk valt
Het structurele voordeel van Step 5 Preview is dat het werk doet dat je lokaal niet kunt doen. Een context van 1M tokens, beeldinvoer, een gemeten score die aan de frontier grenst en 87 outputtokens per seconde zonder hardware te hoeven kopen: voor het maken van concepten, plannen, code review in een grote repository, of alles waarbij het plafond van het model de bottleneck is, wint de API, en zijn de zevenentwintig punten het hele argument. De prijs daarvoor is het tegenovergestelde van die van Muse Glimmer: prompts verlaten je perimeter, de prijs wordt bij elke token opnieuw toegepast, en de breedsprakigheid van het model maakt workloads met lange output duurder dan het tarief van $2,70 suggereert.

Het voordeel van Muse Glimmer is dat het het werk doet dat niet weg kan. Als de gegevens aan regelgeving onderhevig zijn, als het latentiebudget een paar milliseconden is, als de machine offline is, of als de marginale kosten van het miljoenste verzoek nul moeten zijn, dan is geen enkele API een kandidaat — niet deze, niet welke dan ook. De prijs daarvoor is capaciteit: je kiest een 17 waar een 44 bestaat, en bij agentische orkestratie kies je misschien een coördinator die niet kan herstellen van de fouten van een sterker model.
Voor de meeste teams is het antwoord geen keuze maar een splitsing, en die splitsing moet ergens een plek hebben. OrcaRouter routeert meer dan 200 modellen achter één API-sleutel en één factuur tegen 0% opslag, met doorgegeven lijstprijs van de provider, plus automatische failover en een routing-DSL om verkeer te sturen op basis van taak, kosten of latentie. Noch Step 5 Preview noch Muse Glimmer staan in die catalogus — het vlaggenschip van StepFun wordt niet door ons gerouteerd en Glimmer is een lokale download — dus de waarde die wordt geboden is niet de toegang tot een van beide modellen. Het is de set waarmee je ze zou benchmarken, vandaag aanroepbaar met één sleutel, zodat de beslissing lokaal-versus-remote wordt bepaald door je eigen taakverdeling in plaats van door de pagina van welke leverancier je het laatst hebt gelezen.

Hoe te beslissen
Kies Step 5 Preview wanneer het plafond de beperkende factor is. Als je taken open-ended, multimodaal, long-context of agentisch zijn in de zin dat er een capabele planner nodig is, is het API-model het enige van de twee dat ze aankan, en zijn prijs is voor zijn klasse laag genoeg dat een pilot ermee een begrotingspost is in plaats van een project. Reken op breedsprakigheid, houd rekening met uitstel van de gewichtsdatum van 15 oktober, en houd de workloads die het gebouw niet mogen verlaten erbuiten.
Kies Muse Glimmer wanneer de perimeter de beperkende factor is. Als je gegevens niet verzonden kunnen worden, als je moet kunnen draaien in een vliegtuig of in een fabriek, of als je volumes de per-tokenprijs absurd maken, dan is een 30B Apache-2.0-model dat in 20 GB past de praktische keuze, en het resultaat van de lange-contextretrieval is goed genoeg dat het verschil in capaciteiten niet in elke workload zichtbaar zal zijn. Test het in orchestratie voordat je er in die context op vertrouwt, want daar is het onafhankelijke bewijs het zwakst.
Als beide beperkingen tegelijk knellen, voer dan beide uit: lokaal voor de gegevens die niet kunnen verhuizen, API voor de taken die een groter model nodig hebben, en laat de routeringsbeslissing een configuratiewijziging zijn in plaats van een migratie. De vergelijking die ertoe doet is niet 44 tegenover 17. Het is welke van je verzoeken het zich kunnen veroorloven de machine te verlaten, en dat is een vraag die alleen je eigen verkeer kan beantwoorden.
