Gegenereerde herokaart met als titel 'Step 5 Preview vs Muse Glimmer - de API en de laptop'. Linkerkaart 'Step 5 Preview' vermeldt: AA Index 44 tegenover een klassemediaan van 26, StepFun, aangekondigd op 20 september 2026, ongeveer 600B totaal / 27B actief, 1M-tokencontext, $1,00 in / $2,70 uit per 1M tokens, draait op de servers van de leverancier. Rechterkaart 'Muse Glimmer' vermeldt: AA Index 17, Meta Superintelligence Labs, uitgebracht op 10 augustus 2026, 30B parameters in 4-bit onder 20 GB, 131K-tokencontext uitbreidbaar tot 262K, Apache 2.0, draait offline op je eigen GPU. Een voettekst vermeldt: 'Indexcijfers volgens Artificial Analysis; specificaties van Muse Glimmer volgens Meta.'
Guides & Insights

Step 5 Preview vs Muse Glimmer: De Frontier API en het laptopmodel

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op een leaderboard liggen Step 5 Preview en Muse Glimmer niet dicht bij elkaar: 44 tegen 17 op de Artificial Analysis Intelligence Index — een gat van zevenentwintig punten op een schaal waarvan de huidige koploper in de hoge vijftig zit — dat geen enkele hoeveelheid tuning zal dichten. Op de vraag die een team daadwerkelijk moet beantwoorden — waar draaien mijn tokens — zijn het directe concurrenten. Step 5 Preview is het vlaggenschip van StepFun, aangekondigd op 20 september 2026, met ongeveer 600 miljard totale parameters en 27 miljard actieve, een context van 1M tokens, geprijsd op $1,00 per miljoen inputtokens en $2,70 per miljoen outputtokens, en alleen via een netwerk bereikbaar. Muse Glimmer is het open-weight agentische model van Meta Superintelligence Labs met 30 miljard parameters, uitgebracht op 10 augustus 2026 onder Apache 2.0, geleverd in 4-bit kwantisatie zodat het onder 20 GB geheugen past en op één consumenten-GPU draait met het netwerk losgekoppeld. De juiste manier om deze combinatie te lezen is niet 'welke slimmer is'. Het is 'welke van de twee beperkingen — capaciteit of perimeter — degene is die je workload niet kan verplaatsen.'

De vergelijking is ook een nuttige correctie op een gewoonte die deze markt heeft opgepikt: een samengestelde indexscore behandelen als de volledige waarde van een model. De kloof van zevenentwintig punten is reëel, en het is niet het enige getal in het dossier. Op het gebied van long-context retrieval plaatst dezelfde onafhankelijke commissie Muse Glimmer binnen een half punt van open-weight modellen uit een veel grotere gewichtsklasse, en Meta's eigen agentische benchmarks zijn respectabel voor een model dat op een laptop draait. Ondertussen is de meest geciteerde zwakte van Step 5 Preview helemaal niet capaciteit maar uitvoerigheid, en het is gesloten totdat de beloofde gewichten op 15 oktober beschikbaar komen.

Twee modellen, twee volledig verschillende objecten

Step 5 Preview is een mixture-of-experts-systeem dat wordt aangeboden via de infrastructuur van StepFun: ongeveer 600B totale parameters, 27B actief per token, tekst- en beeldinvoer, een contextvenster van 1M tokens, en een onafhankelijke Intelligence Index-score van 44 tegen een mediaan van 26 bij vergelijkbare modellen. De uitvoer draait op 87 tokens per seconde tegen een gemiddelde van 78 volgens de meting van diezelfde ranglijst, en het genereerde ongeveer 160 miljoen uitvoertokens over de index-taaksuite, waar het mediane model ongeveer 82 miljoen produceert — ruwweg het dubbele aan tekst per werkeenheid, gefactureerd tegen $2,70 per miljoen. De BF16-gewichten werden beloofd voor 15 oktober 2026 en staan nog niet in de repository, dus vandaag bestaat het model voor u alleen als API.

Muse Glimmer is het tegenovergestelde object. Het is een 30B-parametermodel dat is getraind via logit-distillatie van Meta's grotere Muse Spark-teacher, en vervolgens fijn afgestemd op agentische data met een lange context en versterkt voor toolgebruik. Meta levert het gekwantiseerd naar 4-bit, wat het geheugen terugbrengt van meer dan 55 GB bij volledige precisie naar minder dan 20 GB — binnen een VRAM-envelop van 24 GB of 32 GB — en het werd door Meta getest op een Nvidia RTX 5090 en op Apple M4 Max- en M5 Max-silicon. Het verwerkt tekst- en beeldinvoer in meer dan honderd talen, ondersteunt een context van 131.072 tokens die uitbreidbaar is tot 262.144, en is gebouwd om een doel aan te nemen, het op te splitsen in stappen, tools aan te roepen en een mislukte aanroep opnieuw te proberen in plaats van te stoppen. Het is Apache 2.0 en het werkt offline.

• Onafhankelijke score — Step 5 Preview: 44 tegen een mediaan van 26 in zijn klasse vs Muse Glimmer: 17 op dezelfde index in zijn hoge configuratie.

• Schaal — Step 5 Preview: ongeveer 600B totaal, 27B actief per StepFun vs. Muse Glimmer: 30B totaal, gekwantiseerd naar 4-bit onder 20 GB.

• Contextvenster — Step 5 Preview: 1M tokens vs Muse Glimmer: 131.072, uitbreidbaar tot 262.144, volgens Meta.

• Prijs — Step 5 Preview: $1,00 in / $2,70 uit per miljoen tokens, gepubliceerd versus Muse Glimmer: geen kosten per token; je levert de GPU.

• Waar het draait — Stap 5 Preview: de servers van de leverancier, via HTTP vs Muse Glimmer: je eigen hardware, offline.

• Licentie — Step 5 Preview: besloten preview, gewichten toegezegd voor 15 oktober 2026 vs Muse Glimmer: Apache 2.0, nu downloadbaar.

• Lang-contextretrieval — Muse Glimmer scoort op de evaluatie van het indexboard voor lang-contextredenering, binnen een half punt van modellen die ettelijke keren duurder zijn en dicht genoeg bij de meting van Step 5 dat het verschil niet betekenisvol is.

De zevenentwintig punten, en wat ze niet meten

Een 30B-model dat is gedistilleerd om in 20 GB geheugen te draaien, zal op een algemene intelligentie-index verliezen van een 600B-vlaggenschip, en Meta's eigen materiaal beweert niet het tegendeel — een van zijn formuleringen zegt onomwonden dat Glimmer niet is ontworpen om het ruwe redeneervermogen van cloudmodellen op volledige schaal te evenaren. De score van 17 is dus geen oordeel over de engineering; het is het verwachte resultaat van het afwegen van een ander doel. De juiste vraag is welke van jouw taken de kloof daadwerkelijk dekt.

De long-contextinterpretatie is waar de twee het dichtst bij elkaar komen en waar de intuïtie tekortschiet. Muse Glimmer scoort 80,0 op de long-contextredeneerevaluatie van het leaderboard — een score die voor een frontiermodel niets bijzonders zou zijn en bijzonder is voor een model dat op een consumenten-GPU draait. Als je werk bestaat uit retrieval, samenvatting of extractie over lange documenten, is een lokaal model op dat niveau niet duidelijk het verkeerde gereedschap, en het feit dat het verzoek je machine nooit verlaat, is een eigenschap die je tegen geen enkele prijs via een API kunt kopen.

Dan is er het deel van de vergelijking dat de cijfers van Meta niet laten zien. Een peer-reviewed studie naar multi-agentorkestratie testte Muse-Glimmer-30B in een gecontroleerde opzet — dezelfde taak, dezelfde harness, dezelfde consultants — en stelde vast dat het geen enkele van de kandidaten die door grotere frontier-modellen waren geproduceerd, wist te herstellen, en dat het bij alle drie de pogingen in elke setting faalde. Dat is één enkele studie van één configuratie, en het is het soort bewijs dat een modelpagina nooit naar voren brengt. Voor agentische pijplijnen waarin een zwakkere orchestrator moet herstellen van de fout van een sterker model, is het het meest relevante resultaat voor besluitvorming in dit stuk, en het is de moeite waard om het te lezen voordat je een van de door de leverancier gerapporteerde benchmarks van Meta bekijkt.

Ter volledigheid: die benchmarks zijn van Meta zelf en niet gereproduceerd: 76,0% op SWE-Bench Verified, 51,2% op SWE-Bench Pro, 51,7% op TerminalBench 2.1, 65,9% op OSWorld-Verified, 83,5% op GPQA Diamond, 22% op Humanity's Last Exam en 75,5 op MCP-Atlas. Ze worden afgezet tegen modellen in dezelfde grootteklasse, en ze beschrijven een capabele lokale agent in plaats van een frontier-redeneerder.

Generated two-column scoreboard card titled 'Step 5 Preview vs Muse Glimmer - the scoreboard'. The left column gives Step 5 Preview an independent index of 44, the vendor's servers as the runtime, closed preview weights, $1.00 / $2.70 per 1M tokens, about 160M output tokens against an 82M median, and wins on capability ceiling, 1M context and image input. The right column gives Muse Glimmer an independent index of 17, your own GPU offline as the runtime, Apache 2.0 weights, no per-token charge, a long-context retrieval score of 80.0 within half a point of much larger models, and wins on privacy perimeter, zero marginal cost and portability. A footer reads 'Index and long-context figures per Artificial Analysis; Muse Glimmer specifications per Meta, vendor-reported.'

Waar de grens eigenlijk valt

Het structurele voordeel van Step 5 Preview is dat het werk doet dat je lokaal niet kunt doen. Een context van 1M tokens, beeldinvoer, een gemeten score die aan de frontier grenst en 87 outputtokens per seconde zonder hardware te hoeven kopen: voor het maken van concepten, plannen, code review in een grote repository, of alles waarbij het plafond van het model de bottleneck is, wint de API, en zijn de zevenentwintig punten het hele argument. De prijs daarvoor is het tegenovergestelde van die van Muse Glimmer: prompts verlaten je perimeter, de prijs wordt bij elke token opnieuw toegepast, en de breedsprakigheid van het model maakt workloads met lange output duurder dan het tarief van $2,70 suggereert.

Screenshot of the Artificial Analysis model page for Muse Glimmer in its high configuration, headed 'Muse Glimmer (High) Intelligence, Performance & Price Analysis', showing Meta as the creator, an open-weights release date of August 2026, an Intelligence Index of 17, and a 131k-token context window with text and image input.

Het voordeel van Muse Glimmer is dat het het werk doet dat niet weg kan. Als de gegevens aan regelgeving onderhevig zijn, als het latentiebudget een paar milliseconden is, als de machine offline is, of als de marginale kosten van het miljoenste verzoek nul moeten zijn, dan is geen enkele API een kandidaat — niet deze, niet welke dan ook. De prijs daarvoor is capaciteit: je kiest een 17 waar een 44 bestaat, en bij agentische orkestratie kies je misschien een coördinator die niet kan herstellen van de fouten van een sterker model.

Voor de meeste teams is het antwoord geen keuze maar een splitsing, en die splitsing moet ergens een plek hebben. OrcaRouter routeert meer dan 200 modellen achter één API-sleutel en één factuur tegen 0% opslag, met doorgegeven lijstprijs van de provider, plus automatische failover en een routing-DSL om verkeer te sturen op basis van taak, kosten of latentie. Noch Step 5 Preview noch Muse Glimmer staan in die catalogus — het vlaggenschip van StepFun wordt niet door ons gerouteerd en Glimmer is een lokale download — dus de waarde die wordt geboden is niet de toegang tot een van beide modellen. Het is de set waarmee je ze zou benchmarken, vandaag aanroepbaar met één sleutel, zodat de beslissing lokaal-versus-remote wordt bepaald door je eigen taakverdeling in plaats van door de pagina van welke leverancier je het laatst hebt gelezen.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

Hoe te beslissen

Kies Step 5 Preview wanneer het plafond de beperkende factor is. Als je taken open-ended, multimodaal, long-context of agentisch zijn in de zin dat er een capabele planner nodig is, is het API-model het enige van de twee dat ze aankan, en zijn prijs is voor zijn klasse laag genoeg dat een pilot ermee een begrotingspost is in plaats van een project. Reken op breedsprakigheid, houd rekening met uitstel van de gewichtsdatum van 15 oktober, en houd de workloads die het gebouw niet mogen verlaten erbuiten.

Kies Muse Glimmer wanneer de perimeter de beperkende factor is. Als je gegevens niet verzonden kunnen worden, als je moet kunnen draaien in een vliegtuig of in een fabriek, of als je volumes de per-tokenprijs absurd maken, dan is een 30B Apache-2.0-model dat in 20 GB past de praktische keuze, en het resultaat van de lange-contextretrieval is goed genoeg dat het verschil in capaciteiten niet in elke workload zichtbaar zal zijn. Test het in orchestratie voordat je er in die context op vertrouwt, want daar is het onafhankelijke bewijs het zwakst.

Als beide beperkingen tegelijk knellen, voer dan beide uit: lokaal voor de gegevens die niet kunnen verhuizen, API voor de taken die een groter model nodig hebben, en laat de routeringsbeslissing een configuratiewijziging zijn in plaats van een migratie. De vergelijking die ertoe doet is niet 44 tegenover 17. Het is welke van je verzoeken het zich kunnen veroorloven de machine te verlaten, en dat is een vraag die alleen je eigen verkeer kan beantwoorden.