Een titelkaart voor 'Muse Spark 1.2 vs GLM-5.2 — de gesloten codeur versus de open generalist', met Muse Spark 1.2 weergegeven onder een GESLOTEN hangslotpictogram en GLM-5.2 onder een OPEN doospictogram.
Guides & Insights

Muse Spark 1.2 vs GLM 5.2: De gesloten coder versus de open generalist

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Twee contextmodellen met 1.000.000 tokens, binnen vijftien cent van elkaar geprijsd per miljoen tokens, beide gericht op code-intensief agentwerk — en verder hebben ze bijna niets gemeen. Muse Spark 1.2, die Meta op 5 augustus 2026 uitbracht naast een meegetrainde terminalagent genaamd Muse Code, heeft gesloten gewichten, is goedkoper per token, scoort 57 op de huidige Artificial Analysis Intelligence Index, en kan niet antwoorden zonder eerst te redeneren. GLM 5.2, het vlaggenschip open-weights model van Z.ai van medio juni, heeft een MIT-licentie, is zelf te hosten, is ongeveer vijf keer sneller tot de eerste token, en verwerkt nog steeds vier en een half keer meer echt verkeer via onze gateway — 213 miljoen tokens in de afgelopen zeven dagen tegenover de 46 miljoen van Muse Spark 1.2. Het model dat hoger scoort en goedkoper is per token, is het model met minder verkeer. Het open model is het model waarnaar mensen daadwerkelijk routeren.

De eerlijke versie van dat feit is waar dit artikel over gaat. Scoring en prijsstelling bepalen minder dan hoe een model in je pipeline past, en deze twee maken tegenovergestelde keuzes op elke as die de pasvorm bepaalt. Waar onafhankelijke cijfers bestaan, komen ze van Artificial Analysis; waar ze van Meta of Z.ai komen, zijn ze gelabeld als door de leverancier gerapporteerd; de latentie- en verkeerscijfers zijn de eigen zeven dagen durende productietelemetrie van OrcaRouter.

Het spec-contrast, één dimensie tegelijk

Prijs — Muse Spark 1.2 voor $1,25 in / $4,25 uit per miljoen tokens, $0,15 bij een cache-hit; GLM 5.2 voor $1,40 in / $4,40 uit, $0,26 gecached. Meta is op elke rij goedkoper.

Context — beide 1.048.576 tokens. Maximale output: Meta documenteert een plafond van 131.072 tokens voor Muse Spark 1.2; GLM 5.2 verklaart 128.000.

Redeneren — redeneren is verplicht op Muse Spark 1.2 over vijf inspanningsniveaus (minimal tot xhigh, standaard medium); GLM 5.2 voert hybride redenering uit, geregeld door reasoning_effort op high of max, met diepe redenering standaard ingeschakeld.

Invoer — Muse Spark 1.2 adverteert tekst-, beeld-, video-, audio- en PDF-invoer; GLM 5.2 is tekst-in, tekst-uit.

Gewichten — Muse Spark 1.2 is gesloten, zonder repository en zonder self-host-pad; GLM 5.2 wordt geleverd met MIT-gelicenseerde open gewichten, een Mixture-of-Experts met 753B parameters en ongeveer 40B actief per token.

Leeftijd — Muse Spark 1.2 is drie dagen oud op het moment van schrijven; GLM 5.2 is sinds 13 juni in productie, met acht weken praktijkervaring en een heel ecosysteem van hosts en tools dat eromheen is gebouwd.

De indexkloof is vier punten. De versieval is echt.

De huidige Intelligence Index (v4.1.1) van Artificial Analysis scoort Muse Spark 1.2 op 57, gerangschikt op nummer 12 van 185, en GLM 5.2 op 53 — de hoogste open-weights score op het bord, maar vier punten achter. De meeste berichtgeving vermeldt nog steeds 54 voor Muse Spark 1.2, omdat dat is wat de evaluatie op de lanceringsdag rapporteerde; de herberekening van v4.1.1 voegde er 2,7 punten aan toe, de grootste stijging van elk model in die update. Als je ergens "54 vs 51" of "54 vs 53" ziet, controleer dan op welke indexversie elk getal betrekking heeft voordat je het verschil als reëel beschouwt.

Het is de moeite waard om te zeggen wat het vierpuntsverschil wel en niet betekent. Het betekent dat op de samengestelde negen benchmarks Meta's gesloten model voorligt op Z.ai's open model bij vergelijkbare inspanning. Het betekent niet dat Muse Spark 1.2 GLM 5.2 op alles verslaat, want de twee modellen behalen hun scores via verschillende routes. GLM 5.2 is een uitschieter op wiskunde en redeneren — AIME 2026 op 99,2 — maar het staat erom bekend omslachtig te zijn, en het zwakke punt is diepgaand werk op repositorieschaal. Muse Spark 1.2 is het tegenovergestelde: sterk in terminalcoding en taken met meerdere bestanden, en aanzienlijk goedkoper per taak om te evalueren, omdat het tijdens het denken veel minder tokens verbruikt.

A two-column scoreboard for Muse Spark 1.2 and GLM-5.2. AA Index (v4.1.1): 57 vs 53. Terminal-Bench 2.1: 80.1 vs 77.9. DeepSWE 1.1: 59.3 (Meta) vs 46.2. Weights: closed vs MIT open. Price in/out: $1.25/$4.25 vs $1.40/$4.40. p50 TTFT: 8.13 s vs 1.55 s.

Waar de benchmarks daadwerkelijk uiteenlopen

Op Terminal-Bench 2.1 liggen de twee dichter bij elkaar dan de indexkloof doet vermoeden, en de herkomst doet er meer toe dan gebruikelijk. Op dezelfde Artificial Analysis-harness scoort Muse Spark 1.2 80.1 en GLM 5.2 77.9. Meta claimt 82.9 voor Muse Spark 1.2 op zijn eigen harness; het hoogst gerapporteerde cijfer van Z.ai voor GLM 5.2 is 82.7, wat het tot het eerste open-weight model boven de 80 op die benchmark maakte. Zelfde benchmark, vier verschillende getallen — de specifieke combinatie van model en harness verschuift deze scores met meerdere punten in beide richtingen, dus behandel elke bewering over één enkele Terminal-Bench als een bereik.

Het verschil waar je op moet letten is DeepSWE 1.1, de benchmark die diepgaand redeneren over meerdere bestanden op repository-schaal benadrukt binnen een lange agent-loop. Meta rapporteert 59,3 voor Muse Spark 1.2 — een cijfer van de leverancier, nog geen derde partij heeft het gereproduceerd. GLM 5.2's gepubliceerde DeepSWE is 46,2, en zijn voorganger GLM-5.1 stond op 18,0, dus dit is de dimensie waarin Z.ai het meest is verbeterd en waarop het nog steeds achterblijft. Als jouw workload bestaat uit "vijftig bestanden coherent veranderen", vertelt dat verschil het hele verhaal; als jouw workload uit terminalcommando's en scaffolding bestaat, is het amper merkbaar.

Nog een bevinding die de voor de hand liggende framing op zijn kop zet. De onafhankelijke Vals AI-suite, die agentworkloads per domein draait, plaatst Muse Spark 1.2 op de vijfde plaats overall met 71,88% — en eerste op Finance Agent, eerste op TaxEval, en eerste op Harvey's Legal Agent-benchmark, tegen respectievelijk 44, 136 en 31 modellen — terwijl Terminal-Bench 2.1 slechts het veertiende beste domein is van de vijftig. Meta verkocht dit model als coder, en een onafhankelijke evaluator ontdekte dat het het sterkst is in finance-, belasting- en juridische documentagents. Als je team contracten opstelt of grootboeken reconcilieert, is dat veruit het meest bruikbare cijfer in dit artikel.

De open-weights-kwestie is het echte keerpunt.

Al het bovenstaande gaat over capaciteit. De beslissing gaat vooral over eigendom, en hier liggen de twee mijlenver uit elkaar.

GLM 5.2 heeft open gewichten onder de MIT-licentie. Dat verandert de onderhandeling, niet alleen de rekening: je kunt het zelf hosten als een workload gevoelig is of het volume hoog is; je kunt het tussen providers verplaatsen zonder opnieuw te integreren, omdat de gewichten van jou zijn; en elke host die het routeert, moet concurreren op prijs en latentie, en daarom wordt de open-gewichtenlijn na verloop van tijd goedkoper. De 753B MoE is geen laptopmodel — de meeste teams zullen het nog steeds huren in plaats van draaien — maar de optie om te vertrekken, of om dezelfde gewichten in-house tegen een vaste prijs te draaien, legt een bodem onder wat iemand je in rekening kan brengen.

Muse Spark 1.2 kiest voor het tegenovergestelde pakket. De gewichten zijn gesloten en de enige first-party route is Meta's Model API, die we nu ook routeren. In ruil daarvoor krijg je een co-getraind product: Muse Code, de terminalagent die met het model werd meegeleverd, is afgestemd op rejection-sampled harness-trajecten en draait persistente, herstartveilige subagenten op een replay-exacte event-log-runtime, met gebundelde /plan, /grill en /goal vaardigheden. Dat is iets wezenlijk anders dan "een goed model dat je in je eigen harness verwerkt" — het is een agent die al werkend aankomt. De afweging is dat het alleen werkt op Meta's manier, in Meta's tool, op macOS of Linux, zonder Windows-client, zonder MCP en nog zonder IDE-plugins.

Screenshot of the Meta AI Research announcement 'Introducing Muse Code and Muse Spark 1.2', dated August 5 2026.

Prijs per token, prijs per taak

Per token is Muse Spark 1.2 goedkoper voor zowel invoer als uitvoer, en het blijft ook per taak goedkoper omdat het ook het minder uitgebreide model is. Artificial Analysis mat dat GLM 5.2 bij de lancering 141 miljoen uitvoertokens verbruikte om de Intelligence Index te draaien — 95% daarvan redeneertokens — waarmee het het meest uitgebreide toonaangevende model op de ranglijst is. Muse Spark 1.2 verbruikte 95 miljoen bij dezelfde oefening voor $0,40 per taak. Meer tokens tegen een hoger tarief betekent dat de kosten per taak van GLM 5.2 zich opstapelen op een manier die de lijstprijs verbergt, en dit is de juiste manier om redenerende modellen te vergelijken: prijs de voltooide taak, niet het tarief per miljoen tokens.

Er is een derde prijs die slechts één van deze modellen heeft. Muse Spark 1.2 biedt een contributor-niveau voor $0,10 in / $0,20 uit — een orde van grootte onder het standaardniveau, en met een vergelijkbare marge onder de adviesprijs van GLM 5.2. De toegangsprijs is toestemming voor Meta om toekomstige modellen te trainen op je dataverkeer, plus een limiet van 60 verzoeken per minuut die productie-fan-out uitsluit. Zie het als een juridische toetsing met een korting, niet als een goedkopere SKU; voor een team dat in aanmerking komt en binnen de limiet werkt, zorgt het ervoor dat de prijsvergelijking niet langer kantje-boord is.

Latentie: de twee modellen keren om

Als de indexkloof Meta bevoordeelt, is het latentieprofiel waar GLM 5.2 op gevoel beslissend wint. Gedurende de afgelopen zeven dagen van echt verkeer op OrcaRouter toont Muse Spark 1.2 een p50-tijd tot eerste token van 8.13 seconden en een p95 van 10.00 seconden, en schiet vervolgens op 576 outputtokens per seconde met een foutpercentage van nul. GLM 5.2 toont een p50 van 1.55 seconden — meer dan vijf keer sneller naar het eerste token — maar druppelt op 78.5 outputtokens per seconde met een foutpercentage van 0.16%. In het lab, bij maximale inspanning, wordt de kloof groter: Artificial Analysis mat de tijd tot eerste token van Muse Spark 1.2 op 26 seconden bij xhigh, de duurste redeneerinstelling.

Dus het ene model laat je wachten en levert vervolgens snel; het andere begint onmiddellijk en neemt er de tijd voor. Voor alles waar een mens naar kijkt — een chatbeurt, een interactieve terminalsessie — voelt GLM 5.2 beter aan, en daarom domineert het het interactieve verkeer via onze gateway. Bij een lange generatie, een grote patch of een documentontwerp zal Muse Spark 1.2 als eerste klaar zijn zodra het eenmaal draait, omdat de uitvoersnelheid zeven keer die van GLM 5.2 is. Meet het verkeerde getal en je kiest het verkeerde model om de verkeerde reden.

Beide proberen zonder een tweede contract

Beide modellen staan in de OrcaRouter-catalogus tegen de lijstprijs van de provider — Muse Spark 1.2 voor $1.25 en $4.25, GLM 5.2 voor $1.40 en $4.40 — omdat OrcaRouter provider-tarieven doorberekent met 0% opslag. Dat maakt de prijssecties op basis van de factuur, niet van de sticker, en het betekent dat het wisselen tussen de twee een wijziging van één regel is in de modelstring tegen dezelfde sleutel, in plaats van een nieuwe integratie. Als een leverancier een prijs verlaagt, komt die verlaging dezelfde dag bij ons terecht.

De routeringslaag bewijst hier zijn nut juist omdat de twee modellen elkaar aanvullen. De zwakte van Muse Spark 1.2 is een langzame eerste token en een hoge prijs op schaal; de zwakte van GLM 5.2 is uitvoerigheid en deep-repo-redenering. Een routeringsregel die de planningsronde naar Muse Spark 1.2 stuurt en de parallelle worker-fan-out naar GLM 5.2 — of terugvalt op GLM 5.2 wanneer het endpoint van Muse Code traag is — kost niets extra om te bouwen, omdat beide achter één endpoint zitten. En voor een model van drie dagen oud is automatische failover de manier om het uit te proberen zonder een productiepad erop te verwedden.

Screenshot of the OrcaRouter model page for GLM-5.2 (z-ai/glm-5.2), showing $1.40 per million input tokens, a 1M-token context window, 128K max output and an OpenAI-compatible endpoint.

Wie moet welke kiezen

Kies Muse Spark 1.2 wanneer de werkeenheid een groot, samenhangend geheel is en iemand een paar seconden kan wachten voordat het start: refactoring van meerdere bestanden, generatie van een hele repository, lange agent-loops, en — volgens Vals AI — werk met financiële, fiscale en juridische documenten. De DeepSWE-voorsprong, het hoge uitvoertempo en het contributorniveau wijzen allemaal dezelfde kant op. Je accepteert gesloten gewichten, Meta's tooling en een langzamer eerste token, en je moet Meta's 82,9 en 59,3 als beweringen lezen, niet als feiten.

Kies GLM 5.2 wanneer eigendom en gevoel belangrijker zijn dan de samengestelde score: open gewichten die je zelf kunt hosten of verplaatsen, een snelle eerste token voor interactief werk, een ecosysteem van testraamwerken en tools die er al mee werken, en de sterkste open-gewicht algemene capaciteit die beschikbaar is. Accepteer de breedsprakigheid, de 46.2 DeepSWE, en een catalogusprijs die per token hoger is, zelfs voordat het verschil in het aantal tokens meetelt.

De meeste teams zullen merken dat het eerlijke antwoord geen van beide op zichzelf is. De open variant is het werkpaard waar je het meeste verkeer doorheen leidt; de gesloten variant is de specialist die je op de diepgaande taken en de vertrouwelijke documenten richt. Vier indexpunten uit elkaar op een samengestelde index, een wereld van verschil over wie de gewichten bezit — dat is de keuze, en die is veel duidelijker dan de scores.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube