
Muse Spark 1.2 mot GLM 5.2: Den slutna kodaren mot den öppna generalisten
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2658Intelligens72Kodning
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianNYQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
Två modeller med 1 000 000 tokens kontext, prissatta inom femton cent från varandra per miljon tokens, båda riktade mot kodtungt agentarbete – och de har nästan ingenting annat gemensamt. Muse Spark 1.2, som Meta släppte den 5 augusti 2026 tillsammans med en samtränad terminalagent som heter Muse Code, har slutna vikter, är billigare per token, får 57 på nuvarande Artificial Analysis Intelligence Index och kan inte svara utan att först resonera. GLM 5.2, Z.ai:s flaggskeppsmodell med öppna vikter från mitten av juni, är MIT-licensierad, kan självhostas, är ungefär fem gånger snabbare till första token och har fortfarande fyra och en halv gånger mer verklig trafik genom vår gateway – 213 miljoner tokens under de senaste sju dagarna jämfört med Muse Spark 1.2:s 46 miljoner. Modellen med högre poäng och lägre pris per token är den med mindre trafik. Den öppna är den som människor faktiskt routar.
Den ärliga versionen av det faktumet är vad den här artikeln handlar om. Poängsättning och prissättning avgör mindre än hur en modell passar din pipeline, och dessa två gör motsatta val på varje axel som avgör passformen. Där oberoende siffror finns kommer de från Artificial Analysis; där de kommer från Meta eller Z.ai är de märkta som leverantörsrapporterade; latens- och trafiksiffrorna är OrcaRouters egen sjudagars produktionstelemetri.
Specifikationskontrasten, en dimension i taget.
• Pris — Muse Spark 1.2 till $1,25 in / $4,25 ut per miljon tokens, $0,15 vid cacheträff; GLM 5.2 till $1,40 in / $4,40 ut, $0,26 cachad. Meta är billigare på varje rad.
• Kontext — båda 1 048 576 tokens. Max utdata: Meta dokumenterar ett tak på 131 072 tokens för Muse Spark 1.2; GLM 5.2 anger 128 000.
• Resonemang — resonemang är obligatoriskt på Muse Spark 1.2 över fem ansträngningsnivåer (minimal till xhigh, standard medium); GLM 5.2 kör hybridresonemang styrt av reasoning_effort på high eller max, med djupgående resonemang aktiverat som standard.
• Inmatning — Muse Spark 1.2 marknadsför inmatning av text, bild, video, ljud och PDF; GLM 5.2 är text-in, text-out.
• Vikter — Muse Spark 1.2 är sluten, utan repository och utan självhostningsväg; GLM 5.2 kommer med MIT-licensierade öppna vikter, en 753B-parameter Mixture-of-Experts med cirka 40B aktiva per token.
• Ålder — Muse Spark 1.2 är tre dagar gammal när detta skrivs; GLM 5.2 har varit i produktion sedan 13 juni, med åtta veckors fälterfarenhet och ett helt ekosystem av värdar och verktyg byggda kring det.
Indexgapet är fyra punkter. Versionsfällan är verklig.
Artificial Analysis nuvarande Intelligence Index (v4.1.1) ger Muse Spark 1.2 57 poäng, rankad #12 av 185, och GLM 5.2 får 53 – den högsta öppna viktpoängen på tavlan, men fyra poäng efter. De flesta rapporteringar citerar fortfarande 54 för Muse Spark 1.2 eftersom det var vad lanseringsdagsutvärderingen rapporterade; omvärderingen i v4.1.1 lade till 2,7 poäng, den största ökningen av alla modeller i den uppdateringen. Om du ser "54 mot 51" eller "54 mot 53" någonstans, kontrollera vilken indexversion varje nummer tillhör innan du behandlar skillnaden som verklig.
Det är värt att säga vad gapet på fyra poäng innebär och inte innebär. Det innebär att i sammansättningen av nio benchmarks hamnar Metas stängda modell före Z.ai:s öppna modell vid jämförbar ansträngning. Det innebär inte att Muse Spark 1.2 slår GLM 5.2 i allt, eftersom de två modellerna når sina poäng på olika vägar. GLM 5.2 är en utstickare inom matematik och resonerande — AIME 2026 på 99,2 — men den är känd för att vara pratglad och dess svaga punkt är djupgående arbete i repository-skala. Muse Spark 1.2 har motsatt form: stark på terminalkodning och uppgifter över flera filer, och dramatiskt billigare per uppgift att utvärdera, eftersom den förbrukar långt färre tokens när den tänker.

Där benchmarks faktiskt skiljer sig åt
På Terminal-Bench 2.1 är de två närmare varandra än indexgapet antyder, och källorna spelar större roll än vanligt. I samma Artificial Analysis-testmiljö får Muse Spark 1.2 80,1 och GLM 5.2 77,9. Meta hävdar 82,9 för Muse Spark 1.2 på sin egen testmiljö; Z.ai:s bäst rapporterade siffra för GLM 5.2 är 82,7, vilket gjorde den till den första open-weight-modellen över 80 på det riktmärket. Samma riktmärke, fyra olika siffror — valet av testmiljö kan flytta dessa poäng flera punkter i båda riktningarna, så behandla varje enskilt Terminal-Bench-påstående som ett intervall.
Den divergens som är värd att uppmärksamma är DeepSWE 1.1, det riktmärke som betonar djupgående, flerfiliga, repository-övergripande resonemang över en lång agentloop. Meta rapporterar 59.3 för Muse Spark 1.2 — en leverantörssiffra, ingen tredje part har reproducerat den ännu. GLM 5.2:s publicerade DeepSWE är 46.2, och dess föregångare GLM-5.1 låg på 18.0, så detta är den dimension Z.ai har förbättrat mest men fortfarande ligger efter i. Om din arbetsbelastning är "ändra femtio filer på ett sammanhängande sätt", är det gapet hela historien; om din arbetsbelastning är terminalkommandon och scaffolding, märks det knappt.
Ännu ett fynd som kullkastar den självklara bilden. Den oberoende Vals AI-sviten, som kör agentarbetsbelastningar per domän, placerar Muse Spark 1.2 på femte plats totalt med 71,88 % – och först på Finance Agent, först på TaxEval och först på Harveys Legal Agent-riktmärke, mot 44, 136 respektive 31 modeller – medan Terminal-Bench 2.1 bara är dess fjortonde bästa domän av femtio. Meta sålde den här modellen som en kodare, och en oberoende utvärderare fann att den är starkast på finans-, skatte- och juridiska dokumentagenter. Om ditt team skriver avtal eller stämmer av reskontra, är det den enskilt mest användbara siffran i den här artikeln.
Frågan om öppna vikter är det verkliga vägskälet.
Allt ovan handlar om förmåga. Beslutet handlar mest om ägande, och här kan de två inte vara längre ifrån varandra.
GLM 5.2 är MIT-licensierad med öppna vikter. Det ändrar förhandlingen, inte bara notan: du kan själv vara värd för den om en arbetsbelastning är känslig eller volymen hög; du kan flytta den mellan leverantörer utan att integrera om, eftersom vikterna är dina; och alla värdar som dirigerar den måste konkurrera på pris och latens, vilket är anledningen till att linjen med öppna vikter blir billigare över tid. 753B MoE är inte en laptopmodell – de flesta team kommer fortfarande att hyra den snarare än att köra den – men möjligheten att lämna, eller att köra samma vikter internt till en fast kostnad, sätter ett golv under vad någon kan ta betalt av dig.
Muse Spark 1.2 köper det motsatta paketet. Vikterna är stängda och den enda förstapartsvägen är Metas Model API, som vi nu också routar. I utbyte får du en samtränad produkt: Muse Code, terminalagenten som följde med modellen, finjusterades på rejection-samplade harness-trajektorier och kör beständiga, omstartssäkra delagenter på en replay-exakt event-loggruntime, med medföljande /plan, /grill och /goal-färdigheter. Det är en verkligt annorlunda sak jämfört med ”en bra modell som du kopplar in i din egen harness” — det är en agent som fungerar direkt. Avvägningen är att den bara fungerar på Metas sätt, i Metas verktyg, på macOS eller Linux, utan Windows-klient, utan MCP och utan IDE-plugin ännu.

Pris per token, pris per uppgift
Per token är Muse Spark 1.2 billigare på in- och utdata, och det förblir billigare per uppgift eftersom det också är den mindre mångordiga modellen. Artificial Analysis mätte att GLM 5.2 förbrukade 141 miljoner utdatatokens, varav 95 % var resonemangstokens, bara för att köra Intelligence Index vid lanseringen – den mest mångordiga ledande modellen på listan. Muse Spark 1.2 förbrukade 95 miljoner på samma övning till $0,40 per uppgift. Fler tokens till en högre avgift innebär att GLM 5.2:s kostnad per uppgift ackumuleras på ett sätt som dess listpris döljer, och detta är det korrekta sättet att jämföra resonemangsmodeller: prissätt den färdiga uppgiften, inte priset per miljon tokens.
Det finns ett tredje pris som bara en av dessa modeller har. Muse Spark 1.2 levereras med en bidragsnivå till 0,10 USD in / 0,20 USD ut – en storleksordning under standardnivån och under GLM 5.2:s listpris med liknande marginal. Inträdesavgiften är tillåtelse för Meta att träna framtida modeller på din trafik, plus en gräns på 60 förfrågningar per minut som utesluter produktionsfan-out. Se det som en juridisk granskning med en rabatt bifogad, inte en billigare SKU; för ett team som kvalificerar sig och arbetar under gränsen gör det att prisjämförelsen inte längre är nära.
Latens: de två modellerna inverteras.
Om indexgapet gynnar Meta, är latensprofilen där GLM 5.2 vinner avgörande på känsla. Under de senaste sju dagarna av riktig trafik på OrcaRouter visar Muse Spark 1.2 en p50-tid till första token på 8,13 sekunder och en p95 på 10,00 sekunder, för att sedan rasa fram med 576 utdatatokens per sekund med en felfrekvens på noll. GLM 5.2 visar en p50 på 1,55 sekunder — mer än fem gånger snabbare till första token — men sipprar fram med 78,5 utdatatokens per sekund med en felfrekvens på 0,16 %. I laboratoriet vid maximal ansträngning vidgas gapet: Artificial Analysis mätte Muse Spark 1.2:s tid till första token till 26 sekunder vid xhigh, dess dyraste resonemangsinställning.
Så en modell får dig att vänta och levererar sedan snabbt; den andra startar omedelbart och tar sin tid. För allt som en människa tittar på — en chattrunda, en interaktiv terminalsession — känns GLM 5.2 bättre, och det är därför det dominerar den interaktiva trafiken genom vår gateway. För en lång generering, en stor patch eller ett dokumentutkast, kommer Muse Spark 1.2 att vara först i mål när den väl startar, eftersom dess utdatahastighet är sju gånger GLM 5.2:s. Mät fel siffra, så väljer du fel modell av fel anledning.
Att prova båda utan ett andra kontrakt
Båda modellerna finns i OrcaRouter-katalogen till leverantörens listpris — Muse Spark 1.2 för 1,25 och 4,25 dollar, GLM 5.2 för 1,40 och 4,40 dollar — eftersom OrcaRouter förmedlar leverantörspriserna med 0 % påslag. Det gör att prissättningen grundar sig på fakturan, inte på prislappen, och det innebär att byte mellan de två är en ändring på en rad i modellsträngen mot samma nyckel snarare än en ny integration. Om en leverantör sänker ett pris, hamnar sänkningen hos oss samma dag.
Routningslagret förtjänar sin plats här just eftersom de två modellerna är varandras komplement. Muse Spark 1.2:s svaghet är en långsam första token och ett högt pris vid skalning; GLM 5.2:s svaghet är mångordighet och resonemang i djupa repositories. En routningsregel som skickar planeringspasset till Muse Spark 1.2 och den parallella worker-fan-outen till GLM 5.2 — eller växlar över till GLM 5.2 när Muse Codes endpoint är långsam — kostar inget extra att bygga, eftersom båda ligger bakom en och samma endpoint. Och för en modell som är tre dagar gammal är automatisk failover så du testar den utan att satsa en produktionsväg på den.

Vem ska välja vilken
Välj Muse Spark 1.2 när arbetsenheten är en stor, sammanhållen artefakt och någon kan vänta några sekunder på att den ska starta: omstrukturering av flera filer, generering av hela repositories, långa agentloopar och — enligt Vals AI — arbete med finans-, skatte- och juridiska dokument. DeepSWE-ledningen, den höga utdatahastigheten och bidragsnivån pekar alla åt samma håll. Du accepterar stängda vikter, Metas verktyg och en långsammare första token, och du bör läsa Metas 82.9 och 59.3 som påståenden, inte fakta.
Välj GLM 5.2 när ägande och känsla väger tyngre än den sammansatta poängen: öppna vikter som du kan self-hosta eller flytta, en snabb första token för interaktivt arbete, ett ekosystem av testmiljöer och verktyg som redan fungerar med den, och den starkaste generella förmågan bland öppna vikter som finns tillgänglig. Acceptera mångordigheten, 46.2 DeepSWE, och ett listpris som är högre per token redan innan skillnaden i tokenantal.
De flesta team kommer att inse att det ärliga svaret inte är något av dem ensamt. Det öppna är arbetshästen som du leder den mesta trafiken genom; det stängda är specialisten som du riktar mot de djupa uppgifterna och de känsliga dokumenten. Fyra indexpunkter från varandra i ett sammansatt index, en värld från varandra när det gäller vem som äger vikterna — det är valet, och det är mycket tydligare än poängen.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
