
Muse Spark 1.2 vs GLM 5.2: il coder chiuso vs il generalista aperto
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2658Intelligenza72Codice
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
Due modelli con contesto da 1.000.000 di token, con prezzi che si discostano al massimo di quindici centesimi per milione di token, entrambi pensati per il lavoro agentico ad alta intensità di codifica — e non condividono quasi nient'altro. Muse Spark 1.2, che Meta ha rilasciato il 5 agosto 2026 insieme a un agente terminale co-addestrato chiamato Muse Code, è a pesi chiusi, costa meno per token, ottiene 57 sull'attuale Artificial Analysis Intelligence Index e non può rispondere senza prima ragionare. GLM 5.2, il modello di punta a pesi aperti di Z.ai risalente a metà giugno, ha licenza MIT, è auto-ospitabile, ed è circa cinque volte più veloce a produrre il primo token, e gestisce ancora quattro volte e mezzo più traffico reale attraverso il nostro gateway — 213 milioni di token negli ultimi sette giorni contro i 46 milioni di Muse Spark 1.2. Il modello con il punteggio più alto e il costo per token più basso è quello con meno traffico. Quello aperto è quello che le persone instradano effettivamente.
La versione onesta di quel fatto è ciò di cui tratta questo articolo. Punteggi e prezzi determinano meno dell'adattamento di un modello alla tua pipeline, e questi due fanno scelte opposte su ogni asse che determina l'adattamento. Dove esistono numeri indipendenti, provengono da Artificial Analysis; dove provengono da Meta o Z.ai, sono etichettati come riportati dal fornitore; i dati di latenza e traffico sono la telemetria di produzione di sette giorni di OrcaRouter.
Il contrasto delle specifiche, una dimensione alla volta
• Prezzo — Muse Spark 1.2 a $1.25 in ingresso / $4.25 in uscita per milione di token, $0.15 su cache hit; GLM 5.2 a $1.40 in ingresso / $4.40 in uscita, $0.26 in cache. Meta è più economica su ogni riga.
• Contesto — entrambi 1.048.576 token. Output massimo: Meta documenta un tetto di 131.072 token per Muse Spark 1.2; GLM 5.2 dichiara 128.000.
• Ragionamento — il ragionamento è obbligatorio su Muse Spark 1.2 in cinque livelli di sforzo (da minimo a xhigh, predefinito medio); GLM 5.2 esegue un ragionamento ibrido controllato da reasoning_effort su alto o massimo, con ragionamento profondo attivo per impostazione predefinita.
• Input — Muse Spark 1.2 offre input di testo, immagini, video, audio e PDF; GLM 5.2 accetta e produce solo testo.
• Pesi — Muse Spark 1.2 è chiuso, senza repository e senza un percorso di self-hosting; GLM 5.2 offre pesi aperti con licenza MIT, un Mixture-of-Experts da 753 miliardi di parametri, con circa 40 miliardi attivi per token.
• Età — Muse Spark 1.2 ha tre giorni di vita al momento della stesura; GLM 5.2 è in produzione dal 13 giugno, con otto settimane di esperienza sul campo e un intero ecosistema di host e strumenti costruiti attorno ad esso.
Il divario dell'indice è di quattro punti. La trappola della versione è reale.
{{1}}L'attuale Intelligence Index di Artificial Analysis (v4.1.1) assegna a Muse Spark 1.2 un punteggio di 57, {{2}}posizionato al #12 su 185, {{3}}e a GLM 5.2 un punteggio di 53 — il punteggio open-weights più alto in classifica, ma inferiore di quattro punti.{{/3}} {{4}}La maggior parte della copertura cita ancora 54 per Muse Spark 1.2 perché è ciò che ha riportato la valutazione del giorno del lancio; {{5}}il ricalcolo della v4.1.1 ha aggiunto 2,7 punti, l'incremento più grande tra tutti i modelli in quell'aggiornamento. Se vedete "54 vs 51" o "54 vs 53" da qualche parte, verificate su quale versione dell'indice si basa ciascun numero prima di considerare reale il divario.{{/5}}{{/4}}{{/1}}
Vale la pena dire cosa significa e cosa non significa il divario di quattro punti. {{1}}Significa che nella media composta di nove benchmark, il modello chiuso di Meta si colloca davanti a quello aperto di Z.ai a parità di sforzo.{{/1}} {{2}}Non significa che Muse Spark 1.2 superi GLM 5.2 in tutto, perché i due modelli raggiungono i loro punteggi per vie diverse.{{/2}} {{3}}GLM 5.2 è un valore anomalo per matematica e ragionamento — AIME 2026 a 99.2 — ma è notoriamente prolisso e il suo punto debole è il lavoro profondo su repository di grandi dimensioni.{{/3}} {{4}}Muse Spark 1.2 è la forma opposta: forte nella codifica su terminale e nei task multi-file, e notevolmente più economico da valutare per task, perché consuma molti meno token durante il ragionamento.{{/4}}

Dove i benchmark effettivamente divergono
Su Terminal-Bench 2.1 i due sono più vicini di quanto suggerisca il divario dell'indice, e la fonte conta più del solito. Sullo stesso harness di Artificial Analysis, Muse Spark 1.2 ottiene 80.1 e GLM 5.2 ottiene 77.9. Meta dichiara 82.9 per Muse Spark 1.2 sul proprio harness; il miglior dato riportato da Z.ai per GLM 5.2 è 82.7, che lo ha reso il primo modello open-weight sopra 80 su quel benchmark. Stesso benchmark, quattro numeri diversi — l'abbinamento dell'harness sposta questi punteggi di diversi punti in entrambe le direzioni, quindi tratta qualsiasi affermazione su un singolo terminal-bench come un intervallo.
La divergenza a cui prestare attenzione è DeepSWE 1.1, il benchmark che mette alla prova il ragionamento profondo, multi-file e su scala di repository, in un lungo ciclo dell'agente. Meta riporta 59.3 per Muse Spark 1.2 — un dato del vendor, che nessuna terza parte ha ancora riprodotto. Il punteggio DeepSWE pubblicato di GLM 5.2 è 46.2, e il suo predecessore GLM-5.1 era a 18.0, quindi questa è la dimensione in cui Z.ai è migliorato di più e su cui è ancora in ritardo. Se il tuo carico di lavoro è "modificare coerentemente cinquanta file", quel divario dice tutto; se il tuo carico di lavoro sono comandi da terminale e scaffolding, la differenza si nota appena.
Un altro risultato che ribalta la lettura scontata. La suite indipendente Vals AI, che esegue workload di agenti per dominio, colloca Muse Spark 1.2 al quinto posto assoluto con il 71,88% — e prima in Finance Agent, prima in TaxEval e prima nel benchmark Legal Agent di Harvey, rispettivamente contro 44, 136 e 31 modelli — mentre Terminal-Bench 2.1 è solo il suo quattordicesimo dominio migliore su cinquanta. Meta ha venduto questo modello come coder, e un valutatore indipendente ha scoperto che è più forte negli agenti per documenti finanziari, fiscali e legali. Se il tuo team redige contratti o riconcilia registri contabili, questo è il numero più utile dell'intero articolo.
La questione dei pesi aperti è il vero bivio.
Tutto quanto sopra riguarda la capacità. La decisione riguarda principalmente la proprietà, e qui i due non potrebbero essere più distanti.
GLM 5.2 è un modello a pesi aperti con licenza MIT. Questo cambia la negoziazione, non solo il conto: puoi auto-ospitarlo se un carico di lavoro è sensibile o il volume è elevato; puoi spostarlo tra provider senza doverlo reintegrare, perché i pesi sono tuoi; e qualsiasi host che lo instrada deve competere su prezzo e latenza, motivo per cui la linea a pesi aperti diventa più economica nel tempo. Il MoE da 753B non è un modello da laptop — la maggior parte dei team lo noleggerà piuttosto che eseguirlo — ma la possibilità di andarsene, o di eseguire gli stessi pesi internamente a un costo fisso, pone un limite minimo a ciò che chiunque può farti pagare.
Muse Spark 1.2 acquista il bundle opposto. I pesi sono chiusi e l'unica via first-party è la Model API di Meta, che ora instradiamo anche noi. In cambio ottieni un prodotto co-addestrato: Muse Code, l'agente terminale distribuito con il modello, è stato ottimizzato su traiettorie di harness campionate per rifiuto ed esegue subagenti persistenti e a prova di riavvio su un runtime event-log esattamente riproducibile, con incluse /plan, /grill e /goal skill. Questa è una cosa davvero diversa da «un buon modello che integri nel tuo harness» — è un agente che arriva già funzionante. Il compromesso è che funziona solo a modo di Meta, nello strumento di Meta, su macOS o Linux, senza client Windows, senza MCP e senza plugin IDE per ora.

Prezzo per token, prezzo per attività
Per token, Muse Spark 1.2 è più economico sia in input che in output, e rimane più conveniente per attività perché è anche il modello meno verboso. Artificial Analysis ha misurato GLM 5.2 bruciando 141 milioni di token di output, il 95% dei quali token di ragionamento, solo per eseguire l'Intelligence Index al lancio — il modello leader più verboso in classifica. Muse Spark 1.2 ha bruciato 95 milioni nello stesso esercizio a $0,40 per attività. Più token a una tariffa più alta significa che il costo per attività di GLM 5.2 si accumula in un modo che il suo prezzo di listino nasconde, e questo è il modo corretto di confrontare i modelli di ragionamento: valutare l'attività completata, non la tariffa per milione di token.
C'è un terzo prezzo che solo uno di questi modelli ha. Muse Spark 1.2 include un livello contributor a $0,10 in ingresso / $0,20 in uscita — un ordine di grandezza sotto il livello standard, e sotto il prezzo di listino di GLM 5.2 di un margine simile. Il costo di ammissione è il permesso a Meta di addestrare modelli futuri sul tuo traffico, più un limite di 60 richieste al minuto che esclude il fan-out in produzione. Trattalo come una revisione legale con uno sconto allegato, non uno SKU più economico; per un team che soddisfa i requisiti e lavora sotto il limite, fa sì che il confronto dei prezzi smetta di essere ravvicinato.
Latenza: i due modelli si invertono
Se il divario nell'indice favorisce Meta, è il profilo di latenza dove GLM 5.2 vince in modo netto sulla sensazione d'uso. Negli ultimi sette giorni di traffico reale su OrcaRouter, Muse Spark 1.2 mostra un p50 del tempo al primo token di 8,13 secondi e un p95 di 10,00 secondi, poi sfreccia a 576 token di output al secondo con un tasso di errore pari a zero. GLM 5.2 mostra un p50 di 1,55 secondi — più di cinque volte più veloce al primo token — ma sgocciola a 78,5 token di output al secondo con un tasso di errore dello 0,16%. In laboratorio, al massimo sforzo, il divario si allarga: Artificial Analysis ha misurato il tempo al primo token di Muse Spark 1.2 a 26 secondi su xhigh, la sua impostazione di ragionamento più costosa.
Quindi un modello ti fa aspettare e poi consegna rapidamente; l'altro parte subito e si prende il suo tempo. Per qualsiasi cosa a cui un essere umano sta guardando — un turno di chat, una sessione interattiva su terminale — GLM 5.2 dà una sensazione migliore, ed è per questo che domina il traffico interattivo attraverso il nostro gateway. Per una generazione lunga, una patch corposa o una bozza di documento, Muse Spark 1.2 finirà per primo una volta avviato, perché la sua velocità di output è sette volte quella di GLM 5.2. Se misuri il numero sbagliato, sceglierai il modello sbagliato per il motivo sbagliato.
Provare entrambi senza un secondo contratto
Entrambi i modelli sono nel catalogo OrcaRouter al prezzo di listino del fornitore — Muse Spark 1.2 a $1.25 e $4.25, GLM 5.2 a $1.40 e $4.40 — perché OrcaRouter trasmette le tariffe del fornitore con un margine dello 0%. Questo rende i prezzi basati sulla fattura, non sul prezzo consigliato, e significa che passare da uno all'altro è un cambio di una sola riga nella stringa del modello rispetto alla stessa chiave, piuttosto che una nuova integrazione. Se un fornitore taglia un prezzo, il taglio arriva dalla nostra parte lo stesso giorno.
Il livello di routing si guadagna il suo posto proprio qui, perché i due modelli sono complementari. Il punto debole di Muse Spark 1.2 è un primo token lento e un costo elevato su larga scala; il punto debole di GLM 5.2 è la verbosità e il ragionamento su repository profondi. Una regola di routing che invia la fase di pianificazione a Muse Spark 1.2 e il fan-out dei worker paralleli a GLM 5.2 — oppure effettua il failover su GLM 5.2 quando l'endpoint di Muse Code è lento — non costa nulla in più da realizzare, perché entrambi sono dietro un unico endpoint. E per un modello di tre giorni, il failover automatico è il modo per provarlo senza scommetterci un percorso di produzione.

Chi dovrebbe scegliere cosa
Scegli Muse Spark 1.2 quando l'unità di lavoro è un artefatto ampio e coerente e qualcuno può attendere qualche secondo per l'avvio: refactoring multi-file, generazione dell'intero repository, lunghi cicli di agente e — secondo Vals AI — lavoro su documenti finanziari, fiscali e legali. Il vantaggio DeepSWE, l'elevato tasso di output e il livello contributor indicano tutti nella stessa direzione. Stai accettando pesi chiusi, gli strumenti di Meta e un primo token più lento, e dovresti leggere l'82,9 e il 59,3 di Meta come affermazioni, non fatti.
Scegli GLM 5.2 quando proprietà e sensazione contano più del punteggio composito: pesi aperti che puoi auto-ospitare o spostare, un primo token rapido per il lavoro interattivo, un ecosistema di harness e strumenti che già funziona con esso, e la più forte capacità generale open-weight disponibile. Accetta la verbosità, il 46.2 DeepSWE, e un prezzo di listino più alto per token anche prima della differenza nel conteggio dei token.
La maggior parte dei team scoprirà che la risposta onesta non è nessuno dei due da solo. Quello aperto è il cavallo di battaglia attraverso cui instradate la maggior parte del traffico; quello chiuso è lo specialista a cui affidate i compiti complessi e i documenti sensibili. A quattro punti di indice di distanza su un composito, ma a un mondo di distanza su chi possiede i pesi: è questa la scelta, ed è molto più chiara dei punteggi.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
