Card hero generata intitolata Claude Sonnet 5.5 vs Muse Glimmer, con sottotitolo un modello laptop da 30B contro il nuovo Sonnet, con tre card statistiche: Intelligence Index 56 vs 17, finestra di contesto 1M vs 131K token, e pesi closed vs Apache 2.0, con un footer che riporta Indice secondo Artificial Analysis v4.3.2; specifiche di Muse Glimmer secondo Meta.
Guides & Insights

Claude Sonnet 5.5 vs Muse Glimmer: un modello laptop da 30B contro il nuovo Sonnet

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

La domanda di fondo per questa pagina è se il confronto sia legittimo, e la risposta onesta è che Claude Sonnet 5.5 e Muse Glimmer non sono concorrenti nel senso comune. Nell'Intelligence Index di Artificial Analysis, revisione v4.3.2, Claude Sonnet 5.5 ottiene 56 e Muse Glimmer 17, e quel divario non è rumore: è all'incirca la distanza tra un modello generalista di frontiera e uno piccolo molto buono. Ciò che rende comunque interessante il confronto è che Muse Glimmer ha una proprietà che l'altro non può comprare a nessun prezzo: è un modello open-weight da 30 miliardi di parametri, pubblicato da M​eta il 10 agosto 2026 con licenza Apache 2.0, quantizzato a 4 bit così da stare sotto i 20 GB di VRAM e progettato per funzionare con la rete scollegata. Claude Sonnet 5.5 è arrivato il 28 settembre 2026 come il Sonnet più veloce e intelligente del fornitore, al prezzo di 2,00 $ per milione di token in input e 10,00 $ per milione di token in output, e raggiungibile solo tramite rete. La vera decisione non è quale modello sia migliore. È dove si vogliono far girare i token.

Due modelli, due definizioni del lavoro

Muse Glimmer nasce dai M​eta Superintelligence Labs come modello da 30 miliardi di parametri, addestrato tramite distillazione logit dal più grande insegnante Muse Spark di M​eta, poi messo a punto su dati agentici a contesto lungo e rinforzato per l'uso degli strumenti. M​eta lo ha distribuito già quantizzato: a 4 bit l'occupazione di memoria passa da oltre 55 GB a piena precisione a meno di 20 GB, ed è questo che gli permette di rientrare nei limiti di una GPU consumer da 24 GB o 32 GB. M​eta lo ha testato su una Nvidia RTX 5090 e sui chip Apple M4 Max e M5 Max. Accetta in input testo e immagini, restituisce testo, gestisce una finestra di contesto di 131.072 token che secondo M​eta può essere estesa a 262.144, e ha una data di cut-off delle conoscenze a gennaio 2026.

Artificial Analysis model page for Muse Glimmer (high), an open-weights model released August 2026, showing an Intelligence Index of 17, an output speed of 143.8 tokens per second, $0.325 per million input tokens and $1.35 per million output tokens, $0.06 per Intelligence Index task, 59M output tokens generated during the Index evaluation, a 131K-token context window and a January 2026 knowledge cutoff.

Claude Sonnet 5.5 è il secondo modello della generazione 5.5 di Anthropic e quello che l'azienda posiziona come la migliore combinazione di velocità e intelligenza nella sua gamma. Gestisce una finestra di 1.000.000 di token, fino a 128.000 token di output in modo sincrono e 300.000 sull'API Message Batches dietro l'output-300k-2026-03-24 header, accetta testo, immagini e file, offre pensiero adattivo con sforzo selezionabile e cutoff a giugno 2026, ed è disponibile con conservazione zero dei dati dal lancio. L'archiviazione costa $0,20 per milione di token in lettura dalla cache e $2,50 per milione in scrittura sulla cache. Anthropic afferma che è il 30% più veloce di Claude Sonnet 5 e costa fino al 30% in meno per attività a tariffe invariate — affermazioni del fornitore, non riprodotte in modo indipendente.

Vale la pena osservare il contrasto delle specifiche in un'unica passata, perché quasi ogni riga è un tipo diverso di cosa, non una versione migliore o peggiore:

• Pesi — Muse Glimmer Apache 2.0, scaricabili, quantizzati a 4-bit vs Claude Sonnet 5.5 chiuso

• Dove viene eseguito — Muse Glimmer sulla tua GPU, offline vs Claude Sonnet 5.5 sull'infrastruttura A​nthropic

• Parametri — Muse Glimmer 30B in totale, meno di 20 GB a 4-bit rispetto a Claude Sonnet 5.5 non divulgati

• Contesto — Muse Glide 131.072 token, estendibili a 262.144 vs Claude Sonnet 5.5 1.000.000 di token

• Prezzo per milione — Muse Glimmer: nessun costo per token, il tuo hardware rispetto a Claude Sonnet 5.5 $2,00 in ingresso / $10,00 in uscita

• Intelligence Index v4.3.2 — Muse Glimmer 17 contro Claude Sonnet 5.5 56

• Costo per attività Index come misurato — Muse Glimmer $0,06 vs Claude Sonnet 5.5 $7,60

Due cifre su quella lista meritano di essere approfondite, perché entrambe sono trappole. La prima è il valore di $0,06 per attività: è quanto Artificial Analysis ha speso per chiamare Muse Glimmer (high) tramite un endpoint ospitato a $0,325 per milione di input e $1,35 per milione di output, quindi misura l'economia del noleggio di questo modello, non del suo funzionamento. In self-hosting, il costo marginale per token scompare e viene sostituito da una GPU che già possiedi o che devi acquistare. La seconda è il divario dell'Indice stesso — un modello da 30B quantizzato in 20 GB viene valutato con lo stesso metro dei modelli di frontiera, e la classifica lo dice chiaramente quando colloca Muse Glimmer tra i primi pochi modelli open-weight, notando al contempo che è costoso per le sue dimensioni.

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Muse Glimmer, the scoreboard, contrasting weights closed vs Apache 2.0, where it runs Anthropic infrastructure vs your own GPU offline, parameters undisclosed vs 30B at 4-bit, context window 1,000,000 vs 131,072 tokens, AA Index 56 vs 17, and output speed 138.7 vs 143.8 tokens per second, with a footer reading AA Index and speed per Artificial Analysis v4.3.2; Muse Glimmer specifications per Meta.

Dove Muse Glimmer è davvero valido, e dove tutto va a rotoli

Il punteggio composito è fin troppo grossolano per costituire la risposta completa, perché Muse Glimmer non è uniformemente diciassette. È veloce — Artificial Analysis misura 143,8 token di output al secondo, davanti ai 138,7 di Claude Sonnet 5.5 — ed è conciso, generando 59M di token nell'intera valutazione dell'Index contro i 410M di Claude Sonnet 5.5. E su una valutazione è vicino alla frontiera: il richiamo su contesto lungo, dove ottiene l'83,3% contro l'82,7% di Claude Sonnet 5.5. Un modello da 30B che eguaglia un Sonnet di frontiera nuovissimo nel recupero su contesto lungo è la riga più sorprendente di questa pagina, ed è coerente con il modo in cui Meta lo ha addestrato — dati agentici a contesto lungo, distillazione da un insegnante molto più grande.

I risultati agentici sono il punto in cui emerge il tetto del modello e la classifica smette di essere lusinghiera. Su Terminal-Bench 4.0, Muse Glimmer ottiene 0,5% contro il 63,6% di Claude Sonnet 5.5. Il suo punteggio nel benchmark di automazione è 0,068 contro 0,713. Humanity's Last Exam: 22,0% contro 55,0%. Un output di tale portata su un benchmark di esecuzione significa che il modello non completa le attività, e nessun risparmio di hosting locale rende più economico un compito che non finisce mai.

Anche la letteratura di ricerca è schietta al riguardo, e vale la pena affermarlo invece di seppellirlo: uno studio sottoposto a revisione paritaria sull'orchestrazione multi-agente, in cui Muse-Glimmer-30B era uno dei modelli testati, ha rilevato che non aveva recuperato nessuno dei suoi candidati. La tabella di benchmark dello stesso M​eta per il modello è un documento del fornitore ed è etichettata come tale qui; i dati di Artificial Analysis sopra riportati sono misurazioni indipendenti, e sono quelli su cui questo pezzo si basa.

Quindi la distinzione è chiara. Muse Glimmer è forte, per le sue dimensioni, nel leggere un input lungo e nel rispondere al riguardo: è veloce, economico da eseguire e entra in una GPU di classe laptop. Non è un modello a cui affidare un compito software in più passaggi e poi andarsene. Questo è il confine onesto, e un confronto costruito solamente attorno a punteggi compositi lo nasconderebbe.

Che cosa stai effettivamente acquistando alla tariffa di frontiera

Il premium di Claude Sonnet 5.5 compra innanzitutto capacità, e il divario di diciassette punti nell'Indice ne è la forma più evidente. Ma altre tre cose accompagnano la tariffa di output di 10,00 $ che non compaiono su nessuna classifica.

Il primo è la finestra. Un milione di token è all'incirca sette volte e mezzo i 131.072 di Muse Glimmer, e A​nthropic applica la tariffa standard su tutto quanto, con le letture dalla cache a un decimo del prezzo di input, così che portare un contesto ampio attraverso molte chiamate risulti accessibile e non teorico. Un prompt su scala di repository non entra affatto nella finestra più piccola, quindi questa è una differenza di capacità, non una preferenza.

Il secondo è la fedeltà degli strumenti. Cinque comportamenti sono cambiati tra Claude Sonnet 5 e Claude Sonnet 5.5, e tutti e cinque riguardano l'uso degli strumenti e il ragionamento: i parametri di campionamento non predefiniti ora restituiscono un 400, thinking: {"type": "disabled"} ora restituisce un 400 e diventa between_tools, la scelta forzata dello strumento di "any" o di uno strumento denominato viene rifiutata, quindi i loop devono passare a auto con uso rigoroso degli strumenti, il vecchio strumento computer_20251124 viene rifiutato sull'API Claude e su Goo​gle Cloud, e i blocchi di pensiero ora sono legati al modello e all'account che li producono. Una sesta modifica non fa fallire nulla ma diventa silenziosa: il testo tra le chiamate agli strumenti viene restituito all'interno dei blocchi di pensiero, quindi un'applicazione in streaming smette di mostrare output finché non imposta un valore di visualizzazione o disattiva il pensiero iniziale. È un giorno di lavoro di migrazione per chiunque usi Sonnet 5, ed è il prezzo d'ingresso per l'affidabilità agentica che le righe del benchmark sopra stanno misurando.

Il terzo aspetto è la provenienza e la gestione dei dati. La conservazione zero dei dati è disponibile fin dal lancio, A​nthropic pubblica una data minima di dismissione del 28 settembre 2027, e il modello è disponibile su Claude API, Bedrock, Goo​gle Cloud e Microsoft Foundry. Per un acquirente soggetto a regolamentazione, questi sono fatti di approvvigionamento che decidono l'acquisto prima che lo faccia il benchmark.

Offline è un requisito, non un risparmio sui costi.

Il motivo per cui questo abbinamento deve stare su una sola pagina è che, per una specifica classe di deployment, Muse Glimmer non è un'opzione più economica — è l'unica opzione. Una richiesta che non può lasciare il dispositivo, un reparto produttivo o un sito sul campo senza connettività, un ambiente air-gapped in cui una chiamata API è una violazione della conformità, o un budget di latenza in cui un round trip è già troppo: nessuno di questi casi è risolto da un modello migliore dietro una rete. I pesi Apache 2.0 che stanno sotto i 20 GB e vengono eseguiti offline sono l'intera risposta, e Claude Sonnet 5.5 a qualsiasi prezzo non partecipa alla questione.

I test pubblicati da Meta su silicio RTX 5090 e Apple M4 Max e M5 Max sono il riferimento pratico per ciò che significa "esegue localmente" in questo contesto, e la quantizzazione a 4 bit è ciò che rende quei target raggiungibili — l'ingombro a precisione completa supera i 55 GB. Chiunque pianifichi un deployment dovrebbe considerare i dati hardware come di Meta anziché come misurati qui.

Per tutti gli altri, i due modelli sono complementari anziché sostituti, e la parte operativamente scomoda è che avere un modello Anthro​pic API e un modello M​eta self-hosted di solito significa due stack completamente separati. OrcaRouter mette oltre 200 modelli dietro un unico endpoint compatibile con Open​AI, con il prezzo di listino del provider passato tal quale e senza alcun ricarico aggiunto, failover automatico tra provider upstream e un DSL di routing per comporre le chiamate — il che copre la metà ospitata di quella soluzione, e il teacher più grande Muse Spark 1.2 di M​eta è instradabile qui come meta/muse-spark-1.2 a $1,25 di input e $4,25 di output per milione di token su una finestra di 1.048.576 token, con letture dalla cache a $0,15. Gestisce 42,8 milioni di token di traffico a settimana attraverso questo catalogo, che è la parte utile della soluzione: il teacher ospitato è sulla stessa chiave di tutto il resto, e il modello che esegui in locale non deve mai toccare una rete.

Tre note di onestà, perché è facile sbagliare. Muse Glimmer stesso non è una delle nostre route — la model card non esiste nel nostro catalogo, e questa pagina lo dice invece di insinuare il contrario. La cattura qui sotto è la pagina del modello che invece esiste, Muse Spark 1.2, che è il checkpoint da cui Muse Glimmer è stato distillato anziché Muse Glimmer stesso. Anche Claude Sonnet 5.5 non è nel nostro catalogo, un giorno dopo il rilascio; la route per raggiungerlo è l'API di A​nthropic, e Claude Sonnet 5 è instradabile qui dal 30 giugno a 2,00 $ e 10,00 $ per chiunque voglia il target di staging.

OrcaRouter model page for meta/muse-spark-1.2, dated 2026-08-05, showing $1.25 input and $4.25 output per million tokens, a p50 time to first token of 2.05 s, a 1,048,576-token context window, and 42.8M tokens of recent traffic.

Come decidere

Parti dal vincolo, non dal punteggio. Se la richiesta non può uscire da una macchina o da una rete, Muse Glimmer è la risposta e il gap dell'Index è irrilevante — un modello 30B Apache 2.0 che gira offline ed eguaglia un modello di frontiera nel recall su contesti lunghi è, per quel compito, la cosa migliore disponibile. Se la richiesta deve completare un'attività software in più passaggi, un modello 30B che totalizza mezzo punto percentuale su Terminal-Bench non è in corsa, indipendentemente dall'hardware che già possiedi.

Tra quei due poli, il fattore decisivo è la misurazione anziché l'opinione: token per attività completata sul proprio carico di lavoro, prezzati due volte — una volta a $2,00 e $10,00 di Claude Sonnet 5.5, e una volta al costo ammortizzato della GPU. L'unico numero che ridefinisce l'intero confronto, $0,06 per attività Index rispetto a $7,60, è una cifra di noleggio ospitato per un modello che la maggior parte delle persone eseguirà da sé, e citarlo come se fosse un risparmio a parità di condizioni sarebbe l'errore facile che questa pagina vuole evitare.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno