Scheda hero generata con titolo "Step 5 Preview vs Muse Glimmer - l'API e il laptop". La scheda di sinistra "Step 5 Preview" riporta: AA Index 44 contro una mediana di classe di 26, StepFun, annunciato il 20 settembre 2026, circa 600B totali / 27B attivi, contesto da 1M token, 1,00 $ in ingresso / 2,70 $ in uscita per 1M token, gira sui server del fornitore. La scheda di destra "Muse Glimmer" riporta: AA Index 17, Meta Superintelligence Labs, rilasciato il 10 agosto 2026, 30B parametri a 4-bit sotto 20 GB, contesto da 131K token estendibile a 262K, Apache 2.0, gira offline sulla tua GPU. Un footer riporta: "I dati dell'indice sono di Artificial Analysis; le specifiche di Muse Glimmer sono di Meta."
Guides & Insights

Step 5 Preview vs Muse Glimmer: l'API Frontier e il modello laptop

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Su una classifica, Step 5 Preview e Muse Glimmer non sono vicini: 44 contro 17 sull'Artificial Analysis Intelligence Index — un divario di ventisette punti su una scala il cui leader attuale si attesta nella fascia alta dei cinquanta — che nessun tipo di ottimizzazione riuscirà a colmare. Sulla domanda a cui un team deve davvero rispondere — dove vengono eseguiti i miei token — sono concorrenti diretti. Step 5 Preview è il modello di punta di StepFun, annunciato il 20 settembre 2026, con circa 600 miliardi di parametri totali e 27 miliardi attivi, un contesto da 1M di token, al prezzo di 1,00 $ per milione di token in input e 2,70 $ per milione di token in output, e raggiungibile solo tramite rete. Muse Glimmer è il modello agentico open-weight da 30 miliardi di parametri di Meta Superintelligence Labs, rilasciato il 10 agosto 2026 con licenza Apache 2.0, distribuito quantizzato a 4-bit così da stare sotto i 20 GB di memoria e girare su una singola GPU consumer con la rete scollegata. Il modo giusto di leggere questo confronto non è "quale dei due è più intelligente". È "quale dei due vincoli — capacità o perimetro — è quello che il tuo carico di lavoro non può spostare".

Il confronto è anche un utile correttivo a un'abitudine che questo mercato ha acquisito: trattare il punteggio di un indice composito come se fosse l'intero valore di un modello. Il divario di ventisette punti è reale e non è l'unico numero nel fascicolo. Sul recupero a contesto lungo, la stessa commissione indipendente colloca Muse Glimmer entro mezzo punto da modelli a pesi aperti appartenenti a una classe di peso molto superiore, e i benchmark agentici di Meta sono rispettabili per un modello che gira su un portatile. Nel frattempo, il punto debole più citato di Step 5 Preview non è affatto la capacità, bensì la verbosità, ed è chiuso finché non arriveranno i pesi promessi il 15 ottobre.

Due modelli, due oggetti completamente diversi

Step 5 Preview è un sistema mixture-of-experts servito dall'infrastruttura di StepFun: circa 600B parametri totali, 27B attivi per token, input testuale e di immagini, una finestra di contesto di 1M token e un punteggio indipendente Intelligence Index di 44 rispetto a una mediana di 26 di modelli comparabili. Il suo output viene generato a 87 token al secondo rispetto a una media di 78 nella misurazione della stessa classifica, e ha generato circa 160 milioni di token di output nell'intera suite di attività dell'indice, dove il modello mediano ne emette circa 82 milioni — all'incirca il doppio del testo per unità di lavoro, fatturato a 2,70 $ per milione. I pesi BF16 erano promessi per il 15 ottobre 2026 e non sono ancora nel repository, quindi oggi il modello esiste per te solo come API.

Muse Glimmer è l'oggetto opposto. È un modello da 30B di parametri addestrato tramite distillazione dei logit dal più grande teacher Muse Spark di Meta, poi messo a punto su dati agentici a contesto lungo e rafforzato per l'uso degli strumenti. Meta lo distribuisce quantizzato a 4 bit, il che porta la memoria da oltre 55 GB a piena precisione a meno di 20 GB — entro un limite di VRAM di 24 GB o 32 GB — ed è stato testato da Meta su una Nvidia RTX 5090 e su silicio Apple M4 Max e M5 Max. Accetta input di testo e immagini in più di cento lingue, supporta un contesto di 131.072 token estendibile a 262.144 ed è progettato per ricevere un obiettivo, scomporlo in passaggi, chiamare strumenti e ritentare una chiamata fallita invece di fermarsi. È Apache 2.0 e funziona offline.

• Punteggio indipendente — Step 5 Preview: 44 rispetto a una mediana di 26 nella sua categoria, contro Muse Glimmer: 17 sullo stesso indice nella sua configurazione superiore.

• Scala — Step 5 Preview: circa 600B totali, 27B attivi secondo StepFun vs Muse Glimmer: 30B totali, quantizzato a 4 bit sotto i 20 GB.

• Finestra di contesto — Anteprima Step 5: 1M token vs Muse Glimmer: 131.072 estendibile a 262.144, secondo Meta.

• Prezzo — Step 5 Preview: $1,00 in / $2,70 out per milione di token, pubblicato vs Muse Glimmer: nessun costo per token; la GPU la fornisci tu.

• Dove viene eseguito — Anteprima del passaggio 5: i server del fornitore, tramite HTTP vs Muse Glimmer: il tuo hardware, offline.

• Licenza — Step 5 Preview: anteprima chiusa, pesi promessi per il 15 ottobre 2026 vs Muse Glimmer: Apache 2.0, scaricabile ora.

• Recupero su contesti lunghi — Muse Glimmer ottiene 80,0 nella valutazione di ragionamento su contesto lungo della classifica dell'indice, entro mezzo punto da modelli che costano diverse volte la sua fascia di prezzo e così vicino al punteggio di Step 5 Preview che la differenza non è rilevante ai fini decisionali per il lavoro di ricerca dei fatti.

I ventisette punti, e ciò che non misurano

Un modello da 30B distillato per girare in 20 GB di memoria perderà contro un modello di punta da 600B su un indice di intelligenza generale, e il materiale di Meta stesso non sostiene il contrario — una delle sue formulazioni è schietta: Glimmer non è progettato per eguagliare la potenza di ragionamento grezza dei modelli cloud su scala completa. Quindi il punteggio di 17 non è un verdetto sull'ingegneria; è il risultato atteso del soppesare un obiettivo diverso. La domanda giusta è quali dei tuoi compiti copra effettivamente quel divario.

La lettura a contesto lungo è il punto in cui i due si avvicinano di più e in cui l'intuizione viene meno. Muse Glimmer ottiene 80,0 nella valutazione di ragionamento a contesto lungo della board — un punteggio che sarebbe banale per un modello di frontiera e che è notevole per uno che gira su una GPU consumer. Se il tuo carico di lavoro è il recupero, la sintesi o l'estrazione su documenti lunghi, un modello locale a quel livello non è ovviamente lo strumento sbagliato, e il fatto che la richiesta non lasci mai la tua macchina è una funzionalità che non puoi comprare da un'API a nessun prezzo.

Poi c’è la parte del confronto che i numeri di Meta non mostrano. Uno studio sottoposto a revisione paritaria sull’orchestrazione multi-agente ha testato Muse-Glimmer-30B in una configurazione controllata — stesso compito, stesso harness, stessi consulenti — e ha rilevato che non ha recuperato nessuno dei candidati prodotti da modelli di frontiera più grandi, fallendo tutti e tre i tentativi in ogni configurazione. Si tratta di un singolo studio su una sola configurazione, ed è il tipo di evidenza che una pagina di modello non mostra mai. Per le pipeline agentiche in cui un orchestratore più debole deve recuperare dal fallimento di un modello più forte, è il risultato più rilevante per le decisioni in questo articolo, e vale la pena leggerlo prima di qualsiasi benchmark riportato da Meta come fornitore.

Quei benchmark, per completezza, sono quelli di Meta e non replicati: 76,0% su SWE-Bench Verified, 51,2% su SWE-Bench Pro, 51,7% su TerminalBench 2.1, 65,9% su OSWorld-Verified, 83,5% su GPQA Diamond, 22% su Humanity's Last Exam e 75,5 su MCP-Atlas. Sono misurati rispetto a modelli della sua stessa classe dimensionale e descrivono un agente locale capace, più che un ragionatore di frontiera.

Generated two-column scoreboard card titled 'Step 5 Preview vs Muse Glimmer - the scoreboard'. The left column gives Step 5 Preview an independent index of 44, the vendor's servers as the runtime, closed preview weights, $1.00 / $2.70 per 1M tokens, about 160M output tokens against an 82M median, and wins on capability ceiling, 1M context and image input. The right column gives Muse Glimmer an independent index of 17, your own GPU offline as the runtime, Apache 2.0 weights, no per-token charge, a long-context retrieval score of 80.0 within half a point of much larger models, and wins on privacy perimeter, zero marginal cost and portability. A footer reads 'Index and long-context figures per Artificial Analysis; Muse Glimmer specifications per Meta, vendor-reported.'

Dove cade effettivamente il confine

Il vantaggio strutturale di Step 5 Preview è che fa il lavoro che non puoi fare in locale. Un contesto da 1M di token, input di immagini, un punteggio misurato vicino alla frontiera e 87 token di output al secondo senza hardware da acquistare: per la stesura, la pianificazione, la revisione del codice su un ampio repository, o qualsiasi cosa in cui il tetto del modello è il collo di bottiglia, l'API vince e i ventisette punti sono l'intero argomento. Il costo di ciò è l'opposto di quello di Muse Glimmer: i prompt escono dal tuo perimetro, il prezzo si riapplica su ogni token, e la verbosità del modello rende i carichi di lavoro con output lunghi più costosi di quanto suggerisca la tariffa di $2,70.

Screenshot of the Artificial Analysis model page for Muse Glimmer in its high configuration, headed 'Muse Glimmer (High) Intelligence, Performance & Price Analysis', showing Meta as the creator, an open-weights release date of August 2026, an Intelligence Index of 17, and a 131k-token context window with text and image input.

Il vantaggio di Muse Glimmer è che svolge il lavoro che non può uscire. Se i dati sono regolamentati, se il budget di latenza è di pochi millisecondi, se la macchina è offline, se il costo marginale della milionesima richiesta deve essere zero, allora nessuna API è candidata — non questa, nessuna. Il prezzo è la capacità: stai scegliendo un 7 dove esiste un 44, e nell'orchestrazione agentica potresti scegliere un coordinatore che non può rimediare agli errori di un modello più grande.

Per la maggior parte dei team la risposta non è una scelta ma una divisione, e la divisione deve pur trovare posto da qualche parte. OrcaRouter instrada più di 200 modelli dietro un'unica chiave API e un'unica fattura, con markup dello 0% e prezzo di listino del provider passato tal quale, più failover automatico e un DSL di routing per instradare il traffico in base a task, costo o latenza. Né Step 5 Preview né Muse Glimmer sono in quel catalogo — il modello di punta di StepFun non viene instradato da noi e Glimmer è un download locale — quindi il valore offerto non è l'accesso a nessuno dei due modelli. È l'insieme rispetto al quale li confronteresti in un benchmark, invocabile con un'unica chiave oggi, così che la decisione tra locale e remoto sia determinata dalla tua distribuzione dei task anziché dalla pagina dell'ultimo fornitore che hai consultato.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

Come decidere

Scegli Step 5 Preview quando il tetto è il vincolo. Se i tuoi compiti sono aperti, multimodali, a contesto lungo o agentici nel senso di richiedere un pianificatore capace, il modello API è l'unico dei due in grado di svolgerli, e il suo prezzo è abbastanza basso per la sua categoria che avviarne un pilotaggio è una voce di budget anziché un progetto. Metti a budget la verbosità, prevedi che la data dei pesi del 15 ottobre slitti, e tienine fuori i carichi di lavoro che non devono uscire dall'edificio.

Scegli Muse Glimmer quando il perimetro è il vincolo. Se i tuoi dati non possono essere inviati, se devi eseguire su un aereo o in una fabbrica, o se i tuoi volumi rendono assurdo il prezzo per token, un modello 30B Apache-2.0 che sta in 20 GB è la scelta pratica, e il suo risultato di retrieval a contesto lungo è abbastanza buono che il divario di capacità non si manifesterà in ogni carico di lavoro. Provalo nell'orchestrazione prima di fidartene in quel contesto, perché è lì che l'evidenza indipendente è più debole.

Se entrambi i vincoli si applicano contemporaneamente, esegui entrambi: in locale per i dati che non possono spostarsi, tramite API per le attività che richiedono un modello più grande, e fai in modo che la decisione di routing sia una modifica di configurazione anziché una migrazione. Il confronto che conta non è 44 contro 17. È quali delle tue richieste possono permettersi di lasciare la macchina, e questa è una domanda a cui solo il tuo traffico può rispondere.