
Step 5 Preview vs Muse Glimmer: l'API Frontier e il modello laptop
- OrcaNUOVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M di token
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
Su una classifica, Step 5 Preview e Muse Glimmer non sono vicini: 44 contro 17 sull'Artificial Analysis Intelligence Index — un divario di ventisette punti su una scala il cui leader attuale si attesta nella fascia alta dei cinquanta — che nessun tipo di ottimizzazione riuscirà a colmare. Sulla domanda a cui un team deve davvero rispondere — dove vengono eseguiti i miei token — sono concorrenti diretti. Step 5 Preview è il modello di punta di StepFun, annunciato il 20 settembre 2026, con circa 600 miliardi di parametri totali e 27 miliardi attivi, un contesto da 1M di token, al prezzo di 1,00 $ per milione di token in input e 2,70 $ per milione di token in output, e raggiungibile solo tramite rete. Muse Glimmer è il modello agentico open-weight da 30 miliardi di parametri di Meta Superintelligence Labs, rilasciato il 10 agosto 2026 con licenza Apache 2.0, distribuito quantizzato a 4-bit così da stare sotto i 20 GB di memoria e girare su una singola GPU consumer con la rete scollegata. Il modo giusto di leggere questo confronto non è "quale dei due è più intelligente". È "quale dei due vincoli — capacità o perimetro — è quello che il tuo carico di lavoro non può spostare".
Il confronto è anche un utile correttivo a un'abitudine che questo mercato ha acquisito: trattare il punteggio di un indice composito come se fosse l'intero valore di un modello. Il divario di ventisette punti è reale e non è l'unico numero nel fascicolo. Sul recupero a contesto lungo, la stessa commissione indipendente colloca Muse Glimmer entro mezzo punto da modelli a pesi aperti appartenenti a una classe di peso molto superiore, e i benchmark agentici di Meta sono rispettabili per un modello che gira su un portatile. Nel frattempo, il punto debole più citato di Step 5 Preview non è affatto la capacità, bensì la verbosità, ed è chiuso finché non arriveranno i pesi promessi il 15 ottobre.
Due modelli, due oggetti completamente diversi
Step 5 Preview è un sistema mixture-of-experts servito dall'infrastruttura di StepFun: circa 600B parametri totali, 27B attivi per token, input testuale e di immagini, una finestra di contesto di 1M token e un punteggio indipendente Intelligence Index di 44 rispetto a una mediana di 26 di modelli comparabili. Il suo output viene generato a 87 token al secondo rispetto a una media di 78 nella misurazione della stessa classifica, e ha generato circa 160 milioni di token di output nell'intera suite di attività dell'indice, dove il modello mediano ne emette circa 82 milioni — all'incirca il doppio del testo per unità di lavoro, fatturato a 2,70 $ per milione. I pesi BF16 erano promessi per il 15 ottobre 2026 e non sono ancora nel repository, quindi oggi il modello esiste per te solo come API.
Muse Glimmer è l'oggetto opposto. È un modello da 30B di parametri addestrato tramite distillazione dei logit dal più grande teacher Muse Spark di Meta, poi messo a punto su dati agentici a contesto lungo e rafforzato per l'uso degli strumenti. Meta lo distribuisce quantizzato a 4 bit, il che porta la memoria da oltre 55 GB a piena precisione a meno di 20 GB — entro un limite di VRAM di 24 GB o 32 GB — ed è stato testato da Meta su una Nvidia RTX 5090 e su silicio Apple M4 Max e M5 Max. Accetta input di testo e immagini in più di cento lingue, supporta un contesto di 131.072 token estendibile a 262.144 ed è progettato per ricevere un obiettivo, scomporlo in passaggi, chiamare strumenti e ritentare una chiamata fallita invece di fermarsi. È Apache 2.0 e funziona offline.
• Punteggio indipendente — Step 5 Preview: 44 rispetto a una mediana di 26 nella sua categoria, contro Muse Glimmer: 17 sullo stesso indice nella sua configurazione superiore.
• Scala — Step 5 Preview: circa 600B totali, 27B attivi secondo StepFun vs Muse Glimmer: 30B totali, quantizzato a 4 bit sotto i 20 GB.
• Finestra di contesto — Anteprima Step 5: 1M token vs Muse Glimmer: 131.072 estendibile a 262.144, secondo Meta.
• Prezzo — Step 5 Preview: $1,00 in / $2,70 out per milione di token, pubblicato vs Muse Glimmer: nessun costo per token; la GPU la fornisci tu.
• Dove viene eseguito — Anteprima del passaggio 5: i server del fornitore, tramite HTTP vs Muse Glimmer: il tuo hardware, offline.
• Licenza — Step 5 Preview: anteprima chiusa, pesi promessi per il 15 ottobre 2026 vs Muse Glimmer: Apache 2.0, scaricabile ora.
• Recupero su contesti lunghi — Muse Glimmer ottiene 80,0 nella valutazione di ragionamento su contesto lungo della classifica dell'indice, entro mezzo punto da modelli che costano diverse volte la sua fascia di prezzo e così vicino al punteggio di Step 5 Preview che la differenza non è rilevante ai fini decisionali per il lavoro di ricerca dei fatti.
I ventisette punti, e ciò che non misurano
Un modello da 30B distillato per girare in 20 GB di memoria perderà contro un modello di punta da 600B su un indice di intelligenza generale, e il materiale di Meta stesso non sostiene il contrario — una delle sue formulazioni è schietta: Glimmer non è progettato per eguagliare la potenza di ragionamento grezza dei modelli cloud su scala completa. Quindi il punteggio di 17 non è un verdetto sull'ingegneria; è il risultato atteso del soppesare un obiettivo diverso. La domanda giusta è quali dei tuoi compiti copra effettivamente quel divario.
La lettura a contesto lungo è il punto in cui i due si avvicinano di più e in cui l'intuizione viene meno. Muse Glimmer ottiene 80,0 nella valutazione di ragionamento a contesto lungo della board — un punteggio che sarebbe banale per un modello di frontiera e che è notevole per uno che gira su una GPU consumer. Se il tuo carico di lavoro è il recupero, la sintesi o l'estrazione su documenti lunghi, un modello locale a quel livello non è ovviamente lo strumento sbagliato, e il fatto che la richiesta non lasci mai la tua macchina è una funzionalità che non puoi comprare da un'API a nessun prezzo.
Poi c’è la parte del confronto che i numeri di Meta non mostrano. Uno studio sottoposto a revisione paritaria sull’orchestrazione multi-agente ha testato Muse-Glimmer-30B in una configurazione controllata — stesso compito, stesso harness, stessi consulenti — e ha rilevato che non ha recuperato nessuno dei candidati prodotti da modelli di frontiera più grandi, fallendo tutti e tre i tentativi in ogni configurazione. Si tratta di un singolo studio su una sola configurazione, ed è il tipo di evidenza che una pagina di modello non mostra mai. Per le pipeline agentiche in cui un orchestratore più debole deve recuperare dal fallimento di un modello più forte, è il risultato più rilevante per le decisioni in questo articolo, e vale la pena leggerlo prima di qualsiasi benchmark riportato da Meta come fornitore.
Quei benchmark, per completezza, sono quelli di Meta e non replicati: 76,0% su SWE-Bench Verified, 51,2% su SWE-Bench Pro, 51,7% su TerminalBench 2.1, 65,9% su OSWorld-Verified, 83,5% su GPQA Diamond, 22% su Humanity's Last Exam e 75,5 su MCP-Atlas. Sono misurati rispetto a modelli della sua stessa classe dimensionale e descrivono un agente locale capace, più che un ragionatore di frontiera.

Dove cade effettivamente il confine
Il vantaggio strutturale di Step 5 Preview è che fa il lavoro che non puoi fare in locale. Un contesto da 1M di token, input di immagini, un punteggio misurato vicino alla frontiera e 87 token di output al secondo senza hardware da acquistare: per la stesura, la pianificazione, la revisione del codice su un ampio repository, o qualsiasi cosa in cui il tetto del modello è il collo di bottiglia, l'API vince e i ventisette punti sono l'intero argomento. Il costo di ciò è l'opposto di quello di Muse Glimmer: i prompt escono dal tuo perimetro, il prezzo si riapplica su ogni token, e la verbosità del modello rende i carichi di lavoro con output lunghi più costosi di quanto suggerisca la tariffa di $2,70.

Il vantaggio di Muse Glimmer è che svolge il lavoro che non può uscire. Se i dati sono regolamentati, se il budget di latenza è di pochi millisecondi, se la macchina è offline, se il costo marginale della milionesima richiesta deve essere zero, allora nessuna API è candidata — non questa, nessuna. Il prezzo è la capacità: stai scegliendo un 7 dove esiste un 44, e nell'orchestrazione agentica potresti scegliere un coordinatore che non può rimediare agli errori di un modello più grande.
Per la maggior parte dei team la risposta non è una scelta ma una divisione, e la divisione deve pur trovare posto da qualche parte. OrcaRouter instrada più di 200 modelli dietro un'unica chiave API e un'unica fattura, con markup dello 0% e prezzo di listino del provider passato tal quale, più failover automatico e un DSL di routing per instradare il traffico in base a task, costo o latenza. Né Step 5 Preview né Muse Glimmer sono in quel catalogo — il modello di punta di StepFun non viene instradato da noi e Glimmer è un download locale — quindi il valore offerto non è l'accesso a nessuno dei due modelli. È l'insieme rispetto al quale li confronteresti in un benchmark, invocabile con un'unica chiave oggi, così che la decisione tra locale e remoto sia determinata dalla tua distribuzione dei task anziché dalla pagina dell'ultimo fornitore che hai consultato.

Come decidere
Scegli Step 5 Preview quando il tetto è il vincolo. Se i tuoi compiti sono aperti, multimodali, a contesto lungo o agentici nel senso di richiedere un pianificatore capace, il modello API è l'unico dei due in grado di svolgerli, e il suo prezzo è abbastanza basso per la sua categoria che avviarne un pilotaggio è una voce di budget anziché un progetto. Metti a budget la verbosità, prevedi che la data dei pesi del 15 ottobre slitti, e tienine fuori i carichi di lavoro che non devono uscire dall'edificio.
Scegli Muse Glimmer quando il perimetro è il vincolo. Se i tuoi dati non possono essere inviati, se devi eseguire su un aereo o in una fabbrica, o se i tuoi volumi rendono assurdo il prezzo per token, un modello 30B Apache-2.0 che sta in 20 GB è la scelta pratica, e il suo risultato di retrieval a contesto lungo è abbastanza buono che il divario di capacità non si manifesterà in ogni carico di lavoro. Provalo nell'orchestrazione prima di fidartene in quel contesto, perché è lì che l'evidenza indipendente è più debole.
Se entrambi i vincoli si applicano contemporaneamente, esegui entrambi: in locale per i dati che non possono spostarsi, tramite API per le attività che richiedono un modello più grande, e fai in modo che la decisione di routing sia una modifica di configurazione anziché una migrazione. Il confronto che conta non è 44 contro 17. È quali delle tue richieste possono permettersi di lasciare la macchina, e questa è una domanda a cui solo il tuo traffico può rispondere.
