
Muse Spark 1.2 vs Muse Spark 1.1: Dovresti Fare l'Aggiornamento?
- metaNUOVOMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenNUOVOQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekNUOVODeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- qwenNUOVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 2038 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0856Intelligenza72Codice
- tencentTencent: Hy32026-07-0642Intelligenza59Codice
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligenza42Codice
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligenza39Codice
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligenza72Codice
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligenza52Codice57Matematica
- z-aiZ.ai: GLM 5.22026-06-1653Intelligenza69Codice60Matematica
Meta ha sostituito Muse Spark 1.1 con Muse Spark 1.2 il 5 agosto 2026 senza cambiare il prezzo, la finestra di contesto, l'elenco delle modalità, i parametri supportati o la manopola del ragionamento. La migrazione quindi sembra gratuita — stessa famiglia di stringhe del modello, stessa fatturazione, nulla da rinegoziare. Non è gratuita. Misurazioni indipendenti pongono il tempo al primo token della nuova versione a 26,12 secondi contro i 2,90 della vecchia versione, e il suo output sostenuto a 165 token al secondo contro i 213,5. Stai acquistando tre punti di intelligenza misurata con circa nove volte l'attesa prima che qualcosa ritorni.
Se valga la pena farlo dipende quasi interamente da quanto durano i tuoi task. Ecco cosa cambia davvero, cosa è rimasto identico e cosa nessuno può ancora dirti.
La decisione in quattro righe
• Indice di Intelligenza: 51 → 54, misurato indipendentemente da Artificial Analysis all'impostazione xhigh di ciascuna versione.
• Tempo al primo token: 2.90s → 26.12s, stessa sorgente, stesse condizioni.
• Costo per eseguire la stessa suite di benchmark: $548.07 → $637.85, con prezzi per token identici. Il 16% in più è puro consumo di token.
• Tutto ciò che un modulo di approvvigionamento chiede: invariato.

Ciò che è genuinamente identico
Vale la pena elencarlo perché è il motivo per cui una migrazione sembra banale sulla carta, e perché una differenza che non esiste è qualcosa che non è necessario testare.
• Prezzo — $1.25 per milione di token di input, $4.25 per milione di output, $0.15 per milione su accesso alla cache, $2.50 per mille ricerche web integrate. Tutti questi importi sono identici in entrambe le versioni.
• Contesto — 1.048.576 token su entrambi, senza livelli di sovrapprezzo per il contesto lungo su nessuno dei due.
• Modalità — testo, immagini, video, audio e PDF in ingresso; testo in uscita. Entrambe le inserzioni indicano gli stessi cinque tipi di input.
• Selettore del ragionamento — obbligatorio su entrambe, cinque livelli (minimo, basso, medio, alto, extra alto), predefinito medio su entrambe. Nessuna delle due versioni dispone di un'impostazione per disattivare il pensiero.
• Parametri — tools, tool_choice, structured_outputs, response_format, reasoning_effort, include_reasoning, max_tokens, temperature, top_p, top_k, repetition_penalty. Elenchi identici.
• Erogazione — un fornitore, la stessa Meta, su entrambi. Nessun host di terze parti, nessuna variante di quantizzazione.
• Prezzo misto — Artificial Analysis li colloca entrambi a $0,78 per milione di token in base alla sua ponderazione mista, il che è ciò che ci si aspetterebbe da listini prezzi identici.
Se speravi che l'aggiornamento includesse più contesto, una garanzia sulla lunghezza dei completamenti o una cache più economica, non è stato così. Si tratta di una release di pesi e post-training con una scheda tariffaria copiata e incollata dalla precedente.
Cosa si è mosso davvero
Artificial Analysis è attualmente l'unica parte indipendente ad aver valutato entrambe le versioni, e le ha valutate entrambe con il massimo sforzo di ragionamento, quindi il confronto è alla pari.
• Indice di Intelligenza — da 51 per 1.1 (posizione #22 su 185) a 54 per 1.2 (posizione #13). Nove posizioni in una classifica in cui la mediana di classe è 32, quindi il guadagno garantisce una posizione reale, non solo un decimale.
• Tempo al primo token — da 2,90 s a 26,12 s. Questa è la regressione principale e non è marginale.
• Velocità di output — da 213,5 a 165,0 token al secondo. Ancora al 16º posto su 185 e ancora descritta da Artificial Analysis come "notevolmente veloce", ma del 23% più lenta rispetto al modello che sostituisce.
• Verbosità — 94M token di output per attraversare l'indice, contro 95M. Sostanzialmente invariato, ed entrambi circa il 45% al di sopra della mediana di 65M.
• Spesa totale per la valutazione — da $548.07 a $637.85. Poiché la verbosità quasi non è cambiata e i prezzi non sono cambiati affatto, quel aumento del 16% proviene da qualcosa di diverso dall'output visibile: tracce di ragionamento interno più lunghe, più tentativi o più turni di strumenti per attività.
Il pattern è coerente. Meta non ha reso il modello più economico, più veloce o più grande. Ha fatto riflettere il modello più a lungo prima di decidere, e la riflessione in più si manifesta come latenza, come uno streaming leggermente più lento e come una fattura più alta del 16% per un lavoro identico. Tre punti indice è ciò che ha fruttato.
Quanto è davvero grave la latenza
Il dato di 26,12 secondi verrà citato fuori contesto, quindi trattalo correttamente: viene misurato a xhigh, il più costoso dei cinque livelli di impegno, su una suite di benchmark progettata per essere difficile. Per impostazione predefinita, l'API usa medium.
Per avere un'idea di cosa significhi in pratica l'impostazione predefinita, Muse Spark 1.1 su OrcaRouter — che serve clienti reali al livello di sforzo che richiedono — mostra un tempo p50 al primo token di 1,84 secondi e un p95 di 6,00 secondi su una settimana mobile. Si tratta di dati di produzione ai livelli di sforzo di produzione, e sono inferiori di oltre un ordine di grandezza rispetto al valore di riferimento. La versione 1.2 non ha ancora telemetria di produzione.

Quindi la lettura onesta non è "1.2 risponde in 26 secondi." È: nell'impostazione in cui 1.2 guadagna i suoi tre punti extra, il primo token ti costa 26 secondi, e nella stessa impostazione il vecchio modello te ne costava tre. Se stavi già usando xhigh — che è esattamente la configurazione in cui esiste il guadagno di intelligenza — quello è il numero che erediti. Se usi il livello medio o inferiore, vedrai qualcosa di molto più breve, e vedrai anche meno del miglioramento.
Quell'accoppiamento è la vera trappola in questo aggiornamento. Non puoi ottenere l'intelligenza senza la deliberazione, perché è dalla deliberazione che nasce l'intelligenza.
Il riposizionamento dietro i numeri
Meta non ha pubblicato alcun post di lancio per la 1.2 — la pagina di annuncio di Muse Spark descrive ancora la 1.1 — ma ha riscritto la descrizione del prodotto, e la riscrittura spiega il compromesso.
Muse Spark 1.1 è stato commercializzato come un modello di ragionamento multimodale con una superficie di input insolitamente ampia, pensato per "agenti multimodali, ricerca approfondita su contenuti misti e analisi di contesti lunghi": rapporti lunghi, librerie multimediali, registrazioni e video insieme al testo.
La descrizione di Muse Spark 1.2 tralascia quasi tutto ciò e cita invece l'ingegneria del software — refactoring multi-file, sessioni di debug prolungate, generazione dell'intero repository — per poi aggiungere un'esplicita affermazione multi-agente: il modello può agire come agente principale che raccoglie il contesto, pianifica e delega, oppure come subagente che esegue in parallelo sotto quest'ultimo. Sostiene inoltre che la cache dei prompt possa ridurre il costo effettivo del 60–80% a seconda di quanto contesto si ripete tra una chiamata e l'altra. Quest'ultima cifra è una stima di Meta, più che un risultato misurato, sebbene la tariffa di cache di $0,15 la renda aritmeticamente credibile.
Leggi la regressione della latenza rispetto a quel riposizionamento e smette di sembrare un errore. Nessuno che rifattorizza una dozzina di file si preoccupa di 26 secondi di pianificazione. Meta ha scelto un cliente, e non è quello a cui è stata venduta la 1.1.
Quello che 1.1 ha ancora e che 1.2 non ha.
Quattro settimane di esistenza non sono sufficienti per accumulare un track record, e sotto tre aspetti concreti il modello più vecchio è attualmente il prodotto meglio documentato.
• Un record in arena.Muse Spark 1.1 ha una storia sostanziosa nella Design Arena: 1334 Elo al 5º posto nello sviluppo di giochi, 1334 al 7º posto nei componenti UI, 1320 al 3º posto nell'arte ASCII, 1318 nella visualizzazione dei dati, 1309 nelle categorie generali di codice, più un'intera ladder agents-arena che copre app web, slide HTML e sviluppo di giochi Godot. Muse Spark 1.2 non ha alcuna voce. Sull'asse che Meta sta ora promuovendo con maggiore insistenza, non ci sono dati di confronto diretto per il nuovo modello.
• Punteggi dei sub-indici. Artificial Analysis pubblica un indice di programmazione di 71.3 e un indice agentico di 37.5 per 1.1. Non esiste un corrispondente pubblicato per 1.2. Poiché il punteggio agentico era di gran lunga la dimensione più debole di 1.1, e la capacità agentica è esattamente ciò che 1.2 dichiara di migliorare, questo è il numero che risolverebbe la questione dell'aggiornamento — e non esiste ancora.
• Telemetria di produzione. 1.1 ha alle spalle una settimana di latenza reale p50 e p95 e 4.4M token di traffico live su OrcaRouter. 1.2 non ha nessuno dei due; il suo endpoint attualmente non riporta alcuna statistica di latenza o throughput perché il volume è troppo basso per essere campionato.
• Un posto dove noleggiarlo oltre a Meta. Muse Spark 1.1 è nel catalogo OrcaRouter a $1.25 e $4.25 — il prezzo di listino di Meta, applicato senza alcun ricarico. Muse Spark 1.2 non è ancora presente, quindi oggi si tratta di un'integrazione diretta con Meta con un unico provider e nessun percorso di failover.

Niente di tutto ciò significa che la 1.2 sia peggiore. Significa che le prove a favore della 1.2 consistono in un punteggio composito fornito da un solo valutatore, mentre le prove per la 1.1 sono un mese di arene, sotto-indici e traffico live. Questa asimmetria dovrebbe influire su come pianificare la migrazione, non sul se tentarla.
Una checklist di migrazione che è davvero breve.
Poiché la rate card e la superficie dei parametri sono identiche, lo swap è una modifica della stringa del modello. Il lavoro consiste nel verificare le tre cose che si sono effettivamente spostate.
• Misura il tuo tempo al primo token con la tua impostazione di effort. Non accettare né il valore di 2,90 s né quello di 26,12 s. Esegui i tuoi prompt reali con qualunque reasoning_effort tu passi effettivamente e confronta direttamente. Questo è l'unico numero che può far fallire del tutto la migrazione.
• Controlla la configurazione di timeout e streaming. Un aumento di 9 volte della latenza del primo token ad alto sforzo supererà i timeout del client ottimizzati per la 1.1 e farà sembrare qualsiasi integrazione non streaming un blocco.
• Ricalcola il costo in base ai conteggi dei token misurati, non dalla tariffa.I prezzi sono identici, quindi ogni variazione di costo è comportamentale. Artificial Analysis ha visto una spesa superiore del 16% per lo stesso lavoro; che tu veda o meno questo effetto dipende dal mix di attività.
• Verifica prima la stabilità della cache-key. Con un prefisso stabile di 60.000 token, un tipico passo dell'agente scende da circa 8,8 centesimi a circa 2,2 centesimi su entrambe le versioni. Questa variazione del 75% è più ampia di qualsiasi effetto del cambio di versione, ed è interamente sotto il tuo controllo.
• Ritestare esplicitamente i percorsi audio e video.Entrambe le schede pubblicizzano le stesse cinque modalità di input, ma la scheda tecnica di Artificial Analysis per la 1.2 riporta solo testo e immagine tra le modalità valutate. Meta ha riscritto la presentazione allontanandola dal lavoro multimediale misto. Nessun soggetto indipendente ha verificato se la capacità fosse rimasta valida.
• Mantieni la 1.1 raggiungibile come fallback. Eseguire entrambe dietro un'unica chiave significa che il rollback è un cambio di configurazione piuttosto che un incidente, e ti permette di fare A/B test tra le due sul traffico live invece di discutere su un benchmark.
Chi si muove ora, chi aspetta
Muoviti ora se esegui agenti di codifica a lungo orizzonte con elevato sforzo di ragionamento. I compiti richiedono già minuti, la penalità di latenza si annulla in quel lasso di tempo, l'aumento di intelligenza è misurato da una terza parte anziché dichiarato da Meta, e tre punti indice rappresentano un salto significativo a questo livello — nove posizioni su una classifica di 185 modelli.
Aspettase qualsiasi cosa offri è interattiva. Non esiste configurazione in cui 1.2 sia più reattivo di 1.1, e il ragionamento obbligatorio significa che non puoi recuperare la reattività disattivando il pensiero. La versione 1.1 rimane il modello più veloce a ogni livello di sforzo e costa esattamente lo stesso.
Aspetta se il tuo carico di lavoro è l'analisi di media misti — il caso d'uso di report lunghi, video e audio per cui 1.1 è stato esplicitamente costruito e commercializzato. Meta ha smesso di pubblicizzarlo e l'unica valutazione indipendente di 1.2 riguarda testo e immagini. La funzionalità potrebbe benissimo essere intatta; semplicemente non ci sono prove né a favore né contro, e 1.1 ha un mese di esperienza in merito.
Aspetta se hai bisogno dei dati dell'arena. Un modello venduto sulla generazione dell'intero repository, senza voci in Design Arena e senza un sotto-indice agentico pubblicato, ti sta chiedendo di prendere per buona la parola di Meta riguardo a ciò che ha cambiato. Dagli tre o quattro settimane e non sarà più vero — a quel punto questa decisione sarà molto più facile da prendere sulla base delle prove piuttosto che su un singolo numero composito.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
