
Muse Spark 1.3 Max Reasoning è Live: L'impostazione dietro i migliori punteggi di Meta ora è disponibile per tutti
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 221 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Muse Spark 1.3 — il modello di ragionamento all'avanguardia rilasciato da Meta Superintelligence Labs il 2 settembre — ha appena ottenuto la modalità su cui era basata la sua stessa classifica. Il 4 settembre, dopo due giorni di ulteriori test di sicurezza, Meta ha aperto l'impostazione di ragionamento "max" più intensiva dal punto di vista computazionale agli sviluppatori su Meta Model API e in Muse Code, il suo agente di codifica da terminale. Il chief AI officer Alexandr Wang ha annunciato il lancio su X e l'account aziendale @AIatMeta lo ha confermato; quella che al lancio era una configurazione limitata a Meta e a un'anteprima per partner è ora un livello di ragionamento selezionabile da qualsiasi sviluppatore.
Questa sequenza è importante perché molti dei numeri che hanno dominato la copertura del lancio di Muse Spark 1.3 — 75,4 su DeepSWE v1.1, 66,9 su OSWorld 2.0, 1.754 su GDPval-AA v2 — provenivano dalla configurazione max, mentre il modello che gli sviluppatori potevano effettivamente invocare è stato distribuito con lo sforzo di ragionamento limitato a “xhigh”. Meta è stata esplicita al lancio: la configurazione max era ancora in fase di test di sicurezza, ma questa separazione ha fatto sì che il tabellone dei punteggi in evidenza e il modello invocabile fossero due cose diverse per due giorni. Il rilascio di giovedì colma questo divario, senza toccare il prezzo per token. Le cifre dei benchmark in quell’elenco appartengono a Meta e non sono state finora riprodotte da un harness di test indipendente; ogni dato riportato dal fornitore in questo articolo è etichettato come tale.
Cosa è stato trattenuto — e cosa è cambiato il 4 settembre
La scala di ragionamento di Muse Spark 1.3 è rimasta invariata da quando è stata aperta l'API a pagamento della famiglia: il ragionamento è sempre attivo e il parametro effort del modello sull'API Meta Model assume i valori minimal, low, medium, high e xhigh; all'aumentare del livello, il modello spende una quota maggiore del proprio budget di output per pensare. Max si colloca al di sopra di xhigh: più potenza di calcolo, più token di ragionamento e, secondo Meta, significativamente più efficace nel lavoro agentico a lungo orizzonte. Al lancio del 2 settembre, Meta ha messo a disposizione tutti i livelli fino a xhigh, ma ha tenuto max fuori dall'API pubblica in attesa di ulteriori test di sicurezza, condividendolo solo con un gruppo limitato di partner: abbastanza per eseguire una valutazione indipendente, non abbastanza per un carico di lavoro in produzione.
Il 4 settembre Wang ha dichiarato che i test erano terminati. Max è ora un'impostazione selezionabile in Muse Code — lo script di installazione è su dev.meta.ai/install.sh — e sull'ID del modello muse-spark-1.3 tramite la Meta Model API, dove il parametro effort ora accetta max. Wang ha definito lo sfasamento di due giorni come il modo in cui Meta limita l'accesso “a livello di configurazione”, e ha detto ad Axios che Meta non ha dovuto sospendere il suo lavoro più ampio per questioni di sicurezza. La finestra è stata breve, ma è un vero precedente: Meta è ora disposta a trattenere una specifica modalità di ragionamento in attesa di una revisione di sicurezza, pur rilasciando immediatamente il resto di un checkpoint.
Un avvertimento pratico per chiunque chiami il modello tramite un gateway piuttosto che l'endpoint di Meta: diverse pagine di documentazione di terze parti ed elenchi di aggregatori sono stati scritti il giorno del lancio e ancora elencano lo sforzo di ragionamento solo fino a xhigh. Il valore max è un rollout lato Meta, quindi verifica che il percorso che usi per chiamare abbia aggiornato la propria superficie di parametri prima di dare per scontato che max sia raggiungibile — un proxy che ha convalidato i propri valori accettati il 2 settembre potrebbe rifiutare "max" finché i suoi manutentori non si aggiornano.
Cosa compra realmente il massimo — e dove non aiuta
I materiali pubblicati da Meta giovedì includono una suddivisione esplicita tra le configurazioni max e xhigh sui benchmark che esegue, e questa è la cosa più utile che abbia pubblicato finora sul modello. Tutto è dichiarato dal fornitore stesso, prodotto all'interno dell'harness Muse Code di Meta, e Meta afferma che i suoi confronti con Claude Opus 5 e GPT-5.6 Sol sono stati condotti come prove "best-effort" alle impostazioni massime di quei rivali, e che tali prove "potrebbero non riflettere le prestazioni ottimizzate dal provider". Con questa avvertenza, la suddivisione offre una chiara indicazione direzionale:
• OSWorld 2.0 (compiti per agenti che usano il computer) — 66.9 a max vs 57.2 a xhigh
• GDPval-AA v2 (Elo agente di lavoro cognitivo) — 1754 a max vs 1709 a xhigh
• JobBench (compiti professionali a lungo orizzonte) — 64.9 a max vs 61.2 a xhigh
• DeepSearchQA — un pareggio a 89.4
• Terminal-Bench 2.1 (codifica con agente terminale) — 89.2 su xhigh contro 88.8 su max, l'unica suite in cui vince la configurazione rilasciata il 2 settembre.

Il pattern merita di essere letto con attenzione. Max aiuta di più dove il compito è un lungo ciclo agentico — operare su un computer, gestire un brief di knowledge work, tenere una pianificazione di sottoattività come fa JobBench. Su un benchmark terminale a turno singolo non ha aggiunto nulla ed è costato un po': Terminal-Bench è il monito che «più ragionamento» non è un miglioramento monotono, ed è il motivo per cui conviene fare un test A/B di max rispetto a xhigh sul proprio carico di lavoro, piuttosto che assumere che l'impostazione più alta sia migliore ovunque. Meta segnala inoltre il risultato di 75.4 su DeepSWE v1.1 — il titolo del primo giorno, in aumento rispetto al 59.3 che Meta aveva riportato per Muse Spark 1.2 sei settimane prima — come un dato di configurazione max. È quella la cifra che i valutatori indipendenti rieseguiranno per primi.
La lettura indipendente sta iniziando a mettersi al passo.
Ciò che mancava al lancio era una qualsiasi misurazione indipendente, e questo divario si sta chiudendo secondo una tempistica che coincide con il rollout di max. Il Coding Agent Index di Artificial Analysis — che valuta ogni modello all'interno del suo harness nativo per agenti di codifica e combina i task di DeepSWE, Terminal-Bench e SWE-Atlas — ha collocato questa settimana Muse Spark 1.3 (max) nell'harness Muse Code con un punteggio di 68, secondo in classifica dietro a Claude Opus 5 (xhigh) in Claude Code e davanti a Claude Fable 5 (max) con 67 e GPT-5.6 Sol (max) con 65. La stessa classifica assegna alla configurazione xhigh distribuita un punteggio di 64 nello stesso harness Muse Code, che è la lettura più pulita finora in termini di confronto alla pari di ciò che max aggiunge — circa quattro punti dell'indice — su un insieme di task indipendente. Quella riga della classifica è stata pubblicata mentre max era ancora in anteprima per i partner; la configurazione che descrive è quella che è stata resa disponibile al pubblico il 4 settembre.
Artificial Analysis ha anche aggiornato la propria scheda del modello per la configurazione max dopo il lancio. Durante il periodo di anteprima la scheda non indicava alcun provider né prezzo; la scheda live ora elenca Meta al prezzo standard di $1,25 per milione di token di input e $4,25 per milione di token di output — lo stesso prezzo di listino di Muse Spark 1.2 — aggiungendo però un'avvertenza sulla verbosità: la run di valutazione di AA ha consumato circa 130 milioni di token contro una mediana di 79 milioni, è costata circa $1.335 in totale e si attesta intorno a $0,95 per task nella stima per-task di AA, a circa 190 token di output al secondo.
Un numero emerso nella copertura precedente merita una verifica sulla versione. Questa settimana Artificial Analysis ha aggiornato il suo Intelligence Index alla v4.2, la stessa settimana in cui max è stato distribuito, ricalcolando i punteggi del settore e spostando le mediane. Nella scheda attuale la configurazione max segna 53 contro una mediana di 29 dei modelli comparabili; il 62 circolato nella copertura della settimana di lancio era stato misurato sulla versione precedente dell'indice, e i due valori non sono confrontabili. Lo split xhigh-versus-max di Meta mostrato sopra è indipendente dall'indice di AA e non è influenzato dall'aggiornamento.

Quanto costa il massimo — il conto è nei token, non nel listino prezzi.
Meta non pubblica un prezzo separato per la configurazione max, né un'analisi dedicata della latenza. Il prezzo per token è identico a quello di Muse Spark 1.2 e a ogni altro livello di sforzo su Muse Spark 1.3: $1,25 per milione di token di input, $4,25 per milione di token di output e $0,15 per l'input in cache nel livello standard. I token di ragionamento vengono fatturati come token di output e conteggiati nel budget di output, quindi scegliere max non è un aumento di prezzo a sé stante — è una promessa di spendere più di quel budget pensando prima di rispondere.
Ciò rende la vera questione dei costi una questione di volume di token, e i primi dati dicono che max è dispendioso proprio dove xhigh è parco. L'esecuzione strumentata di AA ha consumato circa 130 milioni di token in una singola valutazione della configurazione. Per uno sviluppatore che esegue già lunghi cicli agentici a xhigh, il test A/B che conta non è "max supera più attività" ma "max supera abbastanza attività aggiuntive da compensare una bolletta di token sostanzialmente più grande sullo stesso carico di lavoro."
Il livello Contributor di Meta — $0,10 in ingresso e $0,20 in uscita per milione di token in cambio del permesso a Meta di addestrarsi sui tuoi prompt e sulle tue completazioni — si applica allo stesso checkpoint, e Meta afferma che una significativa percentuale a doppia cifra di sviluppatori lo sceglie. I termini di Contributor rendono ogni invio un dato di addestramento e i suoi limiti di frequenza sono stretti, quindi è una scelta predefinita pessima per il fan-out in produzione, ma un modo legittimo per eseguire costosi esperimenti max a basso costo se lo scambio di dati è accettabile per te.
L'ancora di prezzo per tutto questo è facile da verificare senza credere a Meta sulla parola, perché il checkpoint Muse Spark 1.3 ha un prezzo identico a quello già presente su OrcaRouter al prezzo di listino di Meta: Muse Spark 1.2 è su OrcaRouter a $1,25 in ingresso e $4,25 in uscita per milione di token con zero ricarico, quindi l'affermazione del "prezzo invariato" è verificabile su una pagina live che mostra esattamente quei numeri. Muse Spark 1.3 stesso non è ancora su OrcaRouter. Quando uno dei provider che trattiamo inizia a servirlo con max, il prezzo mostrato dalla nostra parte sarà il prezzo di listino di Meta trasferito direttamente — non applichiamo ricarichi ai prezzi dei provider — e qualsiasi taglio del fornitore diventa attivo lo stesso giorno in cui Meta lo rende operativo. Per un rilascio come questo, in cui gli aspetti economici interessanti risiedono nel volume di token piuttosto che nel prezzo di listino, è questo trasferimento diretto a garantire che l'importo effettivamente addebitato sia uguale a quello pubblicato da Meta.

Chi dovrebbe passare a max
La decisione si divide nettamente:
• Passa a carichi di lavoro agentici a lungo orizzonte — uso del computer, brief di knowledge-work, loop di strumenti multi-step in Muse Code — dove sia lo split di Meta sia la classifica degli agenti di codifica di AA mostrano i maggiori guadagni massimi. Fai prima un test A/B con xhigh su un campione dei tuoi task reali, perché la verbosità è un problema concreto.
• Resta su xhigh per chiamate ad alto volume, sensibili alla latenza o brevi a turno singolo, dove max aggiunge principalmente token. Terminal-Bench è la prova che non sempre aggiunge capacità.
• D'ora in poi, tieni d'occhio tre cose: il rilascio dei pesi aperti che Zuckerberg ha promesso senza data, la distribuzione ai consumatori di Muse Spark 1.3 su Instagram, Facebook e Meta AI nelle prossime settimane, e se la classifica degli agenti di codifica di Artificial Analysis inizierà a prezzare la riga massima ora che la configurazione è generalmente disponibile.
Il blocco di due giorni si è rivelato breve, ma ha messo in luce un punto che sopravvive al rollout stesso: i numeri più forti di Muse Spark 1.3 di Meta non sono mai stati un miraggio — aspettavano solo una revisione di sicurezza. Dal 4 settembre, il modello che uno sviluppatore può chiamare e il modello in classifica sono finalmente lo stesso modello. Se max si guadagna i suoi token è ora una questione empirica a cui qualsiasi sviluppatore può rispondere, sull'API di Meta o su qualunque percorso usi già per raggiungere la famiglia Muse Spark.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
