Muse Spark 1.2 vs GPT-5.6 Luna-1
Guides & Insights

Muse Spark 1.2 vs GPT-5.6 Luna: Tre punti indice per 4,6 volte il prezzo del token

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Artificial Analysis ha eseguito la stessa suite di nove benchmark su entrambi i modelli e ha tenuto le ricevute. Sottoporre Muse Spark 1.2 alla suite è costato 637,85 $, mentre GPT-5.6 Luna è costato 174,06 $. A fronte di quella differenza di spesa di 3,7 volte, il modello di Meta ha totalizzato tre punti in più — 54 contro 51 sull'Intelligence Index. Se sia un buon affare è l'intera questione, e la risposta dipende molto meno dal benchmark che da due cose su cui quasi nessuno scrive: come il tuo framework per agenti gestisce la cache dei prompt e se il tuo carico di lavoro ha mai bisogno di ascoltare o guardare qualcosa.

Ogni dato riportato di seguito è una misurazione indipendente di Artificial Analysis, un elenco di API live, oppure la telemetria di produzione di OrcaRouter stessa — quest'ultima merita di essere segnalata fin dall'inizio perché contraddice i risultati dei benchmark in modo istruttivo. Nulla qui è una dichiarazione del fornitore spacciata per risultato; quando il fornitore è l'unica fonte, la frase lo dice.

Il punteggio è più vicino di quanto il prezzo suggerisca

Muse Spark 1.2 ottiene 54 sull'Artificial Analysis Intelligence Index con l'impostazione di ragionamento xhigh, classificandosi al 13° posto su 185 modelli rispetto a una mediana di classe di 32. GPT-5.6 Luna ottiene 51 con il massimo sforzo. Tre punti su un composito di GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience e AA-LCR.

Tre punti sono reali ma piccoli, e i punteggi parziali esistenti per la generazione precedente suggeriscono da dove arrivano. Le cifre per dimensione di Artificial Analysis collocano Muse Spark 1.1 a un indice di coding di 71,3 e a un indice agentico di 37,5; GPT-5.6 Luna si attesta a 71,4 e 45,6. Il coding è stato un testa a testa, e Luna era otto punti avanti sul lavoro agentico — la dimensione esatta che Meta ha rivendicato riscrivendo la descrizione del prodotto della 1.2. Il punteggio composito è cambiato di tre punti a favore di Meta. Nessuno ha ancora pubblicato una ripartizione per dimensione per la 1.2, quindi se il divario agentico si sia davvero chiuso non è verificato.

Muse Spark 1.2 vs GPT-5.6 Luna-2

Sul prezzo del token misto il divario non è sottile. La tariffa mista di Artificial Analysis colloca Muse Spark 1.2 a $0.78 per milione di token e GPT-5.6 Luna a $0.17. Prezzi di listino: $1.25 in ingresso e $4.25 in uscita per Muse Spark 1.2, $0.20 in ingresso e $1.20 in uscita per Luna.

Prezzato per unità di lavoro anziché per token, un singolo passo di agente di codifica che legge 60.000 token di contesto e scrive 3.000 token di output costa circa 8,8 centesimi su Muse Spark 1.2 e circa 1,6 centesimi su GPT-5.6 Luna. Su mille passi al giorno, corrisponde a 88 dollari contro 16 — una differenza di circa 26.000 dollari all'anno per un singolo ciclo di agente.

Il caching è dove il divario si riduce o raddoppia.

Entrambi i modelli offrono tariffe aggressive per l'input in cache, e il rapporto tra di esse non è lo stesso del rapporto tra i loro prezzi di listino. Muse Spark 1.2 legge l'input in cache a $0.15 per milione, con uno sconto dell'88% rispetto alla sua tariffa di $1.25. GPT-5.6 Luna legge l'input in cache a $0.01 per milione, con uno sconto del 95% rispetto a $0.20.

Riesegui lo stesso passaggio dell'agente con il prefisso di 60.000 token servito a caldo: Muse Spark 1.2 scende da 8,8 centesimi a circa 2,2 centesimi. Luna scende da 1,6 centesimi a circa 0,4 centesimi. Il divario assoluto si restringe da 7,2 a 1,8 centesimi per passaggio, ma il multiplo rimane più o meno lo stesso — il caching non salva il modello più costoso, rende semplicemente entrambi più economici di fattori simili. Ciò che cambia è quale voce di costo domina: in cache, il costo di Muse Spark 1.2 è per il 59% token di output anziché per l'85% token di input, quindi la verbosità del modello inizia a contare più della dimensione del contesto.

Non è una preoccupazione ipotetica qui. Muse Spark 1.2 ha generato 95M token di output passando attraverso l'Intelligence Index, contro una mediana di 65M. Il riepilogo di Artificial Analysis lo definisce "un po' prolisso". Luna ha bruciato 130M, che sembra peggio finché non moltiplichi per $1.20 invece di $4.25.

Il copy del prodotto Meta afferma che il caching dei prompt può ridurre il costo effettivo del 60–80%, a seconda di quanto contesto si ripete. Si tratta di una stima del fornitore, non di una misurazione, ma il calcolo sopra rientra nell'intervallo.

Latenza: l'asse dove il benchmark inverte la verità

Leggendo solo i dati di latenza di Artificial Analysis, concluderesti che Muse Spark 1.2 è quello reattivo. Tempo al primo token: 26.12 secondi per Muse Spark 1.2, 126.99 secondi per GPT-5.6 Luna. Quasi cinque volte più veloce.

Entrambi questi valori sono misurati con l'impostazione di ragionamento più costosa di ciascun modello — xhigh per Muse Spark, max per Luna. Nessuno dei due è ciò che vedrete. Su OrcaRouter, nell'arco di una settimana di traffico reale, con qualunque livello di sforzo effettivamente richiesto dai chiamanti, GPT-5.6 Luna mostra un p50 del tempo al primo token di 1,84 secondi e un p95 di 9,68 secondi. Muse Spark 1.1 mostra un p50 identico di 1,84 secondi con un p95 più contenuto di 6,00 secondi. Non esiste ancora telemetria di produzione per la versione 1.2 perché è troppo nuova.

Muse Spark 1.2 vs GPT-5.6 Luna-3

La differenza strutturale è più utile di entrambi i numeri. Il ragionamento di GPT-5.6 Luna è opzionale — il selettore dello sforzo va da nessuno a massimo, passando per basso, medio, alto e xhigh, e puoi davvero spegnere il ragionamento per classificazione, instradamento o estrazione. Il ragionamento di Muse Spark 1.2 è obbligatorio. Il livello più basso del selettore è minimale, e non esiste alcuna impostazione che ti dia i pesi senza pagare per la deliberazione. Per qualsiasi cosa ad alto volume e sensibile alla latenza, questa è un vincolo progettuale, non un parametro di ottimizzazione.

Il throughput sostenuto è vicino: 165.0 token al secondo per Muse Spark 1.2 contro 177.9 per Luna, entrambi ben al di sopra della mediana della classe di 71.

La nota sui prezzi su cui tutti inciamperanno

Il prezzo di GPT-5.6 Luna è attualmente indicato in modo diverso in luoghi diversi, e se stai costruendo un modello di costo, dovresti saperlo prima di citare un numero. Artificial Analysis e il catalogo di OrcaRouter mostrano entrambi $0.20 per milione di input e $1.20 per milione di output — la tariffa successiva al taglio dei prezzi di GPT-5.6 di luglio, e la tariffa che Artificial Analysis ha usato per calcolare la fattura di valutazione di $174.06 sopra. Alcune inserzioni nei marketplace mostrano attualmente $0.10 e $0.60 con un livello superiore separato che scatta oltre 272,000 token di prompt. La mossa sicura è controllare il prezzo sull'endpoint che stai effettivamente chiamando piuttosto che su quello nell'articolo di confronto.

Il dettaglio della suddivisione in livelli è reale indipendentemente dalla tariffa base applicata, ed è davvero poco trattato: Il prezzo di Luna sale quando una singola richiesta supera circa 272.000 token di prompt. L'input raddoppia all'incirca, l'output aumenta della metà e le letture in cache si adattano di conseguenza. Se il tuo motivo per considerare Luna è la sua finestra di contesto da 1,05M token, nota che lasci la tariffa pubblicizzata a circa un quarto del percorso. Muse Spark 1.2 ha una tariffa fissa su tutti i suoi 1.048.576 token, senza sovrapprezzo per contesto lungo — per richieste singole davvero lunghe, il divario effettivo tra i due si riduce considerevolmente.

Cosa Luna non può fare a nessun prezzo

La differenza di modalità è il motivo più chiaro per scegliere l'uno piuttosto che l'altro, e non appare in nessuna classifica.

Input — Muse Spark 1.2 accetta testo, immagini, video, audio e documenti PDF secondo l'elenco di Meta. GPT-5.6 Luna accetta testo, immagini e file. Niente audio, niente video. Se la tua pipeline gestisce registrazioni o filmati, Luna non è affatto una candidata.

Output massimo — Luna dichiara un limite massimo di completamento di 128.000 token. L'endpoint di Muse Spark 1.2 non dichiara alcuna lunghezza massima di completamento, il che è abbastanza insolito da doverlo testare piuttosto che pianificare in base ad esso.

Data di aggiornamento delle conoscenze — Quella di Luna risulta pubblicata come 16 febbraio 2026. Meta non pubblica alcuna data di aggiornamento per Muse Spark 1.2, quindi metti in conto il recupero in entrambi i casi.

Disponibilità — Luna è generalmente disponibile in tutto il mondo attraverso più percorsi. Muse Spark 1.2 è servito esattamente da un unico provider: Meta. Un endpoint, una policy regionale, una sola cosa che può andare giù.

Moderazione — entrambi sono endpoint moderati.

Un'onesta avvertenza sul vantaggio multimodale: la scheda tecnica di Artificial Analysis per Muse Spark 1.2 elenca l'input di testo e immagini come ciò che ha valutato, non l'intera superficie a cinque modalità che Meta pubblicizza. L'API accetta più di quanto qualsiasi soggetto indipendente abbia testato.

Muse Spark 1.2 vs GPT-5.6 Luna-4

Adozione, poiché risulta essere misurabile

I benchmark dicono cosa può fare un modello; il traffico dice che cosa le persone gli affidano. In una settimana mobile su OrcaRouter, GPT-5.6 Luna ha mosso 4.679,4 milioni di token. Muse Spark 1.1 — stesso contesto da 1M, punteggio indice comparabile, quattro settimane più vecchio nel catalogo — ha mosso 4,4 milioni. È un fattore di circa mille.

Parte di ciò è distribuzione: Luna è un default in più strumenti ed è in GA mondiale da più tempo, mentre la famiglia Muse Spark è stata lanciata solo negli Stati Uniti. Ma un divario di mille a uno su un router dove entrambi sono a una stringa di modello di distanza non è puramente una questione di distribuzione. È la ragione pratica per cui Luna è il default più sicuro e Muse Spark 1.2 è ciò che si valuta con attenzione.

Vale la pena notare cosa puoi e non puoi noleggiare oggi: GPT-5.6 Luna è nel catalogo OrcaRouter a $0.20 e $1.20, gli stessi numeri della lista prezzi del fornitore, perché applichiamo un ricarico dello 0% e trasmettiamo il prezzo di listino del fornitore così com'è. Muse Spark 1.1 è presente a $1.25 e $4.25 sulla stessa base. Muse Spark 1.2 non è ancora nel catalogo — è servito direttamente da Meta. Quindi il modo più economico per fare questo confronto in modo onesto oggi è Luna contro Muse Spark 1.1 su un'unica chiave, cambiando una stringa tra le esecuzioni, e poi testare di nuovo contro la 1.2 quando sarà disponibile.

Scegline uno.

Prendi GPT-5.6 Luna se il carico di lavoro è ad alto volume e di tipo testuale: chat, classificazione, estrazione, instradamento, uso leggero di strumenti. Costa un quarto del prezzo medio ponderato, permette di disattivare completamente il ragionamento, il suo p50 di 1,84 secondi è un numero di produzione realmente misurato e non un artefatto di benchmark, ed è il modello con mille volte il traffico live alle spalle. Tre punti indice non sopravvivono a questa aritmetica.

Scegli Muse Spark 1.2 se il carico di lavoro è coding agentico a lungo orizzonte — refactoring multi-file, debug estesi, lavoro su interi repository — o se coinvolge input audio o video, dove Luna semplicemente non può competere. È anche la scelta migliore per richieste singole davvero enormi, poiché la sua tariffa è piatta sull'intero milione di token mentre quella di Luna aumenta oltre 272K.

Prendi entrambi se sei onesto su come vengono effettivamente costruiti i sistemi di agenti. Lo schema che continua a vincere è un modello economico che gestisce la maggior parte delle chiamate di routine e uno costoso riservato ai passaggi in cui la qualità si ripaga da sé. Entrambi i modelli stanno dietro un unico endpoint compatibile con OpenAI, quindi quella suddivisione è una regola di routing piuttosto che un secondo rapporto con un fornitore — e se il ramo costoso si guasta a metà esecuzione, il failover automatico fa sì che la tua valutazione non si avveleni silenziosamente con metà dataset.

La cosa da osservare nel prossimo mese è la ripartizione per dimensione. L'intera proposta di Muse Spark 1.2 ruota attorno alla capacità agentica, e nella generazione precedente quella era la dimensione in cui Luna era in vantaggio di otto punti. Finché qualcuno non pubblica un indice agentico per la 1.2, il guadagno composito di tre punti è l'unica prova che Meta abbia colmato il divario.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube