
GPT-6 Sol vs Muse Spark 1.2: Uno di loro ha le orecchie
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Metti GPT-6 Sol e Muse Spark 1.2 fianco a fianco e le colonne dei prezzi sono semplicemente diverse, mentre le colonne delle modalità non sono affatto simili. Muse Spark 1.2 accetta testo, immagine, video, file e audio. GPT-6 Sol accetta testo, immagine e file. Audio e video sono la differenza, e non sono un dettaglio trascurabile: separano un modello a cui si può consegnare la registrazione di una riunione da uno a cui si deve consegnare la trascrizione. GPT-6 Sol, il livello intermedio di quella generazione, è stato rilasciato il 22 settembre 2026; Muse Spark 1.2, l'attuale checkpoint di Meta nella famiglia Muse Spark, è stato rilasciato il 5 agosto 2026 come aggiornamento drop-in di Muse Spark 1.1 sullo stesso livello Standard allo stesso prezzo.
Quest’ultimo punto è importante per come dovrebbe essere letta questa pagina. Muse Spark 1.2 non è una nuova generazione e non dovrebbe essere presentato come tale: la stessa descrizione di Meta parla di un checkpoint aggiornato con prestazioni leggermente superiori, servito a tariffe invariate. Quindi la domanda interessante non è cosa aggiunge 1.2 rispetto a 1.1. È ciò che la famiglia Muse Spark ha e che la famiglia GPT-6 non ha, e se ti serve davvero.
Le due schede tecniche, sulle dimensioni che differiscono
• Modalità di input — GPT-6 Sol testo, immagine e file vs Muse Spark 1.2 testo, immagine, video, file e audio
• Output — entrambi solo testo
Prezzo di input — GPT-6 Sol 2,00 $ per milione vs Muse Spark 1.2 1,25 $ per milione
• Prezzo di output — GPT-6 Sol 10,00 $ per milione vs Muse Spark 1.2 4,25 $ per milione
• Input in cache — GPT-6 Sol 0,20 $ per milione contro Muse Spark 1.2 0,15 $ per milione
• Finestra di contesto — 1.050.000 token contro 1.048.576 token, praticamente identiche
• Scaglione per richieste lunghe — GPT-6 Sol rimodula il prezzo dell'intera richiesta oltre 272.000 token di input a $4,00 / $15,00, mentre Muse Spark 1.2 non ha alcuno scaglione sulla sua scheda
• GPQA Diamond — GPT-6 Sol 96,1 contro Muse Spark 1.2 90,4
• Humanity's Last Exam — GPT-6 Sol 47,9 vs Muse Spark 1.2 45,5
• Richiamo su contesto lungo — GPT-6 Sol 83,7 vs Muse Spark 1.2 79,0
• tau-banking — GPT-6 Sol non pubblicato in questa revisione vs Muse Spark 1.2 34.8
• Pesi — entrambi chiusi, solo API
La voce delle richieste lunghe sta facendo un lavoro silenzioso in quell'elenco. Muse Spark 1.2 non ha alcuna clausola di riprezzamento per il contesto lungo sulla sua scheda pubblicata, quindi i suoi $1,25 / $4,25 valgono per l'intera finestra. Il prezzo di copertina di GPT-6 Sol no: oltre 272.000 token di input, l'intera richiesta passa a $4,00 / $15,00. Su un prompt a contesto pieno, quindi, il confronto sull'output non è dieci dollari contro $4,25, ma quindici contro $4,25 — tre volte e mezzo, non due e un terzo.
E il divario nei benchmark è più stretto di quanto suggerisca il divario di prezzo. GPQA Diamond, 96,1 contro 90,4, è all'incirca la differenza che ci si aspetterebbe da due diverse impostazioni di sforzo di ragionamento anziché da una differenza di capacità, e su Humanity's Last Exam i due sono 47,9 e 45,5, cioè 2,4 punti su una scala di cento punti. Muse Spark 1.2 è il modello più economico e il lettore più ampiamente capace; GPT-6 Sol è in vantaggio nelle cifre di ragionamento, ma non del margine che il prezzo implica. Nessuna delle due colonne domina, ed è proprio questo che rende la scelta degna di essere fatta deliberatamente.

Cosa cambia effettivamente l'input audio e video
Un modello che accetta l'audio può ricevere una registrazione invece di una trascrizione. Sembra una comodità e in realtà è un cambiamento in ciò che è possibile: la trascrizione è un passaggio con perdita che scarta il tono, la sovrapposizione, le risate e la differenza tra una domanda e un'affermazione quando si legge solo il testo. Un modello che ascolta direttamente il file vede tutto ciò. Lo stesso ragionamento vale per il video, dove la descrizione fotogramma per fotogramma perde la tempistica, mentre un modello che ingerisce la clip no.
La risposta di GPT-6 Sol è una pipeline più che una modalità: prima trascrivi o sottotitoli, poi passi il testo. È un'architettura perfettamente funzionante e per molti carichi di lavoro è quella migliore, perché una trascrizione è ispezionabile, memorizzabile nella cache e poco costosa da archiviare. È peggiore esattamente quando l'audio o il movimento sono il segnale: revisione della qualità nei call center, registrazione di contenuti multimediali, qualsiasi cosa in cui l'esitazione di chi parla porti il significato.
La posizione di Meta su questo punto merita di essere letta con attenzione, perché il tag audio non è un elemento decorativo. Muse Spark 1.2 è elencato con l'audio tra le sue capacità, insieme a visione, strumenti, JSON e ragionamento, e Meta ha distribuito la famiglia come la sua linea multimodale, mentre il più piccolo Muse Glimmer è stato distillato da un teacher Muse Spark. Se stai scegliendo tra questi due in base alla superficie di input, la scelta non è tra una scheda tecnica leggermente più ampia e una leggermente più ristretta. È tra l'avere la modalità e il costruire una pipeline per approssimarla.
Dove i due si separano davvero
La separazione più netta è l'uso agentico di strumenti contro un servizio simulato, ed è l'unico punto in cui i numeri sono abbastanza distanti da potervi agire. Muse Spark 1.2 registra 34,8 su tau-banking e appena 7,1 sulla più recente revisione Terminal-Bench 4.0 — entrambe misurazioni di terze parti, ed entrambe descrivono la stessa debolezza da due direzioni. Un modello che interpreta bene una riunione e poi sbaglia il conteggio del saldo di un cliente quando gli viene chiesto di chiamare un'API non è un modello scadente; è un modello con un compito chiaramente delimitato.
Esegui lo stesso controllo su GPT-6 Sol e il quadro è coerente ma più scarno. Il suo richiamo su contesto lungo si attesta a 83.7, SciCode a 57.6 e il suo Terminal-Bench 4.0 a 43.9, tutti di terze parti. I suoi dati su coding e terminal-agent nella revisione v2.1 sono semplicemente assenti, e l'assenza di un numero non è un numero basso — chiunque riempia quella cella con una stima sta inventando.
Un'asimmetria che vale la pena nominare prima che i numeri vengano confrontati con troppa fretta. Muse Spark 1.2 porta con sé una suite completa di benchmark del fornitore, proveniente da Meta, accanto al set di terze parti, e l'analisi di lancio di Artificial Analysis stessa lo colloca a 54 sull'Intelligence Index con l'impostazione di ragionamento xhigh, tre punti sopra Muse Spark 1.1. GPT-6 Sol si attesta a 47,6 sullo stesso indice nel nostro catalogo. Queste due cifre non sono sottraibili: provengono da configurazioni diverse misurate in momenti diversi, e un indice revisionato tra l'una e l'altra non è lo stesso strumento. Le affermazioni comparative oneste sono quelle relative al singolo benchmark riportate sopra, dove entrambi i modelli riportano una cifra proveniente dallo stesso valutatore. Quando un modello ha più numeri pubblicati, sembrerà sempre meglio documentato di uno che ne ha meno, e su questa coppia gran parte di quella differenza riguarda chi riporta i dati, non ciò che i modelli sono in grado di fare.

Servire due modelli che si comportano in modo diverso sotto carico
Entrambi sono su OrcaRouter, con una sola chiave, e la coppia è una naturale suddivisione instradata anziché un aut aut. Invia il traffico multimodale — le registrazioni, le clip, i pacchetti di documenti con allegati scansionati — a Muse Spark 1.2 a $1,25 / $4,25 senza il crollo sul contesto lungo. Invia il traffico ad alto contenuto di ragionamento e agentico a GPT-6 Sol e accetta la tariffa più alta per le richieste in cui la risposta deve resistere a un esame accurato. Attraverso un unico endpoint, quella suddivisione è una regola di instradamento, non due integrazioni.
Un numero sul fronte dell'erogazione va contro la logica del prezzo. Muse Spark 1.2 è misurato a circa 420 token di output al secondo nella nostra finestra mobile di sette giorni, contro i circa 244 di GPT-6 Sol — il modello di Meta è sia più economico sia più veloce sulle nostre rotte. La latenza va nella direzione opposta sul primo token: un tempo p50 al primo token di circa 5,2 secondi per Muse Spark 1.2 contro circa 6,8 per GPT-6 Sol nella stessa finestra, quindi il modello più economico inizia anche a rispondere prima. Entrambe sono misurazioni mobili su infrastruttura condivisa, non un benchmark controllato, ed entrambe variano tra una lettura e l'altra.
Il failover automatico si guadagna il suo posto su una pipeline mista come questa. Quando una richiesta può arrivare come audio e uscire come testo attraverso una route, oppure come uno step di trascrizione obbligatorio attraverso un'altra, la modalità di errore che ti interessa è un provider che accetta la richiesta e poi si blocca sull'upload del media — una seconda route configurata trasforma questo scenario in un nuovo tentativo, anziché in un job che qualcuno deve notare e rieseguire. Il nostro catalogo riporta invariati i prezzi di listino dei provider, quindi se Meta sposta la voce da $4,25, o aggiunge una clausola long-context alla scheda Muse Spark come hanno già fatto altri fornitori, la modifica ti raggiunge lo stesso giorno in cui avviene, anziché dopo che un rivenditore se ne accorge.

La decisione, in parole povere
Se il tuo input è una registrazione o una clip e il timing o il tono fanno parte del significato, usa Muse Spark 1.2. Non esiste alcuna configurazione di GPT-6 Sol che raggiunga quella capacità tramite l'API, e nessun prezzo al quale la pipeline sostitutiva diventi equivalente. Se il tuo input è costituito da testo e immagini e si agirà in base all'output, i valori di ragionamento di GPT-6 Sol sono superiori e il suo profilo di utilizzo degli strumenti è quello più sicuro — i punteggi tau-banking e Terminal-Bench 4.0 di Muse Spark 1.2 sono il segnale più forte su entrambi i fogli, e indicano una direzione contraria al lavoro agentico.
E nota ciò che Muse Spark 1.2 non è: una nuova generazione. È l'attuale checkpoint di Meta per una famiglia esistente, un sostituto diretto per 1.1 a prezzi invariati, il che rende l'aggiornamento una decisione senza costi e il confronto con GPT-6 Sol una questione a parte. Dall'altro lato, GPT-6 Sol è già stato soppiantato da GPT-6.1 Sol a tariffe identiche per il contesto breve, con l'input in cache dimezzato da $0,20 a $0,10, e la stessa pagina del modello di OpenAI ora indirizza i lettori verso quest'ultimo. Se il motivo per cui stai valutando Sol invece di Muse Spark è l'integrazione di otto giorni, questo resta valido. Se invece è una questione di capacità, controlla prima il successore.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
