
MiniMax M3 vs Muse Spark 1.2: un divario di prezzo di 4 volte a fronte di una sweep nei benchmark
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiniMax M3 costa 0,30 $ per milione di token in input nel nostro catalogo. Muse Spark 1.2 costa 1,25 $. Si tratta di un divario di 4,2x sull'input e di 3,5x sull'output, ed è il singolo fatto più utile su questo abbinamento, perché sulle stesse pagine di catalogo Muse Spark 1.2 supera MiniMax M3 su ogni riga di benchmark che i due modelli condividono. Uno è l'opzione economica a pesi aperti con 512K di contesto utilizzabile garantito dal fornitore e un tetto di output di 512K. L'altro è un checkpoint di ragionamento Meta che ormai è una generazione indietro rispetto alla propria famiglia e continua comunque a superarlo quasi ovunque. Il resto di questa pagina riguarda quale di questi due fatti decida davvero un carico di lavoro — e la risposta non è la stessa per ogni carico di lavoro.
Che cosa è in realtà ognuno di questi modelli
Entrambi sono stati lanciati quest'anno e nessuno dei due è nuovo. La cosa conta, perché una pagina di confronto scritta come se l'uno o l'altro stesse per uscire si rivela datata nel giro di un mese.

MiniMax M3 è una release di MiniMax stessa, annunciata sul blog del fornitore il 2026-06-01 con il titolo «MiniMax M3: coding di frontiera, contesto da 1M, multimodalità nativa — tutto in un unico modello». Il post esordisce in modo diretto: «MiniMax M3 viene rilasciato ufficialmente oggi». Le tre affermazioni di MiniMax al riguardo sono che raggiunge prestazioni di livello frontiera su coding e lavoro agentico, che utilizza MSA (MiniMax Sparse Attention), una nuova architettura di attenzione proposta dall'azienda, e che è nativamente multimodale — accetta input di immagini e video e, nelle parole di MiniMax, «può gestire un computer desktop». MiniMax aggiunge che queste tre capacità sono il requisito minimo indispensabile per i modelli di frontiera closed-source, e che M3 è «il primo e unico modello a pesi aperti a riunire tutte e tre». Il nostro catalogo elenca il modello come disponibile dal 2026-05-31, un giorno prima della data del blog.
Muse Spark 1.2 è di Meta. Il nostro catalogo lo data al 2026-08-05. Non è un nuovo livello: è un checkpoint aggiornato rispetto a Muse Spark 1.1, con prestazioni leggermente superiori, erogato sullo stesso livello Standard a un prezzo identico, il che lo rende un aggiornamento immediato anziché un prodotto separato. La sua caratteristica distintiva è la superficie di input: testo, immagini, video, audio e PDF. L'output è testo.
Un elemento di contesto va collocato qui, anziché seppellito più avanti. Meta ha portato la famiglia Muse Spark a un checkpoint 1.3 il 2 settembre 2026, il che rende 1.2 la generazione precedente della sua stessa linea. È successo tre settimane fa, quindi non è una notizia e questa pagina non lo tratta come tale — ma chi oggi deve scegliere tra questi due dovrebbe sapere che sta confrontando un modello MiniMax attuale con uno Meta superato.
Prezzo per milione di token e quanto costa effettivamente un carico di lavoro

Le tariffe pubblicate, tratte dalla pagina di ciascun modello sul nostro catalogo, che riporta il prezzo di listino del fornitore senza alcun ricarico aggiunto:
Input — MiniMax M3 0,30 $ per 1 milione di token vs Muse Spark 1.2 1,25 $ per 1 milione di token
• Output — MiniMax M3 $1.20 per 1M vs Muse Spark 1.2 $4.25 per 1M
• Lettura cache — MiniMax M3 $0,060 per 1M vs Muse Spark 1.2 $0,150 per 1M
• Rapporto — Muse Spark 1.2 è 4,2x in input, 3,5x in output, 2,5x sulle letture dalla cache
Quei rapporti astratti diventano concreti nel calcolatore dei costi presente su ogni pagina. Imposta entrambi a 10 milioni di token al mese con una quota di input del 70% — una forma ragionevole per un’attività di riepilogo o estrazione, nonché l’impostazione predefinita fornita dallo stimatore — e MiniMax M3 risulta costare 5,70 $ al mese. Muse Spark 1.2 risulta costare 11,30 $ al mese. Attiva la cache dei prompt e lo stesso carico di lavoro scende a circa 4,86 $ contro circa 9,63 $. Il calcolatore etichetta entrambi come stime basate sul prezzo di listino, che è l’avvertenza giusta: i conteggi reali dei token dipendono dal tokenizer del fornitore.
Per un carico di lavoro economico, la differenza è il prezzo di un caffè. Il punto è la forma della curva, non il valore assoluto: un carico di cento milioni di token al mese a forte componente di output passa da tre cifre a quattro solo dal lato Muse Spark. Se il costo è il vincolo che ti ha portato a considerare questo abbinamento, quello è il numero su cui modellare il tuo traffico.
Poiché trasferiamo direttamente il prezzo di listino del fornitore senza alcun ricarico, una riduzione di prezzo da parte del fornitore si riflette dalla nostra parte lo stesso giorno in cui viene annunciata, ed entrambi questi modelli sono instradati qui — una sola chiave li copre entrambi, quindi confrontarne i prezzi non richiede un secondo contratto né una modifica al codice.
Finestra di contesto, e cosa ci sta effettivamente dentro
Questa è la sezione in cui i due risultano più simili su una scheda tecnica e meno simili nell'uso.
• Finestra di contesto — MiniMax M3 1.048.576 token vs Muse Spark 1.2 1.048.576 token
• Output massimo — MiniMax M3 512.000 token vs Muse Spark 1.2 131.072 token
• Superficie di input — MiniMax M3 testo, immagine e video vs Muse Spark 1.2 testo, immagine, video, audio e PDF
• Superficie di output — entrambi emettono solo testo
• Parametri strutturati — MiniMax M3 espone tools e tool_choice; Muse Spark 1.2 espone reasoning_effort e structured_outputs
Entrambe le finestre hanno lo stesso milione di token, quindi la domanda "chi ha più contesto" non ha un vincitore. La riga dell'output massimo è dove si separano: una risposta di MiniMax M3 può arrivare a 512.000 token, circa quattro volte il limite di 131.072 di Muse Spark 1.2. Se il tuo lavoro è la generazione di testi lunghi — una riscrittura completa di un file, un lungo report, un output su scala di trascrizione — quella differenza è strutturale, non incrementale. Se il tuo lavoro consiste in risposte brevi su un input lungo, è irrilevante.
Sul fronte della superficie di input, invece, il discorso si ribalta. Muse Spark 1.2 accetta direttamente audio e PDF; la superficie di input documentata di MiniMax M3 si ferma a immagini e video. Una pipeline che acquisisce registrazioni di chiamate o documenti scansionati deve svolgere una diversa quantità di preelaborazione su ciascuna di queste due.
Sul fronte MiniMax, l'affermazione sul contesto include una nota architetturale che merita di essere etichettata chiaramente come del fornitore stesso. MiniMax attribuisce il comportamento a contesto lungo di M3 a MSA (MiniMax Sparse Attention), che il nostro catalogo descrive come in grado di supportare fino a 1M di token di contesto «con un minimo garantito di 512K». La formulazione del minimo garantito è di MiniMax; non esiste una misurazione indipendente a cui possiamo fare riferimento, quindi considerate la soglia di 512K come un'affermazione del fornitore anziché un dato verificato.
Latenza e throughput sul nostro gateway
Questi sono i dati di cui possiamo parlare più direttamente, perché sono i nostri numeri. Coprono i sette giorni fino al 2026-09-23 e descrivono il traffico sul nostro gateway, non un benchmark di un fornitore.
• tempo p50 al primo token — MiniMax M3 4,28 s vs Muse Spark 1.2 4,82 s
• p95 tempo al primo token — MiniMax M3 10,00 s vs Muse Spark 1.2 10,00 s
• Velocità di output — MiniMax M3 289 tok/s vs Muse Spark 1.2 507 tok/s
• Tasso di errore — MiniMax M3 0,12% vs Muse Spark 1.2 0,15%
• Traffico, ultimi 7 giorni — MiniMax M3 153,8M token vs Muse Spark 1.2 79,6M token
Leggendo questo onestamente, il quadro è contrastante. Sul tempo al primo token i due sono vicini — 4,28 contro 4,82 secondi alla mediana — e il p95 è identico al centesimo a 10,00 secondi, il che è un artefatto di arrotondamento dovuto al fatto che entrambi si trovano vicino allo stesso limite, più che un vero pareggio. Sulla velocità di output non sono affatto vicini: Muse Spark 1.2 esegue lo streaming a una velocità di circa 1,75 volte quella di MiniMax M3, il che cambia la percezione di una generazione lunga per un utente che la guarda, anche quando il costo totale è più alto. I tassi di errore rientrano l'uno nell'errore di arrotondamento dell'altro ed entrambi sono bassi.
La riga del traffico vale la pena leggerla come un segnale più che come un tabellone: negli stessi sette giorni, MiniMax M3 ha mosso circa il doppio dei token rispetto a Muse Spark 1.2 sul nostro gateway. È ciò che il mercato sta scegliendo, non ciò che dicono i benchmark, e su questo accostamento i due sono in disaccordo.
Instradare entrambi dietro un unico endpoint è anche il modo economico per scoprire quale dei due preferisce il tuo carico di lavoro, perché il failover fa sì che un degrado lato provider su uno dei due modelli ricada su un percorso funzionante invece di un errore.
Chiamata di strumenti e lavoro agentico a lungo orizzonte
È qui che i due risultano più distanti nei risultati misurati, ed è qui che le avvertenze contano di più.
• Terminal-Bench v2.1 — MiniMax M3 52.4 vs Muse Spark 1.2 80.1
• tau_banking (uso di strumenti) — MiniMax M3 12.3 vs Muse Spark 1.2 34.8
• MCP Atlas — MiniMax M3 74.2 (riportato dal fornitore) vs Muse Spark 1.2 non misurato
• BrowseComp — MiniMax M3 83,5 (dichiarato dal fornitore) vs Muse Spark 1,2 non misurato
• OSWorld-Verified — MiniMax M3 70.0 (riportato dal fornitore) vs Muse Spark 1.2 non misurato
Le prime due righe provengono dal pannello di benchmark sulle nostre pagine di catalogo e sono le uniche righe agentiche che entrambi i modelli hanno compilato. Non sono vicine: Muse Spark 1.2 più che raddoppia MiniMax M3 su tau_banking e guida Terminal-Bench v2.1 di quasi 28 punti. Se il tuo carico di lavoro è un agente a lungo orizzonte con una superficie di strumenti, questo è il divario singolo più ampio in questa pagina.
Le prossime tre righe sono i numeri di MiniMax stessa, pubblicati nel post di lancio. Non sono confrontabili con le prime due — framework di test diversi, nessun audit indipendente — ma sono gli unici dati pubblicati per MiniMax M3 su quei task, quindi ometterli sottostimerebbe il modello. Leggili come dati riportati dal fornitore e nulla più.
Una divergenza merita un paragrafo a sé, perché è il genere di cosa che una pagina di confronto di solito sorvola. Il post di lancio di MiniMax riporta Terminal-Bench 2.1 a 66.0 per M3, all'interno di un'immagine di un grafico senza alcuna tabella numerica di accompagnamento. La riga indipendente Terminal-Bench v2.1 sulla nostra pagina di catalogo mostra 52.4 per lo stesso modello. I nomi dei task sono abbastanza simili che i lettori li incontreranno fianco a fianco, e le due cifre differiscono di più di 13 punti. Non dichiareremo che uno dei due è sbagliato: la spiegazione probabile è un harness diverso o una configurazione di esecuzione diversa, e l'affermazione onesta è che il numero del fornitore stesso e il numero verificato non concordano, con quello del fornitore più alto.
Gli elenchi dei parametri raccontano una storia più piccola e più pratica. MiniMax M3 espone tools e tool_choice, quindi la selezione degli strumenti è controllabile dalla richiesta. Muse Spark 1.2 espone reasoning_effort, quindi è invece la profondità del ragionamento a essere controllabile. Nessuno dei due espone la manopola dell'altro. Se il problema di controllo della tua applicazione è "far sì che chiami la funzione giusta", questo punta in una direzione; se è "far sì che pensi più a lungo nei casi difficili", punta nell'altra.
Programmazione
La programmazione è il cavallo di battaglia di MiniMax M3 e il campo in cui il divario misurato è più imbarazzante per il modello.
• AA Coding Index — MiniMax M3 38.7 vs Muse Spark 1.2 72.2
• SciCode — MiniMax M3 43,1 vs Muse Spark 1,2 57,4
• SWE-Bench Pro — MiniMax M3 59,0 (riportato dal fornitore) vs Muse Spark 1.2 non misurato
• KernelBench Hard — MiniMax M3 28,8 (dichiarato dal fornitore) vs Muse Spark 1.2 non misurato
Il posizionamento di MiniMax per M3 è coding-first: il titolo di lancio mette "Frontier Coding" davanti al contesto da un milione di token e alla multimodalità. Il valore di 59.0 che dichiara per SWE-Bench Pro è un numero solido sull'harness del fornitore. Nelle righe indipendenti del Coding Index e di SciCode che entrambi i modelli hanno compilato, però, Muse Spark 1.2 è in testa con un ampio margine, e il divario di 33 punti sul Coding Index è il secondo più ampio di questa pagina dopo tau_banking.
Non esiste un modo onesto di presentare MiniMax M3 come il modello di coding migliore sulla base delle prove disponibili. Ciò che si può dire è che i numeri di coding del fornitore stesso sono alti e quelli indipendenti non lo sono, secondo lo stesso schema della divergenza di Terminal-Bench di cui sopra. Chiunque basi la propria decisione sul coding dovrebbe dare più peso alle righe verificate che ai grafici del post di lancio, e dovrebbe testare sul proprio repository piuttosto che sull'uno o sull'altro.
Dove sono genuinamente vicini
Tre righe si rifiutano di decretare un vincitore, e dirlo è più utile che inventarne uno.
• GPQA Diamond — MiniMax M3 89,9 vs Muse Spark 1.2 90,4, un divario di 0,5 punti che è un pareggio per qualsiasi scopo pratico
• p95 tempo al primo token — entrambi 10,00 s negli ultimi sette giorni sul nostro gateway
• Finestra di contesto e modalità di output — identiche a 1.048.576 token di input e output solo testuale
Nel ragionamento scientifico di livello universitario avanzato i due sono di fatto indistinguibili, e quella è l'unica riga di ragionamento in cui il modello molto più economico di MiniMax M3 tiene testa a quello più costoso. Vale la pena ricordarlo quando si leggono gli indici aggregati: il divario tra questi modelli non è uniforme tra le varie capacità, è concentrato nel lavoro agentico e nella programmazione, ed è quasi nullo nelle domande a scelta multipla a forte componente di conoscenza.

Scegli MiniMax M3 se, scegli Muse Spark 1.2 se
I due fatti del paragrafo iniziale si risolvono in modo diverso a seconda di ciò che stai costruendo, quindi ecco la distinzione senza mezzi termini.
• Scegli MiniMax M3 se il costo per token è il vincolo vincolante, se hai bisogno di output di formato lungo oltre i 131.072 token, se hai bisogno di pesi aperti, se vuoi input video senza una pipeline separata, o se vuoi un lavoro di conoscenza ad alto contenuto di ragionamento a circa un quarto del prezzo di input — GPQA Diamond è in perfetta parità e quella è la riga in cui il modello economico si guadagna il suo posto.
• Scegli Muse Spark 1.2 se il tuo carico di lavoro è un agente a lungo orizzonte con strumenti, se hai bisogno dei punteggi di coding verificati più alti, se vuoi un controllo esplicito reasoning_effort, se devi acquisire direttamente audio o PDF, o se hai bisogno di un output in streaming veloce — 507 tok/s contro 289 tok/s è una differenza visibile, non da benchmark.
• Se non sai ancora quale, la prova decisiva non è su questa pagina. Metti entrambi i modelli alla prova su un campione del tuo traffico e misuralo; il calcolatore di prezzo su ogni pagina del modello ti dirà il lato costi in un minuto, e i dati di latenza a sette giorni qui sopra sono la cosa più vicina a un'anteprima del lato prestazioni.
Entrambi sono su un'unica API senza ricarico sul prezzo di listino del fornitore, quindi la prova consiste in un cambio di ID del modello anziché in una migrazione, e il failover automatico significa che una giornata storta su uno dei due fornitori si traduce in una risposta più lenta anziché in un'interruzione.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
