
GPT-6.1 Sol vs MiniMax M3: il listino più economico perde sulla bolletta
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
MiniMax M3 chiede una frazione di ciò che GPT-6.1 Sol chiede — $0,30 per milione di token di input contro $2,00, $1,20 per milione di output contro $10,00 — e secondo il metro che conta davvero, è più economico: $0,508 per attività contro $0,724 sulla valutazione v4.3.2 di Artificial Analysis. Questa è una vittoria autentica, ed è anche tutto l'argomento, perché la stessa misurazione che assegna a M3 il conto più basso assegna a GPT-6.1 Sol un vantaggio di 22,6 punti nell'indice, e l'insieme di benchmark che misura se un modello riesce a completare lavoro agentico invece di descriverlo trasforma il divario in un muro. Il fornitore ha rilasciato GPT-6.1 Sol il 29 settembre 2026. L'azienda ha rilasciato M3, il suo modello open-weight da 428 miliardi di parametri, il 31 maggio 2026.
Entrambi sono attivi, entrambi hanno un prezzo e per entrambi basta una chiamata API. Quello che segue è il calcolo che decide tra i due, e i due punti in cui il calcolo non è tutta la storia.
Cosa è realmente ciascun modello
GPT-6.1 Sol è l'attuale modello di punta di OpenAI per il ragionamento e l'ingegneria del software — un modello chiuso, rilasciato una settimana dopo il GPT-6 Sol che sostituisce, e venduto allo stesso prezzo di listino di $2.00 / $2.00 del suo predecessore. Ha un prezzo di $0.00 per l'input in cache, la metà di quanto GPT-6 Sol addebitava per le richieste in cache, ed è il modello che OpenAI indica quando parla di agentico anziché di chat.
MiniMax M3 è un modello mixture-of-experts con 428 miliardi di parametri totali e 23 miliardi attivi per token, pubblicato sotto la MiniMax Community License — un rilascio open-weights con una licenza personalizzata di stampo non commerciale, non approvata dall'OSI. È servito da un'ampia gamma di fornitori di inferenza: Artificial Analysis registra quindici host per M3 contro otto per GPT-6.1 Sol. Questa ampiezza è il vantaggio pratico degli open weights, ed è anche il motivo per cui la concorrenza sui prezzi per M3 è stata più rapida che per il modello chiuso.
Il listino prezzi, e il contatore che lo sovrascrive

Metti a confronto le due tariffe pubblicate e non c'è partita.
• Input — GPT-6.1 Sol $2,00 per 1M vs MiniMax M3 $0,30 per 1M; M3 costa l'85% in meno
• Output — $10,00 per 1M vs $1,20 per 1M; M3 costa l'88% in meno
• Input in cache — $0,10 per 1M vs $0,06 per 1M
• Costo per attività AA — $0,724 vs $0,508; M3 costa il 30% in meno, non l'85%
• Token di output per attività — 38.128 vs 48.192; M3 scrive il 26% in più
• Tempo per attività — 640 s vs 486 s
• Finestra di contesto — 1.050.000 vs 1.048.576 token; praticamente equivalenti
• Output massimo — 128.000 token vs 512.000; M3 scriverà una risposta molto lunga
• Input accettati — testo, immagine e file vs testo, immagine e video
• Posizione in classifica — GPT-6.1 Sol 10° su 147 modelli vs MiniMax M3 62°
Le due righe convenienti in alto sono quelle che vede un foglio di approvvigionamento. La terza riga è quella che salda il conto, e dice che un vantaggio dell'85–88% sul rate card diventa un vantaggio concreto del 30%, perché M3 emette più token per attività e perché un'attività non è una quantità fissa di lavoro. I rate card prezzano i token; il lavoro si prezza in attività. Qualsiasi confronto che si fermi alle prime due righe sta confrontando i numeri sbagliati, nell'unità sbagliata.
Dove il trenta per cento smette di contare
Il costo del compito è abbastanza vicino che è il divario nell’indice a decidere per tutto ciò che va oltre il testo in blocco. Artificial Analysis colloca GPT-6.1 Sol a 51,83 e MiniMax M3 a 29,22 — un divario di 22,6 punti, e un divario che non è distribuito in modo uniforme in tutta la suite. Nelle valutazioni che chiedono a un modello di usare un terminale, modificare un repository e verificare il proprio lavoro, i due modelli non sono nella stessa categoria:
• Terminal-Bench 4.0 — GPT-6.1 Sol 0.5606 vs MiniMax M3 0.0202
• Terminal-Bench Science — 0.5810 vs 0.0048
• AA-Omniscience — 41.53 vs 1.35
• MMLU-Pro — 0.8595 vs 0.7856
• AutomationBench — 0.6487 vs 0.2125
• τ²-bench — non pubblicato per GPT-6.1 Sol in questa esecuzione vs 0.8889 per M3
• GPQA Diamond — non pubblicato per GPT-6.1 Sol in questa esecuzione vs 0.9293 per M3
• CritPT — 0.3171 vs 0.0371
Leggilo con attenzione, perché non è una vittoria netta e le eccezioni sono la parte interessante. MiniMax M3 ottiene 0,8889 su τ²-bench, la valutazione del dialogo per l'uso di strumenti e il servizio clienti, e 0,9293 su GPQA Diamond — un punteggio scientifico di livello post-laurea che batte ogni dato OpenAI pubblicato in questa specifica esecuzione. M3 è un ragionatore competente e un buon utilizzatore di strumenti in conversazione. Su Terminal-Bench 4.0 ottiene 0,0202. Non è “peggio”; è un modello che non riesce affatto a tenere insieme un compito di repository a più passaggi, e nessuno sconto sui token rende più economico un compito in cui il modello fallisce rispetto a un compito che il modello completa.
C'è un costo di secondo ordine che il dato per singola attività nasconde. M3 registra 48.192 token di output per attività e un tempo alla prima risposta di 23,0 secondi contro i 332,0 secondi di GPT-6.1 Sol — il modello piccolo inizia a parlare quasi subito e poi ragiona a lungo. Se il tuo carico di lavoro è sensibile alla latenza ma superficiale, questo è un punto a favore di M3. Se è agentico, il numero di token è ciò che paghi e il punteggio finale è ciò che ottieni.
La nostra model card per GPT-6.1 Sol riporta gli stessi numeri nella forma che useresti effettivamente per il routing: la tariffa di $2,00 / $10,00, una finestra di contesto di 1.050.000 token, un p50 di 4,54 secondi al primo token, e il blocco di indice e benchmark di Artificial Analysis presente sulla stessa pagina.

Quanto valgono qui i pesi aperti
Il fatto che M3 sia scaricabile è l'argomento più forte a suo favore, e vale la pena essere precisi su cosa comporta. Comporta termini di licenza che ti permettono di eseguire il modello all'interno del tuo perimetro — utile se i dati non possono uscire — e comporta la concorrenza sui prezzi che deriva da quindici host indipendenti. Non ti garantisce un deployment economico: 428 miliardi di parametri con 23 miliardi attivi richiedono comunque hardware di inferenza serio, e la MiniMax Community License è una licenza personalizzata con condizioni allegate, non una licenza senza restrizioni. Per la maggior parte dei team, "open weights" significa un prezzo migliore sull'inferenza ospitata, non un box nel rack.
La scheda OrcaRouter per MiniMax M3 è dove risiedono i numeri erogati: la tariffa di $0,30 / $1,20, la finestra di contesto di 1.048.576 token, l'output massimo di 512.000 token, l'input testo/immagine/video e un volume di 56,4 milioni di token in sette giorni tra i provider che lo instradano.

Entrambi dietro una sola chiave
La ragione pratica per cui questo confronto è un cambio di configurazione anziché una migrazione è che entrambi i modelli sono raggiungibili da un unico endpoint OrcaRouter — una sola API per oltre 200 modelli, con il prezzo di listino del provider passato attraverso a 0% di markup, il che significa che una variazione delle tariffe MiniMax arriva sulla tua fattura lo stesso giorno in cui il fornitore la pubblica, anziché quando un rivenditore rinegozia. Questo conta più per M3 che per il suo rivale: il motivo stesso per instradare verso un modello open-weight è che il suo prezzo e la sua lista di host sono in movimento, e un contatore pass-through è l'unico tipo che insegue un obiettivo mobile.
Il failover automatico è l'altra metà. M3 è servito da molti provider con affidabilità variabile, e il livello di routing può spostare una richiesta su un altro host quando uno si degrada, senza che il chiamante sappia su quale host sia atterrata. Questo è il modo onesto di adottare un modello il cui punteggio su Terminal-Bench dice "non per il percorso critico": mettilo dove un nuovo tentativo costa poco.
Quale, se devi scegliere oggi
Se il lavoro è testo in grandi volumi — estrazione, sintesi, classificazione, dialogo, qualunque cosa in cui l'output sia prosa e la modalità di errore sia una frase sbagliata anziché una build rotta — MiniMax M3 è la scelta predefinita corretta e il trenta per cento sono soldi veri. Usa i numeri di GPQA e τ²-bench come prova: questo è un modello capace che è anche economico.
Se il lavoro è agentico — repository, terminali, catene di strumenti, qualunque cosa con una fase di verifica — lo 0,0202 su Terminal-Bench 4.0 è da squalifica, e GPT-6.1 Sol a 0,5606 per 0,724 $ per attività è l'affare migliore anche a un costo dell'85% in più per token. Il listino prezzi non è mai stato ciò che stavi comprando.
La risposta utile è che non devi scegliere una volta sola. Instrada il livello superficiale verso M3, instrada il livello agentico verso GPT-6.1 Sol e tieni entrambi dietro un'unica credenziale — il DSL di routing li compone in un'unica chiamata quando un'attività inizia come estrazione e si trasforma in un lavoro di riparazione.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
