
GPT-6 vs Grok 4.6: due livelli intermedi, una fattura che diverge oltre i 200K token
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
GPT-6 Sol e Grok 4.6 costano gli stessi 2,00 $ per milione di token di input e 6,00 $ per milione di token di output in cima alle due colonne. Ciò che quasi nessuno stampa accanto a questo è che le colonne smettono di coincidere in punti diversi della richiesta. Grok 4.6 inizia ad applicare la sua tariffa per il contesto lungo nel momento in cui un prompt supera i 200.000 token di input; GPT-6 Sol aspetta fino a 272.000. Al di sopra di quelle soglie viene ricalcolata l'intera richiesta — non solo l'eccedenza — e i due fornitori la ricalcolano in direzioni opposte, ed è proprio questa la parte che decide una fattura per una lunga esecuzione di un agente. GPT-6 Sol e i suoi fratelli GPT-6 Astra e GPT-6 Luna sono stati rilasciati il 22 settembre 2026; Grok 4.6, il livello intermedio della linea di SpaceXAI, è stato rilasciato il 12 agosto 2026 ed è già stato affiancato da Grok 4.7, quindi questo è un confronto tra due modelli già rilasciati e non il lancio di nessuno dei due.
Una seconda cosa è cambiata il 7 ottobre 2026 e conta per come leggi GPT-6 in generale: OpenAI ha iniziato a distribuire GPT-6 nella scheda Chat principale di ChatGPT, raggiungendo i livelli gratuiti l'8 ottobre, con i livelli Plus, Pro, Business ed Enterprise che utilizzano GPT-6 Sol e i livelli Free e Go che utilizzano GPT-6 Luna. Questo è un cambiamento di superficie — gli stessi modelli, un pubblico molto più ampio e un nuovo livello di interfaccia che OpenAI chiama Intelligent UI. Non cambia di una virgola alcun rate API. Significa però che, se stai facendo benchmark di "GPT-6" rispetto a qualsiasi cosa, ora stai facendo benchmark rispetto a un modello a cui anche un numero molto grande di persone sta parlando in una scheda del browser.
Dove le due carte differiscono effettivamente
• Input a contesto breve — GPT-6 Sol 2,00 $ per milione vs Grok 4.6 2,00 $ per milione
• Output a contesto breve — GPT-6 Sol 10,00 $ per milione vs Grok 4.6 6,00 $ per milione
• Soglia per richieste lunghe — GPT-6 Sol applica un prezzo maggiore oltre 272.000 token di input vs Grok 4.6 oltre 200.000
• Input per richieste lunghe — GPT-6 Sol 4,00 $ per milione vs Grok 4.6 4,00 $ per milione
• Output per richieste lunghe — GPT-6 Sol 15,00 $ per milione vs Grok 4.6 12,00 $ per milione
• Input in cache — GPT-6 Sol 0,20 $ per milione vs Grok 4.6 0,50 $ per milione
• Finestra di contesto — GPT-6 Sol 1.050.000 token vs Grok 4.6 500.000 token
• Modalità di input — entrambi accettano testo, immagini e file
• Punteggio knowledge-work — GPT-6 Sol 47,6 vs Grok 4.6 44,3 sull'Artificial Analysis Intelligence Index
• Terminal-Bench 2.1 — GPT-6 Sol non pubblicato sulla stessa revisione vs Grok 4.6 88,4
Leggi insieme le due righe di output e appare la forma della decisione. Grok 4.6 costa $4,00 in meno per milione di token di output su qualsiasi richiesta sotto i 200K, e solo $3,00 in meno al di sopra. Si tratta di un divario molto più piccolo di quanto suggerisca il 40% del titolo, perché entrambi i modelli rideterminano il prezzo dell'intera richiesta anziché della porzione oltre la soglia — un dettaglio su cui vale la pena soffermarsi, dato che un prompt da 200.001 token non viene fatturato come un token alla tariffa costosa più 200.000 alla tariffa economica.
Poi la soglia stessa va nella direzione opposta. Grok 4.6 inizia a riprezzare 72.000 token prima rispetto a GPT-6 Sol. Per un carico di lavoro che si colloca costantemente tra 200K e 272K, Grok 4.6 è il modello più costoso nonostante il prezzo per token di listino più basso, ed è l'unico dei due che si sia mosso affatto. Su quale lato di quella finestra cadano i tuoi prompt è una domanda più utile di quale prezzo di listino sia più basso.

Il divario del benchmark è più piccolo e più stretto del divario di prezzo
Sull'Intelligence Index di Artificial Analysis, che è una misurazione di terze parti e non una tabella di un fornitore, GPT-6 Sol si colloca a 47,6 e Grok 4.6 a 44,3. Un divario di 3,3 punti su una scala da 0 a 100 è reale, ma non è il tipo di distanza che rende un modello sbagliato per un compito e l'altro giusto. Inoltre, la misurazione avviene con un'impostazione di ragionamento specifica per modello, e GPT-6 Sol espone uno sforzo di ragionamento configurabile mentre Grok 4.6 espone il proprio — quindi chiunque citi un singolo numero di confronto diretto sta citando un punto in una griglia bidimensionale.
Dove i due sono davvero più distanti è nel lavoro agentico in stile terminale. Su Terminal-Bench 2.1, Grok 4.6 registra 88,4. GPT-6 Sol non ha alcun dato pubblicato comparabile sulla revisione che il nostro catalogo riporta, e la lettura onesta di una cella vuota è che il numero non è pubblicato — non che il modello abbia ottenuto scarsi risultati. Se il carico di lavoro è un agente a esecuzione prolungata guidato da shell, le evidenze pubblicate favoriscono Grok 4.6 e le evidenze mancanti non contano come prove per nessuna delle due parti.
Vale il contrario sul recupero delle conoscenze su contesti lunghi. GPT-6 Sol registra 83,7 nel richiamo su contesto lungo contro l'80,3 di Grok 4.6, e i fornitori di entrambi i modelli riportano altrove le proprie cifre — SpaceXAI mette in evidenza GPQA Diamond a 94,9 per Grok 4.6, mentre il materiale di OpenAI su GPT-6 è in gran parte dichiarato dal fornitore e non riprodotto. Due regole mantengono la distinzione: un numero di un fornitore è un'affermazione, e un numero di un indice è una misurazione su una revisione denominata. Non sono intercambiabili e non dovrebbero mai essere mediati in un unico punteggio "migliore".
Il problema del successore
Nessuno dei due è il modello più recente del proprio laboratorio, e fingere il contrario sarebbe la cosa più fuorviante che questo confronto potrebbe fare. SpaceXAI ha rilasciato Grok 4.7 il 21 settembre 2026 alla stessa tariffa base di $2,00 / $6,00, con l'Intelligence Index che è passato da 44,3 a 46,4. OpenAI ha rilasciato GPT-6.1 Sol il 29 settembre 2026, anch'esso a $2,00 / $10,00, con l'Intelligence Index a 51,8 e una tariffa effettivamente migliorata: l'input in cache è sceso da $0,20 a $0,10 per milione. Artificial Analysis ora segnala la sua pagina GPT-6 Sol come deprecata, indirizzando i lettori verso GPT-6.1 Sol.
Quindi l'inquadramento equo non è "quale di questi due dovresti adottare" ma "quale di questi due, e sei sicuro che non sia una generazione più recente da una parte o dall'altra". Il motivo per restare su GPT-6 Sol è di solito una specifica integrazione vecchia di otto giorni, più che un'affermazione di capacità; il motivo per restare su Grok 4.6 è un numero pubblicato di terminal-agent che il suo successore non ha ancora eguagliato pubblicamente. Entrambi sono legittimi, ed entrambi hanno una finestra temporale definita.

Eseguire entrambi con un unico tasto.
Entrambi i modelli sono instradati da OrcaRouter, quindi la parte meccanica del mantenere vivi due candidati non costa nulla: una sola API davanti a oltre 200 modelli, la stessa chiave, nessun secondo contratto e nessuna modifica al codice tra l’uno e l’altro. Questo conta qui più del solito, perché la ragione per un secondo modello su questo specifico abbinamento non è una copertura delle capacità ma una decisione di instradamento — manda la finestra da 200K a 272K a GPT-6 Sol e tutto ciò che è più corto a Grok 4.6, e la stessa applicazione ottiene la fattura più economica su entrambi i lati di una soglia che nessuno dei due fornitori ti lascia scegliere.
Il failover automatico è la metà noiosa della stessa configurazione. Le esecuzioni degli agenti a contesto lungo sono lunghe proprio perché qualcosa tiene aperta una sessione, e un singhiozzo del provider al minuto quaranta è il tipo di errore che costa caro. Una seconda rotta configurata in anticipo trasforma tutto questo in un nuovo tentativo anziché in una nuova esecuzione.
Il nostro catalogo le elenca entrambe al prezzo di listino del rispettivo fornitore, senza alcun ricarico, così una variazione di tariffa su una delle due schede si ripercuote su di noi lo stesso giorno in cui si ripercuote su di loro. Vale la pena dirlo chiaramente, più che come uno slogan: il motivo per cui interessarsene è che la differenza tra $0,20 e $0,50 per l'input in cache di cui sopra è esattamente il tipo di voce che i fornitori modificano in silenzio, e un pass-through significa che non devi mai aspettare che un rivenditore si metta al passo.

Cosa lo decide davvero
Se i tuoi prompt sono brevi, Grok 4.6 vince sul prezzo di output con un margine che nessun delta di indice può colmare, e il suo punteggio terminal-agent è il numero pubblicato più alto in entrambe le colonne. Se i tuoi prompt sono lunghi, la soglia di riprezzamento più tardiva di GPT-6 Sol e la sua finestra più lunga valgono più della sua tariffa di output più alta, e la voce dell'input in cache costa un quarto. Se i tuoi prompt si collocano tra 200K e 272K, hai tra le mani l'unico carico di lavoro in cui il modello che sembra più economico è quello più costoso, e la soluzione è la selezione del percorso anziché la selezione del modello.
La cosa da tenere d'occhio non è né l'uno né l'altro, ma i due successori già disponibili. Sia Grok 4.7 sia GPT-6.1 Sol tolgono forza all'idea di aspettare una decisione in merito, e un confronto che va rifatto ogni tre settimane è un confronto che va gestito dietro a un router, non in un documento di architettura.
Confrontati in questo articolo3
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
