
GPT-5.6 vs Grok 4.6: Pari sull'indice, divisi su contesto e prezzo
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Intelligenza49Codice
Sulla scala dell'Artificial Analysis Intelligence Index, rispetto alla quale entrambi sono stati valutati fino all'inizio di settembre 2026, il GPT-5.6 di OpenAI — il cui livello di punta, GPT-5.6 Sol, è ciò a cui instrada il nome API gpt-5.6 — e il Grok 4.6 di SpaceXAI hanno ottenuto lo stesso punteggio: 61. Un indice indipendente che colloca due ammiraglie rivali allo stesso livello è il tipo di risultato più raro in un confronto di frontiera, ed è qui che questo testa a testa diventa interessante, non dove finisce. I modelli che sono arrivati pari vengono venduti in modo molto diverso. Il GPT-5.6 Sol, l'ammiraglia che OpenAI ha rilasciato il 9 luglio e ha riposizionato come la sua offerta economica quando il GPT-6 Astra è stato lanciato il 3 settembre, ha un prezzo di listino di 4,00 $ per milione di token di input e 20,00 $ per milione di token di output dopo un taglio dei prezzi del 24 agosto, e gestisce fino a circa 1,05 milioni di token di contesto. Il Grok 4.6, che xAI ha rilasciato il 12 agosto, ha un prezzo di listino di 2,00 $ / 6,00 $ e arriva a un massimo di 500.000 token. Stesso punteggio sulla lavagna indipendente, e poi i due modelli divergono su quanto lontano si può spingere una singola richiesta — e su quanto costa spingerla.
Questa pagina ora esiste per un motivo concreto: i due listini e i due tetti si sono spostati a poche settimane di distanza l'uno dall'altro. Grok 4.6 è stato rilasciato il 12 agosto e il 28 agosto è diventato disponibile nelle normali chat di Grok su web e mobile, dopo due settimane iniziali in cui era rimasto confinato a Grok Build e all'API. Il taglio promozionale di GPT-5.6 Sol è arrivato il 24 agosto e, dieci giorni dopo, il lancio di GPT-6 Astra ha silenziosamente declassato Sol da flagship a value flagship. Entrambi i modelli qui sotto sono ormai quelli a cui ricorri quando vuoi un ragionamento quasi di frontiera senza pagare prezzi di classe Astra — che è esattamente il motivo per cui il pareggio 61 a 61 è diventato il punto decisionale concreto, piuttosto che una domanda da quiz.
Cosa significa "pari a 61", e cosa non significa.
Il punteggio richiede una data e una scala. Artificial Analysis ha misurato GPT-5.6 Sol a ~61 e Grok 4.6 a 61 sulla scala dell'indice in uso fino all'inizio di settembre — la scala citata dagli altri confronti su GPT-5.6 di questo blog — con Grok all'undicesimo posto tra i 202 modelli monitorati da AA e Sol a un paio di posizioni da esso, allo stesso punteggio. AA ha poi ricalibrato l'indice il 7 settembre (v4.3), una versione che comprime i punteggi: GPT-5.6 Sol misura 47 lì, GPT-6 Astra e Claude Fable 5.1 misurano 53, e per Grok 4.6 non è stato ancora pubblicato alcun punteggio complessivo sulla nuova scala. Il pareggio qui sotto è quindi un'affermazione relativa alla scala di settembre precedente la ricalibrazione, ed è meglio leggerlo come posizione relativa: sull'indice più recente che ha assegnato un punteggio a entrambi, questi due erano in parità, ed entrambi si collocavano subito dietro alla classe di Claude Opus 5.
Un'ulteriore precisazione sul pareggio, ed è importante per come lo si usa. I due punteggi sono stati ottenuti con impostazioni di sforzo differenti: GPT-5.6 Sol con max reasoning, il livello più alto del selettore di OpenAI (che sulle richieste difficili esegue quattro sub-agent in parallelo), e Grok 4.6 su high, l'impostazione predefinita di xAI sul suo selettore che va da low a xhigh. Entrambe sono configurazioni che "danno tutto", ma non sono la stessa configurazione, e il pareggio è tra quelle due specifiche impostazioni, non tra tutte le impostazioni che i modelli offrono. Ciò che il punteggio uguale stabilisce è che nessuno dei due modelli possiede, su un indice composito indipendente, un vantaggio di intelligenza generale che l'altro schieramento possa rilevare — quindi un acquirente che deve scegliere tra i due deve guardare oltre l'indice: contesto, prezzo e le prove che ciascuna parte può effettivamente mostrare.
Two rate cards, two cliffs
Entrambi i fornitori fatturano un prompt lungo come un evento premium, ed entrambi fatturano l'intera richiesta al livello superiore una volta superata una soglia — è questo il meccanismo condiviso che rende leggibile questo confronto di prezzi. La tariffa di OpenAI per GPT-5.6 Sol è di $4.00 / $20.00 per milione, con letture da cache a $0.40, e una volta che una richiesta supera circa 272K token di input, l'intera richiesta viene riprezzata a $8.00 / $30.00 — la struttura a contesto lungo che Epoch AI ha documentato l'8 settembre. La tariffa di xAI per Grok 4.6 è di $2.00 / $6.00, con letture da cache a $0.50, e una volta che un prompt supera i 200K token, l'intera richiesta passa a $4.00 / $12.00.
• Rilasciato — GPT-5.6: 9 luglio 2026 (API pubblica; l'alias gpt-5.6 raggiunge il livello Sol). Grok 4.6: 12 agosto 2026.
• Prezzo di listino per 1M (in / out) — GPT-5.6 Sol: $4.00 / $20.00, letture da cache $0.40 (promo valida almeno fino al 21 novembre 2026). Grok 4.6: $2.00 / $6.00, letture da cache $0.50.
• Livello prompt lunghi — GPT-5.6 Sol: richiesta intera a $8.00 / $30.00 oltre ~272K di input. Grok 4.6: richiesta intera a $4.00 / $12.00 a 200K di input.
• Contesto / limite massimo di output — GPT-5.6 Sol: ~1.05M in ingresso, 128K in uscita. Grok 4.6: 500K in ingresso, nessun limite di uscita pubblicato.
• Index (indipendente) — GPT-5.6 Sol (max) ~61 contro Grok 4.6 (high) 61, scala di settembre precedente alla ricalibrazione.
• Modalità — entrambe accettano input di testo e immagini e producono testo.
Esegui i calcoli e il quadro è inequivocabile: per ogni lunghezza di prompt che Grok 4.6 può gestire, è l'opzione più economica, perché il suo tetto di prezzo ricalcolato si attesta comunque al di sotto o al livello della tariffa standard di GPT-5.6 Sol.
• 100K in / 8K out — GPT-5.6 Sol: 0.10 × $4 + 0.008 × $20 = $0.56. Grok 4.6: 0.10 × $2 + 0.008 × $6 = $0.25. Grok è circa il 55% più economico per la richiesta.
• 400K in / 30K out (entrambi riprezzati) — GPT-5.6 Sol: 0,40 × $8 + 0,03 × $30 = $4,10. Grok 4.6: 0,40 × $4 + 0,03 × $12 = $1,96. Grok costa ancora circa la metà anche dopo il proprio cliff.
• 600K in ingresso / 30K in uscita — GPT-5.6 Sol: 0,60 × $8 + 0,03 × $30 = $5,70. Grok 4.6: non può — 600K supera la sua finestra di contesto di 500K. Questa è la fascia in cui Sol è l'unica opzione, e dove il suo prezzo smette di sembrare premium.

La geometria del precipizio differisce in un aspetto che favorisce GPT-5.6 Sol: la sua soglia (272K) è più alta di quella di Grok (200K), quindi esiste una fascia — grosso modo tra 200K e 272K di input — in cui Grok ha già applicato il riprezzo e Sol no. Anche lì Grok tende a vincere in dollari, perché la sua tariffa di output riprezzata di $12 è comunque inferiore del 40% rispetto ai $20 standard di Sol. L'economia si ribalta a favore di Sol solo oltre i 500K token, che è esattamente la regione in cui la finestra di contesto di Grok non può entrare. Se le lunghezze dei tuoi prompt restano sotto i 200K — come per la maggior parte del traffico di chat, RAG e assistenza alla codifica — Grok 4.6 è più conveniente su larga scala, con un costo complessivo inferiore di quasi un fattore due, e il fatto che il limite valga per l'intera richiesta significa che dovresti trattare i 200K come un confine di pianificazione piuttosto che come un suggerimento morbido.
A cosa servono in realtà i cinquecentomila token extra di Sol?
La finestra da 500K di Grok 4.6 {{1}}si adatta a più carichi di lavoro reali di quanto suggerisca la scheda tecnica{{/1}} — {{2}}letture complete del codebase, lunghi trascritti di agenti, grandi contesti di retrieval{{/2}} — e {{3}}la mancanza di un limite di output pubblicato aiuta sul lato della generazione{{/3}}: {{4}}per una singola chiamata che deve produrre un artefatto molto lungo, Grok non ha un tetto documentato, mentre GPT-5.6 Sol si ferma a 128K token di output{{/4}}. {{5}}Il vantaggio di GPT-5.6 Sol sta nella fascia tra 500K e 1.05M{{/5}}, e {{6}}i carichi di lavoro che ne hanno davvero bisogno sono più circoscritti di quanto il marketing lasci intendere{{/6}}: agenti che tengono in contesto un intero repository più una lunga cronologia di attività, trascrizioni molto lunghe di riunioni o ricerche analizzate in un'unica passata, e lavori di retrieval su corpora troppo grandi per essere spezzati in finestre delle dimensioni di Grok. Se nessuna delle vostre pipeline tocca quella fascia, il contesto extra di Sol è margine che pagate alla tariffa di input di $4.00 senza usarlo.
I due modelli indirizzano anche il ragionamento in modo diverso. GPT-5.6 Sol espone un selettore di sforzo basso / medio / alto / massimo, dove il massimo esegue quattro sottoagenti in parallelo che si coordinano su compiti difficili — di fatto un piccolo sciame di agenti per ogni richiesta complessa, potente ma costoso in termini di token di output, e l'impostazione alla base del punteggio di circa 61 nell'indice. Grok 4.6 esegue un singolo modello con un selettore da basso a extra-alto (predefinito alto) e strumenti lato server per ricerca ed esecuzione di codice, il che rende il suo comportamento più prevedibile per il budget: una richiesta, un modello, un costo che puoi stimare dal listino. Per uno sviluppatore che vuole una spesa deterministica, il design a modello singolo di Grok è operativamente più semplice; per i compiti più difficili a lungo orizzonte, lo sciame a sforzo massimo di Sol è la configurazione più capace — ed è il motivo per cui il suo punteggio migliore e le sue bollette più salate derivano dalla stessa impostazione.
Le prove che ciascuna parte può effettivamente mostrare
Nessuno dei due modelli ha un vantaggio indipendente nella classifica di coding, quindi le prove citabili si dividono per fornitore. OpenAI riporta GPT-5.6 Sol a circa il 96% su SWE-bench Verified — la prova di coding più forte che uno dei due modelli possa esibire, ma una valutazione dichiarata senza ancora un audit indipendente pubblicato — e il vantaggio reale di Sol include il fatto di risiedere negli strumenti Codex e ChatGPT. xAI riporta Grok 4.6 al 94,9% su GPQA Diamond, che presenta come il punteggio più alto mai testato su quel benchmark, e cita valutazioni agentiche con un costo API medio di circa 0,84 dollari per task completo; sono entrambi dati dichiarati dal fornitore. Sulla velocità i due modelli sono più vicini di quanto suggerisca il divario di prezzo: AA ha misurato Grok 4.6 a 64,9 token di output al secondo e GPT-5.6 Sol nella stessa fascia, intorno ai 65 token al secondo, su serving standard, mentre l'anteprima "Ultrafast" separata di OpenAI, basata su Cerebras (fino a circa 750 token al secondo), è ancora limitata e senza prezzo. Leggi l'intera tabella delle prove come: pareggio sull'indice, prove di coding da entrambe le parti senza audit indipendente per nessuno dei due, e nessun divario di velocità che cambi la decisione.
Quale default è razionale a settembre 2026?
Scegli Grok 4.6 quando il tuo traffico è sotto i 200K token di input — il prezzo è quasi la metà a ogni lunghezza di contesto servita, l'indice indipendente dice che i modelli sono allo stesso livello e un selettore per un unico modello con strumenti lato server mantiene il conto prevedibile. Scegli GPT-5.6 Sol quando hai davvero bisogno della fascia di contesto da 500K a 1.05M, quando il tuo stack è già nativo Codex o ChatGPT e il dato riportato di ~96% su SWE-bench fa da ricevuta di coding per l'ufficio acquisti, oppure quando vuoi l'opzione della configurazione a quattro sub-agent con sforzo massimo per i compiti a lungo orizzonte più difficili. E tieni d'occhio due date: la promozione da $4/$20 di GPT-5.6 Sol è garantita almeno fino al 21 novembre 2026, dopo di che i termini di questo confronto cambiano, e xAI ha già anticipato un Grok 4.7 — ciascuno di questi eventi potrebbe ricalibrare i prezzi del confronto su cui stai per basare la tua standardizzazione.
Eseguire entrambi senza riarchitettare
Poiché il pareggio sull'indice significa che questa è una decisione basata su tetto e prezzo piuttosto che sulla qualità, il modello pratico per la maggior parte dei team è instradare piuttosto che scegliere. GPT-5.6 Sol e Grok 4.6 sono entrambi su OrcaRouter ai prezzi di listino dei rispettivi fornitori, inoltrati senza markup — i $4/$20 di OpenAI e i $2/$6 di xAI sono i prezzi riportati in elenco, e quando uno dei due fornitori modifica una tariffa, il nuovo prezzo è attivo sulla stessa chiave lo stesso giorno. Con un endpoint compatibile con OpenAI puoi inviare traffico sub-200K a Grok 4.6, far salire le richieste che necessitano del contesto più lungo di Sol o della sua configurazione a massimo sforzo, e usare il failover automatico così che un limite di frequenza su un percorso del fornitore sia un evento di instradamento piuttosto che un'interruzione.

La parte relativa ai prezzi di questo confronto è quella che si muove — la promozione Sol di OpenAI è garantita solo fino al 21 novembre e xAI ha una 4.7 sulla roadmap — quindi il riferimento che questo blog tiene aggiornato è la pagina dei prezzi di GPT-5.6 Sol, datata e riverificata ogni volta che il listino cambia.

La risposta di due righe
Se i tuoi prompt rientrano in 500K token — e la maggior parte lo fa — Grok 4.6 ottiene lo stesso punteggio dell'indice indipendente di GPT-5.6 Sol a quasi la metà del prezzo per ogni lunghezza che può servire, senza un limite di output pubblicato e con una manopola prevedibile a modello singolo. GPT-5.6 Sol giustifica il suo premio nella fascia che Grok non può raggiungere: oltre 500K token di contesto, e all'interno degli strumenti OpenAI dove il suo riportato ~96% su SWE-bench Verified e i livelli Terra e Luna sottostanti ti danno una famiglia piuttosto che un singolo modello. Il pareggio sull'indice significa che questa decisione riguarda limiti e dollari, non capacità — quindi misura i tuoi prompt reali più lunghi prima di impegnarti, perché quel singolo numero sceglie il vincitore.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
