
GPT-6 Sol Pro vs Grok 4.7: Il doppio della verbosità, un terzo del prezzo
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 986 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 196 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 112 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
I due modelli più economici adiacenti alla frontiera di settembre 2026 sono arrivati a un giorno di distanza l'uno dall'altro, e la cosa interessante non è quale dei due sia più intelligente. GPT-6 Sol — il modello a cui le persone ricorrono quando cercano GPT-6 Sol Pro, ovvero quel modello con il suo reasoning.mode impostato su pro anziché un prodotto separato — è stato rilasciato il 22 settembre 2026 a 2,00 $ per milione di token in input e 10,00 $ per milione di token in output. Grok 4.7 del fornitore è stato rilasciato il 21 settembre allo stesso prezzo di 2,00 $ per l'input e 6,00 $ per l'output. Sul harness neutrale di Artificial Analysis i due si collocano a due punti indice di distanza e a circa due dollari per attività completata di distanza, e il motivo di questo divario non è la capacità. È quanti token consuma ciascuno per arrivarci.
Sol ha generato 77 milioni di token di output eseguendo l'Intelligence Index. Grok 4.7 ne ha generati 240 milioni. Quel rapporto — poco più di tre a uno — è l'intera comparazione, e inverte la conclusione che ti dà una tabella dei prezzi per token.
Le due schede tariffarie, e dove quella economica non è economica
Entrambi i fornitori pubblicano questi numeri autonomamente; nessuno dei due è stato riprezzato in modo indipendente.
• Input — GPT-6 Sol 2,00 $ per milione di token vs Grok 4.7 2,00 $ per milione di token
• Output — GPT-6 Sol $10,00 per milione di token vs Grok 4.7 $6,00 per milione di token
• Input in cache — GPT-6 Sol $0,20 per milione di token vs Grok 4.7 $0,50 per milione di token; la lettura della cache di Sol è più economica di un fattore due e mezzo, che è l'opposto di quanto suggerisce la tariffa di output di riferimento
• Finestra di contesto — GPT-6 Sol 1.050.000 token contro Grok 4.7 500.000 token
• Supplemento per contesto lungo — GPT-6 Sol riprezza una richiesta superiore a 272.000 token di input applicando tariffe di input e cache pari a 2× e output pari a 1,5× per l'intera richiesta, mentre Grok 4.7 raddoppia ogni tariffa a 200.000 token di input, anch'esso per l'intera richiesta
• Data limite delle conoscenze — GPT-6 Sol 20 aprile 2026 vs Grok 4.7 un cutoff di pre-addestramento riportato come giugno 2026 con addestramento supplementare fino ad agosto
• Sforzo di ragionamento — GPT-6 Sol nessuno, basso, medio (predefinito), alto, xhigh, max vs Grok 4.7 basso, medio (predefinito), alto, xhigh
• Modalità — entrambi accettano input di testo e immagini e restituiscono testo
La voce relativa alla lettura della cache è quella su cui un acquirente dovrebbe soffermarsi. La tariffa di output di Grok 4.7 è inferiore del 40%, ma il suo input in cache è superiore del 150%, e l'input in cache è dove risiedono le lunghe cronologie degli agenti e i prompt di sistema ripetuti. Un carico di lavoro che consiste principalmente nel rileggere un contesto ampio e stabile troverà i due modelli molto più vicini di quanto implichi $6 contro $10.

Il record indipendente, e l'unico numero che lo decide
Artificial Analysis è l'unico harness che ha misurato entrambi i modelli, e le sue cifre meritano di essere presentate fianco a fianco, perché la divergenza è istruttiva.
• Indice di Intelligenza — GPT-6 Sol 48 con impegno massimo vs Grok 4.7 46 a xhigh; entrambi ben al di sopra della mediana di 25 dei modelli comparabili
• Costo per attività di indicizzazione — GPT-6 Sol $1,06 vs Grok 4.7 $3,74
• Token di output per l'esecuzione dell'indice — GPT-6 Sol 77M vs Grok 4.7 240M, rispetto a una mediana di 88M
• Velocità di output — Grok 4.7 misurato a 39 token al secondo, che l'harness stesso etichetta come notevolmente lento; il dato di Sol sulla stessa classifica non è pubblicato nella stessa riga di riepilogo
• Coding Agent Index — GPT-6 Sol 57 a $2,99 per attività contro Grok 4.7 56 con il suo harness Grok Build di prima parte, in aumento di nove punti rispetto a Grok 4.6
Due punti di differenza nell'indice, tre volte e mezzo il costo per attività. Non è un'anomalia di prezzo: è l'aritmetica della verbosità. Grok 4.7 è un modello che pensa ad alta voce a lungo; il sistema di valutazione lo segnala come «molto verboso» rispetto a una mediana di 88 milioni di token, e il costo segue i token, non il tariffario.
Il confronto tra agenti di programmazione comporta un'avvertenza che il tabellone nasconde. Il 56 di Grok 4.7 è misurato all'interno dell'harness Grok Build di xAI, che è la configurazione che xAI distribuisce e rispetto alla quale esegue i benchmark. Il 57 di Sol è misurato in un harness neutrale. Un vantaggio di uno o due punti dovuto all'harness di prima parte rientra ampiamente nell'intervallo che la scelta dell'harness spiega, il che significa che la lettura onesta è che questi due sono alla pari nella programmazione agentica — non che Sol sia un punto avanti.

Ciò che sostiene ciascun fornitore, e ciò che nessuno dei due ha mostrato
Il materiale di lancio di xAI è specifico e racconta una storia di lungo periodo: Grok 4.7 è costruito su un modello di base più grande rispetto a Grok 4.6 e ha ricevuto una sessione di apprendimento per rinforzo più lunga, mirata a compiti che «possono richiedere ore per essere completati», affinando l'autoverifica, la gestione di contesti lunghi e il comportamento all'interno dell'ambiente Grok Bot. I numeri dichiarati dal fornitore includono Terminal-Bench 4.0 al 38,0% contro il 20,3% di Grok 4.6, CursorBench 4.0 al 46,3% e DeepSWE v1.1 al 71,0%. Ognuno di questi è una misurazione di xAI stessa e nessuno è stato riprodotto in modo indipendente; il dato indipendente di Terminal-Bench 4.0 che circola è sostanzialmente inferiore a quello del fornitore, che è la forma tipica di quel divario.
Le dichiarazioni di OpenAI per GPT-6 Sol sono quelle già trattate sopra, e portano la stessa etichetta. I valori riportati dal fornitore sono 33,2% su AutomationBench con impegno xhigh contro il 26,9% di Claude Opus 5 a max, a circa il 9% del costo per attività, e 68,8% su DeepSWE v1.1 con impegno max — a 1,1 punti da Claude Fable 5 a xhigh, a un costo per attività inferiore di circa l'80%. Nota il termine di confronto: i grafici di OpenAI mettono Sol contro i modelli di Anthropic, non contro Grok 4.7. Nessuno dei due fornitori ha pubblicato un confronto testa a testa contro l'altro.

Dove il livello di routing si guadagna il suo posto
OrcaRouter non include nessuno dei due modelli in questo confronto — Grok 4.7 e GPT-6 Sol sono entrambi assenti dal nostro catalogo, quindi nulla di quanto segue è un'affermazione sul loro prezzo tramite noi. Ciò che un livello di routing vale in questo particolare abbinamento è la modalità di guasto, non la scheda tariffaria. Il motivo per cui ricorrere a Grok 4.7 è il suo comportamento agentico a lungo orizzonte; il motivo per non ricorrervi è che una velocità di output di 39 token al secondo rende un'esecuzione agentica lunga abbastanza lenta da contare, e un'esecuzione lenta è un'esecuzione che può andare in timeout. Failover automatico tra provider significa che un lavoro lungo può essere instradato verso qualunque modello sia effettivamente disponibile senza che quella velocità diventi un singolo punto di guasto, e il DSL di routing esprime la scelta del modello come una regola all'interno della chiamata anziché come una migrazione — il che qui conta, perché la risposta corretta per questa coppia dipende dal fatto che il compito sia avido di token o sensibile alla latenza, e questa è una proprietà della richiesta, non del trimestre.
La regola di decisione
• Coding agentico a budget fisso — GPT-6 Sol. Capacità di livello sull'indice di coding neutrale, a circa un terzo del costo per attività, perché ci arriva con un terzo dei token.
• Attività a lungo orizzonte in cui la durata dell'esecuzione è il punto — Grok 4.7. Il rilascio è stato addestrato specificamente per lavori di più ore, e i numeri del fornitore su SWE-Marathon e CursorBench vanno esattamente in quella direzione.
• Volume sensibile alla latenza — nessuno dei due, stando ai dati attuali. Il costo per attività di Sol è il dato migliore, ma i 39 token al secondo misurati di Grok 4.7 sono un vero vincolo per qualsiasi cosa interattiva.
• Carichi di lavoro con contesti lunghi prevalentemente in cache — GPT-6 Sol, sulla linea di lettura della cache anziché su quella di output. A $0,20 contro $0,50 per milione di token in cache, e con una finestra grande il doppio, l'argomento si rafforza quanto più il tuo prompt è stabile.
• Se il tuo confronto è stato costruito sul listino per token — ricostruiscilo dal costo per attività. 6,00 $ rispetto a 10,00 $ di output è la coppia di numeri meno informativa di questo articolo, ed è la coppia con cui apre ogni pagina esistente.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
