Una card con titolo hero per un articolo che mette a confronto GPT-6 Sol Pro con Grok 4.7, con la scritta "GPT-6 Sol Pro vs Grok 4.7" e il sottotitolo "Il doppio della verbosità, un terzo del prezzo".
Guides & Insights

GPT-6 Sol Pro vs Grok 4.7: Il doppio della verbosità, un terzo del prezzo

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

I due modelli più economici adiacenti alla frontiera di settembre 2026 sono arrivati a un giorno di distanza l'uno dall'altro, e la cosa interessante non è quale dei due sia più intelligente. GPT-6 Sol — il modello a cui le persone ricorrono quando cercano GPT-6 Sol Pro, ovvero quel modello con il suo reasoning.mode impostato su pro anziché un prodotto separato — è stato rilasciato il 22 settembre 2026 a 2,00 $ per milione di token in input e 10,00 $ per milione di token in output. Grok 4.7 del fornitore è stato rilasciato il 21 settembre allo stesso prezzo di 2,00 $ per l'input e 6,00 $ per l'output. Sul harness neutrale di Artificial Analysis i due si collocano a due punti indice di distanza e a circa due dollari per attività completata di distanza, e il motivo di questo divario non è la capacità. È quanti token consuma ciascuno per arrivarci.

Sol ha generato 77 milioni di token di output eseguendo l'Intelligence Index. Grok 4.7 ne ha generati 240 milioni. Quel rapporto — poco più di tre a uno — è l'intera comparazione, e inverte la conclusione che ti dà una tabella dei prezzi per token.

Le due schede tariffarie, e dove quella economica non è economica

Entrambi i fornitori pubblicano questi numeri autonomamente; nessuno dei due è stato riprezzato in modo indipendente.

• Input — GPT-6 Sol 2,00 $ per milione di token vs Grok 4.7 2,00 $ per milione di token

• Output — GPT-6 Sol $10,00 per milione di token vs Grok 4.7 $6,00 per milione di token

• Input in cache — GPT-6 Sol $0,20 per milione di token vs Grok 4.7 $0,50 per milione di token; la lettura della cache di Sol è più economica di un fattore due e mezzo, che è l'opposto di quanto suggerisce la tariffa di output di riferimento

• Finestra di contesto — GPT-6 Sol 1.050.000 token contro Grok 4.7 500.000 token

• Supplemento per contesto lungo — GPT-6 Sol riprezza una richiesta superiore a 272.000 token di input applicando tariffe di input e cache pari a 2× e output pari a 1,5× per l'intera richiesta, mentre Grok 4.7 raddoppia ogni tariffa a 200.000 token di input, anch'esso per l'intera richiesta

• Data limite delle conoscenze — GPT-6 Sol 20 aprile 2026 vs Grok 4.7 un cutoff di pre-addestramento riportato come giugno 2026 con addestramento supplementare fino ad agosto

• Sforzo di ragionamento — GPT-6 Sol nessuno, basso, medio (predefinito), alto, xhigh, max vs Grok 4.7 basso, medio (predefinito), alto, xhigh

• Modalità — entrambi accettano input di testo e immagini e restituiscono testo

La voce relativa alla lettura della cache è quella su cui un acquirente dovrebbe soffermarsi. La tariffa di output di Grok 4.7 è inferiore del 40%, ma il suo input in cache è superiore del 150%, e l'input in cache è dove risiedono le lunghe cronologie degli agenti e i prompt di sistema ripetuti. Un carico di lavoro che consiste principalmente nel rileggere un contesto ampio e stabile troverà i due modelli molto più vicini di quanto implichi $6 contro $10.

A six-row scoreboard card titled 'GPT-6 Sol Pro vs Grok 4.7 - the scoreboard', comparing output price, cached input, context window, index tokens, AA Intelligence Index and cost per task. GPT-6 Sol Pro is listed at $10.00 output and $0.20 cached input per million tokens, a 1,050,000-token context, 77M index tokens, an AA Index of 48 and $1.06 per task; Grok 4.7 at $6.00 output and $0.50 cached input, a 500,000-token context, 240M index tokens, an AA Index of 46 and $3.74 per task. A footer reads 'Vendor list prices; index and cost figures per Artificial Analysis.'

Il record indipendente, e l'unico numero che lo decide

Artificial Analysis è l'unico harness che ha misurato entrambi i modelli, e le sue cifre meritano di essere presentate fianco a fianco, perché la divergenza è istruttiva.

• Indice di Intelligenza — GPT-6 Sol 48 con impegno massimo vs Grok 4.7 46 a xhigh; entrambi ben al di sopra della mediana di 25 dei modelli comparabili

• Costo per attività di indicizzazione — GPT-6 Sol $1,06 vs Grok 4.7 $3,74

• Token di output per l'esecuzione dell'indice — GPT-6 Sol 77M vs Grok 4.7 240M, rispetto a una mediana di 88M

• Velocità di output — Grok 4.7 misurato a 39 token al secondo, che l'harness stesso etichetta come notevolmente lento; il dato di Sol sulla stessa classifica non è pubblicato nella stessa riga di riepilogo

• Coding Agent Index — GPT-6 Sol 57 a $2,99 per attività contro Grok 4.7 56 con il suo harness Grok Build di prima parte, in aumento di nove punti rispetto a Grok 4.6

Due punti di differenza nell'indice, tre volte e mezzo il costo per attività. Non è un'anomalia di prezzo: è l'aritmetica della verbosità. Grok 4.7 è un modello che pensa ad alta voce a lungo; il sistema di valutazione lo segnala come «molto verboso» rispetto a una mediana di 88 milioni di token, e il costo segue i token, non il tariffario.

Il confronto tra agenti di programmazione comporta un'avvertenza che il tabellone nasconde. Il 56 di Grok 4.7 è misurato all'interno dell'harness Grok Build di xAI, che è la configurazione che xAI distribuisce e rispetto alla quale esegue i benchmark. Il 57 di Sol è misurato in un harness neutrale. Un vantaggio di uno o due punti dovuto all'harness di prima parte rientra ampiamente nell'intervallo che la scelta dell'harness spiega, il che significa che la lettura onesta è che questi due sono alla pari nella programmazione agentica — non che Sol sia un punto avanti.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 23 September 2026, showing list pricing of $2.00 per million input tokens and $6.00 per million output tokens with a 75% cache discount, an Intelligence Index score of 46, a cost per Intelligence Index task of $3.74, 240 million output tokens generated during the index run, a 500,000-token context window, and a measured output speed of 39 tokens per second that the page labels notably slow.

Ciò che sostiene ciascun fornitore, e ciò che nessuno dei due ha mostrato

Il materiale di lancio di xAI è specifico e racconta una storia di lungo periodo: Grok 4.7 è costruito su un modello di base più grande rispetto a Grok 4.6 e ha ricevuto una sessione di apprendimento per rinforzo più lunga, mirata a compiti che «possono richiedere ore per essere completati», affinando l'autoverifica, la gestione di contesti lunghi e il comportamento all'interno dell'ambiente Grok Bot. I numeri dichiarati dal fornitore includono Terminal-Bench 4.0 al 38,0% contro il 20,3% di Grok 4.6, CursorBench 4.0 al 46,3% e DeepSWE v1.1 al 71,0%. Ognuno di questi è una misurazione di xAI stessa e nessuno è stato riprodotto in modo indipendente; il dato indipendente di Terminal-Bench 4.0 che circola è sostanzialmente inferiore a quello del fornitore, che è la forma tipica di quel divario.

Le dichiarazioni di OpenAI per GPT-6 Sol sono quelle già trattate sopra, e portano la stessa etichetta. I valori riportati dal fornitore sono 33,2% su AutomationBench con impegno xhigh contro il 26,9% di Claude Opus 5 a max, a circa il 9% del costo per attività, e 68,8% su DeepSWE v1.1 con impegno max — a 1,1 punti da Claude Fable 5 a xhigh, a un costo per attività inferiore di circa l'80%. Nota il termine di confronto: i grafici di OpenAI mettono Sol contro i modelli di Anthropic, non contro Grok 4.7. Nessuno dei due fornitori ha pubblicato un confronto testa a testa contro l'altro.

Screenshot of OpenAI's developer model page for GPT-6 Sol, captured 23 September 2026, showing the model id gpt-6-sol as the default snapshot, a 1,050,000-token context window with 128,000 maximum output tokens, an April 20, 2026 knowledge cutoff, text and image input with text output, and Standard pricing of $2.00 input, $0.20 cached input, $2.50 cache writes and $10.00 output per million tokens. No pro model id appears on the page.

Dove il livello di routing si guadagna il suo posto

OrcaRouter non include nessuno dei due modelli in questo confronto — Grok 4.7 e GPT-6 Sol sono entrambi assenti dal nostro catalogo, quindi nulla di quanto segue è un'affermazione sul loro prezzo tramite noi. Ciò che un livello di routing vale in questo particolare abbinamento è la modalità di guasto, non la scheda tariffaria. Il motivo per cui ricorrere a Grok 4.7 è il suo comportamento agentico a lungo orizzonte; il motivo per non ricorrervi è che una velocità di output di 39 token al secondo rende un'esecuzione agentica lunga abbastanza lenta da contare, e un'esecuzione lenta è un'esecuzione che può andare in timeout. Failover automatico tra provider significa che un lavoro lungo può essere instradato verso qualunque modello sia effettivamente disponibile senza che quella velocità diventi un singolo punto di guasto, e il DSL di routing esprime la scelta del modello come una regola all'interno della chiamata anziché come una migrazione — il che qui conta, perché la risposta corretta per questa coppia dipende dal fatto che il compito sia avido di token o sensibile alla latenza, e questa è una proprietà della richiesta, non del trimestre.

La regola di decisione

• Coding agentico a budget fisso — GPT-6 Sol. Capacità di livello sull'indice di coding neutrale, a circa un terzo del costo per attività, perché ci arriva con un terzo dei token.

• Attività a lungo orizzonte in cui la durata dell'esecuzione è il punto — Grok 4.7. Il rilascio è stato addestrato specificamente per lavori di più ore, e i numeri del fornitore su SWE-Marathon e CursorBench vanno esattamente in quella direzione.

• Volume sensibile alla latenza — nessuno dei due, stando ai dati attuali. Il costo per attività di Sol è il dato migliore, ma i 39 token al secondo misurati di Grok 4.7 sono un vero vincolo per qualsiasi cosa interattiva.

• Carichi di lavoro con contesti lunghi prevalentemente in cache — GPT-6 Sol, sulla linea di lettura della cache anziché su quella di output. A $0,20 contro $0,50 per milione di token in cache, e con una finestra grande il doppio, l'argomento si rafforza quanto più il tuo prompt è stabile.

• Se il tuo confronto è stato costruito sul listino per token — ricostruiscilo dal costo per attività. 6,00 $ rispetto a 10,00 $ di output è la coppia di numeri meno informativa di questo articolo, ed è la coppia con cui apre ogni pagina esistente.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno