
GPT-6.1 Sol vs Grok 4.7: la tariffa di output più economica in circolazione, e la conversazione più costosa
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Grok 4.7, il successore di Grok 4.6 di xAI, è arrivato il 21 settembre 2026 a 2,00 $ per milione di token in input e 6,00 $ per milione di token in output. GPT-6.1 Sol, l'aggiornamento di fascia media di OpenAI, è arrivato otto giorni dopo, il 29 settembre, a 2,00 $ in input e 10,00 $ in output. Le tariffe di input sono identiche, quella di output è più economica del 40% su Grok 4.7, ed è qui che si ferma la maggior parte dei confronti. È il punto sbagliato in cui fermarsi, perché lo stesso comitato indipendente ha ormai misurato entrambi i modelli end to end: Grok 4.7 ha consumato circa 240 milioni di token in output per completare l'Artificial Analysis Intelligence Index; GPT-6.1 Sol ne ha consumati 67 milioni. Moltiplica la tariffa più economica per tre volte e mezzo il volume e il modello con il prezzo per token più basso costa 3,74 $ per attività completata contro 0,72 $.
Due modelli, a otto giorni di distanza, e un listino che si capovolge
Grok 4.7 è il modello di xAI più potente per la programmazione e il lavoro basato sulla conoscenza: una finestra di contesto di 500.000 token, fino a 450.000 token di output in una singola risposta secondo la scheda dello stesso fornitore, input di testo, immagini e file, e sforzo di ragionamento configurabile tra basso, medio (predefinito), alto e xhigh. xAI non ha divulgato un numero di parametri e il suo cutoff di pretraining è riportato a giugno 2026, con training supplementare fino ad agosto.
GPT-6.1 Sol è l'aggiornamento di un solo incremento di OpenAI del livello GPT-6 Sol, posizionato sotto GPT-6 Astra e sopra GPT-6 Luna: 1.050.000 token di contesto — circa il doppio di quello di Grok — con un tetto di output di 128.000 token che è circa un terzo di quello di Grok, una data di cutoff delle conoscenze al 30 aprile 2026 e gli stessi input di testo, immagini e file. La sua scala di ragionamento va da basso a massimo con un valore predefinito di medio, e non accetta più nessuno affatto.
Una riga per dimensione, entrambi i lati su ciascuna:
• Input — GPT-6.1 Sol $2,00 per 1M vs Grok 4.7 $2,00 per 1M; identico
• Output — GPT-6.1 Sol $10,00 per 1M vs Grok 4.7 $6,00 per 1M; Grok costa il 40% in meno
• Input in cache — GPT-6.1 Sol $0,10 per 1M vs Grok 4.7 $0,50 per 1M; Sol costa cinque volte meno, l'opposto di quanto implica la riga dell'output
• Finestra di contesto — 1.050.000 token vs 500.000
• Output massimo in una singola risposta — 128.000 token vs 450.000 dichiarati
• Scaglione per contesto lungo — prezzo ricalcolato per l'intera richiesta sopra 272.000 token di input con input e cache a 2× e output a 1,5× vs ogni tariffa raddoppiata sopra 200.000 token di input, anche per l'intera richiesta
• Sforzo di ragionamento — basso, medio (predefinito), alto, xhigh, max vs basso, medio (predefinito), alto, xhigh
• Pesi e parametri — chiusi, non divulgati vs chiusi, non divulgati; nessuno dei due fornisce un checkpoint
• Indice di intelligenza allo sforzo massimo pubblicato — GPT-6.1 Sol 51,8 a max vs Grok 4.7 46,4 a xhigh
• Costo per attività dell'indice, indipendente — $0,72 vs $3,74
• Token di output nell'esecuzione dell'indice — 67 milioni vs 240 milioni, rispetto a una mediana della classifica vicina a 81 milioni
Due righe in quell'elenco sono l'intero confronto. La tariffa di output di Grok 4.7 è effettivamente più bassa e la sua riga della cache è effettivamente cinque volte più alta; e ha generato tre volte e mezzo i token da misurare. Il listino tariffe, letto da solo, punta in una direzione. La misurazione punta in quella opposta, per un fattore di cinque.

Dove Grok 4.7 è davvero in vantaggio
Sarebbe disonesto presentare questo articolo come una disfatta, perché Grok 4.7 vince su valutazioni reali. Valutati fianco a fianco al massimo sforzo pubblicato su Artificial Analysis v4.3.2 — Grok a xhigh, Sol a max, una differenza di configurazione da tenere a mente per tutto il resto:
• GDPval-AA v2.1 — Grok 4.7 Elo 1715.4 vs GPT-6.1 Sol Elo 1575.1. Un vantaggio Elo di 140 punti nel lavoro cognitivo economicamente prezioso, e la più grande vittoria singola indipendente per il modello con il listino più economico.
• AutomationBench-AA — Grok 4.7 0.6556 vs GPT-6.1 Sol 0.6487. Di fatto un pareggio, nominalmente a favore di Grok.
• SciCode — Grok 4.7 0.5741 vs GPT-6.1 Sol 0.5417. Un vantaggio di 3.2 punti nella programmazione scientifica.
• Terminal-Bench 4.0 — Grok 4.7 0.2576 vs GPT-6.1 Sol 0.5606. Un deficit di 30 punti, e il divario più ampio del confronto.
• Humanity's Last Exam — Grok 4.7 0.4314 vs GPT-6.1 Sol 0.5292.
• AA-LCR v1.1, ragionamento su contesto lungo — Grok 4.7 0.7667 vs GPT-6.1 Sol 0.83.
• AA-Omniscience — Grok 4.7 32.0 vs GPT-6.1 Sol 41.5.
• GDP.pdf — Grok 4.7 0.20 vs GPT-6.1 Sol 0.31.
• CritPt — Grok 4.7 0.1771 vs GPT-6.1 Sol 0.3171.
Tre delle nove valutazioni vanno a Grok 4.7 o finiscono in parità, compresa quella con cui è più difficile discutere: GDPval-AA è progettato per attribuire un prezzo al lavoro professionale economicamente prezioso, e un vantaggio Elo di 140 punti non è rumore. Se il tuo carico di lavoro è del tipo che GDPval è stato creato per rappresentare — analisi ad alta intensità documentale, deliverable professionali, decisioni di giudizio con una risposta corretta — il modello con il listino più economico è anche il modello migliore sulla classifica neutrale, e la penalità sul costo per attività è il prezzo che paghi per averlo.
I numeri di lancio di xAI sono elevati e, come tutte le cifre di lancio dei fornitori, non replicati. CursorBench 4.0 al 46,3% in xhigh contro il 40,4% di Grok 4.6; Terminal-Bench 4.0 al 38,0% contro il 20,3%, il maggiore incremento singolo dichiarato nella release; DeepSWE v1.1 al 71,0% in high contro il 65,2%; EEBench al 64,0% contro il 53,0%. Questi sono l'harness di xAI, le impostazioni di xAI, il reporting di xAI — e si noti che il dato del 38,0% su Terminal-Bench 4.0 si confronta con lo 0,2576 della classifica indipendente per lo stesso modello sullo stesso benchmark, ovvero il tipo di discrepanza che ci si deve aspettare tra una configurazione messa a punto da un fornitore e una prova neutrale a sforzo massimo.
I dati di OpenAI per GPT-6.1 Sol meritano lo stesso sconto e hanno lo stesso punto debole. L'unico numero in questo confronto che nessuno dei due fornitori ha prodotto è il costo per attività completata, perché è calcolato dal consumo misurato di token anziché da una tabella di punteggi. È questo il dato che sopravvive.
Perché 240 milioni di token lo decidono
Artificial Analysis descrive la verbosità di Grok 4.7 nel proprio riepilogo, e il conteggio dei token alla base dell'esecuzione dell'indice è la prova: 240 milioni di token di output contro una mediana della classifica vicina a 81 milioni, circa tre volte quello che produce un modello tipico sulla stessa suite. I 67 milioni di GPT-6.1 Sol si collocano ben al di sotto della mediana. Mettendo insieme i due rapporti — 3,6× il volume a 0,6× il prezzo — la tariffa di output più economica acquista più token anziché una bolletta più piccola, che è esattamente l'aspetto di una differenza di costo per attività di 3,74 $ contro 0,72 $.
La memorizzazione nella cache cambia l'entità dell'effetto ma non la sua direzione, ed è questo il dettaglio che trae in inganno. L'input in cache di Grok 4.7 è di $0,50 per milione contro i $0,10 di Sol — cinque volte più caro sulla voce in cui risiedono le lunghe cronologie degli agenti e i prompt di sistema ripetuti. Un carico di lavoro dominato dalla rilettura di un ampio prefisso stabile trova quindi i due modelli più vicini di quanto $6 contro $10 suggerisca, e, una volta applicata in aggiunta la verbosità di Grok, più distanti di quanto suggeriscano le tariffe di input. La voce della cache e quella dei token puntano qui nella stessa direzione, il che è insolito e rende questo abbinamento più lineare di quanto lascino intendere i listini.
Le clausole per il contesto lungo meritano di essere prezzate separatamente perché si attivano in punti diversi. GPT-6.1 Sol riprezza un'intera richiesta oltre i 272.000 token di input; Grok 4.7 fa lo stesso oltre i 200.000. Su una chiamata da 250.000 token, Grok è già raddoppiato — 4,00 $ e 12,00 $ con una lettura della cache da 1,00 $ — mentre Sol è ancora alle sue tariffe standard di 2,00 $ e 10,00 $. Tra i 200.000 e i 272.000 token, il modello dal listino più economico è quello più costoso, e con un ampio margine, e quella fascia è comune nel lavoro sui documenti.
Dove Grok vince davvero sulla struttura anziché sul punteggio è il tetto di output. Una risposta massima di 450.000 token contro i 128.000 di Sol è una categoria diversa di artefatto: un intero codebase generato, una lunga trascrizione, una sintesi lunga quanto un libro in una sola chiamata. Se oggi stai raggiungendo i limiti di output, quella riga decide il confronto e niente dell'aritmetica dei costi di cui sopra si applica — non puoi comprare a nessun prezzo una capacità che l'altro modello non ha.
Entrambi sono su un unico tasto, che è la parte utile
Grok 4.7 è disponibile su OrcaRouter al prezzo di listino di xAI stesso — $2,00 e $6,00 per milione di token con una lettura cache a $0,50 e lo scatto a 200.000 token a $4,00 e $12,00 passati esattamente come li elenca xAI — e GPT-6.1 Sol è approdato sulle nostre rotte il giorno del rilascio al prezzo di OpenAI, $2,00 e $10,00 con input in cache a $0,10 e lo scatto a 272.000 token invariato. Non viene aggiunto nulla a nessuno dei due: la piattaforma trasferisce il prezzo di listino del fornitore anziché applicare un ricarico, il che significa che un taglio di prezzo del fornitore da entrambe le parti è attivo qui lo stesso giorno in cui è attivo lì, senza una seconda fattura e senza un rivenditore in mezzo.

Per questa particolare coppia, vale più della comodità. I due modelli non concordano su ciò in cui sono bravi — Grok 4.7 è in testa nell'Elo del lavoro professionale e nella programmazione scientifica, GPT-6.1 Sol è in testa nell'esecuzione da terminale, nell'affidabilità fattuale e nel recupero su contesti lunghi — e il confine tra questi carichi di lavoro è visibile nel tuo stesso traffico prima che in un benchmark. Inviare richieste con la forma di GDPval da una parte ed esecuzioni di agenti a lungo orizzonte dall'altra, dietro un unico endpoint, con failover automatico su entrambi e una regola di routing che modifichi nella configurazione anziché in un deployment, è un modo più economico per trovare quel confine rispetto a un progetto di valutazione. La fusione di modelli, in cui un panel di modelli risponde insieme, è l'altra opzione offerta dalla piattaforma se preferisci non scegliere affatto richiesta per richiesta.

La chiamata
• Lavoro agentico e da terminale con output lungo, cicli con prefisso in cache — GPT-6.1 Sol. Trenta punti su Terminal-Bench 4.0, una riga di cache cinque volte più economica e un quinto del costo per attività completata.
• Lavoro professionale basato sulla conoscenza, analisi documentale, compiti di giudizio — Grok 4.7 in virtù di un vantaggio Elo di 140 punti in GDPval-AA, con il conto dei token messo a budget anziché dato per scontato.
• Programmazione scientifica — Grok 4.7, di stretta misura, nello split SciCode della classifica. Verificalo sulla tua suite; 3,2 punti rientrano nell'intervallo che un diverso insieme di prompt può spostare.
• Risposte singole superiori a 128.000 token di output — Grok 4.7, e non c'è aritmetica che possa sostituirsi a questo.
• Richieste tra 200.000 e 272.000 token di input — GPT-6.1 Sol, perché Grok 4.7 ha già raddoppiato l'intera sua richiesta e Sol no.
• La conversazione più economica possibile — nessuno dei due. Entrambi sono modelli dal prezzo di frontiera con appetiti di token di frontiera; il confronto riguarda quale dei due completa il tuo compito, non quale sia economico in astratto.
• Se un confronto finisce con "Grok costa meno per token" — è finito un passo troppo presto. Il passo successivo è il conteggio dei token, ed è 240 milioni contro 67.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
