Una hero card generata per un confronto tra GPT-6.1 Sol e Grok 4.7, con il titolo "40% in meno per token, 5,2 volte la spesa", con tre badge recanti "Output di Grok 4.7: $6,00 per 1M", "Output di GPT-6.1 Sol: $10,00 per 1M" e "Token di output nell'index run: 67M vs 240M", e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

GPT-6.1 Sol vs Grok 4.7: la tariffa di output più economica in circolazione, e la conversazione più costosa

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Grok 4.7, il successore di Grok 4.6 di x​AI, è arrivato il 21 settembre 2026 a 2,00 $ per milione di token in input e 6,00 $ per milione di token in output. GPT-6.1 Sol, l'aggiornamento di fascia media di Open​AI, è arrivato otto giorni dopo, il 29 settembre, a 2,00 $ in input e 10,00 $ in output. Le tariffe di input sono identiche, quella di output è più economica del 40% su Grok 4.7, ed è qui che si ferma la maggior parte dei confronti. È il punto sbagliato in cui fermarsi, perché lo stesso comitato indipendente ha ormai misurato entrambi i modelli end to end: Grok 4.7 ha consumato circa 240 milioni di token in output per completare l'Artificial Analysis Intelligence Index; GPT-6.1 Sol ne ha consumati 67 milioni. Moltiplica la tariffa più economica per tre volte e mezzo il volume e il modello con il prezzo per token più basso costa 3,74 $ per attività completata contro 0,72 $.

Due modelli, a otto giorni di distanza, e un listino che si capovolge

Grok 4.7 è il modello di xAI più potente per la programmazione e il lavoro basato sulla conoscenza: una finestra di contesto di 500.000 token, fino a 450.000 token di output in una singola risposta secondo la scheda dello stesso fornitore, input di testo, immagini e file, e sforzo di ragionamento configurabile tra basso, medio (predefinito), alto e xhigh. xAI non ha divulgato un numero di parametri e il suo cutoff di pretraining è riportato a giugno 2026, con training supplementare fino ad agosto.

GPT-6.1 Sol è l'aggiornamento di un solo incremento di OpenAI del livello GPT-6 Sol, posizionato sotto GPT-6 Astra e sopra GPT-6 Luna: 1.050.000 token di contesto — circa il doppio di quello di Grok — con un tetto di output di 128.000 token che è circa un terzo di quello di Grok, una data di cutoff delle conoscenze al 30 aprile 2026 e gli stessi input di testo, immagini e file. La sua scala di ragionamento va da basso a massimo con un valore predefinito di medio, e non accetta più nessuno affatto.

Una riga per dimensione, entrambi i lati su ciascuna:

• Input — GPT-6.1 Sol $2,00 per 1M vs Grok 4.7 $2,00 per 1M; identico
• Output — GPT-6.1 Sol $10,00 per 1M vs Grok 4.7 $6,00 per 1M; Grok costa il 40% in meno
• Input in cache — GPT-6.1 Sol $0,10 per 1M vs Grok 4.7 $0,50 per 1M; Sol costa cinque volte meno, l'opposto di quanto implica la riga dell'output
• Finestra di contesto — 1.050.000 token vs 500.000
• Output massimo in una singola risposta — 128.000 token vs 450.000 dichiarati
• Scaglione per contesto lungo — prezzo ricalcolato per l'intera richiesta sopra 272.000 token di input con input e cache a 2× e output a 1,5× vs ogni tariffa raddoppiata sopra 200.000 token di input, anche per l'intera richiesta
• Sforzo di ragionamento — basso, medio (predefinito), alto, xhigh, max vs basso, medio (predefinito), alto, xhigh
• Pesi e parametri — chiusi, non divulgati vs chiusi, non divulgati; nessuno dei due fornisce un checkpoint
• Indice di intelligenza allo sforzo massimo pubblicato — GPT-6.1 Sol 51,8 a max vs Grok 4.7 46,4 a xhigh
• Costo per attività dell'indice, indipendente — $0,72 vs $3,74
• Token di output nell'esecuzione dell'indice — 67 milioni vs 240 milioni, rispetto a una mediana della classifica vicina a 81 milioni

Due righe in quell'elenco sono l'intero confronto. La tariffa di output di Grok 4.7 è effettivamente più bassa e la sua riga della cache è effettivamente cinque volte più alta; e ha generato tre volte e mezzo i token da misurare. Il listino tariffe, letto da solo, punta in una direzione. La misurazione punta in quella opposta, per un fattore di cinque.

A generated hero card for a GPT-6.1 Sol versus Grok 4.7 comparison, headed '40% cheaper per token, 5.2 times the bill', with two badges reading 'Grok 4.7 output: $6.00 per 1M' and 'GPT-6.1 Sol output: $10.00 per 1M', a footer reading 'Independent figures per Artificial Analysis v4.3.2; Grok at xhigh, Sol at max; AI-generated card', and the OrcaRouter logo in the bottom-right corner.

Dove Grok 4.7 è davvero in vantaggio

Sarebbe disonesto presentare questo articolo come una disfatta, perché Grok 4.7 vince su valutazioni reali. Valutati fianco a fianco al massimo sforzo pubblicato su Artificial Analysis v4.3.2 — Grok a xhigh, Sol a max, una differenza di configurazione da tenere a mente per tutto il resto:

• GDPval-AA v2.1 — Grok 4.7 Elo 1715.4 vs GPT-6.1 Sol Elo 1575.1. Un vantaggio Elo di 140 punti nel lavoro cognitivo economicamente prezioso, e la più grande vittoria singola indipendente per il modello con il listino più economico.
• AutomationBench-AA — Grok 4.7 0.6556 vs GPT-6.1 Sol 0.6487. Di fatto un pareggio, nominalmente a favore di Grok.
• SciCode — Grok 4.7 0.5741 vs GPT-6.1 Sol 0.5417. Un vantaggio di 3.2 punti nella programmazione scientifica.
• Terminal-Bench 4.0 — Grok 4.7 0.2576 vs GPT-6.1 Sol 0.5606. Un deficit di 30 punti, e il divario più ampio del confronto.
• Humanity's Last Exam — Grok 4.7 0.4314 vs GPT-6.1 Sol 0.5292.
• AA-LCR v1.1, ragionamento su contesto lungo — Grok 4.7 0.7667 vs GPT-6.1 Sol 0.83.
• AA-Omniscience — Grok 4.7 32.0 vs GPT-6.1 Sol 41.5.
• GDP.pdf — Grok 4.7 0.20 vs GPT-6.1 Sol 0.31.
• CritPt — Grok 4.7 0.1771 vs GPT-6.1 Sol 0.3171.

Tre delle nove valutazioni vanno a Grok 4.7 o finiscono in parità, compresa quella con cui è più difficile discutere: GDPval-AA è progettato per attribuire un prezzo al lavoro professionale economicamente prezioso, e un vantaggio Elo di 140 punti non è rumore. Se il tuo carico di lavoro è del tipo che GDPval è stato creato per rappresentare — analisi ad alta intensità documentale, deliverable professionali, decisioni di giudizio con una risposta corretta — il modello con il listino più economico è anche il modello migliore sulla classifica neutrale, e la penalità sul costo per attività è il prezzo che paghi per averlo.

I numeri di lancio di xAI sono elevati e, come tutte le cifre di lancio dei fornitori, non replicati. CursorBench 4.0 al 46,3% in xhigh contro il 40,4% di Grok 4.6; Terminal-Bench 4.0 al 38,0% contro il 20,3%, il maggiore incremento singolo dichiarato nella release; DeepSWE v1.1 al 71,0% in high contro il 65,2%; EEBench al 64,0% contro il 53,0%. Questi sono l'harness di xAI, le impostazioni di xAI, il reporting di xAI — e si noti che il dato del 38,0% su Terminal-Bench 4.0 si confronta con lo 0,2576 della classifica indipendente per lo stesso modello sullo stesso benchmark, ovvero il tipo di discrepanza che ci si deve aspettare tra una configurazione messa a punto da un fornitore e una prova neutrale a sforzo massimo.

I dati di OpenAI per GPT-6.1 Sol meritano lo stesso sconto e hanno lo stesso punto debole. L'unico numero in questo confronto che nessuno dei due fornitori ha prodotto è il costo per attività completata, perché è calcolato dal consumo misurato di token anziché da una tabella di punteggi. È questo il dato che sopravvive.

Perché 240 milioni di token lo decidono

Artificial Analysis descrive la verbosità di Grok 4.7 nel proprio riepilogo, e il conteggio dei token alla base dell'esecuzione dell'indice è la prova: 240 milioni di token di output contro una mediana della classifica vicina a 81 milioni, circa tre volte quello che produce un modello tipico sulla stessa suite. I 67 milioni di GPT-6.1 Sol si collocano ben al di sotto della mediana. Mettendo insieme i due rapporti — 3,6× il volume a 0,6× il prezzo — la tariffa di output più economica acquista più token anziché una bolletta più piccola, che è esattamente l'aspetto di una differenza di costo per attività di 3,74 $ contro 0,72 $.

La memorizzazione nella cache cambia l'entità dell'effetto ma non la sua direzione, ed è questo il dettaglio che trae in inganno. L'input in cache di Grok 4.7 è di $0,50 per milione contro i $0,10 di Sol — cinque volte più caro sulla voce in cui risiedono le lunghe cronologie degli agenti e i prompt di sistema ripetuti. Un carico di lavoro dominato dalla rilettura di un ampio prefisso stabile trova quindi i due modelli più vicini di quanto $6 contro $10 suggerisca, e, una volta applicata in aggiunta la verbosità di Grok, più distanti di quanto suggeriscano le tariffe di input. La voce della cache e quella dei token puntano qui nella stessa direzione, il che è insolito e rende questo abbinamento più lineare di quanto lascino intendere i listini.

Le clausole per il contesto lungo meritano di essere prezzate separatamente perché si attivano in punti diversi. GPT-6.1 Sol riprezza un'intera richiesta oltre i 272.000 token di input; Grok 4.7 fa lo stesso oltre i 200.000. Su una chiamata da 250.000 token, Grok è già raddoppiato — 4,00 $ e 12,00 $ con una lettura della cache da 1,00 $ — mentre Sol è ancora alle sue tariffe standard di 2,00 $ e 10,00 $. Tra i 200.000 e i 272.000 token, il modello dal listino più economico è quello più costoso, e con un ampio margine, e quella fascia è comune nel lavoro sui documenti.

Dove Grok vince davvero sulla struttura anziché sul punteggio è il tetto di output. Una risposta massima di 450.000 token contro i 128.000 di Sol è una categoria diversa di artefatto: un intero codebase generato, una lunga trascrizione, una sintesi lunga quanto un libro in una sola chiamata. Se oggi stai raggiungendo i limiti di output, quella riga decide il confronto e niente dell'aritmetica dei costi di cui sopra si applica — non puoi comprare a nessun prezzo una capacità che l'altro modello non ha.

Entrambi sono su un unico tasto, che è la parte utile

Grok 4.7 è disponibile su OrcaRouter al prezzo di listino di x​AI stesso — $2,00 e $6,00 per milione di token con una lettura cache a $0,50 e lo scatto a 200.000 token a $4,00 e $12,00 passati esattamente come li elenca x​AI — e GPT-6.1 Sol è approdato sulle nostre rotte il giorno del rilascio al prezzo di Open​AI, $2,00 e $10,00 con input in cache a $0,10 e lo scatto a 272.000 token invariato. Non viene aggiunto nulla a nessuno dei due: la piattaforma trasferisce il prezzo di listino del fornitore anziché applicare un ricarico, il che significa che un taglio di prezzo del fornitore da entrambe le parti è attivo qui lo stesso giorno in cui è attivo lì, senza una seconda fattura e senza un rivenditore in mezzo.

A screenshot of the OrcaRouter model page for grok/grok-4.7, showing the listing dated 2026-09-21, the model described as SpaceXAI's flagship for coding, agentic tasks and knowledge work, a 500K-token context with up to 450K output tokens, text, image and file input, and the list price of $2.00 input and $6.00 output per million tokens with a 4.03 s median time to first token.

Per questa particolare coppia, vale più della comodità. I due modelli non concordano su ciò in cui sono bravi — Grok 4.7 è in testa nell'Elo del lavoro professionale e nella programmazione scientifica, GPT-6.1 Sol è in testa nell'esecuzione da terminale, nell'affidabilità fattuale e nel recupero su contesti lunghi — e il confine tra questi carichi di lavoro è visibile nel tuo stesso traffico prima che in un benchmark. Inviare richieste con la forma di GDPval da una parte ed esecuzioni di agenti a lungo orizzonte dall'altra, dietro un unico endpoint, con failover automatico su entrambi e una regola di routing che modifichi nella configurazione anziché in un deployment, è un modo più economico per trovare quel confine rispetto a un progetto di valutazione. La fusione di modelli, in cui un panel di modelli risponde insieme, è l'altra opzione offerta dalla piattaforma se preferisci non scegliere affatto richiesta per richiesta.

A screenshot of xAI's Grok 4.7 developer documentation, showing the model ID grok-4.7, the description 'SpaceXAI's frontier model for coding, agentic tasks, and knowledge work', text and image to text modalities, a 500,000-token context window, and pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens.

La chiamata

• Lavoro agentico e da terminale con output lungo, cicli con prefisso in cache — GPT-6.1 Sol. Trenta punti su Terminal-Bench 4.0, una riga di cache cinque volte più economica e un quinto del costo per attività completata.
• Lavoro professionale basato sulla conoscenza, analisi documentale, compiti di giudizio — Grok 4.7 in virtù di un vantaggio Elo di 140 punti in GDPval-AA, con il conto dei token messo a budget anziché dato per scontato.
• Programmazione scientifica — Grok 4.7, di stretta misura, nello split SciCode della classifica. Verificalo sulla tua suite; 3,2 punti rientrano nell'intervallo che un diverso insieme di prompt può spostare.
• Risposte singole superiori a 128.000 token di output — Grok 4.7, e non c'è aritmetica che possa sostituirsi a questo.
• Richieste tra 200.000 e 272.000 token di input — GPT-6.1 Sol, perché Grok 4.7 ha già raddoppiato l'intera sua richiesta e Sol no.
• La conversazione più economica possibile — nessuno dei due. Entrambi sono modelli dal prezzo di frontiera con appetiti di token di frontiera; il confronto riguarda quale dei due completa il tuo compito, non quale sia economico in astratto.
• Se un confronto finisce con "Grok costa meno per token" — è finito un passo troppo presto. Il passo successivo è il conteggio dei token, ed è 240 milioni contro 67.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno