
Grok 4.7 vs Grok 4.6: stesso prezzo di $2/$6, un modello diverso sotto la superficie
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 1009 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 195 tok/s
- OrcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
SpaceXAI ha rilasciato Grok 4.7 il 21 settembre 2026, e la prima cosa che vale la pena notare è ciò che non è cambiato: il prezzo. Grok 4.7 costa 2 $ per milione di token di input e 6 $ per milione di token di output, esattamente quanto Grok 4.6 costa da quando è stato lanciato il 12 agosto 2026. Stesso listino prezzi, stessa finestra di contesto da 500.000 token, stesso input testo e immagini — eppure i due modelli non sono vicini nelle valutazioni che contano per il lavoro agentico. Secondo i numeri pubblicati dalla stessa SpaceXAI, Grok 4.7 quasi raddoppia Grok 4.6 su Terminal-Bench 4.0, 38,0% contro 20,3%. Questa è l'intera dinamica di questo confronto: uno scambio generazionale a parità di prezzo in cui quasi tutto il guadagno si concentra in un unico punto, e le parti di Grok 4.6 che infastidivano i team di produzione sono ancora lì.
Che cosa è cambiato davvero tra i due modelli?
La descrizione che SpaceXAI stessa dà del rilascio è limitata, e vale la pena citarne la forma anziché gli aggettivi. Grok 4.7 è costruito su un modello di base più grande rispetto a Grok 4.6, ed è stato sottoposto a una sessione di apprendimento per rinforzo più lunga, mirata a compiti che «possono richiedere ore per essere completati». L'azienda afferma che quella sessione ha affinato tre cose: l'autoverifica, la gestione di contesti lunghi e il comportamento all'interno dell'ambiente Grok Bot. Non si avanza alcuna affermazione su una nuova architettura, una nuova modalità o uno stack di servizio diverso.
Quell'inquadramento conta perché predice dove emergono i guadagni nei benchmark, e questi emergono esattamente lì. Un passaggio RL più lungo su compiti difficili di più ore sposta il lavoro su terminale e repository molto più di quanto sposti un quiz di conoscenza. Se speravi che Grok 4.7 fosse un modello più ampio di Grok 4.6, le note di rilascio dicono il contrario: è la stessa forma di modello, addestrata ulteriormente verso il lato difficile del lavoro agentico.
La storia dei parametri è l'unico elemento di tutto questo che non è una divulgazione da parte del fornitore. Musk ha dichiarato all'inizio di settembre che Grok 4.7 conta all'incirca 2,1 trilioni di parametri rispetto agli 1,5 trilioni di Grok 4.6, un aumento del 40%, e da allora quella cifra è stata ripetuta ovunque. Non è mai comparsa su una scheda tecnica di SpaceXAI. Considerala un'affermazione ampiamente riportata sul modello di base, non una specifica confermata — e nota che i conteggi dei parametri dicono ben poco sul costo di servizio o sulle capacità quando l'architettura è sparsa, come lo è quella della linea Grok.
Il divario rispetto al benchmark, con l'etichetta di provenienza allegata
Ogni dato in questa sezione proviene dal materiale di lancio di SpaceXAI. Nessuno di essi è stato riprodotto in modo indipendente al momento della stesura, e il modo onesto di leggerlo è come un insieme di affermazioni che risulta insolitamente specifico — il che lo rende verificabile in seguito, ma non lo rende verificato ora.
• Terminal-Bench 4.0 — Grok 4.7 38,0% (riportato dal fornitore) vs Grok 4.6 20,3%. Il delta più ampio in assoluto del rilascio, e quello che corrisponde alla dichiarazione "RL più lungo su compiti più difficili".
• CursorBench 4.0 — Grok 4.7 46,3% (riportato dal fornitore) vs Grok 4.6 40,4%. Un guadagno reale, ma modesto — meno di sei punti, su un benchmark più vicino al lavoro quotidiano con l'editor che a sessioni autonome da terminale.
• DeepSWE v1.1 — Grok 4.7 71,0% con elevato sforzo di ragionamento (dichiarato dal fornitore) rispetto a Grok 4.6 65,2%. Ancora un miglioramento solido ma non spettacolare.
• EEBench — Grok 4.7 64,0% (dichiarato dal fornitore). Non è stato pubblicato alcun dato di Grok 4.6 a corredo, quindi questo non dice nulla sull'aggiornamento.
• AA-Briefcase v1.1 — Grok 4.7 a 1.657 Elo (dichiarato dal fornitore), sulla valutazione del lavoro intellettuale professionale.
Leggi la lista come un insieme e il pattern è coerente: Grok 4.7 è sensibilmente migliore dove il compito è lungo e agentico, e marginalmente migliore dove il compito è breve. Il balzo su Terminal-Bench è all'incirca un raddoppio; i guadagni sul lavoro con l'editor sono percentuali a una cifra. Se il tuo carico di lavoro è a forma di autocompletamento, stai pagando gli stessi $2/$6 per un piccolo miglioramento. Se il tuo carico di lavoro è "esegui per due ore e poi torna," il rilascio è rivolto direttamente a te.
Cosa dice finora la misurazione indipendente
Esiste un numero indipendente, e vale la pena affermarlo con attenzione perché è facile interpretarlo male. Artificial Analysis assegna a Grok 4.7 un punteggio di 46 sul suo Intelligence Index, versione v4.3.2, classificandolo al 16° posto su 655 modelli nella classifica. Grok 4.6 si colloca a 44 sulla stessa scala. Un divario di due punti su un indice composito non è il raddoppio che Terminal-Bench mostra, e questa discrepanza è informativa anziché contraddittoria: l'indice combina ragionamento, conoscenza, matematica e programmazione, quindi un grande guadagno in una singola sezione agentica viene diluito da tutto ciò che il modello non ha modificato.
Due ulteriori dettagli dalla stessa pagina sono più utili del punteggio principale. In primo luogo, Grok 4.7 ha generato 240 milioni di token di output durante l'esecuzione dell'indice, rispetto a una mediana di 92 milioni — è un ragionatore prolisso, e con una tariffa di output di $6 per milione quella verbosità è una voce di costo. In secondo luogo, il composito dell'indice lo colloca tra i modelli più forti nella sua fascia di prezzo, che è il confronto che conta davvero per un acquirente. Artificial Analysis non ha pubblicato un prezzo compilato per Grok 4.7 nella pagina del modello, quindi non prendere da lì il suo dato di costo per attività; usa il $2/$6 del fornitore.

Il precipizio dei prezzi che nessuno dei due modelli ha risolto
Ecco la parte del listino prezzi di Grok 4.6 che i team di produzione hanno imparato a odiare, e Grok 4.7 non l'ha cambiata. Sotto i 200.000 token di input la tariffa è di 2 $ in input e 6 $ in output. Al di sopra, l'intera richiesta viene ritariffata a 4 $ in input e 12 $ in output. Non i token in eccesso — l'intera richiesta. Una chiamata da 210.000 token costa il doppio di una chiamata da 199.000 token, per 11.000 token in più.
Con una finestra di contesto di 500.000 token su entrambi i modelli, è facile cadere da quel precipizio. Le esecuzioni di agenti a contesto lungo e i prompt su interi repository sono esattamente i carichi di lavoro per cui Grok 4.7 è stato ottimizzato, il che significa che il miglior caso d'uso del modello è anche quello più probabile che faccia scattare il raddoppio. Se stai spostando il lavoro su Grok 4.7 perché gestisce meglio le lunghe sessioni agentiche, metti in budget il nuovo prezzo prima di spostarlo, non dopo.
C'è anche un livello di velocità di cui tenere conto. SpaceXAI offre una variante veloce di Grok 4.7 che raddoppia la velocità di output e raddoppia il prezzo indicato. È uno scambio legittimo per la programmazione interattiva, e svantaggioso per il lavoro in batch — lo stesso compito, alla stessa qualità, costa il doppio per un risparmio di tempo reale che nessuno sta guardando.
Migrare da Grok 4.6 senza una riscrittura
La buona notizia pratica è che si tratta di un cambio di modello, non di una migrazione di piattaforma. Entrambi i modelli accettano in input testo e immagini e restituiscono testo, entrambi usano gli stessi livelli di reasoning-effort da low a xhigh, e la forma della richiesta è quella che SpaceXAI serve dal Grok 4.5. Il codice che chiama Grok 4.6 con un parametro effort non necessita di ristrutturazione per chiamare Grok 4.7.
Dove lo scambio non è gratis è nella valutazione. I guadagni di Grok 4.7 sono concentrati nelle lunghe esecuzioni agentiche, quindi una suite di test costruita con prompt brevi a turno singolo non ti mostrerà quasi nulla: vedrai il miglioramento delle dimensioni di CursorBench e concluderai che l'aggiornamento non è valso lo sforzo, quando invece la sua ragion d'essere sta in attività che la tua suite non esercita mai. La misurazione che lo risolverebbe davvero è il completamento delle attività su lavoro multi-step: patch accettate, regressioni introdotte, chiamate agli strumenti per attività completata e quanto spesso un'esecuzione richiede un intervento umano. Sono questi gli assi verso cui puntano i numeri stessi del fornitore, ed è su questi che nessun benchmark pubblicato copre il tuo codebase.
La verbosità è la seconda cosa da misurare. Un modello che emette 240 milioni di token su un indice standard emetterà più token sul tuo carico di lavoro di quanti ne emettesse il suo predecessore, e a 6 $ per milione di token di output ciò può cancellare silenziosamente il valore di un aggiornamento allo stesso prezzo. Tieni traccia dei token di output per attività completata per una settimana prima di procedere.

Quale chiamare
La decisione è davvero semplice, il che è insolito per un confronto tra modelli. Grok 4.6 resta la scelta corretta per il traffico a turni brevi e sensibile ai costi: chat, classificazione, riassunto e assistenza al codice su scala di editor, dove i guadagni di Grok 4.7 sono modesti e la sua verbosità è una tassa. Grok 4.7 è la scelta corretta per il carico di lavoro per cui è stato creato — coding agentico a lungo orizzonte e lavoro da terminale, dove un'attività va avanti per ore e l'autoverifica è la differenza tra un lavoro finito e uno bloccato.
Eseguire entrambi non è un compromesso, qui è la risposta giusta, ed è economico da fare. Grok 4.6 è nel catalogo di OrcaRouter al prezzo di listino di SpaceXAI con 0% di ricarico passato direttamente, quindi la scheda tariffaria di $2/$6 qui sopra è quello che paghi — e poiché passiamo direttamente il prezzo di listino del fornitore invece di applicarvi un ricarico, qualsiasi variazione di prezzo del fornitore è attiva dalla nostra parte lo stesso giorno in cui viene introdotta. Una sola chiave API copre Grok 4.6 e oltre 200 altri modelli, quindi spostare il traffico tra loro in base al compito è una modifica di configurazione anziché un secondo contratto. Se vuoi provare Grok 4.7 su un percorso di produzione prima di fidarti, lo schema più sicuro è mantenere il fallback su Grok 4.6 — un modello che puoi instradare oggi — e lasciare che il failover automatico tra fornitori riporti la richiesta indietro quando il nuovo modello si comporta male.

Cosa guardare dopo
Due cose chiariranno questo confronto, e nessuna delle due si è ancora verificata. La prima è una riproduzione indipendente del dato di Terminal-Bench 4.0: il 38% è un balzo abbastanza grande da spingere qualcuno a rieseguire il test, e se regge, l'argomento a favore di Grok 4.7 nelle pipeline agentiche è solido nel merito, non nel marketing. La seconda è il resto della roadmap di Grok: SpaceXAI ha pubblicamente collocato Grok 4.8, Grok 4.9 e Grok 5 dopo questa release, e la vita stessa di Grok 4.6 è durata circa cinque settimane. Scommettere su Grok 4.7 come presupposto di piattaforma a lungo termine significherebbe ripetere l'errore che i team hanno commesso con Grok 4.5.
Per ora, l'aggiornamento allo stesso prezzo è reale e la direzione di marcia è chiara. Il dato da tenere a mente è che con $2/$6 hai ottenuto un modello che raddoppia all'incirca nelle attività da terminale a lungo orizzonte e non si muove quasi per nulla altrove — e questa è un'affermazione specifica, utile e verificabile, non un salto generazionale.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
