
Grok 4.7 ottiene 46 punti sull'Artificial Analysis Intelligence Index e porta SpaceXAI tra i primi quattro
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 217 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 51 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Grok 4.7 ottiene 46 punti sull'Artificial Analysis Intelligence Index e porta SpaceXAI tra i primi quattro
Grok 4.7 è uscito. SpaceXAI lo ha rilasciato lunedì 21 settembre 2026 — allo stesso prezzo di 2 $ per milione di token di input e 6 $ per milione di token di output di Grok 4.6, con la stessa finestra di contesto da 500.000 token, una data di cutoff delle conoscenze più recente e un nuovo livello di ragionamento massimo. È attivo in Cursor e Grok Build, tramite l'API proprietaria del fornitore, e tramite harness di coding, router di modelli e piattaforme cloud di terze parti. Grok 4.5, dell'8 luglio, resta sotto di esso come opzione più economica, e i modelli che deve ancora battere sono invariati: Claude Fable 5.1, Claude Opus 5 e GPT-5.6 Sol si trovano tutti al di sopra nell'Intelligence Index v4.3.2 di Artificial Analysis, dove il primo punteggio indipendente di Grok 4.7 — 46 — si colloca due punti sopra Grok 4.6 e sette sotto Claude Fable 5.1. Nella stessa classifica AA-Briefcase dello stesso valutatore, per il lavoro di conoscenza a lungo termine, si piazza quarto, dietro tre voci Claude e davanti a Claude Opus 5 con sforzo xhigh, a circa la metà del costo per attività di Claude Opus 5 — il primo risultato indipendente di questa release che si legge come una vittoria di prezzo-prestazioni anziché come un divario. Undici giorni dopo, il quadro si è ampliato ai margini anziché al centro: dal 1° ottobre viene distribuito all'interno delle app web e mobile di Grok, dove il selettore di modalità ora lo nomina nelle sue due voci più difficili, ed è elencato su OrcaRouter al prezzo di 2 $/6 $ di SpaceXAI stesso.
Questo è il lancio. I numeri più utili sono arrivati lo stesso giorno, dall'unico valutatore in questa storia che non è il fornitore: Artificial Analysis ha pubblicato la sua prima analisi indipendente su Grok 4.7, e si tratta di un risultato in tre parti — un 46 sull'Intelligence Index, che è solo due punti sopra Grok 4.6, un 56 sul Coding Agent Index, che è nove punti sopra, e un 1.657 Elo su AA-Briefcase, che è 111 punti sopra. Quei tre numeri puntano in direzioni diverse, e la differenza tra loro è la cosa più interessante di questo rilascio. Quello che segue è la specifica rilasciata, la tabella di benchmark del fornitore stesso con l'etichetta di cui ogni riga ha bisogno, e poi i punteggi indipendenti letti correttamente — compreso ciò che dicono sulla riserva di prontezza che SpaceXAI non ha mai affrontato.
Cosa ha rilasciato SpaceXAI il 21 settembre
Cominciamo dalle specifiche, perché sono insolitamente vicine a quelle del suo predecessore. Grok 4.7 ha esattamente lo stesso prezzo di Grok 4.6 — 2 $ per milione di token di input e 6 $ per milione di token di output al di sotto dei 200.000 token di input, che salgono a 4 $ in input e 12 $ in output una volta che una richiesta supera quella soglia, la stessa struttura introdotta da Grok 4.6. La finestra di contesto è di 500.000 token. Il knowledge cutoff è maggio 2026, tre mesi dopo il 1° febbraio 2026 di Grok 4.6. Lo sforzo di ragionamento si articola su quattro livelli — low, medium, high e xhigh — e i dati pubblicati sono riferiti a xhigh. Una variante veloce gira al doppio della velocità di output per il doppio del prezzo.
Alla base, xAI descrive tre cambiamenti anziché una nuova architettura. Il modello di base è più grande di quello di Grok 4.6. La sessione di apprendimento per rinforzo è stata più lunga e con un peso maggiore su compiti che richiedono molte ore per essere completati. E il modello è stato addestrato a verificare il proprio lavoro e a gestire meglio i contesti lunghi, inclusa una comprensione nativa dell'harness di Grok Bot. Il riassunto in una riga dell'azienda stessa è «due volte più veloce, a metà del prezzo dei modelli comparabili»: un'affermazione di posizionamento rispetto ai concorrenti più che una misurazione, e va letta come tale.
La disponibilità è stata ampia fin dal primo giorno e da allora si è ampliata due volte. Al lancio: Cursor e Grok Build, l'API dello stesso fornitore, harness di coding di terze parti, router di modelli e piattaforme cloud; la pagina Grok Build di SpaceXAI stessa ora dice apertamente di «iniziare a sviluppare con Grok 4.7». Il 28 settembre Amazon Web Services lo ha aggiunto ad Amazon Bedrock con la stessa finestra di contesto da 500.000 token e gli stessi quattro livelli di reasoning effort, serviti tramite profili di inferenza cross-Region, così il modello è ora raggiungibile attraverso il catalogo di un hyperscaler e non solo tramite l'API del fornitore. Poi, il 1° ottobre, ha iniziato il rollout all'interno delle app web e mobile consumer di Grok, e due giorni dopo è ancora lì. Quest'ultimo passo è insolitamente silenzioso: SpaceXAI ha annunciato il passo equivalente per Grok 4.5 con un post sul blog intitolato «Portare Grok 4.5 su iOS, Android, Web e X», e non ha pubblicato nulla per Grok 4.7, quindi il cambiamento è visibile nel prodotto anziché dichiarato. È lato server anziché distribuito come aggiornamento dell'app, come confermano le schede delle app: sia la scheda iOS sia quella Android di Grok si sono aggiornate il 1° ottobre — la build dell'App Store è 1.4.47, rilasciata quel giorno, e la sua nota di rilascio menziona solo «Miglioramenti a Chat, Voice e Imagine», mentre la scheda Play è stata aggiornata lo stesso giorno. La modifica viene distribuita dal backend anziché integrata in un binario. Poiché il rollout viene riportato anziché documentato, la portata precisa è più difficile da stabilire rispetto alla scheda Bedrock, che ha dietro di sé un post AWS datato, e le notizie riportate hanno già deviato: gli account che monitorano la situazione ora descrivono Grok 4.7 come il modello di base in tutte le modalità — Fast, Expert, Build e Heavy — un elenco che non corrisponde a ciò che grok.com serve effettivamente. Leggilo come un resoconto dei tracker stessi anziché come una descrizione del fornitore. Partner selezionati di cybersecurity ottengono accesso solo su invito alle capacità di red-team del modello.
Una precisazione a quanto riportato in questo articolo. Il numero di parametri che ha circolato per due mesi — circa 2,1 trilioni, circa il 40% in più rispetto agli 1,5 trilioni di Grok 4.6 — non compare ancora in nessuna scheda tecnica. xAI non ha pubblicato un numero di parametri per Grok 4.7, e Artificial Analysis indica la dimensione del modello come non divulgata. La cifra è sempre stata un'affermazione del fondatore, e il lancio non l'ha trasformata in una specifica.
La tabella dei benchmark è di xAI — ecco cosa non lo è
Ogni cifra nell'elenco seguente proviene dall'annuncio del fornitore, e nessuna di esse è stata riprodotta in modo indipendente. Leggile tenendo ben presente questa etichetta: sono i numeri di xAI sulle valutazioni scelte da xAI, pubblicati il giorno del rilascio, e la prima settimana di qualsiasi lancio è il momento in cui i benchmark dei fornitori sono meno affidabili. Anche le colonne di confronto sono quelle del fornitore — Grok 4.6 (high), GPT-5.6 Sol (max) e Claude Fable 5.1 (max), ciascuno eseguito al livello di impegno scelto dal fornitore.
• CursorBench 4.0 — Grok 4.7 46,3%, Grok 4.6 40,4%, GPT-5.6 Sol 41,7%, Claude Fable 5.1 51,8%. Dati dichiarati dai fornitori.
• DeepSWE v1.1 — Grok 4.7 71,0% con sforzo elevato, Grok 4.6 65,2%, GPT-5.6 Sol 72,7%, Claude Fable 5.1 70,0%. Dichiarati dai fornitori.
• Terminal-Bench 4.0 — Grok 4.7 37,6%, Grok 4.6 20,3%, GPT-5.6 Sol 37,3%, Claude Fable 5.1 57,9%. Dati dichiarati dal fornitore, e rivisti: la riga di Grok 4.7 riportava 38,0% nella tabella del giorno del lancio e oggi riporta 37,6% sulla pagina del fornitore.
• EEBench — Grok 4.7 64,0%, Grok 4.6 53,0%, GPT-5.6 Sol 39,4%, Claude Fable 5.1 56,4%. Dati dichiarati dal fornitore.
• Harvey Legal Agent — Grok 4.7 19,6%, Grok 4.6 15,8%, GPT-5.6 Sol 2,5%, Claude Fable 5.1 6,7%. Dichiarato dal fornitore.
• HealthBench Professional — Grok 4.7 56,7%, Grok 4.6 48,5%, GPT-5.6 Sol 60,5%, Claude Fable 5.1 62,1%. Dati dichiarati dal fornitore.
• AA Briefcase v1.1 — Grok 4.7 1.657, Grok 4.6 1.546, GPT-5.6 Sol 1.487, Claude Fable 5.1 1.678. Questa è l'unica riga della tabella che non è più soltanto del fornitore: la classifica AA-Briefcase di Artificial Analysis pubblica lo stesso 1.657 per Grok 4.7 con effort xhigh e 1.546 per Grok 4.6 con high. Le colonne di confronto restano comunque la scelta del fornitore in fatto di modelli e livelli di effort.
• GDPval Elo — Grok 4.7 1.695, Grok 4.6 1.605, GPT-6 Astra 1.542, Claude Fable 5.1 1.735. Dichiarati dal fornitore.
La lettura onesta di quella serie non è «Grok 4.7 vince». Supera Grok 4.6 su tutti e otto, che è il minimo che un successore ti deve. Rispetto al resto del campo è un bilancio misto: avanti rispetto a GPT-5.6 Sol su CursorBench, Terminal-Bench ed EEBench, indietro su DeepSWE; indietro rispetto a Claude Fable 5.1 su CursorBench, Terminal-Bench, HealthBench ed entrambe le misure in stile Elo, avanti su EEBench e sulla valutazione dell'agente legale Harvey. Illustra anche quanto di un risultato di benchmark dipenda dal livello di effort — il 71,0% di DeepSWE è un numero ottenuto con effort alto all'interno di una tabella altrimenti citata a xhigh.
La sicurezza è l'unico ambito in cui le dichiarazioni del fornitore sono insolitamente specifiche. xAI afferma che Grok 4.7 è stato costruito su uno stack di salvaguardie completamente nuovo e lo definisce il modello più forte che l'azienda abbia testato per i rifiuti e la resistenza al jailbreak. Sul benchmark di biosicurezza di LatchBio riporta il 62,4%; su HackerBench v0.3 riporta di aver lasciato passare il 3,3% dei prompt rischiosi a duplice uso, bloccando raramente attività di sicurezza legittime. Si tratta di valutazioni dichiarate dal fornitore sulla release del fornitore stesso, e nessuna terza parte le ha riprodotte.
I primi numeri in questo pezzo che non sono del fornitore sono i tre pubblicati da Artificial Analysis il 21 settembre, e sono in disaccordo tra loro in modo informativo. Sull'Intelligence Index, Grok 4.7 ottiene 46 con sforzo xhigh sulla scala v4.3.2 — 16º in quella classifica — contro 44 di Grok 4.6. Quel guadagno di due punti è, secondo Artificial Analysis, quanto basta per portare SpaceXAI tra i primi quattro laboratori dell'indice. Leggi la posizione con precisione: è un'affermazione sul miglior modello di un laboratorio, non su questo, e il modello in sé resta ancora quattro punti sotto i 50 di Claude Fable 5 e sette sotto i 53 condivisi da Claude Fable 5.1 e GPT-6 Astra. Un guadagno di due punti rientra anche nell'intervallo che si manifesta tra i livelli di sforzo dello stesso modello, il che ricorda che un successore che ottiene un punteggio superiore al predecessore non equivale a un successore che cambia ciò che è possibile. Un'ulteriore nota sulla lettura del numero: la versione della scala conta, perché Artificial Analysis ha riformulato il suo indice e i valori 61/62/63 che compaiono nella maggior parte della copertura di luglio e agosto appartengono alla scala ritirata precedente a settembre 2026 — non possono essere confrontati con questi.
Il Coding Agent Index è il secondo numero, ed è quello che si è mosso. Eseguito nell'harness Grok Build di SpaceXAI con sforzo xhigh, Grok 4.7 ottiene 56 contro il 47 di Grok 4.6 — nove punti, non due — che è quarto tra i modelli valutati nei loro harness nativi, dietro Claude Fable 5.1, GPT-6 Astra e Claude Opus 5, e davanti a GPT-5.6 Sol. L'indice è un composito a peso uguale di DeepSWE v1.1, Terminal-Bench 4.0 e SWE-Atlas-QnA su 303 attività, e tutte e tre le componenti sono migliorate: DeepSWE dal 65% al 73%, Terminal-Bench dal 18% al 33%, SWE-Atlas-QnA dal 58% al 63%. Questa è la prima prova indipendente che la correzione descritta da xAI — apprendimento per rinforzo più lungo ponderato verso compiti di più ore — abbia fatto qualcosa, ed è il numero che un team che sceglie un agente di codifica dovrebbe soppesare maggiormente, perché è misurato nell'harness con cui il modello viene effettivamente distribuito piuttosto che nella tabella del fornitore.
Il caveat è quanto costano i nove punti. L'esecuzione di Artificial Analysis ha generato 240 milioni di token di output sull'Intelligence Index, contro una mediana di 94 milioni tra i modelli che traccia — più del doppio — e ha stimato in $3,74 il costo di valutazione di un compito dell'Indice. A $6 per milione di token di output, la verbosità è la voce di costo che decide se un ciclo agentico è sostenibile, quindi un guadagno di nove punti pagato con più del doppio dell'output mediano è un vero scambio, non un aggiornamento gratuito. La stessa misurazione significa anche che i punteggi principali non dovrebbero essere letti come un unico verdetto: su base per token, il vantaggio di Grok 4.7 su Grok 4.6 è inferiore a quanto suggerisca il delta dell'indice, e sulle valutazioni di conoscenza generale che compongono l'Intelligence Index è quasi lo stesso modello con una bolletta sostanzialmente più alta. Il risultato di AA-Briefcase nella sezione successiva è l'eccezione a questo, ed è una grande eccezione.

Il secondo consiglio indipendente: AA-Briefcase, e cosa si ottiene con metà del costo per attività
Artificial Analysis ha pubblicato un terzo numero per Grok 4.7 lo stesso giorno, ed è quello che riguarda il lavoro intellettuale anziché il codice. Su AA-Briefcase — la sua classifica dedicata al lavoro intellettuale agentico a lungo orizzonte, costruita da quattro scenari progettuali plurisettimanali e 91 deliverable valutati — Grok 4.7 con sforzo xhigh ottiene 1.657 Elo, quarto in classifica e dietro soltanto alle voci Anthropic: Claude Fable 5.1 con sforzo massimo (1.678), Claude Opus 5 con sforzo massimo (1.673) e Claude Fable 5.1 con sforzo xhigh (1.669). È 16 Elo dietro Claude Opus 5 con sforzo massimo e, con sforzo xhigh, 8 Elo davanti a Claude Opus 5 con sforzo xhigh (1.649). Leggi la posizione con precisione: «dietro solo ai modelli Anthropic» è l'inquadramento usato da Artificial Analysis stessa, ed è accurato — ma il quarto posto non è il secondo, e le tre righe sopra sono tutte dello stesso fornitore.
Il guadagno rispetto alla generazione precedente è il maggiore spostamento singolo della release. Rispetto a Grok 4.6 con effort alto (1.546), Grok 4.7 con xhigh guadagna 111 Elo su AA-Briefcase — più di cinquanta volte il guadagno di due punti sull'Intelligence Index. Artificial Analysis lo attribuisce quasi interamente alla qualità analitica: 1.994 Elo in quella categoria contro 1.690 per Grok 4.6, mentre la qualità della presentazione scende leggermente, 1.499 contro 1.519. È una firma leggibile: il modello ragiona meglio sull'analisi e formatta il deliverable leggermente peggio. La stessa direzione emerge nei dati che Artificial Analysis ha citato per AA-Briefcase-Lite, lo scenario pubblico di due diligence che ha rilasciato su Hugging Face — qualità analitica salita da 1.698 a 1.994, presentazione scesa da 1.531 a 1.499. Due avvertenze su questo confronto. AA-Briefcase-Lite è esplicitamente dimostrativo: la stessa pagina di metodologia di Artificial Analysis afferma che il quinto scenario pubblico «non conta ai fini dei risultati ufficiali di AA-Briefcase». E i dati sulla qualità citati per esso coincidono con le righe xhigh pubblicate sulla board principale, quindi considerate il paragrafo su Lite come un'illustrazione della direzione di marcia anziché una classifica separata.
La voce di costo è il punto in cui questo risultato cambia una decisione. La misura del costo per attività di AA-Briefcase è il costo totale di esecuzione della sottomissione completa diviso per le sue 91 attività; dividendo i totali pubblicati di Artificial Analysis si ottengono circa 9,30 $ per attività per Grok 4.7 a xhigh contro circa 17,79 $ per Claude Opus 5 a max effort — circa la metà, per un divario di 16 punti Elo. Il riassunto del risultato di Artificial Analysis stesso è che Grok 4.7 si classifica "appena dietro Opus 5 a circa il 50% del suo Costo per attività". È lo stesso compromesso che il resto di questo pezzo descrive, arrivando alla stessa risposta da una direzione diversa: Grok 4.7 non batte la frontiera, la batte sul prezzo. Due precisazioni, entrambe oneste. Il conto dei token è reale — su AA-Briefcase-Lite, Artificial Analysis ha stimato il costo API di produzione dei deck di esempio a circa 8 $ per Grok 4.7 a xhigh contro circa 4,40 $ per Grok 4.6 a xhigh, quindi il successore costa circa l'80% in più rispetto al modello che sostituisce sullo stesso lavoro. E le cifre per attività sono calcolate dall'utilizzo dei token ai prezzi di listino con un tasso rappresentativo di cache-hit, quindi variano con il tuo caching: sono un modello di una bolletta, non la tua bolletta.
Dove si colloca Grok 4.7 rispetto a Grok 4.6 e alla concorrenza
• Prezzo per 1 milione di token — Grok 4.7 2 $ in input / 6 $ in output sotto 200K di input, 4 $/12 $ oltre; Grok 4.6 identico.
• Finestra di contesto — 500.000 token per entrambi.
• Data limite delle conoscenze — maggio 2026 per Grok 4.7 rispetto al 1º febbraio 2026 per Grok 4.6.
• Sforzo di ragionamento — low / medium / high / xhigh per Grok 4.7 rispetto ai livelli pubblicati di Grok 4.6.
• Punteggio indipendente — 46 con impegno xhigh rispetto a 44, sull'Intelligence Index v4.3.2 di Artificial Analysis. Sufficiente, secondo Artificial Analysis, per collocare SpaceXAI tra i primi quattro laboratori dell'indice.
• Punteggio di coding indipendente — 56 contro 47 sull'Artificial Analysis Coding Agent Index, ciascun modello nel proprio harness nativo. Quarto tra i modelli con harness nativo, davanti a GPT-5.6 Sol.
Punteggio indipendente per il lavoro di conoscenza — 1.657 Elo con sforzo xhigh contro 1.546 per Grok 4.6 con high, sulla classifica AA-Briefcase di Artificial Analysis. Quarto in assoluto, dietro tre voci di Anthropic e davanti a Claude Opus 5 con xhigh.
• Costo per compito AA-Briefcase — circa $9,30 contro circa $17,79 per Claude Opus 5 al massimo sforzo, sulla stessa classifica. Circa la metà del costo per compito per un divario di 16 Elo.
• Token di output per ogni esecuzione Index — 240 milioni contro una mediana di 94 milioni tra i modelli monitorati da Artificial Analysis. Il miglioramento non è gratuito.
• Valutazione coding del fornitore — CursorBench 4.0 46,3% contro 40,4%.
• Velocità di servizio — una variante rapida con il doppio della velocità di output al doppio del prezzo, rispetto all'erogazione standard di Grok 4.6.
• Sicurezza — un nuovo stack di salvaguardie, con un 62,4% riportato sul benchmark di biosicurezza di LatchBio; Grok 4.6 è stato rilasciato senza questa affermazione.
E il campo, sullo stesso tabellone: Claude Fable 5.1 a 53, Claude Opus 5 a 51, GPT-5.6 Sol a 47, Kimi K3 a 44. La previsione di Musk — che Grok 4.7 «dovrebbe essere all'incirca alla pari con Opus 5.0, non con 5.1» — ora ha un numero sotto di sé, e il numero è finito dove aveva detto che sarebbe finito: sotto la frontiera, non sopra. Il divario misurato rispetto a Claude Fable 5.1 è di sette punti; il divario di prezzo va nella direzione opposta, con Claude Fable 5.1 elencato a 10 $/50 $ per milione di token contro i 2 $/6 $ di Grok 4.7 — cinque volte il prezzo di input e più di otto volte quello di output. Questo è il vero scambio che si chiede a un team di fare, ed è uno scambio prezzo-prestazioni più che una vittoria in termini di capacità. AA-Briefcase è l'unico tabellone in questo pezzo in cui l'ordinamento cambia: lì Grok 4.7 a xhigh si colloca davanti a Claude Opus 5 a xhigh, 1.657 contro 1.649, anche se resta dietro a Opus 5 con sforzo massimo a 1.673 e dietro a Claude Fable 5.1 a 1.678. Vale anche la pena mettere i tre punteggi indipendenti uno accanto all'altro prima di tracciare la linea, perché non puntano nella stessa direzione: sette punti dietro sull'intelligenza generale, davanti a GPT-5.6 Sol sull'indice degli agenti di coding, 111 Elo di vantaggio rispetto al suo predecessore sul knowledge work, e i guadagni pagati in token di output. Quale di questi fatti decida la vostra scelta dipende dal fatto che il carico di lavoro sia un agente di coding, un prodotto di knowledge work o un prompt di chat, e questa è una suddivisione più utile di un singolo ranking.
Cosa hanno azzeccato i leak, e l'unica cosa che non hanno chiarito
Gli artefatti che questo pezzo ha seguito fino a settembre erano reali, e il lancio li trasforma in una prova di quanto valga quella categoria di prove. Ecco il registro.
• La pull request del catalogo ha indicato il prezzo corretto. La proposta del 21 settembre che aggiungeva Grok 4.7 ai cataloghi Zen e Go di un client di agenti open source — aperta alle 05:36 UTC, chiusa automaticamente da un bot di conformità alle 07:46 UTC a causa di una sezione mancante nel template della pull request, mai sottoposta a merge — elencava il modello alle tariffe pubblicate di Grok 4.6. Si è rivelato esattamente corretto: $2/$6, invariato. Ma il meccanismo conta più del risultato. Il contributore ha copiato le tariffe dal modello sopra di esso, e la copia si è rivelata per caso la congettura corretta. Questa è fortuna, non autorità, e anche le dichiarazioni sulle capacità della stessa pull request non contenevano alcuna informazione. Una proposta può essere giusta e comunque non essere una prova.
• La traccia di provisioning era autentica e non era il rilascio. La riga grok-4.7 nella pagina delle quote dei modelli di Google Cloud Console, segnalata dai tracker della community il 16-17 settembre, e lo slug di build datato grok-4-7-0907 emerso in un errore di configurazione di Grok Bot, indicavano entrambi un modello in preparazione. Nessuno dei due aveva una data attribuita da qualcuno, e nessuno dei due era l'annuncio. Ciò che stabiliscono è che l'infrastruttura di terze parti era in fase di preparazione — il che, col senno di poi, era accurato e comunque non un programma.
• Il numero di parametri non è mai stato confermato. Circa 2,1 trilioni, circa il 40% in più rispetto a Grok 4.6, ripetuto da Musk il 2 settembre — e ancora assente da ogni scheda tecnica al lancio. È il caso più chiaro in tutta la vicenda di una cifra che ha circolato abbastanza ampiamente da essere trattata come un fatto pur non avendo mai avuto una fonte da parte del fornitore.

La scheda sopra registra lo stato pre-lancio così come questo articolo l'aveva verificato l'ultima volta: nessun ID del modello, nessuna data di uscita, nessun benchmark pubblicato. Ogni riga che contiene è stata da allora superata dall'annuncio del 21 settembre, ed è mantenuta qui perché il divario tra quella scheda e il modello rilasciato è la vera storia delle ultime sei settimane — un lancio di frontiera che non ha prodotto alcuna specifica confermata fino al giorno in cui è stato rilasciato.
• L'avvertenza sulla prontezza è la questione aperta, e ora ha prove parziali. Musk ha detto a metà settembre che Grok 4.7 "si conclude prematuramente" su compiti ad alta difficoltà e che la sua verifica delle risposte "non è abbastanza rigorosa", cosa che ha attribuito a una penalità di apprendimento per rinforzo per risposte lunghe impostata troppo alta, con l'aggiunta di "possibilmente". L'annuncio di lancio non lo affronta. La soluzione dichiarata da xAI è indiretta: un apprendimento per rinforzo più lungo, ponderato verso compiti di più ore, e una migliore autoverifica è esattamente il cambiamento che faresti per affrontare la terminazione prematura. Il risultato del Coding Agent Index è il primo segno esterno che ha spostato l'ago della bilancia — 56 contro il 47 di Grok 4.6, con Terminal-Bench 4.0 che quasi raddoppia dal 18% al 33%, che è precisamente l'estremità a lungo orizzonte e a molti passaggi dell'intervallo. Non è una risposta netta, perché gli stessi punteggi dell'harness sono anche quelli che ottengono i loro guadagni con molti più token di output. Se il modello abbandoni ancora compiti lunghi e difficili è verificabile da chiunque abbia accesso all'API, e rimane la prima cosa che vale la pena testare.
• Il corpus di SpaceX non è ancora verificato. Il supplemento di addestramento riportato — telemetria di Starlink, log della pressione della camera di combustione del Raptor, telemetria di rientro di Starship, thread interni su Slack, ticket Jira, repository GitHub e record ERP — è una segnalazione della comunità su ciò che ha detto Musk, non una divulgazione aziendale. L'annuncio del lancio descrive un modello di base più grande e una sessione di apprendimento per rinforzo più lunga, e non dice nulla sul corpus. Se c'è dentro, nessuna scheda tecnica lo confermerà; l'unica prova sarà se il modello fa qualcosa su lavoro ingegneristico reale che i suoi pari non riescono a fare.
La tempistica che ha sbagliato quattro volte, e ciò che il mercato ha azzeccato
Grok 4.7 è stato promesso, in pubblico, su cinque tempistiche separate, e le prime quattro sono scadute. Il 24–25 luglio Musk ha detto circa quattro settimane, implicando il 22 agosto. Il 12 agosto ha corretto in "da 3 a 4 settimane", implicando il 2–9 settembre. Il 2 settembre ha ristretto a circa dieci giorni, indicando il 12 settembre. L'11 settembre, il giorno in cui è scaduto, ha detto "ancora qualche giorno". Il quinto non era affatto una finestra — una riga di grok-4.7 su una pagina delle quote di Google Cloud — ed era quello più vicino alla correttezza: il modello è stato rilasciato il 21 settembre, poco dopo l'ultima data a cui qualcuno si era impegnato, e senza una data allegata all'artefatto che lo precedeva.
I mercati predittivi hanno indovinato il calendario e sbagliato il modello. Il mercato Kalshi "SpaceXAI rilascia Grok 4.7 prima del 18 settembre?" ha chiuso le contrattazioni alle 03:59 UTC del 18 settembre, con l'ultima transazione a 65¢, su 1.785 contratti scambiati e 1.211 aperti. Ogni contratto regolato su entrambi i mercati principali — le finestre di Kalshi del 14, 21, 28 e 31 agosto e del 4, 8 e 11 settembre, e i contratti di Polymarket del 12 settembre e del 14 settembre — si è risolto in No. Il mercato Polymarket "prossimo modello Grok (4.7 o superiore) rilasciato entro il 18 settembre?" si attestava al 64% il 15 settembre, dopo aver oscillato tra il 42% e l'88,5% nell'arco di undici giorni. Il mercato ha fatto bene a scommettere contro i picchi alimentati dai tweet, e ha visto giusto nel ritenere che la finestra del 18 settembre si sarebbe chiusa vuota. Era in anticipo di tre giorni sul modello, che è l'unica cosa che un contratto con scadenza non può prezzare.
I conteggi delle visualizzazioni vale la pena conservarli come nota di calibrazione. Il conto alla rovescia di Musk del 2 settembre, "esce tra 10 giorni", ha totalizzato 10,29 milioni di visualizzazioni ed era sbagliato. Il suo passo indietro dell'11 settembre ha totalizzato 2,05 milioni ed era anch'esso sbagliato. I suoi post sulla roadmap del 13–14 settembre hanno totalizzato circa 1,99 milioni ed erano i più vicini alla verità — ha descritto Grok 4.8, un modello da circa 2,5 trilioni di parametri addestrato su uno stack C++ da zero, come "un miglioramento evidente" rispetto a Grok 4.7. La portata seguiva la fiducia, non l'accuratezza, per tutto il corso.
Due delle voci della roadmap sono ora domande aperte anziché previsioni. Grok 4.8 non ha ID modello, né prezzo, né finestra di contesto, né alcuna voce in un benchmark da nessuna parte. E la tesi secondo cui Grok 4.7 sarebbe stato silenziosamente "ribattezzato" in Grok 4.8 — l'interpretazione di una testata del fatto che Musk abbia nominato 4.8 mentre 4.7 era in ritardo — si risolve nel senso opposto: 4.7 è uscito come 4.7, al 46 sull'Index contro il 44 di Grok 4.6, il che è l'incremento di un successore e non un rilancio.
Cosa significa questo per i team che oggi chiamano Grok
Il quadro pratico è cambiato il 21 settembre, ed è cambiato nel modo meno drammatico possibile: un nuovo ID di modello con lo stesso prezzo, la stessa finestra di contesto, un guadagno di due punti sull'Indice, un guadagno di nove punti sull'agente di codifica e un guadagno di 111 punti sul lavoro intellettuale. Due cambiamenti da allora contano più di quanto sembrino. Le app Grok ora consegnano il modello a utenti comuni anziché solo agli sviluppatori, e il catalogo da questo lato ora lo elenca — insieme, questi trasformano il livello di routing descritto alla fine di questo pezzo da un piano in un'impostazione predefinita. Se il tuo modello di costo era basato su Grok 4.6 a $2/$6, il prezzo per token è ancora corretto per Grok 4.7 — ma il conteggio dei token no. L'esecuzione di Artificial Analysis ha bruciato 240 milioni di token di output sull'Intelligence Index contro una mediana di 94 milioni tra i modelli che monitora, quindi la stessa richiesta può costare ben più del doppio anche se la scheda delle tariffe è identica, ed è il tipo di cambiamento che non appare mai in una tabella dei prezzi. Calcola il costo di un vero ciclo agentico sui token di output, non sulla tariffa per milione, prima di concludere che questa release è gratuita. Se la tua ragione per cambiare è la frontiera prezzo-prestazioni che il fornitore sta rivendicando, la prova più forte è ora AA-Briefcase piuttosto che la tabella del fornitore: quarto su quella classifica a circa metà del costo per attività di Claude Opus 5, contrapposto a un divario di sette punti sull'Intelligence Index rispetto a Claude Fable 5.1 e a un divario di prezzo che va cinque volte nella direzione opposta sull'input e più di otto volte sull'output. E se il tuo carico di lavoro è specificamente un agente di codifica, il caso è più forte di quanto suggerisca l'Indice: 56 sul Coding Agent Index nell'harness Grok Build, davanti a GPT-5.6 Sol, è un'altra categoria rispetto a 46 sull'intelligenza generale. Quale di questi conti di più dipende interamente dal tuo carico di lavoro, e nessuno al di fuori di SpaceXAI ha eseguito Grok 4.7 sul tuo.
Sul catalogo di OrcaRouter la linea Grok ora eroga Grok 4.7 insieme a Grok 4.6, Grok 4.5 e Grok 4.3, fatturati al prezzo di listino del provider con 0% di ricarico — $2 per milione di token di input e $6 per milione di output, letture di input in cache a $0,50, e lo stesso scatto a $4 in input e $12 in output che SpaceXAI addebita quando una richiesta supera i 200.000 token di input. È questo che si ottiene passando il listino così com'è: il prezzo per token nel tuo modello di costo è il prezzo per token sulla tua fattura, e ogni modello della famiglia risponde a un'unica chiave, quindi spostare un carico di lavoro da Grok 4.6 a Grok 4.7 è un cambio di stringa anziché un secondo contratto. Quella pagina porta la finestra di contesto da 500.000 token e la stessa superficie compatibile con OpenAI — Chat Completions e Responses — a cui punta già un'integrazione con Grok 4.6.

Quel livello di routing è anche il modo a basso rischio per valutare un modello i cui numeri indipendenti sono arrivati lo stesso giorno di quelli del fornitore. L'elenco di benchmark qui sopra è ancora quello del fornitore stesso — le sue valutazioni scelte, i suoi livelli di sforzo scelti, le sue colonne di confronto scelte — e nulla di tutto ciò è stato riprodotto. Ciò che è cambiato è che i tre punteggi di Artificial Analysis non sono del fornitore, quindi la domanda si è spostata da "qualcosa di tutto questo è reale" a "a quale di questi risultati assomiglia il mio carico di lavoro": il 46 che indica intelligenza generale di fascia media, il 56 che indica quarto tra gli agenti di coding con harness nativo, oppure il 1.657 che indica quarto nel knowledge work a metà del costo per attività della frontiera. E il numero che decide l'economia non è affatto un benchmark, ma i token di output che consuma un'esecuzione, che solo il tuo traffico può prezzare — 240 milioni per esecuzione di Index secondo la misurazione di Artificial Analysis contro una mediana di 94 milioni, e circa 8 $ contro 4,40 $ per set di presentazioni di esempio nel suo scenario pubblico AA-Briefcase-Lite. Il failover automatico ti permette di indirizzare traffico reale al nuovo modello e di ripiegare su un fornitore che risponde ancora se il conto dei token o il comportamento di abbandono prematuro si rivelano peggiori di quanto pubblicizzato — che è la differenza tra testare un modello non provato e scommettere una pipeline su di esso.
Come saperlo per primo (la verifica che ha funzionato)
Questa sezione era un elenco di segnali da tenere d'occhio durante l'attesa. L'attesa è finita, quindi ecco lo stesso elenco confrontato con ciò che è realmente accaduto.
• La lista dei modelli è stata la conferma, e si è mossa. Per sei settimane il consiglio in questo articolo è stato di tenere d'occhio la lista dei modelli del fornitore invece che i tweet, perché nel momento in cui Grok 4.7 fosse reale, la lista avrebbe ottenuto un ID modello con prezzi e una finestra di contesto associati. Ecco cosa è successo: grok-4.7 ora appare con una finestra di contesto di 500K, prezzi $2/$6 sotto 200K di input e $4/$12 sopra, un cutoff di conoscenza di maggio 2026 e quattro livelli di sforzo. Ogni finestra di Musk, ogni argomento sulla cadenza e ogni data di mercato non sono riusciti a muovere quella lista; il rilascio l'ha mossa.
• I cataloghi di terze parti precedono l'annuncio, e sono proposte piuttosto che distribuzioni. La pull request del catalogo del 21 settembre è stata la versione più chiara di questo finora, e la sua chiusura è istruttiva: un contributore aveva preparato il terreno per un modello, un bot ha chiuso la modifica due ore dopo per una sezione mancante del template, e il modello è stato rilasciato due giorni dopo. Interpreta quella classe di artefatti come intenzione con una marca temporale. È davvero a monte dell'annuncio, e non è disponibilità.
• Tieni d'occhio il catalogo dei modelli di OrcaRouter. Ora si è spostato. Per tutto settembre il consiglio in questo articolo è stato che una pagina del modello grok-4.7 su orcarouter.ai sarebbe stata il segnale "puoi chiamarlo oggi tramite noi", perché un modello viene elencato solo dopo che un provider lo ha integrato. Il catalogo ora include Grok 4.7 alla tariffa del fornitore senza alcun ricarico, quindi la verifica che a un lettore è stato detto di eseguire ha una risposta: oggi è instradabile tramite un'unica API.
• Per la visibilità lato consumatori, l'app Grok ha ora messo Grok 4.7 davanti a utenti che non apriranno mai una console API. Rileggendo il 2 ottobre, i dati del selettore che grok.com fornisce a un visitatore non connesso continuano a riportare il nome del modello in due delle sue quattro voci — Expert recita «Pensa a fondo · Grok 4.7» e Heavy recita «Team di esperti · Grok 4.7» — mentre Fast, che è la modalità in cui l'app si apre per impostazione predefinita, è descritta solo come «Risposte rapide» e Auto come la scelta tra Fast ed Expert. Le quattro voci sono Auto, Fast, Expert e Heavy. Build non è tra queste: Grok Build è un prodotto separato per il terminale, su una pagina propria, ed è da quella pagina che proviene effettivamente l'attribuzione di Build al modello — invita i visitatori a «installa ora e inizia a creare con Grok 4.7». Quindi l'affermazione che ha circolato il 1° ottobre ed è stata ripetuta il 2 ottobre — che Grok 4.7 sia ora il modello di base in «Fast, Expert, Build e Heavy» — elenca una modalità che l'app non offre e omette quella in cui si apre, ed è la lettura dei tracker, non del fornitore, perché SpaceXAI non ha pubblicato nulla su questa distribuzione. Il passo equivalente di Grok 4.5 ha avuto un post sul blog tutto suo; questo ha un prodotto che è cambiato silenziosamente sotto una pagina di notizie che non è cambiata.
Lo stato delle cose
Grok 4.7 è stato rilasciato il 21 settembre 2026, a 2 $ per milione di token in input e 6 $ per milione di token in output, con una finestra di contesto di 500.000 token e un cutoff delle conoscenze a maggio 2026. Ciò che è cambiato negli undici giorni successivi è la mappa della disponibilità, più che il modello: Amazon Bedrock lo ha aggiunto il 28 settembre, ha iniziato il rollout all'interno delle app web e mobile di Grok il 1° ottobre ed era ancora in rollout lì il 2 ottobre, e ora è elencato su OrcaRouter alla tariffa di SpaceXAI stessa, senza ricarichi. I suoi punteggi indipendenti sono arrivati lo stesso giorno del lancio e continuano a divergere: 46 con sforzo xhigh sull'Intelligence Index v4.3.2 di Artificial Analysis, due punti sopra Grok 4.6 e sufficiente a collocare SpaceXAI tra i primi quattro laboratori dell'indice; 56 sul Coding Agent Index nell'harness Grok Build, nove punti sopra Grok 4.6 e quarto tra i modelli con harness nativo, davanti a GPT-5.6 Sol; e 1.657 Elo su AA-Briefcase, 111 punti sopra Grok 4.6 e quarto in classifica dietro tre voci di Anthropic, a circa metà del costo per attività di Claude Opus 5. Ogni benchmark nella tabella di lancio del fornitore è del fornitore stesso e non riprodotto, con una sola eccezione: la board AA-Briefcase di Artificial Analysis pubblica lo stesso 1.657, e il fornitore ha poi rivisto la propria riga Terminal-Bench dal 38,0% al 37,6%. I miglioramenti nel coding e nel knowledge work sono reali e costano token in output — 240 milioni per esecuzione dell'Index contro una mediana di 94 milioni, e circa 8 $ contro 4,40 $ per set di presentazioni di esempio nello scenario pubblico di due diligence di AA — ed è questo il numero che decide se questa release è economica. La cifra di ~2,1 trilioni di parametri che ha circolato per due mesi non ha ancora una fonte da parte del fornitore, e l'avvertenza sull'abbandono prematuro non è mai stata affrontata direttamente, anche se il salto di Terminal-Bench dal 18% al 33% nell'harness Grok Build è la prima evidenza esterna che la correzione abbia funzionato. Entrambi i segnali che questo articolo aveva detto ai lettori di tenere d'occhio si sono attivati: l'elenco dei modelli del fornitore ha aggiunto grok-4.7 con prezzo e finestra di contesto associati, e il catalogo qui lo elenca alla stessa tariffa. Quindi la mossa vincente è più semplice di quanto fosse a settembre — Grok 4.6 a 2 $/6 $ era la risposta, e Grok 4.7 a 2 $/6 $ è la stessa risposta con un ID modello più recente, punteggi migliori nel coding e nel knowledge work, un conto in token molto più alto e un'app consumer che lo nomina nelle sue due modalità più difficili.
Confrontati in questo articolo3
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
