
Grok 4.6 vs Claude Opus 5: Stesso 61, Due Economie Diverse
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
Artificial Analysis sottopone ogni modello di frontiera alle stesse nove valutazioni e pubblica la fattura. Nel suo Intelligence Index, Grok 4.6 e Claude Opus 5 ottengono lo stesso numero — 61 — il che rende questo uno dei rari testa a testa in cui il punteggio composito non può dirti quale usare. Ciò che può farlo è una cifra meno nota proveniente dalla stessa fonte: nella suite AA-Briefcase per il lavoro di conoscenza, Grok 4.6 ha completato un compito in circa 53 turni e circa mezzo miliardo di token di input, mentre Claude Opus 5 con il massimo sforzo ha impiegato circa 103 turni e due miliardi di token per lo stesso compito. Si tratta di un divario di quattro a uno nel consumo di token tra due modelli il cui punteggio principale è identico, e emerge solo quando smetti di confrontare le schede dei modelli e inizi a confrontare le fatture.
Entrambi i modelli sono i flagship attuali, il che rende questo un confronto pulito piuttosto che una mancata corrispondenza generazionale. Grok 4.6 è stato rilasciato il 12 agosto 2026 da SpaceXAI come perfezionamento della base Grok 4.5 — la stessa base mixture-of-experts da 1,5 trilioni di parametri, riaddestrata con supervisione più lunga e sessioni di reinforcement learning mirate ad agenti di lunga durata. Claude Opus 5 è stato rilasciato il 24 luglio 2026 da Anthropic come flagship con data fissa, con pensiero adattivo, una finestra di contesto da 1 milione di token e input di immagini e file. Si trovano nello stesso punto della classifica indipendente e in punti opposti del listino prezzi: $2 / $6 per milione di token per Grok 4.6 contro $5 / $25 per Claude Opus 5. Il lavoro interessante è capire quale metà di quella frase determina la tua scelta di produzione.
Il 61 che nasconde un divario di efficienza di quattro a uno
L'Intelligence Index è un composto di nove valutazioni, che è il suo punto di forza e il suo punto cieco. Un singolo numero che fa la media dei punteggi di ragionamento, matematica, codifica e lavoro di conoscenza nasconde come un modello ci arriva — e questi due ci arrivano in modo opposto. La suite professionale in stile valigetta per il lavoro di conoscenza di Artificial Analysis è la finestra più chiara su questo: misura compiti reali a lungo orizzonte, e ha registrato Grok 4.6 a circa 53 turni e 0,5 miliardi di token di input per attività, contro Claude Opus 5 Max a circa 103 turni e 2 miliardi di token di input. In termini di economia per singola attività, questa è la differenza tra un modello che completa un lavoro di ricerca e produzione con un quarto dei token e uno che li brucia.
La causa è una scelta progettuale, non un bug. Grok 4.6 è stato addestrato specificamente per verificare il proprio lavoro man mano che procede e per fermarsi quando una sottoattività è davvero completa — xAI descrive lunghe traiettorie di compiti con autoverifica come obiettivo di addestramento. Claude Opus 5 è addestrato per la profondità di ragionamento e l'ampiezza di conoscenza, e il suo comportamento predefinito è pensare più a fondo e consultare più del necessario. Entrambi sono "modelli di ragionamento"; allocano lo sforzo in modo diverso, e l'allocazione è la specifica che conta per i carichi di lavoro degli agenti.

Il divario conta maggiormente per gli agenti che chiamano un modello in un ciclo — agenti di ricerca, agenti di codice che eseguono dozzine di turni, pipeline di documenti che elaborano batch durante la notte. Ogni turno viene fatturato, e ogni token di input è contesto che deve essere reinviato alla chiamata successiva. Un modello che termina in 53 turni con 0.5B token non è solo più economico per token; è più economico per attività di circa un ordine di grandezza rispetto a uno che ne impiega 103 con 2B token, prima ancora di moltiplicare per il prezzo di listino.
La scheda tecnica, entrambi i lati
Dove differiscono sulla carta, in una riga ciascuno:
• Intelligence Index — Grok 4.6 totalizza 61, classificato al #6 su 184; Claude Opus 5 totalizza 61, in vetta alla classifica insieme a esso. Un pareggio, secondo Artificial Analysis.
• Prezzo di listino per 1 milione di token — Grok 4.6 a $2 in ingresso / $6 in uscita (con raddoppio a $4 / $12 per prompt con almeno 200K token di input); Claude Opus 5 a $5 in ingresso / $25 in uscita, con uno sconto batch del 50% a $2.50 / $12.50.
• Finestra di contesto — 500K token per Grok 4.6 rispetto a 1.000.000 per Claude Opus 5, il vantaggio di specifica più chiaro in assoluto che uno dei due modelli detenga.
• Output massimo — Claude Opus 5 consente fino a 128K token di output (300K tramite API batch); il limite di output di Grok 4.6 è inferiore, nell'ordine di una tipica risposta lunga.
• Input — entrambi accettano testo e immagini; Claude Opus 5 accetta anche file, e la versione Anthropic dell'input multimodale penetra più direttamente nei documenti.
• GDPVal-AA v2 (lavoro di conoscenza) — Grok 4.6 a 1.753 Elo contro Claude Opus 5 a 1.852 Elo. Opus 5 si aggiudica la corona della qualità del lavoro di conoscenza sulla metrica in cui l'efficienza della valigetta ha favorito Grok. [Artificial Analysis]
• CursorBench v3.2 — 69,9% per Grok 4.6 contro 70,0% per Claude Opus 5, sostanzialmente alla pari nel benchmark per agenti di codifica su cui entrambi sono stati misurati. [Artificial Analysis]
• Controllo del ragionamento — Claude Opus 5 espone un selettore di sforzo da basso a massimo e il pensiero adattivo attivo per impostazione predefinita; Grok 4.6 espone lo sforzo di ragionamento ma è calibrato verso un'impostazione predefinita che favorisce lunghe traiettorie degli agenti.
Il punto di affiancarli è che nessuno dei due modelli domina. Claude Opus 5 è il miglior generalista sulla carta: più contesto, tetto di output più alto, input di file, maggiore qualità nel lavoro intellettuale. Grok 4.6 è il miglior rapporto qualità-prezzo e l'agente più efficiente. L'unica domanda che rimane è quale di questi descrive il lavoro che hai effettivamente.

Dove Claude Opus 5 si guadagna il suo premium
I numeri di lancio di Anthropic — dichiarati dal fornitore, non riprodotti in modo indipendente — collocano Claude Opus 5 al 96,0% su SWE-bench Verified e al 79,2% su SWE-bench Pro, con un punteggio OSWorld del 70,6% per l'uso del computer. Nel composito complessivo, il suo 61 eguaglia Grok 4.6, e su GDPVal-AA è misurabilmente avanti. In pratica, questo si traduce in un modello che regge il confronto nell'intero arco della giornata di un knowledge worker: redazione, analisi, ragionamento su documenti lunghi, attività che combinano immagini e testo e programmazione, tutto in un unico posto con un milione di token a disposizione.
La finestra di contesto è la vera ragione per cui sceglierlo. Un limite di 500K token è ampio, ma non equivale a un intero codebase, più un corpus di ricerca, più i risultati intermedi di una lunga sessione di un agente. I team che conducono un'analisi approfondita in un unico passaggio su corpora molto vasti — un repository completo, un anno di documenti finanziari, una lunga pila di PDF — si scontreranno con il tetto di Grok 4.6 e non raggiungeranno mai quello di Claude Opus 5. Per questi carichi di lavoro, il contesto aggiuntivo non è un lusso: è la differenza tra far rientrare il lavoro e doverlo organizzare attorno al limite.
Dove Grok 4.6 è l'acquisto più conveniente
Ribaltando gli stessi fatti, Grok 4.6 è il miglior acquisto per le pipeline di agenti, e non di poco. È 2,5× più economico in input e 4,2× più economico in output rispetto al prezzo di listino di Opus 5, e la sua efficienza token per attività amplifica questo vantaggio: i numeri di AA-Briefcase suggeriscono circa 4× meno token e 2× meno turni per lo stesso risultato di lavoro intellettuale. Moltiplica 4× per 2,5× e un'attività che costa $1,00 con l'economia di Opus 5 costa nell'ordine di $0,10 con quella di Grok 4.6 — prima che gli sconti batch sul lato Opus riducano parte del divario.
Per quanto riguarda specificamente la codifica agentica, il risultato DeepSWE 1.1 di Grok 4.6 è migliorato dal 54% al 65,9% tra la versione 4.5 e la 4.6, e il suo punteggio CursorBench si attesta entro mezzo punto da quello di Opus 5, verificando autonomamente il proprio lavoro lungo il percorso. Per un team che esegue migliaia di chiamate agentiche al giorno, dove ogni chiamata è un loop multi-turno, l'economia per attività e le traiettorie più brevi fanno la differenza tra un prodotto sostenibile e un burn rate elevato. Questo è il ragionamento che xAI sta portando avanti, e i dati indipendenti sull'efficienza supportano questa direzione.
La decisione di routing
Questo è il confronto in cui un router dimostra il suo valore, perché la risposta giusta è "entrambi, con la divisione definita dalla forma del carico di lavoro". Grok 4.6 e Claude Opus 5 sono entrambi disponibili su OrcaRouter al prezzo di listino di ciascun fornitore — $2 / $6 per grok/grok-4.6, $5 / $25 per anthropic/claude-opus-5 — con margine dello 0%, quindi il numero nel tuo modello di costo è il numero che viene effettivamente addebitato. La tecnologia che rende pratica questa divisione: una sola chiave API per entrambi i modelli, failover automatico se l'endpoint di un fornitore degrada nel mezzo di una lunga esecuzione di un agente, e un DSL di routing in grado di inviare turni brevi e ad alto volume a Grok 4.6 e di inoltrare il lavoro a lungo orizzonte e ad alto consumo di contesto a Claude Opus 5 in una singola chiamata. Non serve un secondo contratto per eseguire un'architettura a due livelli, e puoi ricalibrare la divisione man mano che arrivano dati di traffico reali, invece di tirare a indovinare dalle schede dei modelli.

La lettura onesta
Il pareggio sull'indice composito è reale, ed è una trappola. I modelli a parità di punteggio non sono intercambiabili; si differenziano proprio dove il punteggio è cieco. Claude Opus 5 è l'opzione predefinita più sicura per un lavoro di conoscenza ampio, ricco di contesto e incentrato su documenti e immagini, dove una finestra da 1 milione di token e un ragionamento profondo contano più del costo. Grok 4.6 è la scelta predefinita migliore per i cicli di agenti ad alto volume, dove l'efficienza dei token per singola attività e un vantaggio di prezzo di 2,5× si combinano fino a produrre una differenza di un ordine di grandezza in fattura. Se il tuo carico di lavoro è del primo tipo, paga per Opus 5 e smetti di preoccuparti del prezzo. Se è del secondo, la parità di 61 sulla carta è la migliore ragione che tu possa mai avere per testare prima Grok 4.6 — il benchmark dice che sono uguali, e la fattura dice che non lo sono.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
