
Claude Opus 5.5 vs Grok 4.6: un modello legge, l'altro agisce
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 221 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Claude Opus 5.5 e Grok 4.6 sono i due modi più economici per acquistare un modello di classe frontier capace di mantenere mezzo milione di token di contesto — e non sono lo stesso prodotto. Su una misurazione Grok 4.6 è a tre punti dal tetto assoluto: 94,9 su GPQA Diamond, un insieme di domande scientifiche di livello universitario avanzato in cui il modello di punta di Anthropic si colloca nella stessa fascia. Sulla successiva è indietro di trentotto punti. Su Terminal-Bench 4.0, il benchmark agentico da terminale che chiede a un modello di portare a termine lavoro reale in una shell, Artificial Analysis ha assegnato a Grok 4.6 il 21,21% e a Claude Opus 5.5 il 59,60%. Non è un refuso in nessuna delle due direzioni, e l'intera forma di questo abbinamento risiede nello spiegare perché entrambi i numeri sono veri allo stesso tempo.
Due uscite, una fascia di prezzo, a quattro mesi di distanza
SpaceXAI ha rilasciato Grok 4.6 il 12 agosto 2026 come attuale modello di punta della linea Grok, a 2,00 $ per milione di token di input e 6,00 $ di output, con una finestra di contesto di 500.000 token e una superficie di input per testo, immagini e file. Anthropic ha rilasciato Claude Opus 5.5 nel settembre 2026, circa sei settimane dopo, a 4 $/20,00 $ con una finestra di contesto di 1.000.000 di token e 128.000 di output. Entrambi offrono sforzo di ragionamento configurabile, chiamata di strumenti e output strutturati; entrambi supportano una superficie di chat compatibile con OpenAI e anche il formato proprietario del rispettivo fornitore.
Quindi la lettura ingenua è uno scambio pulito: Grok 4.6 costa la metà sull'input e circa un terzo sull'output, e Claude Opus 5.5 risponde con una finestra di contesto doppia. Quello scambio è reale, e sul lavoro su documenti lunghi potrebbe essere l'unica cosa che conta. Non è nemmeno lì che si trova la divergenza interessante, perché i due modelli sono stati misurati sullo stesso banco di prova indipendente e non sono finiti nello stesso punto sugli assi che contano per il lavoro agentico.
Ciò che il catalogo dice sugli assi su cui entrambi sono stati misurati
Il catalogo di OrcaRouter riporta la provenienza dei benchmark riga per riga — ogni cifra indica il valutatore da cui proviene — così le coppie riportate di seguito provengono tutte da un'unica fonte per entrambi i modelli, Artificial Analysis, anziché da un valore dichiarato dal fornitore da un lato e da una terza parte dall'altro:
• GPQA Diamond — Claude Opus 5.5 non è elencato su questo asse nel nostro catalogo; Grok 4.6 ottiene 94,9%
• Humanity's Last Exam — 61,4% per Claude Opus 5.5 contro 42,9% per Grok 4.6
• SciCode — 66,9% contro 56,5%
• Recall su contesto lungo — 84,7% contro 80,3%
• Terminal-Bench 4.0 — 59,60% contro 21,21%
• AA Intelligence Index — 57,6 contro 44,3
La riga GPQA è deliberatamente lasciata vuota dal lato Anthropic invece di essere compilata da una presentazione di un fornitore. Il 94,9 di Grok 4.6 lì è il numero più forte sulla sua scheda ed è autentico — una misurazione indipendente, non un'affermazione di SpaceXAI — e dice qualcosa di reale sul modello: quando il compito è una domanda ben formulata con una sola risposta difendibile, Grok 4.6 si colloca alla frontiera. Leggilo accanto al 21,21% di Terminal-Bench 4.0 e la forma diventa leggibile. Produrre una risposta corretta sulla scienza ed eseguire un compito in cinque passaggi in una shell su un filesystem reale sono competenze diverse, e Grok 4.6 è molto più avanti nella prima che nella seconda.
Un'avvertenza su questo abbinamento prima che venga usato come verdetto: i dati di Artificial Analysis dei due modelli sono stati registrati in date di valutazione diverse, e quelli di Grok 4.6 sono il set più vecchio. Il confronto è tra un modello valutato in agosto e uno valutato in settembre su una harness che è stata essa stessa rivista in quella finestra temporale. La direzione del divario è coerente lungo cinque assi separati, motivo per cui la consideriamo un segnale, ma i valori puntuali esatti dovrebbero essere letti come un confronto agosto-settembre, non come un confronto nello stesso giorno.
Un indice costruito da qualcuno che non vende nessuno dei due
C'è una seconda misura indipendente, e concorda sulla direzione pur essendo molto meno propensa a fare distinzioni sottili. L'Epoch Capabilities Index, costruito da Epoch AI come composito di più di cinquanta benchmark e riscalato in modo che Claude 3.5 Sonnet si collochi a 130 e GPT-5 a 150, colloca Claude Opus 5.5 a 167,35 nel file che abbiamo letto il 2 ottobre 2026. Grok 4.6 è a 156,61, da una valutazione del 12 agosto. Si tratta di un divario di 10,74 punti su una scala in cui, al lancio dell'indice, si è osservato che circa cinque punti corrispondevano a un raddoppio della misura dell'orizzonte temporale di METR — ampio, e ben al di fuori degli intervalli pubblicati dei due modelli, da 164,0 a 172,0 e da 154,66 a 158,93, che non si sovrappongono affatto.
Vale la pena notare ciò che questo indice non risolve. Colloca Claude Sonnet 5.5 a 165.2 e Claude Fable 5.1 a 164.82, entrambi sopra Grok 4.6, ed entrambi costano meno per milione di token di output rispetto alla tariffa di seconda fascia di Grok 4.6. Chi sceglie basandosi esclusivamente sul rapporto capacità-prezzo ha una terza e una quarta opzione nella stessa famiglia di fornitori, e l'abbinamento in questo articolo riguarda qualcos'altro: ciò in cui i due modelli sono bravi, ciascuno per conto proprio.
Le schede tariffarie, e la riga che compare solo su una di esse.

Il listino prezzi di Grok 4.6 include uno scaglione che quello di Claude Opus 5.5 non ha: le richieste superiori a 200.000 token di prompt vengono fatturate al doppio della tariffa base, quindi l'input passa da $2.00 a $4.00 e l'output da $6.00 a $12.00, mentre la lettura dalla cache passa da $0.50 a $1.00. Claude Opus 5.5 applica $4.00/$20.00 con letture dalla cache a $0.20 fisse su tutta la finestra di 1.000.000 di token. Questa inversione è la conseguenza pratica dell'acquisto di contesto lungo dall'uno o dall'altro modello, e ribalta il confronto dei prezzi di listino non appena un carico di lavoro cresce davvero:
• Prezzo con 30.000 token di input — Claude Opus 4.6 è il più costoso, a circa 28 centesimi per 30.000 di input e 8.000 di output, contro circa 11 centesimi per Grok 4.6
• Prezzo a 250.000 token di input — l'ordine si inverte, perché Grok 4.6 è passato al suo livello raddoppiato mentre Claude Opus 5.5 non l'ha fatto.
• Letture dalla cache — 0,20 $ per milione per Claude Opus 5.5 contro 0,50 $, che salgono a 1,00 $ oltre la soglia, per Grok 4.6
• Output massimo — 128.000 token per Claude Opus 5.5; il limite massimo di output di Grok 4.6 non è pubblicato nel record del catalogo
Grok 4.6 presenta anche una lacuna che vale la pena dichiarare apertamente anziché lasciare che venga scoperta in seguito. Il suo record non riporta alcuna cifra di output massimo — il campo non è misurato, non è zero — quindi un carico di lavoro che dipende da risposte singole molto lunghe non ha alcun numero pubblicato su cui pianificare da quel lato del confronto.
La colonna delle prestazioni che non dovrebbe essere letta
Il nostro catalogo include anche un pannello delle prestazioni di servizio per modello e, su Grok 4.6, è la cosa più fuorviante della pagina. La scheda riporta una latenza p50 di 10.000 millisecondi e un tasso di errore del 97,58% su una finestra di sette giorni, con 26.184 token serviti in quel periodo. Quei campi non descrivono un modello lento. Descrivono un modello che è stato chiamato pochissimo: a quel livello di traffico, il campione è troppo esiguo perché una distribuzione della latenza significhi qualcosa, e il tasso di errore riflette una manciata di tentativi anziché una qualità del servizio. Interpretare quel blocco come prova che Grok 4.6 sia lento significherebbe leggere un artefatto di misurazione come una misurazione.
Il pannello di Claude Opus 5.5, al contrario, ha una popolazione alle spalle — un p50 nell'ordine dei 4,4 secondi su una finestra di sette giorni con campioni giornalieri, e 156 milioni di token serviti nello stesso periodo. Anche questo va letto per quello che è: il traffico del nostro playground, che è un campione dei nostri utenti e non una proprietà del modello.
Quale instradare e come scoprirlo sul proprio lavoro
La divisione che i numeri descrivono è abbastanza stabile da poterci agire. Claude Opus 5.5 è la scelta per il lavoro agentico e a lungo orizzonte — il divario di Terminal-Bench 4.0, 59,60% contro 21,21%, è la separazione più ampia su qualunque asse su cui entrambi i modelli siano stati misurati, ed è l'asse che predice se a un modello si possa affidare un compito anziché una domanda. È anche la scelta quando il prompt è davvero lungo, perché il listino prezzi non sale a scaglioni e la finestra è due volte più grande. Grok 4.6 è la scelta per il lavoro ad alto volume a forma di domanda: un punteggio del 94,9% su GPQA Diamond a $2,00/$6,00 entro i primi 200.000 token è un ottimo affare per carichi di lavoro di recupero e risposta che non arrivano mai allo scaglione raddoppiato.
Entrambi sono su OrcaRouter al prezzo di listino del provider con 0% di ricarico — Claude Opus 5.5 a $4.00/$20.00 con letture dalla cache a $0.20, Grok 4.6 a $2.00/$6.00 con il livello oltre i 200K applicato esattamente come lo imposta SpaceXAI — dietro un'unica chiave, così la suddivisione qui sopra può essere testata sul tuo set di prompt invece di discuterne. Dove entrambi sono instradati, failover automatico si trova sotto, cosa che vale la pena avere quando è il modello più economico a reggere il percorso agentico.
Il verdetto che questa accoppiata si guadagna: Grok 4.6 è il lettore migliore e Claude Opus 5.5 è il lavoratore migliore. Il 94,9 su GPQA Diamond e il 21,21 su Terminal-Bench sono lo stesso modello misurato due volte, e sapere a quale di questi due numeri assomiglia il tuo carico di lavoro è l'intera decisione.


Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
