Scheda del titolo con la scritta “Grok 4.7 vs Claude Opus 5” e il sottotitolo “Il divario di prezzo è reale; la parità no”, e tre schede: AA Index v4.3.2 46 vs 51, Prezzo per 1M $2/$6 vs $5/$25, e Terminal-Bench 4.0 26 vs 49.
Guides & Insights

Grok 4.7 vs Claude Opus 5: Il divario di prezzo è reale, la parità no

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Puoi chiamare Grok 4.7 a 2,00 $ per milione di token in input e 6,00 $ per milione di token in output. Puoi chiamare Claude Opus 5 a 5,00 $ e 25,00 $. Si tratta di una differenza di 4,2x sull'output — il tipo di divario che di solito decide un confronto prima ancora che si aprano i benchmark. Non decide questo. Nella versione dell'Artificial Analysis Intelligence Index rispetto alla quale entrambi i modelli sono attualmente valutati — v4.3.2, la revisione pubblicata il 19 settembre 2026 — Claude Opus 5 si colloca a 51 e Grok 4.7, rilasciato dal fornitore il 21 settembre 2026, si colloca a 46. Cinque punti non sono una disfatta, ma la forma dei cinque punti è questa: Opus 5 vince otto delle dieci valutazioni in quell'indice. L'argomento del modello più economico è il prezzo, il contesto è in parità, e l'unico punto in cui il vantaggio di prezzo di Grok 4.7 doveva contare di più è esattamente quello in cui svanisce.

Due ammiraglie, due listini prezzi molto diversi

Claude Opus 5 è sul mercato dal 24 luglio 2026 ed è il modello di punta di Anthropic del livello Opus, posizionato sotto Claude Fable 5.1 nella lineup della stessa azienda. Offre una finestra di contesto da 1 milione di token a prezzo fisso — Anthropic dichiara chiaramente che una richiesta da 900k token viene fatturata alla stessa tariffa per token di una da 9k token, senza alcun sovrapprezzo per il contesto lungo — e un output massimo di 128K, estendibile a 300K tramite la Message Batches API. Il thinking è adattivo e attivo per impostazione predefinita, con una scala di effort che va da low, medium, high, xhigh e max, con valore predefinito high. I pesi sono closed.

Grok 4.7 ha un giorno di vita. Gestisce una finestra di contesto di 500k token, accetta in input testo e immagini e restituisce testo, e dispone di un proprio selettore dello sforzo di ragionamento. Il suo prezzo di listino è di 2,00 $ per l'input e 6,00 $ per l'output per milione di token al di sotto dei 200k token di prompt, salendo a 4,00 $ e 12,00 $ a partire da quella soglia; le letture dalla cache costano 0,50 $ e 1,00 $ nelle stesse due fasce. xAI elenca anche una variante più veloce che gira a circa il doppio della velocità di output per circa il doppio del prezzo, sebbene quella configurazione sia stata rilasciata senza una misurazione di velocità pubblicata allegata. Anche qui i pesi sono chiusi, il che elimina la scappatoia "eseguilo da solo" da entrambi i lati di questo confronto.

Il consiglio indipendente non è vicino e non è lusinghiero.

Entrambi questi modelli vengono valutati sull'indice v4.3.2 di Artificial Analysis, che comprende dieci valutazioni riguardanti agenti, programmazione, conoscenza generale e ragionamento scientifico. Mettendo le due colonne a confronto, il distacco in testa di cinque punti sembra generoso verso il modello più economico: un singolo scarto di cinque punti in un punteggio composito può nascondere molto, e qui nasconde una quasi completa supremazia.

Intelligenza composita — Grok 4.7 (xhigh): 46 sull'Artificial Analysis Intelligence Index v4.3.2. Claude Opus 5 (ragionamento adattivo, sforzo massimo): 51 sulla stessa revisione.

Ragionamento complesso — Grok 4.7: Humanity's Last Exam 43, CritPt 18. Claude Opus 5: HLE 55, CritPt 29. Un divario di dodici punti e uno di undici punti, rispettivamente, entrambi a favore di Opus 5.

Terminali agentici — Grok 4.7: Terminal-Bench 4.0 26. Claude Opus 5: 49. Questo è il divario singolo più ampio della classifica, e riguarda il benchmark più vicino al lavoro autonomo reale.

Automazione del posto di lavoro — Grok 4.7: AutomationBench-AA 66%. Claude Opus 5: 57%. È l'unica vittoria netta di Grok 4.7, e una vittoria reale: nove punti sulla valutazione che misura se un agente porta a termine un flusso di lavoro senza inciampare in un guardrail.

Conoscenza e onestà — Grok 4.7: AA-Omniscience 32. Claude Opus 5: 37. Entrambi i modelli allucinano; Opus 5 lo fa meno su questa misura.

Contesto lungo — Grok 4.7: AA-LCR v1.1 77%, finestra 500k token. Claude Opus 5: 79%, finestra 1M token.

Costo di esecuzione dell'indice — Grok 4.7: 240M token di output nell'intera valutazione, segnalato da Artificial Analysis come insolitamente prolisso. Claude Opus 5: 140M. Grok 4.7 consuma 1,7 volte i token per ottenere un punteggio inferiore.

OrcaRouter model page for Claude Opus 5 showing the anthropic/claude-opus-5 identifier, a 1M-token context window, 128K maximum output, text, image and file input with text output, list rates of $5.00 per 1M input and $25.00 per 1M output, and 69.9M tokens of traffic over seven days.

Dove il vantaggio di prezzo di Grok 4.7 va a morire

Ecco il calcolo che il listino prezzi nasconde. Prendi una richiesta agentica realistica: 30k token di input, 8k di output. Grok 4.7 addebita $0,06 in input e $0,048 in output — circa undici centesimi. Claude Opus 5 addebita $0,15 in input e $0,20 in output — circa trentacinque centesimi. È un 3x autentico, e a questa dimensione Grok 4.7 è la scelta ovvia solo in base al costo.

Ora prendi la richiesta su cui è costruito il marketing di Grok 4.7 stesso: una sessione agentica a contesto lungo. Porta il prompt oltre i 200k token e le tariffe di Grok 4.7 raddoppiano a 4,00 $ in input e 12,00 $ in output. Claude Opus 5 non si muove — la sua finestra da 1M viene fatturata a 5,00 $ e 25,00 $ in modo fisso. Con 250k in input e 8k in output, Grok 4.7 costa 1,00 $ in input e 0,096 $ in output, circa 1,10 $. Opus 5 costa 1,25 $ in input e 0,20 $ in output, circa 1,45 $. Il divario si è ridotto da 3x a circa 1,3x. Spingi ancora più in là — 400k, 500k, il limite massimo della finestra di Grok 4.7 — e la tariffa fissa di Opus 5 continua a chiudere il divario mentre la sua finestra continua a spingersi fino a un milione di token. Grok 4.7 è il modello economico con i prompt brevi e un quasi pari sul prezzo con quelli lunghi, il che ribalta l'intuizione che la pagina dei prezzi è progettata per creare.

Due avvertenze mantengono le cose oneste. Primo, il livello a contesto lungo è una struttura di listino documentata proveniente dalla documentazione ufficiale dei modelli di xAI, non una misurazione: le bollette reali dipendono dalla cache, e la tariffa di $0.50 per lettura in cache di Grok 4.7 è davvero economica. Secondo, Artificial Analysis non ha ancora pubblicato una misurazione della velocità per Grok 4.7, quindi la metà "è più veloce" dell'argomento economico-e-veloce al momento non è verificata. Ciò che è misurato è Opus 5 a 59 token al secondo con un tempo al primo token di 49 secondi: lento, costoso e in vantaggio su quasi ogni asse qualitativo.

Cosa instraderesti effettivamente

Questo è un confronto in cui la risposta onesta varia a seconda del carico di lavoro, e un router è il modo più economico per agire di conseguenza. Claude Opus 5 è disponibile su OrcaRouter, elencato nella sua pagina modello dedicata con il prezzo del fornitore riportato con un markup dello 0% — quindi i 5,00 $ e i 25,00 $ di Opus 5 nel nostro catalogo sono il prezzo di listino di Anthropic, non una copia maggiorata, e se Anthropic lo modifica il numero cambia sulla stessa chiave lo stesso giorno. Grok 4.7 non è nel catalogo OrcaRouter al momento in cui scriviamo; per chiamarlo oggi si passa tramite l'API di xAI stessa e le piattaforme di terze parti che lo offrono. Vale la pena conoscere questa asimmetria prima di progettare tenendone conto.

Two-column scoreboard titled “Grok 4.7 vs Claude Opus 5 - the scoreboard”: AA Index 46 vs 51, Terminal-Bench 4.0 26 vs 49, AutomationBench 66% vs 57%, context 500k vs 1M, price per 1M $2/$6 vs $5/$25, and open weights “no” on both sides.

Lo schema di routing che emerge dai numeri è semplice. Invia il lavoro a contesto lungo, ad alto ragionamento e da agente terminale a Opus 5 — vince Terminal-Bench 4.0 di 23 punti e offre il doppio della finestra a prezzo fisso, che è esattamente il profilo di un compito difficile e lungo. Invia attività di automazione e workflow ad alto volume a Grok 4.7: vince AutomationBench-AA di nove punti e costa un terzo con prompt brevi. Poiché entrambi sono raggiungibili attraverso un unico endpoint quando sono nel catalogo, quella suddivisione è una regola di routing anziché un secondo contratto con un fornitore, e il failover automatico significa che un limite di frequenza su un percorso diventa un evento di routing invece di un'interruzione. Dove un carico di lavoro necessita davvero di entrambi — una prima passata economica e una passata di verifica costosa — il DSL di routing li compone in un'unica chiamata anziché due integrazioni.

Il verdetto

Se scegli in base alle prove, Claude Opus 5 vince questo confronto e non è una vittoria di misura: otto valutazioni su dieci, i due scarti più ampi, il doppio del contesto a prezzo invariato e un budget di token ben sotto i due terzi per un punteggio più alto. Il composito a cinque punti sminuisce quanto nettamente sia in vantaggio. Il caso di Grok 4.7 è più ristretto di quanto suggerisca il suo listino prezzi, ma non è vuoto — è davvero più economico alle dimensioni di prompt che la maggior parte delle applicazioni usa effettivamente, è il modello di automazione migliore, ed è sul mercato da un giorno con una suite di benchmark del fornitore ancora in corso di riproduzione indipendente. Acquistalo per l'automazione sensibile ai costi, tieni d'occhio i suoi numeri di velocità quando Artificial Analysis li pubblicherà, e considera il livello di prezzo per il contesto lungo come ciò che decide se il modello economico rimane economico.

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno