
Grok 4.7 vs Claude Opus 5: Il divario di prezzo è reale, la parità no
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Puoi chiamare Grok 4.7 a 2,00 $ per milione di token in input e 6,00 $ per milione di token in output. Puoi chiamare Claude Opus 5 a 5,00 $ e 25,00 $. Si tratta di una differenza di 4,2x sull'output — il tipo di divario che di solito decide un confronto prima ancora che si aprano i benchmark. Non decide questo. Nella versione dell'Artificial Analysis Intelligence Index rispetto alla quale entrambi i modelli sono attualmente valutati — v4.3.2, la revisione pubblicata il 19 settembre 2026 — Claude Opus 5 si colloca a 51 e Grok 4.7, rilasciato dal fornitore il 21 settembre 2026, si colloca a 46. Cinque punti non sono una disfatta, ma la forma dei cinque punti è questa: Opus 5 vince otto delle dieci valutazioni in quell'indice. L'argomento del modello più economico è il prezzo, il contesto è in parità, e l'unico punto in cui il vantaggio di prezzo di Grok 4.7 doveva contare di più è esattamente quello in cui svanisce.
Due ammiraglie, due listini prezzi molto diversi
Claude Opus 5 è sul mercato dal 24 luglio 2026 ed è il modello di punta di Anthropic del livello Opus, posizionato sotto Claude Fable 5.1 nella lineup della stessa azienda. Offre una finestra di contesto da 1 milione di token a prezzo fisso — Anthropic dichiara chiaramente che una richiesta da 900k token viene fatturata alla stessa tariffa per token di una da 9k token, senza alcun sovrapprezzo per il contesto lungo — e un output massimo di 128K, estendibile a 300K tramite la Message Batches API. Il thinking è adattivo e attivo per impostazione predefinita, con una scala di effort che va da low, medium, high, xhigh e max, con valore predefinito high. I pesi sono closed.
Grok 4.7 ha un giorno di vita. Gestisce una finestra di contesto di 500k token, accetta in input testo e immagini e restituisce testo, e dispone di un proprio selettore dello sforzo di ragionamento. Il suo prezzo di listino è di 2,00 $ per l'input e 6,00 $ per l'output per milione di token al di sotto dei 200k token di prompt, salendo a 4,00 $ e 12,00 $ a partire da quella soglia; le letture dalla cache costano 0,50 $ e 1,00 $ nelle stesse due fasce. xAI elenca anche una variante più veloce che gira a circa il doppio della velocità di output per circa il doppio del prezzo, sebbene quella configurazione sia stata rilasciata senza una misurazione di velocità pubblicata allegata. Anche qui i pesi sono chiusi, il che elimina la scappatoia "eseguilo da solo" da entrambi i lati di questo confronto.
Il consiglio indipendente non è vicino e non è lusinghiero.
Entrambi questi modelli vengono valutati sull'indice v4.3.2 di Artificial Analysis, che comprende dieci valutazioni riguardanti agenti, programmazione, conoscenza generale e ragionamento scientifico. Mettendo le due colonne a confronto, il distacco in testa di cinque punti sembra generoso verso il modello più economico: un singolo scarto di cinque punti in un punteggio composito può nascondere molto, e qui nasconde una quasi completa supremazia.
• Intelligenza composita — Grok 4.7 (xhigh): 46 sull'Artificial Analysis Intelligence Index v4.3.2. Claude Opus 5 (ragionamento adattivo, sforzo massimo): 51 sulla stessa revisione.
• Ragionamento complesso — Grok 4.7: Humanity's Last Exam 43, CritPt 18. Claude Opus 5: HLE 55, CritPt 29. Un divario di dodici punti e uno di undici punti, rispettivamente, entrambi a favore di Opus 5.
• Terminali agentici — Grok 4.7: Terminal-Bench 4.0 26. Claude Opus 5: 49. Questo è il divario singolo più ampio della classifica, e riguarda il benchmark più vicino al lavoro autonomo reale.
• Automazione del posto di lavoro — Grok 4.7: AutomationBench-AA 66%. Claude Opus 5: 57%. È l'unica vittoria netta di Grok 4.7, e una vittoria reale: nove punti sulla valutazione che misura se un agente porta a termine un flusso di lavoro senza inciampare in un guardrail.
• Conoscenza e onestà — Grok 4.7: AA-Omniscience 32. Claude Opus 5: 37. Entrambi i modelli allucinano; Opus 5 lo fa meno su questa misura.
• Contesto lungo — Grok 4.7: AA-LCR v1.1 77%, finestra 500k token. Claude Opus 5: 79%, finestra 1M token.
• Costo di esecuzione dell'indice — Grok 4.7: 240M token di output nell'intera valutazione, segnalato da Artificial Analysis come insolitamente prolisso. Claude Opus 5: 140M. Grok 4.7 consuma 1,7 volte i token per ottenere un punteggio inferiore.

Dove il vantaggio di prezzo di Grok 4.7 va a morire
Ecco il calcolo che il listino prezzi nasconde. Prendi una richiesta agentica realistica: 30k token di input, 8k di output. Grok 4.7 addebita $0,06 in input e $0,048 in output — circa undici centesimi. Claude Opus 5 addebita $0,15 in input e $0,20 in output — circa trentacinque centesimi. È un 3x autentico, e a questa dimensione Grok 4.7 è la scelta ovvia solo in base al costo.
Ora prendi la richiesta su cui è costruito il marketing di Grok 4.7 stesso: una sessione agentica a contesto lungo. Porta il prompt oltre i 200k token e le tariffe di Grok 4.7 raddoppiano a 4,00 $ in input e 12,00 $ in output. Claude Opus 5 non si muove — la sua finestra da 1M viene fatturata a 5,00 $ e 25,00 $ in modo fisso. Con 250k in input e 8k in output, Grok 4.7 costa 1,00 $ in input e 0,096 $ in output, circa 1,10 $. Opus 5 costa 1,25 $ in input e 0,20 $ in output, circa 1,45 $. Il divario si è ridotto da 3x a circa 1,3x. Spingi ancora più in là — 400k, 500k, il limite massimo della finestra di Grok 4.7 — e la tariffa fissa di Opus 5 continua a chiudere il divario mentre la sua finestra continua a spingersi fino a un milione di token. Grok 4.7 è il modello economico con i prompt brevi e un quasi pari sul prezzo con quelli lunghi, il che ribalta l'intuizione che la pagina dei prezzi è progettata per creare.
Due avvertenze mantengono le cose oneste. Primo, il livello a contesto lungo è una struttura di listino documentata proveniente dalla documentazione ufficiale dei modelli di xAI, non una misurazione: le bollette reali dipendono dalla cache, e la tariffa di $0.50 per lettura in cache di Grok 4.7 è davvero economica. Secondo, Artificial Analysis non ha ancora pubblicato una misurazione della velocità per Grok 4.7, quindi la metà "è più veloce" dell'argomento economico-e-veloce al momento non è verificata. Ciò che è misurato è Opus 5 a 59 token al secondo con un tempo al primo token di 49 secondi: lento, costoso e in vantaggio su quasi ogni asse qualitativo.
Cosa instraderesti effettivamente
Questo è un confronto in cui la risposta onesta varia a seconda del carico di lavoro, e un router è il modo più economico per agire di conseguenza. Claude Opus 5 è disponibile su OrcaRouter, elencato nella sua pagina modello dedicata con il prezzo del fornitore riportato con un markup dello 0% — quindi i 5,00 $ e i 25,00 $ di Opus 5 nel nostro catalogo sono il prezzo di listino di Anthropic, non una copia maggiorata, e se Anthropic lo modifica il numero cambia sulla stessa chiave lo stesso giorno. Grok 4.7 non è nel catalogo OrcaRouter al momento in cui scriviamo; per chiamarlo oggi si passa tramite l'API di xAI stessa e le piattaforme di terze parti che lo offrono. Vale la pena conoscere questa asimmetria prima di progettare tenendone conto.

Lo schema di routing che emerge dai numeri è semplice. Invia il lavoro a contesto lungo, ad alto ragionamento e da agente terminale a Opus 5 — vince Terminal-Bench 4.0 di 23 punti e offre il doppio della finestra a prezzo fisso, che è esattamente il profilo di un compito difficile e lungo. Invia attività di automazione e workflow ad alto volume a Grok 4.7: vince AutomationBench-AA di nove punti e costa un terzo con prompt brevi. Poiché entrambi sono raggiungibili attraverso un unico endpoint quando sono nel catalogo, quella suddivisione è una regola di routing anziché un secondo contratto con un fornitore, e il failover automatico significa che un limite di frequenza su un percorso diventa un evento di routing invece di un'interruzione. Dove un carico di lavoro necessita davvero di entrambi — una prima passata economica e una passata di verifica costosa — il DSL di routing li compone in un'unica chiamata anziché due integrazioni.
Il verdetto
Se scegli in base alle prove, Claude Opus 5 vince questo confronto e non è una vittoria di misura: otto valutazioni su dieci, i due scarti più ampi, il doppio del contesto a prezzo invariato e un budget di token ben sotto i due terzi per un punteggio più alto. Il composito a cinque punti sminuisce quanto nettamente sia in vantaggio. Il caso di Grok 4.7 è più ristretto di quanto suggerisca il suo listino prezzi, ma non è vuoto — è davvero più economico alle dimensioni di prompt che la maggior parte delle applicazioni usa effettivamente, è il modello di automazione migliore, ed è sul mercato da un giorno con una suite di benchmark del fornitore ancora in corso di riproduzione indipendente. Acquistalo per l'automazione sensibile ai costi, tieni d'occhio i suoi numeri di velocità quando Artificial Analysis li pubblicherà, e considera il livello di prezzo per il contesto lungo come ciò che decide se il modello economico rimane economico.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
