Card hero intitolata Claude Sonnet 5.5 vs Grok 4.6, con sottotitolo il listino dice una cosa, la fattura dei token ne dice un'altra, con pillole che riportano output $10 vs $6, costo per attività $7.60 vs $1.86 e Indice 56 vs 44, e un piè di pagina che cita Artificial Analysis v4.3.2 e i prezzi dei fornitori.
Guides & Insights

Claude Sonnet 5.5 vs Grok 4.6: il listino prezzi dice una cosa, il conto dei token ne dice un'altra

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

L'aritmetica del titolo sembra già risolta prima ancora che l'articolo inizi. Grok 4.6 costa 2 $ per milione di token di input e 6 $ per milione di token di output; Claude Sonnet 5.5 costa 2 $ e 10 $. Il modello di Space​XAI costa il 40% in meno sull'output, pareggia sull'input ed è disponibile a livello generale dal 12 agosto 2026 — abbastanza a lungo perché le sue stranezze siano documentate anziché oggetto di voci. Il modello di Anthro​pic è arrivato il 28 settembre 2026, un giorno prima della stesura di questo pezzo, ed è la novità più recente della fascia con un ampio margine.

Poi si arriva ai dati indipendenti sull'efficienza e l'ordine si inverte. Artificial Analysis misura i modelli della classe GPT e Claude in base al costo per compito, accanto al suo Intelligence Index, e nella revisione v4.3.2 i due modelli in questione costano $1,86 per compito dell'indice per Grok 4.6 e $7,60 per Claude Sonnet 5.5. Il modello con il listino più economico è quello più costoso da far funzionare, di un fattore quattro. Capire perché, e quando quell'inversione si verifica e quando no, è tutto il confronto.

Due modelli, due posizioni nelle rispettive famiglie

Grok 4.6 è l'attuale ammiraglia della linea Grok — la documentazione per sviluppatori di SpaceXAI lo indica come il più recente, e ha succeduto Grok 4.5 con la stessa finestra di contesto da 500.000 token, la stessa superficie di input per testo, immagini e file, e lo stesso prezzo base. Supporta reasoning effort configurabile, tool calling nativo, output strutturati e l'intera superficie di campionamento e, in quanto modello OpenAI Responses di prima classe, si inserisce nei framework di agenti esistenti senza un livello di traduzione. Artificial Analysis lo colloca a un Intelligence Index di 44, al 31º posto dei 216 modelli che misura, con un valore GPQA Diamond del 94,9%.

Two-column scoreboard for Claude Sonnet 5.5 and Grok 4.6 across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, verbosity 410M output tokens. Right column Grok 4.6: input $2.00 per million, output $6.00 per million, 500K-token context, AA Intelligence Index 44, cost per Index task $1.86, verbosity 94M output tokens. A footer line reads Index, cost per task and verbosity per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5 è la seconda voce della generazione 5.5 di Anthropic e il modello che l'azienda ha posizionato come la migliore combinazione di velocità e intelligenza della sua gamma. Viene distribuito come claude-sonnet-5-5/ sull'API di Claude e sulle tre principali piattaforme cloud, offre una finestra di contesto da 1M di token con un tetto di output sincrono di 128K, mantiene le tariffe di Claude Sonnet 5 pari a $2 / $10 per input, output e caching, ed è disponibile con conservazione dei dati pari a zero. Sulla stessa revisione dell'indice ottiene 56 punti e si classifica terzo su 216.

Quindi i due non sono davvero sullo stesso mercato. Uno è un modello di frontiera da 500.000 token che è in vendita da sette settimane a una tariffa contenuta. L’altro è un livello per uso generale da 1M token che non costa più per token del suo predecessore e totalizza dodici punti in più sul punteggio composito. Vale comunque la pena fare il confronto, perché entrambi sono modelli con input a 2 $ ed è lì che iniziano davvero le decisioni di acquisto.

Il divario di quattro volte che nessuno mette su una diapositiva

Le schede tariffarie prezzano i token. Le fatture sono denominate in attività, e il numero di token che un modello spende per raggiungere una risposta è una scelta progettuale, non una costante. È qui che queste due cose divergono, e le cifre misurate sono nette:

• Tariffa di output — Claude Sonnet 5.5 $10 per milione vs Grok 4.6 $6 per milione

• Costo per attività dell'Intelligence Index — Claude Sonnet 5.5 $7,60 vs Grok 4.6 $1,86

• Verbosità sull'Indice — Claude Sonnet 5.5 410M token di output vs Grok 4.6 94M

• Indice di intelligenza — Claude Sonnet 5.5 56 vs Grok 4.6 44, entrambi su v4.3.2

• Velocità di output — Grok 4.6 misurato a 67,7 token al secondo rispetto a una mediana di 82,7; Anthropic riferisce che Claude Sonnet 5.5 genera output oltre il 30% più velocemente di Claude Sonnet 5, che Artificial Analysis ha cronometrato a 78,7 token al secondo

La linea della verbosità è il meccanismo. Un modello che emette quattro volte i token non ha bisogno di un tasso di output superiore del 67% per costare quattro volte tanto per attività — ma aiuta, ed entrambi gli effetti puntano nella stessa direzione qui. La stessa impostazione di Anthropic sostiene l'interpretazione anziché contraddirla: il materiale di lancio afferma che Claude Sonnet 5.5 "costi fino al 30% in meno per attività" rispetto a Claude Sonnet 5 a prezzi identici per token, il che è un'affermazione sul numero di token, non sulle tariffe. Rispetto a una baseline esterna molto più snella, la stessa proprietà diventa il maggiore rischio di costo del modello.

Niente di tutto ciò fa sparire il divario dell'indice. Dodici punti sul punteggio composito sono una vera differenza di capacità, e un compito più economico che fallisce non è più economico. Significa però che la domanda onesta non è "quale tariffa è più bassa" ma "quanti token richiede il compito più difficile", e quel numero esiste solo una volta eseguito il tuo carico di lavoro.

Artificial Analysis model page for Claude Sonnet 5 (Adaptive Reasoning, Max Effort), released June 2026, showing an Intelligence Index of 38, an output speed of 78.7 tokens per second against an average of 83, a cost of $2.00 per million input tokens and $10.00 per million output tokens, $5.09 per Intelligence Index task, a verbosity of 370M output tokens, and a 1M-token context window.

Contesto, impegno e la forma dell'integrazione

La seconda divergenza è architetturale, e decide quale delle due puoi adottare senza riscrivere nulla.

OrcaRouter model page for grok/grok-4.6, attributed to SpaceXAI and dated 2026-08-12, showing a 500K-token context window, text, image and file input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 3.00 seconds, and OpenAI-compatible base URL https://api.orcarouter.ai/v1

Claude Sonnet 5.5 modifica sei comportamenti rispetto a Claude Sonnet 5, cinque dei quali incompatibili. L'invio di thinking: {"type": "disabled"}/ ora restituisce un 400 e deve essere sostituito con between_tools/. L'uso forzato degli strumenti — tool_choice/ di "any"/ o di uno strumento denominato — viene rifiutato del tutto, quindi un ciclo che forza una chiamata valida per lo schema deve passare a auto/ con uso degli strumenti in modalità strict o output strutturati. Il vecchio computer_20251124/ strumento computer-use viene rifiutato su Claude API e Google Cloud. I blocchi di thinking sono ora vincolati al modello e all'account che li ha prodotti, quindi una conversazione può portare il proprio ragionamento avanti da Claude Sonnet 5, ma non lateralmente in una famiglia di modelli diversa. E lo strumento advisor non accetta più Claude Opus 4.8, Claude Opus 4.7 o Claude Sonnet 5 come advisor dietro un esecutore Sonnet 5.5.

Grok 4.6 non richiede nulla di tutto ciò. È un modello in formato OpenAI con la superficie di campionamento intatta, e la migrazione da Grok 4.5 è un cambio della stringa del modello. La sua struttura di costi, però, ha un’insidia, ed è l’immagine speculare di quella di Anthropic: la tariffa di $2 / $6 si applica fino a 200.000 token di input, e tutto ciò che va oltre viene fatturato a $4 / $12. Claude Sonnet 5.5 applica la tariffa standard sull’intera finestra da 1M.

Metti le due strutture l'una accanto all'altra e la scelta smette di riguardare quale fornitore è più economico:

• Prompt brevi, output denso — la tendenza di Grok 4.6 a usare meno token e il suo tasso di output inferiore vincono decisamente.

• Input molto lunghi — la tariffa fissa di 1M di Claude Sonnet 5.5 inizia a battere una fascia che raddoppia ben prima del limite di contesto

• Output singoli di grandi dimensioni — il tetto di 128K di Sonnet 5.5 corrisponde a quello di Grok 4.6, e raggiunge 300K sull'API Message Batches dietro l'output-300k-2026-03-24/ header

• Codice già in formato OpenAI — Grok 4.6 non richiede modifiche; Sonnet 5.5 richiede il lavoro su uso degli strumenti e thinking di cui sopra

Mettere entrambi su un'unica credenziale

Tenere a mente un confronto tra due fornitori è facile. È nella sua esecuzione che si nasconde il costo: due account, due set di limiti, due interfacce di fatturazione e un conteggio dei token che va misurato due volte prima di avere un senso.

OrcaRouter riduce tutto questo a un unico endpoint compatibile con OpenAI che copre oltre 200 modelli, con il prezzo di listino del provider passato così com'è e senza alcun ricarico, così che una variazione delle tariffe del fornitore, sia lato Grok sia lato Claude, sia attiva qui lo stesso giorno anziché al rinnovo contrattuale successivo. L'intera linea Grok 4.x è presente nel catalogo alle tariffe del fornitore stesso, e Claude Sonnet 5 è instradabile dal 30 giugno ai prezzi Anthropic di 2 $ / 10 $ — il modello su cui continua a girare la maggior parte del traffico API di Claude, misurato a 150 token di output al secondo con un tempo p50 al primo token di circa cinque secondi.

Claude Sonnet 5.5 nello specifico non è ancora nel nostro catalogo. Finché non lo sarà, la via per arrivarci è l'API del fornitore stesso, e il modo per testarlo senza scommettere un carico di lavoro su un modello che nessuno ha valutato in modo indipendente oltre un singolo composito è inviargli una percentuale di traffico dietro failover automatico, con Grok 4.6 o Claude Sonnet 5 che raccolgono ciò che lascia cadere. Provare un tier nuovissimo è una decisione di routing, non un progetto di migrazione.

Cosa fare con i numeri

Grok 4.6 è il modello migliore a cui ricorrere quando il lavoro è breve, l'output è denso e l'integrazione parla già OpenAI. È misurabilmente più snello per attività di qualsiasi altra cosa in questa fascia di prezzo, i suoi controlli di campionamento sono intatti, e sette settimane di disponibilità significano che le sue modalità di errore sono già state scoperte da altri.

Claude Sonnet 5.5 è il modello migliore quando l'input è enorme, quando il punteggio composito è ciò che stai acquistando, o quando il lavoro è abbastanza agentico che un divario di dodici punti nell'indice e un tetto di output di 128K contano più di una differenza di quattro volte nel costo per attività. La checklist di migrazione è reale, e richiede un giorno di lavoro anziché una modifica della stringa del modello.

Ciò che risolverebbe la questione è una misurazione di token per attività sul tuo traffico, eseguita su entrambi. Ogni numero in questo articolo che decide l'esito — $1.86 contro $7.60, 94M contro 410M — è un proxy di quella singola cifra, ed è l'unico che puoi produrre da solo.

Confrontati in questo articolo4

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno