
Claude Sonnet 5.5 vs Grok 4.6: il listino prezzi dice una cosa, il conto dei token ne dice un'altra
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 984 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 195 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
L'aritmetica del titolo sembra già risolta prima ancora che l'articolo inizi. Grok 4.6 costa 2 $ per milione di token di input e 6 $ per milione di token di output; Claude Sonnet 5.5 costa 2 $ e 10 $. Il modello di SpaceXAI costa il 40% in meno sull'output, pareggia sull'input ed è disponibile a livello generale dal 12 agosto 2026 — abbastanza a lungo perché le sue stranezze siano documentate anziché oggetto di voci. Il modello di Anthropic è arrivato il 28 settembre 2026, un giorno prima della stesura di questo pezzo, ed è la novità più recente della fascia con un ampio margine.
Poi si arriva ai dati indipendenti sull'efficienza e l'ordine si inverte. Artificial Analysis misura i modelli della classe GPT e Claude in base al costo per compito, accanto al suo Intelligence Index, e nella revisione v4.3.2 i due modelli in questione costano $1,86 per compito dell'indice per Grok 4.6 e $7,60 per Claude Sonnet 5.5. Il modello con il listino più economico è quello più costoso da far funzionare, di un fattore quattro. Capire perché, e quando quell'inversione si verifica e quando no, è tutto il confronto.
Due modelli, due posizioni nelle rispettive famiglie
Grok 4.6 è l'attuale ammiraglia della linea Grok — la documentazione per sviluppatori di SpaceXAI lo indica come il più recente, e ha succeduto Grok 4.5 con la stessa finestra di contesto da 500.000 token, la stessa superficie di input per testo, immagini e file, e lo stesso prezzo base. Supporta reasoning effort configurabile, tool calling nativo, output strutturati e l'intera superficie di campionamento e, in quanto modello OpenAI Responses di prima classe, si inserisce nei framework di agenti esistenti senza un livello di traduzione. Artificial Analysis lo colloca a un Intelligence Index di 44, al 31º posto dei 216 modelli che misura, con un valore GPQA Diamond del 94,9%.

Claude Sonnet 5.5 è la seconda voce della generazione 5.5 di Anthropic e il modello che l'azienda ha posizionato come la migliore combinazione di velocità e intelligenza della sua gamma. Viene distribuito come claude-sonnet-5-5/ sull'API di Claude e sulle tre principali piattaforme cloud, offre una finestra di contesto da 1M di token con un tetto di output sincrono di 128K, mantiene le tariffe di Claude Sonnet 5 pari a $2 / $10 per input, output e caching, ed è disponibile con conservazione dei dati pari a zero. Sulla stessa revisione dell'indice ottiene 56 punti e si classifica terzo su 216.
Quindi i due non sono davvero sullo stesso mercato. Uno è un modello di frontiera da 500.000 token che è in vendita da sette settimane a una tariffa contenuta. L’altro è un livello per uso generale da 1M token che non costa più per token del suo predecessore e totalizza dodici punti in più sul punteggio composito. Vale comunque la pena fare il confronto, perché entrambi sono modelli con input a 2 $ ed è lì che iniziano davvero le decisioni di acquisto.
Il divario di quattro volte che nessuno mette su una diapositiva
Le schede tariffarie prezzano i token. Le fatture sono denominate in attività, e il numero di token che un modello spende per raggiungere una risposta è una scelta progettuale, non una costante. È qui che queste due cose divergono, e le cifre misurate sono nette:
• Tariffa di output — Claude Sonnet 5.5 $10 per milione vs Grok 4.6 $6 per milione
• Costo per attività dell'Intelligence Index — Claude Sonnet 5.5 $7,60 vs Grok 4.6 $1,86
• Verbosità sull'Indice — Claude Sonnet 5.5 410M token di output vs Grok 4.6 94M
• Indice di intelligenza — Claude Sonnet 5.5 56 vs Grok 4.6 44, entrambi su v4.3.2
• Velocità di output — Grok 4.6 misurato a 67,7 token al secondo rispetto a una mediana di 82,7; Anthropic riferisce che Claude Sonnet 5.5 genera output oltre il 30% più velocemente di Claude Sonnet 5, che Artificial Analysis ha cronometrato a 78,7 token al secondo
La linea della verbosità è il meccanismo. Un modello che emette quattro volte i token non ha bisogno di un tasso di output superiore del 67% per costare quattro volte tanto per attività — ma aiuta, ed entrambi gli effetti puntano nella stessa direzione qui. La stessa impostazione di Anthropic sostiene l'interpretazione anziché contraddirla: il materiale di lancio afferma che Claude Sonnet 5.5 "costi fino al 30% in meno per attività" rispetto a Claude Sonnet 5 a prezzi identici per token, il che è un'affermazione sul numero di token, non sulle tariffe. Rispetto a una baseline esterna molto più snella, la stessa proprietà diventa il maggiore rischio di costo del modello.
Niente di tutto ciò fa sparire il divario dell'indice. Dodici punti sul punteggio composito sono una vera differenza di capacità, e un compito più economico che fallisce non è più economico. Significa però che la domanda onesta non è "quale tariffa è più bassa" ma "quanti token richiede il compito più difficile", e quel numero esiste solo una volta eseguito il tuo carico di lavoro.

Contesto, impegno e la forma dell'integrazione
La seconda divergenza è architetturale, e decide quale delle due puoi adottare senza riscrivere nulla.

Claude Sonnet 5.5 modifica sei comportamenti rispetto a Claude Sonnet 5, cinque dei quali incompatibili. L'invio di thinking: {"type": "disabled"}/ ora restituisce un 400 e deve essere sostituito con between_tools/. L'uso forzato degli strumenti — tool_choice/ di "any"/ o di uno strumento denominato — viene rifiutato del tutto, quindi un ciclo che forza una chiamata valida per lo schema deve passare a auto/ con uso degli strumenti in modalità strict o output strutturati. Il vecchio computer_20251124/ strumento computer-use viene rifiutato su Claude API e Google Cloud. I blocchi di thinking sono ora vincolati al modello e all'account che li ha prodotti, quindi una conversazione può portare il proprio ragionamento avanti da Claude Sonnet 5, ma non lateralmente in una famiglia di modelli diversa. E lo strumento advisor non accetta più Claude Opus 4.8, Claude Opus 4.7 o Claude Sonnet 5 come advisor dietro un esecutore Sonnet 5.5.
Grok 4.6 non richiede nulla di tutto ciò. È un modello in formato OpenAI con la superficie di campionamento intatta, e la migrazione da Grok 4.5 è un cambio della stringa del modello. La sua struttura di costi, però, ha un’insidia, ed è l’immagine speculare di quella di Anthropic: la tariffa di $2 / $6 si applica fino a 200.000 token di input, e tutto ciò che va oltre viene fatturato a $4 / $12. Claude Sonnet 5.5 applica la tariffa standard sull’intera finestra da 1M.
Metti le due strutture l'una accanto all'altra e la scelta smette di riguardare quale fornitore è più economico:
• Prompt brevi, output denso — la tendenza di Grok 4.6 a usare meno token e il suo tasso di output inferiore vincono decisamente.
• Input molto lunghi — la tariffa fissa di 1M di Claude Sonnet 5.5 inizia a battere una fascia che raddoppia ben prima del limite di contesto
• Output singoli di grandi dimensioni — il tetto di 128K di Sonnet 5.5 corrisponde a quello di Grok 4.6, e raggiunge 300K sull'API Message Batches dietro l'output-300k-2026-03-24/ header
• Codice già in formato OpenAI — Grok 4.6 non richiede modifiche; Sonnet 5.5 richiede il lavoro su uso degli strumenti e thinking di cui sopra
Mettere entrambi su un'unica credenziale
Tenere a mente un confronto tra due fornitori è facile. È nella sua esecuzione che si nasconde il costo: due account, due set di limiti, due interfacce di fatturazione e un conteggio dei token che va misurato due volte prima di avere un senso.
OrcaRouter riduce tutto questo a un unico endpoint compatibile con OpenAI che copre oltre 200 modelli, con il prezzo di listino del provider passato così com'è e senza alcun ricarico, così che una variazione delle tariffe del fornitore, sia lato Grok sia lato Claude, sia attiva qui lo stesso giorno anziché al rinnovo contrattuale successivo. L'intera linea Grok 4.x è presente nel catalogo alle tariffe del fornitore stesso, e Claude Sonnet 5 è instradabile dal 30 giugno ai prezzi Anthropic di 2 $ / 10 $ — il modello su cui continua a girare la maggior parte del traffico API di Claude, misurato a 150 token di output al secondo con un tempo p50 al primo token di circa cinque secondi.
Claude Sonnet 5.5 nello specifico non è ancora nel nostro catalogo. Finché non lo sarà, la via per arrivarci è l'API del fornitore stesso, e il modo per testarlo senza scommettere un carico di lavoro su un modello che nessuno ha valutato in modo indipendente oltre un singolo composito è inviargli una percentuale di traffico dietro failover automatico, con Grok 4.6 o Claude Sonnet 5 che raccolgono ciò che lascia cadere. Provare un tier nuovissimo è una decisione di routing, non un progetto di migrazione.
Cosa fare con i numeri
Grok 4.6 è il modello migliore a cui ricorrere quando il lavoro è breve, l'output è denso e l'integrazione parla già OpenAI. È misurabilmente più snello per attività di qualsiasi altra cosa in questa fascia di prezzo, i suoi controlli di campionamento sono intatti, e sette settimane di disponibilità significano che le sue modalità di errore sono già state scoperte da altri.
Claude Sonnet 5.5 è il modello migliore quando l'input è enorme, quando il punteggio composito è ciò che stai acquistando, o quando il lavoro è abbastanza agentico che un divario di dodici punti nell'indice e un tetto di output di 128K contano più di una differenza di quattro volte nel costo per attività. La checklist di migrazione è reale, e richiede un giorno di lavoro anziché una modifica della stringa del modello.
Ciò che risolverebbe la questione è una misurazione di token per attività sul tuo traffico, eseguita su entrambi. Ogni numero in questo articolo che decide l'esito — $1.86 contro $7.60, 94M contro 410M — è un proxy di quella singola cifra, ed è l'unico che puoi produrre da solo.
Confrontati in questo articolo4
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
