
Claude Sonnet 5.5 vs Gemini 3.1 Pro: più economico per token, undici volte più caro per attività
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 984 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 195 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
Sul listino, Claude Sonnet 5.5 è il modello più economico e in quanto a capacità non c'è partita. Ha raggiunto la disponibilità generale il 28 settembre 2026 a 2,00 $ per milione di token in input e 10,00 $ per milione di token in output; Gemini 3.1 Pro, annunciato il 19 febbraio 2026 e ancora servito da un endpoint di anteprima, costa 2,00 $ e 12,00 $. Sonnet 5.5 ottiene anche 56 sull'Intelligence Index v4.3 di Artificial Analysis, contro il 30 di Gemini 3.1 Pro Preview — un divario di ventisei punti su un singolo harness. Il contesto da 1.048.576 token di Gemini è l'unica cifra di punta che vince nettamente. Eppure lo stesso valutatore riferisce che portare a termine un compito aperto costa 0,67 $ sul modello Google e 7,60 $ su quello Anthropic, ovvero un fattore di undici che va nella direzione opposta. Entrambi i numeri sono corretti, e la ragione per cui coesistono — un tetto di 65.536 token in output da un lato e un problema di verbosità dall'altro — è tutto il senso di questo confronto.
Che cosa è effettivamente ciascun endpoint
Fissa le identità prima dell'aritmetica. Il soggetto qui è anthropic/claude-sonnet-5.5, rilasciato il 28 settembre 2026, input di testo, immagini e file, contesto di 1.000.000 token, output massimo di 128.000 token, pensiero adattivo con un parametro effort predefinito a high sulla Claude Platform. L'avversario è google/gemini-3.1-pro-preview, rilasciato il 19 febbraio 2026, input di testo, immagini, video, audio e file, contesto di 1.048.576 token, output massimo di 65.536 token. Uno di quei due nomi contiene una parola che l'altro non ha, e non si tratta di decorazione.
Il suffisso preview è applicato da sette mesi. In questo arco di tempo Google ha rilasciato diverse versioni di Flash e nessun successore del livello Pro; il modello che 3.1 Pro ha sostituito è indicato come dismesso. Niente di tutto ciò è un difetto del modello — è stato attivo, stabile e con un prezzo corretto per tutto il tempo — ma significa che l'endpoint con cui ti stai integrando non è coperto da un impegno di ciclo di vita per la disponibilità generale, e questa famiglia ha già ritirato un modello Pro. Consideralo una voce fissa anziché una nota a piè di pagina, perché cambia quanto costa una decisione architetturale pluriennale se sbagli.
Due numeri che puntano in direzioni opposte
Prima il confronto per token, perché è quello che tutti eseguono e favorisce il modello più recente.
• Input — $2,00 per milione su entrambi; un pareggio esatto alla tariffa principale
• Risultato — 10,00 $ per Claude Sonnet 5.5 contro 12,00 $ per Gemini 3.1 Pro; il modello Anthropic costa il 17% in meno
• Lettura cache — $0,20 per milione su entrambi, al di sotto della soglia del livello
• Scrittura nella cache — 2,50 $ per milione per la finestra di cinque minuti su Claude Sonnet 5.5 contro 0,375 $ per Gemini 3.1 Pro; Google costa circa sette volte meno per scrivere una voce nella cache
• Contesto — 1.000.000 contro 1.048.576; una differenza senza conseguenze pratiche
• Output massimo — 128.000 token contro 65.536; il modello Anthropic ha quasi il doppio del limite
• Modalità di input — testo, immagine e file rispetto a testo, immagine, video, audio e file
Poi il confronto per attività, dallo stesso valutatore, nella stessa settimana, in una configurazione di massimo impegno da entrambe le parti: 7,60 $ per Claude Sonnet 5.5 contro 0,67 $ per Gemini 3.1 Pro. Undici volte. Il meccanismo è documentato nella stessa pagina anziché dedotto — Sonnet 5.5 ha generato 410 milioni di token nell'intera suite di indici contro una mediana di 88 milioni per il settore, che il valutatore descrive come molto prolisso, mentre Gemini 3.1 Pro è descritto come piuttosto conciso. Quando un modello scrive diverse volte tanto rispetto all'altro, un vantaggio del 17% sulla tariffa di output non sopravvive al contatto con la fattura.
La lezione va oltre questi due modelli: un listino prezzi tariffa un token, e tu paghi per il lavoro finito. Qualsiasi confronto che si ferma al listino sta misurando la quantità sbagliata.
Il confine del livello a 200.000 token
Il prezzo di Gemini 3.1 Pro non è fisso, e il salto è abbastanza ampio da invertire parti del confronto sopra. Sotto un prompt di 200.000 token le tariffe sono $2,00 in input e $12,00 in output con una lettura della cache da $0,20. Oltre quella soglia l'intera chiamata viene riprezzata a $4,00 in input, $18,00 in output e $0,40 di lettura della cache — la tariffa di input raddoppia fino a diventare esattamente il doppio di quella di Claude Sonnet 5.5, e l'output passa dall'essere più economico del 17% sul fronte Anthropic all'essere più caro dell'80% sul fronte Google.
Il confine non è esotico. Un prompt da 200.000 token è una piccola base di codice, un lungo insieme di contratti, qualche ora di trascrizione, o un agente che lavora da un po'. Il lavoro a contesto lungo è esattamente ciò per cui viene venduta una finestra da 1 milione di token, quindi il livello che più premia la finestra è anche il livello in cui il vantaggio di prezzo scompare. Se i tuoi prompt superano regolarmente i 200.000 token, valuta Gemini 3.1 Pro a $4,00 e $18,00, non alle tariffe indicate nella pagina di destinazione.
Le scritture in cache meritano una frase a parte, perché si invertono nella direzione opposta e sopravvivono al cambio di livello. A $0,375 per milione contro $2,50, Gemini è di gran lunga più economico per popolare una cache, e quella tariffa non cambia quando si supera il confine. Per un agente che ricostruisce un ampio prefisso a ogni turno invece di riutilizzarlo, quella singola riga può rappresentare un vantaggio strutturale maggiore della tariffa di input — ed è l'unica riga in questo confronto che nessun confine di livello tocca.
Il tetto di 65.536 token, e perché determina l'architettura
Il dato che cambia maggiormente ciò che puoi costruire è l'output massimo: 65.536 token su Gemini 3.1 Pro contro 128.000 su Claude Sonnet 5.5. Un tetto non è una metrica di prestazioni; è un vincolo sulla possibilità che un'attività rientri in una singola chiamata.
Qualsiasi cosa che produca un artefatto di grandi dimensioni — un file sorgente completo, un lungo report, un documento completo, un dataset strutturato — oltre i 65.536 token nel caso di Gemini deve essere scomposta in una catena di chiamate con stato passato tra di esse. La scomposizione costa più token di input a ogni passaggio, più codice di orchestrazione e una nuova modalità di errore nelle giunture in cui un chunk finisce e il successivo inizia. Un secondo vincolo lo aggrava: il materiale di Anthropic stesso colloca la soglia pratica di Sonnet 5.5 per un lavoro lungo affidabile materialmente più in alto, e il tetto di Gemini è il più stretto dei due di un fattore due. Se il tuo artefatto più lungo è di 40.000 token, questa sezione è irrilevante e dovresti confrontare sul costo per attività. Se è di 100.000, il tetto ha già deciso per te.
La modalità, l'unico asse che Gemini possiede in modo assoluto
Gemini 3.1 Pro accetta video e audio; Claude Sonnet 5.5 accetta testo, immagini e file e non può ricevere nessuno dei due. Per un carico di lavoro incentrato sui media — registrazioni di chiamate, acquisizioni dello schermo, video di prodotto, audio di riunioni — non è disponibile alcuna sostituzione in questo abbinamento, e il confronto dei prezzi è irrilevante perché solo uno dei due endpoint può accettare l'input. Per carichi di lavoro di testo e immagini gli insiemi di capacità si sovrappongono e vale l'aritmetica dei prezzi sopra riportata.
Vale la pena citare l'altro numero operativo di Gemini perché è facile da non notare in una pagina che mette in primo piano l'intelligenza: il nostro catalogo misura una latenza mediana del primo token di 10.000 ms al p50 e una velocità di output vicina a 1.283 token al secondo, con un tasso di errore a sette giorni del 56,8%. Si tratta di un modello estremamente veloce con un tasso di errore osservato molto elevato — una combinazione che si adatta a lavori in batch con budget di retry generosi molto meglio di quanto si adatti a qualsiasi cosa per cui un utente stia aspettando. Claude Sonnet 5.5 è, al confronto, il profilo più lento e costante. Il tasso di errore non compare sulla landing page di nessuno dei due fornitori; è il tipo di cifra che emerge solo quando i candidati si trovano dietro un singolo endpoint che li misura, ed è una delle ragioni per valutare entrambi da un unico posto invece che da due dashboard.
Cosa instradare e dove
Invialo a Claude Sonnet 5.5 quando il lavoro è testo o immagini, quando l'asticella della qualità è abbastanza alta che un divario di ventisei punti nell'indice conta, quando gli artefatti di output sono abbastanza lunghi da richiedere il tetto di 128.000 token, o quando il carico di lavoro è interattivo e un tasso di errore del 56,8% è inaccettabile. Su attività strutturate e delimitate, la penalizzazione di verbosità che produce la cifra di $7,60 in gran parte svanisce, e il vantaggio per token diventa denaro reale.
Invialo a Gemini 3.1 Pro quando l'input contiene video o audio, quando i prompt restano sotto i 200.000 token e il volume è elevato, quando scrivi spesso cache di grandi dimensioni e la scrittura della cache da $0,375 si accumula, oppure quando l'attività è di tipo batch e il costo per attività è l'unica colonna che conta — a $0,67 per attività contro $7,60 puoi permetterti un gran numero di tentativi.
Entrambi sono instradabili su OrcaRouter oggi. google/gemini-3.1-pro-preview e anthropic/claude-sonnet-5 sono entrambe voci di catalogo attive su un'unica credenziale al prezzo di listino del provider con 0% di ricarico, il che significa che la suddivisione sopra può essere espressa come una regola di instradamento anziché come due integrazioni — le richieste di tipo media verso un endpoint, quelle di testo e immagini verso l'altro, con failover se uno dei due inizia a restituire errori. Claude Sonnet 5.5 non è ancora una route sulla nostra piattaforma; quando sarà elencato, la stessa regola lo coprirà senza bisogno di una nuova chiave.
Il verdetto onesto per questo confronto: Claude Sonnet 5.5 è il modello migliore di gran lunga e quello più economico per token, e Gemini 3.1 Pro è all'incirca undici volte più economico per compito completato su lavori aperti, sei volte più economico per scrivere una cache, e l'unico dei due che può vedere un video. Chiunque ti citi il listino prezzi sta descrivendo un confronto che non esiste; quello che esiste riguarda quali richieste puoi limitare.



Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
