
Prezzi di Claude Opus 5.5: il listino completo, la voce Cache e quanto costa davvero un compito
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 177 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1323 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
Claude Opus 5.5ha un listino di 4,00 $ per milione di token in input e 20,00 $ per milione in output, un taglio netto del 20% rispetto ai 5,00 $/25,00 $ che Claude Opus 5 ha mantenuto, con le letture dalla cache ridotte del 60% a 0,20 $ per milione. Questi sono i prezzi pubblicati da Anthropic, letti dalla documentazione di prezzo di Anthropic stessa il 24 settembre 2026, due giorni dopo il lancio del modello. Il prezzo di listino è la parte facile. Anthropic afferma anche che il modello costa "circa il 40% in meno da eseguire" su carichi di lavoro tipici, e quel numero non figura nel listino — è una caratterizzazione del fornitore costruita a partire dal taglio per token più l'ipotesi che il modello consumi meno token e meno turni per portare a termine lo stesso lavoro. Questa pagina separa le due cose: ogni tariffa verificabile oggi sul listino, e l'aritmetica che sta dietro a quella che non lo è. Claude Fable 5.1, il livello da 10 $/50 $ superiore, compare ovunque come il termine di confronto che Anthropic stessa propone.
Il tariffario completo, ogni riga così come pubblicata da Anthropic
Tutto in questa sezione è stato letto dalla documentazione sui prezzi di Anthropic su platform.claude.com e claude.com il 24 settembre 2026. Nulla di quanto qui riportato è stato ripreso da un altro articolo.
• Input — 4,00 $ per milione di token (tariffa pubblicata da Anthropic).
• Output — 20,00 $ per milione di token. I token di thinking vengono fatturati come token di output, e il thinking adattivo di Claude Opus 5.5 è sempre attivo e non può essere disattivato.
• Lettura cache — $0,20 per milione di token. Anthropic lo documenta come 0,05x il prezzo base di input, una propria deroga in nota per questo modello.
• Scrittura in cache da 5 minuti — 5,00 $ per milione di token, il moltiplicatore standard di 1,25x applicato all'input di base che Anthropic applica a ogni modello della tabella.
• scrittura in cache di 1 ora — $8.00 per milione di token, il moltiplicatore standard di 2x sull'input di base.
• Batch API — sconto del 50% in entrambe le direzioni: 2,00 $ per l'input e 10,00 $ per l'output per milione. Anthropic pubblica direttamente le cifre scontate invece di lasciarti il compito di dimezzarle.
• Modalità veloce — 8,00 $ di input e 40,00 $ di output per milione, esattamente 2 volte lo standard. La documentazione di Anthropic intitola la pagina "Fast mode (research preview)".
• Inferenza solo USA — un moltiplicatore di 1,1x su input, output e scritture in cache e sulle letture dalla cache quando inference_geo: "us" è impostato. Il routing globale, quello predefinito, utilizza i prezzi standard.
• Contesto e limite di output — 1M token di contesto e 128K di output sincrono ai prezzi standard, senza sovrapprezzo per il contesto lungo. Anthropic afferma che una richiesta da 900k token viene fatturata allo stesso prezzo per token di una da 9k. Nell'API Batch il limite di output sale a 300K dietro output-300k-2026-03-24 header beta.
Anthropic afferma inoltre che i moltiplicatori della cache "si cumulano con altri modificatori di prezzo, come lo sconto dell'API Batch e la residenza dei dati": quindi una richiesta in batch, con cache e ancorata agli Stati Uniti moltiplica tutti e tre, e l'aritmetica si compone anziché sostituirsi.
Ecco su cosa i lettori dei due modelli fanno effettivamente pesare il costo sullo stesso foglio:
• Claude Opus 5 — $5.00 input, $25.00 output, $0.50 lettura cache, $6.25 per una scrittura cache di 5 minuti, $10.00 per una scrittura di 1 ora, $2.50/$12.50 su Batch (tariffe pubblicate di Anthropic, consultate il 2026-09-24).
• Claude Fable 5.1 — $10,00 input, $50,00 output, $0,25 lettura cache, $12,50 per una scrittura cache da 5 minuti, $20,00 per una scrittura da 1 ora, $5,00/$25,00 su Batch (tariffe pubblicate da Anthropic, consultate il 2026-09-24).

La linea di cache è dove viene effettivamente deciso il conto di un agente
La copertura del lancio tratta la lettura della cache come una nota a piè di pagina. È la singola leva più grande sulla scheda per qualunque carico di lavoro che ritrasmette un prefisso di grandi dimensioni, ovvero la maggior parte dei carichi di lavoro di coding e degli agenti.
La nota a piè di pagina di Anthropic è insolitamente esplicita riguardo ai rapporti: i cache hit e i refresh costano 0,1x il prezzo base di input sulla maggior parte dei modelli Claude, 0,025x su Claude Fable 5.1, e 0,05x su Claude Opus 5.5. Quindi il rapporto di cache di Claude Opus 5.5 è due volte peggiore di quello standard, e due volte peggiore di quello di Claude Fable 5.1.
In dollari vince comunque, e questa è la parte che vale la pena interiorizzare: un moltiplicatore migliore non vince in termini di dollari quando il tasso base è due volte e mezzo più alto.
• Claude Fable 5.1 — il 2.5% di una base di $10.00 è $0.25 per milione di token in cache.
• Claude Opus 5.5 — il 5% di una base di 4,00 $ è 0,20 $ per milione di token in cache.
• Claude Opus 5 — il 10% di una base di $5,00 è $0,50 per milione di token in cache.
La stessa inversione vale per le scritture. Claude Fable 5.1 addebita $12,50 per scrivere un milione di token nella cache da 5 minuti e $20,00 per la finestra da 1 ora; Claude Opus 5.5 addebita $5,00 e $8,00. Le letture dalla cache sono l'unica voce in cui Claude Opus 5.5 supera entrambi i fratelli in dollari assoluti pur avendo il rapporto intermedio.
Due regole stabiliscono se valga del tutto la pena pagare per la scrittura. La documentazione di Anthropic afferma che una scrittura da 5 minuti costa 1,25 volte l'input di base e quindi si ripaga dopo una sola lettura della cache, mentre una scrittura da 1 ora costa 2 volte l'input di base e richiede due letture per ripagarsi. Inoltre, la cache è legata al prefisso che l'ha generata: Anthropic osserva che il passaggio tra la velocità rapida e quella standard invalida la cache, perché le richieste a velocità diverse non condividono i prefissi in cache. Cambiare il modello, il livello di sforzo o le definizioni degli strumenti ha lo stesso effetto. Un modello più economico che forza una riscrittura del prefisso a ogni cambio può costare più di quello costoso che ha sostituito.
Quanto costa davvero un lungo ciclo dell'agente
Prendi un agente di codifica da 40 turni che reinvia un prefisso di 120.000 token — prompt di sistema, schemi degli strumenti, albero dei file — a ogni turno, aggiunge 1.000 token di input nuovi per turno dai risultati degli strumenti e produce 800 token di output per turno. Qui il punto è la sostituzione: cambia uno qualsiasi di quei quattro numeri per adattarlo al tuo traffico e l'aritmetica di seguito vale comunque.
Su Claude Opus 5.5:
• Scrittura cache, una volta — 120.000 token a $5,00 per milione = $0,60
• Letture dalla cache, 39 turni — 4.680.000 token a $0,20 per milione = $0,94
• Input nuovo, 40 turni — 40.000 token a $4,00 per milione = $0,16
• Output, 40 turni — 32.000 token a $20,00 per milione = $0,64
• Totale sessione — $2.34, di cui le letture dalla cache rappresentano circa il 40%.
Su Claude Opus 5, a parità di conteggio di token: $0,75 di scrittura in cache, $2,34 di lettura dalla cache, $0,20 di input nuovo e $0,80 di output — $4,09.
Su Claude Fable 5.1, a parità di conteggio di token: $1.50 di scrittura in cache, $1.17 di letture dalla cache, $0.40 di input nuovo e $1.60 di output — $4.67.
Stessi token, stessi turni, senza bisogno di rivendicare alcuna efficienza: Claude Opus 5.5 risulta inferiore del 43% a Claude Opus 5 e del 50% a Claude Fable 5.1. E 1,40 $ dei 1,75 $ di divario rispetto a Claude Opus 5 — l'ottanta per cento del risparmio — deriva dalla sola voce di lettura della cache, non dalla tariffa di input principale.
Ora esegui lo scenario opposto: una chiamata singola con 20.000 token di input e 8.000 di output, senza caching. Claude Opus 5.5 costa $0,08 di input più $0,16 di output — $0,24. Claude Opus 5 costa $0,10 più $0,20 — $0,30. È esattamente il taglio del 20% sul prezzo di listino, e non un punto di più.
Quindi il solo tariffario garantisce una percentuale compresa tra il 20% e il 43%, a seconda di quanta parte della tua fattura è costituita da letture dalla cache. Qualsiasi affermazione al di sopra di questo intervallo deriva dal conteggio dei token, non dai prezzi.
Da dove viene il "circa 40% più economico da eseguire" di Anthropic
Il materiale di lancio di Anthropic afferma che Claude Opus 5.5 "richiede meno potenza di calcolo per essere servito rispetto a Opus 5" e che i suoi test mostrano che "costerà il 40% in meno di Opus 5 su carichi di lavoro tipici" con le impostazioni predefinite. La scomposizione fornita da Anthropic è che il modello "costa meno per token di Opus 5 e utilizza meno token per attività, il che si traduce in un calo dei costi del 40%."
Chiamalo per quello che è: una caratterizzazione del fornitore di una media su carichi di lavoro scelti da Anthropic, non un risultato verificato da revisori e non una tariffa pubblicata sul listino. La metà verificabile è la prima — 20% di sconto su input e output, 60% di sconto sulle letture della cache, entrambi leggibili sul listino oggi. La seconda metà dipende dal fatto che il modello consumi meno token e meno turni su tuo carico di lavoro, cosa verificabile solo eseguendolo.
Le prove che Anthropic offre per la metà relativa ai token sono un insieme di dichiarazioni dei clienti risalenti al momento del lancio. Tutte le seguenti sono pubblicate dal fornitore e descrivono carichi di lavoro scelti dal fornitore e dai suoi clienti:
• Box — il modello «ha usato un terzo dei token usati da Opus 5», con risposte «meno verbose del 40% senza perdere accuratezza».
• Kiro — ha risolto più problemi di Opus 5 effettuando circa il 40% di chiamate in meno e usando la metà dei token.
• Factory — ha "eguagliato Opus 5 ad alto sforzo, usando il 20-25% in meno di token di output".
• GitHub — ha usato uno dei numeri più bassi di token e passaggi che abbiamo misurato, e in VS Code «ha risolto più attività da terminale di Opus 5 in meno della metà dei passaggi».
• Analisi di fusione, un esempio svolto — due aziende fittizie di software HR, con ciascun modello che costruisce un file Excel e una presentazione per la dirigenza. Anthropic riporta che Claude Opus 5.5 ha terminato in 63 minuti contro i 93 di Claude Opus 5 ed «è costato il 50% in meno da produrre». Dati dichiarati dal fornitore, n=1.
Il contrappeso indipendente qui conta, perché punta nella direzione opposta. Artificial Analysis ha misurato Claude Opus 5.5 allo sforzo massimo a circa 119.000 token di output per attività dell'Intelligence Index, contro circa 73.000 per Claude Opus 5 allo sforzo massimo — il numero di token va su, non giù. La sua sintesi di quella configurazione è che Claude Opus 5.5 è "allo stesso livello di Opus 5 quanto a costo per attività nonostante 1,6 volte i token di output", a un costo pubblicato di 5,98 $ per attività dell'Intelligence Index. Questa è una misurazione indipendente allo sforzo massimo, e non è una contraddizione di quanto afferma Anthropic — è l'altro estremo della scala di sforzo.
Il che introduce l'avvertenza che governa ogni numero in questa sezione. Anthropic afferma che, salvo diversa indicazione, tutti i suoi risultati di Claude Opus 5.5 usano il pensiero adattivo a livello di massimo impegno. Claude Opus 5.5 usa per impostazione predefinita il livello medio di impegno; Claude Opus 5 usava per impostazione predefinita il livello alto, e lo stesso livello nominale non è lo stesso budget di pensiero tra i due modelli. Quindi una tabella del fornitore eseguita con massimo impegno e una tabella indipendente eseguita con massimo impegno con fallback predefinito abilitato non sono la stessa configurazione, e neanche l'impostazione predefinita è quella che un lettore adotterebbe effettivamente. Una media del 40% misurata su un insieme selezionato di carichi di lavoro, con impostazioni che potresti non usare, è un'ipotesi di partenza — non una voce di budget.
La modalità Fast è un'anteprima di ricerca, non un tier
La modalità Fast su Claude Opus 5.5 è $8.00 per milione di input e $40.00 per milione di output — esattamente il doppio del prezzo standard — per un massimo di 2,5 volte più token di output al secondo. Non migliora il tempo al primo token; il guadagno è nella velocità di output, ed è più visibile in streaming.
Dì il resto chiaramente, perché è facile metterlo a budget come un tier quando non lo è. Anthropic etichetta la modalità veloce come research preview. L'accesso va richiesto tramite un account manager o la lista d'attesa. Richiede l'header beta fast-mode-2026-02-01 e speed: "fast" nella richiesta. È disponibile solo sull'API di Claude — non su Amazon Bedrock, Google Cloud, Microsoft Foundry o Claude Platform su AWS. Non può essere combinata con la Batch API né con un impegno Priority Tier. Si somma invece al prompt caching e ai moltiplicatori di residenza dei dati, quindi una richiesta in modalità veloce, con cache e ancorata agli Stati Uniti, paga 1,1x in aggiunta a 2x. E spostare un carico di lavoro tra modalità veloce e standard invalida la prompt cache, il che su un lungo ciclo di agente può costare più di quanto faccia risparmiare la velocità.
Claude Opus 5 e Claude Opus 4.8 supportano anch'essi la modalità veloce, a $10,00/$50,00. Claude Opus 4.7 rifiuta il parametro senza mezzi termini.
L'unità che determina la fattura è il costo per attività completata
Ogni tariffa sopra è un prezzo per token. Nessuno acquista token. Un prezzo per token diventa un costo solo quando viene moltiplicato per i token che un'attività consuma e per il numero di tentativi necessari a completarla.
Esegui i calcoli sull'esempio cache-light di prima. A $0,24 per passaggio, un modello che completa un'attività al primo tentativo costa $0,24. La stessa attività su un concorrente a $0,30 per passaggio costa $0,30 — quindi il modello più economico sembra essere avanti del 20%. Ora ipotizza che il modello più economico richieda 1,2 passaggi per ogni attività completata, che è un tasso di successo generoso per il lavoro agentico: 1,2 × $0,24 fa $0,288, contro $0,30 per l'alternativa a passaggio singolo. Il risparmio è svanito. Con tre passaggi è di $0,72, e il modello che sembrava più economico del 20% per token è più caro del 140% per lavoro completato.
Ecco perché le stesse dichiarazioni di efficienza di Anthropic — meno token, meno chiamate, meno passaggi — sono inquadrate nell'unità giusta. È anche il motivo per cui nessuna di esse dovrebbe essere considerata una voce di budget finché non le hai riprodotte. Il controllo è meccanico: prezzo per passata, moltiplicato per le passate per attività completata, misurato sul tuo traffico. Entrambi i numeri devi produrli tu, e nessun fornitore pubblica il secondo per il tuo carico di lavoro.
Se volete un unico punto di riferimento esterno al fornitore, Artificial Analysis colloca Claude Opus 5.5 a 5,98 $ per attività dell'Intelligence Index nella sua configurazione di massimo impegno — un dato indipendente relativo a un'impostazione che la maggior parte del traffico di produzione non utilizzerà, utile come tetto massimo più che come previsione.

Voci che la tariffa principale non include
• Residenza.L'inferenza solo negli USA è 1,1x su ogni categoria di token, comprese le letture e le scritture della cache. Si cumula con la modalità rapida e con lo sconto Batch.
• Definizioni degli strumenti. Anthropic pubblica un overhead del prompt di sistema per l'uso degli strumenti specifico per ogni modello: dichiarare gli strumenti aggiunge 286 token a ogni richiesta a Claude Opus 5.5. Poco a 4,00 $ per milione, ma viene addebitato per ogni richiesta, e un loop agente effettua molte richieste.
• Invalidazione della cache. Un prefisso riscritto dopo un cambiamento di modello, effort, definizione degli strumenti o velocità viene fatturato alla tariffa di scrittura — 5,00 $ o 8,00 $ per milione su Claude Opus 5.5 — non alla tariffa di lettura di 0,20 $.
• Il modello sotto di esso.Claude Sonnet 5 si attesta a 2,00 $ per l'input e 10,00 $ per l'output per milione; la nota a piè di pagina sui prezzi di Anthropic conferma che ora è il prezzo standard e non la tariffa introduttiva con cui era stato annunciato. Claude Opus 5.5 costa esattamente il doppio di Sonnet 5 in entrambe le direzioni.

Chiamare Claude Opus 5.5 al prezzo di listino di Anthropic
Claude Opus 5.5 è su OrcaRouter all'indirizzo anthropic/claude-opus-5.5 a 4,00 $ di input e 20,00 $ di output per milione — il prezzo di listino di Anthropic stesso, trasferito con un ricarico dello 0%. Vale la pena dichiarare con precisione questo pass-through su una pagina dei prezzi: poiché la tariffa del fornitore viene inoltrata anziché memorizzata in una tabella, una variazione della tariffa del fornitore è già attiva qui lo stesso giorno in cui viene pubblicata, non dopo una finestra di sincronizzazione. Se Anthropic modifica questo listino, il numero che chiami si sposta con esso.
La stessa chiave raggiunge i livelli con cui questa pagina lo confronta — anthropic/claude-opus-5 a $5,00/$25,00 e anthropic/claude-fable-5.1 a $10,00/$50,00 — insieme al resto della gamma Claude e a più di 200 altri modelli, quindi verificare se la tariffa per token più economica sopravvive al contatto con i tuoi conteggi di passaggi non richiede un secondo contratto né una modifica al codice. Il failover automatico è lì per il caso in cui vuoi eseguire un modello poco familiare su un percorso di produzione senza scommettere l'intero percorso su di esso.
Il riassunto in due righe di ciò di cui parla questa pagina: il tariffario è 4,00 $ in input, 20,00 $ in output e 0,20 $ per milione di letture dalla cache, e il taglio del 20% è reale e verificabile già oggi. Il 40% è la media di Anthropic sui carichi di lavoro che ha selezionato. Fai girare uno dei tuoi loop di agenti su questo prima di impostare il budget basandoti sul secondo numero.
Confrontati in questo articolo3
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
