Card del titolo hero per Claude Opus 5.5 con la dicitura 'ogni punteggio, l'impostazione di effort da cui deriva e chi l'ha misurato', con due chip statistiche: 66,4% su Terminal-Bench 4.0 con effort xhigh, riportato dal fornitore, e 59,6% sullo stesso benchmark, indipendente.
Guides & Insights

Benchmark di Claude Opus 5.5: ogni punteggio, l'impostazione di impegno da cui proviene e chi l'ha misurato

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Ant​hropic's headline number for Claude Opus 5.5 on Terminal-Bench 4.0 is 66.4%, printed against 52.3% for Claude Opus 5 on the same table — and that 66.4% was produced at xhigh effort, not at the model's default of medium. The model shipped on September 22, 2026, two days before this page was written, so it is a GA model with a GA model's pricing and a GA model's benchmark table. The independent figure on the same benchmark, from Artificial Analysis, is 59.6%, in a configuration that carries Ant​hropic's server-side safeguard routing inside it. Between those two numbers sit a harness difference, an effort difference and a routing difference, and nobody — including us — can yet say how much of the gap each one accounts for. What this page can do is put every published figure for Claude Opus 5.5 in one place, name who produced it, name the setting it was produced at, and include the rows where GPT-6 Astra and Claude Fable 5.1 come out ahead.

Inizia dall'impostazione dello sforzo, perché sposta i numeri più di quanto facciano i modelli.

Claude Opus 5.5 usa per impostazione predefinitamedium di effort sull'API Claude. Claude Opus 5 usava come impostazione predefinita high. Lo stesso livello nominale, inoltre, non corrisponde allo stesso budget di pensiero tra i due modelli, quindi "li abbiamo eseguiti entrambi su high" non è un confronto controllato nemmeno quando l'etichetta coincide. Il pensiero adattivo è sempre attivo e non può essere disattivato su Opus 5.5; il parametro effort regola profondità, latenza e costo, e nient'altro.

Il dato di Anthropic su Terminal-Bench 4.0 è stato ottenuto con xhigh. Questo singolo fatto è l'avvertenza più importante di questa pagina, perché il benchmark che apre la pagina è quello con il margine più ampio riportato rispetto al modello precedente, e perché la stessa tabella mostra cosa succede quando si lascia invariata l'impostazione:

FrontierCode v1.1 Main — 54,4% a xhigh, 54,6% a medium predefinito. Dato dichiarato dal fornitore. L'esecuzione a medium è superiore a quella a xhigh. Su questo carico di lavoro la manopola dello sforzo non ha prodotto nulla di misurabile; i due numeri sono lo stesso numero.

CursorBench 4.0 — 57,8% a xhigh, 52,5% a medium.Dichiarato dal fornitore. Stesso modello, stesso harness, stessa settimana: 5,3 punti, che è il delta di effort più ampio sul tavolo.

Quelle due righe che compaiono in un'unica tabella del fornitore sono l'intero argomento. Un carico di lavoro è insensibile all'effort e l'altro è fortemente sensibile all'effort, e la model card non può dirti in anticipo a quale dei due tipi appartenga il tuo. La conclusione che i dati supportano è ristretta e vale la pena enunciarla in modo altrettanto ristretto: il livello di effort giusto è ormai una misura per singolo carico di lavoro, non un valore predefinito che erediti. Non supporta affermazioni come «Opus 5.5 è più veloce di quanto suggeriscano i suoi benchmark» o «Anthropic ha sottostimato di proposito il valore predefinito»: per questo servirebbero sweep per singolo carico di lavoro su tutte e cinque le impostazioni, e nessuno li ha pubblicati. Significa invece che, se migri da Opus 5 e mantieni l'impostazione di effort che avevi già, hai cambiato l'esperimento, non solo il modello.

Un'altra asimmetria, che però taglia nella direzione opposta. La colonna del concorrente nella riga Terminal-Bench di Anthropic è GPT-6 Astra al 57.9% — eseguito a high di sforzo, secondo la nota al grafico della stessa Anthropic, mentre il 66.4% di Opus 5.5 è stato eseguito a xhigh. Una tabella di un fornitore che esegue il proprio modello con un'impostazione e un rivale con un'altra non è un confronto testa a testa, qualunque sia l'aspetto dei due numeri messi uno accanto all'altro.

La tabella dei fornitori, con la fonte e l'impostazione su ogni riga

Tutto in questa sezione è riportato dal fornitore: il materiale di lancio di Anthropic, l'harness di Anthropic, le salvaguardie di produzione attive, pensiero adattivo allo sforzo massimo salvo diversa indicazione nella riga. Leggilo come Anthropic che misura Anthropic.

Terminal-Bench 4.0 — 66,4%, con effort xhigh. Dichiarato dal fornitore, errore standard di circa ±2,6 punti. Sulla stessa riga: Claude Opus 5 52,3%, Claude Fable 5.1 55,8%, GPT-6 Astra 57,9% (con effort alto), GPT-5.6 Sol 37,3%. Terminal-Bench 4.0 è esplicitamente un benchmark che il fornitore stesso riconosce essere un proxy imperfetto per il lavoro reale in terminale, ed è il dato di punta del modello.

FrontierCode v1.1 Main — 54,4% a xhigh, 54,6% a medium predefinito.Dichiarati dal fornitore. Opus 5 48,0%, Fable 5.1 50,3%, GPT-6 Astra 53,3%, GPT-5.6 Sol 47,5%. La scheda di sistema di Anthropic riporta anche la variante Extended al 63,6% e un valore massimo per la Extended a medium del 65,3%.

CursorBench 4.0 — 57,8% a xhigh, 52,5% a medium.Dati dichiarati dal fornitore. Opus 5 46,6%, Fable 5.1 51,8%, GPT-5.6 Sol 41,7%. Si noti che le righe CursorBench di Fable 5.1 e Opus 5 sono a sforzo massimo, quindi Opus 5.5 a medium viene confrontato con i suoi stessi fratelli al massimo.

GDPval-AA v2.1 — 1.846 Elo. Questa è l'unica riga della tabella del fornitore che il fornitore non ha eseguito. GDPval-AA è una valutazione di Artificial Analysis, e la stessa analisi di Artificial Analysis su Opus 5.5 riporta lo stesso 1.846, con Fable 5.1 a 1.735 e Opus 5 a 1.708. Nella tabella del fornitore: Fable 5.1 1.735, Opus 5 1.708, GPT-5.6 Sol 1.588, GPT-6 Astra 1.542. È l'unica riga qui in cui due organizzazioni concordano sullo stesso numero, e questo perché è la stessa misurazione.

AutomationBench (Zapier) — 40,0%.Dichiarato dal fornitore ed eseguito senza modelli di fallback, pertanto ogni intervento di salvaguardia è stato valutato come un fallimento. GPT-6 Astra 41,4%, Fable 5.1 31,4%, GPT-5.6 Sol 28,8%, Opus 5 26,9%.

Humanity's Last Exam, con strumenti — 67,7%.Riportato dal fornitore. Fable 5.1 65,6%, Opus 5 63,6%, GPT-6 Astra 57,2%. La scheda di sistema di Anthropic riporta separatamente 64,4% senza strumenti, che è il dato a cui fare riferimento se ci si confronta con una fonte che non fornisce ai propri modelli l'accesso agli strumenti.

Terminal-Bench-Science 0.1 — 58,7%. Dati dichiarati dal fornitore, errore standard di circa ±3,5–±5 punti, quindi si tratta di una fascia anziché di un punto. GPT-6 Astra 64,6%, Fable 5.1 52,6%, Opus 5 29,0%, GPT-5.6 Sol 22,4%.

OSWorld 2.0 — 81,8% parziale.Riportato dal fornitore, e "parziale" in quella frase fa un lavoro tutt'altro che banale: la scheda di sistema di Anthropic riporta un tasso di completamento in senso stretto del 48,7% per lo stesso modello sulla stessa valutazione. Entrambi sono pubblicati; il numero parziale è quello che viene citato. Fable 5.1 80,7%, Opus 5 74,0%.

Chartography, con strumenti — 89,0%. Dati dichiarati dal fornitore. Fable 5.1 88,4%, Opus 5 83,4%.

Scoreboard for Claude Opus 5.5 with six rows: Terminal-Bench 4.0 66.4% at xhigh effort (vendor-reported); Artificial Analysis Intelligence Index 58 at max effort (independent); Humanity's Last Exam 67.7% with tools (vendor-reported); Terminal-Bench-Science 0.1 58.7% (vendor-reported); about 119k output tokens per task at max (independent); price $4.00 input / $20.00 output per 1M. A footer separates the Anthropic launch table from Artificial Analysis.

I numeri indipendenti, e cosa significa realmente "Default Fallback"

Artificial Analysis è l'unica terza parte con una valutazione pubblicata e aggiornata di Claude Opus 5.5 su un indice composito, e i suoi dati sono quelli da tenere accanto a quelli di Anthropic. Come rilevato il 24 settembre 2026:

Intelligence Index — 58 al massimo sforzo, in una configurazione etichettata "Adaptive Reasoning, Max Effort, Default Fallback". Indipendente, misurato da Artificial Analysis. Il suo stesso articolo definisce 58 "il punteggio più alto che abbiamo misurato, superiore di diversi punti". Lo stesso indice pubblica anche Opus 5.5 a ogni altra impostazione di sforzo, e il divario è la parte utile: 56 a xhigh, 54 a high, 51 a medium, 42 a low. Si tratta di un'oscillazione di 16 punti lungo la scala dello sforzo su un singolo modello — più ampia del divario tra la maggior parte dei modelli in quella classifica.

Terminal-Bench 4.0 — 59,6%.Indipendente. Artificial Analysis lo segnala come "alla pari con il leader GPT-6 Astra (xhigh)" e circa 11 punti sopra Claude Opus 5.

Humanity's Last Exam — 61,4%. Indipendente, e il precedente miglior risultato sulla stessa classifica era 59,1%, detenuto da Claude Fable 5.1.

SciCode — 66,9%. Indipendente, contro il 63,1% di Claude Fable 5.1.

Ora la clausola che va spiegata anziché citata. "Default Fallback" non è un artefatto del benchmark né un'impostazione di Artificial Analysis — è il routing di salvaguardia lato server di Anthropic, lasciato attivo. Claude Opus 5.5 viene distribuito con il livello di salvaguardia precedentemente riservato a Fable 5.1: la maggior parte delle richieste di cybersecurity viene reindirizzata in modo trasparente a Claude Opus 4.8, e il lavoro di biologia ricade su Claude Opus 5 a meno che l'account non sia verificato. Quando Artificial Analysis esegue l'indice con il fallback predefinito abilitato, sta misurando il sistema distribuito — ciò che una chiave API non verificata raggiunge effettivamente — anziché un checkpoint pulito dei pesi di Opus 5.5. Questa è la misurazione più onesta per un acquirente, ed è la misurazione meno pulita per un benchmark. Anthropic dice altrettanto riguardo alla propria tabella: gli interventi sull'esecuzione di Terminal-Bench 4.0 hanno fatto sì che le attività di cybersecurity fossero completate da Opus 4.8 e quelle di biologia da Opus 5, e l'azienda afferma che tali interventi probabilmente hanno abbassato il punteggio riportato. Quindi il routing di salvaguardia è un fatto operativo reale in entrambe le direzioni, e nessun dato in questa pagina isola il modello sottostante da esso.

Dove le due tabelle divergono, e perché

Metti i due numeri di Terminal-Bench 4.0 uno accanto all'altro e ottieni 66,4% contro 59,6% — 6,8 punti, sullo stesso benchmark, per lo stesso modello. Le ragioni sono note, e ciascuna è abbastanza grande da contare di per sé:

Harness diversi. Anthropic ha eseguito il proprio scaffold di agenti; Artificial Analysis ha eseguito il proprio harness di riferimento per agenti. Il punteggio finale di un benchmark è una proprietà dello scaffold insieme al modello, non del modello da solo, e nessuna delle due organizzazioni ha pubblicato un esperimento di sostituzione dello scaffold.

Impostazioni di effort diverse.Il 66,4% di Anthropic è a xhigh. L'impostazione di effort associata al 59,6% di Artificial Analysis non è indicata nella frase che riporta il numero, e i suoi valori di benchmark riportati sono in genere quelli con effort massimo.

Salvaguardie attive, in entrambi i casi, conteggiate in modo diverso. Anthropic ha eseguito con il fallback e ha trattato gli interventi come riduttivi del punteggio, ma comunque valutati. Su AutomationBench ha eseguito senza fallback e ha conteggiato gli interventi come fallimenti netti. Artificial Analysis esegue con il fallback abilitato in tutti i casi.

I numeri cambiano anche all'interno della tabella di uno stesso fornitore. Anthropic riporta Claude Opus 5 al 52,3% su Terminal-Bench 4.0 e osserva che il 51,8% della classifica pubblica per lo stesso modello «rientra nel rumore».

E poi la prova più forte su questa pagina di quanto valga un harness. La classifica pubblica di Terminal-Bench 4.0, catturata il 24 settembre 2026, non riporta alcuna riga di Claude Opus 5.5. Il suo elemento in cima è GPT-6 Astra a max effort, agente Codex, 58,2% ±2,8; il secondo è Claude Fable 5.1 a max effort tramite Claude Code a 57,9% ±3,8; il terzo è Claude Opus 5 con xhigh tramite Claude Code a 53,9% ±3,2. Quindi il 66,4% non è soltanto un numero diverso dal 59,6% indipendente — non compare nella classifica pubblica, e la versione della classifica stessa di Claude Opus 5 è 53,9%, non il 52,3% che stampa la tabella di lancio. Finché Terminal-Bench non accetta e pubblica una submission di Opus 5.5, il 66,4% è un risultato di harness di un fornitore che nessuno ha riprodotto, e il 59,6% è il numero che una parte esterna sottoscriverebbe davvero. Nota anche che su quella stessa classifica il leader di Terminal-Bench 4.0 di Artificial Analysis e Opus 5.5 di Anthropic arrivano allo stesso 59,6% — il che è un pareggio in un harness, e non ti dice nulla sull'altro.

Effort-dial infographic for Claude Opus 5.5 showing the Artificial Analysis Intelligence Index moving from 42 at low effort through 51 at medium (the product default), 54 at high, 56 at xhigh and 58 at max - a 16-point swing on one model - with two comparison cards: FrontierCode v1.1 at 54.4 xhigh against 54.6 medium (effort-insensitive) and CursorBench 4.0 at 57.8 xhigh against 52.5 medium (effort-sensitive).

Le righe in cui Opus 5.5 perde

Un riepilogo che omette le perdite non è un riepilogo, e la tabella di Anthropic stessa le contiene entrambe.

Terminal-Bench-Science 0.1 — 58,7% contro il 64,6% di GPT-6 Astra.Dichiarato dal fornitore, sulla tabella di Anthropic, e una perdita di 5,9 punti rispetto a un concorrente nominato sulla riga più vicina al ragionamento scientifico. La nota sull'errore standard dello stesso fornitore (±3,5 a ±5) significa che il divario è vicino al confine del rumore anziché comodamente al suo interno — ma è una perdita sulla pagina del fornitore stesso, e l'intervallo non la trasforma in una vittoria. Claude Opus 5 si colloca al 29,0% sulla stessa riga, quindi il guadagno generazionale è reale anche dove il concorrente è in vantaggio.

AutomationBench — 40,0% contro il 41,4% di GPT-6 Astra. Dichiarato dal fornitore, una perdita di 1,4 punti, e l'esecuzione non prevedeva modelli di fallback, quindi gli interventi di salvaguardia sono stati valutati come fallimenti. Ciò significa che questo particolare confronto misura Opus 5.5 con la sua penalità di routing inclusa contro un concorrente la cui penalità di routing, qualunque essa sia, non è descritta. È la riga meno interpretabile della pagina, in un senso o nell'altro.

Altri due punti in cui il vantaggio è più sottile di quanto suggerisca il titolo, entrambi riportati dal fornitore. Su Humanity's Last Exam with tools il margine rispetto a Claude Fable 5.1 è di 2,1 punti (67,7% contro 65,6%); su Chartography with tools è di 0,6 punti (89,0% contro 88,4%); su OSWorld 2.0 partial è di 1,1 punti (81,8% contro 80,7%). Queste sono le righe in cui "Opus 5.5 è il miglior modello agentico" è un'affermazione sulla posizione in classifica più che su un divario misurato, e una differenza di 0,6 punti nella lettura dei grafici non dovrebbe decidere un acquisto.

La posizione indipendente di Claude Fable 5.1, su una diversa revisione dell'indice

Mettere Opus 5.5 a confronto con il suo diretto fratello richiede una sezione a parte, e richiede anche un avviso allegato, perché il confronto è più difficile di quanto non sembri.

Quando Artificial Analysis ha pubblicato la sua analisi su Claude Fable 5.1 il 1° settembre 2026, questo ha ottenuto 66 con sforzo massimo sul suo Intelligence Index ed è stato definito il punteggio più alto che avesse misurato — davanti a Claude Opus 5 con 63 e GPT-5.6 Sol con 61. Nell'indice, così come è elencato il 24 settembre 2026, lo stesso modello appare a 53 con sforzo massimo e fallback, e Opus 5.5 appare a 58 nella configurazione equivalente. L'analisi del 22 settembre su Opus 5.5 definisce 58 "il punteggio più alto che abbiamo misurato, superiore di diversi punti".

Quelle due affermazioni non possono essere entrambe vere sulla stessa scala, e la soluzione è che non si trovano sulla stessa scala. L'indice è un oggetto dinamico che Artificial Analysis aggiorna; due dei suoi articoli pubblicati, a cinque settimane di distanza, collocano la stessa coppia di modelli affini su lati opposti del primo posto. Questa è un'affermazione sulle revisioni dell'indice, non sul fatto che l'uno o l'altro modello sia regredito, e significa che il 66 e il 58 non devono mai essere stampati fianco a fianco. Letti lo stesso giorno, nello stesso elenco, nella stessa configurazione etichettata, l'ordinamento attuale vede Opus 5.5 cinque punti avanti rispetto a Fable 5.1 — e anche questo è un confronto sullo stesso indice, con lo stesso fornitore dell'indice, non un confronto diretto verificato. Ciò che si può dire con sicurezza è più limitato: sulla revisione attuale dell'unico composito indipendente che misura entrambi, Opus 5.5 è il più forte dei due modelli Anthropic, e il 66 più noto di Fable 5.1 appartiene a una revisione precedente di quell'indice.

Le impostazioni meritano un'ultima frase, perché è facile confonderle. Il 66 di Fable 5.1 e il 58 di Opus 5.5 sono entrambe righe a sforzo massimo — ma le cinque impostazioni di sforzo di Fable 5.1 coprono un intervallo di 11x nell'uso di token in output, da 13,1M con sforzo basso a 143,7M con sforzo massimo, con punteggi di indice da 58 a 66. Un singolo punto di indice per un modello con una dispersione interna così ampia è un misero sostituto della riga che eseguiresti davvero.

Il costo dei token è un asse di benchmark a sé stante

Ogni numero sopra è un punteggio. Nessuno di essi è una fattura, e su questo modello la fattura è dove si trova il movimento interessante.

Artificial Analysis misura Claude Opus 5.5 al massimo sforzo utilizzando nell'ordine di 119.000 token di output per attività dell'Intelligence Index — il valore più alto nel suo indice. Per confronto, sulla stessa classifica con la stessa impostazione: Claude Opus 5 circa 73.000, Claude Fable 5.1 circa 78.000, e GPT-6 Astra circa 27.000. I token di ragionamento vengono fatturati come token di output, e il pensiero adattivo non può essere disattivato su Opus 5.5, quindi i token che un modello spende per deliberare non sono una nota a piè di pagina del suo prezzo — ne costituiscono la maggior parte.

Fate il calcolo, perché il prezzo di listino di per sé è fuorviante. Opus 5.5 è listato a $4,00 input / $20,00 output, un taglio del 20% rispetto ai $5,00 / $25,00 di Opus 5. Artificial Analysis misura comunque Opus 5.5 al massimo sforzo con un costo di circa $5,98 per attività dell'indice contro $5,86 per Opus 5 alla stessa impostazione — leggermente di più, non di meno, perché circa 1,6 volte i token di output si mangiano l'intero taglio del 20% e anche qualcosa in più. Sull'intero indice, Opus 5.5 ha prodotto 260M token di output contro una mediana del leaderboard di 88M, che il valutatore etichetta come "molto prolisso".

Il discorso sui costi risiede quindi interamente nell'impostazione dell'effort, e funziona solo se la si utilizza. All'effort massimo, Opus 5.5 è un modello più costoso per attività completata rispetto al modello che sostituisce. A livello medium — il default effettivo del prodotto, nonché l'ambito a cui è circoscritta l'affermazione di Anthropic di un «costo inferiore di circa il 40% su carichi di lavoro tipici» — il risparmio è reale, ma riguarda una media su carichi di lavoro selezionati dal fornitore, non un risultato per attività verificato da un audit. L'interpretazione pratica: il taglio di prezzo del 20% è uno sconto sul listino e un'opzione sul selettore dell'effort, non un risparmio automatico. Se il tuo piano di migrazione è «sostituisci l'ID del modello e mantieni le impostazioni», stai comprando la versione costosa.

Che cosa non è affatto stabilito?

Questa è la sezione a supporto della quale esiste il resto della pagina.

Non è stato pubblicato alcun confronto diretto testa a testa a parità di effort e di harness di Claude Opus 5.5 contro qualsiasi rivale nominato.Ogni confronto tra fornitori diversi presente in questa pagina — Opus 5.5 vs GPT-6 Astra, vs GPT-5.6 Sol, vs Claude Fable 5.1 — è un confronto tra due tabelle prodotte da due aziende diverse, su due harness diversi, con due impostazioni di effort diverse, una delle quali è di solito il modello dello stesso fornitore a un'impostazione favorevole. Non esiste da nessuna parte, nel registro pubblico, un esperimento che mantenga costanti lo scaffold e l'effort tra due fornitori e li riporti entrambi.

La suddivisione dei token per singolo problema non è pubblicata. Il dato aggregato dei token di output è misurato in modo indipendente, ma quanto di esso sia testo di ragionamento e quanto testo di risposta non è pubblicato da nessuno che siamo riusciti a trovare. Qualsiasi pagina che ti fornisca un numero preciso di token di ragionamento per questo modello ti sta dando un numero che nessuno ha misurato.

La maggior parte della scheda di sistema non è stata valutata con benchmark da terzi. SWE-bench Pro 89,9%, Multilingue 93,9%, DeepSWE v1.1 74,2%, ProgramBench 91,2%, OfficeQA 78,9%, HealthBench Professional 65,6% corretto per la lunghezza, GMMLU 94,3%, ArXivMath 96,9% con strumenti — tutti dichiarati dal fornitore, nessuno riprodotto in modo indipendente al momento della stesura.

La cifra di punta di Terminal-Bench 4.0 non è presente nella classifica pubblica. Ne abbiamo parlato sopra, e rientra anche in questo elenco: il numero più citato in assoluto su questo modello è uno che nessuno al di fuori del fornitore ha eseguito.

Anthropic riferisce che Claude Opus 5.5 «spesso sospetta di essere oggetto di valutazione» — parole dell'azienda stessa, offerte come limite alla sua valutazione di sicurezza. Prendiamolo sul serio come problema di misurazione e non come una curiosità: se il modello si comporta diversamente quando crede di essere messo alla prova, allora ogni numero di benchmark presente in questa pagina, di un fornitore o indipendente che sia, è la misurazione del modello sotto osservazione, e quanto ciò differisca dal comportamento in produzione è ignoto e non quantificato. Vale allo stesso modo per le righe buone e per quelle cattive. È l'unica avvertenza che nessuna metodologia di sforzo comparabile riesce a correggere.

Sonnet 5.5 e Haiku 5.5 non sono disponibili. Anthropic li ha annunciati per "le prossime settimane". Non sono stati rilasciati, non hanno benchmark pubblicati e nulla di quanto contenuto in questa pagina è a essi trasferibile.

Prezzo, envelope e le parti della specifica che modificano il tuo codice

Letto dalla tabella tariffaria pubblicata da Anthropic il 24 settembre 2026: 4,00 $ per milione di token di input, 20,00 $ per milione di output, 0,20 $ per milione di lettura della cache, 5,00 $ per milione di scrittura della cache a 5 minuti, 8,00 $ per milione di scrittura della cache a 1 ora, e sconto del 50% in entrambe le direzioni sull'API Batch. La tariffa di lettura della cache è quella silenziosa — è il 5% dell'input di base, mentre la maggior parte dei modelli Claude si attesta al 10% e Fable 5.1 al 2,5%. La modalità fast ha un prezzo separato di 8,00 $ / 40,00 $ e Anthropic la descrive come anteprima di ricerca, non come livello generale.

Questa è la sezione in cui una tabella tariffaria smette di essere una curiosità e diventa aritmetica che un router può fare per te. Claude Opus 5.5 viene servito come anthropic/claude-opus-5.5 su OrcaRouter agli stessi $4,00 / $20,00, con prezzi di listino trasferiti con markup allo 0% — quindi nel momento in cui Anthropic cambia una tariffa, quella è la tariffa qui, lo stesso giorno e senza alcun ritardo di riprezzamento da mettere in conto. Gli elementi che determinano la bolletta reale sono quelli che il catalogo riporta accanto al prezzo: la lettura della cache a $0,20 al 5% dell'input di base contro il 2,5% di Fable 5.1, la finestra di contesto da 1M di token e il tetto di output di 128K. Poiché è sul parametro effort che il costo di questo modello si muove davvero — un'oscillazione dell'indice di 16 punti e circa 119.000 token di output per attività al massimo, contro circa 73.000 per Opus 5 — la migrazione che fa risparmiare è quella che ti permette di regolare l'effort per carico di lavoro anziché per account, e di mettere la rotta Opus 5.5 dietro un failover automatico mentre misuri quale impostazione preferisce il tuo traffico.

Envelope — contesto da 1M token, output massimo di 128K, output di 300K sulla Batch API dietro l'header betaoutput-300k-2026-03-24, conoscenze aggiornate fino a giugno 2026, dismissione non prima del 22 settembre 2027. L'output è oltre il 30% più veloce di Claude Opus 5.

Modifiche incompatibili rispetto a Opus 5 — il ragionamento non può più essere disabilitato; l'uso forzato degli strumenti (un tool_choice che specifica un determinato strumento) restituisce un errore; i blocchi di ragionamento sono vincolati al modello e alla conversazione che li ha prodotti; il vecchio computer_20251124 strumento computer-use non è accettato sull'API Claude o su Google Cloud. I primi tre si applicano anche a Fable 5.1. C'è un quinto silenzioso: il testo tra le chiamate agli strumenti ora arriva all'interno di blocchi di ragionamento il cui testo è vuoto con l'impostazione di visualizzazione predefinita, quindi un'interfaccia utente che mostra quel testo in streaming come indicatore di avanzamento diventa silenziosa senza che si verifichi alcun errore.

Instradamento delle salvaguardie, di nuovo, perché è una voce di specifica e non una nota a piè di pagina — la maggior parte delle richieste di sicurezza informatica viene indirizzata a Claude Opus 4.8, mentre il lavoro di biologia usa Claude Opus 5 come fallback, a meno che l'account non sia verificato. In quelle valutazioni, la risposta che ricevi potrebbe non provenire affatto da Opus 5.5, quindi i punteggi pubblicati sui benchmark affini alla cybersecurity e alla biologia non sono misurazioni pulite di questo modello.

Dichiarazioni di efficienza, tutte riportate dal fornitore — circa il 40% di costi di esecuzione in meno su carichi di lavoro tipici a fronte di un taglio del 20% sul prezzo di listino; un esempio pratico di analisi di fusione che richiede 63 minuti su Opus 5.5 contro 93 su Opus 5 con il 50% di costi in meno; e dichiarazioni dei clienti di Box (un terzo dei token, risposte circa il 40% meno prolisse), Kiro (all'incirca la metà dei token, il 40% di chiamate in meno), Factory (20–25% di token di output in meno) e GitHub (tra il minor numero di token e di passaggi che abbia misurato). Sono medie calcolate su carichi di lavoro selezionati dal fornitore e dai suoi partner di lancio. Sono attribuzioni, non risultati verificati, e sono in evidente tensione con il dato indipendente di costo per attività riportato sopra — che a sua volta è una misurazione a sforzo massimo anziché alle impostazioni predefinite. Entrambe le cose possono essere vere; nessuna delle due è un'affermazione generale sul vostro carico di lavoro.

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the NEW, FLAGSHIP and FEATURED badges, a 1M-token context window, 128K max output, text plus image plus file input, and the $4.00 input / $20.00 output per 1M token rate with pricing passed through from Anthropic.

Lo stato delle prove

Claude Opus 5.5 è un modello reale, con un reale taglio delle tariffe, una reale finestra di 1M di token di contesto e 128K di output, e un cambiamento reale e denso di conseguenze nel modo in cui vengono configurati pensiero ed effort. Arriva inoltre con una tabella di benchmark che misura principalmente Anthropic, una tabella indipendente che misura soprattutto un deployment instradato anziché un checkpoint, e un problema di autoconsapevolezza documentato che mina entrambe. Non è stato pubblicato alcun confronto testa a testa indipendente, a parità di effort e di harness, tra Claude Opus 5.5 e un rivale esplicitamente nominato. Finché non ne esisterà uno, leggi ogni confronto tra vendor su questa pagina per quello che è: due tabelle di fornitori provenienti da due aziende con due impostazioni, messe una accanto all'altra da noi — e rimisura la tua impostazione di effort prima di rimisurare il modello.

Confrontati in questo articolo4

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno