
Claude Opus 5.5 vs Claude Opus 5: I livelli di impegno non significano la stessa cosa
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
La prima cosa da sapere prima di confrontare Claude Opus 5.5con Claude Opus 5è che i due modelli non condividono la stessa scala di effort, e quasi tutti i confronti testa a testa che leggerete questa settimana lo ignorano. Opus 5 usa per impostazione predefinita un effort high. Opus 5.5 usa per impostazione predefinita medium, e allo stesso livello nominale pensa di più per turno di quanto facesse il suo predecessore. Quindi "Opus 5.5 al default contro Opus 5 al default" non è un esperimento controllato: è un confronto tra due quantità di pensiero diverse. Il fornitore lo dice apertamente nella propria guida alla migrazione: testate più livelli di effort e non riutilizzate le impostazioni di Opus 5, perché livelli con lo stesso nome non corrispondono allo stesso budget di pensiero. Una volta tenuto conto di questo, il divario tra i due modelli si riduce in alcuni punti, si allarga in altri, e la decisione di aggiornare dipende da qualcosa di diverso dalla capacità grezza: il costo per attività completata e quattro modifiche alle API che romperanno il codice che oggi gira su Opus 5.
Cosa cambia davvero, specifica per specifica

I due modelli sono più vicini sulla carta di quanto suggeriscano i numeri di versione:
• Prezzo — Claude Opus 5.5 a $4,00 input / $20,00 output per milione di token rispetto a Claude Opus 5 a $5,00 / $25,00
• Lettura della cache — 0,20 $ per milione vs 0,50 $ per milione, una riduzione del 60% sulla voce di costo che domina le esecuzioni agentiche
• Scrittura cache — 5 $ per milione per la finestra di 5 minuti e 8 $ per la finestra di 1 ora su 5.5, contro 6,25 $ su Opus 5
• Contesto e output — 1M token di contesto e 128K di output su entrambi; entrambi raggiungono 300K di output sulla Batch API dietro l'output-300k-2026-03-24 header beta
• Impegno predefinito — medio su Opus 5.5 vs alto su Opus 5
• Pensiero — adattivo e sempre attivo in entrambi, ma su Opus 5.5 non può più essere disabilitato in alcun modo
• Data limite delle conoscenze — giugno 2026 vs maggio 2026
• Latenza — Anthropic classifica Opus 5.5 come "moderato" rispetto alla gamma attuale e afferma che genera output oltre il 30% più velocemente di Opus 5
• Dismissione — non prima del 22 settembre 2027 per Opus 5.5, e non prima del 24 luglio 2027 per Opus 5
Nota cosa non è diverso: la finestra di contesto, il tetto di output, lo sconto batch e il modello di pensiero adattivo sempre attivo. Opus 5.5 non è un modello con un contesto più ampio o un output più lungo. È un modello più economico, più veloce e più efficiente in termini di token, sullo stesso perimetro.
Benchmark, e l'asterisco sullo sforzo su ognuno di essi

Queste cifre provengono dal materiale di lancio di Anthropic — riportate dal fornitore, eseguite sui suoi stessi modelli — e qui l'impostazione dell'effort conta più del nome del modello:
• Terminal-Bench 4.0 — 66,4% vs 52,3%, con l'esecuzione di Opus 5.5 con effort xhigh invece che con il valore predefinito
• FrontierCode v1.1 (Main) — 54,4% contro 48,0%, e 54,6% per Opus 5.5 con il livello di impegno medio predefinito
• CursorBench 4.0 — 57,8% vs 46,6%, e 52,5% a medio
• GDPval-AA v2.1 — 1846 Elo vs 1708
• AutomationBench — 40,0% vs 26,9%
• Humanity's Last Exam, con strumenti — 67,7% vs 63,6%
• Terminal-Bench-Science 0.1 — 58,7% vs 29,0%, il divario più ampio del set
• OSWorld 2.0 — 81,8% parziale vs 74,0%
• Chartography, con strumenti — 89,0% vs 83,4%
Il risultato di FrontierCode è quello da studiare. Opus 5.5 ottiene 54,4% a xhigh e 54,6% a medium — statisticamente lo stesso numero, con una frazione del budget di pensiero. Qualunque miglioramento abbia apportato Anthropic, su quel benchmark non deriva dal pensare più intensamente. CursorBench va nella direzione opposta: 57,8% a xhigh contro 52,5% a medium, una differenza di cinque punti che dice che lo sforzo compra ancora accuratezza reale su alcune attività. La lezione non è "usa medium" o "usa xhigh"; è che il livello di sforzo giusto è ormai una misura per singolo carico di lavoro, e la vecchia abitudine di lasciare Opus 5 sul suo default alto non ti dice più nulla sul nuovo modello.
Anthropic aggiunge un avvertimento che vale la pena ripetere: a questo livello di capacità, i margini nei benchmark sono "una guida meno affidabile alle differenze nel mondo reale", e l'azienda afferma che il suo divario interno rispetto a Claude Fable 5.1 è più stretto di quanto lascino intendere i punteggi pubblicati. È un fornitore che ti dice di non leggere troppo nella sua stessa tabella.
Il costo per attività completata è il confronto che decide
Il prezzo per token è l'unità di misura sbagliata per un agente, e questo confronto è il punto in cui ciò emerge. L'esempio fornito da Anthropic stessa: un'analisi di fusione che ha richiesto a Opus 5.5 63 minuti ed è costata il 50% in meno rispetto allo stesso compito su Opus 5, che ha richiesto 93 minuti. Il listino prezzi spiega in parte questo risultato — una riduzione del 20% su input e output, del 60% sulle letture della cache — ma non tutto. Il resto è dovuto al modello che usa meno token e meno turni per arrivare allo stesso punto. Le dichiarazioni dei clienti pubblicate con il lancio indicano la stessa direzione: Box riporta un terzo dei token e risposte circa il 40% meno verbose, Kiro circa la metà dei token con il 40% in meno di chiamate, Factory dal 20 al 25% in meno di token in output, GitHub tra i valori più bassi di token e passaggi che abbia misurato.
Quelle sono dichiarazioni dei clienti pubblicate dai fornitori, non risultati verificati, e la stima aggregata "circa il 40% più economico su carichi di lavoro tipici" è la caratterizzazione di Anthropic di una media sui carichi di lavoro che ha selezionato. La versione onesta per la tua pianificazione: assumi che il taglio del 20% sul prezzo di listino sia reale e su cui puoi contare, tratta il 20% extra come un'ipotesi che puoi testare in un pomeriggio eseguendo lo stesso compito su entrambi i modelli e contando i token.
Una nota strutturale sul perché il taglio della cache ha un impatto superiore al previsto. Un agente che reinvia un lungo prompt di sistema e un albero dei file a ogni turno paga tariffe di lettura della cache sulla maggior parte del suo input, non tariffe di input nuovo. Ridurre quel valore da $0,50 a $0,20 per milione cambia l'economia delle sessioni di lunga durata molto più di quanto faccia la tariffa principale — ed è il motivo per cui un carico di lavoro marginalmente sostenibile su Opus 5 può diventare chiaramente sostenibile su Opus 5.5 senza alcuna modifica ai tuoi prompt.
Le quattro modifiche incompatibili, come checklist di migrazione
Opus 5.5 è un nuovo modello, non un Opus 5 rinominato, e le note di migrazione di Anthropic elencano quattro modifiche che romperanno il codice già in esecuzione in produzione:
• Non è possibile disabilitare il thinking. Qualsiasi percorso di codice che disattivava il thinking genererà un errore o ne modificherà il comportamento, e la profondità ora è controllata solo tramite il parametro effort.
• L'uso forzato di uno strumento restituisce un errore. Un tool_choice che forza uno strumento denominato non è supportato.
• I blocchi di pensiero sono legati al modello che li ha generati e alla conversazione, perciò non possono essere riprodotti tra modelli nel modo in cui alcune pipeline presuppongono.
• Il precedente computer_20251124 strumento di utilizzo del computer non è accettato sull'API di Claude né su Google Cloud.
C'è un quinto cambiamento che non fa fallire nulla e perciò è più pericoloso. Il testo tra le chiamate agli strumenti ora viene restituito all'interno di blocchi di pensiero il cui testo è vuoto con l'impostazione di visualizzazione predefinita. Se la tua applicazione invia in streaming quel testo agli utenti come aggiornamenti di avanzamento, resta silenziosa tra una chiamata agli strumenti e l'altra finché non imposti un valore di visualizzazione che restituisca il testo. Tutti i test passano; l'interfaccia semplicemente smette di narrare.
I primi tre valgono anche per Claude Fable 5.1, quindi un team che è già migrato a quel modello ha svolto parte di questo lavoro. Un team ancora su Opus 5 no.
Quando Opus 5 è ancora la scelta giusta
L'aggiornamento non è automatico, e ci sono quattro buone ragioni per restare:
• Prevedibilità dei costi. Opus 5 è un modello che hai già caratterizzato. Se il tuo budget è modellato sul suo consumo di token, passare a un modello che ragiona in misura diversa allo stesso livello di effort nominale invalida il modello finché non lo rimisuri.
• Compatibilità. Se una qualsiasi parte del tuo stack dipende dalla disattivazione del thinking, dal forzare un tool o dal vecchio strumento computer-use, la migrazione è un lavoro sul codice, non una semplice sostituzione di stringhe.
• Routing di salvaguardia. Opus 5.5 viene fornito con salvaguardie di classe Fable 5.1, il che significa che la maggior parte delle richieste di cybersecurity viene reindirizzata a Claude Opus 4.8 e il lavoro di biologia ricade su Claude Opus 5 a meno che il tuo account non sia verificato. Se il tuo prodotto rientra in uno di questi due ambiti, "l'aggiornamento" può significare che i tuoi utenti ricevono risposte da un modello più piccolo. Opus 5 non ha questo routing.
• Longevità. Opus 5 non ha intenzione di andarsene presto — Anthropic indica il ritiro non prima del 24 luglio 2027, ovvero tra dieci mesi.
Per tutti gli altri i conti sono semplici: più capacità, prezzo più basso, meno token e una checklist di migrazione che un singolo ingegnere può portare a termine in un giorno.
Esecuzione di entrambi durante il passaggio

La parte scomoda di qualsiasi migrazione di un modello di punta è quella centrale: vuoi Opus 5.5 sul nuovo traffico senza scommettere il percorso di produzione su un modello che non hai ancora caratterizzato con le tue impostazioni di effort, e vuoi mantenere Opus 5 in servizio mentre lo scopri. Questo è un problema di routing, non di ri-piattaformizzazione, e vale la pena essere precisi su cosa sta dove. Claude Opus 5 è già su OrcaRouter al prezzo di listino di Anthropic con 0% di ricarico — il prezzo di listino del fornitore passato direttamente, così una variazione delle tariffe del fornitore è attiva dalla nostra parte lo stesso giorno anziché dopo una sincronizzazione. Claude Opus 5.5 non è ancora una delle nostre route; è disponibile tramite l'API di Anthropic e i principali cloud. Quando arriverà, diventerà una route in più sulla stessa chiave invece di un secondo contratto e un secondo SDK, ed è proprio questo che ti permette di mettere una percentuale di traffico sul nuovo modello mentre il failover automatico mantiene il resto su quello che hai già caratterizzato. Comporre una chiamata su entrambi — una bozza da uno e una passata di verifica dall'altro — è una riga di routing-DSL.
Sii preciso su cosa ti dà questo. Non ti fornisce un benchmark indipendente di Opus 5.5; nulla lo fa ancora, perché gli unici confronti diretti pubblicati sono quelli di Anthropic e i tracker indipendenti stanno ancora definendo le configurazioni di effort. Quello che ti dà è l'unica misura che è davvero predittiva della tua bolletta, sui tuoi prompt, al livello di effort che rilascerai.
La regola di decisione
Se stai iniziando qualcosa di nuovo, usa Claude Opus 5.5 e parti con uno sforzo medio, poi misura se basso regge sul tuo compito — Anthropic riferisce che basso si avvicina alle sue impostazioni più elevate in diverse valutazioni di coding a un costo molto inferiore, e i numeri di FrontierCode sopra suggeriscono che l'impostazione predefinita non lascia molto sul tavolo.
Se usi Claude Opus 5 in produzione, il fattore che fa scattare la migrazione non è la tabella dei benchmark. È se riesci ad assorbire quattro modifiche alle API e se il tuo carico di lavoro ricade nella cybersecurity o nella biologia, dove l'instradamento delle salvaguardie passerà silenziosamente parte del tuo traffico a un modello più piccolo. Tutto il resto di questo aggiornamento è un taglio di prezzo che indossa gli abiti di un rilascio di modello, e vale la pena coglierli.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
