Una card del titolo con la scritta "Claude Opus 5.5 in cima al Coding Agent Index con 66" e il sottotitolo "Token più economici, un conto più salato per le attività" e tre card arrotondate sotto di essa: Coding Agent Index 66, Costo per attività $13,04 in aumento del 21%, e Claude Opus 5: 60 a $10,79.
Guides & Insights

Claude Opus 5.5 guida il Coding Agent Index a 66 — e il conto dei task sale del 21%

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il fornitore ha ridotto del 20% i prezzi dei token di Claude Opus 5.5 il 22 settembre 2026. Due giorni dopo, Artificial Analysis ha pubblicato la misurazione dell'agente di coding che mostra cosa ha fatto quello sconto alla bolletta di un agente: il costo per attività è aumentato del 21%, arrivando a $13.04, rispetto ai $10.79 che lo stesso indice addebita per Claude Opus 5. Anche il punteggio è salito — 66 sul Coding Agent Index, che Artificial Analysis descrive come il più alto mai misurato, sei punti sopra Claude Opus 5 e quattro sopra Claude Fable 5.1 nella stessa configurazione. Entrambe le cose sono vere allo stesso tempo, e il motivo per cui sono vere allo stesso tempo è tutta la storia di questa classifica. Un token più economico di cui un modello consuma di più non è un'attività più economica, e al massimo sforzo di ragionamento su lunghe esecuzioni di un agente, Claude Opus 5.5 ne consuma molti di più.

Cosa valuta davvero il Coding Agent Index

Questa non è una classifica di modelli. Ogni riga che vi compare è una coppia harness-modello — un checkpoint in esecuzione all'interno di uno specifico agente di programmazione, con una specifica impostazione di effort. La riga che tutti citano è Claude Opus 5.5 con effort max dentro Claude Code, che è l'harness su cui Anthropic sviluppa e mette a punto. Il 60 di Claude Opus 5 e il 62 di Claude Fable 5.1 provengono dallo stesso harness e dalla stessa impostazione di effort, ed è questo che li rende confronti onesti; una riga per l'uno o l'altro modello in un agente di programmazione diverso è una misurazione diversa e non viene stampata qui come se fosse la stessa.

L'indice è soggetto a versioning, e la versione conta più del nome del marchio che vi è riportato. La classifica attualmente pubblicata come v1.5 calcola la media di tre valutazioni, ciascuna ponderata in modo uguale, ciascuna riportata come pass@1 mediato su tre tentativi per attività:

Terminal-Bench 4.0 — lavoro agentico con la shell e la riga di comando: navigare un filesystem, usare correttamente gli strumenti, riprendersi da un errore intermedio e portare a termine un flusso di lavoro composto da più passaggi.

DeepSWE v1.1 — attività di ingegneria del software, il lavoro di modifica del repository.

SWE-Atlas-QnA — domande di comprensione del repository, in cui la risposta si trova leggendo una base di codice anziché modificandola.

Tre valutazioni, un numero, e una colonna del costo per attività stampata accanto. Quella colonna dei costi è il motivo per cui questo indice è più utile di un punteggio da solo, ed è anche il motivo per cui il numero principale è più difficile da leggere di quanto sembri.

A two-column scoreboard comparing Claude Opus 5.5 against Claude Opus 5, both in the Claude Code harness at max reasoning effort: Coding Agent Index 66 vs 60, Terminal-Bench 4.0 63.1% vs 54.5%, DeepSWE v1.1 68.4% vs 62.5%, SWE-Atlas-QnA 66.4% vs 62.1%, cost per task $13.04 vs $10.79, and tokens per task 15.6M vs 11.4M.

I tre componenti, e da dove provengono i sei punti

Artificial Analysis ha pubblicato le righe dei componenti accanto al composito, e non si muovono in modo uniforme:

Terminal-Bench 4.063,1% per Claude Opus 5.5 contro 54,5% per Claude Opus 5, un guadagno di 8,6 punti. Questo è il miglioramento singolo più ampio del set.

DeepSWE v1.168,4% contro 62,5%, in aumento di 5,9 punti.

SWE-Atlas-QnA66,4% contro 62,1%, in aumento di 4,3 punti.

Se fai la media di quei tre, ottieni 66,0, che è il punteggio composito. La forma del miglioramento è la parte interessante: il modello è migliorato meno nel leggere una base di codice e di più nel pilotare una shell. Terminal-Bench è la valutazione più vicina a ciò che le persone intendono davvero con "coding agent" — un loop di lunga durata in cui il modello sceglie i comandi, legge l'output e decide cosa fare dopo, senza esseri umani nel loop tra uno step e l'altro. Un salto di 8,6 punti lì è un'affermazione sull'uso sostenuto degli strumenti, non sulla generazione di codice.

Nota che cosa implica riguardo a dove aspettarsi il miglioramento. Se il tuo carico di lavoro è «spiegare questo repository», Claude Opus 5.5 è un upgrade modesto rispetto a Claude Opus 5 — quattro punti. Se il tuo carico di lavoro è «eseguire finché la suite di test non passa, correggendo ciò che si rompe», è il balzo più grande della tabella.

Screenshot of the Artificial Analysis Coding Agent Benchmarks page, showing the Coding Agent Index v1.5 composite of three equally weighted evaluations — DeepSWE v1.1 at 113 tasks by Datacurve, Terminal-Bench 4.0 at 66 tasks by Laude Institute and SWE-Atlas-QnA at 124 tasks by Scale AI — with Claude Opus 5.5 at 66 at the top of the index highlight chart and a cost-per-task bar of about $13.

Il numero stampato accanto alla classifica: $13.04 per attività

Ecco l'aritmetica che fa sembrare il taglio di prezzo diverso da come è stato annunciato. Il prezzo di listino di Anthropic per Claude Opus 5.5 è 4,00 $ per milione di token di input e 20,00 $ per milione di output, in calo rispetto a 5,00 $ e 25,00 $ per Claude Opus 5, con le letture dalla cache in calo del 60% a 0,20 $ per milione. Ognuna di queste voci è più economica. La stima di Artificial Analysis di quanto costa un'attività al massimo sforzo è comunque più alta:

Costo per attività — 13,04 $ per Claude Opus 5.5 contro 10,79 $ per Claude Opus 5, in aumento del 21% sullo stesso indice, stesso harness, stessa impostazione di effort.

Token totali per attività — circa 15,6 milioni contro 11,4 milioni, in aumento di circa il 37%.

Token di output per attività — circa 333.000 contro 137.000, più del doppio. L'output è la direzione costosa, ed è la voce che è cambiata di più.

Input in cache per attività — circa 14.6M contro 10.9M, in aumento di circa 34%. Il taglio del 60% delle letture dalla cache qui sta facendo un lavoro concreto; ma non è sufficiente a compensare un'attività che legge un terzo di contesto in più.

Fai il calcolo con le tariffe pubblicate e il risultato salta fuori. Prendi i soli token di output: 333.000 token a $20,00 per milione sono circa $6.66 — all'incirca la metà dell'intera stima di $13,04, da una singola voce che è raddoppiata. La voce di lettura della cache è enorme in volume e quasi gratuita come prezzo: 14,6M token a $0,20 per milione sono meno di $3. Il taglio del 20% è reale e il taglio della cache è reale; al massimo sforzo su un ciclo di agente, vengono semplicemente superati dal peso di un modello che pensa più a lungo e scrive di più.

Questo ha una conseguenza diretta sul modo in cui pianifichi il budget. Se il tuo team esegue 500 attività di agenti di codifica al giorno con il massimo impegno, la differenza tra 10,79 $ e 13,04 $ è di circa 1.125 $ al giorno — circa 34.000 $ al mese — per lo stesso numero di attività. Questo è il numero da mettere davanti a chi approva il cambio di modello, e non è il numero che il taglio di prezzo implica.

Perché $5.98 e $13.04 sono entrambi veri

Artificial Analysis ha pubblicato un diverso valore di costo per attività per lo stesso modello pochi giorni prima, e leggerli insieme senza le etichette li fa sembrare una contraddizione. Non lo sono — sono due valutazioni diverse, e la differenza è istruttiva.

Sull'Intelligence Index, l'analisi del 22 settembre ha indicato il costo per attività di Claude Opus 5.5 a $5,98, più o meno in linea con i $5,86 di Claude Opus 5, nonostante circa 119.000 token di output per attività contro i 73.000 di Opus 5. In quel caso, il taglio del prezzo e i token extra si annullano quasi esattamente. Sul Coding Agent Index, con lo sforzo massimo, in Claude Code, lo stesso modello costa $13,04 contro $10,79.

Entrambe sono misurazioni oneste di carichi di lavoro diversi. Una valutazione di question answering è uno scambio breve; un compito di un agente è un lungo ciclo di chiamate a strumenti con un contesto in crescita, e la crescita si accumula in modo composto nella direzione dell'output, dove il prezzo è più alto. La lezione pratica è che «la riduzione di prezzo compensa i token aggiuntivi?» non ha una risposta unica — dipende dalla lunghezza del compito, e più il compito è lungo e agentico, peggiore diventa la compensazione. Se prevedi il budget a partire da un benchmark di risposte brevi, sottovaluterai il costo di un agente.

Tre avvertenze che vanno sulla riga

Il 66 è un numero di Claude Code, non un numero di modello puro. L'indice abbina deliberatamente i modelli agli harness, sulla base dell'argomento secondo cui il routing degli strumenti, la logica di retry e la gestione del contesto sono inseparabili dalle prestazioni misurate di un agente. Qui questo gioca a favore di Anthropic, perché l'harness in cui viene valutato è il suo. Artificial Analysis segnala come in arrivo una vista di confronto tra harness; finché non esisterà, nessuno può dire quanto del vantaggio di sei punti sia da attribuire al checkpoint e quanto allo scaffolding che lo circonda.

Il dato di Terminal-Bench 4.0 di Anthropic stessa è più alto di questa componente, ed è stato eseguito da Anthropic. Il materiale di lancio riporta 66,4% a xhigh di effort; la componente del Coding Agent Index è 63,1% al massimo, e la corsa indipendente separata di Artificial Analysis ha misurato 59,6% nel proprio harness sulla stessa versione del benchmark. Tre numeri, tre configurazioni, tre produttori. Il 63,1% della riga sopra è la componente propria dell'indice e va confrontato solo con gli altri numeri di quell'indice; il 66,4% del fornitore è dichiarato dal fornitore, non riprodotto da terzi, e appartiene a un'impostazione di effort diversa.

La revisione dell'indice cambia. Questo blog ha riportato righe diverse del Coding Agent Index all'inizio di settembre, su una versione precedente della stessa classifica, e quei dati più vecchi non sono confrontabili con la v1.5 — il set di valutazione stesso è cambiato quando Terminal-Bench 4.0 ha sostituito la versione precedente. I mirror di terze parti contengono ancora snapshot obsoleti con etichette di versione più vecchie. Se un numero per Claude Opus 5.5 su questo indice non proviene dalla riga attuale della v1.5, non metterlo accanto a un numero della v1.5 e non calcolare un delta tra i due.

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the 2026-09-22 date by Anthropic, a 1M-token context window with 128K max output, text plus image plus file input, input $4.00 and output $20.00 per 1M tokens, and a Python snippet calling the model through api.orcarouter.ai.

Cosa distribuire effettivamente

Il ranking è un numero relativo allo sforzo massimo, e lo sforzo massimo è l'impostazione che quasi nessuno dovrebbe usare come impostazione predefinita. Claude Opus 5.5 ha cinque livelli di sforzo — basso, medio, alto, xhigh e max — e il modello usa il medio come impostazione predefinita. Artificial Analysis non ha pubblicato righe del Coding Agent Index ai livelli inferiori, quindi il risparmio di costo in quel caso non è quantificato su questo indice; sull'Intelligence Index, lo stesso modello a medio ha ottenuto 51 — pari al max di Claude Opus 5 — a $1.34 per attività. È in quella direzione che si trovano i risparmi, e si tratta di un'impostazione, non di un modello diverso.

Lo schema realistico è una separazione: mantenere lo sforzo massimo per i lunghi loop autonomi, dove il guadagno di 8,6 punti su Terminal-Bench è ciò che si sta acquistando, ed eseguire il lavoro di routine a uno sforzo inferiore, dove il modello è ancora ben avanti rispetto a dove si è fermato Claude Opus 5. Poiché lo sforzo è un parametro della richiesta e non un deployment, quella separazione è una regola di routing, ed entrambi i modelli si trovano sullo stesso catalogo — i prezzi di listino di Anthropic passati con markup 0%, quindi un taglio di prezzo del fornitore è attivo su anthropic/claude-opus-5.5 lo stesso giorno in cui viene annunciato, e non serve alcun secondo contratto né modifica al codice per fare A/B tra i due rispetto ai propri task. Per il percorso a sforzo massimo nello specifico, dove un singolo task può essere una lunga esecuzione senza supervisione, il failover automatico è ciò che impedisce a un provider bloccato di costarti l'intero loop.

Cosa rimane ancora da misurare

Tre cose cambierebbero questo quadro e nessuna di esse esiste ancora. Non esiste un confronto a sforzo equivalente e con lo stesso harness tra Claude Opus 5.5 e un checkpoint rivale — ogni confronto tra fornitori disponibile è due tabelle di fornitori disposte fianco a fianco. Non esiste alcuna esecuzione pubblicata del Coding Agent Index a sforzo medio o alto, che è dove si collocherebbe la maggior parte del traffico di produzione. E la questione dell'attribuzione all'harness — quanto di un 66 è dovuto al modello e quanto a Claude Code — è stata riconosciuta dall'indice e rinviata.

Quello su cui puoi agire oggi è più ristretto e più utile di una classifica. Claude Opus 5.5 è davvero migliore di Claude Opus 5 nel lavoro agentico prolungato guidato da shell — è l'unica componente con un guadagno ampio, costante e prodotto in modo indipendente. Costa anche di più per attività nell'impostazione in cui quel guadagno è stato misurato, circa $2,25 in più per attività, e il taglio del prezzo per token non arriva a quel numero. Distribuiscilo al massimo sforzo dove il ciclo è lungo e il costo del fallimento è alto; mantieni l'impostazione più economica ovunque altrove; e ricontrolla l'indice quando compaiono le righe a sforzo inferiore, perché è la configurazione che la maggior parte dei team pagherà davvero. Se stai passando solo per il taglio di prezzo, stai comprando la cosa sbagliata — il modello costa meno per token e di più per attività, e solo uno di questi due numeri compare nella tua fattura.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno