Una scheda del titolo generata con l'intestazione «livello a 165», il sottotitolo «Epoch Capabilities Index, documento del 1º ottobre 2026», tre schede statistiche che riportano 165 (Claude Sonnet 5.5), 165 (Claude Fable 5.1) e 11 vs 20 (valutazioni benchmark alla base di ciascun dato), e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Claude Sonnet 5.5 pareggia Claude Fable 5.1 nell'Epoch Capabilities Index

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Un pareggio in cima a una classifica è di solito la cosa meno interessante che ci sia. Questa è l'eccezione, perché i due modelli a pari merito in cima non costano gli stessi soldi. Nel file dell'Epoch Capabilities Index aggiornato al 1° ottobre 2026, Claude Sonnet 5.5 e Claude Fable 5.1 segnano entrambi 165 — righe tre e quattro di 253 modelli monitorati — due punti dietro Claude Opus 5.5 e GPT-6 Astra, che sono a loro volta appaiati a 167, e due punti sopra Claude Opus 5 a 163. Claude Sonnet 5.5 è stato rilasciato il 28 settembre 2026 a 2 $ per milione di token in input e 10 $ per milione in output. Claude Fable 5.1 è stato rilasciato il 1° settembre a 10 $ e 50 $. Un singolo numero dice che i due sono intercambiabili in quanto a capacità generale. Cinque volte il prezzo di output dice che non lo sono. Entrambe le cose stanno in piedi, e la ragione per cui stanno in piedi insieme è la parte della tabella che nessuno cita.

Che cos'è effettivamente l'indice, e chi lo misura

L'ECI non è una classifica dei fornitori. È costruito da Epoch AI, un'organizzazione di ricerca indipendente, come un composito che unisce i punteggi di più di cinquanta benchmark distinti in un'unica scala di capacità generale, inferendo la difficoltà relativa di ciascun benchmark dai modelli che si trovano a comparire su diversi di essi contemporaneamente. La metodologia è descritta in un paper, “A Rosetta Stone for AI Benchmarks”, finanziato da Google DeepMind e scritto con ricercatori del suo team AGI Safety & Alignment — ma Epoch dichiara chiaramente che l'indice è un suo prodotto e che ne detiene tutti i diritti, e il codice di fitting è pubblico. Questa distinzione conta quando il finanziatore della ricerca e chi pubblica il punteggio non sono la stessa parte.

Due proprietà della scala determinano come può essere letto un numero su di essa. La prima è che l'ECI è ancorato anziché assoluto: i valori grezzi vengono riscalati in modo che Claude 3.5 Sonnet si attesti a 130 e GPT-5 a 150, il che significa che una cifra ha senso solo accanto a un'altra cifra proveniente dallo stesso file. La seconda è che non esiste un tetto. Non c'è un 100 a cui avvicinarsi, quindi “il vertice dell'indice” è un'affermazione su una data, non su un limite che qualcuno abbia raggiunto.

La terza proprietà è quella che trasforma un pareggio in una storia. Gli intervalli pubblicati accanto a ciascun punteggio — intervalli bootstrap al 90%, costruiti ricampionando cinquecento volte i risultati di benchmark osservati di ciascun modello — sono identici per i due modelli a 165: da 162 a 169 per Claude Sonnet 5.5 e da 162 a 169 per Claude Fable 5.1. I conteggi che li hanno prodotti non lo sono. Il 165 di Claude Sonnet 5.5 è stimato da 11 valutazioni di benchmark. Quello di Claude Fable 5.1 è stimato da 20.

Perché lo stesso intervallo non significa la stessa evidenza

L'ECI richiede un minimo di quattro valutazioni benchmark prima che a un modello venga assegnato un punteggio, quindi entrambe le cifre superano comodamente la soglia minima. Ma l'intervallo è un'affermazione su quanto si disperdono i risultati di un modello stesso, non su quanto siano numerosi — ed è per questo che due modelli possono riportare la stessa banda intorno alla stessa stima puntuale mentre uno dei due poggia su circa la metà dell'evidenza. Considera i due 165 come ugualmente solidi e avrai letto l'intervallo come una correzione per la dimensione campionaria che non è.

L'asimmetria ha una conseguenza pratica per la tempistica. Epoch riadatta l'intero modello congiuntamente su tutti i dati ogni volta che arrivano nuove valutazioni, quindi il valore di un modello può spostarsi senza che nulla di quel modello cambi. Il modello con 11 osservazioni ha più margine di movimento di quello con 20, il che rende Claude Sonnet 5.5 il più probabile dei due a spostarsi nella prossima revisione — in una direzione o nell'altra.

L'inquadramento che Epoch stesso dà della lettura attuale è più ristretto rispetto ai titoli che ha prodotto. Il riepilogo dell'aggiornamento fatto dall'organizzazione si apre con Claude Opus 5.5 che conquista il primo posto a 167, davanti di poco a GPT-6 Astra, e dedica la seconda frase al fatto che Claude Sonnet 5.5 ha «all'incirca eguagliato» Claude Fable 5.1 a 165. All'incirca eguagliato è la locuzione decisiva, e gli intervalli pubblicati sono il motivo per cui è quella giusta.

Dove i due profili divergono effettivamente

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Fable 5.1 - the scoreboard'. Left column 'Claude Sonnet 5.5': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 11', 'Mystery Game Puzzles: 65%', 'Furniture Assembly: 75%', 'Price: $2 / $10'. Right column 'Claude Fable 5.1': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 20', 'Mystery Game Puzzles: 58%', 'Furniture Assembly: 70%', 'Price: $10 / $50'. A footer line reads 'Epoch Capabilities Index, file updated 1 October 2026; prices per the vendors' own rate cards.'

Essere allo stesso livello sul composito non significa esserlo sulle singole parti. Epoch pubblica un pannello per benchmark su ogni pagina di modello, e sei benchmark compaiono sia sulla pagina di Claude Sonnet 5.5 sia su quella di Claude Fable 5.1: il che rende questi gli unici sei per cui è disponibile un confronto omogeneo direttamente dall'indice stesso.

• Puzzle dei giochi investigativi — Claude Sonnet 5.5 65% vs Claude Fable 5.1 58%

• FrontierMath Livelli 1–3 (v2) — Claude Sonnet 5.5 89% vs Claude Fable 5.1 90%

• FrontierMath Livello 4 (v2) — Claude Sonnet 5.5 80% contro Claude Fable 5.1 88%

• OTIS Mock AIME 2024–2025 — Claude Sonnet 5.5 100% contro Claude Fable 5.1 100%

• Benchmark di montaggio mobili — Claude Sonnet 5.5 75% vs Claude Fable 5.1 70%

• SimpleQA Verified — Claude Sonnet 5.5 47% vs Claude Fable 5.1 71%

Quattro punti di movimento in un senso o nell'altro su un composito così affollato, e la divisione di fondo non è neanche lontanamente simmetrica. Claude Sonnet 5.5 è in vantaggio dove il lavoro è simile a un gioco e multimodale — risoluzione di puzzle, assemblaggio fisico — e alla pari nella matematica competitiva. Claude Fable 5.1 è in vantaggio di 8 punti sul livello più difficile di FrontierMath e di 24 punti su SimpleQA Verified, il set di conoscenze sul mondo in cui un punteggio del 47% contro un 71% è il singolo divario più ampio nel pannello condiviso. Un acquirente che sceglie tra questi due modelli non sta scegliendo tra due letture della stessa capacità; sta scegliendo tra un modello più economico, più forte su alcuni lavori, e uno più caro, più forte su altri lavori, con un indice di capacità generale che rinuncia a separarli.

L'indice di Epoch afferma anche esplicitamente che un vantaggio su un singolo benchmark non deve necessariamente comparire nel composito. I benchmark non sono ponderati in base all'accuratezza, e un modello specializzato può ottenere un punteggio inferiore a un rivale di forma diversa pur essendo in testa nei singoli test — la sua documentazione lo dice direttamente. Non è un difetto che viene giustificato; è proprio a questo che serve un composito su una cinquantina di test.

I due strumenti indipendenti indicano direzioni opposte

A capture of the Epoch AI model page for Claude Sonnet 5.5, headed ECI #3, Anthropic, Sep. 28, 2026, Closed weights, and the line that it has an ECI score of 165 and ranks 3rd of 253 tracked models. Beneath it a comparison table headed 'Claude Sonnet 5.5 vs select alternatives' carries four columns - Claude Sonnet 5.5, Claude Opus 5.5, GPT-6 Astra and Kimi K3 - with an ECI score row reading 165, 167, 167 and 158, a ranking row reading #3, #1 - Best, #2 and #13, and per-benchmark rows for Mystery Game Puzzles, FrontierMath Tiers 1-3 (v2), FrontierMath Tier 4 (v2), OTIS Mock AIME 2024-2025, Furniture Assembly Benchmark, SciCode, GPQA Diamond, Text Arena (Coding) and SimpleQA Verified.

Esiste una seconda misurazione indipendente in circolazione, e non concorda con la prima su quale dei due modelli sia in vantaggio. Sull'Artificial Analysis Intelligence Index, le cifre che il nostro catalogo riporta per i due modelli sono 56 per Claude Sonnet 5.5 e 53.4 per Claude Fable 5.1, tratte dalla stessa revisione di quell'indice e quindi basate sullo stesso campione di modelli valutati. Tre punti di distanza, a favore del modello più economico — laddove Epoch li legge come identici.

Nessuna delle due letture è sbagliata, e il modo di usarle è notare su cosa non concordano. I due indici coprono set di benchmark diversi e li pesano in modo diverso; il composito Epoch è costruito per sopravvivere alla saturazione dei benchmark, mentre l'indice Artificial Analysis è un aggregato diretto di un paniere diverso. Quando una coppia di modelli è così vicina, la scelta dello strumento vale più del divario misurato. Un lettore che vuole il più forte tra due numeri adiacenti dovrebbe guardare il pannello dei singoli benchmark condivisi qui sopra anziché l'uno o l'altro dato principale, perché è l'unico posto in cui i due modelli vengono confrontati tra loro sullo stesso test.

C'è un ulteriore elemento di contesto che il composito non riporta, mentre Epoch sì: la data di rilascio. Claude Fable 5.1 oggi si classifica quarto su 253 modelli monitorati. Al momento del suo rilascio, il 1° settembre 2026, era primo sui 247 modelli allora monitorati. I suoi pesi non sono cambiati. La frontiera l'ha semplicemente scavalcato di sei posizioni nell'arco di un mese — che è la forma dell'intera tabella, e il motivo per cui una lettura mensile dell'indice è un'istantanea anziché un verdetto.

Quanto costa la differenza, e dov’è il lato economico

A capture of the OrcaRouter model page for Claude Sonnet 5.5, listed under anthropic/claude-sonnet-5.5, showing a 1M-token context window with up to 128K output tokens, input pricing at $2.00 per million tokens and output at $10.00 per million tokens, and the catalogue's capability tags for the model.

Essere sullo stesso livello quanto a capacità generale e distare 2,5 volte l'uno dall'altro sull'input e 5 volte sull'output è l'intero contenuto pratico di questa lettura. Entrambi i modelli sono presenti nel nostro catalogo — anthropic/claude-sonnet-5.5 a $2.00 per milione di token in input e $10.00 per milione in output, con letture dalla cache a $0.20, e anthropic/claude-fable-5.1 a $10.00 e $50.00 con letture dalla cache a $0.25 — ed entrambi vengono passati al prezzo di listino del provider stesso senza alcun ricarico aggiunto, così una variazione delle tariffe del fornitore arriva da noi lo stesso giorno in cui arriva da loro.

La ricorrenza conta più del titolo. Prendi un carico di lavoro che invia un prefisso da 120.000 token dalla cache e genera 8.000 token di output, eseguito una volta al giorno per un mese. Su Claude Sonnet 5.5 quel prefisso costa 120.000 token a $0,20 per milione, circa 2,4 centesimi, più 8.000 a $10 per milione, 8 centesimi — all'incirca 10,4 centesimi per esecuzione, ovvero circa $3,12 in trenta giorni. Su Claude Fable 5.1 lo stesso prefisso è 120.000 a $0,25, 3 centesimi, più 8.000 a $50, 40 centesimi — circa 43 centesimi per esecuzione, ovvero $12,90 nell'arco del mese. Entrambi i modelli offrono la stessa finestra da 1M token con output fino a 128K, quindi la differenza è la scheda, non il tetto massimo.

Contro questo, i sei benchmark condivisi indicano in quale direzione il denaro extra compra qualcosa. Un team il cui lavoro assomiglia a FrontierMath Tier 4 o al richiamo fattuale aperto sta comprando un divario reale di 8-24 punti su quei test pagando quattro volte tanto; un team il cui lavoro assomiglia alla risoluzione di enigmi o all'assemblaggio multimodale sta comprando 5-7 punti nella direzione opposta pagando la cifra inferiore. Su un'unica piattaforma queste non sono due decisioni di approvvigionamento. Entrambi i modelli si trovano dietro un'unica chiave API tra oltre 200 modelli, quindi confrontarli sul proprio traffico è una modifica di configurazione invece che un secondo contratto, e dove entrambi vengono instradati, sotto si trova il failover automatico — il che conta quando due strumenti indipendenti non concordano su quale dei due sia in vantaggio.

Cosa sposterebbe questa lettura?

Tre cose lo cambierebbero, e solo una di esse coinvolge uno dei due modelli.

Il primo sono più valutazioni di benchmark. Claude Sonnet 5.5 è entrato nell'indice quattro giorni fa con 11 alle spalle; ogni valutazione aggiuntiva restringe il suo intervallo e può spostare la sua stima puntuale, e un riadattamento congiunto significa che il movimento non è confinato alla nuova riga.

Il secondo è l'arrivo di un altro modello di frontiera. Le prime quattro righe coprono quattro punti, con due ex aequo all'interno di tale intervallo, quindi un singolo nuovo arrivato ben valutato si colloca all'interno del gruppo anziché al di sotto di esso — e gli intervalli pubblicati, che si sovrappongono tra tutti e quattro, significano che l'ordinamento tra di essi è uno spareggio più che una misurazione.

Il terzo è il prezzo dei modelli stessi, che nessun indice monitora. Il divario su cui si concentra questo articolo è un divario di listino: 2 $ e 10 $ contro 10 $ e 50 $ oggi. Un cambiamento su uno dei due listini sposta la decisione senza spostare un singolo punteggio di capacità.

Il riassunto difendibile è quello ristretto. Nel composito di Epoch AI, in un file aggiornato al 1 ottobre 2026, Claude Sonnet 5.5 e Claude Fable 5.1 hanno lo stesso numero — 165, a pari merito al terzo posto, con intervalli pubblicati identici che si basano su quantità diverse di prove. Sullo strumento separato di Artificial Analysis gli stessi due modelli distano tre punti. Sui sei benchmark in cui l'indice li confronta direttamente, si scambiano il vantaggio a seconda del dominio invece di essere alla pari. E sul listino prezzi non sono affatto vicini. L'unica cosa che questa lettura non può sostenere è la frase con cui è più probabile che venga citata: che i modelli sono equivalenti.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno