
Claude Opus 5.5 guida l'Epoch Capabilities Index con 0,84 punti di vantaggio
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 221 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Il numero è 0,84. Claude Opus 5.5si colloca a 167,35 sull'Epoch Capabilities Index, secondo il file che abbiamo letto il 2 ottobre 2026, con GPT-6 Astraa 166,51 — un divario inferiore a un punto su una scala in cui gli intervalli al 95% pubblicati per i due modelli si sovrappongono quasi completamente, da 164,0 a 172,0 per Opus 5.5 contro 163,14–171,05 per Astra. Al di sotto di loro, Claude Sonnet 5.5ha totalizzato 165,2 e Claude Fable 5.1164,82, per cui le prime quattro voci di un composito indipendente di oltre cinquanta benchmark sono separate da 2,53 punti e tre di esse portano il nome dello stesso fornitore. L'ordinamento è reale nel senso che le stime puntuali sono ordinate. Non è reale nel senso che un vantaggio di 0,84 punti sopravvive alle proprie barre di errore, e tutto ciò che vale la pena dire su questa classifica deriva dal tenere presenti entrambi i fatti contemporaneamente.
Che cos'è l'indice, e che cosa non è 0,84 di un punto
L'Epoch Capabilities Index non è un tabellone dei fornitori. È costruito da Epoch AI, un'organizzazione di ricerca indipendente, come un composito che unisce i punteggi di oltre cinquanta benchmark in un'unica scala di capacità generale, inferendo la difficoltà relativa di ciascun benchmark dai modelli che capita che compaiano su diversi di essi contemporaneamente. La metodologia è esposta in un articolo scritto con ricercatori del team AGI Safety & Alignment di Google DeepMind e finanziato da DeepMind, ma Epoch dichiara chiaramente che l'indice è un suo prodotto e che detiene pieni diritti su di esso — una distinzione da tenere presente quando la fonte di finanziamento e l'editore di un punteggio non sono la stessa parte. Il codice è pubblico.
Due proprietà della scala contano più del titolo. La prima è che l'ECI è volutamente ancorato anziché assoluto: i punteggi grezzi vengono riscalati in modo che Claude 3.5 Sonnet si collochi a 130 e GPT-5 a 150, il che significa che un numero su questo indice ha senso solo accanto a un altro numero dello stesso file, mai da solo. La seconda è che l'indice non ha un tetto. Non c'è un 100 a cui avvicinarsi, quindi "in cima all'indice" è un'affermazione su una data, non su un limite che qualcuno abbia raggiunto.
Ecco perché la lettura onesta di 167,35 rispetto a 166,51 non è «Claude Opus 5.5 è il modello più capace al mondo». È più ristretta e meno citabile: secondo la modellazione di Epoch delle evidenze disponibili al 2 ottobre 2026, i due modelli sono indistinguibili al vertice, e l'ordinamento tra loro è uno spareggio, non una misurazione. Gli intervalli pubblicati lo dicono direttamente — 164,0–172,0 e 163,14–171,05 condividono la grande maggioranza del loro intervallo. Chiunque citi lo 0,84 come verdetto sta citando un artefatto di arrotondamento.
Il blocco Anthropic e la dimensione di una release
L'elemento più informativo della tabella non è chi sia primo. Sono la terza e la quarta riga. Claude Sonnet 5.5, rilasciato il 28 settembre e con un punteggio di 165,2, si colloca 0,38 punti sopra Claude Fable 5.1, rilasciato il 1° settembre a 164,82 — tanto vicini da trovarsi in pratica nella stessa posizione, e tanto vicini che la coppia si trova a soli 2,15 punti sotto la vetta della classifica. Sonnet è il prodotto di fascia media della gamma di Anthropic e Fable è il modello che l'azienda ha storicamente indicato per il lavoro di ragionamento generale; che ora entrambi incornicino la frontiera appena al di sotto è il cambiamento sostanziale di questo aggiornamento, più dell'identità del leader.
Anche il salto generazionale di Anthropic è visibile. Claude Opus 5.5 è il successore di Claude Opus 5, che Epoch valuta 162,94 con un intervallo da 160,2 a 166,7. Si tratta di un miglioramento di 4,41 punti in circa due mesi, da un rilascio del 24 luglio a uno del 22 settembre — un balzo maggiore degli 0,84 punti che separano il primo e il secondo posto odierni. Letta in questo modo, la quantità interessante in questa tabella è la pendenza all'interno della linea di un singolo fornitore, non il divario tra due fornitori in cima.
Dove passa la linea degli open-weights
Epoch separa i modelli per accessibilità, il che rende leggibile il confine dei pesi aperti senza dover tirare a indovinare. La migliore voce a pesi aperti è Kimi K3 a 157,61, datata 16 luglio ed etichettata non commerciale. Dietro di essa si trovano DeepSeek V4 Pro 0813 a 155,38 e DeepSeek V4.1 Flash a 155,0, entrambi senza restrizioni, poi GLM-5.3-Flash a 151,94 e GLM-5.2 a 151,78. Il modello aperto più vicino alla vetta è quindi indietro di 9,74 punti — un divario diciotto volte più ampio di quello tra il primo e il secondo posto, e abbastanza ampio che gli intervalli non si avvicinano nemmeno a toccarsi.
Quell'asimmetria è l'unico risultato duraturo nella tabella. La frontiera chiusa è una mischia entro tre punti; la distanza dalla frontiera chiusa ai migliori pesi scaricabili è di un ordine di grandezza maggiore. Un indice composito che permette di confrontare tra generazioni di benchmark è esattamente lo strumento per notarlo, perché può dire la stessa cosa a luglio e a settembre invece di riportare che un benchmark saturante è diventato silenzioso.
Alcune delle righe vicine meritano di essere fissate per contesto, poiché sono i modelli con cui i lettori confrontano effettivamente Opus 5.5:
• Claude Sonnet 5 — 156.34, rilasciato il 30 giugno, intervallo da 153.61 a 158.81
• Grok 4.6 — 156.61, rilasciato il 12 agosto, intervallo da 154.66 a 158.93
• Gemini 3.8 Flash — 156,93, rilasciato il 2 settembre, intervallo da 154,64 a 160,42
• Muse Spark 1.3 — 156,86, rilasciato il 2 settembre, intervallo da 154,73 a 159,56
• GPT-5.6 Sol — 161.8, rilasciato il 9 luglio, intervallo da 159.26 a 165.26
Una posizione in un indice non è una fattura.

Qui la classifica smette di raccontare tutta la storia, perché i due modelli in cima non costano neanche lontanamente la stessa cosa. Dal nostro catalogo, che li propone entrambi al prezzo di listino del provider senza alcun ricarico, Claude Opus 5.5 a 4,00 $/20,00 $ con letture dalla cache a 0,20 $ e GPT-6 Astra a 10,00 $/50,00 $ con letture dalla cache a 1,00 $ distano 2,5 volte l'uno dall'altro in entrambe le direzioni del listino. Astra sale inoltre oltre i 272.000 token di prompt, dove l'input arriva a 20,00 $ e l'output a 75,00 $; Opus 5.5 mantiene 4,00 $/20,00 $ invariati su tutta la sua finestra da 1M di token. Entrambi erogano 128.000 token di output.
Esegui il calcolo che un carico di lavoro a contesto lungo comporta effettivamente — un prefisso di 180.000 token servito dalla cache, 5.000 token generati. Su Opus 5.5 sono 180.000 token a $0,20 per milione, ovvero circa 3,6 centesimi, più 5.000 a $20 per milione, ovvero 10 centesimi: all'incirca 13,6 centesimi. Su GPT-6 Astra sono 180.000 a $1,00, ovvero 18 centesimi, più 5.000 a $50, ovvero 25 centesimi: all'incirca 43 centesimi. Un vantaggio di 0,84 punti e un divario di costo di 3,2 volte non sono lo stesso tipo di fatto, e una decisione di approvvigionamento che valuta solo il primo ha valutato il numero più piccolo.
Fable 5.1 dimostra il punto dall'altro estremo del listino dello stesso fornitore: a $10,00/$50,00 ha esattamente lo stesso prezzo di Astra e ottiene 164,82 — 2,53 punti in meno di Opus 5.5 a parità di spesa. L'indice colloca le tre voci di frontiera di Anthropic entro 2,53 punti l'una dall'altra e il suo listino le separa di 2,5 volte, il che descrive molto meglio la scelta che un acquirente ha davanti di quanto faccia qualsiasi singola classifica.
Se devi discutere di un numero, fallo sul tuo traffico

Il motivo per cui questo indice vale la pena di essere letto è che viene misurato da qualcuno che non sono i fornitori — ma è la struttura stessa del composite a stabilire i termini della discussione. La calibrazione di Epoch, le sue stime di difficoltà e il modo in cui gestisce i modelli che saltano i benchmark si collocano tutti a monte del numero nella tabella, e nessuno di questi aspetti è qualcosa che un lettore possa ricavare da uno screenshot. Lo stesso vale per il benchmark di punta di ogni fornitore, ed è per questo che la mossa utile non è schierarsi tra l'uno e l'altro, ma confrontarli sul traffico che controlli.
Entrambi questi modelli sono raggiungibili da un'unica chiave API su OrcaRouter, che trasferisce il prezzo di listino del provider con markup dello 0%: Claude Opus 5.5 a $4,00/$20,00 con letture dalla cache da $0,20 e GPT-6 Astra a $10,00/$50,00 con il suo livello oltre 272K applicato esattamente come lo imposta il provider. Inviare lo stesso set di prompt a entrambi è una modifica di configurazione anziché un secondo contratto, e dove entrambi sono instradati, il failover automatico si trova sotto, il che conta per una decisione così vicina al rumore di fondo. La classifica può dirti che i due modelli sono indistinguibili. Solo la tua valutazione può dirti quale dei due è indistinguibile nel tuo lavoro.

Cosa potrebbe far muovere questo numero il mese prossimo?
Il file di Epoch è vivo, e tre cose cambierebbero rapidamente la lettura. La prima è qualsiasi nuova valutazione di un modello di frontiera che si collochi tra i primi quattro, dato che una singola osservazione di benchmark aggiuntiva sposta un composito di più quando il gruppo è così compatto di quanto non faccia quando esiste un chiaro leader. La seconda è la deriva degli intervalli di confidenza: le voci più recenti hanno quelli più ampi, perché sono state valutate sul minor numero di benchmark sovrapposti, quindi le release di settembre sono le righe più probabili da spostare e quelle di luglio le meno probabili. La terza è un benchmark che raggiunge la saturazione, cioè il tipo specifico di cedimento che l'indice è stato costruito per sopravvivere: quando un componente smette di discriminare, Epoch rimoda i pesi della composizione invece di lasciare che il vantaggio di un modello svanisca insieme al test.
Per ora, la sintesi difendibile è quella più ristretta. Claude Opus 5.5 detiene il primo posto nell'Epoch Capabilities Index a 167,35 in virtù di un margine di 0,84 punti che il suo stesso intervallo di confidenza non supporta, Claude Sonnet 5.5 è risalito dalla fascia media della stessa linea fino a 2,15 punti dalla vetta, e il campo open-weights è a più di nove punti dietro tutti loro. Il leader è questione di testa o croce tra due fornitori. Non lo è il divario di prezzo di quattro punti tra loro.
Confrontati in questo articolo4
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
