Una scheda del titolo generata per Claude Opus 5.5 vs Claude Fable 5.1, con il sottotitolo "Il modello più economico ha vinto l'indice indipendente", con il logo reale di OrcaRouter sovrapposto in basso a destra e una riga a piè di pagina che recita "Indice secondo Artificial Analysis al massimo impegno; prezzi secondo Anthropic".
Guides & Insights

Claude Opus 5.5 vs Claude Fable 5.1: il modello più economico ha vinto l'Independent Index

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Anthropic ora vende due modelli al vertice della sua gamma, e quello che costa due volte e mezzo di più non è quello in cima alla classifica. Claude Opus 5.5, rilasciato il 22 settembre 2026 a 4 $ per milione di token in input e 20 $ per milione di token in output, ottiene 58 sull'Artificial Analysis Intelligence Index. Claude Fable 5.1, che occupa la posizione di punta dal 1° settembre a 10 $ in input e 50 $ in output, ottiene 53. Entrambi i valori provengono dallo stesso valutatore, entrambi sono stati misurati nella stessa famiglia di configurazioni, e il divario va nella direzione opposta rispetto ai prezzi. È questo il fatto da cui deve partire il confronto, perché quasi tutti gli articoli di lancio dell'ultima settimana inquadrano Opus 5.5 come la versione scontata di Fable 5.1 — un modello più economico che "tiene testa" a quello costoso sulla maggior parte dei lavori. Il numero indipendente dice che il modello scontato è avanti.

Se ciò debba cambiare quello che distribuisci è una questione diversa, e la risposta dipende meno dal divario di cinque punti che da due impostazioni che nessuno mette in un titolo: a quale livello di impegno ciascun modello si imposta per impostazione predefinita, e quale dei due può essere reso veloce.

I numeri indipendenti, e l'unica cosa che hanno in comune

A two-column scoreboard comparing Claude Opus 5.5 and Claude Fable 5.1 across six shared rows: Intelligence Index (58, ranked #1 of 210, against 53, ranked #4), price in and out ($4.00 / $20.00 per million against $10.00 / $50.00), context window (1M tokens on both), default effort (medium against high), knowledge cutoff (Jun 2026 on both) and fast mode (supported at $8.00 / $40.00 against not supported). The footer reads 'Index figures per Artificial Analysis at max effort; prices, effort defaults and fast-mode support per Anthropic.'

Artificial Analysis pubblica una configurazione per modello e, per entrambi questi, è etichettata come "Ragionamento adattivo, Sforzo massimo, Fallback predefinito". Stessa etichetta, stesso valutatore, stessa esecuzione — il che rende questo il confronto testa a testa più pulito che ciascuno dei due modelli abbia:

• Indice di Intelligenza — Claude Opus 5.5 58, classificato al 1° posto su 210 vs Claude Fable 5.1 53, classificato al 4° posto

• Velocità di output — Claude Fable 5.1 65,8 token/sec, al di sotto della mediana della classifica di 71,0 rispetto a Claude Opus 5.5 non ancora pubblicato sulla classifica

• Tempo al primo token — Claude Fable 5.1 274,43s rispetto a una mediana della classifica di 3,83s; Claude Opus 5.5 non ancora pubblicato

• Verbosità sull'Indice — Claude Opus 5.5 ha generato 260M token di output, contro una mediana di 88M su tutta la linea

• Prezzo — Claude Opus 5.5 $4,00 / $20,00 per milione rispetto a Claude Fable 5.1 $10,00 / $50,00

Due di quelle righe vanno lette anziché citate. La prima è l'etichetta «Max Effort»: il punteggio di nessuno dei due modelli riflette l'impostazione predefinita con cui viene distribuito, e i due default non coincidono — ne parliamo più avanti. La seconda è la riga della verbosità, che va contro il modo in cui Opus 5.5 è stato pubblicizzato. La narrazione sull'efficienza di Anthropic è che il modello arriva alla stessa risposta con meno token, e il materiale di lancio cita partner che riportano da un terzo alla metà in meno di token di output. Sull'Index, misurato anziché citato, Opus 5.5 ha emesso 260M token contro una mediana della classifica di 88M — circa tre volte più verboso del modello tipico con cui viene confrontato. Entrambe le cose possono essere vere: può usare meno token di Claude Opus 5 pur restando un modello verboso in termini assoluti. Ma se hai calcolato il budget partendo dalla frase «meno token» e non dalla tua fattura, la misurazione indipendente è quella da controllare.

Cosa ti dà il supplemento di 6 $ per milione

A screenshot of Anthropic's Claude Platform Docs page for Claude Opus 5.5 showing its 'How it compares' table: Claude Fable 5.1 and Claude Opus 5.5 both at 1M context and 128K max output with a Jun 2026 cutoff, Fable 5.1 at $10 / $50 with high default effort and slower latency against Opus 5.5 at $4 / $20 with medium default effort and moderate latency, with Claude Sonnet 5 at $2 / $10 and a Jan 2026 cutoff and Claude Haiku 4.5 below them. The Opus 5.5 pricing panel underneath lists $4 input, $20 output, $5 and $8 cache writes, $0.20 cache read and a 50% batch discount.

Togli i benchmark e la differenza si riduce a un listino prezzi. Tutto ciò che trovi qui proviene dalla pagina dei prezzi pubblicata da Anthropic, verificabile ancora oggi:

• Input — 4,00 $ per milione su Opus 5.5 contro 10,00 $ su Fable 5.1

• Output — $20,00 per milione vs $50,00

• Lettura cache — $0,20 per milione su Opus 5.5 vs $0,25 su Fable 5.1

• Moltiplicatore della cache — Opus 5.5 addebita i cache hit a 0,05x l'input di base; Fable 5.1 li addebita a 0,025x, un moltiplicatore migliore su una base più alta

• Scrittura in cache — 5 $ per milione per una finestra di 5 minuti e 8 $ per un'ora su Opus 5.5, contro 12,50 $ e 20 $ su Fable 5.1

• Batch API — Opus 5.5 si dimezza a $2,00 / $10,00; Fable 5.1 si dimezza a $5,00 / $25,00

• Modalità veloce — Opus 5.5 la supporta a $8,00 / $40,00 per una velocità di output fino a circa 2,5 volte; Fable 5.1 non supporta affatto la modalità veloce.

La voce della cache è quella da guardare due volte, perché i due modelli invertono lo schema abituale. Fable 5.1 ha il moltiplicatore più aggressivo — 2,5% dell'input di base contro il 5% di Opus 5.5 — ma poiché la sua base è di 10 $ anziché 4 $, la sua lettura dalla cache resta comunque la più costosa delle due in dollari assoluti. Non esiste configurazione in cui il modello premium risulti conveniente su un token di contesto in cache. E il moltiplicatore non è qualcosa che si possa trasferire: un ciclo di agente ottimizzato per il comportamento di caching di Fable 5.1 pagherà proporzionalmente di più per ogni cache hit su Opus 5.5, anche se paga meno per ogni token nuovo.

La modalità veloce è l'asimmetria più netta. La documentazione di Anthropic elenca la modalità veloce per Claude Opus 5.5, Claude Opus 5 e Claude Opus 4.8 — Fable 5.1 è assente da quell'elenco. Quindi il modello più economico ha una leva di latenza che quello costoso semplicemente non ha, a $8/$40, che è comunque inferiore alla tariffa di output standard di $10/$50 di Fable 5.1. Se il tuo carico di lavoro è abbastanza interattivo che un primo token lento è un problema di prodotto, nota che il tempo misurato al primo token di Fable 5.1 è di 274 secondi. Quel numero è un artefatto del ragionamento a massimo sforzo, non un difetto, ma è il numero che un valutatore ha registrato.

I valori predefiniti non sono gli stessi, e questa è la trappola.

La documentazione dei modelli di Anthropic stessa mette i due modelli uno accanto all'altro, e la riga che decide la maggior parte dei confronti reali non è il prezzo. È il livello di impegno predefinito: medium per Claude Opus 5.5, high per Claude Fable 5.1. Entrambi utilizzano un thinking adattivo che non può essere disattivato; la profondità è controllata solo tramite il parametro effort, su una scala che va da low, medium, high, xhigh, max.

Ecco perché la frase di lancio "Opus 5.5 eguaglia Fable 5.1 sulla maggior parte dei compiti" e le tabelle di benchmark che la seguono sembrano in disaccordo. Le righe di confronto diretto di Anthropic per Opus 5.5 sono spesso etichettate con un'impostazione di effort più alta rispetto a quella predefinita — il dato di Terminal-Bench 4.0 del 66,4% contro il 55,8% di Fable 5.1 è stato ottenuto con effort xhigh, non medium. Nel frattempo, i numeri di Fable 5.1 sono stati prodotti con il suo default più alto. Due modelli confrontati con impostazioni di effort diverse non vengono affatto confrontati, e Anthropic lo ammette nel proprio materiale di lancio quando avverte che i margini di benchmark a questo livello di capacità sono una guida meno affidabile alla differenza nel mondo reale di quanto i punteggi lascino intendere.

In pratica, questo trasforma la decisione in un esercizio di messa a punto anziché in una scelta. Se passi da Fable 5.1 a Opus 5.5 e porti invariato il tuo effort setting, hai cambiato silenziosamente quanto ragiona il modello, e ogni numero di qualità e costo che produci in seguito è falsato. La raccomandazione di Anthropic è di testare più livelli di effort invece di trasferire le impostazioni del vecchio modello. Farlo costa poco e quasi nessuno lo fa, perché significa eseguire due volte le proprie valutazioni.

L'unico ambito in cui l'abbinamento si ripaga

Il pattern che giustifica il mantenimento di entrambi è il ciclo dell'advisor: Opus 5.5 che svolge il lavoro, Fable 5.1 consultato sulle decisioni difficili. Anthropic l'ha misurato, e in effetti aggiunge accuratezza — a costi e latenza più elevati, che è il compromesso che ci si aspetta mettendo il modello più lento nel ciclo. Quello che è cambiato è l'aritmetica che ci sta dietro. Quando il divario di capacità era più ampio, pagare $10/$50 per supervisionare un worker da $5/$25 valeva ovviamente la pena. Ora che il worker supera l'advisor nell'indice indipendente, il contributo dell'advisor si restringe ai compiti specifici in cui le sue stesse eval battono Opus 5.5, e quelli sono i compiti che devi identificare da solo. Il ciclo ha ancora senso per un sottoinsieme difficile; smette di averlo come configurazione da applicare a tappeto.

Entrambi sono a un tasto di distanza

Il dettaglio della migrazione che in questo caso mette in difficoltà i team non è la superficie API — è che si tratta di modelli dello stesso fornitore con diverse scale di effort, diversi moltiplicatori di cache e diverse impostazioni predefinite, e confrontarli onestamente significa eseguirli entrambi sui tuoi prompt con una configurazione allineata. Claude Opus 5.5 è su OrcaRouter al prezzo di Anthropic stesso: $4,00 / $20,00, e Claude Fable 5.1 è su OrcaRouter a $10,00 / $50,00 — prezzo di listino del fornitore passato così com'è, con markup dello 0%, quindi entrambi i numeri cambiano il giorno in cui Anthropic li cambia e nessuno dei due comporta un secondo contratto o un secondo SDK.

A screenshot of OrcaRouter's own model page for anthropic/claude-fable-5.1, headed 'Claude Fable 5.1' and credited to Anthropic, showing $10.00 input and $50.00 output per 1M tokens and a PERFORMANCE panel with 65.8 output tokens per second, a 274.43s time to first token, 88M output tokens over 7 days and a 0.00% error rate.

È questo che rende la separazione pratica anziché teorica. Inviare la maggior parte del traffico a Opus 5.5 e fissare una regola di routing che inoltra i casi davvero difficili a Fable 5.1 è una configurazione su un unico endpoint, non due integrazioni — e comporre una chiamata in modo che un modello rediga la bozza mentre l'altro verifica è una riga di routing-DSL, non una pipeline che devi costruire e mantenere. Se il percorso di escalation si rivela sbagliato per il tuo carico di lavoro, il failover automatico fa sì che la richiesta arrivi comunque su un modello che hai già caratterizzato, invece di fallire del tutto.

Cosa lo risolverebbe

La realtà onesta di questo confronto è che Anthropic ha pubblicato una tabella in cui il modello più economico vince nella maggior parte delle righe, Artificial Analysis ne ha pubblicata un'altra in cui vince nettamente, ed entrambe sono state eseguite con impostazioni di impegno che tu non rilasci. Nessuno dei due è un confronto testa a testa controllato a default allineati, e nessuna terza parte ne ha eseguito uno. Il divario che sopravvive a tutto ciò — cioè che Claude Opus 5.5 è materialmente più economico su ogni voce del listino, supporta una modalità rapida che Fable 5.1 non ha, e non è indietro nell'unico punteggio indipendente che entrambi i modelli hanno — è abbastanza ampio da spostare l'onere della prova. Se usi Fable 5.1 come default, la domanda non è più se Opus 5.5 sia abbastanza buono; è quali attività specifiche del tuo carico di lavoro falliscono a medio impegno, perché sono le uniche per cui stai pagando il sovrapprezzo.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno