
Claude Opus 5.5 e il Watermelon Test: Anthropic ha corretto la prosa, ma il punto resta ancora sepolto
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Uno dei campioni che si è spinto più lontano oltre la settimana di lancio era un racconto breve su un'anguria. Qualche centinaio di parole, nessun benchmark allegato, nessun grafico — solo un modello a cui è stato chiesto di scrivere qualcosa di breve e che ci è riuscito per lo più bene. È uno strano artefatto da collocare vicino al centro di un lancio di punta, ma indica la cosa con cui il fornitore ha scelto di aprire quando ha lanciato Claude Opus 5.5 il 22 settembre 2026: non un altro punto su Terminal-Bench, ma prosa. L'inquadramento dell'azienda è che questo modello scrive meno "Claudish" — il suo termine per il registro formulare, eccessivamente cauto e pieno di preamboli che Claude Opus 5 ha attirato lamentele, e rispetto al quale Claude Fable 5.1, GPT-6 Astra e GPT-5.6 Sol sono stati da allora ciascuno misurati. Quindi la domanda a cui vale la pena rispondere non è se la demo fosse affascinante. È se la prosa sia migliorata in modo misurabile, di quanto e dove ancora fallisce.
Ciò che Anthropic dice di aver corretto

L'affermazione di Anthropic è abbastanza specifica da poter essere messa alla prova. Opus 5.5, si sostiene, mette per prima l'informazione più importante, usa meno gergo e segue le regole di scrittura indicate dall'utente più fedelmente rispetto ai precedenti modelli Opus. Il materiale a supporto è dichiarato dal fornitore e non riprodotto: test interni di verifica dei fatti che, secondo Anthropic, hanno superato 16 tentativi su 18, contro zero su 18 sia per Claude Fable 5.1 sia per Claude Opus 5. Le citazioni dei clienti nel materiale di lancio vanno nella stessa direzione — John Ruelas di Ramp descrive un output che «scrive come un buon collega», Box segnala circa il 40% in meno di verbosità sui propri carichi di lavoro.
Due cose meritano di essere tenute distinte, qui. La prima è che "less Claudish" è una modalità di fallimento reale e definibile, non un'invenzione di marketing. Gli addetti ai lavori si lamentano di una prosa di Claude condensata e mal strutturata fin dalle generazioni Opus successive alla 4.6, e la lamentela è specifica: troppo preambolo, troppe riformulazioni del prompt, l'abitudine di arrivare al punto due paragrafi dopo che il lettore ne aveva bisogno. La seconda è che i numeri della stessa Anthropic sull'aver risolto la questione sono esattamente questo — numeri della stessa Anthropic. Il dato di 16 su 18 non ha alcuna replica indipendente, e "40% in meno di verbosità" è una misurazione interna di un cliente, non una metodologia pubblicata.
La release include anche una modifica non legata alla scrittura che vale la pena conoscere: Opus 5.5 è il primo modello Opus a essere distribuito con salvaguardie su cybersicurezza, biologia e sviluppo di LLM di frontiera pari a quelle presenti su Claude Fable 5.1. Quando una richiesta ne fa scattare una, Anthropic afferma che la instrada in modo trasparente verso un altro modello anziché rifiutarla del tutto.
I numeri che non sono di Anthropic

La lettura indipendente più utile sul tema della scrittura viene da Every's Vibe Check, che ha eseguito gli stessi prompt su cinque modelli all'avanguardia e ha valutato l'output con due strumenti standard di leggibilità. Su quel set di prompt, Claude Opus 5.5 è risultato il più leggibile del gruppo — e il divario rispetto al modello che ha sostituito è il cuore della questione:
• Livello di grado Flesch-Kincaid — Claude Opus 5.5 a 6,95, contro Claude Opus 5 a 7,97
• Flesch Reading Ease — 68,4 per Opus 5.5, rispetto a 61,35 per Opus 5
• Claude Fable 5.1 — livello scolastico 7,43, 66,09 Reading Ease
• GPT-6 Astra — livello scolastico 7,52, Reading Ease 64,55
• GPT-5.6 Sol — 8.74 livello scolastico, 56.62 Reading Ease
Leggi i due strumenti insieme, perché si muovono in direzioni opposte e questo è il punto: un livello di grado inferiore e un punteggio di facilità più alto significano entrambi una prosa più semplice. Opus 5.5 si colloca circa un grado intero sotto Opus 5, all'incirca mezzo grado sotto sia Claude Fable 5.1 sia GPT-6 Astra, e quasi due gradi sotto GPT-5.6 Sol. In parole semplici, un livello di lettura da settimo grado invece che da ottavo.
Questo è un miglioramento reale, ma anche circoscritto. Questo è il set di prompt di una singola testata, non un benchmark con una lista di attività fissa e una classifica alle spalle. Ti dice la direzione di marcia e all'incirca l'ampiezza del passo. Non ti dice che Opus 5.5 scrive bene sul tuo lavoro, e le note qualitative di Every stessa chiariscono che nemmeno il recensore lo pensava.
Dove ancora seppellisce il punto
La stessa recensione che ha prodotto i numeri di leggibilità è schietta riguardo al difetto che è sopravvissuto alla correzione. Quando gli è stato chiesto di scrivere l’apertura di un saggio, Opus 5.5 ha impiegato da 37 a 39 frasi per coprire ciò che il recensore aveva coperto in 21, e ha dedicato un intero paragrafo a un punto che il recensore aveva espresso in otto parole. Il riassunto del recensore è che il modello "continua a seppellire il punto" — e la versione più incisiva della critica è che riesce a diagnosticare correttamente di cosa ha bisogno un paragrafo, per poi produrre una revisione che ignora la propria stessa diagnosi.
Come editor se la cavava peggio che come scrittore. Confrontato con gli altri modelli nei compiti di editing, Opus 5.5 è arrivato dietro a Claude Opus 5, GPT-5.6 Sol e GPT-6 Astra — il modello è più bravo a produrre frasi leggibili che a riconoscere quale frase sarebbe dovuta venire prima. Il verdetto del recensore si condensa in una frase che vale la pena citare perché è la cosa più utile dell'intera recensione: "Sono più contento di lui come collaboratore che della prosa che produce."
La lettura pratica deriva direttamente da ciò. Scrivi la bozza con esso, e scrivila a impegno alto o superiore — è con le impostazioni di impegno più basse che il riempitivo peggiora di più. Fornisci i tuoi esempi invece di chiedergli di inventarli. Poi sposta tu il punto in cima, oppure passa la bozza a qualcosa che lo faccia. Quello che Opus 5.5 ti offre è un percorso più rapido verso una prima bozza pulita e un collaboratore davvero migliore per le passate successive. Non ti offre un editor.
Quanto costano le parole in più

C'è una dimensione di costo nel problema della verbosità che le recensioni sulla scrittura per lo più trascurano, e va contro la narrativa del lancio. Artificial Analysis, che esegue una propria valutazione invece di affidarsi ai dati dei fornitori, colloca Claude Opus 5.5al primo posto su 212 modelli nel suo Intelligence Index con un punteggio di 58 — ma al 95º posto su 212 per verbosità, avendo generato 260 milioni di token di output in quella esecuzione dell'Index contro una mediana di 88 milioni. La valutazione è costata $5,98 per task dell'Intelligence Index, e $8.708,20 in totale.
Metti questo accanto alla dichiarazione di efficienza di Anthropic e le due cose non concordano in modo evidente. La posizione dichiarata dal fornitore è che Opus 5.5 utilizzi meno token e generi output oltre il 30% più velocemente rispetto a Opus 5. L'esecuzione indipendente di Artificial Analysis ha rilevato che il modello è molto verboso rispetto ai suoi pari. Entrambe le cose possono essere vere contemporaneamente — mix di attività diversi, impostazioni di effort diverse, definizioni diverse di "meno token" — ma nessuno dovrebbe leggere l'inquadratura del lancio come un fatto accertato sull'economia dei token. Sul prezzo il quadro è più chiaro: 4 $ per milione di input e 20 $ per milione di output, in calo da 5 $/25 $, con uno sconto del 95% sulla cache nei dati di Artificial Analysis.
Se paghi per token di output, la prosa prolissa non è una preferenza di stile. È la voce di costo.
Eseguirlo rispetto a ciò che hai già
Una nota di onestà prima della parte pratica: Claude Opus 5.5 non è una delle nostre route. Non lo ospitiamo, e nulla di quanto segue deve essere interpretato come un'affermazione che lo facciamo. Lo ottieni tramite l'API di Anthropic e diverse piattaforme di terze parti.
Quello che oggi è disponibile su OrcaRouter è il modello che ha sostituito e il livello superiore. Claude Opus 5 è oggi su OrcaRouter, e lo è anche Claude Fable 5.1, entrambi al prezzo di listino del provider con lo 0% di markup pass-through — il che significa che una variazione di prezzo del fornitore arriva da noi lo stesso giorno, invece di quando un rivenditore trova il tempo di occuparsene. Se stai cercando di decidere se la prosa di Opus 5.5 vale il passaggio, questa è un'accoppiata utile: puoi eseguire il confronto con una sola chiave, senza un secondo contratto o una modifica al codice, perché entrambi i modelli sono a un'unica API per oltre 200 modelli di distanza sullo stesso endpoint.
L'altro motivo per tenere un secondo modello nel ciclo è la modalità di guasto di cui tratta questo articolo. Un modello che seppellisce il punto è un modello che vuoi poter aggirare a metà attività, e il failover automatico esiste proprio perché una generazione difettosa non diventi una pipeline bloccata. Se preferisci non scegliere affatto un unico modello, il DSL di routing ne compone diversi in un'unica chiamata e la fusione di modelli esegue un panel di modelli che rispondono insieme — una forma ragionevole per il lavoro di editing, dove il guasto è di giudizio più che di capacità.
Chi dovrebbe agire, e chi dovrebbe aspettare
Se la tua lamentela su Claude Opus 5 era che dovevi riscriverne le aperture, Opus 5.5 è una vera soluzione per circa un livello di leggibilità di quel problema, e i dati sulla leggibilità dicono che il miglioramento è misurabile, non una questione di sensazioni. Se la tua lamentela era che ci vogliono tre paragrafi per arrivare al punto, nessuna prova indipendente dice che questo sia cambiato. Quelle sono lamentele diverse e la copertura del lancio le ha trattate come una sola.
Per il lavoro creativo nello specifico, la storia dell'anguria non è prova di nulla se non del fatto che le persone ricorrono a prompt piccoli, calorosi e a bassa posta in gioco quando vogliono saggiare un nuovo modello. È una cosa ragionevole da fare. È anche esattamente il contesto in cui una tendenza a seppellire il punto è meno visibile, perché nessuno legge una storia dell'anguria per la tesi. Metti il modello davanti a un documento in cui il lettore ha bisogno della conclusione nelle prime due frasi e scoprirai quale dei due problemi avevi davvero.
La prossima cosa da tenere d'occhio è se il prossimo modello della famiglia — Sonnet 5.5 e Haiku 5.5 sono entrambi attesi nelle prossime settimane — erediterà il guadagno di leggibilità, e se qualcuno pubblicherà un dato di leggibilità per l'editing anziché per la stesura. Il dato sulla stesura è quello facile. Il dato sull'editing è dove Opus 5.5 è ancora dietro a tre dei suoi concorrenti.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
