
Claude Opus 5.5 och vattenmelontestet: Anthropic fixade prosan, men själva poängen är fortfarande begravd
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ett av de exempel som nådde längst utanför lanseringsveckan var en novell om en vattenmelon. Några hundra ord, inget benchmark bifogat, inget diagram – bara en modell som ombads skriva något litet och som fick det mesta rätt. Det är en märklig artefakt att ligga nära centrum av en flaggskeppslansering, men den pekar på det som leverantören valde att gå ut med först när den släppte Claude Opus 5.5 den 22 september 2026: inte ännu en punkt på Terminal-Bench, utan prosa. Företagets inramning är att den här modellen skriver mindre "Claudish" – deras ord för det formelartade, överförsiktiga, harklande registret som Claude Opus 5 fick klagomål för, och som Claude Fable 5.1, GPT-6 Astra och GPT-5.6 Sol har var och en mätts mot sedan dess. Så frågan som är värd att besvara är inte om demon var charmig. Det är om prosan blev mätbart bättre, hur mycket, och var den fortfarande brister.
Vad Anthropic säger att de har åtgärdat

Anthropics påstående är tillräckligt specifikt för att testas. Opus 5.5, säger man, sätter den viktigaste informationen först, använder mindre jargong och följer en användares angivna skrivregler närmare än tidigare Opus-modeller. Underlagsmaterialet är leverantörsrapporterat och inte reproducerat: interna faktakontrolltester som Anthropic säger klarade 16 av 18 försök, mot noll av 18 för både Claude Fable 5.1 och Claude Opus 5. Kundcitat i lanseringsmaterialet pekar i samma riktning – Ramps John Ruelas beskriver utdata som "skriver som en bra kollega", Box rapporterar ungefär 40 % mindre mångordighet på sina egna arbetsbelastningar.
Två saker är värda att skilja på här. Den första är att "mindre Claudisk" är ett verkligt, namngivbart felsätt, inte ett marknadsföringspåhitt. Yrkesverksamma har klagat på komprimerad, dåligt strukturerad Claude-prosa sedan Opus-generationerna efter 4.6, och klagomålet är specifikt: för mycket inledning, för många upprepningar av prompten, en vana att komma till poängen två stycken efter att läsaren behövde den. Den andra är att Anthropics egna siffror för att ha åtgärdat det är precis det — Anthropics egna siffror. Siffran 16 av 18 har inte fått någon oberoende replikering, och "40 % mindre verbositet" är en kunds interna mätning, inte en publicerad metodik.
Släppet medför också en ändring som inte rör skrivande och som är värd att känna till: Opus 5.5 är den första Opus-modellen som levereras med skyddsåtgärder för cybersäkerhet, biologi och frontier-LLM-utveckling som motsvarar dem i Claude Fable 5.1. När en begäran utlöser en av dem uppger Anthropic att man transparent dirigerar begäran till en annan modell i stället för att avvisa den direkt.
Siffrorna som inte är Anthropics

Den mest användbara oberoende bedömningen av påståendet om skrivandet kommer från Every's Vibe Check, som körde samma prompter genom fem frontlinjemodeller och poängsatte resultatet med två standardiserade läsbarhetsinstrument. På den promptuppsättningen var det Claude Opus 5.5 som visade sig vara den mest läsbara i gruppen — och gapet till modellen den ersatte är det intressanta:
• Flesch-Kincaid-nivå — Claude Opus 5.5 på 6,95, mot Claude Opus 5 på 7,97
• Flesch Reading Ease — 68,4 för Opus 5.5, mot 61,35 för Opus 5
• Claude Fable 5.1 — årskursnivå 7,43, 66,09 Reading Ease
• GPT-6 Astra — årskursnivå 7,52, Reading Ease 64,55
• GPT-5.6 Sol — 8,74 årskursnivå, 56,62 Reading Ease
Läs de två måtten tillsammans, för de rör sig i motsatta riktningar och det är hela poängen: en lägre årskursnivå och en högre lättläslighetspoäng innebär båda enklare prosa. Opus 5.5 hamnar ungefär en hel årskurs under Opus 5, ungefär en halv årskurs under både Claude Fable 5.1 och GPT-6 Astra, och nästan två årskurser under GPT-5.6 Sol. Enkelt uttryckt: en läsnivå motsvarande årskurs sju i stället för årskurs åtta.
Det är en verklig förbättring, och den är också snäv. Det här är en publikations promptuppsättning, inte ett benchmark med en fast uppgiftslista och en resultattavla bakom sig. Det säger dig färdriktningen och ungefär hur stort steget är. Det säger dig inte att Opus 5.5 skriver bra för ditt arbete, och Everys egna kvalitativa anteckningar gör det tydligt att granskaren inte heller tyckte det.
Där den fortfarande begraver poängen
Samma granskning som tog fram läsbarhetssiffrorna är lika rak om det fel som överlevde rättningen. När Opus 5.5 ombads att inleda en essä behövde den 37 till 39 meningar för att täcka det som granskaren täckte på 21, och den ägnade ett helt stycke åt en poäng som granskaren framförde i åtta ord. Granskarens sammanfattning är att modellen "fortfarande begraver poängen" – och den skarpare versionen av invändningen är att den kan diagnostisera korrekt vad ett stycke behöver och sedan producera en revidering som ignorerar sin egen diagnos.
Som redaktör klarade den sig sämre än som skribent. När den rangordnades mot de andra modellerna i redigeringsuppgifter kom Opus 5.5 efter Claude Opus 5, GPT-5.6 Sol och GPT-6 Astra — modellen är bättre på att producera läsbara meningar än på att känna igen vilken mening som borde ha kommit först. Recensentens omdöme landar i en mening som är värd att citera, eftersom den är det mest användbara i hela recensionen: "Jag är nöjdare med den som samarbetspartner än med prosan den producerar."
Den praktiska tolkningen följer direkt av det. Skriv utkast med den, och gör det med hög ansträngning eller högre – det är i de lägre ansträngningsinställningarna som utfyllnaden blir som värst. Bidra med egna exempel i stället för att be den hitta på dem. Flytta sedan själv poängen högst upp, eller lämna utkastet till något som gör det. Det Opus 5.5 ger dig är en snabbare väg till ett rent förstautkast och en genuint bättre samarbetspartner för de efterföljande genomgångarna. Det ger dig inte en redaktör.
Vad de extra orden kostar

Det finns en kostnadsdimension av verbositetsproblemet som skrivrecensionerna mestadels hoppar över, och den talar emot lanseringsnarrativet. Artificial Analysis, som kör sin egen utvärdering i stället för att förlita sig på leverantörssiffror, placerar Claude Opus 5.5 först av 212 modeller på sitt Intelligence Index med en poäng på 58 — men på 95:e plats av 212 i verbositet, efter att ha genererat 260 miljoner uttoken under den Index-körningen, mot en median på 88 miljoner. Det kostade 5,98 dollar per Intelligence Index-uppgift att utvärdera, och 8 708,20 dollar totalt.
Ställ det mot Anthropics eget effektivitetsanspråk, och de två verkar inte uppenbart stämma överens. Leverantörens rapporterade hållning är att Opus 5.5 använder färre tokens och genererar utdata mer än 30 % snabbare än Opus 5. Den oberoende körningen från Artificial Analysis fann att modellen var mycket ordrik jämfört med sina jämförbara modeller. Båda kan vara sanna samtidigt – olika uppgiftsblandningar, olika ansträngningsinställningar, olika definitioner av "färre tokens" – men ingen bör läsa lanseringens framställning som ett etablerat faktum om tokenekonomi. När det gäller pris är bilden tydligare: 4 USD per miljon indata och 20 USD per miljon utdata, ned från 5/25 USD, med 95 % cacherabatt i siffrorna från Artificial Analysis.
Om du betalar per utdatatoken är mångordig prosa inte en stilpreferens. Det är radposten.
Kör det mot det du redan har
En ärlighetsnot innan den praktiska delen: Claude Opus 5.5 är inte en av våra vägar. Vi är inte värd för den, och inget nedan bör läsas som ett påstående att vi är det. Du får den via Anthropics eget API och flera tredjepartsplattformar.
Det som finns på OrcaRouter i dag är modellen den ersatte och nivån över den. Claude Opus 5 finns på OrcaRouter i dag, och det gör även Claude Fable 5.1, båda till leverantörens listpris med 0 % påslag som förs vidare — vilket innebär att en prisförändring från leverantören slår igenom hos oss samma dag i stället för när en återförsäljare kommer sig för. Om du försöker avgöra om Opus 5.5:s prosa är värd bytet, är det en användbar kombination: du kan köra jämförelsen med en enda nyckel utan ett andra avtal eller en kodändring, eftersom båda modellerna är ett API för 200+ modeller bort på samma slutpunkt.
Den andra anledningen att ha en andra modell i loopen är det felläge som den här artikeln handlar om. En modell som döljer poängen är en modell som du vill kunna routa runt mitt i en uppgift, och automatisk failover finns just för att en dålig generering inte ska bli en fastnad pipeline. Om du helst inte vill välja en enda modell alls, komponerar routing-DSL:en flera till ett enda anrop och modellfusion kör en panel av modeller som svarar tillsammans – vilket är en rimlig form för redigeringsarbete, där felet är omdöme snarare än förmåga.
Vem bör agera, och vem bör vänta
Om ditt klagomål på Claude Opus 5 var att du var tvungen att skriva om dess inledningar, åtgärdar Opus 5.5 på riktigt ungefär en årskursnivå av det problemet, och läsbarhetsdata säger att förbättringen är mätbar snarare än vibbar. Om ditt klagomål var att det tar tre stycken att komma till saken, säger inget i den oberoende bevisningen att det har ändrats. Det är olika klagomål, och bevakningen av lanseringen har behandlat dem som ett.
När det specifikt gäller kreativt arbete är vattenmelonhistorien inte bevis för någonting annat än att människor tar till små, varma prompter med låga insatser när de vill känna på en ny modell. Det är en rimlig sak att göra. Det är också precis den situation där en benägenhet att begrava poängen är som minst synlig, eftersom ingen läser en vattenmelonhistoria för tesens skull. Sätt modellen framför ett dokument där läsaren behöver slutsatsen i de två första meningarna, och du får reda på vilket av de två problemen du faktiskt hade.
Det man bör hålla ögonen på härnäst är huruvida nästa modell i familjen – Sonnet 5.5 och Haiku 5.5 väntas båda inom de kommande veckorna – ärver läsbarhetsvinsten, och huruvida någon publicerar ett läsbarhetstal för redigering snarare än utkastskrivning. Utkasttalet är det enkla. Redigeringstalet är där Opus 5.5 fortfarande ligger efter tre av sina konkurrenter.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
