
Claude Opus 5.5 en de Watermeloen-test: Anthropic heeft het proza opgeknapt, maar het punt blijft begraven
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Een van de voorbeelden die het verst buiten de lanceerweek reikten, was een kort verhaal over een watermeloen. Een paar honderd woorden, geen benchmark eraan verbonden, geen grafiek — alleen een model dat gevraagd werd iets kleins te schrijven en dat grotendeels goed deed. Dat is een vreemd artefact om zo dicht bij het centrum van een vlaggenschiprelease te staan, maar het wijst naar hetgeen de leverancier vooropstelde bij de release van Claude Opus 5.5 op 22 september 2026: niet nog een punt op Terminal-Bench, maar proza. De framing van het bedrijf is dat dit model minder "Claudish" schrijft — de term die het bedrijf gebruikt voor het formuleachtige, overmatig afgezwakte, inleidende register waarvoor Claude Opus 5 klachten kreeg, en waartegen Claude Fable 5.1, GPT-6 Astra en GPT-5.6 Sol sindsdien elk zijn afgemeten. De vraag die het antwoorden waard is, is dus niet of de demo charmant was. Het is of het proza meetbaar is verbeterd, in welke mate, en waar het nog steeds faalt.
Wat Anthropic zegt te hebben opgelost

De bewering van Anthropic is specifiek genoeg om te testen. Opus 5.5, zo zegt het bedrijf, zet de belangrijkste informatie vooraan, gebruikt minder jargon en volgt de door een gebruiker opgegeven schrijfregels nauwer dan eerdere Opus-modellen. Het ondersteunende materiaal is door de leverancier gerapporteerd en niet gereproduceerd: interne factchecktests waarvan Anthropic zegt dat ze 16 van de 18 pogingen hebben doorstaan, tegenover nul van de 18 voor zowel Claude Fable 5.1 als Claude Opus 5. Klantcitaten in het lanceringsmateriaal wijzen in dezelfde richting — John Ruelas van Ramp beschrijft output die "schrijft als een goede collega", Box meldt ongeveer 40% minder breedsprakigheid op zijn eigen workloads.
Er zijn hier twee dingen die het waard zijn om te scheiden. Het eerste is dat "minder Claude-achtig" een echte, benoembare faalmodus is, geen marketinguitvinding. Praktijkmensen klagen al sinds de Opus-generaties na 4.6 over compacte, slecht gestructureerde Claude-proza, en de klacht is specifiek: te veel inleiding, te veel herhalingen van de prompt, de neiging om pas twee alinea's later ter zake te komen dan de lezer nodig had. Het tweede is dat de eigen cijfers van Anthropic waaruit zou blijken dat het is opgelost, precies dat zijn: de eigen cijfers van Anthropic. Het cijfer 16 van de 18 is niet onafhankelijk gerepliceerd, en "40% minder breedsprakigheid" is een interne meting van een klant, geen gepubliceerde methodologie.
De release bevat ook een niet-schrijfgerelateerde wijziging die het weten waard is: Opus 5.5 is het eerste Opus-model dat wordt geleverd met veiligheidsmaatregelen voor cybersecurity, biologie en de ontwikkeling van frontier-LLM's die overeenkomen met die van Claude Fable 5.1. Wanneer een verzoek een van deze maatregelen activeert, zegt Anthropic dat het het verzoek transparant naar een ander model doorstuurt in plaats van het botweg te weigeren.
De cijfers die niet van Anthropic zijn

De nuttigste onafhankelijke beschouwing van de schrijfclaim komt van Every's Vibe Check, die dezelfde prompts bij vijf frontiermodellen uitvoerde en de output beoordeelde met twee standaardinstrumenten voor leesbaarheid. Op die promptset Claude Opus 5.5 kwam als de best leesbare van de groep uit de bus — en het gat met het model dat het verving, is het verhaal:
• Flesch-Kincaid-niveau — Claude Opus 5.5 op 6,95, tegenover Claude Opus 5 op 7,97
• Flesch Reading Ease — 68,4 voor Opus 5.5, tegenover 61,35 voor Opus 5
• Claude Fable 5.1 — 7,43 leesniveau, 66,09 leesgemak
• GPT-6 Astra — 7,52 leerjaarniveau, 64,55 leesgemak
• GPT-5.6 Sol — 8,74 leesniveau, 56,62 leesgemak
Lees de twee instrumenten samen, want ze bewegen in tegengestelde richtingen en dat is precies het punt: een lager klasniveau en een hogere leesgemakscore betekenen beide eenvoudiger proza. Opus 5.5 zit ongeveer een volledig schooljaar onder Opus 5, ruwweg een half schooljaar onder zowel Claude Fable 5.1 als GPT-6 Astra, en bijna twee schooljaren onder GPT-5.6 Sol. Simpel gezegd: een leesniveau van de zevende klas in plaats van de achtste.
Dat is een echte verbetering, en het is ook een beperkte. Dit is de promptset van één medium, geen benchmark met een vaste takenlijst en een leaderboard erachter. Het vertelt je de richting waarin het beweegt en ongeveer de grootte van de stap. Het vertelt je niet dat Opus 5.5 goed schrijft over jouw werk, en Everys eigen kwalitatieve notities maken duidelijk dat de reviewer dat ook niet vond.
Waar het de kern nog steeds begraaft
Dezelfde review die de leesbaarheidscijfers opleverde, is niet mals over de tekortkoming die de reparatie overleefde. Gevraagd om een essay te openen, had Opus 5.5 37 tot 39 zinnen nodig om te behandelen wat de recensent in 21 zinnen deed, en besteedde een volledige alinea aan een punt dat de recensent in acht woorden maakte. De samenvatting van de recensent is dat het model "nog steeds de kern begraaft" — en de scherpere versie van de klacht is dat het correct kan diagnosticeren wat een alinea nodig heeft, en vervolgens een herziening kan produceren die zijn eigen diagnose negeert.
Als redacteur presteerde het slechter dan als schrijver. In de rangschikking tegenover de andere modellen bij redactietaken kwam Opus 5.5 achter Claude Opus 5, GPT-5.6 Sol en GPT-6 Astra — het model is beter in het produceren van leesbare zinnen dan in het herkennen van welke zin eerst had moeten komen. Het oordeel van de recensent komt neer op een zin die het citeren waard is, want die is het nuttigste in de hele recensie: "Ik ben blijer met het als samenwerkingspartner dan met het proza dat het voortbrengt."
De praktische lezing volgt rechtstreeks daaruit. Stel er een concept mee op, en doe dat op hoge effort of hoger — bij de lagere effort-instellingen wordt de opvulling het ergst. Lever je eigen voorbeelden aan in plaats van het te vragen ze zelf te verzinnen. Verplaats daarna zelf het punt naar boven, of geef het concept aan iets dat dat zal doen. Wat Opus 5.5 je geeft, is een snellere weg naar een schoon eerste concept en een oprecht betere collaborator voor de rondes daarna. Het geeft je geen redacteur.
Wat de extra woorden kosten

Er zit een kostendimensie aan het breedsprakigheidsprobleem die de schrijfreviews grotendeels overslaan, en die tegen het lanceringsverhaal indruist. Artificial Analysis, dat zijn eigen evaluatie uitvoert in plaats van te vertrouwen op cijfers van leveranciers, plaatst Claude Opus 5.5op de eerste plaats van 212 modellen in zijn Intelligence Index met een score van 58 — maar 95e van 212 op breedsprakigheid, met 260 miljoen gegenereerde outputtokens in die Index-run tegenover een mediaan van 88 miljoen. Het evalueren kostte $5,98 per Intelligence Index-taak, en $8.708,20 in totaal.
Zet dat naast Anthropics eigen efficiëntieclaim en de twee lijken niet duidelijk overeen te komen. Het door de leverancier gerapporteerde standpunt is dat Opus 5.5 minder tokens gebruikt en output meer dan 30% sneller genereert dan Opus 5. Uit de onafhankelijke run van Artificial Analysis bleek het model zeer uitgebreid ten opzichte van vergelijkbare modellen. Beide kunnen tegelijk waar zijn — verschillende taakmixen, verschillende effort-instellingen, verschillende definities van "minder tokens" — maar niemand zou de framing bij de lancering moeten lezen als een vaststaand feit over tokeneconomie. Wat de prijs betreft is het beeld duidelijker: $4 per miljoen input en $20 per miljoen output, omlaag van $5/$25, met een cachekorting van 95% in de cijfers van Artificial Analysis.
Als je per outputtoken betaalt, is breedsprakig proza geen stijlvoorkeur. Het is de regelpost.
Het uitvoeren tegen wat je al hebt
Eén oprechte opmerking vóór het praktische deel: Claude Opus 5.5 is geen van onze routes. Wij hosten het niet, en niets hieronder mag worden opgevat als een bewering dat we dat wel doen. Je krijgt het via Anthropics eigen API en diverse platforms van derden.
Wat vandaag op OrcaRouter staat, is het model dat het verving en de tier erboven. Claude Opus 5 staat vandaag op OrcaRouter, en Claude Fable 5.1 ook, beide tegen de lijstprijs van de provider met 0% markup doorgegeven — wat betekent dat een prijswijziging van een leverancier dezelfde dag bij ons terechtkomt in plaats van wanneer een reseller er tijd voor heeft. Als je wilt beslissen of het proza van Opus 5.5 de overstap waard is, is dat een nuttige combinatie: je kunt de vergelijking met één key uitvoeren zonder een tweede contract of een codewijziging, want beide modellen zijn één API voor 200+ modellen weg op hetzelfde endpoint.
De andere reden om een tweede model in de lus te houden, is de faalmodus waar dit artikel over gaat. Een model dat de kern begraaft, is een model waar je midden in een taak omheen wilt kunnen routeren, en automatische failover bestaat precies zodat een slechte generatie geen vastgelopen pipeline wordt. Als je liever helemaal geen model kiest, stelt de routing-DSL er meerdere samen in één aanroep en model fusion laat een panel van modellen samen antwoorden — wat een redelijke vorm is voor redigeerwerk, waar de fout in beoordelingsvermogen ligt en niet in capaciteit.
Wie moet handelen, en wie moet wachten?
Als je klacht over Claude Opus 5 was dat je de openingen moest herschrijven, dan is Opus 5.5 een echte oplossing voor ongeveer één leesniveau van dat probleem, en de leesbaarheidsdata zeggen dat de verbetering meetbaar is in plaats van een kwestie van onderbuikgevoel. Als je klacht was dat het drie alinea's duurt voordat het ter zake komt, dan zegt niets in het onafhankelijke bewijs dat dat veranderd is. Dat zijn verschillende klachten en de berichtgeving over de lancering heeft ze als één behandeld.
Specifiek voor creatief werk is het watermeloenverhaal geen bewijs voor iets, behalve dat mensen naar kleine, warme, laagrisico-prompts grijpen wanneer ze een nieuw model willen aftasten. Dat is een redelijke zaak om te doen. Het is ook precies de setting waarin een neiging om het punt te begraven het minst zichtbaar is, omdat niemand een watermeloenverhaal leest voor de these. Zet het model voor een document waarin de lezer de conclusie in de eerste twee zinnen nodig heeft, en je zult erachter komen welk van de twee problemen je eigenlijk had.
Het volgende dat in de gaten moet worden gehouden, is of het volgende model in de familie — Sonnet 5.5 en Haiku 5.5 worden beide in de komende weken verwacht — de leesbaarheidswinst erft, en of iemand een leesbaarheidscijfer publiceert voor redigeren in plaats van opstellen. Het cijfer voor opstellen is het gemakkelijkste. Het cijfer voor redigeren is waar Opus 5.5 nog steeds achter drie van zijn concurrenten staat.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
