
Claude Opus 5.5 voert de Coding Agent Index aan met 66 — en de taakfactuur stijgt met 21%
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 180 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
De leverancier verlaagde Claude Opus 5.5's tokenprijzen met 20% op 22 september 2026. Twee dagen later publiceerde Artificial Analysis de coding-agentmeting die laat zien wat de verlaging deed met de rekening van een agent: de kosten per taak gingen omhoog met 21%, naar $13,04, ten opzichte van de $10,79 die dezelfde index rekent voor Claude Opus 5. De score ging ook omhoog — 66 op de Coding Agent Index, die Artificial Analysis beschrijft als de hoogste die het heeft gemeten, zes punten voorsprong op Claude Opus 5 en vier op Claude Fable 5.1 in dezelfde configuratie. Beide dingen zijn tegelijk waar, en de reden dat ze tegelijk waar zijn, is het hele verhaal van deze ranglijst. Een goedkoper token waarvan een model er meer verbruikt, is geen goedkopere taak, en bij maximale reasoning-inspanning op lange agentruns verbruikt Claude Opus 5.5 er veel meer van.
Wat de Coding Agent Index nu echt meet
Dit is geen ranglijst van modellen. Elke rij erop is een harness-en-modelpaar — een checkpoint dat binnen een specifieke coderingsagent draait, bij een specifieke effort-instelling. De rij die iedereen citeert is Claude Opus 5.5 bij max effort in Claude Code, de harness waartegen Anthropic bouwt en afstemt. De 60 van Claude Opus 5 en de 62 van Claude Fable 5.1 komen uit dezelfde harness en dezelfde effort-instelling, en dat is wat ze tot de eerlijke vergelijkingen maakt; een rij voor een van beide modellen in een andere coderingsagent is een andere meting en wordt hier niet afgedrukt alsof het dezelfde is.
De index is geversioneerd, en de versie is belangrijker dan de merknaam erop. De ranglijst die momenteel is gepubliceerd als v1.5 berekent het gemiddelde van drie evaluaties, elk even zwaar gewogen, elk gerapporteerd als pass@1, gemiddeld over drie pogingen per taak:
• Terminal-Bench 4.0 — agentisch werk met de shell en de opdrachtregel: navigeren door een bestandssysteem, tools correct gebruiken, herstellen van een tussentijdse fout en een workflow met meerdere stappen afronden.
• DeepSWE v1.1 — software-engineeringtaken, het werk aan het bewerken van repositories.
• SWE-Atlas-QnA — vragen over het begrijpen van een repository, waarbij het antwoord wordt gevonden door een codebase te lezen in plaats van deze te wijzigen.
Drie evaluaties, één getal, en daarnaast een afgedrukte kolom met kosten per taak. Die kostenkolom is de reden waarom deze index nuttiger is dan een score alleen, en ook waarom het kerncijfer moeilijker te lezen is dan het lijkt.

De drie componenten, en waar de zes punten vandaan kwamen
Artificial Analysis publiceerde de componentrijen naast de samengestelde index, en ze bewegen niet gelijkmatig:
• Terminal-Bench 4.0 — 63,1% voor Claude Opus 5.5 tegenover 54,5% voor Claude Opus 5, een winst van 8,6 punten. Dit is de grootste individuele verbetering in de set.
• DeepSWE v1.1 — 68,4% tegen 62,5%, een stijging van 5,9 punten.
• SWE-Atlas-QnA — 66,4% tegen 62,1%, een stijging van 4,3 punten.
Het gemiddelde van die drie is 66,0, en dat is de samengestelde score. De vorm van de winst is het interessante deel: het model verbeterde het minst bij het lezen van een codebase en het meest bij het aansturen van een shell. Terminal-Bench is de evaluatie die het dichtst komt bij wat mensen daadwerkelijk bedoelen met 'coding agent' — een langdurige loop waarin het model commando's kiest, de uitvoer leest en beslist wat het daarna doet, zonder mens in de loop tussen de stappen. Een sprong van 8,6 punten daar is een uitspraak over aanhoudend toolgebruik, niet over codegeneratie.
Let op wat dat impliceert over waar de verbetering te verwachten valt. Als je werklast "leg deze repository uit" is, is Claude Opus 5.5 een bescheiden upgrade ten opzichte van Claude Opus 5 — vier punten. Als je werklast "draaien tot de testsuite slaagt, repareren wat stukgaat" is, is het de grootste sprong in de tabel.

Het nummer dat naast de ranglijst is afgedrukt: $13,04 per taak
Hier is de rekensom die de prijsverlaging er anders doet uitzien dan hoe ze werd aangekondigd. De lijstprijs van Anthropic voor Claude Opus 5.5 is $4,00 per miljoen inputtokens en $20,00 per miljoen output, een daling van $5,00 en $25,00 voor Claude Opus 5, waarbij cache-reads met 60% dalen naar $0,20 per miljoen. Elk van die regels is goedkoper. De schatting van Artificial Analysis van wat een taak kost bij maximale inspanning ligt toch hoger:
• Kosten per taak — $13,04 voor Claude Opus 5.5 tegenover $10,79 voor Claude Opus 5, een stijging van 21% op dezelfde index, dezelfde harness, dezelfde effort-instelling.
• Totaal aantal tokens per taak — ongeveer 15,6M tegenover 11,4M, een stijging van ongeveer 37%.
• Outputtokens per taak — ruwweg 333.000 tegenover 137.000, meer dan het dubbele. Output is de dure richting, en het is de regel die het meest is verschoven.
• Gecachte invoer per taak — ongeveer 14,6M tegenover 10,9M, een stijging van ongeveer 34%. De verlaging van 60% in cache-leesbewerkingen doet hier echt werk; het is alleen niet genoeg om een taak te compenseren die een derde meer context leest.
Doe de rekensom met de gepubliceerde tarieven en het beeld valt vanzelf in place. Neem alleen de outputtokens: 333.000 tokens tegen $20,00 per miljoen is ongeveer $6,66 — ruwweg de helft van de volledige schatting van $13,04, afkomstig van één enkele regel die verdubbelde. De cache-leesregel is enorm in volume en bijna gratis in prijs: 14,6 mln. tokens tegen $0,20 per miljoen is minder dan $3. De korting van 20% is reëel en de cachekorting is reëel; bij maximale inspanning op een agent-loop worden ze simpelweg overtroffen door een model dat langer nadenkt en meer schrijft.
Dat heeft directe gevolgen voor de manier waarop u uw budget opstelt. Als uw team 500 coding-agent-taken per dag uitvoert op maximale inspanning, is het verschil tussen $10,79 en $13,04 ongeveer $1.125 per dag — ongeveer $34.000 per maand — voor hetzelfde aantal taken. Dat is het getal dat u moet voorleggen aan wie de modelwijziging goedkeurt, en het is niet het getal dat de prijsverlaging doet vermoeden.
Waarom $5.98 en $13.04 beide waar zijn
Artificial Analysis publiceerde een ander kosten-per-taakcijfer voor hetzelfde model, enkele dagen eerder, en als je de twee samen leest zonder de labels, lijken ze op een tegenstrijdigheid. Dat zijn ze niet — het zijn twee verschillende evaluaties, en het verschil is leerzaam.
Op de Intelligence Index zette het verslag van 22 september de kosten per taak van Claude Opus 5.5 op $5,98, ongeveer gelijk aan de $5,86 van Claude Opus 5, ondanks ongeveer 119.000 outputtokens per taak tegenover de 73.000 van Opus 5. Daar heffen de prijsverlaging en de extra tokens elkaar bijna precies op. Op de Coding Agent Index, bij maximale inspanning, in Claude Code, kost hetzelfde model $13,04 tegenover $10,79.
Beide zijn eerlijke metingen van verschillende workloads. Een evaluatie voor vraagbeantwoording is een korte uitwisseling; een agenttaak is een lange lus van tool-calls met een groeiende context, en die groei telt zich in de outputrichting op, waar de prijs het hoogst is. De praktische les is dat "weegt de prijsverlaging op tegen de extra tokens?" geen eenduidig antwoord heeft — het hangt af van de taaklengte, en hoe langer en agentischer de taak, hoe slechter de compensatie uitvalt. Als je budgetteert op basis van een benchmark met korte antwoorden, onderschat je de rekening van een agent.
Drie kanttekeningen die op de rij thuishoren.
De 66 is een Claude Code-getal, geen getal van een kaal model. De index koppelt modellen bewust aan harnesses, met als argument dat tool-routing, retry-logica en contextbeheer onlosmakelijk verbonden zijn met de gemeten prestatie van een agent. Dat pleit hier in het voordeel van Anthropic, want de harness waarin het wordt gescoord, is de zijne. Artificial Analysis markeert een harness-vergelijkingsweergave als binnenkort beschikbaar; tot die bestaat, kan niemand zeggen hoeveel van de zes punten voorsprong het checkpoint is en hoeveel de scaffolding eromheen.
Het eigen Terminal-Bench 4.0-cijfer van Anthropic is hoger dan deze component, en werd uitgevoerd door Anthropic. Het lanceringsmateriaal vermeldt 66,4% bij xhigh-inspanning; de Coding Agent Index-component is 63,1% bij max, en de afzonderlijke, onafhankelijke run van Artificial Analysis mat 59,6% in zijn eigen testharnas op dezelfde benchmarkversie. Drie cijfers, drie configuraties, drie producenten. De 63,1% in de rij hierboven is de eigen component van de index en mag alleen met de andere cijfers op die index worden vergeleken; de 66,4% van de leverancier is door de leverancier gerapporteerd, niet gereproduceerd door een derde partij, en hoort bij een andere inspanningsinstelling.
De indexherziening verschuift. Deze blog rapporteerde begin september andere Coding Agent Index-rijen, op een eerdere versie van hetzelfde leaderboard, en die oudere cijfers zijn niet vergelijkbaar met v1.5 — de evaluatieset zelf veranderde toen Terminal-Bench 4.0 de eerdere versie verving. Mirrors van derden bevatten nog steeds verouderde snapshots met oudere versielabels. Als een cijfer voor Claude Opus 5.5 op deze index niet uit de huidige v1.5-rij komt, zet het dan niet naast een v1.5-cijfer, en bereken geen delta tussen de twee.

Wat je daadwerkelijk moet uitrollen
De ranking is een max-effort-getal, en max effort is de instelling die bijna niemand standaard zou moeten gebruiken. Claude Opus 5.5 heeft vijf effort-instellingen — low, medium, high, xhigh en max — en het model staat standaard op medium. Artificial Analysis heeft geen Coding Agent Index-rijen gepubliceerd voor de lagere instellingen, dus de kostenbesparing daar is op deze index niet gekwantificeerd; op de Intelligence Index scoorde hetzelfde model op medium 51 — gelijk aan Claude Opus 5's max — tegen $1,34 per taak. Dat is de richting waarin de besparingen zitten, en het is een instelling, niet een ander model.
Het realistische patroon is een splitsing: houd maximale inspanning voor de lange autonome lussen waar de winst van 8,6 punten op Terminal-Bench precies is wat je koopt, en draai het routinewerk met een lagere inspanning waar het model nog steeds ruim voorloopt op waar Claude Opus 5 eindigde. Omdat inspanning een aanvraagparameter is en geen deployment, is die splitsing een routeringsregel, en beide modellen zitten in dezelfde catalogus — Anthropic's lijstprijzen doorgegeven met 0% opslag, dus een prijsverlaging van een leverancier is live op anthropic/claude-opus-5.5 dezelfde dag dat die wordt aangekondigd, en er is geen tweede contract of codewijziging nodig om de twee tegen je eigen taken te A/B-testen. Specifiek voor het max-effort-pad, waar één enkele taak een lange onbeheerde run kan zijn, is automatische failover wat voorkomt dat een haperende provider je de hele lus kost.
Wat is nog ongemeten
Drie dingen zouden dit beeld veranderen en geen ervan bestaat al. Er is geen vergelijking van Claude Opus 5.5 met een concurrerende checkpoint waarbij effort en harness gelijk zijn getrokken — elke beschikbare vergelijking tussen leveranciers bestaat uit twee leverancierstabellen die naast elkaar zijn gezet. Er is geen gepubliceerde Coding Agent Index-run bij medium of high effort, terwijl daar het grootste deel van het productieverkeer zou zitten. En de vraag naar harness-attributie — hoeveel van een 66 het model is en hoeveel Claude Code — is door de index erkend en uitgesteld.
Wat je vandaag kunt aanpakken, is beperkter en nuttiger dan een ranglijst. Claude Opus 5.5 is echt beter in volgehouden, shell-gedreven agentwerk dan Claude Opus 5 — dat is de enige component met een grote, consistente, onafhankelijk geproduceerde winst. Het kost ook meer per taak bij de instelling waar die winst werd gemeten, ongeveer $2,25 per taak, en de prijsverlaging per token haalt dat getal niet. Zet het in bij maximale inspanning waar de lus lang is en de faalkosten hoog zijn; houd elders de goedkopere instelling aan; en hercontroleer de index wanneer de rijen met lagere inspanning verschijnen, want dat is de configuratie waarvoor de meeste teams daadwerkelijk zullen betalen. Als je alleen voor de prijsverlaging overstapt, koop je het verkeerde — het model is goedkoper per token en duurder per taak, en slechts één van die twee getallen verschijnt op je factuur.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
