
Het echte verhaal van Claude Haiku 5.5 is de 100K-cliff: wat de nieuwe Haiku in rekening brengt voorbij 100.000 tokens
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Claude Haiku 5.5 verscheen op 7 oktober 2026 met een opvallende prijs van $0,10 per miljoen inputtokens en $0,50 per miljoen outputtokens, en het getal dat overal werd herhaald was het getal dat Anthropic zelf in de aankondiging zette: een verlaging van 90 procent ten opzichte van het Haiku 4.5-tarief voor dezelfde twee regelposten. Die 90 procent is echt. Het is ook beperkt tot één helft van één dimensie van de factuur, en op het moment dat een verzoek de 100.000 tokens overschrijdt, doet elk tarief erin iets wat de berichtgeving over de lancering grotendeels oversloeg. Dit stuk gaat over die grens — wat die kost, welke workloads die daadwerkelijk raken, en waarom "90 procent goedkoper" een bewering is over een deel van de factuur en niet over jouw factuur.
De twee prijzen, en waar ze wisselen
Anthropic publiceert twee kolommen voor het model, en het wisselen tussen beide gebeurt op basis van één enkele drempel voor de grootte van het verzoek, niet op basis van een modelinstelling die je kiest:
• Korte tier, op of onder 100.000 tokens — $0,10 per miljoen inputtokens, $0,50 per miljoen outputtokens (Anthropic-lijst) • Lange tier, boven 100.000 tokens — $0,50 per miljoen inputtokens, $2,50 per miljoen outputtokens (Anthropic-lijst) • Cache-reads — $0,01 per miljoen (korte tier) en $0,05 per miljoen (lange tier) • Batch-API — 50 procent korting op beide kolommen, en een maximale outputlengte van 300.000 tokens • Standaard maximale output — 128.000 tokens, met een contextvenster van 1 miljoen tokens in beide tiers

Dat zijn de eigen gepubliceerde tarieven van Anthropic, niet gemeten tarieven, en ze vormen de huidige lijst: de prijsstelling voor een model dat zo nieuw is, heeft nog geen tijd gehad om te veranderen, hoewel Anthropic op geen enkele wijze verplicht is om die te handhaven.
Lees die vier getallen in volgorde en de vorm van het geheel is duidelijk. Elk tarief in de long-contextlaag is precies vijf keer het short-contexttarief, en de drempel is voor allemaal tegelijk dezelfde 100.000 tokens. Er is geen geleidelijke curve, geen interpolatie, geen tussenliggende band — een verzoek van 99.000 tokens en een verzoek van 101.000 tokens verschillen met een factor vijf voor elke token op de factuur, niet alleen voor de 2.000 tokens die de grens overschreden. Dat is het deel dat dit een klif maakt in plaats van een helling, en het is het deel dat de framing "90 procent goedkoper" niet kan zien.

Waarom de snee groter lijkt dan hij is
In de vergelijking die Anthropic met Haiku 4.5 maakte, is de korte prijsklasse een echte verlaging van 90 procent op zowel input als output — Haiku 4.5 kostte $1,00 en $5,00 per miljoen voor dezelfde twee kolommen. De lange prijsklasse is een ander verhaal: $0,50 en $2,50 tegen dezelfde $1,00 en $5,00 is een verlaging van 50 procent, niet van 90 procent. De eerlijke versie van de lanceringsclaim is dus dat Claude Haiku 5.5 90 procent goedkoper is dan Haiku 4.5 onder 100.000 tokens en 50 procent goedkoper boven die grens, wat precies de splitsing is die de eigen documentatie van Anthropic geeft zodra je beide kolommen leest in plaats van er maar één. Dat enkele percentage is niet fout; het is het percentage van de korte prijsklasse, gepresenteerd zonder de bijbehorende voorwaarde.
Er is een tweede factor die de tegenovergestelde richting op trekt, en het is de interessantere, omdat hij gemakkelijk te missen en moeilijk te omzeilen is. Claude Haiku 5.5 wordt geleverd met een nieuwe tokenizer, en de eigen richtlijnen van Anthropic gaan uit van een tokenaantal voor een gegeven stuk tekst dat ongeveer 30 procent hoger ligt dan Haiku 4.5 voor dezelfde inhoud produceerde. Wat je per token betaalde, daalde, en wat je per token van *jouw* tekst betaalt, steeg met ongeveer een derde, ten opzichte van de tokenboekhouding van het oude model. Het door Anthropic opgegeven netto cijfer, dat het model gemiddeld ongeveer 75 procent goedkoper is om te draaien, neemt dit al mee — een korting van 90 procent op de lijstprijs minus een tokeninflatie van ongeveer 30 procent komt bij verkeer met korte context in die buurt uit — maar de twee effecten zijn te scheiden en het is de moeite waard ze te scheiden. De prijsaanpassing is een lijstprijswijziging die je van een pagina kunt aflezen; de tokenizeraanpassing verandert hoeveel eenheden van die prijs je bestaande prompts verbruiken, en ze verschijnt in je eigen tokenaantallen voordat ze ergens anders verschijnt.
Voor een workload die al ruim onder de 100.000 tokens per aanroep bleef, is het praktische effect een rechtstreekse verlaging van de kosten per aanroep, deels tenietgedaan door de tokenizer. Voor een workload die dat niet deed, loopt de rekensom op de lange helft twee keer de andere kant op.
Wat er eigenlijk boven de 100.000 tokens leeft
De reflex is om prijzen voor lange contexten onder "agentic coding en RAG, niet wij" te scharen. Dat is te snel, want de grens van 100.000 tokens is een grens per verzoek, en de omvang per verzoek is niet hetzelfde als de omvang van een taak. Een paar patronen overschrijden die grens routinematig:
• Een codebase-lezende agent die gedurende een sessie een grote werkset in context houdt, in plaats van die bij elke stap opnieuw op te halen
• Document- en contractanalyse waarbij de input een lange PDF plus zijn eigen instructies en few-shot-voorbeelden is — het soort prompt dat al 60.000 tokens was voordat iemand de voorbeelden toevoegde
• Ingestiepijplijnen die veel kleine items in één aanroep batchen om de overhead per aanroep te amortiseren, en daarbij de hele batch over de drempel tillen
• Chatproducten die een volledige gespreksgeschiedenis inline bewaren in plaats van deze samen te vatten, waarbij het verzoek monotoon groeit totdat iets het afkapt
• Transcriptie-achtige inputs van audio en lange video's, die precies het verkeer zijn dat een tokenvenster van 1 miljoen tokens volgens de advertentie mogelijk maakt
Het contextvenster van 1 miljoen tokens is het onderdeel van het specificatieblad dat de prijskloof het bespreken waard maakt. Anthropic verkoopt de mogelijkheid om het model een zeer groot verzoek te geven, en de prijsstelling is zo opgezet dat de laatste 900.000 tokens van dat verzoek vijf keer zoveel kosten als de eerste 100.000. Beide feiten zijn bewust; ze worden alleen op verschillende plekken aangekondigd. Als het long-contextvenster de reden is dat u überhaupt naar dit model kijkt, is de long-contextkolom uw kolom, en het lanceringspercentage is dat van iemand anders.
De druk die de prijs op de Flash tier legt
De verklaarde intentie van Anthropic achter het model is om het goedkope, hoogdoorvoerende uiteinde van de stack te bezetten, en de prijslijst weerspiegelt die intentie duidelijk. De berichtgeving van Bloomberg over de lancering zette het neer als Anthropic dat zijn positie als lagere-kostenaanbieder verdedigt tegen goedkopere open-weight concurrenten, en de framing van de leverancierszijde ging verder — dat de nieuwe Haiku zo geprijsd is dat hij zijn directe rivalen met een ruime marge onderbiedt.
De vergelijking is alleen zuiver op de korte tariefschijf, waar $0,10 en $0,50 agressief laag zijn. Boven 100.000 tokens zijn de tarieven van $0,50 en $2,50 niet langer lager dan de korte tariefschijf van wie dan ook; het zijn gewone tarieven uit het middensegment. De bewering van de leverancier over een "ruime marge" is een uitspraak over de eerste kolom van de tariefkaart, en Anthropic mag die daar maken — het is een nauwkeurige lezing van de cijfers die het publiceert. Het is geen bewering over wat een workload met lange context betaalt, en moet niet als zodanig worden aangehaald.
De rest van het model, in het kort
Claude Haiku 5.5 behoudt de functies die op de Sonnet-lijn zijn verschenen in plaats van ze te schrappen. Adaptief denken met een standaardinstelling van medium is aanwezig, en het is het eerste model in de Haiku-klasse met een instelbare inspanningsknop die van Laag tot Max loopt. De kennisafsluitdatum is juni 2026 en de model-ID is claude-haiku-5-5. Anthropic vermeldt een uitfaseringsdatum van niet eerder dan 7 oktober 2027 — dezelfde datum als de release, een jaar later — en het model staat vermeld op Amazon Bedrock, Google Cloud en Microsoft Azure naast Anthropic's eigen API.

Aan de benchmarkkant draagt alles in het lanceringsbericht hetzelfde herkomstlabel, en terecht: dit zijn door de leverancier gerapporteerde cijfers, gemeten door het bedrijf dat het model verkoopt, zonder dat er op het moment van schrijven een onafhankelijke reproductie is gepubliceerd.
• GDPval-AA v2.1 — door de leverancier gerapporteerd: 1.620 voor Claude Haiku 5.5, tegenover 735 voor Haiku 4.5 in dezelfde testomgeving
• AA-Briefcase v1.1 — door de leverancier opgegeven 1.578, tegenover 614 voor de vorige generatie
• OSWorld 2.1 — door de leverancier opgegeven 72,4 procent, tegenover 15,7 procent
• Terminal-Bench 4.0 — door de leverancier gerapporteerd: 39,2, tegen 0,0
Humanity's Last Exam — door de leverancier gerapporteerd: 45,9 procent, of 57,4 met gebruik van tools
Het formaat van die delta's is de reden om ze te markeren in plaats van ze te citeren. Een sprong van 15,7 naar 72,4 op een OS-agent-benchmark gemeten door de eigen leverancier van het model is een getal dat je losjes moet vasthouden tot een derde partij dezelfde testomgeving draait. Artificial Analysis heeft zijn eigen index voor het model gepubliceerd per begin oktober 2026 — een onafhankelijk cijfer van 43,395, met 0,329 op Terminal-Bench Hard en 0,444 op HLE — en die set is de set die je moet citeren wanneer de bewering een uitdaging moet doorstaan. De cijfers van de leverancier en de onafhankelijke cijfers zijn niet in tegenspraak; het zijn simpelweg verschillende testomgevingen, en die in één zin door elkaar halen is hoe een blogpost uiteindelijk beweert dat een evaluatie door een leverancier een feit is.
De infrastructuurnotitie, aangezien we er een draaien
Anthropic verkoopt Claude Haiku 5.5 via zijn eigen API en via Bedrock, Google Cloud en Azure. Als je beslist welke van die je aanroept, of je het naast de andere modellen in je stack zet, let dan op dat de prijs van de leverancier overal hetzelfde is, en OrcaRouter is gebouwd om die listprijs zonder markup door te geven — dus een prijswijziging van Anthropic voor dit model is bij ons dezelfde dag live in plaats van met vertraging. Onze catalogus bevat ook qwen/qwen3.8-flash voor $0,15 en $0,47 per miljoen en z-ai/glm-5.3-flash voor $0,15 en $0,50, het paar dat het vaakst in het slot naast een model van de Haiku-klasse terechtkomt, op dezelfde sleutel en dezelfde factuur — wat een gemengde stack één in plaats van drie contracten laat kosten. Claude Haiku 5.5 zelf serveren wij niet; bel daarvoor Anthropic rechtstreeks.
Een praktische gevolgtrekking van de cliff, als je meer dan één model routeert: de grens van 100.000 tokens is een plek waar een verzoek dat voorheen goedkoop was duur wordt zonder dat er iets wezenlijks aan het verzoek verandert. Als je routeringslaag failover kan uitvoeren, is de verstandige aanpak om langcontextverkeer gericht te houden op het model dat boven de drempel daadwerkelijk goedkoop is en kortcontextverkeer te laten terechtkomen bij het model dat daaronder goedkoop is, in plaats van aan te nemen dat het gepubliceerde tarief van één model voor beide geldt.
Wat mee te nemen uit de lancering
De prijsverlaging is echt en ze is groot, onder 100.000 tokens. Het model is de eerste Haiku met een volledig uitgerolde featureset en een effort-dial, wat voor agentisch gebruik meer uitmaakt dan de prijs. De benchmarkdelta's zijn door de leverancier gerapporteerd en moeten als zodanig worden aangeduid telkens wanneer ze worden herhaald. En de prijslijst bevat een stap bij 100.000 tokens die alle tarieven in één keer met vijf vermenigvuldigt — wat het enige is aan deze lancering dat een lezer van jouw stack, eerder dan een lezer van het persbericht, het meest moet weten voordat het tokenbudget voor de volgende sprint wordt vastgesteld.
Als je de berekening wilt controleren aan de hand van je eigen verkeer, zijn de twee getallen die je moet ophalen het 95e percentiel van de grootte van je verzoeken en je aandeel in de uitgaven voor verzoeken boven de 100.000 tokens. Als het eerste onder de drempel ligt, geldt de 90 procent voor jou en had de lanceerberichtgeving gelijk over jouw situatie. Als het tweede een betekenisvol deel van de rekening is, is het getal dat ertoe doet de 50, en is het de moeite waard om de kostenraming opnieuw uit te voeren voor welk model in de stack je ook hebt gekozen, uitgaande van de 90.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
