
Claude Haiku 5.5 is nu live voor $0,10 per miljoen tokens: de 75%-claim en de twee bijbehorende voetnoten
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Anthropic heeft Claude Haiku 5.5 op 7 oktober 2026 algemeen beschikbaar gesteld, voor $0,10 per miljoen inputtokens en $0,50 per miljoen output — dezelfde twee bedragen die OpenAI rekent voor GPT-6 Luna, en een vijfde van wat Claude Haiku 4.5 sinds 2025 heeft gekost, toen het werd gelanceerd voor $1,00 en $5,00. De kop van Anthropics lanceringspost luidt dat het nieuwe model gemiddeld "ongeveer 75% minder kost om te draaien" dan zijn voorganger, en dat is het cijfer dat elke samenvatting sindsdien heeft herhaald. Er gaan twee voetnoten mee die de meeste van die samenvattingen hebben weggelaten: onder 100.000 tokens is de verlaging 90%, daarboven is de verlaging 50%, en Claude Haiku 5.5 gebruikt de nieuwere tokenizer die het deelt met Claude 4.7 en latere modellen, dus dezelfde tekst telt als ongeveer 30% meer tokens dan op Claude Haiku 4.5. Dus die 75% is een uitspraak over een rekening, niet over een tariefkaart, en voor iedereen met lange prompts zijn dat verschillende dingen. De eigen vergelijkingstabel van de leverancier bevat ook GPT-6 Luna en Claude Sonnet 5.5 als kolommen ernaast, wat de lanceringsdocumentatie ongewoon gemakkelijk maakt om tegen in te gaan.
De rekensom achter "75% minder"
Neem eerst de tariefkaart, want die is niet uniform. Invoer is $0,10 per miljoen tot 100.000 tokens en $0,50 per miljoen daarboven — vijf keer zoveel. Uitvoer is $0,50 en dan $2,50. Caching volgt dezelfde staffel: een cache-write van vijf minuten is $0,125 per miljoen onder de grens en $0,625 daarboven, een write van een uur is $0,20 en $1,00, en een cache-read is $0,01 en $0,05. De Message Batches API geeft 50% korting op beide meters, en op het batchpad ondersteunt het model tot 300.000 outputtokens met de output-300k-2026-03-24 bètaheader.
Nu de tokenizer erop, want daar wordt de claim in de titel interessant. Een prompt die 90.000 tokens mat op de Claude Haiku 4.5-tokenizer, meet ongeveer 117.000 op de nieuwe. De omvang is niet veranderd, maar hij is over de grens van 100.000 tokens gegaan, dus wordt hij gefactureerd tegen $0,50 per miljoen input in plaats van $0,10. Op Claude Haiku 4.5 kostte diezelfde inhoud $0,09 aan input ($1,00 per miljoen × 0,09 miljoen). Op Claude Haiku 5.5 kost het $0,0585. Dat is een verlaging van 35% — reëel, en lang niet in de buurt van 90%. Het cijfer van 90% geldt voor requests die onder de grens blijven nadat de tokenizer ze heeft uitgebreid, en daar zit een groot deel van het verkeer met korte aanroepen: een classificatieaanroep van 20.000 tokens wordt 26.000 tokens, blijft in de eerste tier, en daar is de inputprijs echt een tiende van wat hij was.
Daaruit volgen drie dingen, en het is de moeite waard die te onderscheiden in plaats van te middelen:
• Korte calls krijgen de volledige korting. Extractie, routering, classificatie, samenvatting van een document dat onder de grens past — deze zien het cijfer van 90% op input en output, minus de uitbreiding door de tokenizer.
• Lange aanroepen krijgen ongeveer een derde korting, geen driekwart. Een verzoek dat na hertokenisatie boven de 100.000 tokens uitkomt, betaalt $0,50 en $2,50 per miljoen — nog steeds de helft van de tarieven van Claude Haiku 4.5, maar de tier waarin het valt is vijf keer de tier die het prijskaartje adverteert.
• Het "gemiddeld 75% minder" is een verkeersgewogen getal en het is van Anthropic. Het is de eigen beschrijving van de leverancier van zijn eigen verwachte mix, en Anthropic zegt expliciet dat een prompt onder de drempel ongeveer 90% van de verzoeken aan de vorige Haiku uitmaakte. Als jouw mix niet op die mix lijkt, zal jouw gemiddelde niet op dat gemiddelde lijken — en de enige manier om te weten welke dat is, is om tokens te tellen in je eigen verkeer, met de nieuwe tokenizer, voordat je een budget vaststelt.

Wat werd er nog meer meegeleverd
Het model is niet alleen een prijs. Verschillende lanceringsdetails veranderen hoe je code ertegen schrijft, en een ervan zal een bestaande client breken.
• Adaptief denken staat standaard aan, met een inspanningsregelaar van Laag tot Max en standaard ingesteld op gemiddeld. Dit is het eerste model in de Haiku-klasse met een instelbaar inspanningsniveau, en het is de belangrijkste hefboom voor zowel kwaliteit als kosten per antwoord.
• Sampling-parameters worden afgewezen. Het versturen van een niet-standaard temperature, top_p of top_k levert een 400 op. Elke migratie die die argumenten heeft doorgegeven, zal luidruchtig falen bij het eerste verzoek in plaats van geruisloos te degraderen, wat op zijn minst een eerlijke faalmodus is.
• 1M-token context en tot 128.000 outputtokens in de synchrone Messages API, met een kennisafsluitdatum van juni 2026 en een verbintenis tot buitengebruikstelling niet eerder dan 7 oktober 2027.
• Vijf platforms op dag één: de Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry en Claude Platform op AWS. Dat is een uitrol op dezelfde dag in plaats van de gefaseerde beschikbaarheid die dit soort lanceringen vaak kennen.
• Ook de tooling bewoog mee.De Python- en TypeScript-SDK's van Anthropic ondersteunen nu computer use en browser use in bèta, en het bedrijf voegde maandelijkse API-credits toe voor abonnees van Max 5x ($100), Max 20x ($200) en Team (tot $500 gezamenlijk).
•De veiligheidshouding is nauwer dan de prijs doet vermoeden. Anthropic zegt dat cyberbeveiligingen op Claude Haiku 5.5 restrictiever zijn dan die van Claude Haiku 4.5, maar minder restrictief dan recente frontiermodellen — breder defensief gebruik dan Claude Sonnet 5 toestaat, waarbij penetratietests nog steeds geblokkeerd zijn — en dat biologische beveiligingen overeenkomen met Claude Sonnet 5, Claude Sonnet 5.5 en Claude Opus 5. Alignment-evaluaties verbeterden in brede zin ten opzichte van de voorganger op de eigen suite van Anthropic.
Wat de tabel van de leverancier zegt, en wat de onafhankelijke raad zegt
Anthropic heeft een benchmarktabel gepubliceerd met drie vergelijkingskolommen, en het is de moeite waard om die te lezen als een document over hoe leveranciers argumenteren. Elk cijfer hieronder is door de leverancier gerapporteerd, geproduceerd op Anthropic's testomgevingen, en niets ervan is onafhankelijk gereproduceerd; waar GPT-6 Luna verschijnt, is het Anthropic dat zijn eigen evaluaties uitvoert tegen het model van een concurrent.
• Kenniswerk — GDPval-AA v2.1 op 1620 voor Claude Haiku 5.5, tegenover 735 voor Claude Haiku 4.5, 1437 voor GPT-6 Luna en 1840 voor Claude Sonnet 5.5. AA-Briefcase v1.1 op 1578, 614, 1336 en 1824.
• Computergebruik — OSWorld 2.1 offline op 72,4% tegen 15,7%, 48,9% en 83,9%.
• Redeneren — Humanity's Last Exam op 45,9% zonder hulpmiddelen en 57,4% met hulpmiddelen, tegen 10,2% en 18,7% voor Claude Haiku 4.5 en 56,9% en 64,5% voor Claude Sonnet 5.5.
• Agentisch coderen — Terminal-Bench 4.0 op 39,2% tegen 0,0%, 16,4% en 70,6%. FrontierCode 1.1 (Main) op 46,4% tegen 42,4% voor GPT-6 Luna en 52,1% voor Claude Sonnet 5.5.
• Grafieklezen — Chartography met 46,4% zonder tools tegenover 6,4%, 29,1% en 61,6%.
In die tabel wint Claude Haiku 5.5 elke rij tegen zowel de vorige Haiku als GPT-6 Luna, en verliest hij de meeste ervan van Claude Sonnet 5.5 — wat de eerlijke vorm is van een kleine tier: een grote generatiesprong, en nog steeds een tier onder het middenmodel bij het moeilijkste werk. Anthropic zegt dat ook in de post, waar het Claude Sonnet 5.5 en Claude Opus 5.5 aanbeveelt voor complexe agentische coding en de Haiku positioneert voor taken als samenvatten, compositie en agentrollen.
Het onafhankelijke beeld is genuanceerder en vraagt meer aandacht. Artificial Analysis meet Claude Haiku 5.5 op Max effort op 43 in zijn Intelligence Index v4.3.2, tweede van 182 modellen, en 241,9 output tokens per seconde — snel, zoals beloofd. Het meet ook een kostenpost van $0,21 per voltooide Indextaak, omdat het model 440 miljoen output tokens genereerde bij het draaien van de suite, tegen een mediaan van 100 miljoen; de beoordelaar omschrijft het als zeer breedsprakig. GPT-6 Luna, met 38 op dezelfde index, kost $0,07 per taak. Dezelfde catalogusprijs, drie keer de rekening. Dat is geen tegenspraak van de claim bij de lancering — het is hetzelfde fenomeen waar die claim over gaat, maar dan vanaf de andere kant bekeken: het tarief is wat je per token betaalt, en het bedrag dat je daadwerkelijk betaalt is tarief maal tokens, en Claude Haiku 5.5 verbruikt er meer per antwoord dan zijn concurrenten. Effort is de hefboom; de standaardinstelling van het model is medium, niet Max, en een team dat het lager vastzet, ziet zowel een kleinere rekening als een lagere score.
Het aanroepen vanaf één plek
De migratievraag die deze lancering oproept is niet "is het beter", maar "wat kost mijn verkeer erop", en dat antwoord hangt af van je promptlengtes, je cache-hitratio en de effort-instelling die je kiest. Daar komen betekent je eigen promptset door beide generaties draaien — wat goedkoop is achter één endpoint en omslachtig om over twee te doen.
Claude Haiku 5.5 zelf staat nog niet in de catalogus van OrcaRouter, en dat ronduit zeggen is nuttiger dan iets anders suggereren. De rest van de Anthropic-lijn is: Claude Haiku 4.5, Claude Sonnet 5.5 en Claude Opus 5.5 zijn vandaag allemaal bij ons aan te roepen tegen de lijstprijs van de provider met 0% markup doorgegeven, dus het "before"-been van een migratietest draait op dezelfde sleutel die je daarna zou behouden, en een korting van de leverancier op dat been is bij ons dezelfde dag live. Het "after"-been is de API van Anthropic totdat het nieuwe model een runtime bereikt die wij routeren. Wat het gedeelde endpoint je ondertussen oplevert, is automatische failover onder de aanroep, zodat een nieuw model productieverkeer kan dragen zonder dat het pad ervan afhankelijk is, en de routing-DSL voor het geval waarin de escalatie van Haiku naar Sonnet in de route thuishoort in plaats van in je applicatiecode.

Twee klantresultaten in de lancering zijn het waard om als aanwijzingen mee te nemen, niet als bewijs. Asana meldt een verlaging van de latentie met meer dan 30% en tot 2,5x snellere inferentie per agentbeurt; HubSpot meldt 92,8% gemiddeld over drie runs op zijn CRM-suite; AlphaSense meldt 0,84 tegen 0,76 op 400 queries. Dit zijn door de leverancier geselecteerde klantcijfers in de eigen aankondiging van de leverancier, en hun waarde zit erin dat ze je vertellen welke workloads je eerst moet testen, niet wat je uiteindelijk krijgt.
Wat zou het beeld veranderen?
Het cijfer van 75% wordt op dezelfde manier beslecht als elke verkeersgewogen claim van een leverancier: door je eigen factuur. Wat aan de onafhankelijke kant werkelijk onbeslist is, is het cijfer voor de kosten per taak. Als het standhoudt naarmate er meer runs bijkomen, is de eerlijke samenvatting van deze lancering dat Anthropic de tariefkaart met 80% heeft verlaagd en een model heeft gebouwd dat meer tokens per antwoord verbruikt, dus de effectieve besparing is reëel, groot, afhankelijk van de werkbelasting en zelden het cijfer op de poster. Als het daalt met effort-instellingen en caching, ziet de tier er nog beter uit. Hoe dan ook, het cijfer dat je vóór een cutover moet controleren, zijn je eigen tokens per taak onder de nieuwe tokenizer — dat is precies het cijfer dat het lanceringsbericht je niet kan geven.

Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
