
Claude Haiku 5.5: Een prijsverlaging van 90%, een nieuwe tokenizer en de video die Anthropic niet plaatste
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Iemand typte één zin in Claude Haiku 5.5 en kreeg een complete lanceringsfilm terug. De prompt, die op de avond van 7 oktober 2026 op X werd geplaatst, luidt volledig: "maak een tien keer zo vette video voor je lancering die laat zien hoe goed je als motion designer bent." Het onderschrift van de post bestaat uit drie woorden — "Eén keer geschoten" — en de clip is als bijlage bijgevoegd. Geen nieuwe pogingen, geen storyboard, geen editor. Als dat is wat het goedkoopste model in de Claude-lijn nu doet, is die categorie geen compromis meer.
Dat is de interessante helft van de lancering. De andere helft is rekenwerk, en daar zit het echte nieuws: Claude Haiku 5.5 kost $0,10 per miljoen invoertokens en $0,50 per miljoen uitvoertokens voor prompts tot 100.000 tokens, tegenover Claude Haiku 4.5, met zijn vaste tarief van $1 en $5. De eigen voetnoot van Anthropic noemt dat 90% lager in het gangbare geval — en zegt vervolgens in één adem dat het getal waar een koper op moet rekenen dichter bij 75% ligt. Beide getallen zijn correct, en het verschil ertussen is het belangrijkste in deze release.
Wat Anthropic op 7 oktober officieel heeft verklaard
De lanceerblogpost van de leverancier en diens prijsdocumentatie zijn het eens over de vorm van het geheel, en het is een grotere stap dan een prijsverlaging doorgaans met zich meebrengt.

• Prijs — $0,10 per miljoen invoertokens en $0,50 per miljoen uitvoertokens voor prompts tot 100.000 tokens. Boven die drempel wordt hetzelfde verzoek gefactureerd tegen $0,50 en $2,50. Cache-leesbewerkingen kosten $0,01 per miljoen tot 100K en $0,05 daarboven; cache-schrijfbewerkingen kosten $0,125 en $0,625.
• Context — 1M tokens, met een maximale output van 128.000 tokens. Dat is hetzelfde venster en hetzelfde outputplafond dat Claude Fable 5.1, Claude Opus 5.5 en Claude Sonnet 5.5 bieden, gereproduceerd op het goedkoopste niveau.
• Denken — adaptief denken met de effort-parameter, standaard ingesteld op medium. Anthropic stelt dat dit het eerste model uit de Haiku-klasse is met een instelbare effort-instelling, wat betekent dat hetzelfde model-id goedkoop of zorgvuldig kan worden gedraaid zonder iets anders te wijzigen.
• Tokenizer: de nieuwere tokenizer die ook door Claude 4.7 en latere versies wordt gebruikt en die "ongeveer 30% meer tokens produceert voor dezelfde tekst." De documentatie van Anthropic zegt dat de exacte toename afhangt van de inhoud en de vorm van de workload.
• Levenscyclus — kennisafsluiting juni 2026, en een uitfaseringstoezegging van "niet eerder dan 7 oktober 2027."
Beschikbaarheid — de Claude API, Amazon Web Services, Google Cloud, Microsoft Azure en Claude Platform op AWS, allemaal tegelijk op dag één.
De 10x-sticker en de 75%-realiteit
Tien keer goedkoper is het getal dat het verst zal reizen, en het is het getal dat het waarschijnlijkst op de verkeerde plek in iemands budgetmodel belandt. Het geldt voor prompts tot 100.000 tokens. Haiku 5.5 handhaaft dat tarief niet voor het hele venster.
• Tot 100.000 tokens — $0,10 voor input en $0,50 voor output, tegenover de $1 en $5 van Haiku 4.5. Dat is de 90%-verlaging, en Anthropic zegt dat 90% van de verzoeken aan het vorige Haiku-model binnen dit bereik viel.
• Meer dan 100.000 tokens — $0,50 in en $2,50 uit. Nog steeds precies de helft van wat Haiku 4.5 in rekening bracht, voor dezelfde aanvraag, zonder een plafond te raken.
• De tokenizer — dezelfde tekst wordt ongeveer 30% meer tokens dan op Haiku 4.5, dus de verlaging per token vertaalt zich niet één-op-één naar een kleinere factuur.
• Het eigen gemiddelde van de leverancier — Anthropic presenteert de combinatie als "ongeveer 75% minder duur om te draaien." Dat is het cijfer van de leverancier zelf, geen onafhankelijke meting, en dat is het cijfer dat je in een prognose moet opnemen.
• Cache-economie — cache-leesbewerkingen daalden van $0,10 naar $0,01 per miljoen in de gangbare band, wat belangrijker is dan het inputtarief voor elke pipeline die een lange gedeelde prefix opnieuw verzendt.
Het cijfer van 75% verklaart ook iets wat een lezer anders misschien als een tegenstrijdigheid zou opvatten. De twee belangrijkste cijfers zijn niet in tegenspraak; het ene is een tarief voor een requestvorm, het andere is een gemengde schatting over een echte verkeersmix die de minderheid boven 100K en de extra tokens van de tokenizer omvat. Als je uitgaven modelleert, gebruik dan 75% en controleer je eigen verdeling van promptlengtes voordat je gelooft dat het beter is.
Wat de bewering in de video is, en wat niet
De clip is echt, de prompt staat hierboven woordelijk geciteerd, en de tijdstempel — 19:49 UTC op 7 oktober, ongeveer dezelfde dag dat het model live ging — is controleerbaar. De toeschrijving is aan een individuele gebruiker, niet aan Anthropic.
Dat onderscheid is hier van belang, want de eigen productpagina van Anthropic voor Claude Haiku 5.5 bevat helemaal geen ingesloten video: geen speler, geen mediabestand, alleen een link naar het YouTube-kanaal van het bedrijf. Als er een lanceringsfilm met het model is gemaakt, heeft de leverancier dat niet gezegd. De accurate bewering is dus beperkt: een gebruiker meldt een lanceringsvideo in één keer te hebben gegenereerd met Claude Haiku 5.5, en publiceerde de prompt. Of het in één keer is gegaan, wat het kostte en hoeveel ervan de montage heeft overleefd, zijn allemaal claims uit één bron. Behandel de clip als een demonstratie, niet als een benchmark.
De reden dat het toch het vermelden waard is, is dat videogeneratie niet in de specificatie van het model staat. Haiku 5.5 neemt tekst en afbeeldingen aan en retourneert tekst. Een motion-designresultaat van die kwaliteit impliceert dat het model iets anders aanstuurde — een codegenererend pad, een renderingpijplijn, een toollus — in plaats van zelf frames te produceren. Dat is een uitspraak over agent-orchestratie bij $0.10, en dat is het eigenlijk verrassende deel.
De cijfers die Anthropic publiceerde
De lanceringstabel van de leverancier is een voor-en-na-vergelijking afgezet tegen Haiku 4.5, met GPT-6 Luna en Claude Sonnet 5.5 in dezelfde kolommen om de schaal aan te geven. Elk cijfer hieronder is een door Anthropic zelf gerapporteerd evaluatieresultaat, uitgevoerd op de harness van Anthropic, en is overgenomen maar niet onafhankelijk geverifieerd.

• Kenniswerk — GDPval-AA v2.1 op 1620 tegenover Haiku 4.5's 735, GPT-6 Luna's 1437 en Sonnet 5.5's 1840. AA-Briefcase v1.1 op 1578 tegenover 614, 1336 en 1824.
• Computergebruik — OSWorld 2.1 op 72,4% op de offline-subset, tegenover 15,7% voor Haiku 4.5, 48,9% voor GPT-6 Luna en 83,9% voor Sonnet 5.5.
• Multidisciplinair redeneren — Humanity's Last Exam met 45,9% zonder hulpmiddelen en 57,4% met hulpmiddelen, tegenover 10,2% en 18,7% voor Haiku 4.5.
• Agentisch coderen — Terminal-Bench 4.0 op 39,2% tegen 0,0%, 16,4% en 70,6%. FrontierCode 1.1 (Main) op 46,4% tegen 42,4% voor GPT-6 Luna en 52,1% voor Sonnet 5.5.
• Visueel redeneren — Chartography op 46,4% zonder tools, tegenover 6,4%, 29,1% en 61,6%.
Anthropic is ook ongewoon direct over waar de kleine tier niet wint. In zijn eigen commentaar op de Terminal-Bench-grafiek staat dat Sonnet 5.5 en Opus 5.5 "betere keuzes blijven voor complexe agentische coderingstaken", en positioneert Haiku 5.5 in plaats daarvan voor compactie, samenvatting en subagent-werk. De klantquotes in het bericht wijzen in dezelfde richting en hebben hetzelfde voorbehoud — dit zijn early-access-partners die hun eigen evaluaties beschrijven, geen audits: Asana rapporteert meer dan 30% lagere latentie voor taakvoltooiing en tot 2,5x snellere inferentie per agent-turn; HubSpot rapporteert 92,8% gemiddeld over drie runs op een CRM-portaalsuite; AlphaSense rapporteert 0,84 tegenover 0,76 over 400 queries op een workload met ongeveer 8 miljoen calls per week; Box rapporteert 11 punten hoger dan Haiku 4.5 bij ongeveer de helft van de latentie; Rogo beschrijft een Haiku 5.5-subagent die een segmentomzetregel uit een 10-K haalt; en Cognition rapporteert dat Devin Fusion een FrontierCode-score van 66,2 vasthoudt met Haiku 5.5 als de sidekick.
Wat het onafhankelijke bestuur zegt
Leverancierstabellen zijn van de leverancier. De eerste externe plaatsing is het nuttigere getal voor iedereen die moet beslissen of de tier ver genoeg is opgeschoven om een productiepijplijn te veranderen.

Artificial Analysis geeft Claude Haiku 5.5 een score van 43 op zijn Intelligence Index v4.3.2 in de Max-configuratie van het model; het model staat tweede van de 182 modellen op die ranglijst en bevindt zich ruim boven de mediaan van 13. Dezelfde pagina meet 242 outputtokens per seconde — negende van 182 — en een kostenpost van $0,21 per Intelligence Index-taak.
Twee dingen op die pagina zijn belangrijker dan de kop. Het eerste is breedsprakigheid: bij het evalueren van de Index registreerde Artificial Analysis 440 miljoen outputtokens, tegenover een mediaan van 100 miljoen, en beschrijft het model als "zeer breedsprakig." Er wordt een prijs per token in rekening gebracht, dus een model dat lang nadenkt, betaalt daarvoor — precies daarom ligt het kosten-per-taak-cijfer op $0,21 in plaats van bijna nul, en daarom is de 90%-inputverlaging niet het hele verhaal. Het tweede is de ladder van inspanningen: dezelfde pagina toont configuraties van Max tot Low, en de standaardinstelling van Anthropic is medium, niet max. De 43 op het scorebord is de top van die ladder, niet de instelling die je krijgt als je niets doet.
Het draaien van de laag onder de laag die je al kunt aanroepen
Claude Haiku 5.5 staat niet in de OrcaRouter-catalogus, en het zou de moeite waard zijn om dat ronduit te zeggen in plaats van iets anders te suggereren: de kloof op de dag van lancering tussen het bestaan van een model en het routeerbaar zijn van een model is meestal dagen, en soms langer.
Wat vandaag in de catalogus van Anthropic staat, is Claude Haiku 4.5, Claude Sonnet 5.5 en Claude Opus 5.5, elk tegen de lijstprijs van de aanbieder, doorgegeven met 0% opslag, dus elke verlaging die Anthropic doorvoert, landt dezelfde dag bij ons als bij hen. Dat is de praktische brug voor iedereen die het subagent-patroon nu wil testen: een cascade die de routinetaken naar Haiku 4.5 stuurt en de moeilijke gevallen omhoog laat escaleren, werkt vandaag al onder één key en één SDK, en het kleine been later omwisselen naar Haiku 5.5 is een kwestie van een ander model-id in plaats van een migratie. Automatische failover zit onder welke benen je ook kiest, zodat een slechte middag bij één aanbieder niet de hele pipeline mee ten onder laat gaan.
Als u het liefst helemaal niet wilt wachten, wordt dezelfde inputschijf van $0,10 al ingenomen door GPT-6 Luna, die wij wel routeren, en die dat tarief aanhoudt tot 272.000 tokens voordat het omhooggaat.
Wie moet verhuizen, en wie niet?
Als je werklast classificatie, extractie, routering, compactie of samenvatting in grote volumes is, en je prompts onder de 100.000 tokens blijven, is de zaak eenvoudig: het tarief is een tiende van wat het was, het venster is vijf keer zo breed, en met de inspanningsregelaar kun je de andere kant op bijsturen wanneer een aanvraag dat nodig heeft. Reken op ongeveer 75% lager en je zult niet verrast worden.
Als je prompts regelmatig boven de 100.000 tokens uitkomen, krijg je 50% korting in plaats van 90%, en is het nog steeds de middag waard om aanbieders voor deep-context te vergelijken — het veld heeft verschillende modellen tegen of onder het boven-100K-tarief van deze tier.
En als je evaluatie nog steeds faalt op Terminal-Bench-achtig werk, dan is dit niet het model dat dit oplost; Anthropic zegt het zelf, en de 39,2% tegenover de 70,6% van Sonnet 5.5 is het zuiverste bewijs in het bericht. De eerlijke samenvatting van 7 oktober is dat de ondergrens van nuttige intelligentie een heel eind zakte en de bovengrens helemaal niet bewoog.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
