
Claude Haiku 5.5 vs Claude Sonnet 5.5: een 20x tariefkaart, een 36x gemeten factuur
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Claude Haiku 5.5 en Claude Sonnet 5.5 liggen zes dagen en één tier uit elkaar binnen dezelfde familie, delen een contextvenster van een miljoen tokens en antwoorden via dezelfde API-vorm. Op de gepubliceerde prijslijst kost de goedkopere een vijfde van de duurdere in de band waar de meeste verzoeken terechtkomen. Op de onafhankelijke Artificial Analysis-ranglijst is de kloof zelfs groter: $0,21 om één Intelligence Index-taak te voltooien op Claude Haiku 5.5 tegenover $7,60 op Claude Sonnet 5.5, met een Intelligence Index van 43 tegen 56. Het signaal dat dit stuk in gang zette, verwoordde het als dat Claude Haiku 5.5 "veel beter is dan GPT-6 Luna" en "(dichter) bij Sonnet 5.5". De eerste helft daarvan komt ongeveer overeen met wat de eigen vergelijkingsset van de leverancier laat zien. De tweede helft is waar de metingen niet meer overeenkomen met de marketing, en het is de moeite waard precies te zijn over welke.
Twee modellen, zes dagen en één niveau uit elkaar
Claude Haiku 5.5 is op 7 oktober 2026 uitgekomen onder de model-ID claude-haiku-5-5. Het is de directe vervanger van Claude Haiku 4.5, neemt tekst en afbeeldingen als invoer en geeft tekst terug, en is het eerste model uit de Haiku-klasse waaraan Anthropic een instelbare inspanningsinstelling heeft gegeven — Low, Medium, High, Xhigh en Max, met medium als de API-standaard. Anthropic noemt het "het goedkoopste, snelste en meest capabele kleine model dat we ooit hebben uitgebracht", en de voetnoot nuanceert dat: het is het snelst bij de standaardsnelheid van elk model, maar blijft achter bij de Opus-modellen wanneer die in Fast Mode draaien.
Claude Sonnet 5.5 verscheen zes dagen eerder, op 28 september 2026, als claude-sonnet-5-5 — de tier die Anthropic positioneert als de beste combinatie van snelheid en intelligentie, en die het aanbeveelt voor complexe agentische coding. Hetzelfde contextvenster van één miljoen tokens. Anders dan Claude Haiku 5.5 heeft het geen prijsband op basis van promptlengte, wat belangrijker blijkt te zijn dan de zesdaagse voorsprong.
Beide zijn nu beschikbaar op alle platforms, waaronder Amazon Web Services, Google Cloud en Microsoft Azure, en voor beide geldt de toezegging dat ze niet eerder dan een jaar na de lancering buiten gebruik worden gesteld — 7 oktober 2027 voor Claude Haiku 5.5, 28 september 2027 voor Claude Sonnet 5.5. Anthropic zegt dat Claude Sonnet 5.5 beschikbaar is met nul gegevensretentie, net als Claude Opus 5.5 en Claude Sonnet 5.
De tariefkaart, beide zijden, op één plek
Per miljoen tokens, in Amerikaanse dollars, tegen de door Anthropic gepubliceerde tarieven:
• Invoer — Claude Haiku 5.5 $0,10 voor prompts tot 100.000 tokens, $0,50 daarboven; Claude Sonnet 5.5 $2,00 vast, geen staffel.
• Output — Claude Haiku 5.5 $0,50 tot 100.000 tokens, $2,50 daarboven; Claude Sonnet 5.5 $10,00 vast tarief.
• Cache-reads — Claude Haiku 5.5 $0,01 in de lagere band en $0,05 daarboven; Claude Sonnet 5.5 $0,10. Anthropic halveerde de cache-reads van Claude Sonnet 5.5 van $0,20 op hetzelfde moment als de lancering van Haiku, en zegt dat omdat cache-reads een groot deel van het agentische tokengebruik vormen, Claude Sonnet 5.5 nu ongeveer 20% minder kost bij het meeste agentische werk.
• Cacheschrijfbewerkingen — Claude Haiku 5.5 $0,125 voor een schrijfbewerking van vijf minuten en $0,20 voor een schrijfbewerking van een uur in de lagere band, $0,625 en $1,00 daarboven; Claude Sonnet 5.5 $2,50 voor een schrijfbewerking van vijf minuten en $4,00 voor een uur.
• Batch — de Batch API biedt 50% korting op zowel input als output. Daarmee komt Claude Haiku 5.5 op $0,05 en $0,25 onder de grens van 100.000 tokens en $0,25 en $1,25 daarboven, tegenover Claude Sonnet 5.5 op $1,00 en $5,00.
Lees je die regels horizontaal, dan is het patroon consistent: in de onderste band zie je een inputverschil van 20x en een outputverschil van 20x; boven de lijn 4x en 4x. De kop van Anthropic luidt 'ongeveer 75% minder om te draaien' gemiddeld ten opzichte van Claude Haiku 4.5, in een voetnoot bijgesteld naar 90% goedkoper onder de 100.000 tokens en 50% goedkoper daarboven, waarbij de tokenizerwijziging in dat gemiddelde is meegenomen.
De stap van 100.000 tokens is waar de rekensom omslaat.
Twee dingen trekken in tegengestelde richtingen, en slechts één ervan staat op de tariefkaart. Prijzen dalen hard ten opzichte van Claude Haiku 4.5. Tegelijkertijd levert Claude Haiku 5.5 een bijgewerkte tokenizer, vergelijkbaar met die in Claude Sonnet 5.5 en Claude Opus 5.5, waarvan Anthropic zegt dat die "iets meer tokens per taak gebruikt" — dus een identieke prompt komt aan als een groter aantal factureerbare tokens dan in de vorige generatie. Het gemiddelde van 75% is het nettoresultaat van beide, en het is een leverancierscijfer.
De grens van 100.000 tokens is het punt waarop mensen worden verrast. Anthropic rekent voor Claude Haiku 5.5 af op basis van promptlengte: een verzoek waarvan de prompt meer dan 100.000 tokens bevat, betaalt de hogere tarieven over het hele verzoek, niet alleen over de tokens die de drempel overschrijden. De promptlengte telt alle invoertokens mee, inclusief cache-leesbewerkingen en cache-schrijfbewerkingen, en elk verzoek wordt afzonderlijk geprijsd — een lang verzoek betaalt de hogere tariefschijf, zelfs wanneer een deel van de prompt een cachehit is, en eerdere verzoeken behouden de prijzen waartegen ze zijn gefactureerd. Een retrievalpijplijn die comfortabel op 90.000 tokens zit, betaalt $0,10 en $0,50. Verschuif het venster een stapje en het hele verzoek wordt opnieuw geprijsd tegen $0,50 en $2,50. Bij Claude Sonnet 5.5 is dit niet het geval, omdat het volledige venster van een miljoen tokens tegen standaardtarief wordt gefactureerd.
Hieruit volgen twee gevolgen die in tegengestelde richtingen wijzen. Ten eerste treedt het omslagpunt dat mensen verwachten — lange context waardoor het dure model het goedkopere wordt — niet op: Claude Haiku 5.5 boven de lijn is op de tariefkaart nog steeds een kwart van Claude Sonnet 5.5. Ten tweede wordt de kloof waarop je rekende precies kleiner, van 20x naar 4x, wanneer je workload zwaar wordt, en dat is precies wanneer absolute getallen ertoe beginnen te doen. De stap is de reden dat een kostengevoelige pipeline een eigen budgetlijn nodig heeft in plaats van een tarief per token.
Wat elke leverancier rapporteert dat het scoort
Alles in deze sectie is door de leverancier gerapporteerd en niet door een derde partij gereproduceerd. Anthropic publiceert dezelfde vergelijkingsset op zijn pagina's voor Claude Haiku 5.5 en Claude Sonnet 5.5, en waar de twee pagina's overlappen, komen ze overeen:
• GDPval-AA v2.1, kenniswerk — 1.620 voor Claude Haiku 5.5, tegenover 1.840 voor Claude Sonnet 5.5, 735 voor Claude Haiku 4.5 en 1.437 voor GPT-6 Luna.
• AA-Briefcase v1.1 — 1.578 voor Claude Haiku 5.5, tegenover 1.824 voor Claude Sonnet 5.5, 614 voor Claude Haiku 4.5 en 1.336 voor GPT-6 Luna.
• OSWorld 2.1, computergebruik, offline subset — 72,4% voor Claude Haiku 5.5, tegenover 83,9% voor Claude Sonnet 5.5, 15,7% voor Claude Haiku 4.5 en 48,9% voor GPT-6 Luna.
• Terminal-Bench 4.0, agentisch coderen — 39,2% voor Claude Haiku 5.5, tegenover 70,6% voor Claude Sonnet 5.5, 0,0% voor Claude Haiku 4.5 en 16,4% voor GPT-6 Luna.
• FrontierCode 1.1, Main — 46,4% voor Claude Haiku 5.5, tegen 52,1% voor Claude Sonnet 5.5 bij Xhigh effort, 42,4% voor GPT-6 Luna. Anthropic merkt ook op dat Claude Sonnet 5.5 hierop lager scoort bij Max effort dan bij Xhigh, wat het toeschrijft aan frequenter gebruik van een code-reviewvaardigheid, waardoor time-outs of wijzigingen buiten scope ontstaan.
• Chartografie, visueel redeneren zonder hulpmiddelen — 46,4% voor Claude Haiku 5.5, tegenover 61,6% voor Claude Sonnet 5.5, 6,4% voor Claude Haiku 4.5 en 29,1% voor GPT-6 Luna.
• Humanity's Last Exam — 45,9% zonder hulpmiddelen en 57,4% met hulpmiddelen voor Claude Haiku 5.5; 64,5% met hulpmiddelen voor Claude Sonnet 5.5, 18,7% voor Claude Haiku 4.5, en 56,9% zonder hulpmiddelen voor Claude Sonnet 5.5 op dezelfde pagina. Anthropic merkt op dat de cijfers van de GPT-6-familie mogelijk verouderd zijn omdat OpenAI een bug in beeldbegrip heeft opgelost en niet alle scores van derden waren bijgewerkt.
Twee van die regels zijn het dubbel lezen waard. Op FrontierCode liggen de twee modellen überhaupt dicht bij elkaar — 46,4% tegen 52,1% — en op Chartography, waar geen tools zijn om je achter te verschuilen, bedraagt het verschil 15 punten. Bij Terminal-Bench 4.0 liggen de scores helemaal niet dicht bij elkaar: 39,2% tegen 70,6% is een andere capaciteitsklasse, en daarom verwijst de Claude Sonnet 5.5-pagina van Anthropic nog steeds naar Claude Sonnet 5.5 en Claude Opus 5.5 voor complex agentisch coderen en positioneert Claude Haiku 5.5 als het model voor smal, hoogvolume werk.
Wat de onafhankelijke raad toevoegt
De cijfers van Anthropic vergelijken zijn eigen modellen met elkaar en met één concurrent. Een onafhankelijke ranglijst zet beide af tegen het hele veld, en het cijfer dat zij wel rapporteert maar de leveranciers niet, betreft de kosten per afgeronde taak.
Artificial Analysis kent Claude Haiku 5.5 bij Max effort een Intelligence Index van 43 toe, ruim boven de mediaan van 13 onder vergelijkbare modellen; het model genereert 440 mln outputtokens op de Index tegenover een mediaan van 100 mln — zeer verbose — tegen $0,10 voor input en $0,50 voor output per miljoen, en 242 outputtokens per seconde. De gemeten kosten bedragen $0,21 per Intelligence Index-taak.
Hetzelfde scorebord kent Claude Sonnet 5.5 een score van 56 toe, tegenover een mediaan van 26, waarbij het 410M outputtokens genereert tegenover een mediaan van 88M, tegen $2,00 input en $10,00 output met 90% cachekorting. De gemeten kosten ervan bedragen $7,60 per Intelligence Index-taak.


Zet die twee regels naast elkaar en de verhouding vertelt het verhaal. $0.21 tegenover $7.60 is iets meer dan 36x, en de twee modellen ontlopen elkaar nauwelijks qua uitvoerigheid — 440M outputtokens tegen 410M — dus die vermenigvuldigingsfactor is bijna volledig toe te schrijven aan de tariefkaart die doet wat de tariefkaart zegt dat hij zal doen. Op de tariefkaart van de leverancier zelf is dezelfde vergelijking 20x. Het extra komt van de dingen die een prijs per token niet kan laten zien: het goedkopere model bereikt zijn antwoord met minder gefactureerde tokens per taak bij deze inspanningsinstelling, en cache-reads worden gefactureerd tegen een tiende van het tarief van Claude Sonnet 5.5. Dezelfde harness, dezelfde taken, onafhankelijk gemeten.

Waar de goedkope laag daadwerkelijk opraakt
De klantcijfers die Anthropic publiceert, bepalen vaker de doorslag dan de benchmarks, en ze wijzen allemaal dezelfde kant op. Asana meldt meer dan 30% lagere latentie bij het voltooien van taken en tot 2,5x snellere inferentie per agentbeurt. Box meldt een score die 11 punten boven Claude Haiku 4.5 ligt, bij ongeveer half zoveel latentie. HubSpot meldt de beste score die het in zijn eigen suite heeft gezien: 92,8% gemiddeld over drie runs, met het hoogste trefferpercentage en het laagste percentage valse positieven. AlphaSense verwerkt wekelijks ongeveer 8 miljoen aanroepen via "Ask in Document" en meldt een statistisch significante verbetering ten opzichte van Claude Haiku 4.5: 0,84 tegen 0,76. Cognition meldt dat zijn Fusion-agent met Claude Haiku 5.5 als sidekick een FrontierCode-score van 66,2 behaalt.
Geen enkele daarvan is een agent met een lange horizon. Het zijn puntoplossingen: één duidelijk afgebakende stap die sneller en goedkoper wordt. Dat is de vorm waarvoor Claude Haiku 5.5 is gebouwd, en het is ook de vorm waarin het 36x kostenvoordeel echt geld is in plaats van een afrondingsfout. Het voordeel neemt toe met het callvolume en verdampt naarmate de call-diepte toeneemt: honderdduizend classificatiecalls per dag tegen $0,10 voor input en $0,50 voor output vormen een kostenpost die je ziet verdwijnen, terwijl honderd agentbeurten per sessie, waarbij elke beurt de opgebouwde context opnieuw leest, een kostenpost vormen die superlineair groeit omdat elke beurt voorbij de drempel het hogere tarief betaalt.
Het tegenargument van Claude Sonnet 5.5 is kosten per poging in plaats van kosten per token. Anthropic zegt dat het 30%+ sneller is dan Claude Sonnet 5 en tot 30% minder kost voor de meeste taken, waarbij de besparing komt doordat er minder tokens nodig zijn, niet doordat de tarieven lager zijn. Testers van derden onderbouwen dat met cijfers: Slack meldt ongeveer 14% minder outputtokens, Balyasny ongeveer 121k tokens per antwoord tegenover 497k, Box 2,4x sneller met 12% minder tokens, Lovable ongeveer een derde minder toolaanroepen en ongeveer de helft minder shell-runs, Atlassian tot 30% snellere Rovo Agents, en Base44 3,6 iteraties per build tegenover 7,7 voor Claude Opus 5. Eén beurt die slaagt, verslaat vier die dat niet doen.
Er is een derde factor die de andere kant op werkt. Anthropic heeft de effort-instelling op deze generatie naar een schakelaar op modelniveau verplaatst — de effort-instelling van Claude Haiku 5.5 wordt één keer per verzoek ingesteld in plaats van per verzoek als denkbudget te worden afgestemd, en de oude budget_tokens modus is verouderd op de 4.6-modellen en wordt niet geaccepteerd op latere modellen. Voor een vloot die vanuit veel services één model-ID aanroept, is dat een vereenvoudiging. Voor alles wat zijn eigen redenering per aanroep bepaalde, is het een herschrijving.
Beide achter één endpoint draaien
De reden waarom het de moeite loont om deze beslissing goed te nemen, is dat de verkeerde helft ervan duur is om terug te draaien: een productiepad omleggen van het ene model-ID naar het andere betekent dat je elke call site moet aanraken die uitging van het gedrag van het oude. De goedkopere manier om erachter te komen bij welke tier een workload thuishoort, is om beide achter één endpoint te draaien en verkeer tussen beide te verplaatsen via configuratie in plaats van via refactoring.
Daar is OrcaRouter voor. Claude Sonnet 5.5 staat in de catalogus als anthropic/claude-sonnet-5.5, naast Claude Sonnet 5, Claude Opus 5.5 en Claude Haiku 4.5 — de oudere Haiku-tier blijft beschikbaar als referentiepunt terwijl je er geleidelijk van weg migreert. Het platform geeft de lijstprijs van de aanbieder door zonder opslag, dus de $2,00 en $10,00 hierboven zijn de tarieven die je betaalt, en omgekeerd geldt hetzelfde: wanneer een leverancier zijn prijs aanpast, staat de nieuwe prijs hier dezelfde dag live, en zo bereikte de verlaagde cache-read-prijs van Claude Sonnet 5.5 ons ook. Twee functies doen het werk dat deze specifieke beslissing nodig heeft. Automatische failover houdt een model dat je nog aan het evalueren bent vanzelf buiten je kritieke pad, en de routing-DSL laat je oproepen van minder dan 100.000 tokens naar de goedkope tier sturen en de long-context- of long-horizon-oproepen aan de duurdere tier geven binnen dezelfde requestflow, zonder een tweede contract of een tweede SDK.
Om precies te zijn over wat wel en niet wordt gehost: Claude Sonnet 5.5 kan vandaag via ons worden gerouteerd. Claude Haiku 5.5 staat nog niet in de catalogus. Totdat dat wel het geval is, draait het op Anthropic's eigen API en de drie hierboven genoemde cloudplatforms.
Hoe te beslissen
Kies Claude Haiku 5.5 wanneer de taak nauw afgebakend, omvangrijk en controleerbaar is — classificatie, extractie, routering, samenvatten, het werk per beurt binnen een agent die je al hebt gebouwd. Het tariefverschil van 20x is daar het hele punt, de stap van 100.000 tokens is door het ontwerp te vermijden, en de onafhankelijk gemeten $0,21 per taak zegt dat de winst ook buiten het eigen lab van de leverancier standhoudt. Zet de effort-instelling per taakklasse in plaats van deze op de standaard te laten staan; op een model uit de Haiku-klasse is het verschil tussen Low en Max een kostenvermenigvuldiger, geen kwaliteitsvoorkeur.
Kies Claude Sonnet 5.5 wanneer de taak een lange horizon heeft, agentisch of niet verifieerbaar is — code die moet compileren, computergebruik dat het scherm in een bekende toestand moet achterlaten, alles waarbij een fout antwoord meer kost dan de aanroep. Terminal-Bench 4.0 met 70,6% tegenover 39,2% is geen nuance, het is een andere capaciteitsklasse, en de vaste tariefkaart betekent dat een lange context niet stilletjes de prijs van de hele aanvraag aanpast. Als je workload er echt tussenin zit, is het eerlijke antwoord dat geen van beide modellen al een brede basis van reproductie door derden achter zich heeft, de indexscores komen uit één enkel testharnas, en de hierboven genoemde leverancierscijfers zijn die van de leverancier zelf.
Wat zou dit antwoord veranderen?
Drie dingen zijn het volgen waard, en geen ervan zijn benchmarkreleases. Het eerste is of onafhankelijke evaluaties van Claude Haiku 5.5 bij Low-, High- en Xhigh-effort — niet alleen Max — dezelfde kosten-per-taakverhouding laten zien, omdat de effort-instelling de goedkoopste hefboom in de vergelijking is en het minst gemeten. Het tweede is of de stap van 100.000 tokens standhoudt; een derde band, of helemaal geen band bij de volgende generatie, zou de rekensom voor elke retrieval-pipeline in de praktijk meer veranderen dan welke individuele benchmarkscore dan ook. Het derde is de tokenizer. Als een latere checkpoint dezelfde tekst met de oudere tokenverhouding tokeniseert, wordt Anthropics gemiddelde van 75% een ondergrens in plaats van een doel, en wordt de kloof met Claude Sonnet 5.5 groter zonder dat een van beide prijzen beweegt.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
