Een hero-titelkaart met de kop 'De Chinese Flash-tier, geauditeerd', met een 'oktober 2026'-claim-check-tag, drie prijs-chips die luiden: Claude Haiku 5.5 $0.10 in / $0.50 uit per 1M tokens, GLM 5.3 Flash $0.15 / $0.50 en DeepSeek V4.1 Flash $0.30 / $1.20, een regel met 'Terminal Bench 4.0 0.32828 - gelijkspel', en een regel van Index v4.3.2 met 43.40 - 41.81 - 39.46.
Guides & Insights

Claude Haiku 5.5 was gericht op de Flash Tier van China. Slechts de helft daarvan doorstaat de toets der kritiek.

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Een lezer die in het Chinees schreef, kwam deze week met een puntig argument: Claude Haiku 5.5 lijkt gebouwd om het Chinese middensegment te veroveren, omdat het DeepSeek V4.1 Flash en GLM 5.3 Flash op prijs onderbiedt en hoger scoort dan GLM 5.3 Flash op Terminal Bench 4.0 en de Artificial Analysis Intelligence Index. Het is een scherpere lezing dan de meeste lanceringscommentaren. Het is ook een kwestie van twee beweringen in één jas, en ze bevatten niet evenveel waarheid.

Anthropic bracht Claude Haiku 5.5 uit op 7 oktober 2026 — een volledige publieke lancering met een gedateerde aankondiging, een systeemkaart en een gepubliceerde tariefkaart. Dat geeft de bewering iets wat marktcommentaar uit tweede hand zelden krijgt: cijfers die je kunt controleren.

De onderstaande audit stelt vast dat de ene helft sterker is dan de lezer zei en de andere helft onjuist is op de specifieke benchmark die deze noemt. Beide bevindingen zijn het waard om te weten, omdat ze in tegengestelde richtingen wijzen.

De bewering, precies geformuleerd

Tot zijn onderdelen teruggebracht, bestaat het argument uit drie delen.

• Prijs — Claude Haiku 5.5 is goedkoper dan DeepSeek V4.1 Flash en goedkoper dan GLM 5.3 Flash.

• Onafhankelijke score — deze ligt ongeveer een punt boven GLM 5.3 Flash op de Artificial Analysis Intelligence Index.

• Codingbenchmark — hij scoort ook een punt hoger dan GLM 5.3 Flash op Terminal Bench 4.0.

Twee daarvan zijn te controleren aan de hand van gepubliceerde tabellen en houden stand, met aanpassingen. De derde is te controleren aan de hand van dezelfde tabel en komt anders uit dan beschreven.

A three-column scoreboard titled 'The claim, audited - Claude Haiku 5.5 against the flash tier' comparing Claude Haiku 5.5, GLM 5.3 Flash and DeepSeek V4.1 Flash across six rows: input price, output price, Intelligence Index v4.3.2 (43.40, 41.81 and 39.46), Terminal Bench 4.0 (0.32828, 0.32828 and 0.2677), cost per finished task ($0.21, $0.25 and $0.27) and weights (proprietary, MIT open, MIT open), footed 'Vendor list rates; Index and benchmark figures per Artificial Analysis v4.3.2.'

Het prijsgedeelte: waar, en in de ene richting te laag voorgesteld, in de andere te hoog voorgesteld.

Het tarief van Anthropic voor Claude Haiku 5.5 is $0,10 per miljoen invoertokens en $0,50 per miljoen uitvoertokens tot een prompt van 100.000 tokens, en stijgt naar $0,50 en $2,50 boven die drempel. Het lezen van gecachte invoer kost $0,01 en het schrijven naar de cache kost $0,125. Het contextvenster is één miljoen tokens; de maximale uitvoer is 128.000.

GLM 5.3 Flash, van Z.ai, staat vermeld voor $0,15 en $0,50, met gecachte invoer voor $0,026. DeepSeek V4.1 Flash staat vermeld voor $0,30 en $1,20, met gecachte invoer voor $0,006.

Wat het hoofdtarief betreft, heeft de lezer gelijk. Een inputtarief van $0,10 ligt een derde onder GLM 5.3 Flash en twee derde onder DeepSeek V4.1 Flash, en een outputtarief van $0,50 komt exact overeen met GLM 5.3 Flash, terwijl het ruim onder de helft van dat van DeepSeek blijft. Dat is een bewust ogende landing: evenaar de output van de goedkopere rivaal, versla die op input, en laat de ratio het woord doen.

Waar het voor de claim beter uitpakt, zijn de gemeten kosten per voltooide taak. Op de Intelligence Index v4.3.2 van Artificial Analysis komen de kosten voor de hele klus uit op $0,21 voor Claude Haiku 5.5, $0,25 voor GLM 5.3 Flash en $0,27 voor DeepSeek V4.1 Flash. De tariefkaart zegt dat Claude Haiku 5.5 op invoer 1,5 keer goedkoper is dan GLM 5.3 Flash; de meting zegt dat de voltooide taak ongeveer een zesde goedkoper is. Nog steeds de goedkoopste van de drie — alleen niet met de marge die het prijskaartje suggereert.

De reden is er een die de meeste prijsvergelijkingen overslaan. Claude Haiku 5.5 is breedsprakig. Artificial Analysis registreerde 162.164 outputtokens voor het model tijdens het draaien van de Index, tegenover 68.673 voor GLM 5.3 Flash en 88.574 voor DeepSeek V4.1 Flash. De eigen documentatie van Anthropic voegt een tweede effect toe: het model gebruikt de nieuwere tokenizer die het deelt met Claude 4.7 en later, waardoor dezelfde tekst goed is voor ongeveer 30% meer tokens dan op het model dat het vervangt. Een lager tarief dat op meer tokens wordt toegepast, is een lager tarief dat op meer tokens wordt toegepast.

Een complicatie die alleen op een gerouteerde factuur opduikt: onze eigen catalogus vermeldt DeepSeek V4.1 Flash tegen $0,15 voor input en $0,60 voor output, met een vermenigvuldigingsfactor van 2× die tijdens twee dagelijkse vensters wordt toegepast, 01:00–04:00 en 06:00–10:00 UTC. Achttien uur per dag geldt dat basistarief; zes uur per dag is het outputtarief $1,20. Batchverkeer dat buiten die vensters kan worden ingepland, krijgt een wezenlijk betere DeepSeek-prijs dan het in het oog springende lijsttarief van de leverancier doet vermoeden, en interactief verkeer niet. Als je deze vergelijking echt modelleert, is de kalender net zo belangrijk als de tariefkaart.

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

De scorehelft: "ongeveer een punt" is 1,6

Op de Artificial Analysis Intelligence Index v4.3.2 wordt Claude Haiku 5.5 gemeten op 43,40 in zijn Max-configuratie. GLM 5.3 Flash wordt gemeten op 41,81. DeepSeek V4.1 Flash staat op 39,46.

Dus het indexgedeelte van de bewering klopt qua richting en rondt naar beneden af: het verschil is 1,59 punten, niet één. Dat is een echte voorsprong op een index die richting de zestig loopt, en het is het getal dat in elke samenvatting van deze confrontatie wordt aangehaald.

Wat het niet is, is een bewering over de benchmarks daaronder. Beide leveranciers publiceren hun eigen evaluatiesets, en dat zijn niet dezelfde sets — Anthropic rapporteert GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 en FrontierCode voor Claude Haiku 5.5; Z.ai rapporteert zijn eigen suite voor GLM 5.3 Flash. De onafhankelijke ranglijst is de enige onderling vergelijkbare rij die beschikbaar is, en dat is precies waarom er zo zwaar op het indexverschil wordt geleund en waarom de volgende sectie belangrijk is.

Het codeergedeelte: deze is een regelrechte gelijkstand, geen overwinning.

Terminal Bench 4.0 komt, op de gedeelde onafhankelijke meting, uit op 0,32828 voor Claude Haiku 5.5 en 0,32828 voor GLM 5.3 Flash. Identiek tot vijf decimalen.

Dat is het meest citeerbare getal in deze vergelijking, en de bewering daarover is onjuist. De waarschijnlijke bron van de verwarring is de aangrenzende rij: de volledige GLM-5.3, het niet-Flash-zustermodel, scoort 0,4192 op dezelfde benchmark. Als je "GLM" en "Terminal Bench" in één zin hebt gezien naast een getal dat een punt hoger is dan Claude Haiku 5.5, dan gaat het om het zustermodel, niet om de Flash.

De andere drie rijen die Artificial Analysis voor beide modellen publiceert, zijn interessanter dan de gelijke stand, en ze wijzen niet in één richting:

• SciCode — 0,5498 voor Claude Haiku 5.5 tegen 0,5162 voor GLM 5.3 Flash. Een voorsprong van 3,4 punten voor Anthropic.

• Humanity's Last Exam — 0,4439 tegen 0,3985. Een voorsprong van 4,5 punt voor Anthropic.

• AutomationBench, gedeeltelijke score — 0,3541 tegenover 0,6037. Een voorsprong van 25 punten voor GLM 5.3 Flash, en veruit het grootste verschil in de set.

Die laatste rij is de rij waar inkoopteams het meest om geven, want agentische automatisering is precies waar de middenklassemodellen daadwerkelijk worden ingezet. Op een maatstaf voor de vraag of het model een taak met meerdere stappen tot voltooiing kan brengen, wint het goedkopere open-weights-model met een marge die het indexverschil van 1,6 punt in de andere richting in het niet doet vallen.

Snelheid valt op dezelfde manier uiteen als de prijs, alleen nog sterker. Artificial Analysis mat 424,6 seconden per Index-taak voor Claude Haiku 5.5 tegenover 1035,4 seconden voor GLM 5.3 Flash. Het model van Anthropic doet dat in minder dan de helft van de wall-clocktijd, wat in een agent-loop een belangrijker operationeel cijfer is dan de tokensnelheid.

Wat de claim volledig weglaat

De vergelijking wordt gepresenteerd als een prijs-en-scoreverhaal, waarin stilzwijgend de dimensie wordt overgeslagen waarin de twee modellen het minst op elkaar lijken. GLM 5.3 heeft open gewichten, gepubliceerd onder MIT, met 320 miljard totale parameters en 18 miljard actieve. DeepSeek V4.1 Flash heeft eveneens open gewichten, met 552 miljard totaal en 16 miljard actief. Claude Haiku 5.5 is propriëtair, alleen via API, zonder gepubliceerd aantal parameters en zonder repository.

Dat is voor veel kopers geen voetnoot; het is de eerste regel van het eisenpakket. Een team dat inferentie in zijn eigen tenantomgeving moet draaien, moet fine-tunen of een modelversie jarenlang vast moet houden, kiest helemaal niet tussen deze drie op basis van indexpunten — twee van de drie vallen af voordat de prijskolom wordt gelezen. De framing van de lezer is een observatie over marktpositionering en het is een terechte; het is alleen zo dat het structurele verschil juist ingaat tegen het model dat de framing verdedigt.

Zelf de vergelijking uitvoeren

GLM 5.3 Flash en DeepSeek V4.1 Flash staan beide in de OrcaRouter-catalogus tegen de lijstprijs van de provider met 0% markup, waardoor de Chinese kant van deze vergelijking iets is wat je vandaag kunt aanroepen in plaats van te modelleren in een spreadsheet. Omdat het tarief wordt doorgegeven in plaats van vermengd, landt een prijswijziging van een leverancier bij ons op dezelfde dag als bij hen — en het hierboven beschreven op de kalender gebaseerde DeepSeek-venster is zichtbaar in hetzelfde prijsblok waartegen je zou routeren. Eén sleutel, één SDK, automatische failover eronder, en de routing-DSL als je liever een kostenplafond in de route uitdrukt dan in applicatiecode.

Claude Haiku 5.5 staat niet in onze catalogus. Het is bereikbaar via Anthropics eigen API, en het is beter dat ronduit te zeggen dan het impliciet te laten.

A capture of the OrcaRouter models index, headed 'Models' with the subtitle '207 models, 16 providers - one API key, one bill' and an OpenAI-compatible cURL example showing a POST to the chat completions endpoint with the model field.

Wat de lezer goed heeft begrepen, en wat je ermee moet doen

De intuïtie klopt. Als je de golf van goedkope, capabele Chinese modellen uit het middensegment duur wilde laten lijken, is dit ongeveer de kaart die je zou spelen: evenaar het outputtarief van de goedkopere rivaal, halveer zijn inputtarief, kom 1,6 indexpunten voor te liggen en laat het getal van de prijs per voltooide taak het argument dragen. Claude Haiku 5.5 doet dat, en het doet dat terwijl het per taak meer dan twee keer zo snel is als het model waarop het is gericht.

Wat de lezer verkeerd heeft, is beperkter en interessanter. Terminal Bench 4.0 is geen overwinning; het is een exact gelijkspel. Het prijsvoordeel, wanneer je de hele taak afrekent in plaats van per token, is ongeveer een zesde in plaats van de 1,5× die de tariefkaart suggereert. En de enige benchmark waarop de twee modellen het verst uiteenlopen, is de agentische, waarop GLM 5.3 Flash met 25 punten voorloopt.

Dus de eerlijke versie van de bewering is deze: Claude Haiku 5.5 is gericht op de Chinese flash-tier, wint die vergelijking op de samengestelde index, op kosten per voltooide taak en op latentie, wint die niet op agentische automatisering of openheid, en de specifieke coding-benchmarkvoorsprong die het argument beslissend deed lijken, bestaat niet.

Vergeleken in dit artikel3

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt