Ett hero-kort med rubriken 'Dött lopp vid 0.32828', där Claude Haiku 5.5 och GLM 5.3 Flash står på varsin sida om numret, en rad som lyder Terminal Bench 4.0 0.32828, en Index-rad som lyder 43.40 mot 41.81, och underrubriken 'Samma nummer, olika maskiner'.
Guides & Insights

Claude Haiku 5.5 vs GLM 5.3 Flash: Dött lopp i det benchmarktest som båda leverantörerna citerar

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Run Claude Haiku 5.5 and GLM 5.3 Flash through Terminal Bench 4.0 and you get the same number: 0.32828 for both. Not close — identical, to five decimal places, on the benchmark that the vendor leads with in its own launch materials and that Z.ai's launch materials lead with too. For two models built on entirely different stacks, by vendors in different countries, released six weeks apart, that is a coincidence worth stopping on.

Det är också fel siffra att fatta beslut utifrån. De två modellerna skiljer sig kraftigt åt på alla andra områden, och mönstret i den separationen är tillräckligt ovanligt för att det borde förändra hur du läser endera leverantörens huvudpåståenden. Den ena vinner det sammansatta indexet och siffran för kostnad per uppgift. Den andra vinner nästan allt som liknar en faktisk driftsättning.

De skiljs inte åt av förmåga. De skiljs åt av form.

Börja med det enda numret som säger "dessa är samma klass av modell."

• SciCode — 0,5498 för Claude Haiku 5.5 mot 0,5162 för GLM 5.3 Flash. Två poäng till Anthropic, på ett benchmark där två poäng är brus.

• Terminal Bench 4.0 — 0,32828 mot 0,32828. Oavgjort, exakt.

• Kontextfönster — en miljon tokens för båda.

• Pris för utdata, första nivån – 0,50 USD per miljon för båda.

Fyra rader, fyra nästan-träffar. Om du stannade här skulle du dra slutsatsen att dessa modeller är utbytbara och välja efter pris. Den slutsatsen skulle vara fel, och nästa uppsättning rader är anledningen.

Där de skiljer sig åt är riktningen konsekvent.

De rader som faktiskt skiljer dem åt är inte utspridda. De klustrar i två grupper, och varje modell äger en grupp helt och hållet.

Den agentiska gruppen tillhör GLM 5.3 Flash.AutomationBench delpoäng uppgår till 0,6037 för GLM 5.3 Flash mot 0,3541 för Claude Haiku 5.5 – en skillnad på 25 punkter, den största enskilda skillnaden mellan dessa två modeller på någon gemensam mätning. Tau-Bench Banking visar 0,4722 för GLM 5.3 Flash; Claude Haiku 5.5 har ingen publicerad siffra på den raden. GPQA visar 0,9121 för GLM 5.3 Flash; återigen ingen Anthropic-siffra att jämföra med. När det gäller måtten på huruvida en modell kan hålla samman en uppgift i flera steg och använda verktyg tillförlitligt inom en strukturerad domän ligger Z.ai:s modell före med en marginal som överskuggar skillnaden i sammansatt index som går i motsatt riktning.

Gruppen för sammansatt resultat och kostnad tillhör Claude Haiku 5.5. Artificial Analysis Intelligence Index v4.3.2 visar 43,40 mot 41,81 – 1,59 poäng, och det tal som varje sammanfattning av den här jämförelsen citerar. Kostnaden per slutförd Index-uppgift uppgår till 0,21 USD mot 0,25 USD. Väggklockstid per Index-uppgift visar 424,6 sekunder mot 1 035,4 sekunder: Anthropics modell blir klar på mindre än halva tiden.

Det är så valet ser ut. Claude Haiku 5.5 är snabbare, billigare per avslutat jobb och högre i aggregerat mått. GLM 5.3 Flash är mer tillförlitlig i den specifika typ av arbete som billiga modeller köps in för.

A two-column scoreboard titled 'Claude Haiku 5.5 vs GLM 5.3 Flash - the scoreboard' with rows Terminal Bench 4.0 0.32828 against 0.32828, SciCode 0.5498 against 0.5162, Humanity's Last Exam 0.4439 against 0.3985, AutomationBench 0.3541 against 0.6037, Index v4.3.2 43.40 against 41.81 and cost per task $0.21 against $0.25, footed 'Both figures per Artificial Analysis v4.3.2; Terminal Bench 4.0 is an exact tie.'

Vilken är den man ska tro på?

Inget av dem, för sig självt — och oenigheten i sig är informationen.

Ett Intelligence Index är en viktad blandning över kategorierna resonemang, vetenskap, kodning och agentiska. Det är utformat för att besvara "ungefär hur kapabel är den här modellen" i ett enda tal, och det gör det jobbet. Vad det inte kan göra är att säga om ett försprång på 1,59 punkter kommer från de kategorier din arbetsbelastning verkar i eller från dem den aldrig berör. Här kommer försprånget till stor del från rader som SciCode och Humanity's Last Exam – 0,5498 mot 0,5162, och 0,4439 mot 0,3985 – medan ett underskott på 25 punkter ligger på AutomationBench med motsatt tecken.

Ett team som bygger en kodassistent i en terminal-loop kommer att lägga märke till SciCode-fördelen. Ett team som bygger en agent som måste slutföra ett bankarbetsflöde från början till slut kommer att lägga märke till AutomationBench-gapet, och det kommer att lägga märke till det varje dag. De två teamen tittar på samma index och borde nå motsatta slutsatser.

Det praktiska greppet är att läsa sammanvägningen som ett filter snarare än en rangordning. Om två modeller ligger inom ungefär två indexpoäng har sammanvägningen sagt att de är i samma band och inte sagt något om vilken du bör välja. Vid den punkten är de enda rader som är värda att läsa de som matchar din arbetsbelastning – och om en leverantör inte har publicerat en rad som du behöver, är frånvaron i sig en datapunkt, inte en lucka som ska fyllas igen genom antaganden.

Tokenizer-raden som ingen tar med i jämförelsetabellen

Anthropics egen dokumentation innehåller en mening som förändrar varje prisjämförelse som rör Claude Haiku 5.5, och den är lätt att läsa förbi. Modellen använder den nyare tokeniseraren som delas med Claude 4.7 och senare, vilken räknar samma text som ungefär 30 % fler tokens än modellen den ersätter.

Ställ det mot prislistan och aritmetiken blir mindre smickrande än vad prislappen antyder. Claude Haiku 5.5:s indatapris är $0,10 per miljon token mot GLM 5.3 Flash:s $0,15 – en fördel på 1,5×. Om samma prompt kräver 30 % fler token minskar den effektiva fördelen för identisk text betydligt, även om den inte försvinner. Utdatapriserna är identiska vid $0,50 i den första nivån, så tokenizer-effekten gäller där utan att något väger upp den.

Det uppmätta resultatet är den ärliga versionen av påståendet: enligt Artificial Analysis egen beräkning genererade Claude Haiku 5.5 162 164 utdatatoken per Index-uppgift mot 68 673 för GLM 5.3 Flash — 2,4 gånger så många — och landade ändå på $0.21 per slutförd uppgift mot $0.25. Prisfördelen överlever ordrikedomen, och det som återstår av den är mindre än vad prislistan säger.

Bara en av dessa två har sina priser angivna som fasta. Priset för Claude Haiku 5.5 trappas upp efter 100 000 token i prompten till $0,50 för indata och $2,50 för utdata; GLM 5.3 Flash har ingen motsvarande tröskel publicerad. För det mesta av chatt- och kodassistanstrafik slår det steget aldrig in. För långdokument- eller agentarbete med stor kontext slår det in hela tiden, och vid den punkten inverteras jämförelsen långt bortom vad siffrorna för den första nivån antyder.

A capture of Anthropic's models-overview documentation table headed 'Lifecycle and reference', listing Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 with context windows, maximum outputs, prices per million tokens, latency and default effort, and showing Claude Haiku 5.5 as 'This model' at 1M context, 128K maximum output and 'From $0.10/$0.50'.

Linjen som avgör det innan någon av siffrorna gör det

Allt ovan förutsätter att du fritt kan välja mellan dessa två modeller. En stor andel av teamen kan inte det, och orsaken är en enda rad i specifikationsbladet som benchmarkdiskussionen tenderar att begrava.

GLM 5.3 Flash har öppna vikter, utgiven under MIT-licensen, med 320 miljarder parametrar totalt varav 18 miljarder aktiva. Den kan laddas ner, egenhostas, finjusteras, kvantiseras, låsas till en version och köras i en tenant som du kontrollerar. Claude Haiku 5.5 är proprietär och endast via API, utan publicerat parameterantal, utan licens och utan repositorium.

Om ditt kravdokument säger att modellen måste köras på din egen hårdvara, eller att en specifik checkpoint måste förbli anropbar under de kommande tre åren, är den här jämförelsen över innan priskolumnen ens läses. Det är inte en teknikalitet. Det är den vanligaste anledningen till att team överhuvudtaget hamnar på en mellanklassmodell med öppna vikter, och det är anledningen till att en 25-poängsfördel i AutomationBench inte är det enda som drar i Z.ai:s riktning.

Det går åt andra hållet också, och samma ärlighet gäller. Anthropic publicerar ett åtagande om att inte avveckla Claude Haiku 5.5 tidigare än oktober 2027, och erbjuder modellen via ett förstaparts-API med ett systemkort och en dokumenterad utvärderingsuppsättning. En utgåva med öppna vikter är inte automatiskt mer hållbar – du ärver den operativa bördan tillsammans med vikterna, och en licensfil är inte ett supportavtal. Vilken av de två du vill ha är en fråga om ditt team, inte om modellerna.

Båda sidorna på en och samma knapp, om du vill avgöra det empiriskt

GLM 5.3 Flash finns i OrcaRouters katalog till Z.ai:s listpris med 0 % påslag, vidarefört i stället för sammanblandat, så priset ovan är priset på fakturan och varje ändring som Z.ai gör landar hos oss samma dag. Claude Haiku 5.5 finns inte i vår katalog – den nås via Anthropics eget API – och det är bättre att säga det än att låta det vara underförstått.

Det som katalogen faktiskt gör enkelt är utformningen av det test som den här jämförelsen egentligen kräver. Oenigheten mellan det sammansatta indexet och de agentiska raderna är en hypotes om din arbetsbelastning, och det enda sättet att lösa den är att köra båda modellerna över samma trace. Med GLM 5.3 Flash på rutten och ett Anthropic-ben på andra sidan av samma gateway blir det en konfigurationsändring i stället för två integrationer — ett API för över 200 modeller, en nyckel, automatisk failover under huven, och routnings-DSL:en när du vill dela upp trafiken efter uppgiftsklass och läsa av kostnaden på en enda faktura.

A capture of the OrcaRouter model page for GLM 5.3 Flash under z-ai/glm-5.3-flash, showing a 1M-token context window, 128K maximum output, text, image and video input, benchmarks published by Z.ai on 2026-08-26, the description of its 320B total and 18B active parameters, and a price strip of $0.15 input, $0.50 output and $0.030 cache read per million tokens.

Domen, uttalad på det sätt som siffrorna stöder den.

Om ditt arbete är text in, text ut, håller dina prompter sig inom den första prisnivån och du betalar per token för verklig volym, är Claude Haiku 5.5 den bättre modellen här: högre sammansatt poäng, billigare per slutförd uppgift och mer än dubbelt så snabb per uppgift. Huvudresultatet för terminal-benchmark är jämnt och bör inte användas för att avgöra något.

Om ditt arbete är en agent som måste slutföra ett arbetsflöde i flera steg utan övervakning, ligger GLM 5.3 Flash före på det enda gemensamma benchmark som mäter exakt detta, med 25 punkter, och det är det billigare av de två att modifiera eftersom du kan hålla vikterna.

Oavgjort vid 0.32828 är rätt bild för detta par, men inte för att modellerna är likvärdiga. Det är den enda rad där två modeller som nästan inte har något annat gemensamt råkar hamna på samma siffra — och att behandla den siffran som en sammanfattning av jämförelsen är hur ett inköpsbeslut fattas utifrån den minst informativa siffran i tabellen.