Ett hero-rubrikkort med rubriken 'Den kinesiska Flash-nivån, granskad' med en 'oktober 2026'-faktakontrolltagg, tre prischips med texten Claude Haiku 5.5 $0.10 in / $0.50 ut per 1M tokens, GLM 5.3 Flash $0.15 / $0.50 och DeepSeek V4.1 Flash $0.30 / $1.20, en rad med texten 'Terminal Bench 4.0 0.32828 - oavgjort', och en rad för Index v4.3.2 som lyder 43.40 - 41.81 - 39.46.
Guides & Insights

Claude Haiku 5.5 riktades mot Kinas Flash-nivå. Bara hälften av det påståendet tål granskning.

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

En läsare som skriver på kinesiska framförde ett skarpt argument den här veckan: Claude Haiku 5.5 verkar vara byggd för att ta den kinesiska mellanklassmarknaden, eftersom den underbjuder DeepSeek V4.1 Flash och GLM 5.3 Flash i pris och får högre poäng än GLM 5.3 Flash på Terminal Bench 4.0 och Artificial Analysis Intelligence Index. Det är en skarpare tolkning än de flesta lanseringskommentarer. Det är också två påståenden i en och samma skrud, och de bär inte samma mängd sanning.

Anthropic släppte Claude Haiku 5.5 den 7 oktober 2026 – en fullständig offentlig lansering med ett daterat tillkännagivande, ett systemkort och en publicerad prislista. Det ger påståendet något som andrahandskommentarer om marknaden sällan får: siffror som går att kontrollera.

Granskningen nedan visar att den ena hälften är starkare än vad läsaren sade och att den andra hälften är felaktig i fråga om det specifika riktmärket som den citerar. Båda fynden är värda att känna till, eftersom de pekar i motsatta riktningar.

Påståendet, exakt formulerat

Avskalat till sina beståndsdelar har argumentet tre delar.

• Pris — Claude Haiku 5.5 är billigare än DeepSeek V4.1 Flash och billigare än GLM 5.3 Flash.

• Oberoende poäng — den ligger ungefär en poäng över GLM 5.3 Flash på Artificial Analysis Intelligence Index.

• Kodningsbenchmark – den får också en poäng mer än GLM 5.3 Flash på Terminal Bench 4.0.

Två av dem kan kontrolleras mot publicerade tabeller och stämmer, med vissa justeringar. Den tredje kan kontrolleras mot samma tabell och utfallet blir ett annat än det beskrivna.

A three-column scoreboard titled 'The claim, audited - Claude Haiku 5.5 against the flash tier' comparing Claude Haiku 5.5, GLM 5.3 Flash and DeepSeek V4.1 Flash across six rows: input price, output price, Intelligence Index v4.3.2 (43.40, 41.81 and 39.46), Terminal Bench 4.0 (0.32828, 0.32828 and 0.2677), cost per finished task ($0.21, $0.25 and $0.27) and weights (proprietary, MIT open, MIT open), footed 'Vendor list rates; Index and benchmark figures per Artificial Analysis v4.3.2.'

Prishalvan: sann, och underskattad i en riktning, överskattad i en annan

Anthropics publicerade pris för Claude Haiku 5.5 är $0,10 per miljon indata-tokens och $0,50 per miljon utdata-tokens upp till en prompt på 100 000 tokens, och stiger till $0,50 och $2,50 över den tröskeln. Cachad indata kostar $0,01 att läsa och $0,125 att skriva. Kontextfönstret är en miljon tokens; maximal utdata är 128 000.

GLM 5.3 Flash från Z.ai listas till $0,15 och $0,50, med cachad indata till $0,026. DeepSeek V4.1 Flash listas till $0,30 och $1,20, med cachad indata till $0,006.

Vad gäller det annonserade priset har läsaren rätt. Ett indatapris på 0,10 dollar är en tredjedel lägre än GLM 5.3 Flash och två tredjedelar lägre än DeepSeek V4.1 Flash, och ett utdatapris på 0,50 dollar matchar GLM 5.3 Flash exakt samtidigt som det ligger långt under hälften av DeepSeeks pris. Det ser ut som en medvetet vald prisnivå: matcha den billigare rivalens utdatapris, slå den på indatapriset och låt förhållandet tala.

Där det blir bättre för påståendet är den uppmätta kostnaden per slutförd uppgift. På Artificial Analysis Intelligence Index v4.3.2 landar kostnaden för hela jobbet på 0,21 USD för Claude Haiku 5.5, 0,25 USD för GLM 5.3 Flash och 0,27 USD för DeepSeek V4.1 Flash. Prislistan säger att Claude Haiku 5.5 är 1,5 gånger billigare än GLM 5.3 Flash på input; mätningen säger att den slutförda uppgiften är ungefär en sjättedel billigare. Fortfarande billigast av de tre – bara inte med den marginal som prislappen antyder.

Anledningen är den som de flesta prisjämförelser utelämnar. Claude Haiku 5.5 är ordrik. Artificial Analysis registrerade 162 164 utdatatoken för den när man körde Index, mot 68 673 för GLM 5.3 Flash och 88 574 för DeepSeek V4.1 Flash. Anthropics egen dokumentation tillför en andra effekt: modellen använder den nyare tokeniseraren som delas med Claude 4.7 och senare, så samma text räknas som ungefär 30 % fler token än på modellen den ersätter. En billigare taxa tillämpad på fler token är en billigare taxa tillämpad på fler token.

En egenhet som bara dyker upp på en routad faktura: vår egen katalog listar DeepSeek V4.1 Flash till $0.15 för indata och $0.60 för utdata, med en multiplikator på 2× som tillämpas under två dagliga tidsfönster, 01:00–04:00 och 06:00–10:00 UTC. Arton timmar om dygnet är det grundtaxan; sex timmar om dygnet är utdatapriset $1.20. Batchtrafik som kan schemaläggas utanför dessa fönster får ett väsentligt bättre DeepSeek-pris än leverantörens officiella listpris antyder, medan interaktiv trafik inte gör det. Om du modellerar den här jämförelsen på riktigt spelar kalendern lika stor roll som priskortet.

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

Poängdelen: "ungefär en poäng" är 1,6.

På Artificial Analysis Intelligence Index v4.3.2 mäts Claude Haiku 5.5 till 43,40 i sin Max-konfiguration. GLM 5.3 Flash mäts till 41,81. DeepSeek V4.1 Flash ligger på 39,46.

Så indexhalvan av påståendet är riktningsmässigt rätt och avrundas nedåt: gapet är 1,59 punkter, inte en. Det är en riktig ledning på ett index som når upp i sextiotalet, och det är siffran som citeras i varje sammanfattning av den här matchen.

Vad den inte är, är ett påstående om benchmarkarna bakom. Båda leverantörerna publicerar sina egna utvärderingsset, och de är inte samma set – Anthropic rapporterar GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 och FrontierCode för Claude Haiku 5.5; Z.ai rapporterar sin egen svit för GLM 5.3 Flash. Den oberoende resultattavlan är den enda tillgängliga raden för en äpplen-mot-äpplen-jämförelse, vilket är precis varför man lutar sig så hårt mot indexgapet och varför nästa avsnitt är viktigt.

Kodningsdelen: den här är ett dött lopp, inte en vinst.

Terminal Bench 4.0, enligt den gemensamma oberoende mätningen, visar 0,32828 för Claude Haiku 5.5 och 0,32828 för GLM 5.3 Flash. Identiska ned till fem decimaler.

Det är den absolut mest citerbara siffran i den här jämförelsen, och påståendet om den är fel. Den troliga källan till förvirringen är den närliggande raden: den fullständiga GLM-5.3, syskonmodellen som inte är Flash, får 0,4192 på samma benchmark. Om du har sett ”GLM” och ”Terminal Bench” i en och samma mening bredvid en siffra en poäng över Claude Haiku 5.5, är det syskonmodellen, inte Flash.

De andra tre raderna som Artificial Analysis publicerar för båda modellerna är mer intressanta än oavgjort, och de pekar inte åt ett håll:

• SciCode — 0,5498 för Claude Haiku 5.5 mot 0,5162 för GLM 5.3 Flash. En fördel på 3,4 punkter för Anthropic.

• Humanity's Last Exam — 0,4439 mot 0,3985. En fördel på 4,5 punkter för Anthropic.

AutomationBench, delpoäng – 0,3541 mot 0,6037. Ett försprång på 25 poäng för GLM 5.3 Flash, och den överlägset största skillnaden i setet.

Den sista raden är den som inköpsteamen kommer att bry sig mest om, eftersom agentisk automation är där mellanklassmodellerna faktiskt används. I ett mått på om modellen kan driva en uppgift i flera steg till slutförande vinner den billigare modellen med öppna vikter med en marginal som får 1,6 punkters indexskillnad i motsatt riktning att blekna.

Hastigheten skiljer sig åt på samma sätt som priset, fast ännu mer. Artificial Analysis mätte 424,6 sekunder per Index-uppgift för Claude Haiku 5.5 mot 1035,4 sekunder för GLM 5.3 Flash. Anthropics modell kommer dit på mindre än halva den verkliga tiden, vilket i en agentloop är ett större operativt mått än tokenhastigheten.

Vad påståendet helt utelämnar

Jämförelsen ramas in som en pris- och poängberättelse, vilket i tysthet förbigår den dimension där de två modellerna är minst lika varandra. GLM 5.3 Flash har öppna vikter och är publicerad under MIT, med 320 miljarder totala parametrar och 18 miljarder aktiva. DeepSeek V4.1 Flash har likaså öppna vikter, med 552 miljarder totalt och 16 miljarder aktiva. Claude Haiku 5.5 är proprietär och endast tillgänglig via API, utan publicerat parameterantal och utan kodförråd.

Det är inte en fotnot för många köpare; det är första raden i kravdokumentet. Ett team som behöver köra inferens i sin egen tenant, finjustera eller hålla en modellversion fast i flera år väljer inte alls mellan dessa tre utifrån indexpoäng – två av de tre är diskvalificerade innan priskolumnen ens har lästs. Läsarens inramning är en marknadspositioneringsobservation och det är en rimlig sådan; det råkar bara vara så att den strukturella skillnaden går emot den modell som inramningen försvarar.

Att köra jämförelsen själv

GLM 5.3 Flash och DeepSeek V4.1 Flash finns båda i OrcaRouter-katalogen till leverantörens listpris med 0 % påslag, vilket gör den kinesiska sidan av denna jämförelse till något du kan anropa idag i stället för att modellera i ett kalkylblad. Eftersom priset förs vidare i stället för att blandas, landar en leverantörsprisändring på vår sida samma dag som den landar på deras – och det kalenderbaserade DeepSeek-fönstret som beskrivs ovan syns i samma prisblock som du skulle routa mot. En nyckel, en SDK, automatisk failover i botten, och routing-DSL:en om du hellre vill uttrycka ett kostnadstak i rutten än i applikationskoden.

Claude Haiku 5.5 finns inte med i vår katalog. Det går att nå via Anthropics eget API, och det är bättre att säga det rakt ut än att låta det vara underförstått.

A capture of the OrcaRouter models index, headed 'Models' with the subtitle '207 models, 16 providers - one API key, one bill' and an OpenAI-compatible cURL example showing a POST to the chat completions endpoint with the model field.

Vad läsaren hade rätt i, och vad man gör med det

Instinkten är riktig. Om du ville få vågen av billiga, kapabla kinesiska mellanklassmodeller att framstå som dyr, är detta ungefär kortet du skulle spela: matcha den billigare rivalens outputpris, halvera dess inputpris, hamna 1,6 indexpunkter före och låt siffran för pris per slutförd uppgift bära argumentet. Claude Haiku 5.5 gör det, och den gör det samtidigt som den är mer än dubbelt så snabb per uppgift som modellen den riktar sig mot.

Det läsaren missförstod är snävare och mer intressant. Terminal Bench 4.0 är inte en seger; det är ett exakt oavgjort resultat. Prisfördelen, när man debiterar för hela jobbet i stället för per token, är ungefär en sjättedel i stället för den 1,5× som prislistan antyder. Och det enda benchmark där de två modellerna skiljer sig mest åt är det agentiska, där GLM 5.3 Flash leder med 25 poäng.

Så den ärliga versionen av påståendet är denna: Claude Haiku 5.5 riktar sig mot den kinesiska flash-nivån, den vinner den jämförelsen när det gäller det sammansatta indexet, kostnaden per slutförd uppgift och latensen, den vinner den inte när det gäller agentisk automatisering eller öppenhet, och det specifika försprånget på kodningsbenchmark som fick argumentet att kännas avgörande finns inte.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen