Ett genererat titelkort med texten 'Claude Haiku 5.5: 100K-prissteget', som visar två priskort — 'Under 100K tokens: $0.10 in / $0.50 ut' och 'Över 100K tokens: $0.50 in / $2.50 ut' — med en uppåtgående steggrafik mellan dem och en sidfotsrad 'Anthropics listpriser, oktober 2026.' Den riktiga OrcaRouter-logotypen är kompositad i nedre högra hörnet.
Guides & Insights

Claude Haiku 5.5:s verkliga historia är 100K-klippan: Vad den nya Haiku tar betalt bortom 100 000 tokens

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Claude Haiku 5.5 kom den 7 oktober 2026 med ett annonserat pris på 0,10 USD per miljon indatatoken och 0,50 USD per miljon utdatatoken, och siffran som upprepades överallt var den som Anthropic själva tog med i tillkännagivandet: en minskning med 90 procent jämfört med Haiku 4.5-priset för samma två postar. De 90 procenten är verkliga. De är också begränsade till ena hälften av en enda dimension av räkningen, och i samma stund som en begäran passerar 100 000 token gör varje taxa i den något som lanseringsbevakningen mest hoppade över. Den här artikeln handlar om den gränslinjen – vad den kostar, vilka arbetsbelastningar som faktiskt når den, och varför ”90 procent billigare” är ett påstående om en del av räkningen snarare än om din räkning.

De två priserna, och var de växlar

Anthropic publicerar två kolumner för modellen, och växlingen mellan dem är en enda tröskel för storleken på begäran snarare än någon modellinställning du väljer:

• Kort nivå, på eller under 100 000 tokens — $0,10 per miljon indatatokens, $0,50 per miljon utdatatokens (Anthropics prislista) • Lång nivå, över 100 000 tokens — $0,50 per miljon indatatokens, $2,50 per miljon utdatatokens (Anthropics prislista) • Cacheläsningar — $0,01 per miljon (kort nivå) och $0,05 per miljon (lång nivå) • Batch-API — 50 % rabatt på endera kolumnen, och en maximal utdatalängd på 300 000 tokens • Standard för maximal utdata — 128 000 tokens, med ett kontextfönster på 1 miljon tokens i båda nivåerna

A generated single-column scoreboard titled 'Claude Haiku 5.5 — the scoreboard' listing Input price (under 100K): $0.10 per million, Output price (under 100K): $0.50 per million, Input price (over 100K): $0.50 per million, Output price (over 100K): $2.50 per million, Context window: 1,000,000 tokens, AA Index: 43.4, with the footer 'Anthropic list prices; AA Index per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.

Det där är Anthropics egna publicerade priser, inte uppmätta, och de är den aktuella listan: prissättningen för en så här ny modell har inte hunnit förändras, även om Anthropic inte har någon skyldighet att hålla den kvar.

Läs de fyra siffrorna i ordning, så är formen på saken uppenbar. Varje taxa i nivån för lång kontext är exakt fem gånger taxan för kort kontext, och tröskelvärdet är samma 100 000 tokens för alla på en gång. Det finns ingen gradvis kurva, ingen interpolering, inget mellanliggande band – en begäran på 99 000 tokens och en på 101 000 tokens skiljer sig med en faktor fem för varje token i räkningen, inte bara för de 2 000 tokens som passerade gränsen. Det är detta som gör det till ett stup snarare än en sluttning, och det är detta som inramningen ”90 procent billigare” inte kan se.

A screenshot of Anthropic's Claude Platform Docs pricing page, showing the model pricing table and the per-model rate columns for the Claude line, captured in English.

Varför ser såret större ut än det är

Jämfört med Haiku 4.5, den jämförelse som Anthropic gjorde, är den korta nivån en verklig minskning med 90 procent på både input och output — Haiku 4.5 kostade $1.00 och $5.00 per miljon för samma två kolumner. Den långa nivån är en annan historia: $0.50 och $2.50 mot samma $1.00 och $5.00 är en minskning med 50 procent, inte 90 procent. Så den ärliga versionen av lanseringspåståendet är att Claude Haiku 5.5 är 90 procent billigare än Haiku 4.5 under 100 000 tokens och 50 procent billigare över det, vilket är exakt den uppdelning som Anthropics egen dokumentation anger när man läser båda kolumnerna i stället för bara den ena. Den enskilda procentsatsen är inte fel; det är procenten för den korta nivån, presenterad utan sitt villkor.

Det finns en andra sak som drar i motsatt riktning, och den är den mer intressanta eftersom den är lätt att missa och svår att komma runt. Claude Haiku 5.5 levereras med en ny tokenizer, och Anthropics egen vägledning anger tokenantalet för en given textmängd till ungefär 30 procent högre än vad Haiku 4.5 gav för samma innehåll. Vad du än betalade per token sjönk, medan vad du betalar per token av *din* text steg med ungefär en tredjedel, jämfört med den gamla modellens beräkning. Anthropics angivna nettofigur – att modellen är ungefär 75 procent billigare att köra i genomsnitt – räknar redan in detta: en 90-procentig sänkning av listpriset minus en tokeninflation på omkring 30 procent landar i det häradet vid trafik med kort kontext – men de två effekterna går att separera och är värda att separera. Prisförändringen är en ändring av listpriset som du kan läsa av på en sida; tokenizerförändringen ändrar hur många enheter av det priset dina befintliga prompter förbrukar, och den syns i dina egna tokenantal innan den syns någon annanstans.

För en arbetsbelastning som redan med god marginal låg under 100 000 tokens per anrop är den praktiska effekten en direkt minskning av kostnaden per anrop, delvis uppvägd av tokeniseraren. För en som inte gjorde det går aritmetiken åt andra hållet två gånger på den långa halvan.

Vad finns det egentligen ovanför 100 000 tokens

Reflexen är att placera långkontextprissättning under "agentisk kodning och RAG, inte oss." Det är för snabbt, för gränsen på 100 000 token är en gräns per förfrågan, och storleken per förfrågan är inte samma sak som uppgiftens storlek. Några mönster överskrider den rutinmässigt:

• En agent som läser kodbaser och som håller en stor arbetsmängd i kontexten under en hel session, i stället för att hämta om information vid varje steg

• Dokument- och avtalsanalys där indata är en lång PDF plus dess egna instruktioner och few-shot-exempel – den typ av prompt som var 60 000 tokens innan någon lade till exemplen

Ingestionspipelines som batchar många små objekt till ett anrop för att amortera overhead per anrop, och därigenom för hela batchen över tröskeln

• Chattprodukter som har en fullständig konversation inline i stället för att sammanfatta den, där förfrågan kvarstår tills något trunkerar den

• Ljud- och långvideo-transkriptionsliknande indata, vilket är precis den typ av trafik som ett kontextfönster på 1 miljon tokens marknadsförs för att möjliggöra

Kontextfönstret på 1 miljon token är den del av specifikationsbladet som gör stupet värt att tala om. Anthropic säljer möjligheten att ge modellen en mycket stor förfrågan, och prissättningen är utformad så att de sista 900 000 token i den förfrågan kostar fem gånger så mycket som de första 100 000 gjorde. Båda sakerna är avsiktliga; de tillkännages bara på olika ställen. Om långkontextfönstret är anledningen till att du överhuvudtaget tittar på den här modellen, är långkontextkolumnen din kolumn, och lanseringsprocenten är någon annans.

Trycket priset utövar på Flash-nivån

A​nthropics uttalade avsikt med modellen är att hålla den billiga änden av stacken med hög genomströmning, och prislistan återspeglar den avsikten tydligt. Bloombergs rapportering om lanseringen framställde det som att A​nthropic försvarar sin lågkostnadsposition mot billigare konkurrenter med öppna vikter, och leverantörssidans framställning gick längre – att den nya Haiku är prissatt för att underbjuda sina direkta rivaler med bred marginal.

Jämförelsen är bara rättvis på den korta nivån, där $0,10 och $0,50 är aggressivt låga. Över 100 000 tokens ligger priserna på $0,50 och $2,50 inte längre under någon annans korta nivå; de är vanliga mellannivåpriser. Leverantörens påstående om "bred marginal" är ett uttalande om prislistans första kolumn, och Anthropic har rätt att göra det där – det är en korrekt tolkning av siffrorna som företaget publicerar. Det är inte ett påstående om vad en arbetsbelastning med lång kontext betalar, och det bör inte citeras som ett sådant.

Resten av modellen, kortfattat

Claude Haiku 5.5 behåller funktionerna som levererades med Sonnet- och Opus-serien i stället för att skala bort dem för storleksklassen. Adaptivt tänkande med en förvald ansträngningsinställning på medel finns med, och det är den första modellen i Haiku-klassen med ett justerbart ansträngningsreglage som sträcker sig från Låg till Max. Kunskapsavgränsningen är juni 2026 och modell-ID:t är claude-haiku-5-5. A​nthropic uppger ett utfasningsdatum tidigast den 7 oktober 2027 — samma datum som lanseringen, ett år senare — och modellen listas på Amazon Bedrock, G​oogle Cloud och Microsoft Azure tillsammans med A​nthropics eget API.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5, headlined 'Proprietary model — Released October 2026', with an Intelligence Index of 43.395, speed #10 of 182, and a cost comparison block showing $0.10 input.

När det gäller benchmarkdelen bär allt i lanseringsinlägget samma härkomstetikett och förtjänar den: detta är siffror som rapporterats av leverantören, mätta av företaget som säljer modellen, utan någon oberoende reproduktion publicerad vid tiden för skrivandet.

• GDPval-AA v2.1 — enligt leverantören 1 620 för Claude Haiku 5.5, mot 735 för Haiku 4.5 i samma testramverk

• AA-Briefcase v1.1 — leverantörsrapporterade 1 578, mot 614 för föregående generation

• OSWorld 2.1 — leverantörsrapporterade 72,4 procent, mot 15,7 procent

• Terminal-Bench 4.0 — leverantörsrapporterat 39,2, mot 0,0

• Humanity's Last Exam – leverantörsrapporterade 45,9 procent, eller 57,4 med verktygsanvändning

Storleken på dessa deltavärden är anledningen till att flagga dem snarare än att citera dem. Ett hopp från 15,7 till 72,4 i ett OS-agent-benchmark som mäts av modellens egen leverantör är en siffra att ta med en nypa salt tills en tredje part kör samma testrigg. Artificial Analysis har publicerat sitt eget index för modellen per början av oktober 2026 — en oberoende siffra på 43,395, med 0,329 på Terminal-Bench Hard och 0,444 på HLE — och det är den uppsättningen man bör hänvisa till när påståendet behöver stå emot en utmaning. Leverantörens siffror och de oberoende siffrorna står inte i konflikt; de är helt enkelt olika testriggar, och att blanda dem i en och samma mening är hur ett blogginlägg till slut påstår att en leverantörsutvärdering är ett faktum.

Infrastrukturanteckningen, eftersom vi driver en

A​nthropic säljer Claude Haiku 5.5 via sitt eget API och via Bedrock, G​oogle Cloud och Azure. Om du står inför att avgöra vilken av dessa du ska anropa, eller om du lägger till den bredvid de andra modellerna som redan finns i din stack, notera att leverantörens listpris är detsamma var den än säljs, och OrcaRouter är byggt för att föra vidare det listpriset utan påslag — så en prisändring från A​nthropic på den här modellen slår igenom hos oss samma dag i stället för med fördröjning. Vår katalog innehåller också qwen/qwen3.8-flash till $0.15 och $0.47 per miljon och z-ai/glm-5.3-flash till $0.15 och $0.50, det par som oftast hamnar i platsen bredvid en modell av Haiku-klass, på samma nyckel och samma faktura — det som gör att en blandad stack kostar ett avtal i stället för tre. Vi tillhandahåller inte Claude Haiku 5.5 själva; för det vänder du dig direkt till A​nthropic.

En praktisk konsekvens av klippan, om du routar mer än en modell: gränsen vid 100 000 token är en punkt där en begäran som brukade vara billig blir dyr utan att något i begäran förändras nämnvärt. Om ditt routningslager kan växla över vid fel är det förnuftiga upplägget att hålla långkontexttrafik riktad mot den modell som faktiskt är billig ovanför tröskeln och låta kortkontexttrafik hamna hos den som är billig under den, i stället för att anta att en modells annonserade pris gäller för båda.

Vad man ska ta med sig från lanseringen

Prissänkningen är verklig och den är stor – under 100 000 tokens. Modellen är den första Haiku med en färdiglevererad funktionsuppsättning och ett effort-reglage, vilket betyder mer för agentisk användning än priset gör. Benchmark-deltan är leverantörsrapporterade och bör märkas som sådana varje gång de upprepas. Och prislistan har ett steg vid 100 000 tokens som multiplicerar varje taxa med fem på en gång – vilket är det som en läsare av din stack, snarare än en läsare av pressmeddelandet, allra mest behöver känna till innan nästa sprints tokenbudget fastställs.

Om du vill kontrollera beräkningen mot din egen trafik är de två tal du behöver ta fram 95:e percentilen för din förfrågningsstorlek och din andel av utgifterna för förfrågningar över 100 000 tokens. Om den första ligger under gränsen gäller 90 procent för dig och lanseringsbevakningen hade rätt om din situation. Om den andra utgör en betydande del av fakturan är talet som spelar roll 50, och det är värt att köra om kostnadsuppskattningen för vilken modell i stacken du än valde utifrån antagandet om 90.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen