
Claude Haiku 5.5:s verkliga historia är 100K-klippan: Vad den nya Haiku tar betalt bortom 100 000 tokens
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Claude Haiku 5.5 kom den 7 oktober 2026 med ett annonserat pris på 0,10 USD per miljon indatatoken och 0,50 USD per miljon utdatatoken, och siffran som upprepades överallt var den som Anthropic själva tog med i tillkännagivandet: en minskning med 90 procent jämfört med Haiku 4.5-priset för samma två postar. De 90 procenten är verkliga. De är också begränsade till ena hälften av en enda dimension av räkningen, och i samma stund som en begäran passerar 100 000 token gör varje taxa i den något som lanseringsbevakningen mest hoppade över. Den här artikeln handlar om den gränslinjen – vad den kostar, vilka arbetsbelastningar som faktiskt når den, och varför ”90 procent billigare” är ett påstående om en del av räkningen snarare än om din räkning.
De två priserna, och var de växlar
Anthropic publicerar två kolumner för modellen, och växlingen mellan dem är en enda tröskel för storleken på begäran snarare än någon modellinställning du väljer:
• Kort nivå, på eller under 100 000 tokens — $0,10 per miljon indatatokens, $0,50 per miljon utdatatokens (Anthropics prislista) • Lång nivå, över 100 000 tokens — $0,50 per miljon indatatokens, $2,50 per miljon utdatatokens (Anthropics prislista) • Cacheläsningar — $0,01 per miljon (kort nivå) och $0,05 per miljon (lång nivå) • Batch-API — 50 % rabatt på endera kolumnen, och en maximal utdatalängd på 300 000 tokens • Standard för maximal utdata — 128 000 tokens, med ett kontextfönster på 1 miljon tokens i båda nivåerna

Det där är Anthropics egna publicerade priser, inte uppmätta, och de är den aktuella listan: prissättningen för en så här ny modell har inte hunnit förändras, även om Anthropic inte har någon skyldighet att hålla den kvar.
Läs de fyra siffrorna i ordning, så är formen på saken uppenbar. Varje taxa i nivån för lång kontext är exakt fem gånger taxan för kort kontext, och tröskelvärdet är samma 100 000 tokens för alla på en gång. Det finns ingen gradvis kurva, ingen interpolering, inget mellanliggande band – en begäran på 99 000 tokens och en på 101 000 tokens skiljer sig med en faktor fem för varje token i räkningen, inte bara för de 2 000 tokens som passerade gränsen. Det är detta som gör det till ett stup snarare än en sluttning, och det är detta som inramningen ”90 procent billigare” inte kan se.

Varför ser såret större ut än det är
Jämfört med Haiku 4.5, den jämförelse som Anthropic gjorde, är den korta nivån en verklig minskning med 90 procent på både input och output — Haiku 4.5 kostade $1.00 och $5.00 per miljon för samma två kolumner. Den långa nivån är en annan historia: $0.50 och $2.50 mot samma $1.00 och $5.00 är en minskning med 50 procent, inte 90 procent. Så den ärliga versionen av lanseringspåståendet är att Claude Haiku 5.5 är 90 procent billigare än Haiku 4.5 under 100 000 tokens och 50 procent billigare över det, vilket är exakt den uppdelning som Anthropics egen dokumentation anger när man läser båda kolumnerna i stället för bara den ena. Den enskilda procentsatsen är inte fel; det är procenten för den korta nivån, presenterad utan sitt villkor.
Det finns en andra sak som drar i motsatt riktning, och den är den mer intressanta eftersom den är lätt att missa och svår att komma runt. Claude Haiku 5.5 levereras med en ny tokenizer, och Anthropics egen vägledning anger tokenantalet för en given textmängd till ungefär 30 procent högre än vad Haiku 4.5 gav för samma innehåll. Vad du än betalade per token sjönk, medan vad du betalar per token av *din* text steg med ungefär en tredjedel, jämfört med den gamla modellens beräkning. Anthropics angivna nettofigur – att modellen är ungefär 75 procent billigare att köra i genomsnitt – räknar redan in detta: en 90-procentig sänkning av listpriset minus en tokeninflation på omkring 30 procent landar i det häradet vid trafik med kort kontext – men de två effekterna går att separera och är värda att separera. Prisförändringen är en ändring av listpriset som du kan läsa av på en sida; tokenizerförändringen ändrar hur många enheter av det priset dina befintliga prompter förbrukar, och den syns i dina egna tokenantal innan den syns någon annanstans.
För en arbetsbelastning som redan med god marginal låg under 100 000 tokens per anrop är den praktiska effekten en direkt minskning av kostnaden per anrop, delvis uppvägd av tokeniseraren. För en som inte gjorde det går aritmetiken åt andra hållet två gånger på den långa halvan.
Vad finns det egentligen ovanför 100 000 tokens
Reflexen är att placera långkontextprissättning under "agentisk kodning och RAG, inte oss." Det är för snabbt, för gränsen på 100 000 token är en gräns per förfrågan, och storleken per förfrågan är inte samma sak som uppgiftens storlek. Några mönster överskrider den rutinmässigt:
• En agent som läser kodbaser och som håller en stor arbetsmängd i kontexten under en hel session, i stället för att hämta om information vid varje steg
• Dokument- och avtalsanalys där indata är en lång PDF plus dess egna instruktioner och few-shot-exempel – den typ av prompt som var 60 000 tokens innan någon lade till exemplen
Ingestionspipelines som batchar många små objekt till ett anrop för att amortera overhead per anrop, och därigenom för hela batchen över tröskeln
• Chattprodukter som har en fullständig konversation inline i stället för att sammanfatta den, där förfrågan kvarstår tills något trunkerar den
• Ljud- och långvideo-transkriptionsliknande indata, vilket är precis den typ av trafik som ett kontextfönster på 1 miljon tokens marknadsförs för att möjliggöra
Kontextfönstret på 1 miljon token är den del av specifikationsbladet som gör stupet värt att tala om. Anthropic säljer möjligheten att ge modellen en mycket stor förfrågan, och prissättningen är utformad så att de sista 900 000 token i den förfrågan kostar fem gånger så mycket som de första 100 000 gjorde. Båda sakerna är avsiktliga; de tillkännages bara på olika ställen. Om långkontextfönstret är anledningen till att du överhuvudtaget tittar på den här modellen, är långkontextkolumnen din kolumn, och lanseringsprocenten är någon annans.
Trycket priset utövar på Flash-nivån
Anthropics uttalade avsikt med modellen är att hålla den billiga änden av stacken med hög genomströmning, och prislistan återspeglar den avsikten tydligt. Bloombergs rapportering om lanseringen framställde det som att Anthropic försvarar sin lågkostnadsposition mot billigare konkurrenter med öppna vikter, och leverantörssidans framställning gick längre – att den nya Haiku är prissatt för att underbjuda sina direkta rivaler med bred marginal.
Jämförelsen är bara rättvis på den korta nivån, där $0,10 och $0,50 är aggressivt låga. Över 100 000 tokens ligger priserna på $0,50 och $2,50 inte längre under någon annans korta nivå; de är vanliga mellannivåpriser. Leverantörens påstående om "bred marginal" är ett uttalande om prislistans första kolumn, och Anthropic har rätt att göra det där – det är en korrekt tolkning av siffrorna som företaget publicerar. Det är inte ett påstående om vad en arbetsbelastning med lång kontext betalar, och det bör inte citeras som ett sådant.
Resten av modellen, kortfattat
Claude Haiku 5.5 behåller funktionerna som levererades med Sonnet- och Opus-serien i stället för att skala bort dem för storleksklassen. Adaptivt tänkande med en förvald ansträngningsinställning på medel finns med, och det är den första modellen i Haiku-klassen med ett justerbart ansträngningsreglage som sträcker sig från Låg till Max. Kunskapsavgränsningen är juni 2026 och modell-ID:t är claude-haiku-5-5. Anthropic uppger ett utfasningsdatum tidigast den 7 oktober 2027 — samma datum som lanseringen, ett år senare — och modellen listas på Amazon Bedrock, Google Cloud och Microsoft Azure tillsammans med Anthropics eget API.

När det gäller benchmarkdelen bär allt i lanseringsinlägget samma härkomstetikett och förtjänar den: detta är siffror som rapporterats av leverantören, mätta av företaget som säljer modellen, utan någon oberoende reproduktion publicerad vid tiden för skrivandet.
• GDPval-AA v2.1 — enligt leverantören 1 620 för Claude Haiku 5.5, mot 735 för Haiku 4.5 i samma testramverk
• AA-Briefcase v1.1 — leverantörsrapporterade 1 578, mot 614 för föregående generation
• OSWorld 2.1 — leverantörsrapporterade 72,4 procent, mot 15,7 procent
• Terminal-Bench 4.0 — leverantörsrapporterat 39,2, mot 0,0
• Humanity's Last Exam – leverantörsrapporterade 45,9 procent, eller 57,4 med verktygsanvändning
Storleken på dessa deltavärden är anledningen till att flagga dem snarare än att citera dem. Ett hopp från 15,7 till 72,4 i ett OS-agent-benchmark som mäts av modellens egen leverantör är en siffra att ta med en nypa salt tills en tredje part kör samma testrigg. Artificial Analysis har publicerat sitt eget index för modellen per början av oktober 2026 — en oberoende siffra på 43,395, med 0,329 på Terminal-Bench Hard och 0,444 på HLE — och det är den uppsättningen man bör hänvisa till när påståendet behöver stå emot en utmaning. Leverantörens siffror och de oberoende siffrorna står inte i konflikt; de är helt enkelt olika testriggar, och att blanda dem i en och samma mening är hur ett blogginlägg till slut påstår att en leverantörsutvärdering är ett faktum.
Infrastrukturanteckningen, eftersom vi driver en
Anthropic säljer Claude Haiku 5.5 via sitt eget API och via Bedrock, Google Cloud och Azure. Om du står inför att avgöra vilken av dessa du ska anropa, eller om du lägger till den bredvid de andra modellerna som redan finns i din stack, notera att leverantörens listpris är detsamma var den än säljs, och OrcaRouter är byggt för att föra vidare det listpriset utan påslag — så en prisändring från Anthropic på den här modellen slår igenom hos oss samma dag i stället för med fördröjning. Vår katalog innehåller också qwen/qwen3.8-flash till $0.15 och $0.47 per miljon och z-ai/glm-5.3-flash till $0.15 och $0.50, det par som oftast hamnar i platsen bredvid en modell av Haiku-klass, på samma nyckel och samma faktura — det som gör att en blandad stack kostar ett avtal i stället för tre. Vi tillhandahåller inte Claude Haiku 5.5 själva; för det vänder du dig direkt till Anthropic.
En praktisk konsekvens av klippan, om du routar mer än en modell: gränsen vid 100 000 token är en punkt där en begäran som brukade vara billig blir dyr utan att något i begäran förändras nämnvärt. Om ditt routningslager kan växla över vid fel är det förnuftiga upplägget att hålla långkontexttrafik riktad mot den modell som faktiskt är billig ovanför tröskeln och låta kortkontexttrafik hamna hos den som är billig under den, i stället för att anta att en modells annonserade pris gäller för båda.
Vad man ska ta med sig från lanseringen
Prissänkningen är verklig och den är stor – under 100 000 tokens. Modellen är den första Haiku med en färdiglevererad funktionsuppsättning och ett effort-reglage, vilket betyder mer för agentisk användning än priset gör. Benchmark-deltan är leverantörsrapporterade och bör märkas som sådana varje gång de upprepas. Och prislistan har ett steg vid 100 000 tokens som multiplicerar varje taxa med fem på en gång – vilket är det som en läsare av din stack, snarare än en läsare av pressmeddelandet, allra mest behöver känna till innan nästa sprints tokenbudget fastställs.
Om du vill kontrollera beräkningen mot din egen trafik är de två tal du behöver ta fram 95:e percentilen för din förfrågningsstorlek och din andel av utgifterna för förfrågningar över 100 000 tokens. Om den första ligger under gränsen gäller 90 procent för dig och lanseringsbevakningen hade rätt om din situation. Om den andra utgör en betydande del av fakturan är talet som spelar roll 50, och det är värt att köra om kostnadsuppskattningen för vilken modell i stacken du än valde utifrån antagandet om 90.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
