
Claude Haiku 5.5 är live till $0.10 per miljon tokens: 75 %-påståendet och dess två fotnoter
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Anthropic släppte Claude Haiku 5.5 i allmän tillgänglighet den 7 oktober 2026 för 0,10 USD per miljon input-tokens och 0,50 USD per miljon output-tokens – samma två siffror som OpenAI tar för GPT-6 Luna, och en femtedel av vad Claude Haiku 4.5 har kostat sedan 2025, då det lanserades för 1,00 och 5,00 USD. Rubriken i Anthropics lanseringsinlägg är att den nya modellen i genomsnitt kostar "cirka 75 % mindre att köra" än sin föregångare, och det är siffran som varje sammanfattning sedan dess har upprepat. Den kommer med två fotnoter som de flesta av dessa sammanfattningar utelämnade: under 100 000 token är minskningen 90 %, över det är minskningen 50 %, och Claude Haiku 5.5 använder den nyare tokenizern som delas med Claude 4.7 och senare, så samma text räknas som ungefär 30 % fler token än på Claude Haiku 4.5. Så 75 % är ett uttalande om en räkning, inte om en prislista, och för alla vars prompter är långa är det två olika saker. Leverantörens egen jämförelsetabell har också GPT-6 Luna och Claude Sonnet 5.5 som kolumner bredvid den, vilket gör lanseringsdokumentationen ovanligt lätt att ifrågasätta.
Aritmetiken bakom "75 % mindre"
Ta prislistan först, för den är inte enhetlig. Indata kostar $0,10 per miljon upp till 100 000 tokens och $0,50 per miljon däröver – fem gånger så mycket. Utdata kostar $0,50 och sedan $2,50. Cachning följer samma steg: en femminuters cache-skrivning kostar $0,125 per miljon under gränsen och $0,625 över den, en timlång skrivning kostar $0,20 och $1,00, och en cache-läsning kostar $0,01 och $0,05. Message Batches API ger 50 % rabatt på båda mätarna, och på batch-vägen stöder modellen upp till 300 000 utdata-tokens med output-300k-2026-03-24 beta-headern.
Lägg nu tokenizern ovanpå det, för det är där huvudpåståendet blir intressant. En prompt som mätte 90 000 tokens med Claude Haiku 4.5-tokenizern mäter ungefär 117 000 med den nya. Den har inte ändrat storlek, men den har passerat 100 000-tokengränsen, så den debiteras 0,50 USD per miljon indata i stället för 0,10 USD. På Claude Haiku 4.5 kostade samma innehåll 0,09 USD i indata (1,00 USD per miljon × 0,09 miljoner). På Claude Haiku 5.5 kostar det 0,0585 USD. Det är en sänkning med 35 % — verklig, och inte i närheten av 90 %. Siffran 90 % gäller förfrågningar som stannar under gränsen efter att tokenizern har expanderat dem, vilket är där en stor del av trafiken med korta anrop finns: ett klassificeringsanrop på 20 000 tokens blir 26 000 tokens, stannar i den första nivån, och där är indatapriset verkligen en tiondel av vad det var.
Tre saker följer av det, och de är värda att hålla isär snarare än att slå ihop till ett genomsnitt:
• Korta anrop får full rabatt. Extrahering, routning, klassificering, sammanfattning av ett dokument som ryms under gränsen – dessa ser 90 %-siffran på indata och utdata, minus tokeniserarens expansion.
• Långa anrop får ungefär en tredjedels rabatt, inte tre fjärdedelar. En begäran som hamnar över 100 000 tokens efter återtokenisering betalar 0,50 $ och 2,50 $ per miljon — fortfarande hälften av Claude Haiku 4.5:s priser, men nivån den ligger i är fem gånger den nivå som prislappen annonserar.
• ”75 % mindre i genomsnitt” är ett trafikviktat tal och det är Anthropics. Det är leverantörens egen beskrivning av sin egen förväntade blandning, och Anthropic säger uttryckligen att en prompt under tröskeln utgjorde omkring 90 % av förfrågningarna till den tidigare Haiku. Om din blandning inte ser ut som den blandningen kommer ditt genomsnitt inte att se ut som det genomsnittet – och det enda sättet att veta vilket är att räkna tokens i din egen trafik, med den nya tokenizern, innan du sätter en budget.

Vad mer levererades med det?
Modellen är inte bara ett pris. Flera av lanseringsdetaljerna förändrar hur du skriver kod mot den, och en av dem kommer att få en befintlig klient att sluta fungera.
• Adaptivt tänkande är aktiverat som standard, med en ansträngningsratt från Låg till Max och standardvärdet medel. Detta är den första modellen i Haiku-klassen med en justerbar ansträngningsinställning, och det är den främsta hävstången för både kvalitet och kostnad per svar.
• Samplingsparametrar avvisas. Att skicka ett icke-standardvärde för temperature, top_p eller top_k returnerar en 400. Varje migrering som förde dessa argument vidare kommer att misslyckas högljutt vid den första begäran i stället för att försämras i tysthet, vilket åtminstone är ett ärligt felbeteende.
• 1M-tokens kontext och upp till 128 000 utdatatokens i det synkrona Messages-API:et, med kunskapsavskärning i juni 2026 och ett åtagande om avveckling tidigast den 7 oktober 2027.
• Fem plattformar dag ett: Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry och Claude Platform på AWS. Det är en lansering samma dag snarare än den etappvisa tillgänglighet som dessa lanseringar ofta har.
• Även verktygsstödet har utvecklats. Anthropics Python- och TypeScript-SDK:er har nu stöd för computer use och browser use i beta, och företaget har lagt till månatliga API-krediter för prenumeranter på Max 5x ($100), Max 20x ($200) och Team (upp till $500 i en gemensam pott).
• Säkerhetsprofilen är snävare än priset antyder. Anthropic säger att cybersäkerhetsåtgärderna för Claude Haiku 5.5 är mer restriktiva än Claude Haiku 4.5:s men mindre restriktiva än de senaste frontier-modellerna — bredare defensiv användning än vad Claude Sonnet 5.5 tillåter, med penetrationstestning fortfarande blockerad — och att de biologiska skyddsåtgärderna motsvarar Claude Sonnet 5, Claude Sonnet 5.5 och Claude Opus 5. Alignment-utvärderingarna förbättrades genomgående jämfört med föregångaren i Anthropics egen testsvit.
Vad leverantörens tabell säger, och vad den oberoende styrelsen säger
Anthropic har publicerat en benchmarktabell med tre jämförelsekolumner, och den är värd att läsa som ett dokument om hur leverantörer argumenterar. Varje siffra nedan är leverantörsrapporterad, framtagen i Anthropics egna testramverk, och inget av det har reproducerats oberoende; där GPT-6 Luna förekommer är det Anthropic som kör sina egna utvärderingar mot en konkurrents modell.
• Kunskapsarbete — GDPval-AA v2.1 på 1620 för Claude Haiku 5.5, mot 735 för Claude Haiku 4.5, 1437 för GPT-6 Luna och 1840 för Claude Sonnet 5.5. AA-Briefcase v1.1 på 1578, 614, 1336 och 1824.
• Datoranvändning — OSWorld 2.1 offline vid 72,4 % mot 15,7 %, 48,9 % och 83,9 %.
• Resonemang — Humanity's Last Exam med 45,9 % utan verktyg och 57,4 % med dem, jämfört med 10,2 % och 18,7 % för Claude Haiku 4.5 och 56,9 % och 64,5 % för Claude Sonnet 5.5.
• Agentisk kodning — Terminal-Bench 4.0 på 39,2 % mot 0,0 %, 16,4 % och 70,6 %. FrontierCode 1.1 (Main) på 46,4 % mot 42,4 % för GPT-6 Luna och 52,1 % för Claude Sonnet 5.5.
• Kartläsning — Chartography vid 46,4 % utan verktyg mot 6,4 %, 29,1 % och 61,6 %.
I den tabellen vinner Claude Haiku 5.5 varje rad mot både den tidigare Haiku och GPT-6 Luna, och förlorar de flesta av dem mot Claude Sonnet 5.5 – vilket är den ärliga formen hos en liten nivå: ett stort generationskliv, och fortfarande en nivå under mellanmodellen i det svåraste arbetet. Anthropic säger samma sak i inlägget och rekommenderar Claude Sonnet 5.5 och Claude Opus 5.5 för komplex agentisk kodning, samtidigt som man positionerar Haiku för kompaktering, sammanfattning, klassificering och subagentroller.
Den oberoende bilden är mer nyanserad och kräver mer uppmärksamhet. Artificial Analysis mäter Claude Haiku 5.5 vid Max-ansträngning till 43 på sitt Intelligence Index v4.3.2, tvåa av 182 modeller, och 241,9 utdatatokens per sekund – snabbt, som utlovat. Den mäter också en kostnad på 0,21 dollar per slutförd Index-uppgift, eftersom modellen genererade 440 miljoner utdatatokens när den körde sviten, mot en median på 100 miljoner; utvärderaren beskriver den som mycket ordrik. GPT-6 Luna, med 38 på samma index, kostar 0,07 dollar per uppgift. Samma prislapp, tre gånger notan. Det är inte en motsägelse av lanseringspåståendet – det är samma fenomen som lanseringspåståendet handlar om, sett från andra änden: taxan är vad du betalar per token, och beloppet du faktiskt betalar är taxan gånger antalet tokens, och Claude Haiku 5.5 gör av med fler av dem per svar än sina konkurrenter. Ansträngningen är hävstången; modellens standard är medel, inte Max, och ett team som låser den lägre kommer att se både en mindre nota och en lägre poäng.
Anropar det från en plats
Migreringsfrågan som den här lanseringen skapar är inte "är det bättre" utan "vad kostar min trafik på det", och svaret beror på dina promptlängder, din cacheträfffrekvens och den effort-inställning du väljer. Att komma dit innebär att köra din egen promptuppsättning genom båda generationerna – vilket är billigt att göra bakom en endpoint och omständligt att göra över två.
Claude Haiku 5.5 finns ännu inte i OrcaRouters katalog, och att säga det rakt ut är mer användbart än att antyda något annat. Resten av Anthropic-linjen är: Claude Haiku 4.5, Claude Sonnet 5.5 och Claude Opus 5.5 kan alla anropas hos oss idag till leverantörens listpris med 0 % påslag som förs vidare, så migreringstestets "före"-ben körs på samma nyckel som du skulle behålla efteråt, och en prissänkning från leverantören på det benet är live hos oss samma dag. "Efter"-benet är Anthropics API tills den nya modellen når en runtime som vi routar. Vad den delade slutpunkten ger dig under tiden är automatisk failover under anropet, så en ny modell kan bära produktionstrafik utan att vägen är beroende av den, och routnings-DSL:en för fallet där eskaleringen från Haiku till Sonnet hör hemma i routen snarare än i din applikationskod.

Två kundresultat i lanseringen är värda att föra vidare som ledtrådar snarare än bevis. Asana rapporterar över 30 % minskning av latensen och upp till 2,5 gånger snabbare inferens per agenttur; HubSpot rapporterar 92,8 % i genomsnitt över tre körningar på sin CRM-svit; AlphaSense rapporterar 0,84 mot 0,76 på 400 frågor. Detta är leverantörsvalda kundsiffror i leverantörens eget tillkännagivande, och deras värde ligger i att visa vilka arbetsbelastningar du bör testa först, inte i att säga vad du kommer att få.
Vad skulle förändra bilden
75 %-siffran kommer att avgöras på samma sätt som varje trafikviktat leverantörspåstående avgörs: av din egen faktura. Det som verkligen är öppet på oberoende håll är siffran för kostnad per uppgift. Om den håller i sig i takt med att fler körningar ackumuleras, är den ärliga sammanfattningen av den här lanseringen att Anthropic sänkte prislistan med 80 % och byggde en modell som gör av med fler tokens per svar, så den faktiska besparingen är verklig, stor, beroende av arbetsbelastning och sällan siffran på affischen. Om den sjunker med effort-inställningar och cachning ser nivån ännu bättre ut. Hur som helst är siffran att kontrollera före en övergång dina egna tokens per uppgift med den nya tokenizern — det är den enda siffran som lanseringsinlägget inte kan ge dig.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
