
Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite: Billigare per token, dyrare per svar
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Claude Haiku 5.5 kostar 0,10 USD per miljon indata-tokens och 0,50 USD per miljon utdata-tokens. Gemini 3.5 Flash-Lite kostar 0,30 och 2,50 USD på samma två mätare. Anthropic-modellen har en tredjedel av priset för indata och en femtedel av priset för utdata, och den får 43,40 mot 22,2 på Artificial Analysis Intelligence Index v4.3.2 — en skillnad på över tjugo punkter i ett område där tio poäng är ett generationssprång. På prislistan är detta ingen nära jämförelse, och kapacitetsmässigt är det inte heller en nära jämförelse.
På fakturan ligger de nära varandra, och det går åt andra hållet. Sätt båda modellerna på samma oberoende resultattavla och debitera var och en av dem för en slutförd uppgift i stället för en token, så visar sig Gemini 3.5 Flash-Litebilligare per svar. Artificial Analysis anger Claude Haiku 5.5 till $0,21 per uppgift i Intelligence Index och Gemini 3.5 Flash-Lite till $0,1235 — en fördel på 1,7 mot 1 för modellen som betalar fem gånger mer för varje token den avger.
Den inversionen är hela den här jämförelsen. Claude Haiku 5.5 ersätter den billigaste Anthropic någonsin har släppt och slår allt i närheten på den gemensamma resultattavlan. Gemini 3.5 Flash-Lite släpptes den 21 juli 2026 och har varit det mest prisvärda valet i detta segment sedan i somras. Den fråga en köpare faktiskt har är inte vilken som är bättre, för svaret på det är avgjort. Det är vilken man ska sätta framför en förfrågan som måste komma tillbaka billigt.
Allt nedan är per miljon tokens i amerikanska dollar. Listpriserna är leverantörernas egna publicerade priser. De oberoende poängen, siffrorna för kostnad per uppgift och hastighetsmätningarna som tillskrivs Artificial Analysis är den utvärderarens. Latenssiffrorna för Gemini 3.5 Flash-Lite kommer från vår egen uppmätta trafik. När en siffra finns i den modellpost vi har i stället för att läsas från utvärderarens sida samma dag, har vi behandlat den utvärderaren som källan och inte oss själva.
Stickern och fakturan stämmer inte överens.
Skillnaden i kostnad per uppgift förklaras inte av prislistan, och anledningen till att den finns är värd att känna till innan någon av modellerna kommer i närheten av produktion.
Claude Haiku 5.5 är ordrik, och utvärderaren säger det rent ut. När Artificial Analysis körde Intelligence Index registrerade de 440 miljoner uttoken från modellen mot en median på 100 miljoner överlag, och flaggade den som mycket ordrik. Tänkande faktureras som utdata, tänkande är på som standard med en ansträngningsratt som börjar på medium, och en låg indatataxa hjälper inte en arbetsbelastning vars faktura till största delen består av utdata.
Gemini 3.5 Flash-Lite är inte heller kortfattad, men den är mätbart mindre kostsam per jobb. Samma resultattavla registrerar 17 507 utdatatokens per slutförd indexuppgift för den — 10 405 av dem resonemang och 7 102 svar. Ställ det mot Anthropic-modellens tokenvolym och aritmetiken går ihop: en fem mot ett-fördel i utmatningstakten äts delvis upp av en modell som avger det större svaret, och det som kvarstår på uppgiftsnivå är en liten nackdel snarare än en stor fördel.
Det finns en andra, tystare effekt som verkar på samma sätt. Anthropics dokumentation säger att Claude Haiku 5.5 använder tokeniseraren som delas med Claude 4.7 och senare, så samma text räknas som ungefär 30 % fler tokens än den gjorde på modellen som denna ersätter. Priset föll med en faktor tre jämfört med Googles nivå. Tokenantalet sjönk inte, och på samma text ökade det.
Båda modellerna, på de siffror som spelar roll
Cachade priser och listpriser från Anthropics och Googles egen dokumentation; oberoende siffror tillskrivna Artificial Analysis; live-latens från vårt eget sjudagars trafikfönster. Cachad 2026-10-08.

• Indata — Claude Haiku 5.5 $0,10 upp till 100 000 token och $0,50 däröver; Gemini 3.5 Flash-Lite $0,30 fast över ett fönster på 1 048 576 token.
• Utdata — Claude Haiku 5.5 $0,50 upp till 100 000 tokens och $2,50 därutöver; Gemini 3.5 Flash-Lite $2,50 fast.
• Cachad indata — Claude Haiku 5.5 $0.01 upp till 100 000 tokens och $0.05 däröver; Gemini 3.5 Flash-Lite $0.03. Cache-skrivningar kostar $0.125 och $0.625 per miljon tokens för Claude Haiku 5.5.
• Kontext och utdata — en miljon tokens vardera. Maximal utdata är 128 000 tokens för Claude Haiku 5.5 mot 65 536 för Gemini 3.5 Flash-Lite, så Anthropics tak är ungefär dubbelt så högt.
• Inmatningsmodalitet — text och bilder för Claude Haiku 5.5; text, bilder, video, ljud och filer för Gemini 3.5 Flash-Lite. Båda returnerar text.
• Oberoende poäng — 43,40 för Claude Haiku 5.5 (Max), tvåa av 182 modeller på Intelligence Index v4.3.2, mot 22,2 för Gemini 3.5 Flash-Lite, nittiosjätte av 147 och i den trettiofjärde percentilen på den listan.
• Oberoende kostnad per uppgift — $0,21 mot $0,1235 på samma kort.
• Genomströmning — 241,9 utdatatokens per sekund uppmätt för Claude Haiku 5.5 av Artificial Analysis, mot 280,0 för Gemini 3.5 Flash-Lite uppmätt i vår egen testmiljö under de senaste sju dagarna. Det är två olika testriggar, inte en, så läs dem som en storleksordning och inte som en tävling.
Tjugoen punkter, och vad de är gjorda av
Ett gap på tjugoen punkter i ett index som sträcker sig upp i sextiotalet är ingen marginal. Det är skillnaden mellan en modell som kan driva en agentisk loop och en modell som bör ges ett enda väl specificerat anrop.
De två leverantörerna mäter inte varandras testramverk, så deras egna testsviter kan inte jämföras direkt. Anthropic publicerar resultat från GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 och FrontierCode för Claude Haiku 5.5; Google publicerar sin egen uppsättning för Flash-Lite-nivån; ingen av dem körde den andras testsvit. Den enda tillgängliga äpplen-mot-äpplen-jämförelsen är den oberoende resultattavlan, och där ligger Anthropics modell före med en marginal som är allt annat än knapp.
Utvärderarens delpoäng för Gemini 3.5 Flash-Lite sätter formen för den nivån på pränt. Den uppnår 83,8 % på GPQA Diamond och 54,2 % på SWE-Bench Pro, 54 % på Terminal-bench 2.1, 41,3 % på SciCode och 39,2 % på MLE-Bench, med 18,8 % på Humanity's Last Exam. Det är siffrorna för en kompetent, billig, generell nivå – stark på kunskapsfrågor, tydligt efter på de svåraste resonemangs- och forskningsutvärderingarna. Claude Haiku 5.5 med 43,40 på det sammanvägda måttet ligger i en helt annan liga, och den praktiska tolkningen är att arbete som kräver planering i flera steg över en lång horisont inte alls är ett jobb för Googles nivå.
En miljon tokens fönster, och 65 536 svar
De två kontextfönstren är lika stora och de är inte samma produkt.
Lång kontext hos Gemini 3.5 Flash-Lite försämras med avståndet på ett sätt som är värt att prissätta innan man litar på det. På GDM-MRCR v2, utvärderingen av åttanålsretrieval, ligger det i genomsnitt på 72,2 % när nålarna finns inom 128 000 token och 21,3 % på den punktvisa varianten med en miljon token. Dess Long-Context Recall-värde är 76 %, och CharXiv Reasoning landar på 74,5 % utan verktyg och 76,5 % med dem. Ett fönster på en miljon token är en verklig förmåga; att tillförlitligt hämta från dess bortre ände är en mindre sådan, och de två siffrorna ovan är avståndet mellan dem. Claudemodellens fönster har inte mätts på samma sätt på samma resultattavla, så ingen motsvarande siffra finns tillgänglig för den, och den här artikeln kommer inte att hitta på en.
Utdatataken är den mer omedelbart användbara skillnaden. Claude Haiku 5.5 genererar 128 000 tokens i ett svar; Gemini 3.5 Flash-Lite stannar vid 65 536. Om artefakten du vill få tillbaka är en lång fil, en fullständig migrering, en genererad testsvit eller en omskrivning i transkriptionsskala, kan en av dessa två modeller producera den i ett enda anrop och den andra inte — och ett jobb som delas upp över två anrop kostar mer än dubbelt så mycket som ett anrop, eftersom det delade prefixet skickas två gånger.

Ljud och video är inte en prisfråga
Gemini 3.5 Flash-Lite tar emot video, ljud och filer till samma pris som text. Claude Haiku 5.5 tar emot text och bilder.
För en pipeline som tar in inspelade samtal, skärminspelning eller övervakningsmaterial är den kapacitetsskillnad som spelar roll inte de tjugoen indexpoängen. Det är att en av dessa modeller tar indata direkt, medan den andra behöver ett transkriberings- eller bildruteutvinningssteg framför sig – en andra modell, en andra räkning och ett nytt felmodsläge som ligger mellan källan och svaret. Team i den situationen väljer inte mellan två billiga nivåer. De väljer mellan en modell och en pipeline.
Det omvända gäller för bilder och dokument. Båda modellerna läser bilder nativt, och Claude Haiku 5.5 presterar 43,40 på composite, så en arbetsbelastning för extrahering av sidbilder eller diagramförståelse utan ljud i sig hör hemma på Anthropics sida utifrån siffrorna snarare än på ett modalitetsargument.
Kör en av de två härifrån
Gemini 3.5 Flash-Lite finns i OrcaRouter-katalogen till Googles listpris med 0 % påslag, vilket innebär att leverantörens pris förs vidare i stället för att blandas, och en ändring i Googles prislista når din faktura samma dag som den når deras. Det är en nyckel och ett SDK för Googles nivå tillsammans med Claude Sonnet 5.5 och Claude Opus 5.5, som också finns i katalogen – så en A/B mellan ett Google Flash-Lite-ben och ett Anthropic-ben är redan en konfiguration snarare än ett integrationsprojekt. Automatisk failover ligger under, så inget av benen är en enskild felpunkt, och routing-DSL:en uttrycker eskaleringen i rutten om det är där logiken hör hemma.
Latensprofilen för den delsträckan bygger på vår egen mätning snarare än leverantörens. Under de senaste sju dagarnas live-trafik har Gemini 3.5 Flash-Lite hållit en p50 på 2 426 millisekunder och en p95 på 8 600 millisekunder vid 280 uttoken per sekund, med en felfrekvens på 0,313 %. Läs det som ett rullande fönster och inte ett löfte: det förändras i takt med att trafik och leverantörsförhållanden förändras, och siffran att lita på för en given pipeline är den du själv mäter efter en vecka.

Claude Haiku 5.5 finns inte i katalogen. Den släpptes den 7 oktober 2026 – en dag innan detta skrevs – och den är inte routbar från oss i dag, så Anthropic-sidan av den här jämförelsen är för närvarande endast nåbar hos Anthropic. Att säga det rakt ut är bättre än att låta det vara underförstått. Ett glapp mellan att en modell släpps och att en modell kan anropas via oss är normalt, det är inte ett löfte om när det sluts, och en läsare som planerar en migrering bör planera utifrån den kalender de kan se snarare än den de skulle föredra.
Vilken, och för vem?
Om arbetet är text in och text ut, om promptarna ryms under 100 000 tokens och om uppgiften kräver planering i flera steg eller långsiktiga agenter, är Claude Haiku 5.5 den starkare modellen med tjugoen punkter och den billigare per token med en faktor tre till fem. Budgetera efter kostnad per uppgift i stället för efter prislistan, räkna med ungefär 0,21 dollar för den typ av jobb som den oberoende nämnden mäter, och räkna om dina prompter innan du prognostiserar något, eftersom tokenizerändringen flyttar antalet med omkring trettio procent i sig.
Om arbetet är kort, högvolymigt och har formen av ett svar – en tagg, en kategori, en extrahering, ett guardrail-beslut – så talar matematiken för Gemini 3.5 Flash-Lite, och det av en oglamorös anledning. Notan för ett anrop som genererar väldigt lite domineras av indata, de två indatapriserna är $0.30 mot $0.10, och Googles modells mycket kortare uppdragsavtryck gör att den billigare taxan vinner det färdiga jobbet trots att den förlorar på prislappen. Lägg till video-, ljud- eller filindata, och valet slutar helt att handla om pris.
Vad jämförelsen faktiskt slår fast är snävare än ”den nya Haiku är billig.” Den slår fast att den angivna taxan för en billig nivå är en dålig vägledning för vad den nivån kostar dig, och att modellen som ser tre gånger dyrare ut på prissidan kan skicka dig den mindre fakturan. Hur du än landar, mät de tokens du avger och inte de du skickar, för på båda dessa modeller är det den mätare som räkningen egentligen skrivs på.
