Ett genererat hero-kort för 'Billigare per token, dyrare per svar', märkt 'KOSTNAD PER SVAR' med överrubriken 'TVÅ BILLIGA NIVÅER, EN GEMENSAM RESULTATTAVLA' och underrubriken 'Claude Haiku 5.5 på 43,40 mot Gemini 3.5 Flash-Lite på 22,2 i Intelligence Index v4.3.2.' Fyra chips visar '43,40 vs 22,2', '$0,21 vs $0,12', '$0,10 vs $0,30' och '$0,50 vs $2,50'. Två kort nedan är märkta 'ANTHROPICS FÖRDEL' ('tjugoen poäng högre på den gemensamma resultattavlan, och billigare på båda mätarna') och 'GOOGLES FÖRDEL' ('billigare för en färdig uppgift, och den hanterar video och ljud'). En sidfot lyder 'Oberoende poäng och kostnad per uppgift från Artificial Analysis; listpriser avlästa den 8 oktober 2026.' OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Guides & Insights

Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite: Billigare per token, dyrare per svar

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Claude Haiku 5.5 kostar 0,10 USD per miljon indata-tokens och 0,50 USD per miljon utdata-tokens. Gemini 3.5 Flash-Lite kostar 0,30 och 2,50 USD på samma två mätare. Ant​hropic-modellen har en tredjedel av priset för indata och en femtedel av priset för utdata, och den får 43,40 mot 22,2 på Artificial Analysis Intelligence Index v4.3.2 — en skillnad på över tjugo punkter i ett område där tio poäng är ett generationssprång. På prislistan är detta ingen nära jämförelse, och kapacitetsmässigt är det inte heller en nära jämförelse.

På fakturan ligger de nära varandra, och det går åt andra hållet. Sätt båda modellerna på samma oberoende resultattavla och debitera var och en av dem för en slutförd uppgift i stället för en token, så visar sig Gemini 3.5 Flash-Litebilligare per svar. Artificial Analysis anger Claude Haiku 5.5 till $0,21 per uppgift i Intelligence Index och Gemini 3.5 Flash-Lite till $0,1235 — en fördel på 1,7 mot 1 för modellen som betalar fem gånger mer för varje token den avger.

Den inversionen är hela den här jämförelsen. Claude Haiku 5.5 ersätter den billigaste Anthropic någonsin har släppt och slår allt i närheten på den gemensamma resultattavlan. Gemini 3.5 Flash-Lite släpptes den 21 juli 2026 och har varit det mest prisvärda valet i detta segment sedan i somras. Den fråga en köpare faktiskt har är inte vilken som är bättre, för svaret på det är avgjort. Det är vilken man ska sätta framför en förfrågan som måste komma tillbaka billigt.

Allt nedan är per miljon tokens i amerikanska dollar. Listpriserna är leverantörernas egna publicerade priser. De oberoende poängen, siffrorna för kostnad per uppgift och hastighetsmätningarna som tillskrivs Artificial Analysis är den utvärderarens. Latenssiffrorna för Gemini 3.5 Flash-Lite kommer från vår egen uppmätta trafik. När en siffra finns i den modellpost vi har i stället för att läsas från utvärderarens sida samma dag, har vi behandlat den utvärderaren som källan och inte oss själva.

Stickern och fakturan stämmer inte överens.

Skillnaden i kostnad per uppgift förklaras inte av prislistan, och anledningen till att den finns är värd att känna till innan någon av modellerna kommer i närheten av produktion.

Claude Haiku 5.5 är ordrik, och utvärderaren säger det rent ut. När Artificial Analysis körde Intelligence Index registrerade de 440 miljoner uttoken från modellen mot en median på 100 miljoner överlag, och flaggade den som mycket ordrik. Tänkande faktureras som utdata, tänkande är på som standard med en ansträngningsratt som börjar på medium, och en låg indatataxa hjälper inte en arbetsbelastning vars faktura till största delen består av utdata.

Gemini 3.5 Flash-Lite är inte heller kortfattad, men den är mätbart mindre kostsam per jobb. Samma resultattavla registrerar 17 507 utdatatokens per slutförd indexuppgift för den — 10 405 av dem resonemang och 7 102 svar. Ställ det mot Anthropic-modellens tokenvolym och aritmetiken går ihop: en fem mot ett-fördel i utmatningstakten äts delvis upp av en modell som avger det större svaret, och det som kvarstår på uppgiftsnivå är en liten nackdel snarare än en stor fördel.

Det finns en andra, tystare effekt som verkar på samma sätt. Ant​hropics dokumentation säger att Claude Haiku 5.5 använder tokeniseraren som delas med Claude 4.7 och senare, så samma text räknas som ungefär 30 % fler tokens än den gjorde på modellen som denna ersätter. Priset föll med en faktor tre jämfört med Goo​gles nivå. Tokenantalet sjönk inte, och på samma text ökade det.

Båda modellerna, på de siffror som spelar roll

Cachade priser och listpriser från Ant​hropics och Goo​gles egen dokumentation; oberoende siffror tillskrivna Artificial Analysis; live-latens från vårt eget sjudagars trafikfönster. Cachad 2026-10-08.

A generated scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite - on the numbers that matter'. Claude Haiku 5.5 reads input $0.10 under 100K and $0.50 above, output $0.50 and $2.50, cached input $0.01 and $0.05, maximum output 128,000 tokens, input modality text and images, Intelligence Index v4.3.2 43.40, cost per task $0.21. Gemini 3.5 Flash-Lite reads input $0.30, output $2.50, cached input $0.03, maximum output 65,536 tokens, input modality text images video audio and files, Intelligence Index v4.3.2 22.2, cost per task $0.12. A footer reads 'Vendors' published list rates; independent scores and cost per task from Artificial Analysis.'

• Indata — Claude Haiku 5.5 $0,10 upp till 100 000 token och $0,50 däröver; Gemini 3.5 Flash-Lite $0,30 fast över ett fönster på 1 048 576 token.

• Utdata — Claude Haiku 5.5 $0,50 upp till 100 000 tokens och $2,50 därutöver; Gemini 3.5 Flash-Lite $2,50 fast.

• Cachad indata — Claude Haiku 5.5 $0.01 upp till 100 000 tokens och $0.05 däröver; Gemini 3.5 Flash-Lite $0.03. Cache-skrivningar kostar $0.125 och $0.625 per miljon tokens för Claude Haiku 5.5.

• Kontext och utdata — en miljon tokens vardera. Maximal utdata är 128 000 tokens för Claude Haiku 5.5 mot 65 536 för Gemini 3.5 Flash-Lite, så Ant​hropics tak är ungefär dubbelt så högt.

• Inmatningsmodalitet — text och bilder för Claude Haiku 5.5; text, bilder, video, ljud och filer för Gemini 3.5 Flash-Lite. Båda returnerar text.

• Oberoende poäng — 43,40 för Claude Haiku 5.5 (Max), tvåa av 182 modeller på Intelligence Index v4.3.2, mot 22,2 för Gemini 3.5 Flash-Lite, nittiosjätte av 147 och i den trettiofjärde percentilen på den listan.

• Oberoende kostnad per uppgift — $0,21 mot $0,1235 på samma kort.

• Genomströmning — 241,9 utdatatokens per sekund uppmätt för Claude Haiku 5.5 av Artificial Analysis, mot 280,0 för Gemini 3.5 Flash-Lite uppmätt i vår egen testmiljö under de senaste sju dagarna. Det är två olika testriggar, inte en, så läs dem som en storleksordning och inte som en tävling.

Tjugoen punkter, och vad de är gjorda av

Ett gap på tjugoen punkter i ett index som sträcker sig upp i sextiotalet är ingen marginal. Det är skillnaden mellan en modell som kan driva en agentisk loop och en modell som bör ges ett enda väl specificerat anrop.

De två leverantörerna mäter inte varandras testramverk, så deras egna testsviter kan inte jämföras direkt. Anthropic publicerar resultat från GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 och FrontierCode för Claude Haiku 5.5; Google publicerar sin egen uppsättning för Flash-Lite-nivån; ingen av dem körde den andras testsvit. Den enda tillgängliga äpplen-mot-äpplen-jämförelsen är den oberoende resultattavlan, och där ligger Anthropics modell före med en marginal som är allt annat än knapp.

Utvärderarens delpoäng för Gemini 3.5 Flash-Lite sätter formen för den nivån på pränt. Den uppnår 83,8 % på GPQA Diamond och 54,2 % på SWE-Bench Pro, 54 % på Terminal-bench 2.1, 41,3 % på SciCode och 39,2 % på MLE-Bench, med 18,8 % på Humanity's Last Exam. Det är siffrorna för en kompetent, billig, generell nivå – stark på kunskapsfrågor, tydligt efter på de svåraste resonemangs- och forskningsutvärderingarna. Claude Haiku 5.5 med 43,40 på det sammanvägda måttet ligger i en helt annan liga, och den praktiska tolkningen är att arbete som kräver planering i flera steg över en lång horisont inte alls är ett jobb för Googles nivå.

En miljon tokens fönster, och 65 536 svar

De två kontextfönstren är lika stora och de är inte samma produkt.

Lång kontext hos Gemini 3.5 Flash-Lite försämras med avståndet på ett sätt som är värt att prissätta innan man litar på det. På GDM-MRCR v2, utvärderingen av åttanålsretrieval, ligger det i genomsnitt på 72,2 % när nålarna finns inom 128 000 token och 21,3 % på den punktvisa varianten med en miljon token. Dess Long-Context Recall-värde är 76 %, och CharXiv Reasoning landar på 74,5 % utan verktyg och 76,5 % med dem. Ett fönster på en miljon token är en verklig förmåga; att tillförlitligt hämta från dess bortre ände är en mindre sådan, och de två siffrorna ovan är avståndet mellan dem. Claudemodellens fönster har inte mätts på samma sätt på samma resultattavla, så ingen motsvarande siffra finns tillgänglig för den, och den här artikeln kommer inte att hitta på en.

Utdatataken är den mer omedelbart användbara skillnaden. Claude Haiku 5.5 genererar 128 000 tokens i ett svar; Gemini 3.5 Flash-Lite stannar vid 65 536. Om artefakten du vill få tillbaka är en lång fil, en fullständig migrering, en genererad testsvit eller en omskrivning i transkriptionsskala, kan en av dessa två modeller producera den i ett enda anrop och den andra inte — och ett jobb som delas upp över två anrop kostar mer än dubbelt så mycket som ett anrop, eftersom det delade prefixet skickas två gånger.

A screenshot of the Artificial Analysis model page for Gemini 3.5 Flash-Lite, showing the model name over the provider Google, the release month July 2026, a one-million-token context window, the input modality list covering text, image, video, audio and PDF, an Intelligence Index v4.3.2 score of 22, the per-million-token input and output rates with the cached-input discount, and the measured output speed, total response time and cost per task.

Ljud och video är inte en prisfråga

Gemini 3.5 Flash-Lite tar emot video, ljud och filer till samma pris som text. Claude Haiku 5.5 tar emot text och bilder.

För en pipeline som tar in inspelade samtal, skärminspelning eller övervakningsmaterial är den kapacitetsskillnad som spelar roll inte de tjugoen indexpoängen. Det är att en av dessa modeller tar indata direkt, medan den andra behöver ett transkriberings- eller bildruteutvinningssteg framför sig – en andra modell, en andra räkning och ett nytt felmodsläge som ligger mellan källan och svaret. Team i den situationen väljer inte mellan två billiga nivåer. De väljer mellan en modell och en pipeline.

Det omvända gäller för bilder och dokument. Båda modellerna läser bilder nativt, och Claude Haiku 5.5 presterar 43,40 på composite, så en arbetsbelastning för extrahering av sidbilder eller diagramförståelse utan ljud i sig hör hemma på Ant​hropics sida utifrån siffrorna snarare än på ett modalitetsargument.

Kör en av de två härifrån

Gemini 3.5 Flash-Lite finns i OrcaRouter-katalogen till Googles listpris med 0 % påslag, vilket innebär att leverantörens pris förs vidare i stället för att blandas, och en ändring i Googles prislista når din faktura samma dag som den når deras. Det är en nyckel och ett SDK för Googles nivå tillsammans med Claude Sonnet 5.5 och Claude Opus 5.5, som också finns i katalogen – så en A/B mellan ett Google Flash-Lite-ben och ett Anthropic-ben är redan en konfiguration snarare än ett integrationsprojekt. Automatisk failover ligger under, så inget av benen är en enskild felpunkt, och routing-DSL:en uttrycker eskaleringen i rutten om det är där logiken hör hemma.

Latensprofilen för den delsträckan bygger på vår egen mätning snarare än leverantörens. Under de senaste sju dagarnas live-trafik har Gemini 3.5 Flash-Lite hållit en p50 på 2 426 millisekunder och en p95 på 8 600 millisekunder vid 280 uttoken per sekund, med en felfrekvens på 0,313 %. Läs det som ett rullande fönster och inte ett löfte: det förändras i takt med att trafik och leverantörsförhållanden förändras, och siffran att lita på för en given pipeline är den du själv mäter efter en vecka.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing the Anthropic model name and an October 2026 release, Intelligence Index v4.3.2 of 43 ranking second of 182, speed ninth of 182 at 241.9 output tokens per second, a $0.21 cost per task, input $0.10 and output $0.50 per million tokens, and a one-million-token context window.

Claude Haiku 5.5 finns inte i katalogen. Den släpptes den 7 oktober 2026 – en dag innan detta skrevs – och den är inte routbar från oss i dag, så Anthropic-sidan av den här jämförelsen är för närvarande endast nåbar hos Anthropic. Att säga det rakt ut är bättre än att låta det vara underförstått. Ett glapp mellan att en modell släpps och att en modell kan anropas via oss är normalt, det är inte ett löfte om när det sluts, och en läsare som planerar en migrering bör planera utifrån den kalender de kan se snarare än den de skulle föredra.

Vilken, och för vem?

Om arbetet är text in och text ut, om promptarna ryms under 100 000 tokens och om uppgiften kräver planering i flera steg eller långsiktiga agenter, är Claude Haiku 5.5 den starkare modellen med tjugoen punkter och den billigare per token med en faktor tre till fem. Budgetera efter kostnad per uppgift i stället för efter prislistan, räkna med ungefär 0,21 dollar för den typ av jobb som den oberoende nämnden mäter, och räkna om dina prompter innan du prognostiserar något, eftersom tokenizerändringen flyttar antalet med omkring trettio procent i sig.

Om arbetet är kort, högvolymigt och har formen av ett svar – en tagg, en kategori, en extrahering, ett guardrail-beslut – så talar matematiken för Gemini 3.5 Flash-Lite, och det av en oglamorös anledning. Notan för ett anrop som genererar väldigt lite domineras av indata, de två indatapriserna är $0.30 mot $0.10, och Googles modells mycket kortare uppdragsavtryck gör att den billigare taxan vinner det färdiga jobbet trots att den förlorar på prislappen. Lägg till video-, ljud- eller filindata, och valet slutar helt att handla om pris.

Vad jämförelsen faktiskt slår fast är snävare än ”den nya Haiku är billig.” Den slår fast att den angivna taxan för en billig nivå är en dålig vägledning för vad den nivån kostar dig, och att modellen som ser tre gånger dyrare ut på prissidan kan skicka dig den mindre fakturan. Hur du än landar, mät de tokens du avger och inte de du skickar, för på båda dessa modeller är det den mätare som räkningen egentligen skrivs på.