
Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite: goedkoper per token, duurder per antwoord
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Claude Haiku 5.5 kost $0,10 per miljoen inputtokens en $0,50 per miljoen outputtokens. Gemini 3.5 Flash-Lite kost $0,30 en $2,50 op dezelfde twee meters. Het Anthropic-model is een derde van de prijs voor input en een vijfde van de prijs voor output, en het scoort 43,40 tegenover 22,2 op de Artificial Analysis Intelligence Index v4.3.2 — een verschil van meer dan twintig punten in een veld waar tien een generatiesprong is. Op de tariefkaart is dit geen nek-aan-nekvergelijking, en op het gebied van capaciteiten al evenmin.
Op de factuur is het een nek-aan-nekrace, en het pakt de andere kant uit. Zet beide modellen op dezelfde onafhankelijke ranglijst en reken elk van hen af voor een voltooide taak in plaats van voor een token, en Gemini 3.5 Flash-Lite blijkt goedkoper per antwoord. Artificial Analysis rekent Claude Haiku 5.5 op $0,21 per Intelligence Index-taak en Gemini 3.5 Flash-Lite op $0,1235 — een voordeel van 1,7 tegen 1 voor het model dat vijf keer meer betaalt voor elke token die het uitstuurt.
Die omkering is het hele punt van deze vergelijking. Claude Haiku 5.5 vervangt de goedkoopste tier die Anthropic ooit heeft uitgebracht en verslaat alles in de buurt op het gedeelde scorebord. Gemini 3.5 Flash-Lite werd op 21 juli 2026 uitgebracht en is sinds de zomer de voordelige keuze in deze prijsklasse. De vraag die een koper werkelijk heeft, is niet welke van de twee beter is, want dat antwoord staat vast. Het is welke je voor een verzoek moet zetten dat goedkoop moet terugkomen.
Alles hieronder is per miljoen tokens in Amerikaanse dollars. De listprijzen zijn de door de leveranciers zelf gepubliceerde tarieven. De onafhankelijke scores, de kosten-per-taakcijfers en de snelheidsmetingen die aan Artificial Analysis worden toegeschreven, zijn van die evaluator. De latentiecijfers voor Gemini 3.5 Flash-Lite komen uit ons eigen gemeten verkeer. Wanneer een getal op het modelrecord staat dat wij bijhouden in plaats van dat het op die dag van de pagina van de evaluator is gelezen, hebben wij die evaluator als de bron beschouwd, en niet onszelf.
De sticker en de factuur komen niet overeen.
Het kosten-per-taakverschil wordt niet verklaard door de tariefkaart, en het is de moeite waard om te weten waarom het bestaat voordat een van beide modellen in de buurt van productie komt.
Claude Haiku 5.5 is wijdlopig, en de evaluator zegt dat met zoveel woorden. Bij het draaien van de Intelligence Index registreerde Artificial Analysis 440 miljoen outputtokens van het model, tegenover een mediaan van 100 miljoen over de hele linie, en bestempelde het als zeer wijdlopig. Denkwerk wordt gefactureerd als output, denken staat standaard aan met een inspanningsregelaar die op medium begint, en een goedkoop inputtarief helpt niet bij een workload waarvan de rekening grotendeels uit output bestaat.
Gemini 3.5 Flash-Lite is ook niet beknopt, maar het is meetbaar goedkoper per taak. Hetzelfde scorebord registreert 17.507 outputtokens per voltooide indextaak voor dit model — 10.405 daarvan redeneertokens en 7.102 antwoordtokens. Zet dat af tegen het tokenvolume van het Anthropic-model, en de rekensom komt uit: een voordeel van vijf tegen één op het outputtarief wordt deels opgeslokt door een model dat de grotere respons genereert, en wat op taakniveau overblijft, is een klein nadeel in plaats van een groot voordeel.
Er is een tweede, subtieler effect dat dezelfde kant op werkt. In de documentatie van Anthropic staat dat Claude Haiku 5.5 de tokenizer gebruikt die ook door Claude 4.7 en later wordt gebruikt, waardoor dezelfde tekst ongeveer 30% meer tokens telt dan op het model dat dit model vervangt. Het tarief daalde met een factor drie ten opzichte van Google's tier. Het aantal tokens daalde niet, en bij dezelfde tekst steeg het.
Beide modellen, op de cijfers die ertoe doen
Gecachte tarieven en lijstprijzen uit de eigen documentatie van Anthropic en Google; onafhankelijke cijfers toegeschreven aan Artificial Analysis; live latentie uit ons eigen verkeersvenster van zeven dagen. Gecacht op 2026-10-08.

• Invoer — Claude Haiku 5.5 $0,10 tot 100.000 tokens en $0,50 daarboven; Gemini 3.5 Flash-Lite $0,30 vast over een venster van 1.048.576 tokens.
• Uitvoer — Claude Haiku 5.5: $0,50 tot 100.000 tokens en $2,50 daarboven; Gemini 3.5 Flash-Lite: $2,50 vast tarief.
• Gecachte invoer — Claude Haiku 5.5 $0,01 tot 100.000 tokens en $0,05 daarboven; Gemini 3.5 Flash-Lite $0,03. Cache-schrijfacties kosten $0,125 en $0,625 per miljoen tokens voor Claude Haiku 5.5.
• Context en output — een miljoen tokens per stuk. De maximale output is 128.000 tokens voor Claude Haiku 5.5 tegenover 65.536 voor Gemini 3.5 Flash-Lite, dus het plafond van Anthropic is ongeveer twee keer zo hoog.
• Invoermodaliteit — tekst en afbeeldingen voor Claude Haiku 5.5; tekst, afbeeldingen, video, audio en bestanden voor Gemini 3.5 Flash-Lite. Beide retourneren tekst.
• Onafhankelijke score — 43,40 voor Claude Haiku 5.5 (Max), tweede van 182 modellen op Intelligence Index v4.3.2, tegenover 22,2 voor Gemini 3.5 Flash-Lite, zesennegentigste van 147 en in het vierendertigste percentiel van die ranglijst.
• Onafhankelijke kosten per taak — $0,21 tegenover $0,1235 op hetzelfde board.
• Doorvoer — 241,9 outputtokens per seconde gemeten voor Claude Haiku 5.5 door Artificial Analysis, tegenover 280,0 voor Gemini 3.5 Flash-Lite, gemeten op onze eigen playground in de afgelopen zeven dagen. Dat zijn twee testomgevingen, niet één, dus lees ze als een orde van grootte en niet als een race.
Eenentwintig punten, en waar ze van gemaakt zijn
Een verschil van eenentwintig punten op een index die in de zestig loopt, is geen marge. Het is het verschil tussen een model dat een agentische lus aankan en een model dat één goed gespecificeerde aanroep moet krijgen.
De twee leveranciers meten elkaars harnassen niet, dus hun eigen suites kunnen niet naast elkaar worden gelegd. Anthropic publiceert resultaten voor GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 en FrontierCode voor Claude Haiku 5.5; Google publiceert zijn eigen set voor het Flash-Lite-segment; geen van beide heeft die van de ander gedraaid. De enige beschikbare vergelijking van appels met appels is de onafhankelijke ranglijst, en daar ligt het Anthropic-model voor met een ruime marge.
De subscores van de beoordelaar voor Gemini 3.5 Flash-Lite leggen de contouren van die categorie vast. Hij scoort 83,8% op GPQA Diamond en 54,2% op SWE-Bench Pro, 54% op Terminal-bench 2.1, 41,3% op SciCode en 39,2% op MLE-Bench, met 18,8% op Humanity's Last Exam. Dat zijn de cijfers van een competente, goedkope, general-purpose categorie — sterk in kennisvragen, zichtbaar achter op de moeilijkste redeneer- en onderzoeksevaluaties. Claude Haiku 5.5, met 43,40 op de samengestelde score, zit in een heel andere band, en de praktische interpretatie is dat werk dat meerstapsplanning over een lange horizon vereist, helemaal geen taak is voor de Google-categorie.
Een miljoen tokens aan window, en 65.536 aan antwoord
De twee contextvensters zijn even groot en het zijn niet hetzelfde product.
Lange context op Gemini 3.5 Flash-Lite degradeert met afstand op een manier die het waard is om te beprijzen voordat erop wordt vertrouwd. Op GDM-MRCR v2, de retrieval-evaluatie met acht needles, scoort het gemiddeld 72,2% wanneer de needles binnen 128.000 tokens liggen en 21,3% op de pointwise variant van één miljoen tokens. De Long-Context Recall-score is 76%, en CharXiv Reasoning komt uit op 74,5% zonder tools en 76,5% met tools. Een venster van een miljoen tokens is een echte capaciteit; betrouwbaar ophalen vanaf het verre uiteinde ervan is een kleinere capaciteit, en de twee bovenstaande cijfers zijn de afstand daartussen. Het venster van het Claude-model is niet op dezelfde manier op hetzelfde board gemeten, dus er is geen equivalent cijfer voor beschikbaar, en dit stuk zal er geen verzinnen.
De outputplafonds zijn het direct nuttigere verschil. Claude Haiku 5.5 genereert 128.000 tokens in één reactie; Gemini 3.5 Flash-Lite stopt bij 65.536. Als het artefact dat je terug wilt een lang bestand is, een volledige migratie, een gegenereerde testsuite of een herschrijving op transcriptschaal, kan een van deze twee modellen het in één enkele aanroep produceren en het andere niet — en een taak die over twee aanroepen wordt gesplitst, kost meer dan twee keer zoveel als één aanroep, omdat de gedeelde prefix tweemaal wordt verzonden.

Audio en video is geen prijskwestie
Gemini 3.5 Flash-Lite accepteert video, audio en bestanden tegen hetzelfde tarief als tekst. Claude Haiku 5.5 accepteert tekst en afbeeldingen.
Voor een pipeline die opgenomen gesprekken, schermopnames of bewakingsbeelden verwerkt, is het capaciteitsverschil dat ertoe doet niet de eenentwintig indexpunten. Het is dat een van deze modellen de input rechtstreeks aanneemt, en het andere een transcriptie- of frame-extractiefase ervoor nodig heeft — een tweede model, een tweede rekening, en een nieuwe faalmodus tussen de bron en het antwoord. Teams in die positie kiezen niet tussen twee goedkope niveaus. Ze kiezen tussen één model en een pipeline.
Het omgekeerde geldt voor afbeeldingen en documenten. Beide modellen lezen afbeeldingen native, en Claude Haiku 5.5 scoort daarvoor 43,40 op de composiet, dus een workload voor het extraheren van pagina-afbeeldingen of het begrijpen van diagrammen zonder audio erin hoort op basis van de cijfers aan de Anthropic-kant thuis, niet op basis van een modaliteitsargument.
Een van de twee vanaf hier uitvoeren
Gemini 3.5 Flash-Lite staat in de OrcaRouter-catalogus tegen de lijstprijs van Google met 0% markup, wat betekent dat het tarief van de provider wordt doorgegeven in plaats van vermengd, en dat een wijziging op de tariefkaart van Google jouw factuur bereikt op de dag dat die hun factuur bereikt. Dat is één sleutel en één SDK voor de tier van Google, naast Claude Sonnet 5.5 en Claude Opus 5.5, die ook in de catalogus staan — dus een A/B tussen een Google Flash-Lite-leg en een Anthropic-leg is al een configuratie in plaats van een integratieproject. Automatische failover zit daaronder, dus geen van beide legs is een single point of failure, en de routing-DSL zal de escalatie in de route tot uitdrukking brengen als dat is waar de logica thuishoort.
Het latentieprofiel van dat traject is gebaseerd op onze eigen meting en niet op die van de leverancier. Over de laatste zeven dagen liveverkeer heeft Gemini 3.5 Flash-Lite een p50 van 2.426 milliseconden en een p95 van 8.600 milliseconden aangehouden bij 280 outputtokens per seconde, met een foutpercentage van 0,313%. Zie het als een rollend venster en niet als een belofte: het verandert mee met verkeer en de omstandigheden bij de provider, en het getal dat je voor een bepaalde pipeline moet vertrouwen, is het getal dat je na een week zelf meet.

Claude Haiku 5.5 staat niet in de catalogus. Het is uitgekomen op 7 oktober 2026 — een dag voordat dit werd geschreven — en het is vandaag niet via ons routeerbaar, dus de Anthropic-kant van deze vergelijking is momenteel alleen bereikbaar bij Anthropic. Dat gewoon duidelijk zeggen is beter dan het impliciet te laten. Een gat tussen het uitkomen van een model en het aanroepbaar zijn van een model via ons is normaal, het is geen belofte over wanneer dat gat zich sluit, en een lezer die een migratie plant, kan beter uitgaan van de kalender die hij kan zien dan van de kalender die hij zou verkiezen.
Welke, en voor wie?
Als het werk tekst in en tekst uit is, als de prompts onder de 100.000 tokens blijven, en als de taak planning in meerdere stappen of agents met een lange horizon vereist, is Claude Haiku 5.5 het sterkere model met een voorsprong van eenentwintig punten en per token drie tot vijf keer goedkoper. Begroot op kosten per taak in plaats van op de prijslijst, reken op ongeveer $0,21 voor het soort opdracht dat de onafhankelijke raad meet, en tel je prompts opnieuw voordat je iets voorspelt, want de tokenizerwijziging verandert de telling op zichzelf al met ongeveer dertig procent.
Als het werk kort, hoogvolume en antwoordvormig is — een tag, een categorie, een extractie, een guardrail-beslissing — dan valt de rekensom uit in het voordeel van Gemini 3.5 Flash-Lite, en wel om een weinig glamoureuze reden. De rekening voor een aanroep die heel weinig uitvoer genereert, wordt gedomineerd door input, de twee inputtarieven zijn $0,30 tegen $0,10, en de veel kleinere taakvoetafdruk van het Google-model betekent dat het goedkopere tarief de afgeronde klus wint, ook al verliest het op de stickerprijs. Voeg video-, audio- of bestandsinvoer toe en de keuze gaat helemaal niet meer over prijs.
Wat de combinatie feitelijk beslecht, is beperkter dan "de nieuwe Haiku is goedkoop." Ze beslecht dat het meest in het oog springende tarief op een goedkope tier een slechte graadmeter is voor wat die tier je kost, en dat het model dat op de prijzenpagina drie keer zo duur lijkt, je de kleinere factuur kan sturen. Waar je ook op uitkomt, meet de tokens die je genereert en niet de tokens die je verstuurt, want bij beide modellen is dat de meter waarop de rekening werkelijk wordt geschreven.
