Een gegenereerde herokaart voor 'Goedkoper per token, duurder per antwoord', met het label 'KOSTEN PER ANTWOORD', de kicker 'TWEE GOEDKOPE TIERS, ÉÉN GEDEELD SCOREBORD' en de ondertitel 'Claude Haiku 5.5 met 43,40 tegenover Gemini 3.5 Flash-Lite met 22,2 op Intelligence Index v4.3.2.' Vier chips tonen '43,40 vs 22,2', '$0,21 vs $0,12', '$0,10 vs $0,30' en '$0,50 vs $2,50'. Twee kaarten eronder zijn gelabeld 'VOORDEEL VAN ANTHROPIC' ('eenentwintig punten hoger op het gedeelde scorebord, en goedkoper op beide maatstaven') en 'VOORDEEL VAN GOOGLE' ('goedkoper voor een afgeronde taak, en het kan video en audio verwerken'). Een voettekst luidt 'Onafhankelijke scores en kosten per taak van Artificial Analysis; lijstprijzen uitgelezen op 8 oktober 2026.' Het OrcaRouter-logo is in de rechteronderhoek gecompositeerd.
Guides & Insights

Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite: goedkoper per token, duurder per antwoord

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Claude Haiku 5.5 kost $0,10 per miljoen inputtokens en $0,50 per miljoen outputtokens. Gemini 3.5 Flash-Lite kost $0,30 en $2,50 op dezelfde twee meters. Het Ant​hropic-model is een derde van de prijs voor input en een vijfde van de prijs voor output, en het scoort 43,40 tegenover 22,2 op de Artificial Analysis Intelligence Index v4.3.2 — een verschil van meer dan twintig punten in een veld waar tien een generatiesprong is. Op de tariefkaart is dit geen nek-aan-nekvergelijking, en op het gebied van capaciteiten al evenmin.

Op de factuur is het een nek-aan-nekrace, en het pakt de andere kant uit. Zet beide modellen op dezelfde onafhankelijke ranglijst en reken elk van hen af voor een voltooide taak in plaats van voor een token, en Gemini 3.5 Flash-Lite blijkt goedkoper per antwoord. Artificial Analysis rekent Claude Haiku 5.5 op $0,21 per Intelligence Index-taak en Gemini 3.5 Flash-Lite op $0,1235 — een voordeel van 1,7 tegen 1 voor het model dat vijf keer meer betaalt voor elke token die het uitstuurt.

Die omkering is het hele punt van deze vergelijking. Claude Haiku 5.5 vervangt de goedkoopste tier die Ant​hropic ooit heeft uitgebracht en verslaat alles in de buurt op het gedeelde scorebord. Gemini 3.5 Flash-Lite werd op 21 juli 2026 uitgebracht en is sinds de zomer de voordelige keuze in deze prijsklasse. De vraag die een koper werkelijk heeft, is niet welke van de twee beter is, want dat antwoord staat vast. Het is welke je voor een verzoek moet zetten dat goedkoop moet terugkomen.

Alles hieronder is per miljoen tokens in Amerikaanse dollars. De listprijzen zijn de door de leveranciers zelf gepubliceerde tarieven. De onafhankelijke scores, de kosten-per-taakcijfers en de snelheidsmetingen die aan Artificial Analysis worden toegeschreven, zijn van die evaluator. De latentiecijfers voor Gemini 3.5 Flash-Lite komen uit ons eigen gemeten verkeer. Wanneer een getal op het modelrecord staat dat wij bijhouden in plaats van dat het op die dag van de pagina van de evaluator is gelezen, hebben wij die evaluator als de bron beschouwd, en niet onszelf.

De sticker en de factuur komen niet overeen.

Het kosten-per-taakverschil wordt niet verklaard door de tariefkaart, en het is de moeite waard om te weten waarom het bestaat voordat een van beide modellen in de buurt van productie komt.

Claude Haiku 5.5 is wijdlopig, en de evaluator zegt dat met zoveel woorden. Bij het draaien van de Intelligence Index registreerde Artificial Analysis 440 miljoen outputtokens van het model, tegenover een mediaan van 100 miljoen over de hele linie, en bestempelde het als zeer wijdlopig. Denkwerk wordt gefactureerd als output, denken staat standaard aan met een inspanningsregelaar die op medium begint, en een goedkoop inputtarief helpt niet bij een workload waarvan de rekening grotendeels uit output bestaat.

Gemini 3.5 Flash-Lite is ook niet beknopt, maar het is meetbaar goedkoper per taak. Hetzelfde scorebord registreert 17.507 outputtokens per voltooide indextaak voor dit model — 10.405 daarvan redeneertokens en 7.102 antwoordtokens. Zet dat af tegen het tokenvolume van het Ant​hropic-model, en de rekensom komt uit: een voordeel van vijf tegen één op het outputtarief wordt deels opgeslokt door een model dat de grotere respons genereert, en wat op taakniveau overblijft, is een klein nadeel in plaats van een groot voordeel.

Er is een tweede, subtieler effect dat dezelfde kant op werkt. In de documentatie van Anthropic staat dat Claude Haiku 5.5 de tokenizer gebruikt die ook door Claude 4.7 en later wordt gebruikt, waardoor dezelfde tekst ongeveer 30% meer tokens telt dan op het model dat dit model vervangt. Het tarief daalde met een factor drie ten opzichte van Google's tier. Het aantal tokens daalde niet, en bij dezelfde tekst steeg het.

Beide modellen, op de cijfers die ertoe doen

Gecachte tarieven en lijstprijzen uit de eigen documentatie van Anthropic en Google; onafhankelijke cijfers toegeschreven aan Artificial Analysis; live latentie uit ons eigen verkeersvenster van zeven dagen. Gecacht op 2026-10-08.

A generated scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite - on the numbers that matter'. Claude Haiku 5.5 reads input $0.10 under 100K and $0.50 above, output $0.50 and $2.50, cached input $0.01 and $0.05, maximum output 128,000 tokens, input modality text and images, Intelligence Index v4.3.2 43.40, cost per task $0.21. Gemini 3.5 Flash-Lite reads input $0.30, output $2.50, cached input $0.03, maximum output 65,536 tokens, input modality text images video audio and files, Intelligence Index v4.3.2 22.2, cost per task $0.12. A footer reads 'Vendors' published list rates; independent scores and cost per task from Artificial Analysis.'

• Invoer — Claude Haiku 5.5 $0,10 tot 100.000 tokens en $0,50 daarboven; Gemini 3.5 Flash-Lite $0,30 vast over een venster van 1.048.576 tokens.

• Uitvoer — Claude Haiku 5.5: $0,50 tot 100.000 tokens en $2,50 daarboven; Gemini 3.5 Flash-Lite: $2,50 vast tarief.

• Gecachte invoer — Claude Haiku 5.5 $0,01 tot 100.000 tokens en $0,05 daarboven; Gemini 3.5 Flash-Lite $0,03. Cache-schrijfacties kosten $0,125 en $0,625 per miljoen tokens voor Claude Haiku 5.5.

• Context en output — een miljoen tokens per stuk. De maximale output is 128.000 tokens voor Claude Haiku 5.5 tegenover 65.536 voor Gemini 3.5 Flash-Lite, dus het plafond van Anthropic is ongeveer twee keer zo hoog.

• Invoermodaliteit — tekst en afbeeldingen voor Claude Haiku 5.5; tekst, afbeeldingen, video, audio en bestanden voor Gemini 3.5 Flash-Lite. Beide retourneren tekst.

• Onafhankelijke score — 43,40 voor Claude Haiku 5.5 (Max), tweede van 182 modellen op Intelligence Index v4.3.2, tegenover 22,2 voor Gemini 3.5 Flash-Lite, zesennegentigste van 147 en in het vierendertigste percentiel van die ranglijst.

• Onafhankelijke kosten per taak — $0,21 tegenover $0,1235 op hetzelfde board.

• Doorvoer — 241,9 outputtokens per seconde gemeten voor Claude Haiku 5.5 door Artificial Analysis, tegenover 280,0 voor Gemini 3.5 Flash-Lite, gemeten op onze eigen playground in de afgelopen zeven dagen. Dat zijn twee testomgevingen, niet één, dus lees ze als een orde van grootte en niet als een race.

Eenentwintig punten, en waar ze van gemaakt zijn

Een verschil van eenentwintig punten op een index die in de zestig loopt, is geen marge. Het is het verschil tussen een model dat een agentische lus aankan en een model dat één goed gespecificeerde aanroep moet krijgen.

De twee leveranciers meten elkaars harnassen niet, dus hun eigen suites kunnen niet naast elkaar worden gelegd. Ant​hropic publiceert resultaten voor GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 en FrontierCode voor Claude Haiku 5.5; Goo​gle publiceert zijn eigen set voor het Flash-Lite-segment; geen van beide heeft die van de ander gedraaid. De enige beschikbare vergelijking van appels met appels is de onafhankelijke ranglijst, en daar ligt het Ant​hropic-model voor met een ruime marge.

De subscores van de beoordelaar voor Gemini 3.5 Flash-Lite leggen de contouren van die categorie vast. Hij scoort 83,8% op GPQA Diamond en 54,2% op SWE-Bench Pro, 54% op Terminal-bench 2.1, 41,3% op SciCode en 39,2% op MLE-Bench, met 18,8% op Humanity's Last Exam. Dat zijn de cijfers van een competente, goedkope, general-purpose categorie — sterk in kennisvragen, zichtbaar achter op de moeilijkste redeneer- en onderzoeksevaluaties. Claude Haiku 5.5, met 43,40 op de samengestelde score, zit in een heel andere band, en de praktische interpretatie is dat werk dat meerstapsplanning over een lange horizon vereist, helemaal geen taak is voor de Google-categorie.

Een miljoen tokens aan window, en 65.536 aan antwoord

De twee contextvensters zijn even groot en het zijn niet hetzelfde product.

Lange context op Gemini 3.5 Flash-Lite degradeert met afstand op een manier die het waard is om te beprijzen voordat erop wordt vertrouwd. Op GDM-MRCR v2, de retrieval-evaluatie met acht needles, scoort het gemiddeld 72,2% wanneer de needles binnen 128.000 tokens liggen en 21,3% op de pointwise variant van één miljoen tokens. De Long-Context Recall-score is 76%, en CharXiv Reasoning komt uit op 74,5% zonder tools en 76,5% met tools. Een venster van een miljoen tokens is een echte capaciteit; betrouwbaar ophalen vanaf het verre uiteinde ervan is een kleinere capaciteit, en de twee bovenstaande cijfers zijn de afstand daartussen. Het venster van het Claude-model is niet op dezelfde manier op hetzelfde board gemeten, dus er is geen equivalent cijfer voor beschikbaar, en dit stuk zal er geen verzinnen.

De outputplafonds zijn het direct nuttigere verschil. Claude Haiku 5.5 genereert 128.000 tokens in één reactie; Gemini 3.5 Flash-Lite stopt bij 65.536. Als het artefact dat je terug wilt een lang bestand is, een volledige migratie, een gegenereerde testsuite of een herschrijving op transcriptschaal, kan een van deze twee modellen het in één enkele aanroep produceren en het andere niet — en een taak die over twee aanroepen wordt gesplitst, kost meer dan twee keer zoveel als één aanroep, omdat de gedeelde prefix tweemaal wordt verzonden.

A screenshot of the Artificial Analysis model page for Gemini 3.5 Flash-Lite, showing the model name over the provider Google, the release month July 2026, a one-million-token context window, the input modality list covering text, image, video, audio and PDF, an Intelligence Index v4.3.2 score of 22, the per-million-token input and output rates with the cached-input discount, and the measured output speed, total response time and cost per task.

Audio en video is geen prijskwestie

Gemini 3.5 Flash-Lite accepteert video, audio en bestanden tegen hetzelfde tarief als tekst. Claude Haiku 5.5 accepteert tekst en afbeeldingen.

Voor een pipeline die opgenomen gesprekken, schermopnames of bewakingsbeelden verwerkt, is het capaciteitsverschil dat ertoe doet niet de eenentwintig indexpunten. Het is dat een van deze modellen de input rechtstreeks aanneemt, en het andere een transcriptie- of frame-extractiefase ervoor nodig heeft — een tweede model, een tweede rekening, en een nieuwe faalmodus tussen de bron en het antwoord. Teams in die positie kiezen niet tussen twee goedkope niveaus. Ze kiezen tussen één model en een pipeline.

Het omgekeerde geldt voor afbeeldingen en documenten. Beide modellen lezen afbeeldingen native, en Claude Haiku 5.5 scoort daarvoor 43,40 op de composiet, dus een workload voor het extraheren van pagina-afbeeldingen of het begrijpen van diagrammen zonder audio erin hoort op basis van de cijfers aan de Anthropic-kant thuis, niet op basis van een modaliteitsargument.

Een van de twee vanaf hier uitvoeren

Gemini 3.5 Flash-Lite staat in de OrcaRouter-catalogus tegen de lijstprijs van Goo​gle met 0% markup, wat betekent dat het tarief van de provider wordt doorgegeven in plaats van vermengd, en dat een wijziging op de tariefkaart van Goo​gle jouw factuur bereikt op de dag dat die hun factuur bereikt. Dat is één sleutel en één SDK voor de tier van Goo​gle, naast Claude Sonnet 5.5 en Claude Opus 5.5, die ook in de catalogus staan — dus een A/B tussen een Goo​gle Flash-Lite-leg en een Ant​hropic-leg is al een configuratie in plaats van een integratieproject. Automatische failover zit daaronder, dus geen van beide legs is een single point of failure, en de routing-DSL zal de escalatie in de route tot uitdrukking brengen als dat is waar de logica thuishoort.

Het latentieprofiel van dat traject is gebaseerd op onze eigen meting en niet op die van de leverancier. Over de laatste zeven dagen liveverkeer heeft Gemini 3.5 Flash-Lite een p50 van 2.426 milliseconden en een p95 van 8.600 milliseconden aangehouden bij 280 outputtokens per seconde, met een foutpercentage van 0,313%. Zie het als een rollend venster en niet als een belofte: het verandert mee met verkeer en de omstandigheden bij de provider, en het getal dat je voor een bepaalde pipeline moet vertrouwen, is het getal dat je na een week zelf meet.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing the Anthropic model name and an October 2026 release, Intelligence Index v4.3.2 of 43 ranking second of 182, speed ninth of 182 at 241.9 output tokens per second, a $0.21 cost per task, input $0.10 and output $0.50 per million tokens, and a one-million-token context window.

Claude Haiku 5.5 staat niet in de catalogus. Het is uitgekomen op 7 oktober 2026 — een dag voordat dit werd geschreven — en het is vandaag niet via ons routeerbaar, dus de Ant​hropic-kant van deze vergelijking is momenteel alleen bereikbaar bij Ant​hropic. Dat gewoon duidelijk zeggen is beter dan het impliciet te laten. Een gat tussen het uitkomen van een model en het aanroepbaar zijn van een model via ons is normaal, het is geen belofte over wanneer dat gat zich sluit, en een lezer die een migratie plant, kan beter uitgaan van de kalender die hij kan zien dan van de kalender die hij zou verkiezen.

Welke, en voor wie?

Als het werk tekst in en tekst uit is, als de prompts onder de 100.000 tokens blijven, en als de taak planning in meerdere stappen of agents met een lange horizon vereist, is Claude Haiku 5.5 het sterkere model met een voorsprong van eenentwintig punten en per token drie tot vijf keer goedkoper. Begroot op kosten per taak in plaats van op de prijslijst, reken op ongeveer $0,21 voor het soort opdracht dat de onafhankelijke raad meet, en tel je prompts opnieuw voordat je iets voorspelt, want de tokenizerwijziging verandert de telling op zichzelf al met ongeveer dertig procent.

Als het werk kort, hoogvolume en antwoordvormig is — een tag, een categorie, een extractie, een guardrail-beslissing — dan valt de rekensom uit in het voordeel van Gemini 3.5 Flash-Lite, en wel om een weinig glamoureuze reden. De rekening voor een aanroep die heel weinig uitvoer genereert, wordt gedomineerd door input, de twee inputtarieven zijn $0,30 tegen $0,10, en de veel kleinere taakvoetafdruk van het Google-model betekent dat het goedkopere tarief de afgeronde klus wint, ook al verliest het op de stickerprijs. Voeg video-, audio- of bestandsinvoer toe en de keuze gaat helemaal niet meer over prijs.

Wat de combinatie feitelijk beslecht, is beperkter dan "de nieuwe Haiku is goedkoop." Ze beslecht dat het meest in het oog springende tarief op een goedkope tier een slechte graadmeter is voor wat die tier je kost, en dat het model dat op de prijzenpagina drie keer zo duur lijkt, je de kleinere factuur kan sturen. Waar je ook op uitkomt, meet de tokens die je genereert en niet de tokens die je verstuurt, want bij beide modellen is dat de meter waarop de rekening werkelijk wordt geschreven.