
Claude Haiku 5.5 vs Gemini 3.7 Flash: Een van deze twee is al met pensioen
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Er schuilt een ongemakkelijk feit onder elke Claude Haiku 5.5 en Gemini 3.7 Flash-vergelijking die vandaag wordt geschreven: Gemini 3.7 Flash is verouderd. De leverancier bracht het uit op 13 augustus 2026, verving het op 2 september door Gemini 3.8 Flash, en Artificial Analysis heeft de 3.7-pagina nu voorzien van een verouderingsmarkering. Claude Haiku 5.5 daarentegen verscheen op 7 oktober 2026 en heeft een toezegging dat het niet eerder dan in oktober 2027 buiten gebruik wordt gesteld.
Dat maakt de vergelijking niet nutteloos. Het verandert de vraag. Dit is niet langer "welke van deze twee moet ik aanroepen" — voor de meeste teams is het antwoord daarop geen van beide, omdat de 3.7-lijn binnen zijn eigen familie al is opgevolgd. Waar het wel goed voor is, is iets subtielers en misschien wel nuttigers: een helder beeld van hoe snel Google's flash-tier zich in drie weken heeft ontwikkeld, en van welke onderdelen van de specsheet van een flash-tier-model daadwerkelijk bepalen of het wordt gebruikt.
Wat je nog kunt meten
Beide modellen zijn uitgevoerd op hetzelfde onafhankelijke board, de enige plek waar de twee überhaupt naast elkaar kunnen worden gezet. Op de Artificial Analysis Intelligence Index v4.3.2 scoort Claude Haiku 5.5 43,40 in zijn Max-configuratie tegenover 39,06 voor Gemini 3.7 Flash in zijn High-configuratie — een verschil van 4,33 punten.
Beide leveranciers publiceren ook hun eigen evaluatiesets, en deze overlappen niet op een manier die een directe vergelijking mogelijk maakt. De gedeelde onafhankelijke rijen zijn de vier die Artificial Analysis op beide heeft uitgevoerd:
• Terminal Bench 4.0 — 0.3283 voor Claude Haiku 5.5 tegen 0.1364 voor Gemini 3.7 Flash. Een absolute kloof van 19 punten, en de grootste asymmetrie in de set.
• SciCode — 0,5498 tegen 0,5718. Gemini 3.7 Flash verslaat het nipt met 2,2 punten.
• Humanity's Last Exam — 0,4439 tegen 0,4787. Gemini 3.7 Flash met 3,5 punten.
• AutomationBench, gedeeltelijke score — 0,3541 tegenover 0,6203. Gemini 3.7 Flash met 27 punten.
Lees die set aandachtig, want hij bevat het interessante resultaat. Gemini 3.7 Flash wint drie van de vier gemeenschappelijke benchmarks en verliest toch de samengestelde index met 4,3 punten. Een index is een gewogen mix, en de weging plaatst de terminal- en coderijen — waar het verschil juist de andere kant op loopt, met een veel grotere marge — boven het totaal van de andere. Dat is niet zozeer een scoringsartefact als wel een uitspraak over waarvoor de index dient: hij probeert te voorspellen of een model een taak kan voltooien, en op die vraag was de 3.7-lijn zwak op een manier die zijn respectabele scores op wetenschapsbenchmarks niet verhulden.

Waar de 3.7-lijn eigenlijk slecht in was
Twee rijen vertellen het verhaal beter dan de index doet.
Terminal Bench 4.0 met 0,1364 is een laag cijfer, en het staat naast een 0,8577 op de vorige Terminal Bench-generatie van hetzelfde model. Dat is geen model dat slechter is geworden; het is een benchmark die is veranderd in wat hij meet, en Gemini 3.7 Flash heeft de overgang niet gemaakt. Claude Haiku 5.5 scoort op dezelfde herziene benchmark 0,3283 — niet spectaculair in absolute termen, maar bijna tweeënhalf keer het cijfer van 3.7 Flash, op de rij die de agentische codeerprestaties het meest direct voorspelt.
De tweede rij is Tau-Bench Banking, waar Gemini 3.7 Flash 0,3278 scoort. Betrouwbaarheid van toolgebruik in een gestructureerd domein is precies waarvoor een goedkoop model wordt ingezet, en een score onder 0,33 is het soort getal dat stilletjes een pilot om zeep helpt. Claude Haiku 5.5 heeft geen gepubliceerd Tau-Bench-cijfer in dezelfde tabel, dus daar is geen vergelijking beschikbaar — het eerlijkst is om dat te zeggen in plaats van er een af te leiden.
Waar Gemini 3.7 Flash overeind bleef, is waar het altijd overeind bleef: GPQA op 0,9455 en MMMU-Pro op 0,8549 zijn beide echte sterke punten, en zijn multimodale input stond nooit ter discussie. De tekortkoming zat in het deel van de specsheet dat bepaalt of een agent-loop werkt, niet in het deel dat leaderboardrijen wint.
Wat veranderde er in de drie weken daarna?
Gemini 3.8 Flash verscheen op 2 september 2026, en de verschuiving binnen Googles eigen flash-tier is de nuttigere vergelijking voor iedereen die een 2027-pipeline plant.
Op dezelfde index scoort Gemini 3.8 Flash 40,93 tegenover 39,06 voor de 3.7-lijn — een winst van 1,87 punt in drie weken. Terminal Bench 4.0 ging van 0,1364 naar 0,1970. Tau-Bench Banking ging van 0,3278 naar 0,4495. Dat zijn precies de rijen waarop het 3.7-model het slechtst presteerde, wat erop wijst dat de opvolger juist op deze zwakte was gericht in plaats van op een algemene capaciteitsverhoging.
De prijs bleef helemaal ongewijzigd. Gemini 3.7 Flash werd vermeld tegen $0,75 voor input en $3,75 voor output per miljoen tokens, en Gemini 3.8 Flash werd gelanceerd tegen dezelfde $0,75 en $3,75 — de identieke tariefkaart, gekoppeld aan een model dat twee indexpunten beter scoort op de rijen die ertoe doen voor agents.

De tariefkaart is waar deze vergelijking echt een wending neemt
Vergeleken met Claude Haiku 5.5 is de prijs van Google het hele verhaal, en het is niet eens close.
• Invoer — Claude Haiku 5.5 $0,10 per miljoen tokens tot 100.000, $0,50 daarboven; Gemini 3.7 Flash $0,75 vast, of zevenenhalf keer het tarief van Anthropic binnen de eerste schijf.
• Uitvoer — $0,50 voor Claude Haiku 5.5 binnen de eerste tier, $2,50 daarboven; $3,75 voor Gemini 3.7 Flash.
• Gecachte invoer — $0,01 en $0,125 voor Claude Haiku 5.5; $0,075 lezen en $0,75 schrijven voor Gemini 3.7 Flash.
• Context — één miljoen tokens voor beide. Maximale uitvoer — 128.000 tokens voor Claude Haiku 5.5 tegen 65.536 voor Gemini 3.7 Flash.
• Invoermodaliteit — tekst en afbeeldingen voor Claude Haiku 5.5; tekst, afbeeldingen, spraak en video voor Gemini 3.7 Flash. Dit blijft de enige regel waarop Googles specificatie strikt langer is, en die overleefde de opvolging naar 3.8 ongewijzigd.
• Onafhankelijke kosten per voltooide Index-taak — $0,21 voor Claude Haiku 5.5 tegenover $0,93 voor Gemini 3.7 Flash. Een verschil van 4,4× dat groter is dan de inputverhouding van 7,5 tegen 1 zou doen vermoeden, omdat het model van Anthropic hier het uitvoerige model is: 162.164 outputtokens per Index-taak tegenover 58.387 voor Gemini 3.7 Flash. Anthropic documenteert ook een tokenizer die wordt gedeeld met Claude 4.7 en later, en die voor dezelfde tekst ongeveer 30% meer tokens telt, wat in dezelfde richting werkt.
• Snelheid — 212,3 seconden per Index-taak voor Gemini 3.7 Flash tegenover 424,6 voor Claude Haiku 5.5. Het model van Google is twee keer zo snel als het andere, en dit is de enige regel in deze sectie waarin het goedkopere model niet ook het betere is.
Wat dit betekent als je vandaag kiest
De praktische lezing is dat geen van deze twee het juiste antwoord is, om verschillende redenen.
Gemini 3.7 Flash is verouderd, geprijsd tegen hetzelfde tarief als zijn opvolger, en slechter dan die opvolger op precies de rijen die een goedkoop productiemodel nodig heeft. Het aanbevelen ervan zou neerkomen op het aanbevelen van een tariefkaart die aan een achterhaald model hangt — de opvolger kost hetzelfde en doet meer. Niemand die in oktober 2026 tussen deze twee kiest, zou op de 3.7-lijn moeten uitkomen, en het feit dat de tariefkaart ongewijzigd is, is wat de doorslag geeft.
Claude Haiku 5.5 is het live model, en bij werk met tekst als invoer en tekst als uitvoer is het op elke maatstaf goedkoper, hoger op de samengestelde score en veel beter op de twee rijen die agentisch succes voorspellen. Het is ook het langzamere model en het kan geen spraak of video accepteren. Of dat ertoe doet, is een vraag over je pipeline, niet over de modellen.
De derde optie, die het verschil in indexpunten tussen 3.8 en 3.7 zichtbaar maakt, is dat de flash-tier van Google zich zo snel ontwikkelt dat een drie weken oude vergelijking al historisch is. Behandel elke rechtstreekse vergelijking in de flash-tier als iets met een houdbaarheid van weken, niet van kwartalen.
Rennen aan welke kant je ook terechtkomt.
Gemini 3.8 Flash — de opvolger, niet de verouderde 3.7 — staat in de OrcaRouter-catalogus tegen Google's lijstprijs met 0% opslag, dus het tarief dat Google publiceert is het tarief dat op je factuur terechtkomt, en een wijziging aan hun kant is dezelfde dag live aan onze kant. Claude Sonnet 5.5 en Claude Opus 5.5 staan ook in de catalogus, waardoor een routingtest met twee leveranciers een configuratie is in plaats van een project: één API voor meer dan 200 modellen, één sleutel, automatische failover daaronder, en de routing-DSL wanneer je de escalatie liever in de route houdt dan in code.
Gemini 3.7 Flash staat zelf niet in onze catalogus, en Claude Haiku 5.5 evenmin. Beide blijven bereikbaar via de eigen API's van hun leveranciers en, in het geval van Google, via verschillende platforms van derden. Dat is het vermelden waard, in plaats van de lezer het zelf te laten ontdekken.

Het getal om af te trekken
Het is niet de indexkloof van 4,33 punten. Het is dat Gemini 3.7 Flash drie van de vier gedeelde benchmarks won en toch de samengestelde score met vier punten verloor, omdat de benchmark waaraan de index het zwaarste gewicht toekent, degene was waarop het 0,1364 scoorde. De wetenschapsscores van een model uit de flash-klasse kunnen er prima uitzien, terwijl het faalt bij datgene waarvoor goedkope modellen worden gekocht.
Het gevolg is dat de opvolger precies die rijen binnen drie weken repareerde, tegen een ongewijzigde prijs. Op basis van dit bewijs is de concurrentiedruk in dit segment niet de prijs. Het gaat erom of het model een taak met meerdere stappen kan afronden, en dat beweegt nu sneller dan tariefkaarten doen.
