
Claude Haiku 5.5 vs Gemini 3.7 Flash: En av dessa två är redan pensionerad
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Det finns ett besvärande faktum som ligger under varje Claude Haiku 5.5 kontra Gemini 3.7 Flashjämförelse som skrivs idag: Gemini 3.7 Flash är föråldrad. Leverantören släppte den 13 augusti 2026 och ersatte den med Gemini 3.8 Flash den 2 september, och Artificial Analysis har nu 3.7-sidan med en föråldringsflagga på sig. Claude Haiku 5.5 lanserades däremot den 7 oktober 2026 och har ett åtagande om avveckling tidigast i oktober 2027.
Det gör inte jämförelsen värdelös. Det ändrar frågan. Det här är inte längre "vilken av dessa två ska jag anropa" — för de flesta team är svaret på det ingendera, eftersom 3.7-serien har ersatts inom sin egen familj. Vad den är bra för är något subtilare och rimligen mer användbart: en tydlig bild av hur snabbt Googles flash-nivå rörde sig på tre veckor, och av vilka delar av specifikationsbladet för en modell på flash-nivå som faktiskt avgör om den används.
Vad du fortfarande kan mäta
Båda modellerna har körts på samma oberoende resultattavla, vilket är den enda platsen där de två överhuvudtaget kan jämföras sida vid sida. På Artificial Analysis Intelligence Index v4.3.2 får Claude Haiku 5.5 43,40 i sin Max-konfiguration mot 39,06 för Gemini 3.7 Flash i sin High-konfiguration – en skillnad på 4,33 punkter.
Båda leverantörerna publicerar också sina egna utvärderingsuppsättningar, och de överlappar inte på ett sätt som möjliggör direkt jämförelse. De gemensamma oberoende raderna är de fyra som Artificial Analysis körde på båda:
• Terminal Bench 4.0 — 0,3283 för Claude Haiku 5.5 mot 0,1364 för Gemini 3.7 Flash. En absolut skillnad på 19 punkter, och den största asymmetrin i uppsättningen.
• SciCode — 0,5498 mot 0,5718. Gemini 3.7 Flash överträffar det med 2,2 poäng.
• Humanity's Last Exam – 0,4439 mot 0,4787. Gemini 3.7 Flash med 3,5 poäng.
AutomationBench, delpoäng — 0,3541 mot 0,6203. Gemini 3.7 Flash med 27 poängs marginal.
Läs den uppsättningen noggrant, för den innehåller det intressanta resultatet. Gemini 3.7 Flash vinner tre av de fyra gemensamma benchmarkarna och förlorar ändå i det sammansatta indexet med 4,3 poäng. Ett index är en viktad sammanvägning, och viktningen placerar terminal- och kodraderna — där gapet går åt andra hållet med en mycket större marginal — före aggregeringen av de övriga. Det är inte så mycket en artefakt i poängsättningen som ett uttalande om vad indexet är till för: det försöker förutsäga om en modell kan slutföra ett jobb, och i den frågan var 3.7-linjen svag på ett sätt som dess respektabla poäng på vetenskapsbenchmarkarna inte dolde.

Vad 3.7-serien faktiskt var dålig på
Två rader berättar historien bättre än indexet gör.
Terminal Bench 4.0 med 0,1364 är en låg siffra, och den ligger bredvid 0,8577 på föregående generation av Terminal Bench från samma modell. Det är inte en modell som blev sämre; det är ett benchmark som ändrade vad det mäter, och Gemini 3.7 Flash klarade inte övergången. Claude Haiku 5.5 får, på samma reviderade benchmark, 0,3283 — inte spektakulärt i absoluta tal, men nästan två och en halv gånger siffran för 3.7 Flash, på den rad som mest direkt förutsäger agentisk kodningsprestanda.
Den andra raden är Tau-Bench Banking, där Gemini 3.7 Flash får 0,3278. Tillförlitlighet vid verktygsanvändning i en strukturerad domän är precis vad en billig modell driftsätts för, och en poäng under 0,33 är den typ av siffra som tyst tar död på ett pilotprojekt. Claude Haiku 5.5 har ingen publicerad Tau-Bench-siffra i samma tabell, så någon jämförelse finns inte tillgänglig där — det ärliga är att säga det i stället för att dra en slutsats.
Där Gemini 3.7 Flash höll måttet är där den alltid har hållit måttet: GPQA på 0,9455 och MMMU-Pro på 0,8549 är båda verkliga styrkor, och dess multimodala indata ifrågasattes aldrig. Misslyckandet låg i den del av specifikationsbladet som avgör om en agentloop fungerar, inte i den del som vinner rader på topplistan.
Vad förändrades under de tre veckorna efter det?
Gemini 3.8 Flash lanserades den 2 september 2026, och förskjutningen inom Googles egen flash-nivå är den mer användbara jämförelsen för alla som planerar en pipeline för 2027.
På samma index mäter Gemini 3.8 Flash 40,93 mot 39,06 för 3,7-linjen – en ökning på 1,87 punkter på tre veckor. Terminal Bench 4.0 gick från 0,1364 till 0,1970. Tau-Bench Banking gick från 0,3278 till 0,4495. Det är exakt de rader där 3.7-modellen var sämst, vilket tyder på att efterföljaren siktade just på denna svaghet snarare än på en allmän kapacitetshöjning.
Priset rörde sig inte alls. Gemini 3.7 Flash listades till $0.75 för input och $3.75 för output per miljon tokens, och Gemini 3.8 Flash lanserades till samma $0.75 och $3.75 — samma prislista, kopplad till en modell som är två indexpoäng bättre på de rader som spelar roll för agenter.

Prislistan är där den här jämförelsen verkligen vänder.
Mot Claude Haiku 5.5 är Googles pris hela historien, och det är inte ens nära.
• Indata — Claude Haiku 5.5 $0,10 per miljon tokens upp till 100 000, $0,50 därutöver; Gemini 3.7 Flash $0,75 fast, eller sju och en halv gånger Anthropics taxa inom den första nivån.
• Utdata — 0,50 USD för Claude Haiku 5.5 inom den första nivån, 2,50 USD över den; 3,75 USD för Gemini 3.7 Flash.
• Cachad indata — 0,01 $ och 0,125 $ för Claude Haiku 5.5; 0,075 $ läsning och 0,75 $ skrivning för Gemini 3.7 Flash.
• Kontext — en miljon tokens för båda. Maximal utdata — 128 000 tokens för Claude Haiku 5.5 mot 65 536 för Gemini 3.7 Flash.
• Indatamodalitet — text och bilder för Claude Haiku 5.5; text, bilder, tal och video för Gemini 3.7 Flash. Detta förblir den enda raden där Googles specifikation är strikt längre, och den överlevde övergången till 3.8 oförändrad.
• Oberoende kostnad per slutförd Index-uppgift – $0,21 för Claude Haiku 5.5 mot $0,93 för Gemini 3.7 Flash. En 4,4× skillnad som är större än vad indataförhållandet på 7,5 till 1 skulle antyda, eftersom det är Anthropics modell som är den ordrika här: 162 164 utdatatoken per Index-uppgift mot 58 387 för Gemini 3.7 Flash. Anthropic dokumenterar också en tokeniserare som delas med Claude 4.7 och senare och som räknar ungefär 30 % fler token för samma text, vilket drar åt samma håll.
• Hastighet – 212,3 sekunder per Index-uppgift för Gemini 3.7 Flash mot 424,6 för Claude Haiku 5.5. Googles modell är den snabbare av de två med en faktor två, vilket är den enda raden i det här avsnittet där den billigare modellen inte också är den bättre.
Vad detta innebär om du väljer idag
Den praktiska tolkningen är att ingen av dessa två är rätt svar, av olika skäl.
Gemini 3.7 Flash är föråldrad, prissatt i samma nivå som sin efterträdare och sämre än den efterträdaren på just de rader som en billig produktionsmodell behöver. Att rekommendera den vore att rekommendera ett prisschema kopplat till en ersatt modell – efterträdaren kostar lika mycket och gör mer. Ingen som väljer mellan dessa två i oktober 2026 borde landa på 3.7-linjen, och det faktum att dess prisschema är oförändrat är det som avgör saken.
Claude Haiku 5.5 är den aktiva modellen, och för arbete med text in och text ut är den billigare i alla avseenden, högre på kompositmåttet och avsevärt bättre på de två rader som förutsäger agentisk framgång. Den är också den långsammare och kan inte ta emot tal eller video. Huruvida det spelar roll är en fråga om din pipeline, inte om modellerna.
Det tredje alternativet, som gapet i indexpoäng mellan 3,8 och 3,7 synliggör, är att Googles flash-nivå rör sig tillräckligt snabbt för att en tre veckor gammal jämförelse redan är historia. Betrakta varje head-to-head-jämförelse på flash-nivå som att den har en livslängd mätt i veckor, inte kvartal.
Att springa på vilken sida du än landar på
Gemini 3.8 Flash – efterträdaren, inte den utfasadе 3.7 – finns i OrcaRouters katalog till Googles listpris med 0 % påslag, så det pris Google publicerar är det pris som når din faktura, och en ändring på deras sida är live hos oss samma dag. Claude Sonnet 5.5 och Claude Opus 5.5 finns också i katalogen, vilket gör ett routningstest mellan två leverantörer till en konfiguration i stället för ett projekt: ett API för över 200 modeller, en nyckel, automatisk failover under huven, och routing-DSL:en när du hellre vill hålla eskaleringen i routen än i koden.
Gemini 3.7 Flash finns inte i vår katalog, och Claude Haiku 5.5 gör det inte heller. Båda är fortfarande nåbara via sina leverantörers egna API:er och, i Googles fall, flera tredjeparts-API:er. Det är värt att säga rakt ut i stället för att låta läsaren upptäcka det själv.

Talet som ska dras bort
Det är inte indexgapet på 4,33 punkter. Det är att Gemini 3.7 Flash vann tre av de fyra gemensamma benchmarkarna och ändå förlorade sammanvägningen med fyra punkter, eftersom den benchmark som indexet viktar tyngst var den där den fick 0,1364. En modell i flash-klassen kan ha fina naturvetenskapsresultat samtidigt som den misslyckas med det som billiga modeller köps för.
Följden är att efterträdaren åtgärdade exakt de raderna inom tre veckor, till ett oförändrat pris. Mot bakgrund av detta är konkurrenstrycket i denna nivå inte priset. Det handlar om huruvida modellen kan slutföra en flerstegsuppgift, och det rör sig nu snabbare än prislistor gör.
