En titelskylt för jämförelsen mellan Gemini 3.7 Flash och Claude Opus 5, som visar ett snabbt sprinterkort märkt Gemini 3.7 Flash med en $0.75 / $3.75-lapp, ett högt tornkort märkt Claude Opus 5 med en $5 / $25-lapp, och en liten 1/6-dels bråkikon mellan dem.
Guides & Insights

Gemini 3.7 Flash vs Claude Opus 5: Vad en arbetshäst ger dig för en sjättedel av priset

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Här är siffran som gör den här jämförelsen värd att genomföra: Claude Opus 5, Anthrop{{1}}ic{{/1}}s flaggskepp, får 61 på Artificial Analysis Intelligence Index, medan Gemini 3.7 Flash, Go{{2}}ogle{{/2}}s arbetshäst som släpptes den 13 augusti 2026, får 56. Fem poäng. Och till det kampanjpris som Go{{3}}ogle{{/3}} erbjuder fram till årsskiftet kostar Gemini 3.7 Flash 0,75 dollar per miljon inmatningstokens och 3,75 dollar per miljon utdatatokens — ungefär en sjättedel av Claude Opus 5:s $5,00 / $25,00. Klyftan som brukade skilja ”arbetshäst” från ”flaggskepp” har minskat till den punkt där den ärliga frågan inte är om den billiga modellen är bra, utan vad den dyra fortfarande gör som den billiga inte kan.

Inramningen spelar roll, eftersom detta inte är en rättvis jämförelse – att låtsas något annat skulle vilseleda dig. Claude Opus 5, släppt den 24 juli 2026, är Anthrop​ics mest kapabla allmänt tillgängliga modell: en resonemangsmodell med 1M-tokens kontext och ett 128K-tak för utdata, byggd för de svåraste ingenjörs-, forsknings- och datoranvändningsuppgifterna. Gemini 3.7 Flash är Go​ogles högvolym-arbetshäst: 1M kontext, 64K utdata, text-/bild-/ljud-/videoinmatning och en design som är raka motsatsen till Opus – strömma så många tokens som möjligt, så billigt som möjligt, för de 95 % av trafiken som är rutin. Att jämföra dem på en enda siffra är så man får fel svar; att jämföra dem på formen av arbetet man faktiskt kör är så man får ett användbart svar.

The Google DeepMind model card for Gemini 3.7 Flash, showing the model's headline description as Google's workhorse model for coding and agents, its 1M-token context window and 64K output cap, and benchmark tables of its gains over Gemini 3.6 Flash.

Fem punkter, uppackade

Intelligence Index är inte en linjär skala, och gapet mellan 56 och 61 är värt mer på vissa uppgifter än andra. Opus 5:ans 61 kommer från att leda på sammansättningens svåraste delar — dess 30.2 på ARC-AGI-3, 43.3 på FrontierBench och 79.2 på SWE-bench Pro är alla leverantörsrapporterade, men de är den typen av frontier-resonemangsresultat som ingen Flash-klassmodell rör vid. Gemini 3.7 Flash:s 56 uppnås på ett annat sätt: Googles rapporterade siffror för den (65.3 på DeepSWE v1.1, 1588 Elo på WebDev Arena, 30.4 på AutomationBench) visar en modell som är utmärkt på avgränsade, högrevolyms ingenjörs- och agentuppgifter, inte på nyskapande öppet resonemang. Fem indexpoäng beskriver därför ett verkligt kapacitetssstup, även om avståndet i rubriken ser litet ut.

• Intelligence Index — 56 för Gemini 3.7 Flash jämfört med 61 för Claude Opus 5 (max effort), enligt Artificial Analysis.

• Utmatningshastighet — ~340 tokens/s för Gemini 3.7 Flash jämfört med ~53 tokens/s för Claude Opus 5, båda enligt Artificial Analysis. En 6,4x skillnad.

• Kontextfönster — 1M tokens för båda, men Claude Opus 5:s utgångstak är 128K jämfört med Gemini 3.7 Flash:s 64K.

• Inmatningspris — 0,75 USD (kampanjpris, till och med 2026) jämfört med 5,00 USD — en skillnad på 6,7 gånger.

• Utpris — $3.75 (kampanj) jämfört med $25.00 — en 6,7x skillnad.

• Multimodal inmatning — Gemini 3.7 Flash tar emot text, bild, ljud och video; Claude Opus 5 är endast text och bild.

A comparison scoreboard for Gemini 3.7 Flash and Claude Opus 5: Claude Opus 5 leads 61 to 56 on the AA Index and 128K to 64K on max output, but Gemini 3.7 Flash leads ~340 to ~53 tokens per second, $0.75 to $5.00 input and $3.75 to $25.00 output, with both at 1M context.

Där Claude Opus 5 fortfarande är värt sitt pris

Flaggskeppets argument är inte nostalgi, det är svansen på uppgiftsfördelningen. Långsiktig autonom ingenjörsverksamhet — en modell som lämnas ensam med en kodbas i en timme för att planera, redigera, testa och iterera — är där Opus 5:s rapporterade försprång är störst, och dess datoranvändningsresultat (71 på OSWorld, leverantörsrapporterade) placerar den i en klass som Gemini 3.7 Flash inte tillhör. Team som migrerar bort från Claude Opus 4.8 bör också veta att Opus 5 levereras med adaptivt tänkande aktiverat som standard med omkalibrerade ansträngningsnivåer, och att inaktivering av tänkande är begränsad till hög ansträngning — beteendeförändringar som kan bryta befintliga pipelines. Inget av det gör den till fel val för hårt arbete; det gör den till rätt val för en smalare del av arbetet än vad priset antyder.

Det andra som Opus 5 säljer är Anthrop​ics platformsekonomi. Dess promptcachning kan minska den effektiva inmatningskostnaden med upp till 90 % vid cacheträffar, och dess batch-nivå halverar priset på asynkron trafik — så en arbetsbelastning med hög cache och hög batch på Opus 5 faktureras mycket närmare sin prislappsskugga än rubriken $5 / $25 antyder. Flaggskeppets verkliga pris är arbetsbelastningsberoende; arbetshästen är det inte.

Där Gemini 3.7 Flash är det smartare köpet

För allt som strömmar, batchar eller matas med lång kontext är arbetshästen inte bara billigare – den är strukturellt bättre placerad. En 6,4x fördel i utdatahastighet förändrar vad du kan bygga: interaktiv kodkomplettering, live-sammanfattning av ett helt repository, agentloopar som behöver många anrop per minut – alla dessa når genomströmningsväggen på en 53-token/s-modell långt innan de når kvalitetsväggen. Gemini 3.7 Flash accepterar även ljud- och videoinmatning, vilket öppnar användningsfall (mötestranskription, videobildförståelse) som ingen Claude-modell klarar på den inmatningsaxeln. Och dess justerbara tankenivå innebär att du kan köra den med låg ansträngning för billigt rutinarbete och med hög ansträngning för den svårare delmängden, och bara betala för det resonemang du använder.

Parkopplingsplaybook

Praktikerna på fältet har till stor del slutat behandla detta som ett antingen/eller, och mönstret som ständigt återkommer är en dela-och-härska-loop: Claude Opus 5 sköter planering och design, Gemini 3.7 Flash sköter implementeringen i stor volym, och Opus 5 granskar. Varje modell används där dess förhållande mellan kvalitet och kostnad är bäst, och den kombinerade pipelinen är både billigare och snabbare än att köra endera ensam. Ett routningslager gör mönstret praktiskt istället för arkitektoniskt: Claude Opus 5 är live på OrcaRouter till Anthropics listpris med 0 % påslag, och routnings-DSL:n låter dig komponera ett enda anrop som skickar planeraren till Opus 5 och exekveraren över Flash-klassmodellerna bakom en OpenAI-kompatibel endpoint — med modellfusion som nästa steg, där båda modellerna svarar på samma fråga och en domare förenar de två utslagen.

The OrcaRouter model page for Claude Opus 5, showing Anthropic's $5.00 per million input and $25.00 per million output list pricing and a 1M-token context window.

Räkningen, sida vid sida.

Sätt riktiga siffror på det. En dag med 10 miljoner inmatade tokens och 1 miljon utmatade tokens — en tung men vanlig agentisk pipeline — faktureras $75 + $375 = $450 enligt standardpriset för Claude Opus 5. Samma trafik på kampanjpriset för Gemini 3.7 Flash faktureras $7,50 + $37,50 = $45, exakt en tiondel. Även när man räknar in cache-rabatter för Opus på inmatningssidan, är skillnaden en storleksordning, och det är anledningen till att "flash for the bulk, opus for the hard tail" har blivit den normala produktionsformen snarare än en exotisk sådan. När kampanjen slutar, fördubblas inmatningspriset för Gemini 3.7 Flash till $1,50 — fortfarande en tredjedel av priset för Opus, och fortfarande billigt nog att behålla kombinationens aritmetik intakt.

Den ärliga läsningen

Det fem poäng stora gapet är verkligt och sitter precis där man skulle förvänta sig: på det svåraste, mest långsiktiga arbetet. Om din arbetsbelastning domineras av den svansen — gränsforskning, timslång autonom ingenjörskonst, datoranvändning — motiverar Claude Opus 5 sitt pris och du bör inte överanalysera det. Om din arbetsbelastning domineras av volym, latens eller långt sammanhang, är Gemini 3.7 Flash till kampanjpriset ett bättre köp med en storleksordning, och gapet till flaggskeppet är en benchmark-nivå, inte en avgrund. Modellerna konvergerar, och det praktiska svaret för de flesta team är inte längre "vilken" utan "vilka delar av arbetet som går till vilken."

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen