
Gemini 3.7 Flash vs Claude Opus 5: Was ein Arbeitstier für ein Sechstel des Preises leistet
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 221 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Hier ist die Zahl, die diesen Vergleich lohnenswert macht: Claude Opus 5, Anthropics Flaggschiff, erreicht 61 Punkte auf dem Artificial Analysis Intelligence Index, während Gemini 3.7 Flash, Googles am 13. August 2026 veröffentlichtes Arbeitstier, auf 56 Punkte kommt. Fünf Punkte. Und zum Aktionspreis, den Google bis zum Jahresende anbietet, kostet Gemini 3.7 Flash 0,75 $ pro Million Input-Tokens und 3,75 $ pro Million Output – etwa ein Sechstel der 5,00 $ / 25,00 $ von Claude Opus 5. Die Kluft, die früher „Arbeitstier“ von „Flaggschiff“ trennte, hat sich so weit verengt, dass die ehrliche Frage nicht lautet, ob das billige Modell gut ist, sondern was das teure noch kann, was das billige nicht kann.
Der Rahmen ist entscheidend, denn dies ist kein direkter Vergleich, und so zu tun, als wäre es einer, würde Sie in die Irre führen. Claude Opus 5, veröffentlicht am 24. Juli 2026, ist Anthropics leistungsfähigstes allgemein verfügbares Modell: ein Reasoning-Modell mit 1M-Token-Kontext und einer Ausgabegrenze von 128K, entwickelt für die schwierigsten Engineering-, Forschungs- und Computer-Use-Aufgaben. Gemini 3.7 Flash ist Googles Arbeitstier für den Massenbetrieb: 1M Kontext, 64K Ausgabe, Text-/Bild-/Audio-/Video-Eingabe und eine Designvorgabe, die das Gegenteil von Opus ist — so viele Tokens wie möglich auszugeben, so kostengünstig wie möglich, für die 95 % des Datenverkehrs, die Routine sind. Ein Vergleich anhand einer einzelnen Zahl führt zu einer falschen Antwort; ein Vergleich anhand der Form der Arbeit, die Sie tatsächlich ausführen, führt zu einer nützlichen.

Fünf Punkte, aufgeschlüsselt
Der Intelligence Index ist keine lineare Skala, und der Abstand zwischen 56 und 61 wiegt bei manchen Aufgaben schwerer als bei anderen. Die 61 von Opus 5 resultiert aus der Führung bei den schwierigsten Komponenten des Index – seine 30,2 bei ARC-AGI-3, 43,3 bei FrontierBench und 79,2 bei SWE-bench Pro stammen zwar alle vom Anbieter, aber sie sind die Art von Frontier-Reasoning-Ergebnissen, an die kein Modell der Flash-Klasse heranreicht. Die 56 von Gemini 3.7 Flash wird anders erreicht: Die von Google gemeldeten Zahlen (65,3 bei DeepSWE v1.1, 1588 Elo bei WebDev Arena, 30,4 bei AutomationBench) zeigen ein Modell, das bei begrenzten, hochvolumigen Engineering- und Agentenaufgaben hervorragend ist, nicht jedoch bei neuartigem, offenem Denken. Fünf Indexpunkte beschreiben daher eine echte Fähigkeitsklippe, auch wenn der Abstand in der Schlagzeile gering wirkt.
• Intelligence Index — 56 für Gemini 3.7 Flash gegenüber 61 für Claude Opus 5 (maximale Anstrengung), laut Artificial Analysis.
• Ausgabegeschwindigkeit — etwa 340 Token/s für Gemini 3.7 Flash gegenüber etwa 53 Token/s für Claude Opus 5, beide laut Artificial Analysis. Ein 6,4-facher Unterschied.
• Kontextfenster — 1M Token für beide, aber das Ausgabelimit von Claude Opus 5 beträgt 128K gegenüber 64K bei Gemini 3.7 Flash.
• Eingabepreis — 0,75 $ (Aktionspreis, bis 2026) gegenüber 5,00 $ — eine 6,7-fache Preisdifferenz.
• Abgabepreis — 3,75 $ (Aktionspreis) gegenüber 25,00 $ — eine 6,7-fache Differenz.
• Multimodale Eingabe — Gemini 3.7 Flash verarbeitet Text, Bilder, Audio und Video; Claude Opus 5 unterstützt nur Text und Bilder.

Wo Claude Opus 5 seinen Preis immer noch wert ist
Der Fall des Flaggschiffs ist keine Nostalgie, sondern der Ausläufer der Aufgabenverteilung. Langfristig angelegtes autonomes Engineering – ein Modell, das eine Stunde lang allein mit einer Codebasis gelassen wird, um zu planen, zu bearbeiten, zu testen und zu iterieren – ist der Bereich, in dem der gemeldete Vorsprung von Opus 5 am größten ist, und seine Computer-Use-Ergebnisse (71 auf OSWorld, vom Hersteller angegeben) heben es in eine Klasse, in die Gemini 3.7 Flash nicht vordringt. Teams, die von Claude Opus 4.8 migrieren, sollten außerdem wissen, dass Opus 5 adaptives Denken standardmäßig mit neu kalibrierten Aufwandstufen aktiviert hat und dass das Deaktivieren des Denkens auf hohen Aufwand begrenzt ist – Verhaltensänderungen, die bestehende Pipelines brechen können. Nichts davon macht es zur falschen Wahl für harte Arbeit; es macht es zur richtigen Wahl für einen engeren Ausschnitt von Aufgaben, als sein Preis vermuten lässt.
Das andere, was Opus 5 verkauft, ist die Plattform-Ökonomie von Anthropic. Sein Prompt-Caching kann die effektiven Eingabekosten bei Cache-Treffern um bis zu 90 % senken, und seine Batch-Stufe halbiert den Preis für asynchronen Datenverkehr – sodass eine Workload mit hohem Cache- und Batch-Anteil auf Opus 5 viel näher am Schatten seines Listenpreises abgerechnet wird, als die Schlagzeile von 5 $ / 25 $ vermuten lässt. Der tatsächliche Preis des Flaggschiffs ist workloadabhängig; der des Arbeitstiers nicht.
Wo Gemini 3.7 Flash die klügere Wahl ist
Für alles, was streamt, in Batches läuft oder von langen Kontexten abhängt, ist das Arbeitstier nicht nur billiger, sondern strukturell besser aufgestellt. Ein 6,4-facher Vorteil bei der Ausgabegeschwindigkeit verändert, was man bauen kann: interaktive Code-Vervollständigung, Live-Zusammenfassung eines vollständigen Repositorys, Agenten-Schleifen, die viele Aufrufe pro Minute benötigen – all das stößt bei einem 53-Token/s-Modell viel früher an die Durchsatzgrenze als an die Qualitätsgrenze. Gemini 3.7 Flash akzeptiert auch Audio- und Videoeingaben, was Anwendungsfälle eröffnet (Besprechungstranskription, Verständnis von Videobildern), die kein Claude-Modell auf dieser Eingabeachse abdeckt. Und die einstellbare Denkstufe bedeutet, dass man es mit geringem Aufwand für kostengünstige Routinearbeit und mit hohem Aufwand für die anspruchsvollere Teilmenge betreiben kann und nur für die Denkleistung zahlt, die man nutzt.
Das Pairing-Playbook
Die Praktiker vor Ort sehen dies weitgehend nicht mehr als Entweder-oder, und das Muster, das immer wieder auftaucht, ist eine Teile-und-herrsche-Schleife: Claude Opus 5 übernimmt Planung und Design, Gemini 3.7 Flash die Umsetzung großer Mengen, und Opus 5 die Prüfung. Jedes Modell wird dort eingesetzt, wo sein Verhältnis von Qualität zu Kosten am besten ist, und die kombinierte Pipeline ist sowohl günstiger als auch schneller, als wenn man nur eines davon allein betreiben würde. Eine Routing-Ebene macht dieses Muster praktikabel statt nur architektonisch: Claude Opus 5 ist live auf OrcaRouter zum Listenpreis von Anthropic mit 0 % Aufschlag, und die Routing-DSL ermöglicht es, einen einzigen Aufruf zusammenzustellen, der den Planer an Opus 5 und den Ausführenden über die Flash-Klasse-Modelle hinter einem OpenAI-kompatiblen Endpunkt sendet – mit Modellfusion als weiterem Schritt, bei dem beide Modelle dieselbe Frage beantworten und ein Richter die beiden Urteile in Einklang bringt.

Die Rechnung, Seite an Seite
Nehmen wir konkrete Zahlen. Ein Tag mit 10 Millionen Input-Tokens und 1 Million Output-Tokens – eine schwere, aber gewöhnliche Agenten-Pipeline – schlägt bei Claude Opus 5 zum Standardtarif mit 75 $ + 375 $ = 450 $ zu Buche. Der gleiche Traffic kostet bei Gemini 3.7 Flash zum Aktionspreis 7,50 $ + 37,50 $ = 45 $, also exakt ein Zehntel. Selbst wenn man Opus' Cache-Rabatte auf der Input-Seite einrechnet, bleibt der Abstand eine Größenordnung – und genau das ist der Grund, warum „Flash für die Masse, Opus für den schwierigen Teil" zur Standard-Form in der Produktion geworden ist und nicht zur exotischen Ausnahme. Wenn die Aktion endet, verdoppelt sich der Input-Preis von Gemini 3.7 Flash auf 1,50 $ – immer noch ein Drittel von Opus' Preis und immer noch günstig genug, damit die Rechnung hinter der Paarung aufgeht.
Die ehrliche Lesart
Die Fünf-Punkte-Lücke ist real und sitzt genau dort, wo man sie erwarten würde: bei der härtesten Arbeit mit dem längsten Zeithorizont. Wenn Ihre Arbeitslast von diesem Ausläufer dominiert wird — Spitzenforschung, stundenlange autonome Entwicklung, Computernutzung — rechtfertigt Claude Opus 5 seinen Preis, und Sie sollten nicht zu viel darüber nachdenken. Wenn Ihre Arbeitslast von Volumen, Latenz oder langem Kontext dominiert wird, ist Gemini 3.7 Flash zum Aktionspreis um eine Größenordnung der bessere Kauf, und die Lücke zum Flaggschiff ist eine Benchmark-Stufe, keine Kluft. Die Modelle konvergieren, und die praktische Antwort für die meisten Teams lautet nicht mehr „welches“, sondern „welche Teile der Arbeit an welches Modell gehen“.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
