Eine Titelkarte für den Vergleich zwischen Gemini 3.7 Flash und DeepSeek V4 Flash, die zwei Blitze zeigt: eine geschlossene Schließfachbox mit der Beschriftung Gemini 3.7 Flash und einem Preisschild von 0,75 $ / 3,75 $, und eine offene Box mit einem Download-Pfeil mit der Beschriftung DeepSeek V4 Flash und einem Preisschild von 0,14 $ / 0,28 $.
Guides & Insights

Gemini 3.7 Flash vs DeepSeek V4 Flash: Zwei "Flash"-Modelle, gegensätzliche Antworten auf dieselbe Frage

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die beiden am verwirrendsten benannten Modelle des Jahres 2026 heißen beide Flash, und sie könnten dieselbe Frage nicht unterschiedlicher beantworten. Gemini 3.7 Flash, veröffentlicht am 13. August 2026, ist Go​ogles geschlossenes Arbeitstier: ungefähr 340 Ausgabe-Token pro Sekunde, ein Intelligenzindex von 56 und ein Aktionspreis von 0,75 $ pro Million Eingabe-Token und 3,75 $ pro Million Ausgabe-Token. DeepSeek V4 Flash ist die Open-Weights-Hälfte der V4-Familie von Deep​Seek, die im April erschien und Ende Juli aktualisiert wurde: MIT-lizenziert, herunterladbar und über Deep​Seeks eigene API für 0,14 $ pro Million Eingabe-Token und 0,28 $ pro Million Ausgabe-Token erhältlich – etwa ein Fünftel von Go​ogles Aktionspreis für Eingaben und ein Dreizehntel des Ausgabepreises. Beide sind „Flash“-Modelle, die für schnelle und kostengünstige Arbeit mit hohem Volumen gebaut wurden. Das Wort ist der Punkt, an dem die Ähnlichkeit endet.

Die Frage, die sie unterschiedlich beantworten, ist die prägende Frage dieser Generation: Mietest du Intelligenz oder besitzt du sie? DeepSeek V4 Flash ist ein Mixture-of-Experts-Modell mit 284 Milliarden Parametern, rund 13B aktiven Parametern pro Token, einem Kontextfenster von 1M Token und einem Ausgabelimit von 384K, veröffentlicht unter einer MIT-Lizenz – die Gewichte sind ein Download von etwa 160GB, und das Update vom 31. Juli (V4-Flash-0731) hat die agentischen Fähigkeiten deutlich gestärkt. Gemini 3.7 Flash ist ein proprietäres Modell, das auf Gemini 3.6 Flash basiert, mit einem 1M-Kontext, einem Ausgabelimit von 64K, multimodaler Eingabe und keiner Möglichkeit zum Selbsthosting. Eines dieser Modelle kann luftdicht isoliert, feinabgestimmt und auf eigener Hardware betrieben werden. Das andere läuft nur dort, wo Google es laufen lässt.

The Google DeepMind model card for Gemini 3.7 Flash, showing the model's headline description as Google's workhorse model for coding and agents, its 1M-token context window and 64K output cap, and benchmark tables of its gains over Gemini 3.6 Flash.

Die beiden Flashes, Seite an Seite

Beide Modelle zielen auf denselben Käufer — hochvolumige Produktionsworkloads, die sich kein Flaggschiff pro Token leisten können —, aber sie erreichen das über gegensätzliche Architekturen. DeepSeek V4 Flashs Hybrid-Attention (komprimierte sparse plus stark komprimierte Attention) macht seinen 1M-Kontext wirtschaftlich genug, um zu diesen Preisen verkauft zu werden; es ist das Modell, auf das Deep​Seek die Legacy-Endpunkte `deepseek-chat` und `deepseek-reasoner` ausgerichtet hat, die im Juli eingestellt wurden. Gemini 3.7 Flash ist Go​ogles algorithmische Verfeinerung seiner eigenen Flash-Linie, und sein Vorteil ist der Durchsatz: unabhängige Messungen beziffern ihn auf etwa 340 Tokens/s gegenüber DeepSeek V4 Flashs etwa 113, und das erreicht es, während es Audio- und Videoeingaben verarbeitet, die DeepSeek V4 Flash nicht unterstützt.

Intelligenzindex — 56 für Gemini 3.7 Flash gegenüber 50 für DeepSeek V4 Flash, laut Artificial Analysis.

Ausgabegeschwindigkeit — ~340 Tokens/s gegenüber ~113 Tokens/s, beide laut Artificial Analysis.

Kontextfenster — 1M Token für beide; DeepSeek V4 Flash gibt bis zu 384K aus, gegenüber 64K bei Gemini 3.7 Flash.

Eingabepreis — 0,75 $ (Aktionspreis, bis 2026) gegenüber 0,14 $ auf Deep​Seeks eigener API.

Ausgabepreis — $3.75 (Sonderpreis) gegenüber $0.28.

Gewichte — proprietär versus MIT-lizenziert und herunterladbar.

A comparison scoreboard for Gemini 3.7 Flash and DeepSeek V4 Flash: Gemini 3.7 Flash leads 56 to 50 on the AA Index and ~340 to ~113 tokens per second, while DeepSeek V4 Flash leads 384K to 64K on max output, $0.14 to $0.75 on input and $0.28 to $3.75 on output, with both at 1M context and proprietary weights against MIT open weights.

Was sechs Indexpunkte tatsächlich kaufen

Der Abstand von sechs Punkten im Index ist bedeutsam, aber keine Kluft, und er liegt größtenteils in Bereichen, für die DeepSeek V4 Flash nicht optimiert wurde. Die von Gemini 3.7 Flash gemeldeten Werte für agentisches Kodieren (65,3 bei DeepSWE v1.1, 43,6 bei FrontierCode 1.1 Main, vom Anbieter gemeldet) liegen deutlich vorne, und sein Elo-Wert für Webentwicklung (1588, ebenfalls vom Anbieter gemeldet) spiegelt echte Verbesserungen bei der UI-Generierung wider. Die eigenen gemeldeten Werte von DeepSeek V4 Flash — 79,0 bei SWE-bench Verified, 91,6 bei LiveCodeBench, ein τ²-Bench-Wert von 95,0, den unabhängige Tracker bestätigen — halten bei abgegrenzten Programmieraufgaben und Tool-Nutzung gut stand, und sein 1M-Kontext-Abruf (78,7 bei MRCR, 60,5 bei CorpusQA) ist konkurrenzfähig mit allem in seiner Preisklasse. Das Muster: Gemini 3.7 Flash führt bei agentischer Tiefe und Web-Arbeit; DeepSeek V4 Flash tauscht diese gegen rohe Token-Ökonomie und eine Langkontext-Obergrenze, die kein geschlossenes Arbeitstier erreicht.

Offene Gewichte verändern die Beschaffung, nicht nur den Preis.

Die MIT-Lizenz ist der Teil dieses Vergleichs, den keine Benchmark-Tabelle erfasst. DeepSeek V4 Flash kann heruntergeladen und auf eigener Hardware ausgeführt, mit eigenen Daten feinabgestimmt und in Umgebungen verwendet werden, in denen API-Aufrufe nicht erlaubt sind – und die Lizenz enthält keine skalenabhängigen Einschränkungen, sodass sich durch Ihr Wachstum nichts an den Bedingungen ändert. Die praktischen Kosten sind betrieblicher Natur: Ein 284B-MoE-Modell mit der Geschwindigkeit zu betreiben, die ein Produktionsteam wünscht, erfordert echten GPU-Bestand, und für die meisten Teams ist die ehrliche Wahl die gehostete API. Genau hier entfaltet das Preisgefälle seine eigentliche Wirkung: Selbst der gehostete Weg ist mit 0,14 $ / 0,28 $ günstig genug, um für den Long Tail des Datenverkehrs die Standardwahl zu sein. Gemini 3.7 Flash bietet keinen der Eigentumswege – was Sie kaufen, ist ein zuverlässig verwalteter, schneller, multimodaler Dienst mit einem Aktionspreis und einer Preisklippe im Januar.

Die Volumenrechnung

Führt man denselben Tag auf beiden aus: 20 Millionen Input-Tokens und 4 Millionen Output-Tokens. Auf der eigenen API von DeepSeek V4 Flash sind das 2,80 $ + 1,12 $, also etwa 3,92 $. Bei Gemini 3.7 Flash zum Aktionspreis sind das 15 $ + 15 $, also etwa 30 $ – eine 7,6-fache Lücke, selbst während Go​ogle seinen Rabatt anbietet. Nach dem 1. Januar 2027, wenn Gemini 3.7 Flash auf 1,50 $ / 7,50 $ zurückfällt, kostet derselbe Tag etwa 58 $, das Fünfzehnfache des Deep​Seek-Werts. Der Geschwindigkeitsvorteil gleicht das bei interaktiven Workloads teilweise aus – schnellere Tokens bedeuten weniger parallele Anfragen –, aber bei Stapel- und Hintergrundarbeiten gewinnt das offene Modell die Kostenrechnung ohne jeden Zweifel. Die beiden Modelle zielen nicht einmal auf dieselbe Kostenkurve ab, und genau darum geht es.

The OrcaRouter model page for DeepSeek V4 Flash, showing the ~$0.15 per million input and ~$0.29 per million output pass-through pricing, a 1M-token context window with 384K max output, and the text-only 284B-total / 13B-active mixture-of-experts description.

Wer sollte worauf aufbauen

Wählen Sie DeepSeek V4 Flash, wenn die Kosten pro Token der begrenzende Faktor sind, wenn Sie lange Outputs von bis zu 384K benötigen, wenn Sie die Option des Self-Hostings oder eines Air-Gapped-Betriebs brauchen, oder wenn Sie etwas entwickeln, dessen Margen Token-Preise auf Flaggschiff-Niveau nicht überleben. Wählen Sie Gemini 3.7 Flash, wenn Sie Geschwindigkeit in einer interaktiven Schleife, multimodale Eingaben, Go​ogles verwaltete Zuverlässigkeit oder die von Go​ogle berichteten stärkeren Agentic-Coding-Ergebnisse benötigen — und wenn Sie sich damit wohlfühlen, dass der Aktionspreis nur vorübergehend gilt. Sie sind nicht auf dieselbe Weise Rivalen, wie zwei Flaggschiffe es sind; sie sind zwei unterschiedliche Beschaffungsstrategien, die denselben Namen tragen. Die Routing-Ebene ist der Ort, an dem die Strategien aufeinandertreffen: DeepSeek V4 Flash ist auf OrcaRouter zum Listenpreis von Deep​Seek mit 0 % Aufschlag live, und das Failover-Muster passt natürlich zu dieser Paarung — eine Regel, die den Großteil des Traffics auf V4 Flash laufen lässt und den schwierigen Anteil an ein stärkeres geschlossenes Modell eskaliert, wobei Gemini 3.7 Flash über Go​ogles eigene Gemini API auf dem anderen Zweig desselben Routers erreichbar ist.

Die ehrliche Lesart

Wenn Sie selbst hosten können oder rein kostenorientiert arbeiten, ist DeepSeek V4 Flash das bessere Modell, auf das Sie setzen sollten, und die Lizenz macht es zu einer Entscheidung, die Sie nie überdenken müssen. Wenn Sie Googles Servergeschwindigkeit, multimodale Eingabe oder den berichteten Vorteil beim agentischen Programmieren benötigen, ist Gemini 3.7 Flash der bessere Dienst, solange die Aktion läuft – die Preisverdopplung im Januar steht bereits auf dem Kalender. Zwei Modelle, ein Name, und der Markt darf sehen, welcher Philosophie der Traffic im nächsten Jahr seine Stimme gibt.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert