Een titelkaart voor de vergelijking tussen Gemini 3.7 Flash en DeepSeek V4 Flash, met twee bliksemschichten: een gesloten kluisje met het label Gemini 3.7 Flash en een prijskaartje van $0.75 / $3.75, en een open doos met een downloadpijl met het label DeepSeek V4 Flash en een prijskaartje van $0.14 / $0.28.
Guides & Insights

Gemini 3.7 Flash vs DeepSeek V4 Flash: Twee "Flash"-modellen, tegenovergestelde antwoorden op dezelfde vraag

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De twee modellen van 2026 met de meest verwarrende namen heten beide Flash, en ze konden dezelfde vraag niet verschillender beantwoorden. Gemini 3.7 Flash, uitgebracht op 13 augustus 2026, is het gesloten werkpaard van Google: ongeveer 340 outputtokens per seconde, een Intelligence Index van 56, en een promotieprijs van $0,75 per miljoen input en $3,75 per miljoen output. DeepSeek V4 Flash is de open-weights helft van DeepSeeks V4-familie, verscheen in april en werd eind juli bijgewerkt: MIT-gelicenseerd, downloadbaar, en geprijsd op $0,14 per miljoen input en $0,28 per miljoen output op DeepSeeks eigen API — ongeveer een vijfde van Google's promotieprijs voor input en een dertiende van de outputprijs. Beide zijn 'flash'-modellen, gebouwd om snel en goedkoop te zijn voor grootschalig werk. De overeenkomst houdt op bij het woord.

De vraag die zij verschillend beantwoorden, is de bepalende vraag van deze generatie: huur je intelligentie of bezit je die? DeepSeek V4 Flash is een mixture-of-experts-model met 284 miljard parameters, met ruwweg 13B actieve parameters per token, een contextvenster van 1M tokens en een uitvoerplafond van 384K, uitgebracht onder een MIT-licentie — de gewichten zijn een download van ~160GB, en de update van 31 juli (V4-Flash-0731) voegde aanzienlijk sterkere agentische mogelijkheden toe. Gemini 3.7 Flash is een propriëtair model dat voortbouwt op Gemini 3.6 Flash, met een context van 1M, een uitvoerlimiet van 64K, multimodale invoer en geen mogelijkheid om het zelf te hosten. Een van deze modellen kun je air-gapped gebruiken, finetunen en op je eigen hardware draaien. Het andere draait alleen waar Google het draait.

The Google DeepMind model card for Gemini 3.7 Flash, showing the model's headline description as Google's workhorse model for coding and agents, its 1M-token context window and 64K output cap, and benchmark tables of its gains over Gemini 3.6 Flash.

De twee Flashes, zij aan zij

Beide modellen richten zich op dezelfde koper — productieworkloads met hoge volumes die zich geen vlaggenschip per token kunnen veroorloven — maar ze komen daar via tegengestelde architecturen. DeepSeek V4 Flash's hybride attention (gecomprimeerde sparse plus sterk gecomprimeerde attention) is wat zijn 1M-context economisch genoeg maakt om tegen deze prijzen te verkopen; het is het model waar Deep​Seek de legacy-`deepseek-chat`- en `deepseek-reasoner`-endpoints op richt, dat in juli is uitgefaseerd. Gemini 3.7 Flash is Go​ogle's algoritmische verfijning van zijn eigen Flash-lijn, en zijn voordeel is de verwerkingsdoorvoer: onafhankelijke meting plaatst het op ongeveer 340 tokens/s tegenover DeepSeek V4 Flash's ongeveer 113, en het bereikt dat terwijl het audio- en video-invoer accepteert die DeepSeek V4 Flash niet accepteert.

Intelligence Index — 56 voor Gemini 3.7 Flash tegenover 50 voor DeepSeek V4 Flash, volgens Artificial Analysis.

Uitvoersnelheid — ~340 tokens/s versus ~113 tokens/s, beide volgens Artificial Analysis.

Contextvenster — 1M tokens voor beide; DeepSeek V4 Flash produceert tot 384K, tegenover de 64K van Gemini 3.7 Flash.

Invoerprijs — $0.75 (promotioneel, tot en met 2026) vergeleken met $0.14 op de eigen API van Deep​Seek.

Outputprijs — $3,75 (promotioneel) tegenover $0,28.

Gewichten — propriëtair versus MIT-gelicentieerd en downloadbaar.

A comparison scoreboard for Gemini 3.7 Flash and DeepSeek V4 Flash: Gemini 3.7 Flash leads 56 to 50 on the AA Index and ~340 to ~113 tokens per second, while DeepSeek V4 Flash leads 384K to 64K on max output, $0.14 to $0.75 on input and $0.28 to $3.75 on output, with both at 1M context and proprietary weights against MIT open weights.

Wat zes indexpunten daadwerkelijk opleveren

Het verschil van zes punten op de Index is betekenisvol maar niet onoverbrugbaar, en het zit vooral op gebieden waarvoor DeepSeek V4 Flash niet was geoptimaliseerd. De gerapporteerde cijfers voor agentische codering van Gemini 3.7 Flash (65.3 op DeepSWE v1.1, 43.6 op FrontierCode 1.1 Main, leveranciersgerapporteerd) liggen ver voor, en de Elo voor webontwikkeling (1588, eveneens leveranciersgerapporteerd) weerspiegelt echte verbeteringen in UI-generatie. De eigen gerapporteerde cijfers van DeepSeek V4 Flash — 79.0 op SWE-bench Verified, 91.6 op LiveCodeBench, een τ²-Bench-score van 95.0 die onafhankelijke trackers bevestigen — houden goed stand bij begrensde codering en toolgebruik, en de 1M-contextretrieval (78.7 op MRCR, 60.5 op CorpusQA) is concurrerend met alles in zijn prijsklasse. Het patroon: Gemini 3.7 Flash leidt op agentische diepgang en webwerk; DeepSeek V4 Flash ruilt die in voor pure tokeneconomie en een plafond voor lange context dat geen enkel gesloten werkpaard evenaart.

Open weights veranderen de inkoop, niet alleen de prijs

De MIT-licentie is het onderdeel van deze vergelijking dat geen enkele benchmarktabel vastlegt. {{1}}DeepSeek V4 Flash{{/1}} kan worden gedownload en draaien op je eigen hardware, worden gefinetuned op je eigen data, en worden gebruikt in omgevingen waar API-aanroepen niet zijn toegestaan — en de licentie kent geen schaalgebaseerde beperkingen, dus niets in je groei verandert de voorwaarden. De praktische kosten zijn operationeel: het serveren van een {{2}}284B MoE{{/2}}-model op de snelheid die een productieteam wil, vergt een echte GPU-inventaris, en voor de meeste teams is de eerlijke keuze de gehoste API. Daar doet het prijsverschil zijn echte werk: zelfs de gehoste route is tegen {{3}}$0,14{{/3}} / {{4}}$0,28{{/4}} goedkoop genoeg om de standaard te zijn voor de lange staart van het verkeer. {{5}}Gemini 3.5 Flash{{/5}} biedt geen van de eigendomsroutes — wat je koopt is een betrouwbaar beheerde, snelle, multimodale dienst met een promotioneel prijskaartje en een klif in januari.

volumerekening

Voer op beide op dezelfde dag uit: 20 miljoen input-tokens en 4 miljoen output-tokens. Op de eigen API van DeepSeek V4 Flash is dat $2,80 + $1,12, ongeveer $3,92. Op Gemini 3.7 Flash tegen het promotietarief is dat $15 + $15, ongeveer $30 — een 7,6x verschil, zelfs terwijl Go​ogle zijn korting laat lopen. Na 1 januari 2027, wanneer Gemini 3.7 Flash terugkeert naar $1,50 / $7,50, kost dezelfde dag ongeveer $58, vijftien keer het cijfer van Deep​Seek. Het snelheidsvoordeel compenseert dit gedeeltelijk bij interactieve workloads — snellere tokens betekenen minder gelijktijdige verzoeken — maar voor batch- en achtergrondwerk is het open model onbetwist goedkoper. De twee modellen mikken niet eens op dezelfde kostencurve, en dat is nu juist het punt.

The OrcaRouter model page for DeepSeek V4 Flash, showing the ~$0.15 per million input and ~$0.29 per million output pass-through pricing, a 1M-token context window with 384K max output, and the text-only 284B-total / 13B-active mixture-of-experts description.

Wie moet waarop bouwen?

Kies DeepSeek V4 Flash wanneer de kosten per token de beperkende factor zijn, wanneer je lange outputs tot 384K wilt, wanneer je de mogelijkheid tot self-hosting of een air-gapped implementatie nodig hebt, of wanneer je iets bouwt waarvan de marges niet bestand zijn tegen tokens met een vlaggenschipprijs. Kies Gemini 3.7 Flash wanneer je snelheid nodig hebt in een interactieve loop, multimodale input, Go​ogle's beheerde betrouwbaarheid, of de sterkere agentic-coding resultaten die Go​ogle rapporteert — en wanneer je je er comfortabel bij voelt dat de promotieprijs tijdelijk is. Het zijn geen rivalen op de manier waarop twee vlaggenschepen dat zijn; het zijn twee verschillende inkoopstrategieën die dezelfde naam dragen. De routeringslaag is waar de strategieën samenkomen: DeepSeek V4 Flash is live op OrcaRouter tegen Deep​Seek's lijstprijs met 0% opslag, en het failoverpatroon past natuurlijk bij deze koppeling — een regel die het grootste deel van het verkeer op V4 Flash laat draaien en de moeilijke subset escaleert naar een sterker gesloten model, waarbij Gemini 3.7 Flash bereikbaar is via Go​ogle's eigen Gemini API op de andere tak van dezelfde router.

De eerlijke lezing

Als je self-hosting kunt doen of puur kostengedreven bent, is DeepSeek V4 Flash het betere model om op voort te bouwen, en de licentie maakt het een beslissing waar je nooit op terug hoeft te komen. Als je de serving-snelheid van Go​ogle nodig hebt, multimodale invoer, of de gemelde agentic-coding-voorsprong, is Gemini 3.7 Flash de betere dienst zolang de promotie duurt — met de prijsverdubbeling in januari al op de kalender. Twee modellen, één naam, en de markt mag zien voor welke filosofie het verkeer van het komende jaar kiest.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt