
Gemini 3.7 Flash vs DeepSeek V4 Flash: Twee "Flash"-modellen, tegenovergestelde antwoorden op dezelfde vraag
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
De twee modellen van 2026 met de meest verwarrende namen heten beide Flash, en ze konden dezelfde vraag niet verschillender beantwoorden. Gemini 3.7 Flash, uitgebracht op 13 augustus 2026, is het gesloten werkpaard van Google: ongeveer 340 outputtokens per seconde, een Intelligence Index van 56, en een promotieprijs van $0,75 per miljoen input en $3,75 per miljoen output. DeepSeek V4 Flash is de open-weights helft van DeepSeeks V4-familie, verscheen in april en werd eind juli bijgewerkt: MIT-gelicenseerd, downloadbaar, en geprijsd op $0,14 per miljoen input en $0,28 per miljoen output op DeepSeeks eigen API — ongeveer een vijfde van Google's promotieprijs voor input en een dertiende van de outputprijs. Beide zijn 'flash'-modellen, gebouwd om snel en goedkoop te zijn voor grootschalig werk. De overeenkomst houdt op bij het woord.
De vraag die zij verschillend beantwoorden, is de bepalende vraag van deze generatie: huur je intelligentie of bezit je die? DeepSeek V4 Flash is een mixture-of-experts-model met 284 miljard parameters, met ruwweg 13B actieve parameters per token, een contextvenster van 1M tokens en een uitvoerplafond van 384K, uitgebracht onder een MIT-licentie — de gewichten zijn een download van ~160GB, en de update van 31 juli (V4-Flash-0731) voegde aanzienlijk sterkere agentische mogelijkheden toe. Gemini 3.7 Flash is een propriëtair model dat voortbouwt op Gemini 3.6 Flash, met een context van 1M, een uitvoerlimiet van 64K, multimodale invoer en geen mogelijkheid om het zelf te hosten. Een van deze modellen kun je air-gapped gebruiken, finetunen en op je eigen hardware draaien. Het andere draait alleen waar Google het draait.

De twee Flashes, zij aan zij
Beide modellen richten zich op dezelfde koper — productieworkloads met hoge volumes die zich geen vlaggenschip per token kunnen veroorloven — maar ze komen daar via tegengestelde architecturen. DeepSeek V4 Flash's hybride attention (gecomprimeerde sparse plus sterk gecomprimeerde attention) is wat zijn 1M-context economisch genoeg maakt om tegen deze prijzen te verkopen; het is het model waar DeepSeek de legacy-`deepseek-chat`- en `deepseek-reasoner`-endpoints op richt, dat in juli is uitgefaseerd. Gemini 3.7 Flash is Google's algoritmische verfijning van zijn eigen Flash-lijn, en zijn voordeel is de verwerkingsdoorvoer: onafhankelijke meting plaatst het op ongeveer 340 tokens/s tegenover DeepSeek V4 Flash's ongeveer 113, en het bereikt dat terwijl het audio- en video-invoer accepteert die DeepSeek V4 Flash niet accepteert.
• Intelligence Index — 56 voor Gemini 3.7 Flash tegenover 50 voor DeepSeek V4 Flash, volgens Artificial Analysis.
• Uitvoersnelheid — ~340 tokens/s versus ~113 tokens/s, beide volgens Artificial Analysis.
• Contextvenster — 1M tokens voor beide; DeepSeek V4 Flash produceert tot 384K, tegenover de 64K van Gemini 3.7 Flash.
• Invoerprijs — $0.75 (promotioneel, tot en met 2026) vergeleken met $0.14 op de eigen API van DeepSeek.
• Outputprijs — $3,75 (promotioneel) tegenover $0,28.
• Gewichten — propriëtair versus MIT-gelicentieerd en downloadbaar.

Wat zes indexpunten daadwerkelijk opleveren
Het verschil van zes punten op de Index is betekenisvol maar niet onoverbrugbaar, en het zit vooral op gebieden waarvoor DeepSeek V4 Flash niet was geoptimaliseerd. De gerapporteerde cijfers voor agentische codering van Gemini 3.7 Flash (65.3 op DeepSWE v1.1, 43.6 op FrontierCode 1.1 Main, leveranciersgerapporteerd) liggen ver voor, en de Elo voor webontwikkeling (1588, eveneens leveranciersgerapporteerd) weerspiegelt echte verbeteringen in UI-generatie. De eigen gerapporteerde cijfers van DeepSeek V4 Flash — 79.0 op SWE-bench Verified, 91.6 op LiveCodeBench, een τ²-Bench-score van 95.0 die onafhankelijke trackers bevestigen — houden goed stand bij begrensde codering en toolgebruik, en de 1M-contextretrieval (78.7 op MRCR, 60.5 op CorpusQA) is concurrerend met alles in zijn prijsklasse. Het patroon: Gemini 3.7 Flash leidt op agentische diepgang en webwerk; DeepSeek V4 Flash ruilt die in voor pure tokeneconomie en een plafond voor lange context dat geen enkel gesloten werkpaard evenaart.
Open weights veranderen de inkoop, niet alleen de prijs
De MIT-licentie is het onderdeel van deze vergelijking dat geen enkele benchmarktabel vastlegt. {{1}}DeepSeek V4 Flash{{/1}} kan worden gedownload en draaien op je eigen hardware, worden gefinetuned op je eigen data, en worden gebruikt in omgevingen waar API-aanroepen niet zijn toegestaan — en de licentie kent geen schaalgebaseerde beperkingen, dus niets in je groei verandert de voorwaarden. De praktische kosten zijn operationeel: het serveren van een {{2}}284B MoE{{/2}}-model op de snelheid die een productieteam wil, vergt een echte GPU-inventaris, en voor de meeste teams is de eerlijke keuze de gehoste API. Daar doet het prijsverschil zijn echte werk: zelfs de gehoste route is tegen {{3}}$0,14{{/3}} / {{4}}$0,28{{/4}} goedkoop genoeg om de standaard te zijn voor de lange staart van het verkeer. {{5}}Gemini 3.5 Flash{{/5}} biedt geen van de eigendomsroutes — wat je koopt is een betrouwbaar beheerde, snelle, multimodale dienst met een promotioneel prijskaartje en een klif in januari.
volumerekening
Voer op beide op dezelfde dag uit: 20 miljoen input-tokens en 4 miljoen output-tokens. Op de eigen API van DeepSeek V4 Flash is dat $2,80 + $1,12, ongeveer $3,92. Op Gemini 3.7 Flash tegen het promotietarief is dat $15 + $15, ongeveer $30 — een 7,6x verschil, zelfs terwijl Google zijn korting laat lopen. Na 1 januari 2027, wanneer Gemini 3.7 Flash terugkeert naar $1,50 / $7,50, kost dezelfde dag ongeveer $58, vijftien keer het cijfer van DeepSeek. Het snelheidsvoordeel compenseert dit gedeeltelijk bij interactieve workloads — snellere tokens betekenen minder gelijktijdige verzoeken — maar voor batch- en achtergrondwerk is het open model onbetwist goedkoper. De twee modellen mikken niet eens op dezelfde kostencurve, en dat is nu juist het punt.

Wie moet waarop bouwen?
Kies DeepSeek V4 Flash wanneer de kosten per token de beperkende factor zijn, wanneer je lange outputs tot 384K wilt, wanneer je de mogelijkheid tot self-hosting of een air-gapped implementatie nodig hebt, of wanneer je iets bouwt waarvan de marges niet bestand zijn tegen tokens met een vlaggenschipprijs. Kies Gemini 3.7 Flash wanneer je snelheid nodig hebt in een interactieve loop, multimodale input, Google's beheerde betrouwbaarheid, of de sterkere agentic-coding resultaten die Google rapporteert — en wanneer je je er comfortabel bij voelt dat de promotieprijs tijdelijk is. Het zijn geen rivalen op de manier waarop twee vlaggenschepen dat zijn; het zijn twee verschillende inkoopstrategieën die dezelfde naam dragen. De routeringslaag is waar de strategieën samenkomen: DeepSeek V4 Flash is live op OrcaRouter tegen DeepSeek's lijstprijs met 0% opslag, en het failoverpatroon past natuurlijk bij deze koppeling — een regel die het grootste deel van het verkeer op V4 Flash laat draaien en de moeilijke subset escaleert naar een sterker gesloten model, waarbij Gemini 3.7 Flash bereikbaar is via Google's eigen Gemini API op de andere tak van dezelfde router.
De eerlijke lezing
Als je self-hosting kunt doen of puur kostengedreven bent, is DeepSeek V4 Flash het betere model om op voort te bouwen, en de licentie maakt het een beslissing waar je nooit op terug hoeft te komen. Als je de serving-snelheid van Google nodig hebt, multimodale invoer, of de gemelde agentic-coding-voorsprong, is Gemini 3.7 Flash de betere dienst zolang de promotie duurt — met de prijsverdubbeling in januari al op de kalender. Twee modellen, één naam, en de markt mag zien voor welke filosofie het verkeer van het komende jaar kiest.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
