
DeepSeek V4 Flash vs V4 Pro: De Efficiëntieklasse versus het Vlaggenschip, Vergeleken
- obsidianNIEUWQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 per 1 mln tokens · 24 tok/s
- qwenNIEUWQwen: Qwen3.8 27B (free)2026-08-1328 tok/s
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaNIEUWMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenNIEUWQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens · 2657 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
- grokxAI: Grok 4.52026-07-0856Intelligentie72Coderen
- tencentTencent: Hy32026-07-0642Intelligentie59Coderen
DeepSeek's V4-lijn is een ladder met twee treden: V4 Flash, het goedkope, snelle efficiëntiemodel — nu in zijn officiële -0731-release met veel sterkere agenten — en V4 Pro, het grote vlaggenschip voor het moeilijkste redeneren en coderen, dat op 12 augustus 2026 naar zijn officiële GA-build (0813) ging. Het interessante is hoe weinig ze op praktisch werk van elkaar verschillen, en hoeveel ze qua prijs verschillen. Deze gids vergelijkt de twee op capaciteit, kosten, snelheid en geschiktheid, waarbij elk cijfer van een bron is voorzien.
Nauwkeurigheidsnotitie: de agentic/coding-scores van V4 Flash zijn door DeepSeek gerapporteerd (officiële changelog, 2026-07-31, DeepSeek-harness); de GA-scores (0813) van V4 Pro zijn eveneens door DeepSeek gerapporteerd op dezelfde harness, en er is nog geen onafhankelijke evaluatie van de 0813-build gepubliceerd. De prijzen zijn actueel per 12 augustus 2026; de GA-prijsverlaging wordt op OrcaRouter doorgegeven met 0% opslag. Door leveranciers gerapporteerde harness-cijfers zijn doorgaans optimistisch — verifieer dit op je eigen taken.
TL;DR. V4 Flash is een MoE met 284B / 13B actief voor $0,08 / $0,18 per miljoen tokens; V4 Pro is het veel grotere vlaggenschip, nu in de officiële GA-build (0813) voor $0,435 / $0,87 — ongeveer vijf keer de prijs van Flash, gedaald van ruwweg veertien keer vóór de prijsverlaging van augustus. Bij praktisch coderen zit Flash binnen een paar punten van Pro (bijv. SWE-bench Verified ~79% vs ~80,6%, volgens aggregators), en de -0731 post-training upgrade maakt Flash op zichzelf een sterke agent. Gebruik Pro voor de moeilijkste redeneertaken en het meest veeleisende multi-file codeerwerk; gebruik Flash voor de grote bulk — en routeer op moeilijkheidsgraad om het grootste deel van Pro's kwaliteit te krijgen voor ongeveer een vijfde van de kosten.
Belangrijkste conclusies
• Omvang en prijs: Flash is 284B / 13B-actief voor $0,08 / $0,18; Pro is het veel grotere vlaggenschip voor $0,435 / $0,87 — Flash kost ongeveer een vijfde van de prijs, en Pro's GA-prijsverlaging verkleinde de oude ~14x kloof tot ongeveer 5x.
• De codeerkloof is klein: aggregator SWE-bench Verified ~79% (Flash) tegenover ~80,6% (Pro, preview-tijdperk; de GA-build heeft nog geen onafhankelijke scores); op DeepSeek's harness noteert GA Pro Terminal-Bench 2.1 87,9 tegenover Flash's 82,7.
• Beide delen de context van 1M tokens en een output van 384K; beide zijn tekst-only, met redenering, tools en JSON.
• Flash is sneller en goedkoper om te serveren (p50 TTFT ~394 ms, ~184 tok/s); Pro ruilt snelheid in voor piekprestaties.
• Beste werkwijze: routeer op moeilijkheidsgraad — Flash voor de bulk, Pro voor de moeilijke minderheid.
Wat elk model is
V4 Flash is de efficiëntielaag: een mixture-of-experts-model met 284B parameters in totaal, maar slechts ~13B actieve parameters, een context van 1M tokens, tot 384K output, afgestemd op hoogvolume, lage latentie en agentisch werk. Zijn officiële -0731release (31 juli 2026) is een post-training-upgrade die agents, codering en toolgebruik verbeterde, en native ondersteuning voor de Responses-API en Codex toevoegde. V4 Pro is DeepSeeks vlaggenschip — een veel groter model gebouwd voor de moeilijkste redenering en codering, waar maximale capaciteit belangrijker is dan kosten. Het draaide vanaf april als preview en ging daarna op 12 augustus 2026 naar de officiële GA-build, met een veel lagere prijs. Beide zitten in dezelfde V4-familie en delen de 1M-context, tekst-only-invoer en ondersteuning voor redenering/tools/JSON.

Capaciteit: hoe dicht ligt Flash bij Pro?
Nauwer dan het prijsverschil doet vermoeden, althans wat praktisch coderen betreft. Aggregator-evaluaties plaatsen V4 Flash (Max) rond 79,0% op SWE-bench Verified — het oplossen van echte GitHub-issues — tegenover ongeveer 80,6% voor V4 Pro zoals getest tijdens de preview-periode. De GA-build (0813) is te nieuw voor onafhankelijke scores — er zijn er nog geen gepubliceerd — dus de beste beschikbare Pro-vergelijking is DeepSeeks eigen testomgeving, waar de GA-build 87,9 op Terminal-Bench 2.1 en 62,7 op DeepSWE scoort, tegenover 82,7 en 54,4 voor Flash (-0731) (allemaal door DeepSeek gerapporteerd). Waar Pro vooroploopt, is aan het zwaarste eind: de meest complexe meerstapsredeneringen, het lastigste multi-file-coderen en taken waarbij een groter actief-parameterbudget echt helpt. Als het meeste van je werk 'moeilijk maar niet baanbrekend' is, dekt Flash het; reserveer Pro voor de werkelijk baanbrekende minderheid.
Prijs en snelheid: Flash's beslissende voorsprong
Dit is waar de twee het meest uiteenlopen — en waar de rekensom net is veranderd. Flash is $0,08 / $0,18 per miljoen input/output-tokens; de officiële GA-build (0813) van V4 Pro is $0,435 / $0,87 — ongeveer vijf keer de prijs van Flash. Dat is nog steeds een flinke meerprijs, maar een fractie van de ~14x kloof van vóór de prijsverlaging: de oudere deepseek-v4-pro-notering stond op $1.168 / $2.336, dus de GA-build is ruwweg 63% goedkoper. In een maand met 10 miljoen tokens bij 70% input kost Flash ongeveer $1,10 en Pro ongeveer $5,66 — de verhouding blijft gelijk als je opschaalt naar miljarden tokens. Flash is ook ontworpen voor throughput (p50 TTFT ~394 ms, ~184 tok/s), dus het past beter bij latentiegevoelige agents met hoge volumes. Met de meerprijs van Pro krijg je topprestaties, geen snelheid of besparingen — maar omdat de kloof nu ~5x in plaats van ~14x bedraagt, is de prijs van die headroom aan de top fors gedaald.
Het juiste patroon: routeer op moeilijkheid
Je hoeft niet te kiezen. De goedkoopste hoogwaardige opstelling stuurt het merendeel van de makkelijke tot matige verzoeken naar Flash en escaleert alleen de moeilijkste naar Pro. Omdat beide uit dezelfde familie komen met dezelfde context en interfaces, is die routing naadloos — en de -0731-upgrade betekent dat Flash nu meer van de middelste categorie afhandelt voordat je hoeft te escaleren. Goed uitgevoerd levert routeren op moeilijkheidsgraad het grootste deel van Pro's kwaliteit tegen ongeveer de kosten van Flash, en de GA-prijsverlaging maakt de incidentele escalatie naar Pro aanzienlijk goedkoper dan tijdens de preview.

Welke moet je kiezen?
Kies V4 Flash als…
U draait workloads met een hoog volume voor agentische AI, codering of lange documenten, waarbij kosten en snelheid belangrijk zijn, en 'bijna-vlaggenschip'-kwaliteit volstaat — wat na de -0731-upgrade een groot terrein bestrijkt.
Kies V4 Pro als…
Je hebt maximale capaciteit nodig voor het moeilijkste redeneren en het meest veeleisende multi-file coderen, en je bent bereid om ongeveer 5x de prijs van Flash te betalen voor die topklasse-headroom — een veel eenvoudiger opgave dan de ~14x opslag die de prijzen uit de preview-periode met zich meebrachten.
Gebruik beide via één endpoint
Beide zijn beschikbaar op OrcaRouter tegen 0% opslag via één OpenAI-compatibel eindpunt — Flash als deepseek/deepseek-v4-flash-0731 en Pro als de officiële deepseek/deepseek-v4-pro-0813 GA-build — zodat je route-op-moeilijkheid als configuratiekeuze kunt implementeren, beide kunt benchmarken op je eigen taken en verkeer kunt omschakelen zonder opnieuw te integreren. Dat is de eenvoudigste manier om de besparingen van Flash te benutten terwijl je Pro paraat houdt voor de lastige minderheid.

Veelgestelde vragen
Is V4 Flash net zo goed als V4 Pro?
Bij praktisch coderen, nagenoeg — aggregator SWE-bench Verified ~79% vs ~80.6% (preview-tijdperk voor Pro; de GA-build heeft nog geen onafhankelijke scores). Bij de moeilijkste redenering en de meest complexe code neemt Pro de leiding. Voor de meeste workloads is Flash voldoende na de -0731-upgrade.
Hoeveel goedkoper is V4 Flash?
Flash kost ongeveer een vijfde van de prijs van Pro: $0,08 / $0,18 per miljoen tokens versus GA Pro's $0,435 / $0,87. Vóór de prijsverlaging van Pro in augustus was het verschil ~14x; nu is het ongeveer 5x.
Delen ze hetzelfde contextvenster?
Ja — beide bieden een context van 1M tokens (1,048,576) en tot 384K output.
Welke is sneller?
Flash, door ontwerp — p50-tijd tot eerste token rond 394 ms en ~184 tokens/seconde, afgestemd op gebruik met hoge volumes en lage latentie.
Kan ik beide samen gebruiken?
Ja — routeer op basis van moeilijkheid via het enkele eindpunt van OrcaRouter: Flash voor het volume, Pro voor de moeilijkste taken.
Kortom
V4 Flash versus V4 Pro is efficiëntie versus piekcapaciteit. Flash geeft je het grootste deel van Pro's praktische codeervaardigheid, plus een echt sterke agent na de -0731-upgrade, tegen ongeveer een vijfde van de prijs en hogere snelheid; Pro's officiële GA-build is het vlaggenschip voor het zwaarste werk, en de prijsverlaging — naar $0,435 / $0,87, ongeveer vijf keer Flash in plaats van de oude veertien — maakt dat topsegment betaalbaarder dan ooit. De slimme zet is niet of-of — het is routeren op moeilijkheid via één endpoint zoals OrcaRouter, zodat de bulk goedkoop op Flash draait en alleen de moeilijke minderheid voor Pro betaalt.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
