DeepSeek V4 Flash Officiële Release: Het goedkope, snelle, agentische 1M-contextmodel, uitgelegd
Guides & Insights

DeepSeek V4 Flash Officiële Release: Het goedkope, snelle, agentische 1M-contextmodel, uitgelegd

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

DeepSeek V4 Flash is de goedkope helft van DeepSeek's V4-ladder, en de onafhankelijke cijfers hebben het eindelijk ingehaald: op de AIME 2026-set van MathArena scoort het 95,83%, statistisch niet te onderscheiden van DeepSeek V4 Pro's 96,67%, tegen ongeveer een negende van de kosten per probleem. De officiële openbare bètaversie, -0731, werd uitgebracht op 31 juli 2026 met dezelfde architectuur als de april-preview — een mixture-of-experts-model met 284 miljard parameters, 13B actief, met een context van 1 miljoen tokens — maar met een extra ronde post-training die de agentische vaardigheden, codeervaardigheid en tool-aanroepmogelijkheden sterk verbeterde, plus native ondersteuning voor de Responses-API en specifieke aanpassingen voor Codex-achtige agents. Deze gids behandelt wat de release daadwerkelijk heeft veranderd, wat de leverancier en onafhankelijke evaluaties elk zeggen, wat het kost als je rekening houdt met hoeveel het denkt, en hoe je het aanroept.

Nauwkeurigheidsnoot: de releasegegevens en de belangrijkste agentische scores hieronder komen uit DeepSeeks officiële API-changelog (gedateerd 2026-07-31) en zijn door de leverancier gerapporteerd, uitgevoerd op DeepSeeks eigen testomgeving — behandel ze als richtinggevend en voer je eigen evaluaties uit. Onafhankelijke cijfers worden vermeld waar ze verschijnen: Artificial Analysis voor de Intelligence Index en de onderdelen daarvan, MathArena voor AIME 2026, DeepSeeks eigen prijslijst voor de prijzen. Waar iets berust op een rapport van één enkele praktijkbeoefenaar in plaats van een gepubliceerde evaluatie, zegt de zin dat. Specificaties en prijzen veranderen; controleer voordat je bouwt.

TL;DR. V4 Flash is het kosten-efficiënte broertje van de gigantische DeepSeek V4 Pro: een MoE met 284B / 13B actieve parameters, een context van 1M tokens en tot 384K output, afgestemd op hoogvolume, lage latentie en agentisch werk. De officiële release van 31 juli is een post-training upgrade —zelfde omvang, aanzienlijk betere agents en code— die ook native ondersteuning voor de Responses-API en Codex toevoegt. DeepSeek rapporteert sterke agentische/coderingsscores (bijv. Terminal-Bench 2.1 82.7, Toolathlon 70.3), en Artificial Analysis heeft de -0731 build sindsdien 50 gescoord op zijn Intelligence Index: tien punten boven de april preview, zes boven de veel grotere V4 Pro, en gelijk aan Gemini 3.6 Flash. Het kost ongeveer $0,15 / $0,29 per miljoen input/output-tokens, ruwweg een derde van de prijs van V4 Pro. Alleen de Flash API is geüpgraded; V4 Pro en de DeepSeek app/web zijn ongewijzigd. Op OrcaRouter krijg je het met 0% opslag via één OpenAI-compatibel endpoint.

Belangrijkste conclusies

Officiële release (build -0731, 31 juli 2026): een post-training upgrade van de preview — dezelfde architectuur, veel sterkere agents, codering en toolgebruik.

• Architectuur ongewijzigd: 284B totaal / 13B actief (MoE), 1M-token context (1.048.576), tot 384K output, tekst-only input, met reasoning, tools en JSON.

• Nieuw: native ondersteuning voor de Responses API plus specifieke Codex-aanpassing; blijft OpenAI ChatCompletions en Anthropic-stijl interfaces ondersteunen. Model-id deepseek-v4-flash.

Door DeepSeek gerapporteerde agentische/coderingswinsten: Terminal-Bench 2.1 82.7, Toolathlon (geverifieerd) 70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7.

• Zeer goedkoop: ongeveer $0,15 / $0,29 per 1M input/output-tokens — ruwweg een derde van de $0,44 / $0,88 van V4 Pro — en DeepSeek prijst cache-hits op $0,0028 per 1M, ongeveer 98% lager dan verse input. Alleen de Flash API is veranderd; Pro en app/web zijn hetzelfde.

Wat de officiële release daadwerkelijk heeft geüpgraded

V4 Flash verscheen voor het eerst als preview op 24 april 2026. De officiële release van 31 juli 2026 (de -0731 build, volgens de API-changelog van DeepSeek) is expliciet geen nieuwe architectuur: totale en actieve parameters (284B / 13B) en de 1M-context blijven ongewijzigd. Wat er is veranderd, is de post-training — extra fine-tuning die volgens DeepSeek de kernvaardigheden voor agentische taken, het schrijven van code en het aanroepen van tools aanzienlijk heeft verbeterd. Twee praktische toevoegingen zijn van belang: V4 Flash biedt nu native ondersteuning voor de Responses API en is specifiek aangepast voor Codex-achtige codeeragenten, terwijl het nog steeds OpenAI ChatCompletions en Anthropic-achtige interfaces spreekt. Belangrijk is dat in deze release alleen de Flash API is geüpgraded; V4 Pro en de app- en webversies van DeepSeek zijn ongewijzigd. Voor teams betekent dat een direct inzetbare verbetering voor agentische workloads tegen dezelfde prijs, zonder migratie.

Architectuur: een klein-actieve MoE gebouwd voor doorvoer.

V4 Flash is een mixture-of-experts-model met ruwweg 284 miljard parameters in totaal, maar slechts ongeveer 13 miljard actief per token. Dat lage aantal actieve parameters is precies de bedoeling: het houdt inferentie snel en goedkoop, terwijl een grote expertpool de kwaliteit bewaart. Het contextvenster is een volwaardige 1,048,576 tokens (ongeveer 1M), met een zeer grote maximale output van 384K, en het model ondersteunt redeneren (uitgebreid denken), tool calling en gestructureerde JSON. Invoer is alleen tekst. Het ontwerpdoel — hoog volume, lage latentie, agentisch werk — komt naar voren in de servingcijfers: een p50 time-to-first-token van ongeveer 394 milliseconden en een output van ongeveer 184 tokens per seconde volgens OrcaRouter's metingen.

Benchmarks: wat de officiële cijfers zeggen

De officiële release leunt zwaar op agentische en code-evaluaties, uitgevoerd met DeepSeek's eigen harness (minimal-mode / max-effort instellingen). Hier lees je hoe je de kernresultaten moet interpreteren, allemaal door DeepSeek gerapporteerd:

• Terminal-Bench 2.1: 82.7 — agentische commandoregel-/softwaretaken in een echte terminal. Een hoge score hier duidt op een model dat daadwerkelijk tools en shells kan aansturen, en niet alleen vragen kan beantwoorden.

• Toolathlon (geverifieerd): 70.3 en Automation Bench (openbaar): 25.1 — breedte en betrouwbaarheid van toolgebruik en end-to-end automatisering. De betrouwbaarheid van tool-aanroepen is de doorslaggevende eigenschap voor agents.

• Cybergym: 76.7 — security/CTF-stijl agentisch probleemoplossen.

• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — software-engineering en full-stack coderen, van generatie op repository-niveau tot moeilijke data-science-taken. Het sterke DSBench-FullStack-resultaat (68.7) wijst op praktische, multi-file codeervaardigheid.

• Agent Last Exam: 25.2 — een opzettelijk moeilijke agentische redeneerproef waarbij zelfs toonaangevende modellen laag scoren; nuttig als relatief signaal, niet als absoluut.

Voor onafhankelijke context heeft Artificial Analysis nu de -0731-build zelf geëvalueerd en scoort het 50 op de Artificial Analysis Intelligence Index — tien punten boven de april-preview die het vervangt, zes punten boven de veel grotere V4 Pro, en gelijk aan Gemini 3.6 Flash. De componentresultaten: GPQA Diamond 91%, AA-LCR 66%, Humanity's Last Exam 37%, SciCode 50%, τ³-Bench Banking 31%, CritPt 17%, en een Elo van 1559 op GDPval-AA v2. Twee daarvan verdienen een tweede blik. Artificial Analysis mat Terminal-Bench 2.1 op 79% tegenover DeepSeek's gerapporteerde 82,7 — dichtbij, maar lager, wat de richting is waarin vendor-harness-nummers doorgaans de fout in gaan. En op AA-Omniscience landt het model op -16 met een hoog gemeten hallucinatiepercentage, dus het goedkope-en-agentische verhaal geldt niet voor het zonder toezicht ophalen van feiten. Dat is de scherpere manier om dit model te lezen: sterke redenering per dollar, zwakke kennis per query.

Wedstrijdwiskunde: de enige plek waar Flash gelijk is aan Pro.

De meest bruikbare onafhankelijke analyse van het redeneervermogen van V4 Flash komt van MathArena, die elk model vier keer draait op elk probleem van een pas uitgekomen competitie en het rooster per probleem publiceert. Op AIME 2026 — beide papers, 30 problemen, vier runs per stuk — scoort V4 Flash in de max-reasoning-modus 95,83% ±3,58%, tegenover 96,67% ±3,21% voor DeepSeek V4 Pro. Die intervallen overlappen bijna volledig: op deze benchmark is het kleine model niet meetbaar slechter dan het vlaggenschip. De kostencolumn is waar ze uiteenlopen. MathArena zet één V4 Flash-run op $0,009 per probleem tegenover $0,082 voor V4 Pro — ongeveer negen keer goedkoper voor dezelfde nauwkeurigheid, een sterker argument voor de efficiëntiecategorie dan wat er ook in de eigen aankondiging van DeepSeek staat.

Twee kanttekeningen horen in dezelfde adem genoemd te worden. MathArena voorziet beide DeepSeek-inzendingen van een contaminatiewaarschuwing, het label dat het gebruikt voor een model dat na de wedstrijd verscheen, dus een deel van die nauwkeurigheid kan herinnering in plaats van redenering zijn. En de versie die MathArena testte is gedateerd 2026-04-24 — de aprilpreview, niet de -0731-build. Op het moment van schrijven is er geen onafhankelijke AIME 2026-score voor de officiële release, en DeepSeeks eigen modelkaart publiceert helemaal geen wiskundebenchmark ervoor, alleen agentische.

Het raster toont ook waar het plafond ligt. Bijna elk model op het bord haalt het grootste deel van AIME 2026; het probleem dat hen scheidt is probleem 15. Slechts twee inzendingen lossen het op in alle vier runs — GPT-5.5 bij extra hoge inspanning en Claude Opus 4.8 bij max. V4 Flash scoort daar nul van de vier, en V4 Pro ook, naast GLM-5.2, Gemini 3.6 Flash, Kimi K2.6 en Claude Opus 4.7.

Dat laatste detail is wat een rapport van 5 augustus 2026 de moeite waard maakt om te signaleren. De AI-commentator @teortaxesTex postte dat de -0731-build AIME 2026-opgave 15 wél oploste, daar ongeveer 1.006 seconden over deed en ruwweg 100.000 outputtokens gebruikte, en beschreef hoe het model zichtbaar het probleem begon te bespelen voordat het de shortcut opgaf en het eerlijk uitwerkte. Dit is één enkele run van één beoefenaar, geen benchmarkresultaat: het is niet gereproduceerd, geen openbaar leaderboard heeft de -0731-build gescoord, en een losstaand transcript is geen evaluatie. Wat wél gecontroleerd kan worden is de interne consistentie, en die klopt — Artificial Analysis meet de output van dit model op ongeveer 116 tokens per seconde, en 1.006 seconden met dat tempo is ruwweg 117.000 tokens, dezelfde orde van grootte als het gerapporteerde aantal. Een antwoord van 100.000 tokens ligt ook ruim binnen wat DeepSeek verwacht, aangezien het aanbeveelt om tot 384K outputtokens toe te staan bij hoge of maximale redeneerinspanning. Beide cijfers liggen ongeveer drie keer zo hoog als de door MathArena gemeten gemiddelden voor dit model (33.588 outputtokens en 6 min 50 s per antwoord), wat je zou verwachten bij de moeilijkste opgave van de set. Dus: aannemelijk van vorm, onbevestigd in uitkomst, en als het gerepliceerd wordt is het een echte sprong vooruit ten opzichte van de preview-build, die bij die opgave vier van de vier keer faalt.

Prijszetting: het getal dat budgetten verandert.

Op OrcaRouter, die providerprijzen doorgeeft met 0% opslag, kost V4 Flash ongeveer $0,15 per miljoen invoertokens en $0,29 per miljoen uitvoertokens, en DeepSeek heeft de prijzen voor deze upgrade gelijk gehouden. Dat is ongeveer een derde van DeepSeek V4 Pro's $0,44 / $0,88. Cache-hits zijn goedkoper dan de meeste mensen aannemen: DeepSeek vermeldt gecachte invoer op $0,0028 per miljoen, ongeveer 98% lager dan verse invoer, en dat is wat agents en chat met een stabiele systeemprompt zo goedkoop maakt om draaiende te houden. In reële termen komt 10 miljoen tokens per maand met een 70% invoer / 30% uitvoer-verdeling neer op een paar dollar; schaal op naar een miljard tokens en het verschil met een vlaggenschip wordt een post die de financiële afdeling opvalt.

Bij een redeneermodel is de prijslijst echter de minst interessante helft van de rekening — wat budgetten beïnvloedt is hoeveel tokens het model kiest te besteden. Artificial Analysis had ongeveer 206 miljoen outputtokens nodig om zijn volledige Intelligence Index op V4 Flash te laten draaien, ruwweg twee keer de ~100 miljoen mediaan van de modellen die het test, en omschrijft het als snel maar zeer uitvoerig. Omgerekend kost een enkel antwoord van 100.000 tokens ongeveer drie cent, en het outputplafond van 384K begrenst één antwoord tot bijna elf cent. In absolute zin goedkoop, maar een paar honderd keer de kosten van een kort antwoord — en dat is waarom redeneerinspanning een budgethefboom is, geen kwaliteitsknop die je op maximaal laat staan. Het praktijkverslag van Simon Willison maakt hetzelfde punt vanuit de andere richting: bij de standaardinstellingen was zijn testgeneratie teleurstellend, en het verhogen van de redeneerinspanning naar hoog verbeterde dit aanzienlijk. Meet je eigen complexe verzoeken voordat je aanneemt dat het geadverteerde tarief jouw kosten zijn.

Waar V4 Flash past: de DeepSeek V4-ladder

De V4-serie van DeepSeek is een ladder. V4 Pro is het vlaggenschip — een veel groter, topklasse redeneer- en codeermodel. V4 Flash is de efficiëntiecategorie: veel minder actieve rekenkracht, een fractie van de prijs en, na deze post-training-upgrade, werkelijk sterke agentische en codeervaardigheden. Het feit dat DeepSeek investeerde in het verbeteren van Flash tot een betere agent (Responses API, Codex-adaptatie, tool-use-benchmarks) vertelt je waar het verwacht dat het volume naartoe gaat. Maar de AIME 2026-cijfers compliceren de nette versie van dat verhaal in het voordeel van Flash: bij competitiewiskunde liggen de twee modellen binnen elkaars foutmarges, dus "stuur de moeilijke problemen naar Pro" is niet automatisch juist. De eerlijke verdeling is dat Pro breedte van kennis en het zwaarste agentische werk oplevert, niet een betere kans op een moeilijk wiskundeprobleem — en daarom is routeren op basis van gemeten moeilijkheid van je eigen taken beter dan standaard kiezen voor het grootste model.

Drie realistische scenario's

1. Codeeragenten en Codex-stijl workflows

De native Responses-API- en Codex-ondersteuning van de -0731-build, plus de scores op Terminal-Bench (82,7) en DSBench-FullStack (68,7), maken V4 Flash tot een sterke, goedkope engine voor autonome codeeragenten — bugfixing, refactoring, testgeneratie en meerstaps-toolgebruik.

2. Grootschalige toolgebruikende agenten

Snelle eerste tokens (~394 ms), hoge doorvoer (~184 tok/s), een 1M-context en sterke Toolathlon (70.3)-betrouwbaarheid passen bij productie-agents die op schaal tools aanroepen — retrieval, automatisering, orchestratie.

3. Lange documenten verwerken met een beperkt budget

De volledige 1M-token context en 384K output verwerken het samenvatten, analyseren of transformeren van zeer grote invoer — logs, codebases, lange rapporten — in één enkele doorgang, goedkoop.

Hoe krijg ik toegang tot V4 Flash

{{1}}Je kunt V4 Flash rechtstreeks aanroepen via de API van DeepSeek (model-id deepseek-v4-flash; deze ondersteunt de Responses API, OpenAI ChatCompletions en interfaces in Anthropic-stijl), of via een leveranciersonafhankelijk endpoint.{{/1}} {{2}}OrcaRouter biedt V4 Flash met 0% opslag via een enkel OpenAI-compatibel endpoint (deepseek/deepseek-v4-flash) naast 200+ andere modellen aan — zodat je het kunt benchmarken tegen GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen3.8-Max en Kimi K3 op één plek, en elke aanvraag kunt routeren naar wat het goedkoopst is voor de taak.{{/2}} {{3}}Omdat prijzen zonder opslag worden doorberekend, bereikt een prijswijziging van DeepSeek je factuur op de dag dat deze ingaat.{{/3}} {{4}}En omdat de interface OpenAI-compatibel is, is V4 Flash adopteren — of er na een week van metingen weer mee stoppen — een configuratiewijziging, geen herintegratie.{{/4}}

Beperkingen en eerlijke kanttekeningen

V4 Flash is een efficiëntiemodel, geen vlaggenschip, maar de onafhankelijke data heeft die grens specifieker gemaakt dan "slechter bij moeilijke dingen". Op AIME 2026 evenaart het V4 Pro binnen de betrouwbaarheidsintervallen; waar het duidelijk achterblijft is de breedte van kennis — AA-Omniscience -16 en een hoog gemeten hallucinatiepercentage — en het meest veeleisende agentische werk. Invoer is alleen tekst, zonder native beeldinvoer. De belangrijkste agentische scores zijn door DeepSeek gerapporteerd op de eigen harness, en het enige cijfer dat een onafhankelijk lab opnieuw heeft gedraaid kwam lager uit (Artificial Analysis mat Terminal-Bench 2.1 op 79% tegen de gerapporteerde 82,7), dus behandel leverancierscijfers als richtinggevend. En "goedkoop per token" is niet "goedkoop per taak": dit model is meetbaar breedsprakig, dus beperk de redeneerinspanning en tooliteraties bij eenvoudige aanroepen in plaats van standaard maximale inspanning aan te laten staan. Valideer op je eigen workload voordat je productieverkeer erop zet.

Veelgestelde vragen

Wat is DeepSeek V4 Flash?

Het efficiëntiemodel van DeepSeek in de V4-lijn: een mixture-of-experts-model met 284B / 13B actieve parameters, een context van 1M tokens, tot 384K output, afgestemd op snel, hoogvolume, agentisch en codeerwerk. De officiële release (build -0731) werd uitgebracht op 31 juli 2026.

Wat is er veranderd in de officiële release?

De architectuur is ongewijzigd; het is een post-training-upgrade die de agentische, codeer- en tool-aanroepmogelijkheden aanzienlijk verbetert en native ondersteuning voor de Responses-API met Codex-aanpassing toevoegt. Alleen de Flash-API is geüpgraded — V4 Pro en de app/web zijn hetzelfde.

Hoeveel kost V4 Flash?

Ongeveer $0.15 per miljoen invoertokens en $0.29 per miljoen uitvoertokens op OrcaRouter (0% opslag) — ruwweg een derde van V4 Pro's $0.44 / $0.88 — met cache-hits vermeld op $0.0028 per miljoen, ongeveer 98% lager dan verse invoer. De prijzen bleven stabiel in deze release. Houd rekening met zowel het tokenvolume als het tarief: dit is een breedsprakig redeneermodel, en een antwoord van 100.000 tokens kost ongeveer drie cent.

Hoe goed is V4 Flash in agentische en codeertaken?

DeepSeek rapporteert sterke scores: Terminal-Bench 2.1 82.7, Toolathlon (geverifieerd) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — alle cijfers zijn afkomstig van de vendor-harness, dus verifieer op je eigen taken.

Is V4 Flash goed in wedstrijdwiskunde?

Beter dan de prijs doet vermoeden. Op het AIME 2026-grid van MathArena scoort de april-previewbuild 95,83% over vier runs van 30 problemen — binnen het betrouwbaarheidsinterval van V4 Pro's 96,67%, tegen ongeveer een negende van de kosten per probleem — hoewel MathArena beide modellen markeert voor mogelijke contaminatie en de -0731-build nog niet heeft gescoord. Het enige probleem dat deze build nooit oplost is probleem 15, dat alleen GPT-5.5 met extra hoge inspanning en Claude Opus 4.8 op max betrouwbaar oplossen.

Hoe verhoudt V4 Flash zich tot V4 Pro?

Pro is veruit het grotere vlaggenschip voor de moeilijkste redenering en codering; Flash is de efficiëntielaag tegen ongeveer 1/3 van de prijs met sterke agentische/coderingscapaciteiten. Stuur moeilijke taken naar Pro, al het andere naar Flash.

Wat is het contextvenster?

Een volledige 1.048.576 tokens (ongeveer 1M), met maximaal 384K outputtokens.

Is V4 Flash multimodaal?

Nee — invoer is alleen tekst. Het ondersteunt redeneren, tool-aanroepen en JSON-uitvoer.

Werkt V4 Flash met de Responses API en Codex?

Ja — de release -0731 voegt native Responses-API-ondersteuning en specifieke Codex-aanpassing toe, naast OpenAI ChatCompletions en Anthropic-achtige interfaces.

Hoe gebruik ik V4 Flash?

Rechtstreeks via de API van DeepSeek, of via het OpenAI-compatibele eindpunt van OrcaRouter met 0% opslag (deepseek/deepseek-v4-flash), waar je ook concurrerende modellen kunt vergelijken en routeren.

Kortom

De officiële release van DeepSeek V4 Flash behoudt het goedkope, snelle recept en maakt er een veel betere agent van: dezelfde 284B / 13B-actieve MoE en 1M context, nagetraind voor sterker coderen en toolgebruik, met native Responses-API en Codex-ondersteuning, voor dezelfde ~$0.15 / $0.29. De onafhankelijke cijfers ondersteunen nu het grootste deel van de pitch — Artificial Analysis plaatst de -0731 build op hetzelfde niveau als Gemini 3.6 Flash op het gebied van intelligentie, en MathArena heeft de preview build die V4 Pro evenaart op AIME 2026 voor een negende van de kosten per probleem. Wat het lage tarief niet oplevert, is breedte van kennis of een vrijbrief voor breedsprakigheid: dit model denkt met ongeveer twee keer het tokenbudget van een gemiddeld model, dus uw rekening per taak hangt meer af van de redeneerinspanning die u toestaat dan van de opgegeven prijs. Voer het uit via een 0%-opslag, OpenAI-compatibel eindpunt zoals OrcaRouter, meet wat uw eigen zware verzoeken werkelijk verbruiken, en route uitsluitend door naar een vlaggenschip waar de meting aangeeft dat het moet.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt