
DeepSeek V4 Flash Officiële Release: Het goedkope, snelle, agentische 1M-contextmodel, uitgelegd
- qwenNIEUWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens · 224 tok/s
- orcaNIEUWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNIEUWAnthropic: Claude Opus 52026-07-2461Intelligentie78Coderen
- googleNIEUWGoogle: Gemini 3.6 Flash2026-07-2150Intelligentie69Coderen
- googleNIEUWGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1651Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1557Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligentie77Coderen
- grokxAI: Grok 4.52026-07-0854Intelligentie72Coderen
- tencentTencent: Hy32026-07-0641Intelligentie59Coderen
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligentie42Coderen
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligentie39Coderen
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligentie72Coderen
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligentie52Coderen57Wiskunde
- z-aiZ.ai: GLM 5.22026-06-1651Intelligentie69Coderen60Wiskunde
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligentie61Coderen61Wiskunde
- anthropicAnthropic: Claude Fable 52026-06-0960Intelligentie77Coderen
- qwenQwen: Qwen3.7 Plus2026-06-0139Intelligentie56Coderen59Wiskunde
DeepSeek's efficiëntiemodel, V4 Flash, is van preview overgegaan naar een officiële openbare bètarelease — de code>-0731/code>-build werd op 31 juli 2026 uitgebracht. De architectuur is niet veranderd (het is nog steeds een mixture-of-experts-model met 284 miljard parameters en een context van 1 miljoen tokens), maar een extra ronde post-training heeft de agentische, codeer- en toolaanroepmogelijkheden aanzienlijk verbeterd, en het ondersteunt nu native de Responses API met specifieke aanpassingen voor Codex-achtige agents. Deze gids legt uit wat V4 Flash is, wat de officiële release daadwerkelijk heeft verbeterd, hoe de (door DeepSeek gerapporteerde) benchmarks eruitzien, wat het kost en hoe je het gebruikt — elk cijfer voorzien van bron.
Nauwkeurigheidsnotitie: de releasegegevens en benchmarkscores hieronder zijn afkomstig van DeepSeek's officiële API-wijzigingslog (gedateerd 2026-07-31); architectuur, context en prijzen zijn gekruist gecontroleerd met de modellenpagina van OrcaRouter; de Artificial Analysis-composieten zijn onafhankelijk. Door DeepSeek gerapporteerde benchmarks gebruiken hun eigen harness-instellingen — behandel ze als leverancierscijfers en voer je eigen evaluaties uit. Specificaties en prijzen veranderen; verifieer voordat je bouwt.
TL;DR. V4 Flash is het kostenefficiënte broertje van de gigant DeepSeek V4 Pro: een 284B / 13B-actieve MoE met een context van 1M tokens en tot 384K output, afgestemd op hoogvolume, laag-latentie, agentisch werk. De officiële release van 31 juli is een post-training-upgrade —zelfde omvang, aanzienlijk betere agents en code— die ook native ondersteuning voor de Responses-API en Codex toevoegt. DeepSeek rapporteert sterke agentische/codeerscores (bijv. Terminal-Bench 2.1 82.7, Toolathlon 70.3) en het kost ongeveer $0,15 / $0,29 per miljoen input/output-tokens, ruwweg een derde van de prijs van V4 Pro. Alleen de Flash API is geüpgraded; V4 Pro en de DeepSeek-app/-website zijn ongewijzigd. Op OrcaRouter krijg je het met 0% opslag via één OpenAI-compatibel endpoint.
Belangrijkste conclusies
Officiële release (build -0731, 31 juli 2026): een post-training upgrade van de preview — dezelfde architectuur, veel sterkere agents, codering en toolgebruik.
• Architectuur ongewijzigd: 284B totaal / 13B actief (MoE), 1M-token context (1.048.576), tot 384K output, tekst-only input, met reasoning, tools en JSON.
• Nieuw: native ondersteuning voor de Responses API plus specifieke Codex-aanpassing; blijft OpenAI ChatCompletions en Anthropic-stijl interfaces ondersteunen. Model-id code>deepseek-v4-flash/code>.
Door DeepSeek gerapporteerde agentische/coderingswinsten: Terminal-Bench 2.1 82.7, Toolathlon (geverifieerd) 70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7.
• Zeer goedkoop: ongeveer $0.15 / $0.29 per 1M invoer-/uitvoertokens met ~$0.02 cache reads (OrcaRouter, 0% markup) — ruwweg een derde van V4 Pro's $0.44 / $0.88. Alleen de Flash API is veranderd; Pro en app/web zijn hetzelfde.
Wat de officiële release daadwerkelijk heeft geüpgraded
V4 Flash verscheen voor het eerst als preview op 24 april 2026. De officiële release van 31 juli 2026 (de code>-0731/code> build, volgens het API-wijzigingslogboek van DeepSeek) is nadrukkelijk geen nieuwe architectuur: de totale en actieve parameters (284B / 13B) en de 1M-context zijn ongewijzigd. Wat er is veranderd, is de post-training — extra fine-tuning waarvan DeepSeek zegt dat het de kernmogelijkheden voor AI-agenten, coderen en het aanroepen van tools aanzienlijk heeft verbeterd. Twee praktische toevoegingen zijn belangrijk: V4 Flash biedt nu native ondersteuning voor de Responses API en is specifiek aangepast voor Codex-achtige codeeragenten, terwijl het nog steeds compatibel is met OpenAI ChatCompletions en Anthropic-achtige interfaces. Belangrijk is dat alleen de Flash API in deze release is geüpgraded; V4 Pro en de DeepSeek-app en web-ervaringen zijn ongewijzigd. Voor teams betekent dat een direct inzetbare verbetering voor workloads voor agenten tegen dezelfde prijs, zonder migratie.

Architectuur: een klein-actieve MoE gebouwd voor doorvoer.
V4 Flash is een mixture-of-experts-model met ruwweg 284 miljard parameters in totaal, maar slechts ongeveer 13 miljard actief per token. Dat lage aantal actieve parameters is precies de bedoeling: het houdt inferentie snel en goedkoop, terwijl een grote expertpool de kwaliteit bewaart. Het contextvenster is een volwaardige 1,048,576 tokens (ongeveer 1M), met een zeer grote maximale output van 384K, en het model ondersteunt redeneren (uitgebreid denken), tool calling en gestructureerde JSON. Invoer is alleen tekst. Het ontwerpdoel — hoog volume, lage latentie, agentisch werk — komt naar voren in de servingcijfers: een p50 time-to-first-token van ongeveer 394 milliseconden en een output van ongeveer 184 tokens per seconde volgens OrcaRouter's metingen.
Benchmarks: wat de officiële cijfers zeggen
De officiële release leunt zwaar op agentische en code-evaluaties, uitgevoerd met DeepSeek's eigen harness (minimal-mode / max-effort instellingen). Hier lees je hoe je de kernresultaten moet interpreteren, allemaal door DeepSeek gerapporteerd:
• Terminal-Bench 2.1: 82.7 — agentische commandoregel-/softwaretaken in een echte terminal. Een hoge score hier duidt op een model dat daadwerkelijk tools en shells kan aansturen, en niet alleen vragen kan beantwoorden.
• Toolathlon (geverifieerd): 70.3 en Automation Bench (openbaar): 25.1 — breedte en betrouwbaarheid van toolgebruik en end-to-end automatisering. De betrouwbaarheid van tool-aanroepen is de doorslaggevende eigenschap voor agents.
• Cybergym: 76.7 — security/CTF-stijl agentisch probleemoplossen.
• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — software-engineering en full-stack coderen, van generatie op repository-niveau tot moeilijke data-science-taken. Het sterke DSBench-FullStack-resultaat (68.7) wijst op praktische, multi-file codeervaardigheid.
• Agent Last Exam: 25.2 — een opzettelijk moeilijke agentische redeneerproef waarbij zelfs toonaangevende modellen laag scoren; nuttig als relatief signaal, niet als absoluut.
Voor onafhankelijke context: Artificial Analysis (geëvalueerd op 2026-06-25, preview-build) plaatste V4 Flash rond {{1}}56.2 AA Coding{{/1}}, {{2}}40.3 AA Intelligence{{/2}} en {{3}}50.0 AA Math{{/3}} — een op coderen gerichte generalist boven de mediaan van open modellen. De officiële post-trainingboost is rechtstreeks gericht op de agentic/coding-as, dus verwacht dat de nieuwere build sterker aanvoelt op precies die taken. Zoals altijd zijn vendor-harness-cijfers optimistisch; valideer op je eigen workloads.
Prijszetting: het getal dat budgetten verandert.
Op OrcaRouter, dat providerprijzen met 0% opslag doorberekent, kost V4 Flash ongeveer $0,15 per miljoen inputtokens en $0,29 per miljoen outputtokens, met cachereads rond $0,02 — en DeepSeek hield de prijzen in deze release laag (geen verhoging voor de upgrade). Dat is ruwweg een derde van de $0,44 / $0,88 van DeepSeek V4 Pro. Concreet: 10 miljoen tokens per maand met een 70% input / 30% output-verdeling kost op V4 Flash in de orde van een paar dollar; schaal je op naar een miljard tokens, dan wordt het verschil met een vlaggenschip een kostenpost die de financiële afdeling opvalt. Promptcaching verlaagt dat verder voor agents en chat met een stabiele systeemprompt, omdat gecachte input wordt gefactureerd tegen ruwweg een tiende van verse input. Goedkopere agentische capaciteit tegen dezelfde lage prijs is de hele pitch van deze release.
Waar V4 Flash past: de DeepSeek V4-ladder
DeepSeek's V4-lijn is een ladder. V4 Pro is het vlaggenschip — een veel groter redeneer- en codeermodel van topniveau. V4 Flash is de efficiëntielaag: veel minder actieve rekenkracht, een fractie van de prijs, en, na deze post-training-upgrade, echt sterke agentische en codeervaardigheden. Het feit dat DeepSeek investeerde om van Flash een betere agentte maken (Responses API, Codex-adaptatie, tool-use-benchmarks) vertelt je waar het verwacht dat het zwaartepunt zal liggen: de dagelijkse stroom van agentische en codeertaken op Flash, de moeilijkste redeneertaken voorbehouden aan Pro. Dat weerspiegelt het patroon van de hele industrie — goedkope standaard plus premium-vlaggenschip — en daarom verslaat routering op moeilijkheidsgraad het standaard kiezen van het grootste model.

Drie realistische scenario's
1. Codeeragenten en Codex-stijl workflows
De native Responses-API- en Codex-ondersteuning van de -0731-build, plus de scores op Terminal-Bench (82,7) en DSBench-FullStack (68,7), maken V4 Flash tot een sterke, goedkope engine voor autonome codeeragenten — bugfixing, refactoring, testgeneratie en meerstaps-toolgebruik.
2. Grootschalige toolgebruikende agenten
Snelle eerste tokens (~394 ms), hoge doorvoer (~184 tok/s), een 1M-context en sterke Toolathlon (70.3)-betrouwbaarheid passen bij productie-agents die op schaal tools aanroepen — retrieval, automatisering, orchestratie.
3. Lange documenten verwerken met een beperkt budget
De volledige 1M-token context en 384K output verwerken het samenvatten, analyseren of transformeren van zeer grote invoer — logs, codebases, lange rapporten — in één enkele doorgang, goedkoop.
Hoe krijg ik toegang tot V4 Flash
Je kunt V4 Flash rechtstreeks aanroepen via de API van DeepSeek (model-id code>deepseek-v4-flash/code>; het ondersteunt de Responses API, OpenAI ChatCompletions en Anthropic-achtige interfaces), of via een vendor-neutraal endpoint. a href="https://www.orcarouter.ai/">OrcaRouter/a> biedt V4 Flash aan met 0% opslag via een enkel OpenAI-compatibel endpoint (code>deepseek/deepseek-v4-flash/code>) naast 185+ andere modellen — zodat je het op één plek kunt benchmarken tegen GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen 3.8 en Kimi K3, en elke aanvraag kunt routeren naar wat het goedkoopst is voor de taak. Omdat het OpenAI-compatibel is, is het adopteren van V4 Flash — of ervan afstappen — een configuratiewijziging, geen herintegratie.

Beperkingen en eerlijke kanttekeningen
V4 Flash is een efficiëntiemodel, geen vlaggenschip: bij de allermoeilijkste redeneertaken blijft het achter op V4 Pro en de beste westerse modellen. De invoer is alleen tekst (geen native beeldinvoer). De benchmarkscores hier zijn door DeepSeek gerapporteerd met behulp van de eigen testomgeving, dus behandel exacte getallen als indicatief en verwacht dat onafhankelijke evaluaties wat lager uitkomen. En "goedkoop per token" is niet "goedkoop per taak" als je redeneringen of agent-lussen lang laat doorlopen — beperk de redeneerinspanning en tool-iteraties bij eenvoudige aanroepen. Valideer op je eigen workload voordat je er productieverkeer op zet.
Veelgestelde vragen
Wat is DeepSeek V4 Flash?
Het efficiëntiemodel van DeepSeek in de V4-lijn: een mixture-of-experts-model met 284B / 13B actieve parameters, een context van 1M tokens, tot 384K output, afgestemd op snel, hoogvolume, agentisch en codeerwerk. De officiële release (build -0731) werd uitgebracht op 31 juli 2026.
Wat is er veranderd in de officiële release?
De architectuur is ongewijzigd; het is een post-training-upgrade die de agentische, codeer- en tool-aanroepmogelijkheden aanzienlijk verbetert en native ondersteuning voor de Responses-API met Codex-aanpassing toevoegt. Alleen de Flash-API is geüpgraded — V4 Pro en de app/web zijn hetzelfde.
Hoeveel kost V4 Flash?
Ongeveer $0,15 per miljoen invoertokens en $0,29 per miljoen uitvoertokens op OrcaRouter (0% opslag), met ~$0,02 cachelezingen — ongeveer een derde van V4 Pro's $0,44 / $0,88. De prijzen bleven laag in deze release.
Hoe goed is V4 Flash in agentische en codeertaken?
DeepSeek rapporteert sterke scores: Terminal-Bench 2.1 82.7, Toolathlon (geverifieerd) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — alle cijfers zijn afkomstig van de vendor-harness, dus verifieer op je eigen taken.
Hoe verhoudt V4 Flash zich tot V4 Pro?
Pro is veruit het grotere vlaggenschip voor de moeilijkste redenering en codering; Flash is de efficiëntielaag tegen ongeveer 1/3 van de prijs met sterke agentische/coderingscapaciteiten. Stuur moeilijke taken naar Pro, al het andere naar Flash.
Wat is het contextvenster?
Een volledige 1.048.576 tokens (ongeveer 1M), met maximaal 384K outputtokens.
Is V4 Flash multimodaal?
Nee — invoer is alleen tekst. Het ondersteunt redeneren, tool-aanroepen en JSON-uitvoer.
Werkt V4 Flash met de Responses API en Codex?
Ja — de release -0731 voegt native Responses-API-ondersteuning en specifieke Codex-aanpassing toe, naast OpenAI ChatCompletions en Anthropic-achtige interfaces.
Hoe gebruik ik V4 Flash?
Rechtstreeks via de API van DeepSeek, of via het OpenAI-compatibele endpoint van OrcaRouter met 0% opslag (code>deepseek/deepseek-v4-flash/code>), waar u ook kunt vergelijken en routeren tussen concurrerende modellen.
Kortom
De officiële release van DeepSeek V4 Flash behoudt het goedkope, snelle recept en maakt er een veel betere agent van: dezelfde 284B / 13B-actieve MoE en 1M context, maar verder getraind voor sterkere codeer- en toolvaardigheden, met native Responses-API en Codex-ondersteuning — tegen dezelfde prijs van ~$0,15 / $0,29. Het is geen vlaggenschip en het is niet multimodaal, maar voor de overgrote meerderheid van agentisch, codeer- en werk met lange documenten is het een van de beste prijs-per-token-opties in 2026. Probeer het via een OpenAI-compatibel endpoint met 0%-opslag, zoals OrcaRouter, en routeer de moeilijkste minderheid van verzoeken naar een vlaggenschip — die combinatie is qua kosten moeilijk te verslaan.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
