Hero-titelkaart met de tekst 'DeepSeek V4.1 Flash vs DeepSeek V4 Pro', met de ondertitel 'De geplande overdracht, geannuleerd op 2026-09-11', twee kaarten met de tekst 'DeepSeek V4.1 Flash — AA Index 40, $0.15 / $0.60' en 'DeepSeek V4 Pro 0813 — AA Index 36, $0.66 / $1.98', en een voettekst met de tekst 'AA Index volgens Artificial Analysis; prijzen volgens DeepSeek, off-peak, per 1M tokens.'
Guides & Insights

DeepSeek V4.1 Flash vs DeepSeek V4 Pro: de overdracht die DeepSeek plande, maar vervolgens annuleerde

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

DeepSeek V4.1 Flash is op 2026-09-10 verschenen, en DeepSeek V4 Pro zou inmiddels verdwenen moeten zijn. Het plan, twee dagen voor de Flash-release aangekondigd en op de releasedag definitief gemaakt, was dat op 2026-09-14 om 12:00 uur Beijingse tijd elk verzoek aan deepseek-v4-pro stilletjes zou worden omgeleid naar de nieuwere, goedkopere deepseek-flash en tegen Flash-tarieven in rekening zou worden gebracht. DeepSeek annuleerde dat op 2026-09-11 nadat ontwikkelaars bezwaar maakten, en op 2026-09-14 verstreek de deadline terwijl V4 Pro nog steeds actief was en de facturering ongewijzigd bleef. Dit is dus geen vergelijking van een lancering — het model links is acht dagen oud en het model rechts is een een jaar oud vlaggenschip in zijn vierde maand van algemene beschikbaarheid. Het is een vergelijking van twee modellen waarvan de maker benchmarks publiceerde waaruit bleek dat de goedkope won, en vervolgens ontdekte dat zijn gebruikers het er niet mee eens waren, en terugkrabbelde. Die volgorde is het nuttigste dat iemand deze maand over een van beide modellen heeft gepubliceerd, want het is precies de beslissing die je zelf op het punt staat te nemen.

Wat er eigenlijk is gebeurd, in volgorde

De tijdlijn is hier belangrijker dan welke individuele benchmark dan ook, want de ommekeer is het verhaal en de aankondiging was opzettelijk stil.

2026-09-09 — DeepSeek laat gebruikers weten dat V4 Pro-verzoeken, in afwachting van de komst van V4.1 Pro, worden doorgestuurd naar V4.1 Flash en gefactureerd tegen Flash-tarieven. De boodschap is dat Flash Pro op het gebied van prestaties, kosten, snelheid en tijd voor taakvoltooiing ruimschoots heeft overtroffen.

2026-09-10 — DeepSeek V4.1 Flash is algemeen beschikbaar (GA) in de app, op het web en via de API. De weights worden onder MIT op Hugging Face gepubliceerd. De API-modelnaam wordt deepseek-flash. De vorige generatie deepseek-v4-flash en deepseek-v4-flash-vision-exp worden volledig uitgefaseerd, waarbij hun legacy-ID's tijdelijk naar V4.1 Flash worden doorgestuurd. De afschakeling van Pro wordt uitgesteld naar 2026-09-14, 12:00 Pekingse tijd (04:00 UTC).

2026-09-11 — DeepSeek komt terug op zijn besluit. In reactie op de vraag van gebruikers zegt het bedrijf dat de V4 Pro API-dienst na 2026-09-14 blijft bestaan met ongewijzigde facturering, en dat de automatische overstap naar V4.1 Flash wordt geannuleerd.

2026-09-14 — de deadline verstrijkt. V4 Pro levert nog steeds tegen $0,66 / $1,98 per miljoen tokens buiten de piekuren.

De asymmetrie in die reeks is het hele artikel. Flash-gebruikers werden gemigreerd, of ze dat nu wilden of niet — het oude V4 Flash-ID antwoordt nu met een ander model. Pro-gebruikers kregen respijt, en de reden is niet dat V4 Pro betere benchmarks haalt. Het is dat productiesystemen erop waren afgestemd: prompts, agent-scaffolds, eval-harnassen en reproduceerbaarheidsaannames die een backendwissel ongeldig maakt zonder enige codewijziging aan de kant van de aanroeper. DeepSeeks vergelijkingspagina vermeldt vandaag nog steeds beide modellen, naast elkaar, wat aangeeft dat het bedrijf van plan is beide te blijven aanbieden.

Naast elkaar: de twee SKU's

Alles hieronder is DeepSeeks eigen gepubliceerde specificatie, tenzij een bron wordt vermeld. Prijzen zijn per miljoen tokens, buiten piekuren, met het piektarief tussen haakjes — DeepSeek piekt tussen 01:00 en 04:00 en opnieuw tussen 06:00 en 10:00 UTC, van maandag tot vrijdag, en alle andere uren vallen buiten de piek tegen de helft van het piektarief.

API-modelnaamdeepseek-flash (DeepSeek-V4.1-Flash) vs deepseek-v4-pro (DeepSeek-V4-Pro-0813).

Invoer, cachemiss — $0,15 ($0,30) vs. $0,66 ($1,32).

Invoer, cache-hit — $0.003 ($0.006) vs $0.022 ($0.044).

Uitvoer — $0,60 ($1,20) vs $1,98 ($3,96).

Context / maximale uitvoer — 1M tokens / 384K op beide. Identiek.

Afbeeldingsinvoer — native ondersteund op Flash; staat op V4 Pro vermeld als niet ondersteund.

Gelijktijdigheidslimiet — 2.500 op Flash tegenover 500 op V4 Pro.

Gerapporteerde parameters — Flash: 552B totaal, opgave van de leverancier, met een geloofwaardige weerlegging vanuit de community (meer daarover hieronder). V4 Pro: 1,6T totaal, ~49B actief, wat Artificial Analysis ook vermeldt en de vLLM-receptpagina bevestigt.

Actief budget per token — Flash activeert bewust ongeveer 8B bij prefill en 16B bij decode, wat precies het punt van zijn architectuur is; Pro activeert ~49B per token.

Licentie — MIT open gewichten bij beide.

GA-datum — Flash 2026-09-10; V4 Pro 0813 2026-08-13, na een preview in april.

Two-column scoreboard comparing DeepSeek V4.1 Flash and DeepSeek V4 Pro 0813 across six dimensions: AA Intelligence Index 40 vs 36, input $0.15 vs $0.66 per 1M off-peak, output $0.60 vs $1.98 per 1M off-peak, output speed 214.4 vs 94.4 tokens/s, image input supported vs not supported, and concurrency limit 2,500 vs 500, with a footer reading 'AA Intelligence Index and output speed per Artificial Analysis; prices, image input and concurrency per DeepSeek, off-peak.'

Het prijsverschil is het hele argument.

Input is 4,4× duurder op Pro. Output is 3,3×. Cache-hits — de laag die een lange agent-run met een stabiele systeemprompt domineert — zijn 7,3×. Omdat de piekprijs elke laag aan beide zijden verdubbelt, is de verhouding tijdens de piek identiek; het verschil is geen kortingsartefact.

Zet er een workload op. Neem een coding agent die per maand 10M inputtokens verwerkt met een cache-hitratio van 70% en 2M outputtokens. Op V4.1 Flash tijdens daluren is dat $0,45 aan nieuwe input, $0,021 aan gecachte input en $1,20 aan output: $1,67. Op V4 Pro tijdens daluren is dat $1,98, $0,154 en $3,96: $6,09. Ruwweg 3,6×, op een workload die bewust niets bijzonders is.

Dat is DeepSeeks eigen lijst, en het is de prijs die je daadwerkelijk betaalt hier: OrcaRouter geeft de lijsttarieven van providers door tegen 0% opslag, dus een prijswijziging van DeepSeek komt dezelfde dag bij ons binnen in plaats van te worden herverpakt. Beide modellen zitten op dezelfde sleutel, wat belangrijk is voor het gedeelte verderop — het gedeelte over het testen van een migratie die je niet langer hoeft uit te voeren.

Screenshot of DeepSeek's official Models & Pricing page showing deepseek-flash and deepseek-v4-pro side by side: vision supported for Flash and 'Not supported' for V4 Pro; cache-hit input $0.003 vs $0.022 off-peak; cache-miss input $0.15 vs $0.66; output $0.60 vs $1.98; concurrency limit 2500 vs 500; and a footnote stating that in response to user demand DeepSeek will continue providing V4 Pro API services after September 14, 2026 with billing unchanged.

Waar DeepSeek V4.1 Flash echt wint

Het sterkste bewijs voor Flash is niet de benchmarktabel van DeepSeek. Dat is Artificial Analysis, dat onafhankelijk is en rechtstreeks van de eigen modelpagina's wordt afgelezen.

Intelligence Index — Flash (Reasoning, Max Effort) scoort 40 en staat op #6 van 113 modellen. V4 Pro 0813 (Reasoning, Max Effort) scoort 36, op #7. Dezelfde index, dezelfde effort-instelling, vier punten verschil, met het goedkopere model voorop.

Uitvoersnelheid — 214,4 tokens/s tegenover 94,4 tokens/s. Dat is 2,3×, en het is gemeten, niet beweerd.

Tijd tot het eerste token — 1,21 s tegenover 1,74 s.

DeepSWE v1.1 — 74,2 voor Flash op het gevolgde leaderboard, eerste plaats, vóór GPT-6 Astra met 74,10, Claude Opus 5 met 74,00 en Gemini 3.8 Flash met 73,70. De 62,7 van V4 Pro 0813 op dezelfde benchmark is DeepSeeks eigen cijfer. De marge aan de top bedraagt 0,2 punt, wat een gelijkspel is, geen overwinning — maar een gat van 11,5 punt ten opzichte van Pro is geen gelijkspel.

Serveerefficiëntie — De decoder van Flash leidt zijn globale KV af uit de laatste verborgen toestand van de encoder in plaats van die per laag opnieuw te berekenen, wat de asymmetrische 8B-prefill / 16B-decode-activering oplevert. Het InferenceX-profiel van SemiAnalysis stelt de KV-cache op ongeveer 890 bytes per token — ongeveer een kwart van die van V4 Flash — met persistente KV-opslag tot ongeveer een achtste. Dat is de reden dat de prijs is wat hij is, en dat is ook waarom het model beschikbaar is bij een gelijktijdigheid van 2.500, terwijl Pro maximaal 500 aankan.

Vision in de geserveerde API — niet alleen in de gewichten. De eigen prijzenpagina van DeepSeek vermeldt beeldinvoer als ondersteund voor Flash en niet ondersteund voor V4 Pro, en DeepSeek beschrijft het als zijn eerste vlaggenschipmodel met native multimodaal begrip. Dit is het eerste vlaggenschipmodel van DeepSeek waarbij het lezen van een schermafbeelding geen apart endpoint nodig heeft.

Alle andere opvallende cijfers die je geciteerd zult zien — Terminal-Bench 2.1 op 90,6, GPQA Diamond op 90,9, Codeforces 3471 — zijn van DeepSeek zelf, niet door ons gereproduceerd, en moeten met dat in gedachten worden gelezen.

Waar DeepSeek V4 Pro nog steeds de juiste keuze is

Het zou gemakkelijk zijn om V4 Pro na zo'n week af te schrijven. De omgekeerde deprecatie zegt van niet, en het specificatieblad zegt dat ook.

Pro heeft 1,6T totale parameters en activeert ~49B per token, tegenover de 16B van Flash bij het decoderen. Wat de index ook zegt, de capaciteit per token is een echte resource, en de workloads waarin die tot uiting komt, zijn die met een lange horizon: agentruns van meerdere uren, grote refactors, taken waarbij een vroege verkeerde afslag het hele traject kost. Een indexverschil van vier punten meet het gemiddelde van tien evaluaties, niet de staart van je verdeling.

Pro is ook de bekende factor. Het is algemeen beschikbaar sinds 2026-08-13, na een preview in april, en de 0813-build ontleent zijn prestaties aan post-training in plaats van aan architectuur — hetzelfde aantal parameters, dezelfde vorm als de preview, ander gedrag. Dat zijn vier maanden aan communitytools, gepubliceerde agent-harnesses, promptpatronen en faalmodi. Flash is al acht dagen GA, en het ecosysteem eromheen is navenant dun. Als de betrouwbaarheid van je team voortkomt uit precies weten hoe een model faalt, is Pro waar die kennis huist.

En de dienstverlening stopte niet. De toezegging van DeepSeek is expliciet en de facturering is ongewijzigd, de gewichten zijn MIT, en V4 Pro staat nog steeds in onze catalogus tegen hetzelfde lijsttarief. De geannuleerde deprecatie is geen uitstel van executie — het is een verklaring dat DeepSeek van plan is om de tier te blijven bedienen.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro showing the model ID deepseek/deepseek-v4-pro, the description 'DeepSeek V4 Pro flagship MoE — 1.6T total / 49B active params, 1M context', 1M-token context and 384K max output, text-only input, $0.66 per 1M input tokens and $1.98 per 1M output tokens, and p50 TTFT of 5.79 seconds.

Drie dingen om beide modellen aan te rekenen

Vangrails, want het is duur als je deze beslissing verkeerd neemt.

Het aantal parameters is omstreden. 552B is het cijfer van DeepSeek. Een geloofwaardige communityanalyse stelt dat het vrijgegeven checkpoint 748B is — de 552B transformer-backbone plus de ~196B Engram-tabel voor voorwaardelijk geheugen, een opzoekstructuur die op twee punten in het netwerk wordt geraadpleegd in plaats van een laag waar het signaal doorheen stroomt. De gepubliceerde download is 510,3 GB verdeeld over 48 safetensors-shards van FP8-dense gewichten met FP4-routed experts. Beide getallen kunnen tegelijk juist zijn, afhankelijk van of je retrieval afzonderlijk van berekening meetelt. Beschouw 552B als door de leverancier gerapporteerd en controleer de schijfvoetafdruk voordat je een deployment plant.

Een score op een leaderboard is een scherm, geen contract.De 74,2 van DeepSWE v1.1 is een harness-benchmark. Een zelf gepubliceerde audit door EyesTech Systems Lab beweert dat deze Flash-klasse-scores instorten wanneer ze worden overgezet naar geïsoleerde, real-world repositories met meerdere bestanden — waardoor DeepSeek V4.1 Flash op 31,4% uitkomt op SWE-bench Pro tegenover een kopcijfer van 74,2%, een grotere daling dan de frontier-modellen in zijn eigen vergelijking. Die audit is niet onafhankelijk — de auteur verkoopt een tool voor het detecteren van precies de harness-exploitatie die hij beschrijft — en we hebben er geen replicatie van gezien. Het blijft de juiste houding: verifieer op je eigen repo's voordat je migreert.

Uitvoerigheid is een kostenpost.Artificial Analysis mat V4.1 Flash tijdens zijn Intelligence Index-run 250M outputtokens, tegen een mediaan van 140M voor vergelijkbare open-weights modellen, en noemt het zeer uitvoerig. Output is de dure richting in deze prijstabel, dus een model dat hardop nadenkt, vreet aan zijn eigen besparingen. Reken bij een reasoning-intensieve workload op tokenaantal, niet alleen op tokenprijs.

Nog één ding, duidelijk gezegd zodat niemand op een gerucht vooruitloopt: DeepSeek V4.1 Pro is niet uitgebracht. De geannuleerde migratie werd neergezet als een noodoplossing "vóór de lancering van V4.1 Pro", en daaraan is niets veranderd.

Kies DeepSeek V4.1 Flash als

• Uw werklast kent een hoog volume, is latentiegevoelig of kostengebonden — classificatie, extractie, routering, samenvatting, chat, de meeste codegeneratie.

• Je hebt beeldinvoer nodig op hetzelfde endpoint als tekst. Dit is het eerste DeepSeek-flagship waarbij dat één enkele aanroep is in plaats van een tweede model.

• Je prompts zijn cachebaar. Bij 7,3× op cachehits is de kloof het grootst precies waar agentverkeer zich bevindt, en een stabiele systeemprompt vormt het grootste deel van de input van een lange run.

• Je begint deze week met een schone lei en hebt geen harness die is afgestemd op de eigenaardigheden van een specifiek model. Er valt niets te beschermen.

• Je wilt de hogere gelijktijdigheidslimiet. 2.500 tegenover 500 is een vijfvoudig verschil in hoeveel je kunt verwerken voordat je in de wachtrij belandt.

Kies DeepSeek V4 Pro als

• Je productie is er al op afgestemd. De omslag betekent dat je tijd hebt — gebruik die om te testen in plaats van de vraag te ontwijken.

• Je taken hebben een lange horizon en falen is duur, en je hebt gemeten dat ~49B actieve parameters per token je iets opleveren dat de 16B van Flash niet biedt, op jouw data in plaats van op een leaderboard.

• Je hebt voorspelbaar, uitsluitend op tekst gebaseerd gedrag nodig zonder visiepad om te beredeneren, of je hebt evaluatie-baselines die een modelwissel midden in een onderzoek ongeldig zou maken.

• Uw toegangspatroon kenmerkt zich door een laag volume en hoge inzet, waarbij 3,6× op een kleine factuur niet de beslissende factor is.

Als je al hebt gebouwd op DeepSeek V4 Pro

Het nuttige dat op 2026-09-11 veranderde, is dat je migratie geen deadline meer was en een beslissing werd. Dat is strikt beter voor jou en strikt slechter voor je inbox, want de beslissing moet nog steeds worden genomen en nu neemt niemand hem voor je.

Begin met het berekenen van de prijs. Het verschil van 3,3–4,4× is het bedrag dat je op tafel laat liggen, en het uitgewerkte voorbeeld hierboven zet dat in ongeveer een minuut om in een maandbedrag. Test het vervolgens op de enige manier die telt: spiegel een deel van het productieverkeer naar Flash, houd Pro op het primaire pad en vergelijk de output op je eigen taken. Omdat beide modellen op dezelfde sleutel antwoorden tegen de lijstprijs van de provider, met automatische failover, is die schaduwrun een routeringswijziging in plaats van een tweede integratie, en kan de router een verzoek terug laten vallen op Pro zonder dat jij de fallback hoeft te schrijven. Teams die tokens verbranden aan een migratie waar ze niet om hebben gevraagd, zijn precies de reden dat de routeringslaag überhaupt bestaat.

Ga er niet van uit dat Flash een drop-in vervanging is. Het is een andere architectuur — een causale encoder–decoder met 40 lagen en asymmetrische activatie — en het is uitvoeriger bij het redeneren. Gedrag op promptniveau laat zich in geen van beide richtingen zonder meer overzetten, dus meet de migratie aan de hand van outputs, niet aan de hand van de index.

Wat te kijken

Drie dingen bepalen hoe deze combinatie er over een maand uitziet. Ten eerste of V4.1 Pro uitkomt en een echte Pro-laag terugbrengt — de hele geannuleerde migratie was expliciet een tussenoplossing daarvoor, dus de roadmap van DeepSeek heeft nog steeds een gat in de vorm van een vlaggenschip. Ten tweede of het respijt de volgende prijsaanpassing van DeepSeek overleeft; een bedrijf dat bereid is één keer een stille omleiding in te plannen, heeft geleerd dat het dit niet kan, niet dat het dit niet zou moeten. Ten derde of iemand buiten DeepSeek de Flash-benchmarkcijfers reproduceert op ongewijzigde repositories, het enige resultaat dat de discussie efficiëntie versus capaciteit zou beslechten waar deze hele vergelijking om draait. Tot dan is de eerlijke positie degene die de terugdraaiing zelf impliceert: Flash is de betere standaard voor alles wat nieuw is, Pro is de betere gok voor alles wat al gebouwd is, en DeepSeek heeft je net verteld dat het beide zal bedienen terwijl je uitzoekt welke van de twee je bent.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt