Hero-titelkaart met de tekst 'DeepSeek V4.1 Flash-prijzen', de regel '$0,15 invoer, $0,60 uitvoer, $0,003 cachehit', het onderschrift 'Per 1M tokens, off-peak. Tijdens piekuren verdubbelt elk tarief.', en drie kaarten met de tekst 'Cachehit: 50x goedkoper dan een miss', '1M-tokencontext' en 'Open gewichten, MIT-licentie'
Guides & Insights

Prijzen voor DeepSeek V4.1 Flash: de volledige tariefkaart, en het cachehitgetal dat je factuur bepaalt

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

DeepSeek V4.1 Flash is sinds 2026-09-10 algemeen beschikbaar, en per vandaag is de gepubliceerde tariefkaart het goedkoopste in de topklasse van de modelmarkt: $0,15 per miljoen inputtokens, $0,60 per miljoen outputtokens en $0,003 per miljoen bij cachehits. Die drie cijfers vormen de dalurenkolom. Tijdens DeepSeek's piekvensters op werkdagen verdubbelt elk van deze cijfers, inclusief cachehits. De vergelijking die ertoe doet, is niet met DeepSeek's eigen verouderende vlaggenschip — DeepSeek-V4-Pro-0813 noteert $0,66 / $1,98 per miljoen buiten de piekuren, dus Flash onderbiedt zijn eigen broertje met ongeveer 4x op input — maar met de gesloten frontier-tier waarmee kopers daadwerkelijk prijzen vergelijken: GPT-5.6 Sol, Claude Opus 5 en Gemini 3.8 Flash, die elk een orde van grootte meer per token rekenen.

Eén correctie voordat we bij de cijfers komen, want de uitgelekte informatie die aan deze lancering voorafging, circuleert nog steeds. De cijfers die vóór GA de ronde deden, beschreven een prijsverlaging die "morgen" zou ingaan. De prijzen zijn echt; de framing niet. V4.1 Flash werd op 2026-09-10 uitgebracht, met deze tarieven al van kracht, en DeepSeeks eigen changelog vermeldt de verlaging als onderdeel van de release, niet als een latere korting. Alles hieronder is vandaag, 2026-09-16, afgelezen van DeepSeeks live prijspagina.

De volledige tariefkaart, per 2026-09-16

DeepSeek publiceert één sheet met de huidige SKU's, waarbij elk regelitem is opgesplitst in een piek- en een dalurenkolom. Voor de model-id deepseek-flash, die DeepSeek-V4.1-Flash bedient, zijn de gepubliceerde tarieven:

Invoer, cachemiss — $0,15 per 1 miljoen tokens buiten de piekuren; $0,30 per 1 miljoen tijdens de piekuren

Invoer, cache-hit — $ 0,003 per 1 miljoen tokens buiten piekuren; $ 0,006 per 1 miljoen tijdens piekuren

Uitvoer — $ 0,60 per 1 miljoen tokens buiten piekuren; $ 1,20 per 1 miljoen tijdens piekuren

Contextvenster — 1M tokens, met een maximale output van 384K

Gelijktijdigheidslimiet — 2.500 gelijktijdige verzoeken op de Flash-SKU

Verouderde model-id'sdeepseek-v4-flash en deepseek-v4-flash-vision-exp zijn als afzonderlijke producten buiten gebruik gesteld, maar worden nog steeds doorgestuurd naar V4.1 Flash, gefactureerd tegen Flash-tarieven

Het verschil tussen de eerste twee regels vertelt het hele verhaal van dit werkblad. Een cache-hit kost buiten de piek 50x minder dan een cache-miss — een korting van 98%, wat ook is hoe Artificial Analysis het in zijn kostenmodel weergeeft. Niets anders op de kaart laat een rekening zo ver bewegen.

Single-column scoreboard card titled 'DeepSeek V4.1 Flash — the rate card, 2026-09-16', with rows reading 'Off-peak input: $0.15 / 1M tokens', 'Off-peak output: $0.60 / 1M tokens', 'Cache hit: $0.003 / 1M tokens', 'Peak hours: 2x every rate', 'Context window: 1M tokens' and 'Weights: MIT, open', over the footer 'All figures from DeepSeek's published API pricing page, 2026-09-16.'Screenshot of DeepSeek's own Models & Pricing page, showing the deepseek-flash and deepseek-v4-pro columns side by side under MODEL VERSION DeepSeek-V4.1-Flash and DeepSeek-V4-Pro-0813, with 1M context and 384K max output for both, Vision supported on Flash but not on V4 Pro, and the pricing block reading cache-hit input $0.003 off-peak / $0.006 peak against $0.022 / $0.044, cache-miss input $0.15 / $0.3 against $0.66 / $1.32, and output $0.6 / $1.2 against $1.98 / $3.96, above a concurrency limit row of 2500 and 500

Peak is geen afrondingsfout, en het is getimed voor Beijing

De piekvensters van DeepSeek zijn van maandag tot vrijdag, 01:00–04:00 UTC en 06:00–10:00 UTC. Alles daarbuiten — inclusief alle weekenduren — wordt tegen halftarief gefactureerd. De verdubbeling geldt voor alle drie de tarieflijnen, dus een cachemiss tijdens piekuren kost $0,30 en piekoutput kost $1,20.

Waar die vensters vallen, hangt volledig af van waar je bent. In Peking zijn ze 09:00–12:00 en 14:00–18:00 — twee werkblokken, en dat is precies het punt. In Berlijn, in september, is het tweede venster 08:00–12:00 CEST: de hele ochtend van een Europees team valt in de piek. In New York is hetzelfde venster 02:00–06:00 EDT. Een team in de VS dat normale uren draait, wordt vrijwel nooit tegen piektarief gefactureerd, en een EU-team betaalt elke ochtend voor de lunch het dubbele. Als je kiest wanneer je een batchtaak uitvoert, is dat een beslissing die $0,15 per miljoen tokens waard is, en het kost niets om die te nemen.

Wat cache-hit-pricing werkelijk doet met de rekening van een agent

Cache-hits zijn automatisch op DeepSeek — de documentatie zegt dat schijfcaching standaard is ingeschakeld voor alle gebruikers, zonder codewijziging — dus de korting is niet iets waarvoor je speciaal hoeft te ontwerpen. Het is ook best-effort, niet gegarandeerd: DeepSeek stelt dat er geen vaste TTL is, een ongebruikte cache wordt 'meestal binnen een paar uur tot een paar dagen' gewist, en het systeem belooft geen hitpercentage van 100%. Het is de moeite waard om de velden prompt_cache_hit_tokens en prompt_cache_miss_tokens van het antwoord te lezen voordat je hier iets op baseert.

De rekensom weegt zwaarder dan het adjectief. Neem een coding agent met een stabiele prefix van 40.000 tokens — systeemprompt, tool-schema's, repo-context — die 60 turns draait, waarbij elke turn ongeveer 2.000 tokens aan tool-output toevoegt en het model ongeveer 1.200 tokens produceert. De totale input over de sessie is 5,94 mln tokens en de totale output 72.000 tokens.

Gefactureerd zonder enige vorm van caching, buiten de piekuren: 5,94 mln input tegen $0,15 is $0,891, plus 72.000 output tegen $0,60 is $0,043 — ongeveer $0,93 voor de sessie.

Gefactureerd met het prefix in de cache, wat in feite standaard gebeurt: 5,782M van die invoertokens komen binnen als cache-hits tegen $0,003 ($0,017), 158.000 komen binnen als cache-misses tegen $0,15 ($0,024), en dezelfde 72.000 uitvoertokens kosten $0,043. Ongeveer $0,084 — ruwweg 11x goedkoper. Invoer daalt van 95% van de factuur naar 49% ervan, het gecachte deel alleen al is 21%, en de uitvoertokens worden de grootste afzonderlijke regel. Hetzelfde model, dezelfde sessie, dezelfde uitvoer — het enige dat is veranderd, is of het prefix werd hergebruikt.

Let op wat er niet op het overzicht van DeepSeek staat: een regelitem voor cache-write. Anthropic rekent 1,25x de basisinput om een cache van 5 minuten te vullen en 2x voor een uur; de kaart van DeepSeek vermeldt alleen hit en miss, en de cachegids beschrijft geen schrijf- of opslagkosten. Als je de caching-economie tussen leveranciers vergelijkt in plaats van naar de meest in het oog springende tokenprijzen te kijken, is die afwezigheid meer waard dan de 50x hit-korting suggereert.

Het is ook de reden waarom het pass-through-detail op DeepSeek V4.1 Flash op OrcaRouter hier van belang is. We factureren tegen het eigen lijsttarief van de provider, zonder opslag, dus een prijswijziging van een leverancier is dezelfde dag live aan onze kant in plaats van te wachten op een herprijzingsronde — en de cache-hit- en piek/dal-kolommen die u hierboven ziet, zijn de kolommen waartegen u daadwerkelijk wordt gefactureerd, geen samengestelde benadering daarvan.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model id, Vision / Tools / JSON / Reasoning tags, a 2026-09-10 release date, 1M-token context, 384K max output, text + image input, text output, $0.15 input and $0.60 output per 1M tokens, a p50 time to first token of 784 ms, a p95 of 2.95 s, 59,150.9M tokens of traffic over seven days, and body text stating OrcaRouter bills at the provider rate with zero markup added

In vergelijking met DeepSeek-V4-Pro-0813: een 4x kloof, en een uitfasering die niet plaatsvond

De voor de hand liggende interne vergelijking is de flagship-SKU, en die is minder spectaculair dan het kopcijfer doet vermoeden. DeepSeek-V4-Pro-0813, de model-id deepseek-v4-pro, staat geprijsd op $0,66 per 1M input bij een cachemisser en $1,98 per 1M output buiten de piekuren, wat tijdens de piek verdubbelt naar $1,32 en $3,96. De cachehits kosten buiten de piekuren $0,022 — meer dan 7x die van Flash.

Input bij cachemis — $0,15 versus $0,66 buiten de piekuren, dus Flash is 4,4x goedkoper

Uitvoer — $0,60 vs $1,98 buiten de piek, dus Flash is 3,3x goedkoper

Invoer bij cache-hit — $0,003 vs $0,022 buiten piekuren, dus Flash is 7,3x goedkoper

Context- en uitvoerplafond — identiek bij 1M en 384K op beide SKU's

Concurrency — 2.500 op Flash tegenover 500 op V4 Pro, een verschil van 5x dat volledig uit de prijslijst verdwijnt

Drie dingen aan deze vergelijking zijn makkelijk om fout te doen. Ten eerste is het hergebruikargument in absolute termen sterker bij het vlaggenschip, ook al heeft Flash de grotere multiplier: het cachen van een miljoen tokens bespaart $0,638 op V4 Pro en $0,147 op Flash, omdat de miss-rate van het vlaggenschip sowieso veel hoger is. Ten tweede is het model waarvan iedereen verwachtte dat het weg zou zijn, dat niet: DeepSeek kondigde aan dat het op 2026-09-14 zou stoppen met het bedienen van V4 Pro en die verzoeken naar Flash zou routeren, kreeg kritiek van ontwikkelaars omdat het een backend-model onder productieworkflows vandaan wisselde, en draaide de beslissing op 2026-09-11 terug. V4 Pro wordt nog steeds bediend, tegen ongewijzigde facturering. Ten derde, en dit is de valkuil waar de lekverslaggeving in liep — er is geen uitgebrachte V4.1 Pro. DeepSeek-V4-Pro-0813 blijft de flagship-SKU, en de leverancier heeft geen opvolger onder die naam uitgebracht. Iedereen die een migratie naar "V4.1 Pro" prijst, prijst een model dat niet bestaat.

Vs. de gesloten frontier-tier

Tegenover de gesloten modellen die kopers daadwerkelijk op hun shortlist zetten, is de multiplier het belangrijkste gegeven. Alle onderstaande cijfers komen van de eigen, vandaag gepubliceerde prijspagina van elke leverancier.

GPT-5.6 Sol — staat in de prijslijst voor $5,00 per 1 mln. input en $30,00 per 1 mln. output op de short-context-tier van OpenAI, momenteel met een promotietarief van $4,00 / $20,00 waarvan OpenAI zegt dat het ten minste tot en met 2026-11-21 beschikbaar is, met gecachte input tegen $0,40. Ten opzichte van het promotietarief is DeepSeek V4.1 Flash 26,7x goedkoper bij input en 33,3x bij output; ten opzichte van de lijstprijs 33x en 50x. Een cache-hit van Sol kost 133x wat die van Flash kost.

Claude Opus 5 — $5,00 per 1M input en $25,00 per 1M output, met cache-hits tegen $0,50 per 1M op Anthropics gepubliceerde prijslijst. Dat is 33x het inputtarief van Flash, 42x het outputtarief en 167x het cache-hittarief. De 5-minuten-cache-writes van Anthropic voegen daar nog eens 1,25x bovenop toe; DeepSeeks prijslijst heeft geen equivalente regel.

Gemini 3.8 Flash — $0,75 per 1 miljoen invoer en $3,75 per 1 miljoen uitvoer tot en met 31-12-2026, waarbij beide tarieven op 01-01-2027 zullen verdubbelen, gecachte invoer tegen $0,075, en — dit is de regel die op een echte factuur terugkomt — cache opslag tegen $0,50 per 1 miljoen tokens per uur. Flash is 5x goedkoper op invoer, 6,25x op uitvoer en 25x op cachehits in vergelijking daarmee, en DeepSeek rekent niets voor het aanhouden van een cache.

De capaciteitscontext is wat dit eerlijk houdt. Op de Intelligence Index v4.3 van Artificial Analysis scoort DeepSeek V4.1 Flash (redenering, maximale inspanning) 40 punten en staat het 6e van 113 modellen, tegen $0,27 per indextaak en 214,4 outputtokens per seconde. Dat is een plek die echt tegen de frontier aanleunt, tegen een prijs die 26x lager ligt dan het segment waarmee het wordt vergeleken — maar dezelfde meting laat zien dat het een van de meest verbose modellen is die AA heeft getest, met 250M outputtokens gedurende de indexrun tegen een mediaan van 140M. Verboosheid verandert niets aan de prijs per token, maar wel aan de rekening. Een model dat 62% meer tokens schrijft dan de mediaan kost hier nog steeds veel minder, maar "goedkoop per token" en "goedkoop per taak" zijn verschillende beweringen, en alleen het tweede is wat je betaalt.

Is er een gratis tier?

Nee. DeepSeeks eigen prijzenpagina vermeldt geen gratis API-laag, geen gratis maandelijkse quota en geen gratis model — facturering verloopt op pay-as-you-go-basis tegen een opgewaardeerd of toegekend saldo, waarbij het toegekende saldo eerst wordt verbruikt. De chat-app voor consumenten is gratis; de API achter deepseek-flash is dat niet, en er is geen gratis endpoint voor op het platform van DeepSeek. Verschillende gateways van derden adverteren met gratis of proeftoegang tot dit model, en wij zouden ze allemaal als prototyping-oppervlakken behandelen in plaats van productiebackends, omdat die voorwaarden zonder voorafgaande kennisgeving veranderen en geen ervan de eigen tariefkaart van de leverancier bevat.

De efficiëntieclaims achter de prijs

De prijs is geen subsidie, althans niet volgens DeepSeek zelf. De modelkaart en het technisch rapport van de leverancier beschrijven V4.1 Flash als een mixture-of-experts met 552B parameters op een Causal Encoder-Decoder-layout die tijdens prefill ongeveer 8B parameters per token activeert en tijdens decode 16B — asymmetrisch van opzet, goedkoop om mee te lezen en duurder om mee te schrijven. Wat het geheugen betreft rapporteert DeepSeek een globale KV-cache van ongeveer 890 bytes per token, ongeveer een kwart van die van DeepSeek-V4-Flash, en een persistente cachevoetafdruk van ongeveer een achtste daarvan onder identieke workloads, bereikt door sliding-windowtoestand weg te gooien en bij een treffer de laatste 128 tokens opnieuw af te spelen. Dit zijn door de leverancier gerapporteerde metingen op de eigen hardware van de leverancier, en het technisch rapport claimt geen wiskundige equivalentie met volledige berekening voor het replay-pad.

Het aantal parameters is het enige cijfer in deze release dat werkelijk onzeker is, en het is de moeite waard om precies te zijn over waarom. De tekst van DeepSeek meldt 552B, en dat is de backbone — het deel dat het rekenwerk doet. Daarnaast staat Engram, een opzoektabel voor voorwaardelijk geheugen die de modelkaart op 196B parameters schat, benaderd via token-lookup in plaats van doorgerekend. Tel ze op en je komt uit in de buurt van 748B, het aantal dat een veelgelezen community-analyse op r/LocalLLaMA binnen enkele uren nadat de weights beschikbaar kwamen bepleitte, en dat het eigen bestandspaneel van de Hugging Face-repository nog hoger opvoert, richting 763B. Verslagen van community-deployments hebben het checkpoint geteld op ongeveer 510 GB verdeeld over 48 shards, native gekwantiseerd geleverd als FP8 dense weights met FP4 experts.Beschouw het totaal als betwist en het backbone-cijfer als door de leverancier opgegeven. De aantallen actieve parameters zijn degene die de snelheid bepalen; de residente weights zijn degene die beslissen of het model überhaupt start.

Zelf hosten is een echt alternatief voor deze prijs, onder MIT.

De gewichten staan op deepseek-ai/DeepSeek-V4.1-Flash onder de MIT-licentie, die commercieel gebruik, wijziging en herdistributie toestaat. Dat maakt het API-tarievenblad een keuze in plaats van een tolheffing: onder MIT weerhoudt niets in de licentie je ervan dit model zelf te draaien en te betalen voor rekenkracht in plaats van voor tokens.

Wat het niet doet, is het goedkoop maken. De checkpoint is ruwweg 510 GB aan residente gewichten vóór cache en activaties, DeepSeek vermeldt nergens in de repository een GPU-vereiste, en community-deploymentverslagen plaatsen de praktische ondergrens bij een multi-GPU-node in plaats van een workstation. Drie serving-stacks leverden op 2026-09-10 day-0-ondersteuning — vLLM, SGLang met Miles, en Cambricons op vLLM gebaseerde NeuWare-aanpassing voor zijn eigen accelerators — maar op de releasedag leverden vLLM en SGLang speciale preview-images in plaats van officiële pakketten, en llama.cpp had de ondersteuning voor de V4.1-architectuur nog niet gemerged. Zelfhosting op consumentenhardware is vandaag niet het alternatief voor de API-prijs; een gehuurde 8-GPU-node is dat wel. Als je volume groot genoeg is om dat te amortiseren, staat de licentie het toe; zo niet, dan is $0,15 per miljoen tokens het goedkopere antwoord, en dat is niet eens close.

Wat de tariefkaart je eigenlijk vraagt te beslissen

Drie dingen, in volgorde van hoeveel geld ze in beweging brengen. Houd een stabiele promptprefix aan en laat de cache zijn werk doen — die is automatisch, het is een korting van 50x, en in een agent-loop van 60 beurten verandert die een sessie van $0,93 in een van $0,084. Draai je batchverkeer buiten 01:00–04:00 en 06:00–10:00 UTC op weekdagen, wat voor een Amerikaans team geen verschil maakt en voor een Europees team betekent dat de ochtendtaak naar de middag verschuift. En als je dit afzet tegen het eigen flagship van DeepSeek, onthoud dat het flagship nog in de aanbieding is — de geplande uitfasering werd geannuleerd op 2026-09-11, beide SKU's bevinden zich achter één sleutel, en de overstap tussen beide is een wijziging van model-id in plaats van een migratie.

Wat de tariefkaart je niet vertelt, is of het model goed genoeg is voor jouw workload, en de cijfers daarvoor zijn nieuwer en magerder dan de prijslijst. De positie op de Artificial Analysis-index is één enkele meting bij maximale redeneerinspanning, de benchmarkregels van de leverancier zijn door de leverancier opgegeven, en het aantal parameters staat ter discussie. De prijs is het vastgestelde deel van deze release. Baseer de prijs van je migratie daarop, en test de capaciteiten voordat je je eraan vastlegt.

Vergeleken in dit artikel4

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt