DeepSeek V4 Beoordeling: De goedkoopste serieuze 1M-token modellen in AI?

DeepSeek V4 Beoordeling: De goedkoopste serieuze 1M-token modellen in AI?

Auteur

Fengya Tian

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

DeepSeek bracht de V4-familie uit op 24 april 2026 — twee modellen, V4-Pro en V4-Flash, live op de API en open-source vanaf dag één — en stelde stilletjes een nieuwe norm voor wat serieuze AI-capaciteit kost. Beide modellen hebben standaard een contextvenster van 1M tokens, bieden zowel denk- als niet-denkmodi, en het vlaggenschip V4-Pro kost maximaal $0,87 per miljoen outputtokens: een prijs die onder elke vergelijkbare 1M-contextmodel op de markt duikt, zowel open als gesloten.

En juli is de beslissingsmaand. In een kennisgeving van 29 juni bevestigde DeepSeek dat de officiële versie van V4 halverwege juli 2026 uitkomt, met verbeteringen op het gebied van functies en prestaties – en de introductie van piekuurtarieven die de prijzen verdubbelen tijdens de kantooruren in Beijing. Tien dagen later, op 24 juli, worden de legacymodelnamen `deepseek-chat` en `deepseek-reasoner` definitief buiten gebruik gesteld. Deze recensie behandelt wat V4 eigenlijk is, wat het nu kost en na de officiële release, waar het wint, waar het duidelijk niet wint, en wat je moet doen vóór de deadlines.

Korte conclusie

Overweeg DeepSeek V4 als je…

- Voer productieworkloads met hoog volume uit waarbij de eenheidskosten bepalen wat haalbaar is — de prijsstelling van V4 is ongeëvenaard

- Lange context goedkoop nodig: 1M tokens standaard, tot 384K uitvoertokens per antwoord, met agressieve context-caching kortingen

- Wil drop-in integratie — de API spreekt zowel OpenAI ChatCompletions- als Anthropic-formaten, dus bestaande tools werken grotendeels gewoon.

- Waardeer open gewichten en zelf-hosting opties, vooral de kleinere V4-Flash

Wacht even (of stuur door naar elders) als je…

- Voer langetermijn autonome agents uit — op de gepubliceerde cross-model tabel van Z.ai, blijft V4-Pro ver achter bij zowel GLM-5.2 als de gesloten frontier op marathon-achtige benchmarks.

- Heeft afbeeldinginvoer nodig: V4 is alleen tekst

- Reken op vaste prijzen de klok rond — vanaf de officiële lancering medio juli 2026 verdubbelen de tarieven tijdens piekuren in Beijingse zakelijke vensters (buiten de piek blijven de huidige tarieven van kracht)

Wat is DeepSeek V4?

V4 is DeepSeek's vierde-generatie modellenfamilie, uitgebracht als twee Mixture-of-Experts-modellen. DeepSeek-V4-Pro is het vlaggenschip: 1,6 biljoen totale parameters met 49 miljard actief per token. DeepSeek-V4-Flash is de efficiëntietier: 284 miljard totaal, 13 miljard actief. Beide draaien standaard een contextvenster van 1M tokens op DeepSeek's officiële diensten, en beide bieden dubbele modi — denkmodus voor moeilijke problemen, niet-denkmodus voor snelheid — onder de model-ID's deepseek-v4-pro en `deepseek-v4-flash`.

Twee positioneringsdetails zijn van belang. Ten eerste, V4 werd gelanceerd als een preview die DeepSeek als productie-geschikt beschouwt — en volgens de aankondiging van het bedrijf van 29 juni, de officiële versie verschijnt medio juli 2026 met "feature-optimalisaties en prestatieverbeteringen." Ten tweede, het werd gelanceerd open-source, waarmee DeepSeek haar patroon van het openbaar vrijgeven van gewichten voortzet — wat zelf-hosting en fine-tuning haalbaar houdt, realistisch gezien voor de 284B Flash meer dan voor de 1.6T Pro.

Wat is er nieuw in DeepSeek V4?

Een 1M-token context als standaard, geen upsell. Elke officiële DeepSeek-service draait nu standaard met het volledige miljoen-token venster — geen aparte long-context SKU, geen premium tarief.

Enorme uitvoerhoofdruimte. Beide modellen ondersteunen tot 384K uitvoertokens per antwoord — drie keer wat de meeste concurrenten met 1M-context toestaan — wat van belang is voor codegeneratie van volledige bestanden, lange gestructureerde extracties en het schrijven van rapporten.

Dubbele modi op één eindpunt.Denkmodus voor moeilijke problemen, niet-denkmodus voor goedkope snelle gesprekken, schakelbaar per verzoek in plaats van per model.

Twee lagen met één API-vorm. Pro voor capaciteit, Flash voor volume — dezelfde context, dezelfde modi, dezelfde integratie.

Dubbele API-compatibiliteit. V4 spreekt zowel OpenAI ChatCompletions als Anthropic API formaten native, zodat de meeste bestaande agent-tooling verbinding maakt zonder herschrijving.

Prijzen: wat het werkelijk kost

Dit is het gedeelte dat V4 beroemd maakt. V4-Pro kost $0,435 per miljoen invoertokens en $0,87 per miljoen uitvoertokens. V4-Flash kost $0,14 en $0,28. Cache-hits op herhaalde context worden vermeld op ver onder een cent per miljoen tokens — effectief gratis voor agentloops die dezelfde projectstatus opnieuw lezen.

Ter referentie: GLM-5.2, zelf geprezen als de waarde-hit van de zomer, noteert $1,40 / $4,40. Claude Sonnet 5 noteert $3 / $15, Claude Opus 4.8 $5 / $25. De uitvoerprijs van V4-Pro is een vijfde van die van GLM-5.2 en ongeveer 3% van die van Opus 4.8. Zelfs als V4-Pro enkele directe kwaliteitsvergelijkingen verliest — en dat gebeurt — verandert de economie welke vragen het überhaupt waard zijn om aan een model te stellen.

Er komt één verandering met de officiële release. Volgens de kennisgeving van DeepSeek van 29 juni verdubbelen vanaf half juli alle tokenprijzen tijdens piekvensters — 09:00–12:00 en 14:00–18:00 Beijingse tijd — terwijl daluren de huidige tarieven behouden. Zelfs verdubbeld, ligt de piekuitvoerprijs van V4-Pro (ongeveer $1,74 per miljoen) nog steeds onder het standaardtarief van GLM-5.2, maar het tijdperk van vaste prijzen eindigt met de preview: als uw verkeer piekt tijdens Chinese kantooruren, modelleer dan de schommeling — of plan en route eromheen.

Beoordelingsscore

De onderstaande scores zijn onze redactionele beoordeling op basis van DeepSeek's officiële documentatie en Z.ai's gepubliceerde cross-model benchmark tabel — beschouw de cross-vendor cijfers als context van derden in plaats van DeepSeek's eigen claims.

- Coderen: 8/10 — bekwaam in alledaagse engineering; niet de open-weight leader

- Agentisch / toolgebruik: 7/10 — solide toolorkestratie, zwak op marathonlange autonomie

- Redeneren: 8/10 — sterke wiskunde- en natuurwetenschappelijke scores voor de prijsklasse

- Kostenefficiëntie: 10/10 — niets vergelijkbaars komt in de buurt

- Context en lange documenten: 9/10 — 1M in, 384K uit, bijna gratis cache hits

- Snelheid: 8/10 — magere actieve parametertellingen, plus een niet-denkende modus voor snelle paden.

Algemeen: ~8.3/10 — de prijs-prestatiekoning van midden 2026, met een asterisk voor de lange termijn.

Voordelen

- Prijzen die de curve resetten: $0,14–$0,87 per miljoen tokens voor de hele familie.

1M context standaard met 384K output — {{1}}het grootste outputplafond in zijn klasse{{/1}}

Denk- en niet-denkmodi op één endpoint, per verzoek schakelbaar.

- OpenAI en Anthropic API-compatibiliteit betekent bijna nul migratiewrijving.

- Open-source gewichten houden self-hosting en fine-tuning als optie open.

Nadelen

- Langetermijn agentisch werk is de duidelijke zwakte — in de gepubliceerde tabel van Z.ai scoort V4-Pro 29.0 op FrontierSWE, terwijl GLM-5.2 74.4 haalt en Claude Opus 4.8 75.1.

Alleen tekst: geen afbeeldingsinvoer in de V4 API

- Piekurprijzen komen met de officiële release medio juli — tarieven verdubbelen tijdens de zakelijke vensters in Beijing, dus budgetten zijn niet langer vlak

Nog een preview tot half juli, dus het gedrag kan veranderen met de officiële versie.

De pensionering van deepseek-chat en deepseek-reasoner op 24 juli 2026 dwingt legacy-gebruikers om te migreren volgens het schema van DeepSeek.

- Zelf hosten van de Pro met 1,6T parameters is voor bijna iedereen onpraktisch (Flash, met 284B, is het realistische doelwit)

Hoe DeepSeek V4 zich verhoudt

V4-Pro vs V4-Flash.Dezelfde context, dezelfde modi, dezelfde API — het verschil is kwaliteit versus doorvoer bij een 3x prijskloof. Een verstandige standaard: Flash voor samenvattingen, extractie, classificatie en chat; Pro voor code, analyse en alles wat een mens beoordeelt.

vs GLM-5.2. De open-gewicht strijd van de zomer, en het is echt nipt qua waarde. GLM-5.2 is de sterkere coder — op de gepubliceerde tabel van Z.ai leidt het V4-Pro met 81.0 tegen 64.0 op Terminal-Bench 2.1 en domineert het langetermijnwerk (74.4 versus 29.0 op FrontierSWE) — terwijl V4 terugvecht met prijzen die 3–5x lager zijn en een drievoudige outputlimiet. Volumepijplijnen neigen naar V4; codeeragents neigen naar GLM-5.2.

versus het gesloten front.Claude Opus 4.8 en GPT-5.5 blijven duidelijk sterkere modellen op moeilijke benchmarks. Maar met een output-prijsverschil van 30–60x ten opzichte van Opus 4.8, probeert V4 niet die strijd te winnen — het probeert 90% van je verkeer zo goedkoop te maken dat het niet rendabel is om het ergens anders heen te sturen.

De deadline van 24 juli: migreren van verouderde namen

Als uw integratie nog `deepseek-chat` of `deepseek-reasoner` aanroept, stoppen deze namen met werken na 24 juli 2026, 15:59 UTC. Ze worden momenteel naar V4-Flash geleid, wat betekent dat uw verkeer al draait op V4-economie — maar na de deadline mislukken verzoeken direct. De migratie zelf is één regel (`model: "deepseek-v4-pro"` of `"deepseek-v4-flash"`), dus het echte werk is het opnieuw testen van prompts tegen V4-gedrag en het per endpoint beslissen welke laag elke workload verdient — of het plaatsen van een router ervoor zodat de volgende veroudering een configuratiewijziging is in plaats van een codewijziging.

Wie zou DeepSeek V4 moeten gebruiken?

High-volume producten — ondersteuning, samenvatting, extractie, classificatie — waarbij V4 pricing marginale functies winstgevend maakt

Langdurige document- en RAG-intensieve workloads die dagelijks 1M-token vensters vullen en profiteren van vrijwel gratis cache-hits.

Teams die lange uitvoer genereren: codebases, rapporten, gestructureerde gegevens — 384K uitvoer is het klasseplafond

Kostenbewuste bouwers die een capabele standaard willen en bereid zijn de harde 10% elders te escaleren

Wie zou elders moeten kijken?

Teams waarvan de kernwerklast bestaat uit langlopende autonome agenten — GLM-5.2 of een gesloten vlaggenschip is de veiligere route.

Visie-afhankelijke workflows (V4 neemt geen afbeeldingen)

Iedereen die vandaag een contractueel 'stabiel' label nodig heeft in plaats van een preview

Is DeepSeek V4 de moeite waard?

Voor de prijs, nadrukkelijk ja — als een baan, niet als een religie. V4 verslaat niet de beste open-weight coder (GLM-5.2) of de frontier-vlaggenschepen op kwaliteit, en zijn langetermijnagentnummers zijn echt zwak. Wat het doet is enorme delen van alledaags AI-werk — de samenvattingen, extracties, concepten en chatbeurten die de echte tokenrekeningen domineren — bijna niets laten kosten. Het winnende patroon is V4 als de volumevloer, met escalatiebanen erboven.

Eindoordeel

DeepSeek V4 is de prijs-prestatiebenchmark waaraan elk ander model nu wordt afgemeten — onze score: ~8,3/10. Gebruik Flash waar volume de boventoon voert, Pro waar kwaliteit telt maar budgetten reëel zijn, en stuur het topwerk door naar een sterker model. Herbereken je kosten wanneer de piekprijzen half juli ingaan — goedkoop blijft goedkoop, maar het is niet langer vlak. En als je nog op deepseek-chat of deepseek-reasoner zit: je hebt tot 24 juli. Handel.

DeepSeek V4 gebruiken via OrcaRouter

Een driestrooksstrategie — V4 voor volume, een sterker open of gesloten model voor moeilijke taken, een fallback voor betrouwbaarheid — is precies de opstelling die pijnlijk is om handmatig uit te voeren en triviaal achter een gateway. OrcaRouter bedient DeepSeek V4 naast GLM-5.2, Claude, GPT, Gemini en 200+ andere modellen via één OpenAI-compatibel endpoint, tegen de lijstprijzen van de aanbieder zonder tokenopslag: slimme routering kiest per verzoek de juiste baan, automatische failover dekt haperingen uit het previewtijdperk af, en per-model observeerbaarheid laat zien wat elke baan werkelijk kost per voltooide taak. Het ontkracht ook wijzigingen aan de aanbiederskant, zoals de naamintrekking van 24 juli of de piekuurprijzen van half juli — wanneer een modelnaam verdwijnt of een prijsvenster opengaat, werk je een routeringsregel bij, niet je codebase.

Veelgestelde vragen

Is DeepSeek V4 nu beschikbaar?

Ja — V4-Pro en V4-Flash zijn sinds 24 april 2026 live gegaan op de DeepSeek API onder de model-ID's deepseek-v4-pro en deepseek-v4-flash, met open-source gewichten. Officieel is het een preview; de aankondiging van DeepSeek van 29 juni plaatst de officiële versie op medio juli 2026.

Wat is DeepSeek's piekuurtarief?

Aangekondigd voor de officiële release: vanaf medio juli 2026 verdubbelen alle tokenprijzen tijdens de Beijingse kantoortijden (09:00-12:00 en 14:00-18:00 Beijingse tijd), terwijl de tarieven buiten de piekuren ongewijzigd blijven. Verkeer dat piekt buiten de Chinese kantoortijden – de meeste westerse workloads – ontwijkt grotendeels de toeslag.

Wat gebeurt er met deepseek-chat en deepseek-reasoner?

Ze routeren momenteel automatisch naar V4-Flash, maar na 24 juli 2026 (15:59 UTC) worden beide namen volledig buiten gebruik gesteld en zullen aanvragen mislukken. Werk de modelparameter expliciet bij voor de deadline.

Moet ik V4-Pro of V4-Flash gebruiken?

Flash voor volume werk, een mens controleert nooit regel voor regel — samenvattingen, extractie, classificatie, chat. Pro voor code, analyse en opstellen, tegen ongeveer 3x de prijs van Flash maar nog steeds ver onder elk vergelijkbaar model.

Is DeepSeek V4 beter dan GLM-5.2?

Goedkoper, niet beter. Op Z.ai's gepubliceerde tabel leidt GLM-5.2 duidelijk op het gebied van coderen en domineert het langetermijn-agentwerk; V4 reageert met 3–5x lagere prijzen, een uitvoerlimiet van 384K en bijna gratis cache-hits. Veel teams gebruiken beide: V4 voor volume, GLM-5.2 voor codeeragenten.

Kan DeepSeek V4 afbeeldingen verwerken?

Nee — de V4 API is alleen-tekst. Stuur visietaken (screenshots, PDF's als pixels, grafieken) in plaats daarvan naar een multimodaal model zoals Claude of Gemini.

Kan ik DeepSeek V4 zelf hosten?

De gewichten zijn open-source, maar wees realistisch over de schaal: V4-Pro is een MoE met 1,6T parameters — datacenterterrein — terwijl de 284B V4-Flash het praktische zelf-hostende doel is voor goed uitgeruste teams.

Werkt V4 met mijn bestaande OpenAI- of Claude-tooling?

Meestal wel — de API ondersteunt native zowel OpenAI ChatCompletions- als Anthropic-formaten, dus agentframeworks en SDK's die voor een van beide zijn gebouwd, maken meestal verbinding met een wijziging van base-URL en modelnaam.

Kan ik DeepSeek V4 gebruiken via OrcaRouter?

Ja — DeepSeek-modellen zijn beschikbaar op OrcaRouter tegen de lijstprijzen van de provider zonder opslag, naast GLM, Claude, GPT en Gemini, zodat u de volume-plus-escalatie split achter één eindpunt kunt uitvoeren.

Klaar om je tokenrekening saai te maken? Maak je OrcaRouter-account aan, richt je OpenAI-compatibele client op één endpoint, en routeer het volume naar DeepSeek V4 terwijl sterkere modellen de top aanpakken — zonder tokenopslag en met een 24 juli-bestendige integratie.


© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

Neem contact op

Word lid van de community

DiscordEmailXGitHubYouTube