
DeepSeek V4 Pro-benchmarks: De volledige 0813-scorecard, elke onafhankelijke check, en wat niemand nog heeft geverifieerd
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 143 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Het antwoord in één zin: DeepSeek V4 Pro laat op DeepSeek's eigen cijfers een oprecht sterke agentische scorecard zien — Terminal-Bench 2.1 op 87,9, DeepSWE op 62,7, CyberGym op 83,3 — maar vrijwel elk kopcijfer is door de leverancier gerapporteerd, en het onafhankelijke beeld is koeler. Artificial Analysis plaatst de officiële 0813-build op 53 op zijn Intelligence Index, gelijk aan GLM 5.2, vier punten achter GPT-5.6 Terra en zeven achter Kimi K3; Vals AI rangschikt het op de 12e plaats, onder de vorige generatie GPT-5.5. Dit artikel is de volledige aggregatie die niemand anders heeft geschreven: de complete 0813-scorecard, de uitgebreide coderingsset uit het technisch rapport, elke onafhankelijke controle die er bestaat, en een eerlijk overzicht van welke cijfers zijn gereproduceerd en welke nog steeds alleen op DeepSeek's woord berusten. Een week na de scorecard begint ook het beeld rond serving zich in te vullen — op 19 augustus 2026 publiceerden LMSYS en Ant Group een H20-servingstack die 271 output tokens/s bereikt bij batchgrootte 1, behandeld in een eigen sectie hieronder en, net als alles aan de leverancierskant van deze pagina, aangemerkt als zelfgerapporteerd totdat iemand het reproduceert.
De officiële 0813-scorecard — DeepSeek's eigen cijfers, allemaal
De officiële aankondiging van DeepSeek (API-docs, news260813, 13 augustus 2026) vermeldt de productiebuild ten opzichte van de april-preview. Elk cijfer in deze sectie is door de leverancier gerapporteerd — niets is onafhankelijk gereproduceerd per 16 augustus 2026:
• Terminal-Bench 2.1 — 87.9 (voorvertoning: 72.1).
• DeepSWE — 62.7 (preview: 12.8) — een sprong van ongeveer 5x, veruit de meest opvallende bewering op de kaart.
• CyberGym — 83.3 (voorvertoning: 52.7).
• Humanity's Last Exam — 42.7 zonder tools, 60.0 met tools (preview: 37.7 / 48.2).
• Toolathlon-Verified — 74.1 (preview: 55.9).
• AutomationBench (publiek) — 31,8 (preview: 12,8).
• DSBench-FullStack — 71,1; DSBench-Hard — 67,2 (preview: 41,8 / 31,1).
• NL2Repo — 61,5 (preview: 38,5).
• Agents' Last Exam — 25,7 (preview: 16,5).
Het patroon om op te letten is waar de winsten zich concentreren: agentische en cybersecurity-benchmarks. Dat is precies het soort scorekaart dat een lab produceert wanneer het een agentmodel wil adverteren — en precies het soort dat een neutrale hertest nodig heeft voordat je productiegeld eraan uitgeeft.

De uitgebreide codeerset uit het technisch rapport van DeepSeek
Naast de agentische kaart voegt het DeepSeek-technisch rapport (zoals verzameld door BenchLM op 16 augustus 2026) een bredere set voor codering en lange context toe. Ook door de leverancier gerapporteerd, en door BenchLM gelabeld als "Provider exact" — geen onafhankelijke test:
• SWE-bench Verified — 80,6%; SWE-bench Pro — 55,4%.
• LiveCodeBench Pass@1-CoT — 93.5% — de beste geverifieerde in de catalogus van BenchLM.
• Codeforces rating — 3206 — ook de best geverifieerde in de catalogus.
• BrowseComp — 83,4%; Terminal-Bench 2.0 — 67,9%.
• MRCR 1M — 83,5%; CorpusQA 1M — 62,0% — beide de beste in de catalogus op 1M-token-retrieval, wat belangrijk is voor een model dat een contextvenster van 1M tokens promoot.
• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (vermeld op de modelpagina van OrcaRouter).
Wat onafhankelijke evaluatoren daadwerkelijk meten
Drie onafhankelijke bronnen hebben DeepSeek V4 Pro getest, en hun oordelen clusteren onder de kaart van de leverancier:
• Artificial Analysis Intelligence Index — 53 (De berichtgeving van SCMP, augustus 2026; de modelpagina van OrcaRouter toont 53.2, gerangschikt op de 20e plaats van 132). Op gelijke hoogte met GLM 5.2, vier punten achter GPT-5.6 Terra, zeven achter Kimi K3.
• Artificial Analysis Coding — 68.8, 24e van de 130 (volgens de modelpagina van OrcaRouter).
• Vals AI Index — 12e, achter de vorige generatie GPT-5.5 en ver achter Kimi K3 en Claude Opus 5 (SCMP). Vals AI's eigen tests wezen op twee concrete zwakke punten: het uitvoeren van taken in een sandbox-terminalomgeving en het bouwen van complexe financiële modellen in Excel-spreadsheets.
• Vibe Code Bench v1.1 — 49.93 (Vals AI, de enige "Benchmark exact" onafhankelijke run in de set).
De eerlijke boekhouding — wat gerepliceerd is versus wat nog louter DeepSeeks woord is.
Dit is het gedeelte dat een benchmarkartikel moet bieden, en de reden om deze pagina te bookmarken in plaats van de verslaggeving van de lancering. Verdeel elke score in een van twee categorieën:
• Uit onafhankelijke bronnen: AA Intelligence Index 53 / 53,2, AA Coding 68,8, Vals AI rang 12e, Vibe Code Bench 49,93 — en een afzonderlijk verkregen Terminal-Bench 2.1-run van 78,7 die naast DeepSeek's 87,9 op OrcaRouter's modelpagina staat. Dat gat van negen punten tussen het cijfer van de leverancier en een onafhankelijke run is verreweg het belangrijkste gegeven op deze pagina: het is de reproductiekloof, gekwantificeerd.
• Alleen door de leverancier gerapporteerd, niet onafhankelijk gereproduceerd: elk cijfer in de officiële 0813-kaart hierboven (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) en de volledige uitgebreide codeerset (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). DeepSeek's eigen documentatie bestempelt het Terminal-Bench 2.1-cijfer als een "provider run."
Zo gelezen is het verhaal samenhangend: DeepSeek V4 Pro is een echt middenmoot-frontiermodel — AA 53, gerangschikt in de tiener- tot twintigerposities — met een leveranciersscorecard die bijna topprestaties claimt op agentisch en codeergebied. Beide uitspraken zijn waar, en ze zijn niet tegenstrijdig; de ene is gemeten, de andere is geclaimd.

Wat de scorecard kost
DeepSeek V4 Pro is het MoE-vlaggenschip met 1,6T totaal / 49B actieve parameters, een contextvenster van 1M tokens en een maximale output van 384K. Op OrcaRouter is de prijs gelijk aan DeepSeek's catalogusprijs zonder opslag: $0,435 per miljoen invoertokens en $0,87 per miljoen output (cache-lezen $0,060 per miljoen), volgens de directory die op 15 augustus 2026 is gecontroleerd en bevestigd op de live modelpagina. Tegen dat tarief is de prijs-per-punt-berekening het sterkste argument voor het model: het is ruwweg een tiende van de outputprijs van de modellen die er dichtbij scoren op de onafhankelijke index, dus je betaalt prijzen uit het middensegment voor een scorekaart die, als de beweringen van de leverancier kloppen, bijna aan de top staat. Eén kanttekening: DeepSeek heeft een piek-/dalprijzenschema aangekondigd (buiten de piek 50% van de piekprijs), ingaande 17 augustus, Beijing-tijd, dus het tarief kan wijzigen — de hier genoemde bedragen zijn de actuele catalogusprijs op het moment van dit artikel.

DeepSeek V4 Pro serveren: 271 output tokens/s op H20
Benchmarks beoordelen wat het model weet; serving-cijfers beoordelen hoe goedkoop je het kunt laten denken. Op 19 augustus 2026 publiceerden LMSYS — de organisatie achter Chatbot Arena — en het open-source team van Ant Group het eerste serieuze serving-werk over de 0813-build: een "scenario-specifieke serving-stack" gebouwd op SGLang, de open-source engine die LMSYS onderhoudt. Het belangrijkste getal is 271 output tokens/s bij batchgrootte 1 op een NVIDIA H20, wat het team schat op 1,42× ten opzichte van een B300 — bereikt op een chip met geen native FP4 Tensor Cores. Dit zijn eigen metingen van LMSYS en Ant Group, aangekondigd in hun blog en op X; geen enkele is onafhankelijk gereproduceerd.
De rest van de cijfers van de stack, allemaal zelf gerapporteerd door LMSYS en Ant Group op hun eigen stack:
• Decode-latentie — een "geoptimaliseerde DSpark"-component verlaagt de tijd-per-output-token (TPOT) met 74,8–78,0% bij batchgrootte 1.
• Prefill — een prefill van 1 miljoen tokens wordt voltooid in 43,7 seconden, een toename van 36,5% in de geometrisch gemiddelde prefill-doorvoer.
• KV-cache — een aanpak die het team "Humming MXFP4AFP8 + Online C128" noemt, vergroot de volledige-token KV-cachecapaciteit met 10,14×, de hefboom die agentworkloads van 1M tokens praktisch maakt op deze klasse silicium.
• Per-GPU-decodering — bij een context van 4K stijgt de decode-doorvoer per GPU van 319,9 naar 703,2 tokens/s/GPU, een verbetering van 2,20×.
Lees de kanttekeningen voordat je er een vloot op gaat dimensioneren. Batchsize 1 is het single-stream-regime — wat een interactieve agent of een chat tegenkomt, niet een API met hoge gelijktijdigheid — en de 1,42×-vergelijking ten opzichte van de B300 is een verhouding die LMSYS vermeldt zonder de absolute tokens/s van de B300 te publiceren, dus het verschil wordt beweerd, maar is niet controleerbaar. Het resultaat meet ook de stack, niet de chip: deze winst komt voort uit optimalisatie op SGLang-niveau op hardware die er anders onderpowered uit zou zien voor een MoE met 1,6T totaal. Ter context: de live modelpagina van OrcaRouter meet DeepSeek V4 Pro op 80,8 output tokens/s via een gedeeld API-eindpunt — het H20-cijfer is een single-stream benchmark op een dedicated stack, een ander getal met een andere betekenis.
Als je workload via een API wordt bediend, verandert dit niets aan hoe je het model aanroept: DeepSeek V4 Pro is één OpenAI-compatibele sleutel op OrcaRouter tegen de lijstprijs van DeepSeek, met automatische failover als de provider hapert. De H20-cijfers doen er het meest toe als jij het team bent dat een zelfgehoste H20-vloot afweegt tegen het betalen voor de API — de kloof die het werk van LMSYS en Ant Group dicht, is een hardware-aankoopbeslissing, geen modelselectiebeslissing.
Wanneer deze aanbeveling onjuist is
De eerlijke gevallen waarin DeepSeek V4 Pro niet jouw keuze zou moeten zijn:
• U heeft onafhankelijk bevestigde frontier-redenering nodig.AA Index 53 zit in de middenmoot — Kimi K3 (60) en GPT-5.6 Terra (57) liggen voor en zijn geverifieerd. Als uw beslissing afhangt van het gemeten plafond, verandert de leverancierskaart daar niets aan.
• Je zet je productie in op DeepSWE 62.7 voordat iemand het opnieuw draait. Een sprong van 12.8→62.7 in één release is een bewering, geen feit. Wacht op een neutrale reproductie — de 87.9-vs-78.7-kloof op Terminal-Bench laat zien wat men zou kunnen vinden.
• Uw workload is sandbox-terminalautomatisering of Excel-financiële modellering. Vals AI zegt dat dit precies de gebieden zijn waar het model moeite mee heeft, onafhankelijk van welke leveranciersscore dan ook.
• Je neemt een cyberbeveiligingsbeslissing op basis van CyberGym 83.3. Dat is DeepSeek die zijn eigen model test op zijn eigen benchmark — een beveiligingsleverancier die op basis van dit getal koopt, koopt niet-gecontroleerde data.
• Je koopt H20's alleen al op basis van het getal van 271 tokens/s. Dat getal is een zelfgerapporteerde benchmark van één stack bij batchgrootte 1 — veelbelovend, niet gereproduceerd, en één punt op een kostencurve die ook bezettingsgraad, stroomverbruik en welke serving-stack je ook daadwerkelijk zou draaien omvat.
Kortom
DeepSeek V4 Pro 0813 is een echt grensverleggend model met een leveranciersscorekaart die voorloopt op de onafhankelijke resultaten. De 0813-release veranderde een tekstpreview in een serieuze agentische concurrent — we hebben de release zelf apart behandeld — en als je het vandaag wilt evalueren, is het één OpenAI-compatibele API-sleutel op OrcaRouter tegen DeepSeek's catalogusprijs, met automatische failover als de provider hapert. Lees de scorekaart gewoon zoals dit artikel hem opsplitst: de onafhankelijke controles (AA 53, Vals 12e, de 78.7 Terminal-Bench-run) zijn waar je vandaag op kunt vertrouwen; de 87.9's en 62.7's moet je verifiëren voordat je erop voortbouwt. Dezelfde discipline geldt nu ook voor serving: de 271 outputtokens/s van LMSYS en Ant Group op H20 is het beste beeld van de doorvoer dat we hebben, en we moeten nog steeds op hun woord afgaan totdat een neutrale run het bevestigt. Koop het voor de prijs-prestatieverhouding en de 1M-tokencontext, niet voor de niet-gereproduceerde kopcijfers.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
