
DeepSeek V4 Pro-benchmarks: De volledige 0813-scorecard, elke onafhankelijke check, en wat niemand nog heeft geverifieerd
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianNIEUWQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligentie68Coderen
- qwenNIEUWQwen: Qwen3.8 27B (free)2026-08-1340 tok/s
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaNIEUWMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens · 221 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
- grokxAI: Grok 4.52026-07-0856Intelligentie72Coderen
Het antwoord in één zin: DeepSeek V4 Pro laat op DeepSeeks eigen cijfers een oprecht sterke agentische scorecard zien — Terminal-Bench 2.1 op 87,9, DeepSWE op 62,7, CyberGym op 83,3 — maar vrijwel elk kopcijfer is door de leverancier gerapporteerd, en het onafhankelijke beeld is koeler.Artificial Analysis plaatst de officiële 0813-build op 53 op zijn Intelligence Index, gelijk aan GLM-5.2, vier punten achter GPT-5.6 Terra en zeven achter Kimi K3; Vals AI plaatst het op de 12e plaats, onder de GPT-5.5 van de vorige generatie. Dit artikel is de volledige aggregatie die niemand anders heeft geschreven: de complete 0813-scorecard, de uitgebreide coderingsset uit het technisch rapport, elke bestaande onafhankelijke check, en een eerlijke boekhouding van welke cijfers zijn gereproduceerd en welke nog steeds uitsluitend op DeepSeeks woord berusten.
De officiële 0813-scorekaart — DeepSeek's eigen cijfers, allemaal
De officiële aankondiging van DeepSeek (API-documentatie, news260813, 13 augustus 2026) vermeldt de productiebuild ten opzichte van de aprilpreview. Elk cijfer in deze sectie is afkomstig van de leverancier — geen enkele is onafhankelijk gereproduceerd per 16 augustus 2026:
• Terminal-Bench 2.1 — 87.9 (voorvertoning: 72.1).
• DeepSWE — 62.7 (preview: 12.8) — een sprong van ongeveer 5x, veruit de meest opvallende bewering op de kaart.
• CyberGym — 83.3 (voorvertoning: 52.7).
• Humanity's Last Exam — 42.7 zonder tools, 60.0 met tools (preview: 37.7 / 48.2).
• Toolathlon-Verified — 74.1 (preview: 55.9).
• AutomationBench (publiek) — 31,8 (preview: 12,8).
• DSBench-FullStack — 71,1; DSBench-Hard — 67,2 (preview: 41,8 / 31,1).
• NL2Repo — 61,5 (preview: 38,5).
• Agents' Last Exam — 25,7 (preview: 16,5).
Het patroon om op te letten is waar de winsten zich concentreren: agentische en cybersecurity-benchmarks. Dat is precies het soort scorekaart dat een lab produceert wanneer het een agentmodel wil adverteren — en precies het soort dat een neutrale hertest nodig heeft voordat je productiegeld eraan uitgeeft.

De uitgebreide coderingsset uit het technisch rapport van DeepSeek
Naast de agentische kaart voegt het DeepSeek-technisch rapport (zoals samengevoegd door BenchLM op 16 augustus 2026) een bredere codeer- en lange-contextset toe. Ook door de leverancier gerapporteerd en door BenchLM als "Provider exact" gelabeld — geen onafhankelijke test:
• SWE-bench Verified — 80,6%; SWE-bench Pro — 55,4%.
• LiveCodeBench Pass@1-CoT — 93.5% — de beste geverifieerde in de catalogus van BenchLM.
• Codeforces rating — 3206 — ook de best geverifieerde in de catalogus.
• BrowseComp — 83,4%; Terminal-Bench 2.0 — 67,9%.
• MRCR 1M — 83,5%; CorpusQA 1M — 62,0% — beide de beste in de catalogus op 1M-token-retrieval, wat belangrijk is voor een model dat een contextvenster van 1M tokens promoot.
• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (vermeld op de modelpagina van OrcaRouter).
Wat onafhankelijke evaluatoren daadwerkelijk meten
Drie onafhankelijke bronnen hebben DeepSeek V4 Pro getest, en hun oordelen clusteren onder de kaart van de leverancier:
• Artificial Analysis Intelligence Index — 53 (SCMP's berichtgeving, augustus 2026; OrcaRouter's modelpagina toont 53.2, gerangschikt als 20e van 132). Op gelijke hoogte met GLM-5.2, vier punten achter GPT-5.6 Terra, zeven achter Kimi K3.
• Artificial Analysis Coding — 68.8, 24e van de 130 (volgens de modelpagina van OrcaRouter).
• Vals AI Index — 12e, achter de vorige generatie GPT-5.5 en ver achter Kimi K3 en Claude Opus 5 (SCMP). Vals AI's eigen tests wezen op twee concrete zwakke punten: het uitvoeren van taken in een sandbox-terminalomgeving en het bouwen van complexe financiële modellen in Excel-spreadsheets.
• Vibe Code Bench v1.1 — 49.93 (Vals AI, de enige "Benchmark exact" onafhankelijke run in de set).
Het eerlijke grootboek — wat is gereproduceerd versus wat nog slechts DeepSeek's woord is.
Dit is het gedeelte dat een benchmarkartikel moet bieden, en de reden om deze pagina te bookmarken in plaats van de verslaggeving van de lancering. Verdeel elke score in een van twee categorieën:
• Uit onafhankelijke bron: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI op de 12e plaats, Vibe Code Bench 49.93 — en een afzonderlijk verkregen Terminal-Bench 2.1-run van 78.7 die naast DeepSeek's 87.9 op OrcaRouter's modelpagina staat. Die kloof van negen punten tussen het cijfer van de leverancier en een onafhankelijke run is verreweg het belangrijkste gegeven op deze pagina: het is de reproductiekloof, gekwantificeerd.
• Alleen door de leverancier gerapporteerd, niet onafhankelijk gereproduceerd: elk cijfer in de officiële 0813-kaart hierboven (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) en de volledige uitgebreide codeerset (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). DeepSeek's eigen documentatie bestempelt het Terminal-Bench 2.1-cijfer als een "provider run."
Zo gelezen is het verhaal samenhangend: DeepSeek V4 Pro is een echt middenmoot-frontiermodel — AA 53, gerangschikt in de tiener- tot twintigerposities — met een leveranciersscorecard die bijna topprestaties claimt op agentisch en codeergebied. Beide uitspraken zijn waar, en ze zijn niet tegenstrijdig; de ene is gemeten, de andere is geclaimd.

Wat de scorecard kost
DeepSeek V4 Pro is de 1,6T-totaal / 49B-actieve MoE-vlaggenschip met een contextvenster van 1M tokens en een maximale output van 384K. Op OrcaRouter wordt het aangeboden tegen DeepSeeks lijstprijs zonder opslag: $0,435 per miljoen inputtokens en $0,87 per miljoen output (cache read $0,060 per miljoen), volgens de directory die op 15 augustus 2026 is gecontroleerd en bevestigd op de live modelpagina. Bij dat tarief is de prijs-per-punt-berekening het sterkste argument voor het model: het is ongeveer een tiende van de outputprijs van de modellen die er dichtbij scoren op de onafhankelijke index, dus je betaalt middenklasseprijzen voor een scorekaart die, als de claims van de leverancier kloppen, bijna bovenaan staat. Eén kanttekening: DeepSeek heeft een piek-/dalprijsschema aangekondigd (buiten de piek 50% van de piekprijs) dat ingaat op 17 augustus, Beijing-tijd, dus het tarief kan wijzigen — de cijfers hier zijn de live lijstprijs op het moment van dit artikel.

Wanneer deze aanbeveling onjuist is
De eerlijke gevallen waarin DeepSeek V4 Pro niet jouw keuze zou moeten zijn:
• U heeft onafhankelijk bevestigde frontier-redenering nodig.AA Index 53 zit in de middenmoot — Kimi K3 (60) en GPT-5.6 Terra (57) liggen voor en zijn geverifieerd. Als uw beslissing afhangt van het gemeten plafond, verandert de leverancierskaart daar niets aan.
• Je zet je productie in op DeepSWE 62.7 voordat iemand het opnieuw draait. Een sprong van 12.8→62.7 in één release is een bewering, geen feit. Wacht op een neutrale reproductie — de 87.9-vs-78.7-kloof op Terminal-Bench laat zien wat men zou kunnen vinden.
• Uw workload is sandbox-terminalautomatisering of Excel-financiële modellering. Vals AI zegt dat dit precies de gebieden zijn waar het model moeite mee heeft, onafhankelijk van welke leveranciersscore dan ook.
• U neemt een cyberbeveiligingsbeslissing op basis van CyberGym 83.3. Dat is DeepSeek dat zijn eigen model op zijn eigen benchmark test — een beveiligingsleverancier die op basis van dit cijfer koopt, koopt ongecontroleerde data.
Kortom
DeepSeek V4 Pro 0813 is een echt frontiermodel met een leveranciersscorecard die de onafhankelijke resultaten overtreft. De 0813-release veranderde een tekstpreview in een serieuze agentische concurrent — we hebben de release zelf apart besproken — en als je het vandaag wilt evalueren, is het één OpenAI-compatibele sleutel op OrcaRouter tegen de lijstprijs van DeepSeek, met automatische failover als de provider hapert. Lees de scorecard zoals dit artikel hem opsplitst: de onafhankelijke controles (AA 53, Vals 12e, de 78.7 Terminal-Bench-run) zijn waar je vandaag op kunt vertrouwen; de 87.9s en 62.7s zijn wat je moet verifiëren voordat je erop bouwt. Koop het vanwege de prijs-prestatieverhouding en de 1M-token context, niet vanwege de niet-gereproduceerde kopcijfers.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
