
DeepSeek V4.1 Flash-benchmarks: wat 74.2 wel en niet bewijst
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 984 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 195 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
DeepSeek V4.1 Flash scoorde 74,2 op DeepSWE v1.1, een tiende punt boven GPT-6 Astra, een half punt boven Gemini 3.8 Flash en Claude Opus 5, en het cijfer wordt de hele week al aangehaald als een wisseling van de wacht. Het is de moeite waard precies te zijn over wat het werkelijk is. Het model zelf is niet nieuw — DeepSeek V4.1 Flash werd op 2026-09-10 algemeen beschikbaar, zes dagen geleden — dus niets hier is een lancering. Wat in dat venster is geland, is de meetlaag: de eerste onafhankelijke indexvermeldingen, het eerste onafhankelijke arenaresultaat, dag-0-servingondersteuning in drie stacks, en een beslissing van de leverancier om zijn eigen vlaggenschip uit te faseren ten gunste van deze. Deze pagina is een overzicht van wat daadwerkelijk is gemeten, met bij elk cijfer de bron vermeld, en een heldere uiteenzetting van wat nog niemand heeft vastgesteld.
Het DeepSWE-getal, en de vier modellen binnen een half punt daarvan
DeepSWE v1.1 is een langetermijnbenchmark voor software-engineering van Datacurve — 113 originele taken verdeeld over 91 opensource-repositories en vijf programmeertalen, opgebouwd rond wijzigingen in meerdere bestanden en gedragsmatige correctheid. Op de eigen modelkaart van DeepSeek luidt de door de leverancier gerapporteerde tabel: DeepSeek V4.1 Flash 74,2, Claude Opus 5 74,0, GPT-5.6 Sol 73,0, Kimi K3 67,5, GLM-5.3 66,9, DeepSeek V4-Pro-0813 62,7, DeepSeek V4-Flash 54,4.
De onafhankelijke ranglijst voor dezelfde benchmark reproduceert die volgorde niet, en de verschillen zijn belangrijker dan de kop. De DeepSWE v1.1 Pass@1-ranglijst van Datacurve zet Muse Spark 1.3 (FAIR) op de eerste plaats met 75.40, vóór DeepSeek V4.1 Flash met 74.20. Daarachter: GPT-6 Astra met 74.12 (extra hoog) en 74.10 (max), Gemini 3.8 Flash met 73.83 (hoog), Claude Opus 5 met 73.65 (max).
Dus de 74,2 is een echte vermelding op een echt leaderboard van een derde partij, en hij staat tweede, niet eerste. De bewering die op de dag van de release circuleerde — dat dit state of the art is op DeepSWE — houdt geen stand bij contact met het leaderboard dat de score vermeldt. Muse Spark 1.3 staat 1,2 punten voor.
Nu het deel dat overgeslagen wordt. Vier frontiermodellen liggen binnen 0,55 punt van elkaar op deze benchmark: 74,20, 74,12, 73,83, 73,65. Dat is een smallere band dan de meetruis. Gepubliceerde variatie van run tot run op DeepSWE is in de orde van 1,4 tot 3,2 punten — drie tot zes keer zo groot als de volledige spreiding van de top vier. Een voorsprong van 0,2 punt op GPT-6 Astra is geen bevinding; het is hoe een gelijkspel eruitziet wanneer je het met twee decimalen weergeeft.
Scaffoldgevoeligheid is de tweede reden om niet te veel waarde aan het getal te hechten, en hier levert de eigen documentatie van de leverancier het bewijs. DeepSeek rapporteert DeepSWE over acht scaffolds in dezelfde release-informatie. De 74,2 werd behaald op mini-SWE. Hetzelfde model scoorde 72,6 op DSH Minimal, 70,5 op DSH Standard, 69,8 op Claude Code, 67,6 op DSH PTC, 66,2 op Pi, 65,6 op Codex en 65,5 op OpenCode. Dat is een spreiding van 8,7 punten bij één model en één benchmark, puur gedreven door de harness die eromheen zit. Wie een DeepSeek-getal dat op mini-SWE is geproduceerd vergelijkt met het getal van een concurrent dat op een andere agentlus is geproduceerd, vergelijkt scaffolds, niet modellen.
Waar de onafhankelijke index het daadwerkelijk plaatst
Artificial Analysis draait een vaste suite met opgegeven inspanningsinstellingen, waardoor de Intelligence Index de zuiverste beschikbare externe controle is. Op de modelpagina voor DeepSeek V4.1 Flash staat de index bij maximale redeneerinspanning op 40 — gerangschikt #6 van 113 modellen in die klasse, tegen een klassemediaan van 18. De gesloten rivalen staan erboven: Claude Opus 5 (max) 51, GPT-5.6 Sol (max) 47, GLM-5.3 (max) 45, Kimi K3 (max) 44, Gemini 3.8 Flash (high) 41. DeepSeek' eigen vorige vlaggenschip, V4-Pro-0813, staat eronder op 36.
Lees de twee scoreborden naast elkaar en het meningsverschil is structureel, geen fout. Op de door DeepSeek gekozen benchmark, met de juiste scaffold, evenaart het model de frontier. Op een vaste externe suite, gemiddeld over redeneren, programmeren, wiskunde en agentisch werk, staat het elf punten achter Claude Opus 5 en één punt achter Gemini 3.8 Flash. Beide kunnen waar zijn. Een leverancierstabel is een argument; een index is een gemiddelde.
De indexpagina bevat ook twee cijfers die van belang zijn voor een routeringsbeslissing en zelden de krantenkoppen halen. DeepSeek V4.1 Flash draait op 214,4 outputtokens per seconde bij maximale inspanning — snel. Het genereerde ook 250M outputtokens bij het voltooien van de Intelligence Index, tegen een mediaan van 140M, wat Artificial Analysis bestempelt als uitgesproken breedsprakig. Breedsprakigheid is geen kwaliteitsprobleem; het is een rekening. Een model dat in 79% meer tokens denkt dan zijn concurrenten, levert een deel van zijn prijsvoordeel in bij elke lange redeneeraanroep.

ProgramBench: een single-modelscore en een multi-agentscore zijn niet dezelfde meting
Dit is het getal dat het meest waarschijnlijk verkeerd wordt gelezen, dus het is de moeite waard om het zorgvuldig te scheiden.
• Eén model, standaardconfiguratie — DeepSeek V4.1 Flash scoort 20,3 op ProgramBench (Almost@1), volgens DeepSeeks eigen modelkaart. Dat is lager dan GPT-5.6 Sol op 23,0 en ver onder Claude Opus 5 op 37,0, en slechts iets boven GLM-5.3 op 19,0 en Kimi K3 op 17,5. Door de leverancier gerapporteerd, en het stelt het model niet in een gunstig daglicht.
• Multi-agentteamconfiguratie — het technische rapport van DeepSeek, DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression, beschrijft een voorlopig Agent Swarm RL-recept waarin een leidende agent teamgenoten coördineert via een gedeeld taakbord. Op een hoogbetrouwbare 172-taak-subset van ProgramBench — taken waarbij de referentieoplossing 95% of beter haalt — stijgt de multi-agentconfiguratie van 13,59% bij een deadline van één uur naar een piek van 30,04% bij acht uur, terwijl de single-agentbaseline van 12,79% naar 20,39% gaat.
De 30,04% is de bron van de bewering "30%", en het is geen score van één model. Het is een team van agents dat acht uur de tijd kreeg, gemeten op een gefilterde subset, in de eigen voorlopige evaluatie van de leverancier. De vergelijking die het uitlokt — "ruim boven single Sol, bijna 2x Kimi K3" — is rekenkundig eerlijk tegenover Sols 23,0 en K3's 17,5, en het is ook een vergelijking tussen een multi-agentconfiguratie en single-model-baselines op een andere takenreeks. Hetzelfde rapport toont het effect op FrontierSWE v2: multi-agent bereikt 32,90% bij twintig uur tegenover 28,20% single-agent. Het verschil is reëel, het wordt kleiner naarmate de deadline wordt verlengd, en de tokencost om het te behalen is niet klein — één hands-on verslag meldt meer dan 10x het aantal tokens en looptijden die vier uur naderen.
Het aantal parameters ligt nog niet vast, dus behandel elke groottevergelijking als voorlopig.
In de release notes van DeepSeek wordt een "MoE met 552B parameters" beschreven. Dat is het cijfer van de leverancier, en het is wat de meeste berichtgeving herhaalt. Het is ook niet het hele artefact.
DeepSeek's eigen modelkaart documenteert naast de transformer-backbone een tweede component: "Engram conditional memory (196B parameters, spaarzaam benaderd via op tokens gebaseerde lookup)." Tel je die twee op, dan kom je op 748B. Dat is de rekensom achter de interpretatie in de community die binnen enkele uren na de release op r/LocalLLaMA circuleerde, en de safetensors-index van de modelkaart zelf vermeldt 763B parameters over de tensortypes. Het FP8-cijfer van ruwweg 510 GB komt uit dezelfde analyselijn: wat je daadwerkelijk downloadt en in het geheugen houdt.
De verklaring is dat er verschillende dingen worden geteld. 552B is de computationele ruggengraat — de parameters waar een token doorheen stroomt. 196B is een opzoektabel die bij specifieke lagen wordt geraadpleegd en opgeslagen informatie retourneert in plaats van er berekeningen op uit te voeren. 8B en 16B, de activatiecijfers die DeepSeek aanhaalt, zijn de per-token-slices die actief zijn tijdens respectievelijk prefill en decode. Alle vier getallen beschrijven hetzelfde model.
Niets daarvan maakt de vergelijking veilig. Elke bewering van de vorm 'dit model evenaart een frontiermodel met een fractie van de omvang' berust op een leverancierskop die een vijfde van het artefact uitsluit. Totdat iemand een reproduceerbare parameterverantwoording publiceert, moeten argumenten op basis van omvang het voorbehoud inline meedragen.
ARC-AGI: geen resultaat voor dit model
Er is geen ARC-AGI-2- of ARC-AGI-1-score voor DeepSeek V4.1 Flash. De pagina met geverifieerde resultaten van ARC Prize bevat geen vermelding voor dit checkpoint, en de eigen benchmarktabel van DeepSeek heeft geen ARC-rij. Het enige door ARC Prize geverifieerde DeepSeek-resultaat is dat voor het oudere V4 Flash 0731-checkpoint — 61,4% op ARC-AGI-2 semi-private bij maximale redeneerinspanning en 89,0% op ARC-AGI-1, tegen respectievelijk $0,04 en $0,02 per taak. Dat zijn de cijfers van de voorganger op een ander model, en ze als V4.1 Flash-resultaten aanhalen zou onjuist zijn. Als ARC-AGI belangrijk is voor uw evaluatie, is dit model momenteel niet gescoord.
Wat is er nog meer in het venster beland?
Voor een lezer die overweegt dit model te proberen, zijn er drie dingen veranderd, en geen daarvan is de eigen release van het model.
• Onafhankelijk arenaresultaat. OpenDesign Arena liet dertien modellen identieke ontwerptaken doorlopen — webapps, dashboards, mobiele schermen, landingspagina's. DeepSeek V4.1 Flash scoorde 81,2 van de 100 tegenover de 82,7 van GPT-6 Astra, voor $0,023 per voltooid ontwerp tegenover $1,61, en was klaar in 5,3 minuten tegenover 11,1. Opleveringspercentage — output die zonder aanpassing bruikbaar is — was 57,7% tegen 60% van Astra. Dit is een van de eerste echt onafhankelijke metingen van het model, en het meet specifiek ontwerpoutput, niet algemeen redeneren of coderen.
• Day-0-servingondersteuning op drie stacks. vLLM publiceerde een day-0-image (9 september 2026) die gevalideerd is op NVIDIA- en AMD-hardware. SGLang en Miles publiceerden op 10 september 2026 day-0-inference- en RL-ondersteuning, waaronder een Engram host-offload-pad dat de KV-cachecapaciteit met 36% verhoogde op 4x GB300 en een bounded-replay-optimalisatie die de prefill-throughput met factor 1,56 verhoogde op 8x H200. Cambricon kondigde dezelfde dag Day-0-adaptatie op de vLLM-stack aan. Voor een model waarvan het verkoopargument agressieve KV-cachecompressie is — een kwart van de HBM-voetafdruk van de vorige generatie, een achtste van de SSD — is de mogelijkheid om vanaf dag één op standaardstacks te draaien het verschil tussen een labresultaat en iets dat je kunt uitrollen.
• De leverancier heeft zijn eigen vlaggenschip uitgefaseerd. DeepSeek is V4-Pro aan het uitfaseren. Vanaf 04:00 UTC op 2026-09-14 wordt elke aanvraag die “deepseek-v4-pro” vermeldt, naar V4.1 Flash doorgestuurd en tegen Flash-tarieven gefactureerd, en dat blijft zo totdat er een V4.1 Pro wordt gelanceerd. DeepSeek V4.1 Pro is niet uitgebracht — het is een toekomstig model, en de omleiding is een noodoplossing die voorkomt dat gepinde integraties kapotgaan. Ook uitgefaseerd: “deepseek-v4-flash” en “deepseek-v4-flash-vision-exp”, beide tijdelijk naar V4.1 Flash omgeleid voor compatibiliteit. Als je een gepinde model-ID in productie hebt, is die omleiding het enige operationele feit op deze pagina dat je niet kunt negeren.
Wat de prijs met de beslissing doet
De prijsstelling is het punt waarop dit model ophoudt een benchmarkverhaal te zijn. Volgens de eigen gepubliceerde tarieven van DeepSeek, effectief vanaf 04:00 UTC op 2026-09-10, waarbij piekuren zijn gedefinieerd als 01:00–04:00 en 06:00–10:00 UTC op werkdagen en alle overige uren als daluren gelden.
• Buiten piekuren, per miljoen tokens — $0,003 cachehit, $0,15 cachemiss, $0,60 output.
• Piek, per miljoen tokens — $0,006 bij cache-hit, $0,30 bij cache-miss, $1,20 output.
• Gecachte invoer, vergeleken met een gesloten frontiermodel — drie tienden van een cent per miljoen tegenover ongeveer vijftig cent. Voor een agent die dezelfde repository in een lus doorloopt, is die laag goed voor de meeste tokens.
• Gemeten op onze eigen catalogus — $0,15 in en $0,60 uit per miljoen, 784 ms mediane tijd tot het eerste token, 211 tokens per seconde over de afgelopen zeven dagen.
Artificial Analysis vermeldt hetzelfde model tegen $0.30 voor input en $1.20 voor output, met een cachekorting van 98% en een gemengd tarief van $0.18 per miljoen — dat is het piekniveau, en de twee bedragen zijn dezelfde prijs op verschillende uren van de dag. Het is de moeite waard om dat onderscheid je eigen te maken voordat je leveranciers vergelijkt: een model met een tweetariefsklok kan niet worden vergeleken op basis van één enkel hoofdtarief.
Dat is ook waarom pass-through-pricing hier meer dan gewoonlijk van belang is. OrcaRouter routeert DeepSeek V4.1 Flash naast de rest van zijn catalogus tegen 0% opslag — de catalogusprijs van de provider, ongewijzigd, zodat de piek- en dalstaffels van DeepSeek aan onze kant precies aankomen zoals DeepSeek ze publiceert, en een prijswijziging van een leverancier dezelfde dag live is. Bij een model waarvan het tarief elke werkdagochtend vier uur lang verdubbelt, verbergt een platform dat de staffels afvlakt het enige getal dat je nodig had.


Wat niemand heeft vastgesteld
Het gat in dit verhaal is niet een ontbrekende benchmark. Het is dat er geen geloofwaardige rechtstreekse vergelijking bestaat tussen DeepSeek V4.1 Flash en zijn genoemde rivalen op een gedeelde harness, uitgevoerd door iemand zonder belang bij de uitkomst. Elk cijfer op deze pagina is een van drie dingen: door de leverancier gerapporteerd, geproduceerd door een derde partij op een andere configuratie, of een gemiddelde over een vaste suite die niet is ontworpen om deze confrontatie te isoleren. Er is geen run waarin DeepSeek V4.1 Flash en GPT-6 Astra werden geëvalueerd op dezelfde taken, dezelfde scaffold, dezelfde effort-instelling, gepubliceerd met variantie.
Drie specifieke dingen zouden het beeld veranderen, en geen ervan bestaat vandaag.
• Een scaffold-gecontroleerde DeepSWE-vergelijking. De spreiding van 8,7 punten tussen DeepSeek's eigen scaffolds is groter dan welk verschil dan ook tussen de top vier modellen op het leaderboard. Zolang het frontier niet op één harness wordt gemeten, is de ordening bovenaan die tabel niet betekenisvol.
• Een onafhankelijke reproductie van het resultaat van het ProgramBench-agentteam. De 30,04% komt uit het technisch rapport van de leverancier over een gefilterde subset van 172 taken, in een voorlopige configuratie, met een tokenkost die niet is gekarakteriseerd voor productiebudgetten.
• ARC-AGI. Er bestaat helemaal geen score voor dit checkpoint.
De praktische consequentie is een beperktere bewering dan de krantenkoppen ondersteunen. DeepSeek V4.1 Flash ligt meetbaar binnen de ruis van de frontier op één codingbenchmark met een lange horizon, is oprecht concurrerend bij onafhankelijke ontwerptaken tegen ongeveer 1,4% van de kosten, en staat ongeveer tien punten achter op een samengestelde index. Dat is genoeg om het tegen je eigen workload te draaien en je evaluatie de kwestie te laten beslechten. Het is niet genoeg om een productieroutingtabel te herschrijven op basis van 0,2 punten — en het feit dat beide uitspraken waar zijn, is de hele bevinding.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
