Een hero-titelkaart voor DeepSeek V4.1 Flash met de ondertitel 'Tweedaagse API-bèta: wat we tot nu toe weten', pill-badges met 'TUSSENTIJDSE BUILD' en 'API-TEST – VERLOOPT 09-10', een voettekstregel 'Officieel releasebericht wordt zeer binnenkort verwacht' en het OrcaRouter-logo rechtsonder in de hoek.
Guides & Insights

DeepSeek V4.1 Flash gaat in een tweedaagse API-bèta: nieuwe architectuur, native multimodaal en ambitie op pro-niveau

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

DeepSeek V4.1 Flash verscheen precies daar waar DeepSeek dingen test voordat het ze aankondigt: in de live API, onder een model-ID dat zijn eigen vervaldatum met zich meedraagt. De model-ID — deepseek-v4.1-flash-expires-on-0910 — werd op 8 september 2026 beschikbaar, nadat het team van DeepSeek een interne test van een 'tussenversie' in zijn officiële communitygroepen had geplaatst, en die 0910 achteraan is het verhaal in het klein. Dit is een build die in de echte API-omgeving is geplaatst voor een beperkte test die rond 10 september offline gaat, vóór het officiële releasebericht dat de tipgevers die het model signaleren 'zeer binnenkort' verwachten. Het is geen lancering. Er is geen modelkaart, geen technisch rapport, geen vermelding in de changelog, en vanaf vanavond vermeldt de openbare Models & Pricing-pagina van DeepSeek nog steeds alleen DeepSeek V4 Flash, DeepSeek V4 Pro en DeepSeek-V4-Flash-Vision-Exp.

Alles hieronder moet worden gelezen met dat sterretje in gedachten. Het officiële kanaal hier is een aankondiging van een communitygroep en een bijbehorend feedbackformulier, geen release-opmerking. Wat volgt is de samenvoeging van die aankondiging, de berichtgeving van Chinese media binnen enkele uren daarna, en metingen van de eerste dag van ontwikkelaars die hun eigen sleutels op het endpoint richtten — met de claims van de leverancier en de cijfers van de community gelabeld als wat ze zijn.

Wat er vandaag daadwerkelijk is gebeurd

Rond 15:00 uur Beijingse tijd op 8 september liet het team van DeepSeek aan zijn officiële communitygroepen weten dat er een tussenversie — in het Chinees beschreven als een 中间版本, een tussenliggend controlepunt — werd opengesteld voor beperkt testen in de echte API-omgeving voordat een definitieve versie uitkomt. Iedereen met een DeepSeek API-sleutel kan hem aanroepen: behoud je bestaande base URL en sleutel, en stel de modelnaam in op deepseek-v4.1-flash-expires-on-0910. Dat is het hele toegangsverhaal — er is geen apart endpoint, geen wachtlijst en geen nieuwe console.

De praktische speelruimte is beperkt. Het achtervoegsel codeert het plan: de testversie "zal op 10 september automatisch verlopen en offline gaan", waardoor er nog ruwweg twee dagen uptime overblijven. Elk account is beperkt tot 20 gelijktijdige verzoeken — tegenover de door DeepSeek voor deepseek-v4-flash gepubliceerde limiet van 2.500 gelijktijdige verzoeken — wat een sterke aanwijzing is voor de bedoeling: dit is bedoeld voor functioneel testen en evaluatie, niet om productieverkeer erop te richten.

• Wat het is — een “tussenversie”-checkpoint dat in de live API is geplaatst voor kortdurende tests vóór een officiële build.

• Waar het draait — Deep​Seek's eigen API; basis-URL en sleutel ongewijzigd, modelnaam vervangen door deepseek-v4.1-flash-expires-on-0910.

• Hoe lang — de naam zegt expires-on-0910; de test gaat naar verwachting rond 10 september offline.

• Wie kan het aanroepen — elk account met een Deep​Seek-sleutel, met maximaal 20 gelijktijdige verzoeken per account.

A single-column scoreboard titled 'DeepSeek V4.1 Flash - the scoreboard' listing Model ID deepseek-v4.1-flash-expires-on-0910, Status 2-day API beta - expires 09-10, Concurrency 20 req/account (V4 Flash: 2,500), Billing same rate card as DeepSeek V4 Flash, Speed (community) ~420 tok/s peaks 500+, Native multimodal text + image (official claim), with a footer reading 'Speed is community-measured; no official benchmarks or specs published yet.'

Wat de bèta in rekening brengt: de DeepSeek V4 Flash-tariefkaart

Deep​Seek zei dat de test wordt gefactureerd tegen dezelfde tarieven als deepseek-v4-flash, en dat de huidige tariefkaart van dat model van toepassing is. Sinds de herprijzing van 16 augustus 2026 hanteert Deep​Seek piek-/dalprijzen; de exacte bedragen zijn de officiële voor de Flash-tier:

Invoer, cache hit — $0,007 per 1M tokens buiten piekuren, $0,014 piekuren

• Invoer, cache miss — $0,22 per 1M tokens buiten piek, $0,44 piek

Output — $0.66 per 1M tokens buiten piekuren, $1.32 piek

• Piekuren — 01:00–04:00 en 06:00–10:00 UTC, maandag–vrijdag; alle andere uren zijn daluren tegen de helft van het piektarief.

A screenshot of the DeepSeek API docs Models & Pricing page (captured September 8, 2026) showing the current public lineup — deepseek-v4-flash, deepseek-v4-pro and deepseek-v4-flash-vision-exp — with 1M context and 384K max output, the off-peak/peak price columns (deepseek-v4-flash: $0.007 cache-hit input, $0.22 cache-miss input and $0.66 output off-peak, doubled at peak), and published concurrency limits of 2,500 / 500 / 2,500.

Let op wat niet veranderde: de prijs per token. DeepSeek's bewering dat V4.1 Flash "goedkoper" is, is dus een efficiëntieclaim, geen tariefsverlaging — een punt dat verschillende eerstedaagse testers op de dure manier ontdekten, terwijl ze zagen dat een sessie van vijf minuten merkbaar meer van hun saldo aftapte dan dezelfde tijdsduur op DeepSeek V4 Flash, omdat het model veel sneller tokens verbruikt. Of de kosten per taak daadwerkelijk dalen, hangt ervan af of het de klus afrondt met minder tokens en minder heroveringen, wat niemand kan beoordelen op basis van twee dagen snelheidstests.

Wat 'nieuwe architectuur, native multimodaal' betekent — vooralsnog onbevestigd.

De officiële beschrijving van Deep​Seek voor V4.1 Flash bestaat uit vier beweringen: een nieuwe modelstructuur, native multimodale ondersteuning, sterkere capaciteiten en snellere generatie. De bewering over de architectuur springt eruit, omdat ze een patroon doorbreekt. De vorige refresh, DeepSeek V4 Flash 0731, was een post-trainingupdate die dezelfde architectuur en schaal behield als de preview; de formulering van Deep​Seek wijst hier op een structurele wijziging, en verschillende media interpreteerden het als een teken dat het model opnieuw was getraind in plaats van gefinetuned. Voor de rest is alles giswerk. De speculatie in de community over gewijzigde aandachtsmechanismen, expertnetwerken of een geïntegreerde visiemodule is precies dat: speculatie. Er zijn geen parameteraantallen, geen cijfers over het contextvenster, geen benchmarktabellen en geen technisch rapport gepubliceerd.

De formulering 'native multimodaal' is om een specifieke reden van belang. DeepSeek-V4-Flash-Vision-Exp, gelanceerd op 21 augustus en sinds 31 augustus met open gewichten, koppelde een vision-encoder aan de DeepSeek V4 Flash-tekstbasis — het eigen materiaal van DeepSeek beschreef het tweetal als een tekstmodel plus een extern visionpad. V4.1 Flash wordt omschreven als van meet af aan multimodaal, met beeld-en-tekstinvoer die door het basismodel zelf wordt afgehandeld. Dat is in principe een reëel architectuurverschil, maar de modalitiespecificatie is niet gepubliceerd: wat testers hebben getest is tekst-plus-afbeeldingen, en een lezer dient 'multimodaal' alleen als bevestigd te beschouwen in die tekst-en-beeldbetekenis totdat er een modelkaart verschijnt. Of een bredere invoerset deel uitmaakt van het plan is, op het moment van schrijven, onbekend in plaats van bevestigd.

Snelheid is de kop — en het is een gemeenschapsmeting

Het getal dat op de eerste dag de ronde doet, is ruwweg 420 outputtokens per seconde bij lange generaties, met gemelde pieken boven de 500 tokens/s bij individuele runs. Een veel gedeelde test genereerde meer dan 71.000 tokens in minder dan drie minuten. Niets hiervan is officieel: dit zijn metingen door ontwikkelaars aan het bèta-endpoint, onder ongecontroleerde omstandigheden, en DeepSeek heeft geen eigen snelheidsbenchmark gepubliceerd. Ter referentie: Artificial Analysis meet het publieke endpoint van DeepSeek V4 Flash 0731 op ongeveer 128 tokens/s, dus de vroege rapporten wijzen op een sprong in de ruwe doorvoer van ongeveer drie keer of meer — met de gebruikelijke kanttekening dat de doorvoer afhangt van de inputlengte, de mate van gelijktijdigheid en de serveromstandigheden.

Bij de end-to-end-vergelijkingen met DeepSeek-V4-Flash-Vision-Exp komt de kloof het duidelijkst naar voren, omdat ze dezelfde taak direct achter elkaar meten. Testers rapporteerden dat een SVG-codegeneratietaak end-to-end ongeveer 6× sneller verliep, een long-context-retrieval met 49k tokens zo'n 5,2× sneller, een grote SQL-generatie-en-optimalisatietaak rond de 5× sneller, een algoritmisch probleem 4,6× sneller en een asynchrone-refactortaak 3,9× sneller. Beschouw die cijfers als indicatief, niet als exact: end-to-end-cijfers voor dezelfde taak omvatten denktijd, latentie van het eerste token en generatiesnelheid, en ze komen van individuele testers in plaats van een gecontroleerde testsuite. De consistente richting bij al deze resultaten is het interessante signaal, niet een enkele vermenigvuldigingsfactor.

De kernvraag van de bèta

Het meest strategische detail ligt verborgen in het feedbackformulier dat Deep​Seek bij de test heeft gevoegd. Naast vragen over agent-frameworks en praktijkscenario’s vraagt het testers rechtstreeks of de tussentijdse versie DeepSeek V4.1 Flash “de online DeepSeek V4 Pro volledig kan vervangen”. Dat is een opmerkelijke vraag voor een bedrijf om gebruikers voor te leggen, want DeepSeek V4 Pro bevindt zich drie prijsniveaus boven Flash: tegen de huidige officiële tarieven kost het Pro-model $0,66 per 1M invoertokens (cache miss) en $1,98 per 1M uitvoertokens buiten de piek, tegenover $0,22 en $0,66 voor DeepSeek V4 Flash — een keurige 3× op elke lijn. Als een model op Flash-niveau werkelijk de capaciteit van Pro-niveau benadert tegen prijzen van Flash-niveau, beantwoordt die vraag zichzelf voor een groot deel van de gebruikers, en Deep​Seek weet dat.

Wanneer je de vragenlijst samen met de formulering 'nieuwe structuur' leest, suggereert hij dat V4.1 Flash de eerste zichtbare stap is van iets groters dan een puntrelease — een herpositionering van de Flash-lijn om de kloof met het vlaggenschip te verkleinen, zoals Deep​Seek herhaaldelijk een goedkoper, sneller model heeft gebruikt om de verwachtingen van de markt over wat een prijssegment je oplevert te herijken. Niets daarvan wordt bevestigd door een benchmark; het is een strategische interpretatie van een vraag van twee zinnen. Maar het is het interessantste wat Deep​Seek de hele dag over V4.1 Flash heeft gezegd.

Waar je het kunt proberen, en wat je ondertussen in productie kunt draaien.

Tijdens het testvenster is de enige plek om V4.1 Flash te bereiken de eigen API van Deep​Seek — er is geen hosting door derden van een build die over twee dagen vervalt, en niemand zou een productiepad moeten verbinden aan een model-ID dat gepland staat om te stoppen met antwoorden. Het verstandige gebruik van de komende twee dagen is evaluatie: voer je representatieve workloads uit, meet kwaliteit en echte token-economie, en behandel elk snelheidscijfer dat je ziet als anekdotisch totdat er een formele release met een modelkaart verschijnt.

Voor verkeer dat moet blijven werken, is het openbare Deep​Seek-aanbod ongewijzigd, en dat is waar een routeringslaag zijn bestaansrecht verdient. Op OrcaRouter zijn DeepSeek V4 Flash, DeepSeek V4 Pro en DeepSeek-V4-Flash-Vision-Exp allemaal bereikbaar via één API tegen de lijstprijs van Deep​Seek, die zonder enige opslag wordt doorberekend — dus de prijsverlaging van augustus is bij ons al doorgevoerd sinds de dag waarop die van kracht werd, en niet pas toen een margespreadsheet daaraan toe was. Wanneer een definitieve V4.1 Flash uiteindelijk bij providers beschikbaar komt, is dezelfde opzet de manier om dit model met lage overstapkosten te adopteren: stuur een deel van het verkeer naar het nieuwe model, behoud DeepSeek V4 Flash of V4 Pro als automatische failover, en laat de DSL van de router bepalen welke aanroepen in aanmerking komen voor het onbewezen model en welke op het werkpaard moeten blijven. Je hoeft een productiepad niet op het spel te zetten met een tweedaagse bètaversie om erachter te komen of het goed is.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash (captured September 5, 2026) showing the Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, text input, a p50 time-to-first-token of 434 ms, and the description 'DeepSeek V4 Flash efficient MoE — 284B total / 13B active params, 1M context, optimized for fast everyday workloads.'

Open vragen

• Wanneer komt de officiële release? Het signaal dat dit model markeerde, zegt dat een releasebericht "zeer binnenkort" wordt verwacht; de levensduur van twee dagen van de bèta suggereert dat Deep​Seek de wereld niet lang wil laten wachten.

• Komt de uiteindelijke build overeen met deze? Onafhankelijke testers die de testcycli van Deep​Seek volgen, merken op dat het bedrijf meerdere kandidaat-builds parallel lijkt te draaien, en de snelste kandidaat in een vroege test is niet altijd degene die wordt uitgebracht — dus de snelheidscijfers van vandaag beschrijven mogelijk niet het GA-model.

• Wat zijn de specificaties? Het aantal parameters, de architectuurdetails, de contextlengte en de volledige lijst van invoermodaliteiten zijn allemaal niet gepubliceerd, en dat zijn allemaal de eerste dingen die een echte review nodig heeft.

• Houdt de prijs stand, en overleeft "lagere kosten" het contact met echte workloads? De bèta factureert tegen DeepSeek V4 Flash-tarieven; een lancering zou een nieuwe tariefkaart kunnen brengen, en de kosten per taak zijn niet gemeten.

• Kan het echt dienstdoen als Pro? De vragenlijst stelt de vraag, maar alleen onafhankelijke evaluaties op agentic- en reasoning-suites — de benchmarks die vandaag de dag het Flash-niveau van het Pro-niveau scheiden — kunnen die beantwoorden.

Als je een DeepSeek-sleutel hebt, is het de tweedaagse klok waar het om draait: roep deepseek-v4.1-flash-expires-on-0910 aan voordat hij verdwijnt, draai je eigen workloads en zet de cijfers onder 'door de community gemeten, omstandigheden variëren'. Voor alle anderen is het releasebericht waar je op moet letten, en de vraag erachter — of het goedkoopste prijsniveau van DeepSeek zich net is gaan richten op het duurste.

Terwijl de tweedaagse bèta zich nog stabiliseert, is het stabiele Flash-model dat je vandaag daadwerkelijk kunt draaien nog maar één API-aanroep verwijderd: DeepSeek V4 Flash op OrcaRouter — tegen de lijstprijs van Deep​Seek, doorberekend met 0% opslag.

En het vlaggenschip waarmee de bètavragenlijst testers steeds vraagt V4.1 Flash te vergelijken: DeepSeek V4 Pro op OrcaRouter.

Vergeleken in dit artikel3

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt