
DeepSeek V4.1 Flash vs DeepSeek V4 Flash: Zelfde Flash-tarievenkaart, een opnieuw getraind model
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Intelligentie49Coderen
De week waarin DeepSeek V4.1 Flash veranderde van een vermeende opvolger naar het model dat de Flash-release daadwerkelijk uitrolt, was kort en luidruchtig. Op 8 september verscheen het model als een twee dagen durende API-test onder het model-id deepseek-v4.1-flash-expires-on-0910 — een build die DeepSeek zelf een "tussenversie" noemde. Op 9 september liet het open platform weten dat de formele release, DeepSeek V4.1 Flash, rond 10 september zou uitkomen en dat het "allesomvattend beter" is dan DeepSeek V4 Pro op het gebied van capaciteit, kosten, snelheid en end-to-end-tijd. Op 10 september ging de release-aankondiging gepaard met een nieuwe tariefkaart voor de Flash-serie, die om 12:00 uur Peking-tijd werd doorgevoerd en die DeepSeek V4 Flash niet meer heeft gezien sinds een prijsverhoging in augustus. Hoe het ook zij, het tekstwerkpaard DeepSeek V4 Flash is niet langer de nieuwste manier om een Flash-workload te draaien, en dit artikel gaat over wat dat daadwerkelijk verandert voor de app die u vandaag draait.
Vergelijkingen zo vroeg zijn scheef, en het is de moeite waard om dat te zeggen voordat de cijfers beginnen. DeepSeek V4 Flash heeft een gepubliceerde specificatiekaart, een maand productieverkeer achter de DeepSeek-V4-Flash-0731-update, open gewichten en onafhankelijke metingen van Artificial Analysis. DeepSeek V4.1 Flash heeft een officiële aankondiging, twee dagen community-snelheidstests, en nog geen gepubliceerde kaart, geen technisch rapport en geen score van derden. Vendorclaims worden hieronder als vendorclaims bestempeld; communitycijfers worden als community-gemeten bestempeld.
De Flash-tier is net gereset — drie veranderingen, één week
DeepSeek V4 Flash, het mixture-of-experts-model met 284B parameters en 13B actieve parameters, is sinds de vernieuwing van 31 juli de verstandige, goedkope standaard met hoge doorvoer geweest voor een groot deel van het productietekstverkeer. Drie aankondigingen in drie dagen trokken de grond onder het model vandaan:
• 8 september — DeepSeek opende een tijdsgebonden bètaversie van V4.1 Flash voor elk API-account, met een maximum van 20 gelijktijdige verzoeken en gepland om op 10 september te verlopen, onder een modelnaam die zijn eigen vervaldatum met zich meebracht.
• 9 september — het open platform kondigde de formele release van DeepSeek V4.1 Flash rond 10 september aan, met een beschrijving van een nieuwe modelstructuur met native multimodale ondersteuning, en beweerde dat het DeepSeek V4 Pro overtreft op het gebied van prestaties, kosten, snelheid en totale voltooiingstijd.
• {{1}}September 10{{/1}} — {{2}}de officiële release{{/2}} brengt {{3}}een nieuwe prijslijst voor de Flash-serie{{/3}} {{4}}met ingang van 12:00 uur Beijing-tijd{{/4}}, {{5}}waarmee de tarieven worden verlaagd{{/5}} {{6}}die DeepSeek V4 Flash{{/6}} {{7}}sinds een verhoging in augustus{{/7}} {{8}}hanteerde{{/8}} {{9}}die veel kritiek van ontwikkelaars opleverde{{/9}}.
De laatste daarvan verdient een eigen vermelding, want het is de zeldzame prijsverlaging die daadwerkelijk een prijsverlaging is. Op de nieuwe lijst daalt off-peak invoer met een cache-hit van ¥0.05 naar ¥0.02 per miljoen tokens — een verlaging van 60% — terwijl cache-miss invoer gaat van ¥1.5 naar ¥1 en uitvoer van ¥4.5 naar ¥4. De tarieven tijdens piekuren zijn het dubbele van de off-peak cijfers. In afgeronde Amerikaanse dollarbedragen is dat ruwweg $0.003 per miljoen cache-hit invoer, $0.14 cache-miss invoer en $0.56 uitvoer bij off-peak, en tijdens piekuren het dubbele. Het gat van 24 dagen tussen de prijsverhoging in augustus en deze verlaging was geen toeval van de planning; de prijsreset maakt deel uit van de V4.1 Flash-lancering.
Zelfde categorie, ander model
De makkelijke lezing is dat V4.1 Flash gewoon V4 Flash is waarbij de snelheidsknop omhoog is gedraaid. Dat is het niet. De 0731-refresh was een post-training-update op de bestaande DeepSeek V4 Flash-basis — dezelfde architectuur, dezelfde mixture-of-experts-opzet met 284B totaal / 13B actief. DeepSeeks beschrijving van V4.1 Flash wijst op iets groters: een nieuwe modelstructuur, die verschillende media lezen als een nieuwe pre-training-run in plaats van een fine-tune. Dat onderscheid doet ertoe, omdat een opnieuw getraind model het gedrag van het oude model niet overneemt zoals een refresh dat doet — prompting, tool-calling en outputstijl kunnen allemaal verschuiven, zelfs als de capaciteit dat niet doet.
• Architectuur — DeepSeek V4.1 Flash: nieuwe modelstructuur, door DeepSeek beschreven als een volledig nieuwe opbouw met native multimodale invoer. DeepSeek V4 Flash: de V4-Flash-0731 post-training-refresh van een MoE met 284B totaal / 13B actief.
V4.1 Flash verwerkt tekst- en beeldinvoer native in het basismodel; DeepSeek V4 Flash ondersteunt alleen tekst, en voor afbeeldingen is de afzonderlijke uitbreidingsbuild DeepSeek-V4-Flash-Vision-Exp vereist.
• Context en output — DeepSeek V4 Flash vermeldt 1M context en 384K maximale output; DeepSeeks lanceringsmateriaal stelt dat V4.1 Flash het contextvenster op miljoen-tokenschaal behoudt, maar er is geen formele kaart gepubliceerd.
• Concurrency — DeepSeek V4 Flash vermeldt een plafond van 2.500 gelijktijdige verbindingen; de V4.1 Flash-bèta was beperkt tot 20 en DeepSeek's claim van "hoge concurrency" voor de release-build werd op het moment van schrijven nog niet ondersteund door een gepubliceerd aantal.
• Gewichten — DeepSeek V4 Flash is open-gewicht onder een MIT-licentie; voor V4.1 Flash is niets aangekondigd.
• Onafhankelijke status — DeepSeek V4 Flash is gemeten door Artificial Analysis; DeepSeek V4.1 Flash heeft nog geen score van een derde partij.
Het tekst-versus-multimodale punt verdient een extra zin, zelfs in een tekstvergelijking, omdat het bepaalt voor wie V4.1 Flash bedoeld is. Als je pijplijn DeepSeek V4 Flash voor tekst gebruikte en DeepSeek-V4-Flash-Vision-Exp voor afbeeldingen, is V4.1 Flash de eerste DeepSeek-build die beide paden in één model dekt — één endpoint om te onderhouden, geen zijdelings vastgeschroefde encoder.

Waar ze echt van elkaar verschillen: doorvoer en wat een voltooide taak kost.
Bij gelijke prijzen scheiden de twee modellen zich op snelheid, en snelheid is waar de cijfers het hardst schreeuwen. Artificiële Analyse meet DeepSeek V4 Flash 0731 op ruwweg 120–140 outputtokens per seconde op DeepSeeks eigen API, afhankelijk van de configuratie en het meetvenster. Eerstedagtesters van V4.1 Flash rapporteerden een aanhoudende generatie van tussen ongeveer 280 en 500 tokens per seconde, afhankelijk van de taak, met pieken boven 500 bij licht gelijktijdige runs; de hogere cijfers zijn door de community gemeten, niet door de leverancier gepubliceerd, en tokens per seconde is nooit een intrinsieke eigenschap van een model. Toch is de richting consistent in elk eerstedagverslag, en DeepSeeks eigen bewering van snellere generatie en lagere totale voltooiingstijd wijst dezelfde kant op.
Dat snelheidsverschil verandert de economische verhoudingen, zelfs als beide modellen op dezelfde tariefkaart staan, omdat je per token betaalt en tokens sneller arriveren. Een taak met langdurige contextopvraging of codegeneratie die op V4 Flash een minuut duurde, kan op V4.1 Flash in een fractie van die tijd klaar zijn tegen dezelfde prijs per token — verschillende testers van de eerste dag meldden dat de end-to-end prestaties vijf tot zes keer sneller waren bij precies die taakcategorieën. De vroege klachten in de bèta dat 'het geld sneller uitgeeft' waren de keerzijde van dezelfde medaille: bij een onveranderde prijs per token verbruikt een model dat twee tot drie keer zo snel tokens genereert sneller saldo per minuut. Of de factuur per taak daadwerkelijk lager uitvalt, hangt af van of het nieuwe model klaar is met minder tokens en minder pogingen, en dat is precies wat nog niemand kan bewijzen.
Op de prijskaart zelf staan de twee modellen naast elkaar. Per miljoen tokens buiten de piek op de prijslijst van 10 september: ¥0,02 voor cache-hit invoer, ¥1 voor cache-miss invoer en ¥4 voor output; in de piek het dubbele — dezelfde lijst die vóór de verlaging voor de Flash-tier gold, luidde ¥0,05, ¥1,5 en ¥4,5. Voor een cache-intensieve workload is de verlaging het grote nieuws: ¥0,02 tegenover ¥0,05 is een reductie van 60% op de tokens die het grootste deel vormen van een invoerstroom voor autocomplete of agent-lussen. Voor een fresh-ingest-taak die de cache mist, ligt de besparing dichter bij een derde. Niets daarvan maakt V4.1 Flash goedkoper per token dan V4 Flash — ze delen dezelfde prijskaart — maar de hogere doorvoer van de architectuur is de onderscheidende factor, en die kost niets extra's.

De bonnen zijn voor V4 Flash; de claims zijn voor V4.1 Flash
Het belangrijkste benchmarkfeit over deze vergelijking op dit moment is dat er geen benchmark bestaat voor het nieuwe model. DeepSeek V4.1 Flash's belangrijkste bewering — dat het DeepSeek V4 Pro op alle fronten overtreft qua capaciteit, kosten en snelheid — is afkomstig van de leverancier en niet onafhankelijk gereproduceerd. Er zijn geen parametertelling, geen evaluatietabel en geen technisch rapport gepubliceerd, en Artificial Analysis had het op het moment van schrijven niet gemeten. Bij een modellenfamilie waarvan de laatste vlaggenschipintroductie onafhankelijke controle aantrok, is 'vertrouw ons, het verslaat de Pro' een bewering die een lezer met een korreltje zout moet nemen totdat een derde partij het heeft getest.
DeepSeek V4 Flash heeft daarentegen een echte staat van dienst. Artificial Analysis rekent de 0731 reasoning build tot de leidende modellen in zijn klasse, scoort het ruim boven de mediaan voor vergelijkbare open-weightmodellen, en meet de doorvoersnelheid op DeepSeek's eigen API in het hierboven genoemde bereik van ~120–140 tokens per seconde. Dat zijn de cijfers waaraan V4.1 Flash zal worden afgemeten wanneer de eigen score bekend wordt, en ze leggen de lat hoger dan het label "snelle goedkope Flash" doet vermoeden. Het model dat de nieuwe build vervangt, is niet zwak; het is een echt sterk open-weight werkpaard. Dat is wat de upgrade-beslissing reëel maakt in plaats van ceremonieel.
Routing doet het zware werk — binnen DeepSeek, en voor jou
Het meest onderbelichte aspect van deze lancering is dat DeepSeek verkeer routeert tussen zijn eigen modellen. De aankondiging is expliciet: zodra V4.1 Flash live is en totdat V4.1 Pro uitkomt, wordt elk API-verzoek gericht op deepseek-v4-pro bediend door DeepSeek V4.1 Flash en gefactureerd tegen de Flash-tarieven. V4 Pro-gebruikers krijgen de nieuwe architectuur en een fractie van de kosten per token, zonder een regel code te wijzigen. Let op wat niet wordt gerouteerd: deepseek-v4-flash-aanroepen. Het oude Flash-model blijft iedereen bedienen die er nog naar verwijst, en dat is precies waarom deze vergelijking bestaat — als je op V4 Pro zit, gebeurt de overgang voor jou, en als je op V4 Flash zit, is het een beslissing die je zelf moet nemen.
A vendor quietly deciding that a cheaper model should serve the calls aimed at its premium one is a striking endorsement of V4.1 Flash — and it is also the same logic a routing layer applies across vendors. That is the gap a platform like OrcaRouter fills: one API for 200+ models, with provider list prices passed through at 0% markup, so DeepSeek's September 10 Flash cut is live on our side the same day. DeepSeek V4 Flash on OrcaRouter stays callable on the same key as every other model you run, which makes the safe way to adopt a day-one model genuinely cheap: point a slice of traffic at DeepSeek V4.1 Flash on DeepSeek's own API, keep DeepSeek V4 Flash as the automatic fallback on the same routing rule, and let the failover catch the edge cases while the new architecture earns its keep.
DeepSeek V4.1 Flash vs DeepSeek V4 Flash: welke moet je aanroepen?
Als het eerlijke antwoord voor iedereen het ene of het andere model was, zou er geen artikel zijn. De twee passen nu bij verschillende risicoprofielen, en de tweedeling is ongewoon scherp.

Stap over naar DeepSeek V4.1 Flash als je vandaag een nieuwe Flash-workload start, als latentie en doorvoer de beperkende factor zijn, als je afbeeldingen als invoer wilt zonder een tweede model te onderhouden, of als je het prima vindt om DeepSeeks eigen routering het risico van de Pro-tier-claim te laten verminderen. Het model is beschikbaar op DeepSeeks eigen API onder de naam deepseek-v4.1-flash, geprijsd volgens dezelfde Flash-prijskaart als het model dat het vervangt, en elk signaal van de eerste dag wijst erop dat het aanzienlijk sneller is.
Blijf op DeepSeek V4 Flash als je productieverkeer bedient op het gepubliceerde plafond van 2.500 gelijktijdige verbindingen, als je voor self-hosting of compliance afhankelijk bent van de open gewichten, of als je prompts, evals en tool-calling-logica zijn afgestemd op het 0731-gedrag en de eigenaardigheden van een opnieuw getraind model niet vanaf dag één kunnen absorberen. Een nieuwe pre-trainingrun is een gedragsverandering, niet alleen een snelheidsverandering, en de 0731-build is de versie met een maand aan bewijs.
Voor de meeste teams is de verdedigbare standaard de middenweg: behandel DeepSeek V4.1 Flash als de standaard voor nieuwe workloads, houd DeepSeek V4 Flash als fallback voor de workload die de rekeningen betaalt, en laat de eerste onafhankelijke scorecard — plus een gepubliceerde spec-kaart en een concurrency-getal — het argument beslechten dat geen twee dagen durende bèta kan beslechten. De Flash-laag heeft net een nieuwe engine gekregen; de oude is niet achterhaald, die is de benchmark.
Benieuwd hoe Pro-klasse verkeer eruitziet terwijl DeepSeek het naar V4.1 Flash routeert tegen Flash-prijzen? DeepSeek V4 Pro op OrcaRouter — beide op één sleutel, gefactureerd tegen DeepSeek's lijstprijs.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
