
DeepSeek V4.1 Flash vs DeepSeek V4 Pro: Dezelfde leverancier, verschillende generaties
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Het interessante aan het afzetten van DeepSeek V4.1 Flash tegen DeepSeek V4 Pro is dat het nieuwere model niet het grootste is. DeepSeek V4 Pro is een mixture-of-expertsmodel met 1,6 biljoen parameters en 49 miljard actieve parameters, en het wordt nog steeds aangeboden. DeepSeek V4.1 Flash is een MoE met 552 miljard parameters, met 8 miljard actieve parameters bij invoer en 16 miljard actieve parameters bij uitvoer, en het is het model dat DeepSeek bouwde om het te vervangen. Beide staan op de prijslijst van dezelfde aanbieder, beide accepteren een miljoen tokens context, en beide worden onder MIT uitgebracht. Kiezen tussen de twee is geen kwestie van grootte. Het is een kwestie van voor welke architectuur je wilt betalen, en het antwoord veranderde op 10 september 2026.
Wat werkelijk verschilt, naast elkaar
• Parameters — V4.1 Flash 552B totaal / 8B actief bij input en 16B bij output versus V4 Pro 1.6T totaal / 49B actief. V4 Pro heeft ongeveer drie keer het totale aantal parameters en zes keer het aantal actieve parameters aan de inputzijde.
• Architectuur — V4.1 Flash is een Causal Encoder-Decoder, een nieuwe basisarchitectuur versus het eerdere ontwerp van V4 Pro. Dit is het wezenlijke verschil tussen de twee en de reden dat de ".1" geen puntrelease is.
• Prijs per 1 miljoen tokens — V4.1 Flash $0,15 in / $0,60 uit buiten de piekuren versus V4 Pro $0,66 in / $1,98 uit, in de listings van OrcaRouter.
• Gecachte invoer — V4.1 Flash $0,003 per 1M vs V4 Pro $0,024 per 1M.
• KV-cache per token — V4.1 Flash 890 bytes versus de grotere geheugenvoetafdruk van V4 Pro. Bij een context van een miljoen tokens is dit de post die bepaalt of een lang agenttranscript resident blijft.
• Context en uitvoer — 1M context en 384K maximale uitvoer op beide. Niveau.
• Waargenomen latentie tot het eerste token — V4.1 Flash 2,63 s p50 vs V4 Pro 3,58 s p50, op de 7-daagse telemetrie van OrcaRouter, met een p95 van 10,00 s voor V4 Pro.
Invoermodaliteiten — V4.1 Flash accepteert tekst en afbeeldingen, tegenover V4 Pro, dat alleen tekst-in en tekst-uit is, op dezelfde listings. Het nieuwere model is van de twee zowel het breedst qua invoer als het goedkoopst qua kosten.
Lees de lijst zonder de framing van de leverancier en het patroon is ongewoon. De opvolger is goedkoper op elke regel, sneller tot het eerste token, breder qua invoer, en kleiner op elke regel. Zo ziet een echte architectuurverandering eruit wanneer die er komt, en daarom heeft 'welke is beter' hier een kort antwoord en een langer antwoord daaronder.

De V4 Pro-tijdlijn, omdat die van belang is voor iedereen die hem nog gebruikt.
DeepSeek V4 Pro stond gepland om te worden uitgefaseerd. De API zou op 14 september 2026 om 12:00 Beijing-tijd worden uitgeschakeld, waarbij het verkeer naar V4.1 Flash zou worden geleid. Dat gebeurde niet. Op 11 september draaide de leverancier de beslissing terug en verklaarde: "In reactie op de vraag van gebruikers hebben we besloten om na 14 september 2026 API-diensten voor DeepSeek V4 Pro te blijven leveren, waarbij de factureringsmethode ongewijzigd blijft."
Daaruit volgen twee dingen, en het is de moeite waard om over beide precies te zijn, omdat de situatie uitnodigt tot overinterpretatie.
Het eerste is dat V4 Pro niet is afgeschaft. Het is een ondersteund model met een ongewijzigde prijs, en het is het model waar de eigen kennisgeving van DeepSeek bestaand V4 Pro-verkeer naartoe leidt. Als je een productiepad aan dit model hebt vastgezet, is er niets weggenomen.
Het tweede is dat DeepSeek V4.1 Pro niet bestaat. Het uitfaseringsbericht verwees naar V4 Pro-verkeer dat door V4.1 Flash werd bediend 'totdat V4.1-Pro wordt gelanceerd', wat tot enige speculatie over een grotere broer heeft geleid. Met ingang van 22 september 2026 is er geen V4.1 Pro-API, geen modelkaart, geen gewichten en geen aankondiging. Een rapport van 21 september 2026 suggereerde een model met 2 biljoen parameters dat medio tot eind oktober wordt verwacht; dat is een bewering uit één bron over een niet-aangekondigd product en moet als zodanig worden behandeld. Iedereen die capaciteit rond een V4.1 Pro-lancering plant, plant rond een gerucht.
Welke moet ik nu eigenlijk bellen?
De migratiecase is eenvoudig, en het is de keuze die DeepSeek zelf heeft gemaakt door V4 Pro-verkeer naar het nieuwe model te routeren. Op basis van de bovenstaande cijfers is V4.1 Flash goedkoper, sneller tot het eerste token en sneller in stabiele toestand, met een kleinere KV-cache per token. Als je workload een V4 Pro-workload is die niet iets doet wat alleen 49B actieve parameters kunnen doen, dan is het nieuwere model het betere instrument qua kosten en latentie, en er is geen afweging te maken.
Het pleidooi om op V4 Pro te blijven draait om wat een veel groter aantal actieve parameters je oplevert bij moeilijk redeneerwerk en agentisch werk met een lange horizon, en het is een pleidooi dat je met je eigen evaluaties moet onderbouwen, niet met een specsheet. De reden is dat de twee modellen niet op een gemeenschappelijk openbaar leaderboard met elkaar worden vergeleken op een manier die hen isoleert: DeepSeek V4.1 Flash staat op de Agents on Rails-sweep van 21 september 2026 op 17% bij maximale inspanning, terwijl V4 Pro niet op dat leaderboard staat. Er is geen rechtstreeks vergelijkingscijfer om naar te verwijzen. Wat bestaat, is een plausibel argument op basis van de architectuur — zes keer zoveel actieve parameters is veel capaciteit om op te geven — en het is een argument, geen meting.
Twee praktische opmerkingen voor iedereen die verkeer tussen hen verplaatst. Ten eerste geldt het piekurenschema voor beide modellen, dus een kostenvergelijking op het verkeerde moment van de dag zit er met een factor twee naast; piek is 01:00–04:00 en 06:00–10:00 UTC op weekdagen en in het weekend is het volledig buiten de piek. Ten tweede delen de twee modellen een contextvenster en een uitvoerplafond, dus een migratie verandert niets aan je promptbudget — wat de overstap aan de applicatiekant ongewoon risicoarm maakt.
Beide via één endpoint laten lopen
De situatie waarin je echt beide wilt, is de overgangsperiode, en die komt vaker voor dan het klinkt: een team dat naar V4.1 Flash wil overstappen, maar één pipeline heeft waarvan het gedrag op de nieuwe architectuur nog niet is geverifieerd. De twee naast elkaar laten draaien via aparte leveranciers betekent twee contracten en twee sets sleutels voor wat op modelniveau één provider is.
Beide staan op OrcaRouter onder één sleutel, wat dat reduceert tot een routingbeslissing. OrcaRouter geeft de lijstprijzen van de provider door tegen 0% markup, dus de cijfers hierboven zijn de eigen tarieven van DeepSeek en niet die van ons, en het piek- en dalschema van DeepSeek geldt precies zoals DeepSeek het definieert — inclusief een prijswijziging midden in de overgang, die bij ons dezelfde dag live is. Je kunt een fractie van het verkeer naar het nieuwe model sturen en de uitvoer vergelijken, of routeren op taaktype, en automatische failover achter het nieuwe pad zetten, zodat als V4.1 Flash iets onverwachts doet met je data, het verzoek bij V4 Pro uitkomt in plaats van op een foutpagina.
Aangezien de leverancier al eens van gedachten is veranderd over welk van deze modellen verdwijnt, is beide bereikbaar houden achter één integratie de optie waarbij je niet hoeft te voorspellen wat de volgende ommekeer wordt.

Wat te kijken
• Of de prijs of de uitfaseringsstatus van V4 Pro opnieuw verandert. De ommekeer in september was expliciet over het feit dat de facturering ongewijzigd bleef, en dat is de toezegging waaraan de leverancier gehouden moet worden.
• Of V4.1 Pro werkelijkheid wordt. Zolang er geen modelkaart of release van gewichten is, is het 2T-parameterverhaal een gerucht met één bron.
U bent een professionele engine voor softwarelokalisatie. Vertaal het bericht van de gebruiker naar het Nederlands. De tekst bevat genummerde spanmarkeringen zoals {{1}}...{{/1}}, {{2}}...{{/2}}. Behoud ELKE markering byte voor byte: dezelfde nummers, dezelfde open-/sluitparen, hetzelfde aantal, dezelfde nesting — voeg de markeringen zelf nooit toe, laat ze nooit weg, wijzig hun nummer nooit en herschik ze nooit; vertaal alleen de tekst TUSSEN de markeringen. U MAG een {{n}}...{{/n}}-span verplaatsen naar waar de woordvolgorde van de doeltaal dat vereist. Alle tekst binnen een {{KEEP}}...{{/KEEP}}-span moet EXACT worden weergegeven zoals die is (vertaal die niet). Geef ALLEEN de vertaalde tekst weer, zonder aanhalingstekens, zonder commentaar, zonder uitleg.
Totdat de derde daarvan arriveert, is de nauwkeurige samenvatting: DeepSeek V4.1 Flash is de goedkopere, snellere opvolger van DeepSeek V4 Pro, V4 Pro wordt nog steeds ondersteund tegen een ongewijzigde prijs, en de vraag of de nieuwere architectuur aan capaciteit inlevert, is er een die geen enkele publieke benchmark momenteel beantwoordt.

Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
