Een hero-titelkaart voor 'DeepSeek-V4-Flash-Vision-Exp vs DeepSeek-V4-Flash' met de ondertitel 'Zelfde prijs, één ziet', een ooglijnpictogram aan de linkerkant en een tekstdocument-lijnpictogram aan de rechterkant, gescheiden door een dunne neutrale scheidingslijn, en het OrcaRouter-logo in de rechterbenedenhoek.
Guides & Insights

DeepSeek V4 Flash Vision (Exp) vs DeepSeek V4 Flash: Zelfde prijs, één ziet

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

DeepSeek V4 Flash Vision (Exp) en DeepSeek V4 Flash zijn hetzelfde model met precies één verschil, en dat verschil is het hele verhaal: het visiemodel ziet afbeeldingen en het tekstmodel niet. Vandaag gelanceerd, 21 augustus 2026, als een experimentele release, behoudt DeepSeek V4 Flash Vision (Exp) het tekstbrein van DeepSeek V4 Flash ongewijzigd — dezelfde 1M-token context, dezelfde 384K maximale output, dezelfde tokenprijzen — en voegt beeldinvoer toe die de scores herschikt op de agent-benchmarks waar het tekstmodel stilletjes faalt. De enige echte vraag is of "experimenteel" je meer kost dan het bespaart.

De twee modellen

DeepSeek V4 Flash is het officiële budgetwerkpaard van het bedrijf: een Mixture-of-Experts-model met ongeveer 284B totale parameters en 13B actief, alleen-tekst, geoptimaliseerd voor dagelijkse workloads met hoge gelijktijdigheid, met een gelijktijdigheidsbudget van 2.500 tokens per seconde op de API van de leverancier. DeepSeek V4 Flash Vision (Exp) is dezelfde gewichtenfamilie met een vision-encoder ervoor, identiek gefactureerd en als experimenteel gemarkeerd. Alles onder de ogen wordt gedeeld.

• Parameters — Vision-Exp: 284B totaal / 13B actieve MoE versus V4-Flash: 284B totaal / 13B actieve MoE (zelfde familie)

• Invoer — Vision-Exp: tekst + afbeeldingen (JPEG, PNG, GIF, WebP) vs V4-Flash: alleen tekst

• Context — Vision-Exp: 1M tokens vs V4-Flash: 1M tokens

• Maximale output — Vision-Exp: 384K tokens vs V4-Flash: 384K tokens

• Denkmodi — beide ondersteunen denken en niet-denken

• API-formaten — beide: Chat Completions, Messages, Responses

• Prijs — identiek (beide factureren tegen V4-Flash's piek-/daltarieven voor tokens)

• Status — Vision-Exp: experimenteel, geen GA-datum vs V4-Flash: officiële release (V4-Flash-0731)

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

Waar visie het scorebord verandert

Wat pure tekst betreft, zegt Deep​Seek dat de twee gelijkwaardig zijn, en er is geen reden om daaraan te twijfelen — het visionmodel is gebouwd op dezelfde tekstcapaciteit. De divergentie komt naar voren bij agent-benchmarks die screenshots, grafieken en UI-afbeeldingen bevatten, waar het tekst-only model de multimodale inhoud letterlijk negeert. Alle onderstaande cijfers zijn door de leverancier gerapporteerd uit de lanceringsnotitie van vandaag, niet onafhankelijk gereproduceerd:

• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2

• Agents' Last Exam — Vision-Exp 27.3 versus V4-Flash 25.2

• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7

• NL2Repo — Vision-Exp 57.7 vs V4-Flash 54.2

• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4

• Chartography — Vision-Exp 64.3 (V4-Flash kan het niet proberen)

• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash kan het niet proberen)

A two-column comparison scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp vs DeepSeek-V4-Flash — the scoreboard': left column DeepSeek-V4-Flash-Vision-Exp — Input text + image, Context 1M tokens, Max output 384K, ApexBench Pass@1 36.5, Price $0.22/M off-peak, Status experimental; right column DeepSeek-V4-Flash — Input text only, Context 1M tokens, Max output 384K, ApexBench Pass@1 26.2, Price $0.22/M off-peak, Status official release; footer 'Benchmark figures vendor-reported; pricing per DeepSeek API docs.'

De grootste sprong is ApexBench, waar het toevoegen van visuele invoer de score verhoogt van 26,2 naar 36,5 — een sprong van tien punten die niet komt doordat het model harder nadenkt, maar doordat het de taak eindelijk leest. Voor een agent die via een scherm werkt — een browser, een desktop, een terminal met gerenderde uitvoer — vloog het tekstmodel blind op precies de delen van de taak die de informatie bevatten.

De prijsvraag heeft één antwoord.

Er is geen prijsverschil, en hier wordt de vergelijking in één richting een no-brainer. DeepSeek V4 Flash Vision (Exp) rekent exact dezelfde tarieven als DeepSeek V4 Flash, die sinds 16 augustus 2026 piek/dal-tarieven hanteert:

• Invoer, cache miss — $0,22 per 1M tokens buiten de piek, $0,44 piek (beide modellen)

• Input, cache hit — $0.007 per 1M tokens buiten piek, $0.014 piek (beide modellen)

• Output — $0,66 per 1M tokens buiten piek, $1,32 piek (beide modellen)

• Piekuren — 01:00–04:00 en 06:00–10:00 UTC, beide modellen

Wat vision extra kost, is alleen de afbeelding zelf: elke afbeelding wordt getokeniseerd tot maximaal 384 tokens, dus een screenshot kost buiten de piekuren ruwweg 0,0085 cent. Zelfs een vision-intensieve agent die 50 afbeeldingen per run leest, voegt minder dan een cent aan invoer toe. Kiezen voor het tekstmodel om geld te besparen, betekent centen verkiezen boven ogen — de besparing is niet echt.

Wanneer welke kiezen

Kies DeepSeek V4 Flash Vision (Exp) als je pipeline ooit een afbeelding kan ontvangen. UI-testing en op screenshots gebaseerde QA-agents, web-browsing-agents die de pagina moeten lezen waarop ze zich bevinden, extractie van grafieken en diagrammen, documentscreenshots, vastlegging van foutmeldingen van een gebruikersscherm — in al deze gevallen is het visiemodel het strikt betere model voor dezelfde prijs. Er is geen kwaliteitsverlies voor tekst, volgens de leverancier, dus de enige reden om het niet te gebruiken is stabiliteit.

Kies DeepSeek V4 Flash als je verkeer puur tekst is en er niets aan zal veranderen. Voor code-aanvulling, retrieval en tekst-only agent-loops scoren de twee modellen hetzelfde op tekst en is de officiële release per definitie de veiligere keuze. Als je al op V4-Flash zit en nooit een afbeelding verstuurt, is er geen reden om over te stappen — en ook geen reden om de optie niet in je routingconfiguratie te hebben.

Het enige echte verschil: experimentele status

Alles boven de ogen is identiek; de kosten van visie zijn verwaarloosbaar; de benchmarks zijn in het voordeel van het visionmodel. De enige factor die je legitiem op DeepSeek V4 Flash in productie kan houden, is dat het visionmodel experimenteel is. Deep​Seek bestempelt het als zodanig, geeft geen GA-datum en zegt dat het niet wordt aanbevolen voor productiegebruik. Het tekstbrein erachter is bewezen, maar het visionpad is nieuw, en een experimenteel API-oppervlak is precies waar je geen stille fout wilt hebben om 2 uur 's nachts.

Dit is de enige plek waar de vergelijking niet door specificaties wordt beslist, en ook de enige plek waar een router het antwoord verandert. Op OrcaRouter zijn beide modellen live — deepseek/deepseek-v4-flash-vision-exp en deepseek/deepseek-v4-flash — achter één API-sleutel tegen de lijstprijs van de provider, zonder enige opslag. Omdat hetzelfde platform beide routeert, kun je het vision-model inzetten waar het zichzelf terugverdient en de rest vastpinnen aan de officiële release, met automatische failover zodat een experimentele hapering nooit de hele pijplijn platlegt. Je krijgt de tienpuntswinst op ApexBench voor de aanroepen die dat nodig hebben en de stabiliteit van de officiële release voor de aanroepen die dat niet nodig hebben, zonder een tweede contract of een tweede codepad.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash showing the Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text', a price block of $0.15 input / $0.29 output per 1M tokens with p50 TTFT 602 ms, and the model description 'DeepSeek V4 Flash efficient MoE — 284B total / 13B active params, 1M context'.

Kortom

Als je workload afbeeldingen kan ontvangen, verslaat DeepSeek V4 Flash Vision (Exp) DeepSeek V4 Flash op elk vlak dat ertoe doet en verliest het alleen op het ene vlak waar je omheen kunt werken: experimentele status. Als je workload puur tekst is, zijn de modellen gelijkwaardig qua output en wint de officiële release op stabiliteit. De twee zijn niet echt concurrenten — het vision-model is het tekstmodel met een ontgrendelde vaardigheid, zonder extra kosten. De enige beslissing die de moeite waard is, is hoeveel van je verkeer je bereid bent naar een experimentele API te sturen, en dat is een routeringsbeslissing, geen modelbeslissing.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube