Een hero-titelkaart voor DeepSeek-V4-Flash-Vision-Exp met de ondertitel 'Zelfde prijs als V4-Flash, nu met ogen', een oog-en-prijskaartje-lijnpictogram, een klein afgerond label met de tekst 'EXPERIMENTEEL • API • 2026-08-21' en het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

DeepSeek V4 Flash Vision (Exp) lanceert op de API: zelfde prijs als V4-Flash, nu met ogen

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

DeepSeek V4 Flash Vision (Exp) is vandaag, 21 augustus 2026, live gegaan op het Deep​Seek API-platform, en het belangrijkste getal in de aankondiging is geen benchmark — het is de prijs: dit experimentele vision-model rekent exact dezelfde token-tarieven als DeepSeek V4 Flash, het tekst-only werkpaard waarvan het de pure-tekstcapaciteiten ronduit evenaart. Daarmee is dit de eerste keer dat Deep​Seek's eigen API überhaupt afbeeldingen accepteert, en het betekent dat de goedkoopste manier om een 1M-context-agent te draaien zojuist gratis multimodaal is geworden.

Wat er daadwerkelijk is uitgebracht

DeepSeek V4 Flash Vision (Exp) is een experimenteel multimodaal model, toegankelijk met de model-ID deepseek-v4-flash-vision-exp. Het neemt tekst en afbeeldingen als invoer en produceert tekst als uitvoer, over een contextvenster van 1M tokens met een maximale uitvoer van 384K, in zowel denk- als niet-denkmodi. Het ondersteunt het Chat Completions-formaat, Anthropic-stijl Messages en het Responses-formaat — het trio dat een agentframework nodig heeft om het aan te sluiten zonder aangepaste adapter.

Bij beeldinvoer accepteert Deep​Seek JPEG, PNG, GIF en WebP, die op drie manieren kunnen worden doorgegeven: inline base64, een externe URL, of een bestand geüpload via de nieuwe Files API. Er is nog geen video- of audio-invoer — de 'vision' is hier alleen voor stilstaande beelden.

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

De eigen positionering van Deep​Seek, in zijn releasebericht: pure-tekstcapaciteit — agents, redeneren, wereldkennis — is op gelijk niveau met de officiële DeepSeek V4 Flash-release, terwijl de multimodale agentcapaciteit een grote sprong maakt en dicht bij Opus-4.8 uitkomt. Dat is een leveranciersclaim, niet gereproduceerd, en het is de moeite waard om zorgvuldig te lezen, omdat het benchmarkdetail erachter interessanter is dan de kop.

Waarom de benchmarkstijging groter is dan het lijkt

Alle onderstaande cijfers zijn afkomstig van Deep​Seek zelf, vandaag gepubliceerd in de lanceringsnotitie, en niet onafhankelijk geverifieerd. Bij de agent-benchmarks die schermafbeeldingen en afbeeldingen bevatten, leest de tekst-only DeepSeek V4 Flash deze niet — het negeert eenvoudigweg de multimodale delen van de taak. DeepSeek V4 Flash Vision (Exp) kijkt daadwerkelijk, en daarom zijn de verschillen zo groot:

• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2 (Opus-4.8 39.4)

• Agents' Last Exam — Vision-Exp 27.3 vs V4-Flash 25.2 (Opus-4.8 25.7)

• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7 (Opus-4.8 85.0)

• NL2Repo — Vision-Exp 57,7 versus V4-Flash 54,2 (Opus-4.8 69,7)

• DeepSWE — Vision-Exp 59.3 tegen V4-Flash 54.4 (Opus-4.8 58.0)

• Chartography — Vision-Exp 64.3 (alleen-tekst V4-Flash kan dit niet aan)

• ZeroBench Pass@5 — Vision-Exp 35.0 (alleen-tekst V4-Flash kan het niet proberen)

A single-column scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp — the scoreboard' listing Context 1M tokens, Max output 384K tokens, Input text + images, Image billing up to 384 tokens each, ApexBench Pass@1 36.5, Status experimental — no GA date, with a footer reading 'All benchmark figures vendor-reported; no independent scores yet.'

Twee van die cijfers verdienen een tweede blik. Op Agents' Last Exam verslaat Vision-Exp (27,3) Opus-4.8 (25,7) nipt, en op DeepSWE verslaat het Opus-4.8 (59,3 tegen 58,0) ook. Dat is waar "dicht bij Opus-4.8" feitelijk op berust — niet één topresultaat, maar een reeks agentische benchmarks waarbij het zien van het scherm het grootste deel van de kloof met het toonaangevende multimodale model overbrugt, terwijl het dat model qua prijs met ruwweg een orde van grootte onderbiedt.

Wat een afbeelding kost, tot op de decimaal

Afbeeldingen worden voor facturatie getokeniseerd — maximaal 384 tokens per stuk — en worden vervolgens tegen dezelfde prijs per token in rekening gebracht als Deep​Seek V4 Flash. Omdat Deep​Seek al zijn modellen op 16 augustus 2026 heeft overgezet naar piek-/dalprijzen, hangen de exacte bedragen af van het moment waarop je aanroept:

• Invoer, cache miss — $0,22 per 1M tokens buiten piek, $0,44 piek

Invoer, cache hit — $0,007 per 1M tokens buiten piekuren, $0,014 piekuren

Output — $0.66 per 1M tokens buiten piekuren, $1.32 piek

• Piekuren — 01:00–04:00 en 06:00–10:00 UTC (alle andere uren zijn daluren)

Doe de berekening en de kosten van vision verdwijnen bijna. Eén afbeelding op de limiet van 384 tokens kost als invoer ongeveer 0,0085 cent buiten de piek en 0,017 cent tijdens de piek. Een agent die in één run 50 screenshots leest, voegt ruwweg een halve cent aan invoertokens toe — voordat het model ook maar zijn eerste uitvoertoken schrijft. Deep​Seek begrenst de resolutie ook vóór de inferentie: het lage detailniveau schaalt om naar 512×512, en hoog/origineel schaalt de afbeelding vooraf (kleine afbeeldingen omhoog tot ongeveer 384×384, grote omlaag tot ongeveer 800×800), zodat een origineel met hoge resolutie nooit in zijn oorspronkelijke pixelformaat aan het model wordt aangeboden.

De ondersteunende cast: een gratis Files API en Harness 0.1.1

Bij het model zijn twee infrastructuurcomponenten meegeleverd. De Files API is live en gratis: upload een afbeelding één keer, verwijs ernaar via file_id en hergebruik deze in meerdere requests zonder de bytes opnieuw te sturen — relevant voor een browsing-agent die een pagina gedurende meerdere beurten in de context houdt. En Deep​Seek Harness 0.1.1, die op dezelfde dag is uitgebracht, biedt directe ondersteuning voor het nieuwe model, zodat de harness die Deep​Seek agentische workloads benchmarkt en aandrijft, er meteen mee aan de slag kan.

De productiekanttekening, duidelijk gezegd

Dit is een experimenteel model. Deep​Seek labelt het expliciet als zodanig, heeft geen GA-datum aangekondigd en raadt af om het direct in productie te draaien; het aangekondigde plan is om te itereren op feedback en later een stabiele versie uit te brengen. Het praktische gevolg is dat het tekstbrein bewezen is — het is dezelfde gewichtenfamilie die V4-Flash aandrijft — maar het visionpad is nieuwe code, en niemand buiten Deep​Seek heeft het op schaal getest.

Dat is precies de situatie waarin een routinglaag zijn bestaansrecht bewijst. Op OrcaRouter zijn zowel deepseek/deepseek-v4-flash-vision-exp als deepseek/deepseek-v4-flash live achter één API, tegen Deep​Seek's lijstprijs, zonder opslag. Je kunt verkeer met afbeeldingen naar het experimentele model sturen en in dezelfde configuratie een automatische failover naar een fallback instellen op het moment dat het een fout geeft of een time-out optreedt — wat het hele 'nieuwe code'-probleem minder risicovol maakt. De routing-DSL stelt je ook in staat om alleen de aanroepen die daadwerkelijk afbeeldingen bevatten naar het visiemodel te sturen en puur tekstverkeer op DeepSeek V4 Flash te houden, waarmee je de benchmarkwinsten meepakt waar ze bestaan en niets extra betaalt waar ze niet bestaan.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash-vision-exp showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text + Image', 'Output: text', p50 TTFT 275 ms, and the model description 'Experimental vision-enabled variant of DeepSeek V4 Flash: text + image in, text out'.

Wat nu te kijken

De open vragen zijn de gebruikelijke voor een experimentele lancering. Wanneer bereikt DeepSeek V4 Flash Vision (Exp) GA, en blijft de prijs overeind? Volgt er video- of audio-invoer? Het model ondersteunt vandaag alleen stilstaande beelden, waardoor de grote multimodale grensmodellen zonder tegenstand blijven op het gebied van bewegende media. En reproduceren de onafhankelijke evaluaties (de eerste externe run op ApexBench of Terminal-Bench) de gepubliceerde cijfers? Het interessante is dat zelfs als elke benchmark lager uitvalt, de enige claim die nu al kosteneffectief is — beeldherkenning tegen tekstprijzen — een prijsfeit is, geen benchmarkclaim, en dat hoeft niet gereproduceerd te worden.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube