Ett hero-titelkort för DeepSeek-V4-Flash-Vision-Exp med undertexten 'Samma pris som V4-Flash, nu med ögon', en linjeikon med öga och prislapp, en liten rundad märkning med texten 'EXPERIMENTAL • API • 2026-08-21', och OrcaRouter-logotypen i nedre högra hörnet.
Guides & Insights

DeepSeek V4 Flash Vision (Exp) lanseras på API:et: samma pris som V4-Flash, nu med ögon.

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

DeepSeek V4 Flash Vision (Exp) gick live på DeepSeek API-plattformen idag, den 21 augusti 2026, och den viktigaste siffran i tillkännagivandet är inte ett benchmark – det är priset: den här experimentella visionsmodellen debiteras med exakt samma tokenpriser som DeepSeek V4 Flash, textarbetshästen vars rena textkapacitet den matchar till fullo. Detta gör att det är första gången DeepSeeks eget API överhuvudtaget accepterar bilder, och det innebär att det billigaste sättet att köra en agent med 1M-kontext just blev multimodalt – gratis.

Vad som faktiskt levererades

DeepSeek V4 Flash Vision (Exp) är en experimentell multimodal modell som nås med modell-ID:t deepseek-v4-flash-vision-exp. Den tar emot text och bilder och producerar text, över ett kontextfönster på 1M-token med en maximal utdata på 384K, i både tänkande och icke-tänkande lägen. Den stöder Chat Completions-formatet, Anthropic-stil Messages och Responses-formatet – den trio som ett agentramverk behöver för att koppla in det utan en anpassad adapter.

Vid bildinmatning accepterar DeepSeek JPEG, PNG, GIF och WebP, som skickas på tre sätt: base64 direkt, en extern URL, eller en fil uppladdad via det nya Files API:et. Det finns ännu inget video- eller ljudinmatning – "vision" här är endast stillbilder.

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

Deep​Seeks egen positionering, i sin release note: ren text-förmåga — agenter, resonemang, världskunskap — är i nivå med den officiella DeepSeek V4 Flash-versionen, medan multimodal agentförmåga tar ett stort kliv och landar nära Opus-4.8. Det är ett leverantörspåstående, inte reproducerat, och värt att läsa noggrant, eftersom benchmarkdetaljerna bakom det är mer intressanta än rubriken.

Varför benchmarkhoppet är större än det ser ut.

Alla följande siffror är Deep​Seek:s egna, publicerade idag i lanseringsnoten, inte oberoende verifierade. På agent-benchmarkerna som inbäddar skärmbilder och bilder läser den textbaserade DeepSeek V4 Flash dem inte — den ignorerar helt enkelt de multimodala delarna av uppgiften. DeepSeek V4 Flash Vision (Exp) tittar faktiskt, vilket är anledningen till att skillnaderna är så stora:

• ApexBench Pass@1 — Vision-Exp 36.5 mot V4-Flash 26.2 (Opus-4.8 39.4)

• Agents' Last Exam — Vision-Exp 27.3 mot V4-Flash 25.2 (Opus-4.8 25.7)

• Terminal-Bench 2.1 — Vision-Exp 83.9 mot V4-Flash 82.7 (Opus-4.8 85.0)

• NL2Repo — Vision-Exp 57.7 mot V4-Flash 54.2 (Opus-4.8 69.7)

• DeepSWE — Vision-Exp 59.3 mot V4-Flash 54.4 (Opus-4.8 58.0)

• Chartography — Vision-Exp 64.3 (text-only V4-Flash kan inte försöka sig på det)

• ZeroBench Pass@5 — Vision-Exp 35.0 (text-only V4-Flash kan inte försöka sig på det)

A single-column scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp — the scoreboard' listing Context 1M tokens, Max output 384K tokens, Input text + images, Image billing up to 384 tokens each, ApexBench Pass@1 36.5, Status experimental — no GA date, with a footer reading 'All benchmark figures vendor-reported; no independent scores yet.'

Två av dessa siffror förtjänar en andra titt. På Agents' Last Exam slår Vision-Exp (27,3) Opus-4.8 (25,7) med knapp marginal, och på DeepSWE besegrar den också Opus-4.8 (59,3 mot 58,0). Det är på detta som "nära Opus-4.8" faktiskt vilar — inte ett enda flaggskeppsresultat, utan en rad agentiska benchmarks där att se skärmen sluter det mesta av gapet till den främsta multimodala modellen, samtidigt som den prismässigt undersäljer den med ungefär en tiopotens.

Vad en bild kostar, till decimalen

Bilder tokeniseras för fakturering — upp till 384 tokens vardera — och debiteras sedan med samma per-token-priser som DeepSeek V4 Flash. Eftersom Deep​Seek flyttade alla sina modeller till hög-/lågtrafikpriser den 16 augusti 2026, beror de exakta siffrorna på när du anropar:

• Input, cache miss — $0.22 per 1M tokens i lågtrafik, $0.44 i högtrafik

• Inmatning, cacheträff — $0.007 per 1M tokens utanför högtrafik, $0.014 högtrafik

• Utdata — $0,66 per 1M tokens i lågtrafik, $1,32 i högtrafik

• Högtrafik — 01:00–04:00 och 06:00–10:00 UTC (alla andra timmar är lågtrafik)

Räkna på det så försvinner nästan kostnaden för bildförståelse. Som indata kostar en bild vid sitt {{1}}384-token cap{{/1}} cirka 0,0085 cent i lågtrafik och 0,017 cent i högtrafik. En agent som läser 50 skärmbilder i en enda körning lägger till ungefär en halv cent i indatatokens — innan modellen ens skriver sin första utdatatoken. Deep​Seek begränsar också upplösningen före inferens: den låga detaljnivån skalar om till {{2}}512×512{{/2}}, och hög/original förskalar bilden (små upp till cirka {{3}}384×384{{/3}}, stora ned till cirka {{4}}800×800{{/4}}), så ett högupplöst original matas aldrig in i modellen med sitt ursprungliga pixelantal.

Birollerna: ett gratis Files API och Harness 0.1.1

Två infrastrukturkomponenter levererades tillsammans med modellen. Files API är live och gratis: ladda upp en bild en gång, referera till den med file_id, och återanvänd den i flera förfrågningar utan att skicka om bytena — det är meningsfullt för en surfagent som håller en sida i kontext över flera vändor. Och Deep​Seek Harness 0.1.1, som släpptes samma dag, har stöd för den nya modellen direkt utan extra konfigurering, så att den harness som benchmarkar och driver Deep​Seek-agentiska arbetsbelastningar kan använda den omedelbart.

Produktionsvarningen, klart uttryckt.

Detta är en experimentell modell. Deep​Seek märker den uttryckligen som sådan, har inte meddelat något GA-datum och avråder från att köra den direkt i produktion; den uttalade planen är att iterera på feedback och släppa en stabil version senare. Den praktiska konsekvensen är att text-hjärnan är beprövad — det är samma viktfamilj som driver V4-Flash — men synvägen är ny kod, och ingen utanför Deep​Seek har stresstestat den i stor skala.

Det är precis den situation där ett routningslager gör skäl för sig. På OrcaRouter är både deepseek/deepseek-v4-flash-vision-exp och deepseek/deepseek-v4-flash live bakom ett enda API, till Deep​Seeks listpris som förs vidare utan påslag. Du kan rikta bildbärande trafik mot den experimentella modellen och, i samma konfiguration, ställa in en automatisk failover till en reservmodell i samma ögonblick som den ger fel eller tar timeout – vilket minskar risken med hela ”ny kod”-problemet. Routnings-DSL:n låter dig också skicka endast de anrop som faktiskt innehåller bilder till visionsmodellen och behålla ren texttrafik på DeepSeek V4 Flash, och därmed fånga de benchmark-vinster som finns och inte betala något extra där de inte finns.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash-vision-exp showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text + Image', 'Output: text', p50 TTFT 275 ms, and the model description 'Experimental vision-enabled variant of DeepSeek V4 Flash: text + image in, text out'.

Vad du ska titta på härnäst

De öppna frågorna är de vanliga för en experimentell lansering. När når DeepSeek V4 Flash Vision (Exp) GA, och håller priset i sig? Kommer video- eller ljudinmatning härnäst – modellen hanterar idag endast stillbilder, vilket lämnar de stora multimodala frontmodellerna oemotsagda när det gäller rörlig media. Och reproducerar de oberoende utvärderingarna (den första tredjepartskörningen på ApexBench eller Terminal-Bench) de publicerade siffrorna? Det intressanta är att även om varje benchmark skulle sjunka, så är det enda påståendet som redan är kostnadseffektivt – vision till textpriser – ett prisfaktum, inte ett benchmark-påstående, och det behöver inte reproduceras.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube