
DeepSeek V4 Flash Vision (Exp) lanseras på API:et: samma pris som V4-Flash, nu med ögon.
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2658Intelligens72Kodning
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianNYQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
DeepSeek V4 Flash Vision (Exp) gick live på DeepSeek API-plattformen idag, den 21 augusti 2026, och den viktigaste siffran i tillkännagivandet är inte ett benchmark – det är priset: den här experimentella visionsmodellen debiteras med exakt samma tokenpriser som DeepSeek V4 Flash, textarbetshästen vars rena textkapacitet den matchar till fullo. Detta gör att det är första gången DeepSeeks eget API överhuvudtaget accepterar bilder, och det innebär att det billigaste sättet att köra en agent med 1M-kontext just blev multimodalt – gratis.
Vad som faktiskt levererades
DeepSeek V4 Flash Vision (Exp) är en experimentell multimodal modell som nås med modell-ID:t deepseek-v4-flash-vision-exp. Den tar emot text och bilder och producerar text, över ett kontextfönster på 1M-token med en maximal utdata på 384K, i både tänkande och icke-tänkande lägen. Den stöder Chat Completions-formatet, Anthropic-stil Messages och Responses-formatet – den trio som ett agentramverk behöver för att koppla in det utan en anpassad adapter.
Vid bildinmatning accepterar DeepSeek JPEG, PNG, GIF och WebP, som skickas på tre sätt: base64 direkt, en extern URL, eller en fil uppladdad via det nya Files API:et. Det finns ännu inget video- eller ljudinmatning – "vision" här är endast stillbilder.

DeepSeeks egen positionering, i sin release note: ren text-förmåga — agenter, resonemang, världskunskap — är i nivå med den officiella DeepSeek V4 Flash-versionen, medan multimodal agentförmåga tar ett stort kliv och landar nära Opus-4.8. Det är ett leverantörspåstående, inte reproducerat, och värt att läsa noggrant, eftersom benchmarkdetaljerna bakom det är mer intressanta än rubriken.
Varför benchmarkhoppet är större än det ser ut.
Alla följande siffror är DeepSeek:s egna, publicerade idag i lanseringsnoten, inte oberoende verifierade. På agent-benchmarkerna som inbäddar skärmbilder och bilder läser den textbaserade DeepSeek V4 Flash dem inte — den ignorerar helt enkelt de multimodala delarna av uppgiften. DeepSeek V4 Flash Vision (Exp) tittar faktiskt, vilket är anledningen till att skillnaderna är så stora:
• ApexBench Pass@1 — Vision-Exp 36.5 mot V4-Flash 26.2 (Opus-4.8 39.4)
• Agents' Last Exam — Vision-Exp 27.3 mot V4-Flash 25.2 (Opus-4.8 25.7)
• Terminal-Bench 2.1 — Vision-Exp 83.9 mot V4-Flash 82.7 (Opus-4.8 85.0)
• NL2Repo — Vision-Exp 57.7 mot V4-Flash 54.2 (Opus-4.8 69.7)
• DeepSWE — Vision-Exp 59.3 mot V4-Flash 54.4 (Opus-4.8 58.0)
• Chartography — Vision-Exp 64.3 (text-only V4-Flash kan inte försöka sig på det)
• ZeroBench Pass@5 — Vision-Exp 35.0 (text-only V4-Flash kan inte försöka sig på det)

Två av dessa siffror förtjänar en andra titt. På Agents' Last Exam slår Vision-Exp (27,3) Opus-4.8 (25,7) med knapp marginal, och på DeepSWE besegrar den också Opus-4.8 (59,3 mot 58,0). Det är på detta som "nära Opus-4.8" faktiskt vilar — inte ett enda flaggskeppsresultat, utan en rad agentiska benchmarks där att se skärmen sluter det mesta av gapet till den främsta multimodala modellen, samtidigt som den prismässigt undersäljer den med ungefär en tiopotens.
Vad en bild kostar, till decimalen
Bilder tokeniseras för fakturering — upp till 384 tokens vardera — och debiteras sedan med samma per-token-priser som DeepSeek V4 Flash. Eftersom DeepSeek flyttade alla sina modeller till hög-/lågtrafikpriser den 16 augusti 2026, beror de exakta siffrorna på när du anropar:
• Input, cache miss — $0.22 per 1M tokens i lågtrafik, $0.44 i högtrafik
• Inmatning, cacheträff — $0.007 per 1M tokens utanför högtrafik, $0.014 högtrafik
• Utdata — $0,66 per 1M tokens i lågtrafik, $1,32 i högtrafik
• Högtrafik — 01:00–04:00 och 06:00–10:00 UTC (alla andra timmar är lågtrafik)
Räkna på det så försvinner nästan kostnaden för bildförståelse. Som indata kostar en bild vid sitt {{1}}384-token cap{{/1}} cirka 0,0085 cent i lågtrafik och 0,017 cent i högtrafik. En agent som läser 50 skärmbilder i en enda körning lägger till ungefär en halv cent i indatatokens — innan modellen ens skriver sin första utdatatoken. DeepSeek begränsar också upplösningen före inferens: den låga detaljnivån skalar om till {{2}}512×512{{/2}}, och hög/original förskalar bilden (små upp till cirka {{3}}384×384{{/3}}, stora ned till cirka {{4}}800×800{{/4}}), så ett högupplöst original matas aldrig in i modellen med sitt ursprungliga pixelantal.
Birollerna: ett gratis Files API och Harness 0.1.1
Två infrastrukturkomponenter levererades tillsammans med modellen. Files API är live och gratis: ladda upp en bild en gång, referera till den med file_id, och återanvänd den i flera förfrågningar utan att skicka om bytena — det är meningsfullt för en surfagent som håller en sida i kontext över flera vändor. Och DeepSeek Harness 0.1.1, som släpptes samma dag, har stöd för den nya modellen direkt utan extra konfigurering, så att den harness som benchmarkar och driver DeepSeek-agentiska arbetsbelastningar kan använda den omedelbart.
Produktionsvarningen, klart uttryckt.
Detta är en experimentell modell. DeepSeek märker den uttryckligen som sådan, har inte meddelat något GA-datum och avråder från att köra den direkt i produktion; den uttalade planen är att iterera på feedback och släppa en stabil version senare. Den praktiska konsekvensen är att text-hjärnan är beprövad — det är samma viktfamilj som driver V4-Flash — men synvägen är ny kod, och ingen utanför DeepSeek har stresstestat den i stor skala.
Det är precis den situation där ett routningslager gör skäl för sig. På OrcaRouter är både deepseek/deepseek-v4-flash-vision-exp och deepseek/deepseek-v4-flash live bakom ett enda API, till DeepSeeks listpris som förs vidare utan påslag. Du kan rikta bildbärande trafik mot den experimentella modellen och, i samma konfiguration, ställa in en automatisk failover till en reservmodell i samma ögonblick som den ger fel eller tar timeout – vilket minskar risken med hela ”ny kod”-problemet. Routnings-DSL:n låter dig också skicka endast de anrop som faktiskt innehåller bilder till visionsmodellen och behålla ren texttrafik på DeepSeek V4 Flash, och därmed fånga de benchmark-vinster som finns och inte betala något extra där de inte finns.

Vad du ska titta på härnäst
De öppna frågorna är de vanliga för en experimentell lansering. När når DeepSeek V4 Flash Vision (Exp) GA, och håller priset i sig? Kommer video- eller ljudinmatning härnäst – modellen hanterar idag endast stillbilder, vilket lämnar de stora multimodala frontmodellerna oemotsagda när det gäller rörlig media. Och reproducerar de oberoende utvärderingarna (den första tredjepartskörningen på ApexBench eller Terminal-Bench) de publicerade siffrorna? Det intressanta är att även om varje benchmark skulle sjunka, så är det enda påståendet som redan är kostnadseffektivt – vision till textpriser – ett prisfaktum, inte ett benchmark-påstående, och det behöver inte reproduceras.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
