
DeepSeek V4 Flash officiell lansering: den billiga, snabba, agentiska modellen med 1M-kontext, förklarad
- qwenNYQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens · 224 tok/s
- orcaNYOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNYAnthropic: Claude Opus 52026-07-2461Intelligens78Kodning
- googleNYGoogle: Gemini 3.6 Flash2026-07-2150Intelligens69Kodning
- googleNYGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1651Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1557Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0854Intelligens72Kodning
- tencentTencent: Hy32026-07-0641Intelligens59Kodning
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligens42Kodning
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligens39Kodning
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligens72Kodning
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligens52Kodning57Matematik
- z-aiZ.ai: GLM 5.22026-06-1651Intelligens69Kodning60Matematik
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligens61Kodning61Matematik
- anthropicAnthropic: Claude Fable 52026-06-0960Intelligens77Kodning
- qwenQwen: Qwen3.7 Plus2026-06-0139Intelligens56Kodning59Matematik
DeepSeeks effektivitetsmodell, V4 Flash, har gått från förhandsversion till en officiell offentlig betaversion — den code>-0731/code> versionen släpptes den 31 juli 2026.
Noggrannhetsanteckning: versionsdetaljerna och benchmarksiffrorna nedan kommer från DeepSeeks officiella API-ändringslogg (daterad 2026-07-31); arkitektur, kontext och prissättning är korskontrollerade mot OrcaRouters modellsida; Artificial Analysis-sammansättningarna är oberoende. DeepSeek-rapporterade benchmarks använder dess egna harness-inställningar — behandla dem som leverantörssiffror och kör dina egna utvärderingar. Specifikationer och priser ändras; verifiera innan du bygger.
TL;DR. V4 Flash är den kostnadseffektiva syskonmodellen till den gigantiska DeepSeek V4 Pro: en MoE med 284B parametrar (13B aktiva), 1M-tokens kontext och upp till 384K utdata, anpassad för högvolym, låg latens och agentbaserat arbete. Den officiella releasen den 31 juli är en post-training-uppgradering — samma storlek, väsentligt bättre agenter och kodning — som också lägger till inbyggt stöd för Responses-API och Codex. DeepSeek rapporterar starka resultat inom agenter/kodning (t.ex. Terminal-Bench 2.1 82,7, Toolathlon 70,3), och den kostar cirka 0,15 $ / 0,29 $ per miljon inmatnings-/utdata-tokens, ungefär en tredjedel av priset för V4 Pro. Endast Flash API uppgraderades; V4 Pro och DeepSeeks app/webb är oförändrade. Hos OrcaRouter får du det med 0 % påslag via en OpenAI-kompatibel endpoint.
Viktiga slutsatser
• Officiell utgåva (build -0731, 31 juli 2026): en uppgradering efter träning av förhandsversionen — samma arkitektur, betydligt starkare agenter, kodning och verktygsanvändning.
• Arkitekturen oförändrad: 284B totalt / 13B aktiva (MoE), 1M-token kontext (1,048,576), upp till 384K utdata, endast textinmatning, med resonemang, verktyg och JSON.
• Nytt: inbyggt stöd för Responses API samt specifik anpassning för Codex; fortsätter att stödja OpenAI ChatCompletions- och Anthropic-liknande gränssnitt. Modell-ID code>deepseek-v4-flash/code>.
- DeepSeek-rapporterade agentiska/kodningsförbättringar: Terminal-Bench 2.1 82.7, Toolathlon (verifierad) 70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7.
• Mycket billigt: cirka $0,15 / $0,29 per 1M inmatnings-/utmatningstokens med ~$0,02 cache-läsningar (OrcaRouter, 0 % påslag) — ungefär en tredjedel av V4 Pro:s $0,44 / $0,88. Endast Flash API:t ändrades; Pro och app/web är desamma.
Vad den officiella releasen faktiskt uppgraderade
V4 Flash dök först upp som en förhandsversion den 24 april 2026. Den officiella lanseringen den 31 juli 2026 (code>-0731/code>-bygget, enligt DeepSeeks API-ändringslogg) är uttryckligen inte en ny arkitektur: totala och aktiva parametrar (284B / 13B) och 1M-kontexten är oförändrade. Det som ändrats är efterträningen — extra finjustering som DeepSeek säger avsevärt förbättrade kärnförmågorna inom agentbaserade arbetsflöden, kodning och verktygsanrop. Två praktiska tillägg spelar roll: V4 Flash stöder nu inbyggt Responses API och är särskilt anpassad för Codex-liknande kodningsagenter, samtidigt som den fortfarande talar OpenAI ChatCompletions- och Anthropic-liknande gränssnitt. Viktigt är att bara Flash API uppgraderades i den här versionen; V4 Pro och DeepSeeks app-/webbupplevelser är oförändrade. För team innebär det en drop-in-förbättring för agentbaserade arbetsbelastningar till samma pris, utan migrering.

Arkitektur: en MoE med få aktiva experter byggd för genomströmning
V4 Flash är en mixture-of-experts-modell med totalt cirka 284 miljarder parametrar, men endast cirka 13 miljarder aktiva per token. Det låga antalet aktiva parametrar är hela poängen: det håller inferensen snabb och billig samtidigt som en stor expertpool bevarar kvaliteten. Kontextfönstret är hela 1 048 576 tokens (cirka 1M), med en mycket stor maxutdata på 384K, och modellen stöder resonemang (utökat tänkande), verktygsanrop och strukturerad JSON. Indata är endast text. Designmålet – höga volymer, låg latens, agentiskt arbete – syns i serversiffrorna: en p50-tid till första token på cirka 394 millisekunder och utdata på cirka 184 tokens per sekund enligt OrcaRouters mätningar.
Riktmärken: vad de officiella siffrorna säger
Den officiella releasen betonar starkt agentiska och kodningsutvärderingar, körda med DeepSeeks eget ramverk (inställningarna minimal-mode / max-effort). Så här tolkar du huvudresultaten, alla rapporterade av DeepSeek:
• Terminal-Bench 2.1: 82.7 — agentiska kommandorads-/programvaruuppgifter i en riktig terminal. Ett högt resultat här signalerar en modell som faktiskt kan styra verktyg och skal, inte bara svara på frågor.
• Toolathlon (verifierat): 70.3 och Automation Bench (Public): 25.1 — bredd och tillförlitlighet i verktygsanvändning och end-to-end-automatisering. Tillförlitligheten vid verktygsanrop är den avgörande egenskapen för agenter.
• Cybergym: 76.7 — säkerhets-/CTF-stil agentiskt problemlösande.
• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — mjukvaruteknik och fullstack-kodning, från generering på reponivå till svåra data science-uppgifter. Det starka resultatet för DSBench-FullStack (68.7) tyder på praktisk, flerfilig kodningskompetens.
• Agent Last Exam: 25.2 — en avsiktligt svår agentisk resoneringsutmaning där även toppmodeller får låga poäng; användbar som relativ signal, inte absolut.
För oberoende kontext: Artificial Analysis (utvärderad 2026-06-25, preview-bygge) placerade V4 Flash runt 56.2 AA Coding, 40.3 AA Intelligence och 50.0 AA Math — en kodningsinriktad generalist över medianen bland öppna modeller. Den officiella förbättringen efter träning är riktad rakt mot agentic/coding-axeln, så förvänta dig att det nyare bygget känns starkare på just de uppgifterna. Som alltid är siffrorna från leverantörens testmiljö optimistiska; validera på dina egna arbetsbelastningar.
Prissättning: siffran som förändrar budgetar
På OrcaRouter, som förmedlar leverantörspriser med 0 % påslag, kostar V4 Flash ungefär 0,15 dollar per miljon inmatningstokens och 0,29 dollar per miljon utmatningstokens, med cacheavläsningar runt 0,02 dollar – och DeepSeek höll priserna låga i den här utgåvan (ingen höjning för uppgraderingen). Det är ungefär en tredjedel av DeepSeek V4 Pros 0,44 / 0,88 dollar. I konkreta siffror: 10 miljoner tokens i månaden med en 70/30-fördelning mellan inmatning och utmatning landar på ett par dollar med V4 Flash; skalar du upp till en miljard tokens blir skillnaden mot en flaggskeppsmodell en budgetpost som ekonomiavdelningen noterar. Prompt-cachning minskar kostnaden ytterligare för agenter och chatt med ett stabilt systemprompt, eftersom cachad inmatning faktureras till ungefär en tiondel av färsk inmatning. Billigare agentisk kapacitet till samma låga pris är hela poängen med den här utgåvan.
Där V4 Flash passar in: DeepSeek V4-stegen
DeepSeeks V4-serie är en stege. V4 Pro är flaggskeppet — en betydligt större modell i toppklass för resonemang och kod. V4 Flash är effektivitetsnivån: långt mindre aktiv beräkningskraft, en bråkdel av priset och, efter denna post-training-uppgradering, genuint stark agent- och kodningsförmåga. Det faktum att DeepSeek investerade i att göra Flash till en bättre agent (Responses API, Codex-anpassning, riktmärken för verktygsanvändning) talar om var volymen förväntas hamna: vardaglig agent- och kodtrafik på Flash, med det svåraste resonemanget reserverat för Pro. Det speglar hela branschens mönster med billig standard plus premiumflaggskepp — och det är därför som routing efter svårighetsgrad slår att använda den största modellen som standard.

Tre verkliga scenarier
1. Kodningsagenter och Codex-liknande arbetsflöden
-0731-byggets inbyggda stöd för Responses-API och Codex, tillsammans med dess resultat i Terminal-Bench (82,7) och DSBench-FullStack (68,7), gör V4 Flash till en stark och billig motor för autonoma kodningsagenter — buggfixning, refaktoreringar, testgenerering och flerstegsverktygsanvändning.
2. Verktygsanvändande agenter med hög volym
Snabba första tokens (~394 ms), hög genomströmning (~184 tok/s), en 1M-kontext och stark Toolathlon-tillförlitlighet (70.3) passar produktionsagenter som anropar verktyg i stor skala — hämtning, automatisering, orkestrering.
3. Bearbetning av långa dokument med begränsad budget
Den fullständiga 1M-tokenkontexten och 384K-utdata hanterar sammanfattning, analys eller transformering av mycket stora indata — loggar, kodbaser, långa rapporter — i en enda genomgång, till låg kostnad.
Så här kommer du åt V4 Flash
Du kan anropa V4 Flash direkt via DeepSeeks API (modell-ID code>deepseek-v4-flash/code>; det stöder Responses API, OpenAI ChatCompletions och Anthropic-liknande gränssnitt), eller via en leverantörsoberoende slutpunkt. a href="https://www.orcarouter.ai/">OrcaRouter/a> erbjuder V4 Flash med 0 % påslag genom en enda OpenAI-kompatibel slutpunkt (code>deepseek/deepseek-v4-flash/code>) tillsammans med 185+ andra modeller – så att du kan jämföra den mot GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen 3.8 och Kimi K3 på ett och samma ställe, och dirigera varje begäran till det som är billigast för uppgiften. Eftersom den är OpenAI-kompatibel innebär att anta V4 Flash – eller att byta bort från den – en konfigurationsändring, inte en ny integration.

Begränsningar och ärliga förbehåll
V4 Flash är en effektivitetsmodell, inte en flaggskeppsmodell: vid de allra svåraste resonemangen ligger den efter V4 Pro och ledande västerländska modeller. Indata är endast text (ingen inbyggd bildinmatning). Benchmarkresultaten här är rapporterade av DeepSeek med egen testmiljö, så betrakta exakta siffror som vägledande och förvänta dig att oberoende utvärderingar hamnar något lägre. Och "billigt per token" är inte "billigt per uppgift" om du låter resonemangs- eller agentloopar köra länge — begränsa resonemangsansträngning och verktygsiterationer vid enkla anrop. Validera på din egen arbetsbelastning innan du överför produktionstrafik.
FAQ
Vad är DeepSeek V4 Flash?
DeepSeeks effektivitetsmodell i V4-serien: en mixture-of-experts-modell med 284B / 13B aktiva parametrar, ett kontextfönster på 1M-token, upp till 384K i utdata, optimerad för snabbt, högvolymigt, agentiskt och kodningsarbete. Dess officiella lansering (build -0731) släpptes den 31 juli 2026.
Vad ändrades i den officiella releasen?
Arkitekturen är oförändrad; det är en post-training-uppgradering som avsevärt förbättrar agentiska förmågor, kodning och verktygsanrop, och lägger till inbyggt stöd för Responses-API med Codex-anpassning. Endast Flash API uppgraderades — V4 Pro och appen/webben är desamma.
Hur mycket kostar V4 Flash?
Cirka $0,15 per miljon inmatningstokens och $0,29 per miljon utmatningstokens på OrcaRouter (0 % påslag), med ~$0,02 cacheläsningar — ungefär en tredjedel av V4 Pros $0,44 / $0,88. Priserna förblev låga i denna release.
Hur bra är V4 Flash på agentiska och kodningsuppgifter?
DeepSeek rapporterar starka resultat: Terminal-Bench 2.1 82.7, Toolathlon (verifierat) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — alla siffror från leverantörens testmiljö, så verifiera på dina egna uppgifter.
Hur står sig V4 Flash jämfört med V4 Pro?
Pro är det vida större flaggskeppet för det svåraste resonerandet och kodandet; Flash är effektivitetsnivån till ungefär en tredjedel av priset med stark agentisk/kodningsförmåga. Dirigera svåra uppgifter till Pro, allt annat till Flash.
Vad är kontextfönstret?
Hela 1 048 576 tokens (cirka 1M), med upp till 384K output-token.
Är V4 Flash multimodal?
Nej — indata är endast text. Den stöder resonemang, verktygsanrop och JSON-utdata.
Fungerar V4 Flash med Responses API och Codex?
Ja — versionen -0731 lägger till inbyggt stöd för Responses-API och specifik Codex-anpassning, tillsammans med OpenAI ChatCompletions och Anthropic-liknande gränssnitt.
Hur använder jag V4 Flash?
Direkt via DeepSeeks API, eller genom OrcaRouters OpenAI-kompatibla slutpunkt med 0% påslag (code>deepseek/deepseek-v4-flash/code>), där du också kan jämföra och dirigera mellan konkurrerande modeller.
Slutsats
Den officiella lanseringen av DeepSeek V4 Flash behåller det billiga, snabba receptet och gör den till en betydligt bättre agent: samma 284B / 13B-aktiva MoE och 1M kontext, men eftertränad för starkare kodning och verktygsanvändning, med inbyggt stöd för Responses-API och Codex — till samma prissättning på ~0,15 / 0,29 USD. Den är ingen flaggskeppsmodell och den är inte multimodal, men för den stora majoriteten av agentarbete, kodningsarbete och arbete med långa dokument är den ett av de bästa alternativen sett till värde per token under 2026. Prova den via en OpenAI-kompatibel slutpunkt med 0 % påslag, som OrcaRouter, och dirigera den svåraste minoriteten av förfrågningar till en flaggskeppsmodell — den kombinationen är svår att slå kostnadsmässigt.
