DeepSeek V4 Flash officiell lansering: den billiga, snabba, agentiska modellen med 1M-kontext, förklarad
Guides & Insights

DeepSeek V4 Flash officiell lansering: den billiga, snabba, agentiska modellen med 1M-kontext, förklarad

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

DeepSeek V4 Flash är den billiga halvan av DeepSeeks V4-stege, och de oberoende siffrorna har äntligen hunnit ikapp: på MathArenas AIME 2026-uppsättning får den 95,83 %, statistiskt oskiljbar från DeepSeek V4 Pros 96,67 %, till ungefär en niondel av kostnaden per problem. Den officiella offentliga betaversionen, -0731, släpptes den 31 juli 2026 med samma arkitektur som aprilförhandsvisningen — en mixture-of-experts-modell med 284 miljarder parametrar, 13B aktiva, med en kontext på 1 miljon tokens — men en omgång extra post-träning som kraftigt förbättrade dess agentiska, kodnings- och verktygsanropsförmåga, plus inbyggt stöd för Responses-API och specifika anpassningar för Codex-liknande agenter. Den här guiden beskriver vad releasen faktiskt ändrade, vad leverantörens och de oberoende utvärderingarna var för sig säger, vad den kostar när man räknar in hur mycket den tänker, och hur man anropar den.

Anmärkning om noggrannhet: versionsinformationen och de övergripande agentiska poängen nedan kommer från DeepSeeks officiella API-ändringslogg (daterad 2026-07-31) och är leverantörsrapporterade, körda i DeepSeeks egen testmiljö — behandla dem som vägledande och kör dina egna utvärderingar. Oberoende siffror tillskrivs där de förekommer: Artificial Analysis för Intelligence Index och dess komponenter, MathArena för AIME 2026, DeepSeeks egen prislista för prissättning. Där något bygger på en enskild utövares rapport snarare än en publicerad utvärdering, framgår det av meningen. Specifikationer och priser ändras; verifiera innan du bygger.

TL;DR. V4 Flash är den kostnadseffektiva syskonmodellen till den gigantiska DeepSeek V4 Pro: en 284B / 13B-aktiv MoE med 1M-token-kontext och upp till 384K utdata, trimmad för högvolym, låg latens och agentiskt arbete. Den officiella lanseringen den 31 juli är en uppgradering efter träning — samma storlek, väsentligt bättre agenter och kodning — som också lägger till inbyggt stöd för Responses-API och Codex. DeepSeek rapporterar starka agent-/kodningsresultat (t.ex. Terminal-Bench 2.1 82.7, Toolathlon 70.3), och Artificial Analysis har sedan gett -0731-builden 50 på sitt Intelligence Index: tio poäng över aprilförhandsversionen, sex över den betydligt större V4 Pro, och i nivå med Gemini 3.6 Flash. Den kostar cirka $0.15 / $0.29 per miljon input/output-token, ungefär en tredjedel av priset för V4 Pro. Endast Flash-API:et uppgraderades; V4 Pro och DeepSeek-appen/-webben är oförändrade. På OrcaRouter får du det med 0 % påslag via en OpenAI-kompatibel slutpunkt.

Viktiga slutsatser

• Officiell utgåva (build -0731, 31 juli 2026): en uppgradering efter träning av förhandsversionen — samma arkitektur, betydligt starkare agenter, kodning och verktygsanvändning.

• Arkitekturen oförändrad: 284B totalt / 13B aktiva (MoE), 1M-token kontext (1,048,576), upp till 384K utdata, endast textinmatning, med resonemang, verktyg och JSON.

• Nytt: inbyggt stöd för Responses API plus specifik Codex-anpassning; fortsätter att stödja OpenAI ChatCompletions och Anthropic-liknande gränssnitt. Modell-id deepseek-v4-flash.

- DeepSeek-rapporterade agentiska/kodningsförbättringar: Terminal-Bench 2.1 82.7, Toolathlon (verifierad) 70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7.

• Mycket billigt: cirka $0.15 / $0.29 per 1M inmatnings-/utmatningstokens — ungefär en tredjedel av V4 Pros $0.44 / $0.88 — och DeepSeek prissätter cacheträffar till $0.0028 per 1M, cirka 98 % under färsk inmatning. Endast Flash API:t ändrades; Pro och app/webben är desamma.

Vad den officiella releasen faktiskt uppgraderade

V4 Flash dök först upp som en förhandsvisning den 24 april 2026. Den officiella utgåvan den 31 juli 2026 (byggnumret -0731 enligt DeepSeeks API-ändringslogg) är uttryckligen inte en ny arkitektur: totala och aktiva parametrar (284B / 13B) och 1M-kontexten är oförändrade. Det som ändrades är efterträning — extra finjustering som enligt DeepSeek avsevärt förbättrade de centrala agent-, kodnings- och verktygsanropsförmågorna. Två praktiska tillägg är viktiga: V4 Flash stöder nu inbyggt Responses API och är specifikt anpassad för Codex-liknande kodningsagenter, samtidigt som den fortfarande talar OpenAI ChatCompletions och Anthropic-liknande gränssnitt. Viktigt är att endast Flash API uppgraderades i denna utgåva; V4 Pro och DeepSeek-appen samt webbupplevelserna är oförändrade. För team innebär det en drop-in-förbättring för agentiska arbetsbelastningar till samma pris, utan migrering.

Arkitektur: en MoE med få aktiva experter byggd för genomströmning

V4 Flash är en mixture-of-experts-modell med totalt cirka 284 miljarder parametrar, men endast cirka 13 miljarder aktiva per token. Det låga antalet aktiva parametrar är hela poängen: det håller inferensen snabb och billig samtidigt som en stor expertpool bevarar kvaliteten. Kontextfönstret är hela 1 048 576 tokens (cirka 1M), med en mycket stor maxutdata på 384K, och modellen stöder resonemang (utökat tänkande), verktygsanrop och strukturerad JSON. Indata är endast text. Designmålet – höga volymer, låg latens, agentiskt arbete – syns i serversiffrorna: en p50-tid till första token på cirka 394 millisekunder och utdata på cirka 184 tokens per sekund enligt OrcaRouters mätningar.

Riktmärken: vad de officiella siffrorna säger

Den officiella releasen betonar starkt agentiska och kodningsutvärderingar, körda med DeepSeeks eget ramverk (inställningarna minimal-mode / max-effort). Så här tolkar du huvudresultaten, alla rapporterade av DeepSeek:

• Terminal-Bench 2.1: 82.7 — agentiska kommandorads-/programvaruuppgifter i en riktig terminal. Ett högt resultat här signalerar en modell som faktiskt kan styra verktyg och skal, inte bara svara på frågor.

• Toolathlon (verifierat): 70.3 och Automation Bench (Public): 25.1 — bredd och tillförlitlighet i verktygsanvändning och end-to-end-automatisering. Tillförlitligheten vid verktygsanrop är den avgörande egenskapen för agenter.

• Cybergym: 76.7 — säkerhets-/CTF-stil agentiskt problemlösande.

• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — mjukvaruteknik och fullstack-kodning, från generering på reponivå till svåra data science-uppgifter. Det starka resultatet för DSBench-FullStack (68.7) tyder på praktisk, flerfilig kodningskompetens.

• Agent Last Exam: 25.2 — en avsiktligt svår agentisk resoneringsutmaning där även toppmodeller får låga poäng; användbar som relativ signal, inte absolut.

För oberoende kontext har Artificial Analysis nu utvärderat själva -0731-bygget och gett det 50 på Artificial Analysis Intelligence Index — tio poäng över aprilförhandsversionen som den ersätter, sex poäng över den mycket större V4 Pro, och i nivå med Gemini 3.6 Flash. Dess delresultat: GPQA Diamond 91 %, AA-LCR 66 %, Humanity's Last Exam 37 %, SciCode 50 %, τ³-Bench Banking 31 %, CritPt 17 % och en Elo på 1559 på GDPval-AA v2. Två av dessa förtjänar en närmare titt. Artificial Analysis mätte Terminal-Bench 2.1 till 79 % jämfört med DeepSeeks rapporterade 82,7 — nära, men lägre, vilket är den riktning som leverantörsharness-siffror vanligtvis missar. Och på AA-Omniscience hamnar modellen på -16 med en hög uppmätt hallucinationsfrekvens, så historien om billig och agentisk förmåga sträcker sig inte till oövervakad faktaminnesåterkallelse. Det är det skarpare sättet att läsa den här modellen: stark resonemangsförmåga per dollar, svag kunskap per fråga.

Tävlingsmatte: det enda stället där Flash matchar Pro.

Den mest användbara oberoende bedömningen av V4 Flash:s resonemang kommer från MathArena, som kör varje modell fyra gånger på varje problem i en nyutgiven tävling och publicerar ett rutnät över resultaten per problem. På AIME 2026 — båda papperen, 30 problem, fyra körningar vardera — får V4 Flash i max-resoneringsläge 95,83 % ±3,58 %, jämfört med DeepSeek V4 Pro:s 96,67 % ±3,21 %. Dessa intervall överlappar nästan helt: på detta riktmärke är den lilla modellen inte mätbart sämre än flaggskeppsmodellen. Det är i kostnadskolumnen som de skiljer sig åt. MathArena anger en V4 Flash-körning till 0,009 USD per problem jämfört med 0,082 USD för V4 Pro — ungefär nio gånger billigare för samma noggrannhet, vilket är ett starkare argument för effektivitetsklassen än något i DeepSeeks eget tillkännagivande.

Två invändningar bör nämnas i samma andetag. MathArena flaggar båda DeepSeek-bidragen med en kontamineringsvarning, dess etikett för en modell som släpptes efter att tävlingen publicerades, så en del av den träffsäkerheten kan vara återkallande snarare än resonemang. Och versionen MathArena testade är daterad 2026-04-24 — aprilförhandsversionen, inte -0731-bygget. I skrivande stund finns inget oberoende AIME 2026-resultat för den officiella versionen, och DeepSeeks eget modellkort publicerar inget matematikbenchmark för den alls, bara agentiska sådana.

Rutnätet visar också var taket ligger. Nästan varje modell på tavlan klarar merparten av AIME 2026; problemet som sorterar dem är problem 15. Endast två bidrag löser det i alla fyra körningarna – GPT-5.5 med extra hög ansträngning och Claude Opus 4.8 på max. V4 Flash får noll av fyra där, och det gör även V4 Pro, tillsammans med GLM-5.2, Gemini 3.6 Flash, Kimi K2.6 och Claude Opus 4.7.

Den sista detaljen är vad som gör en rapport från den 5 augusti 2026 värd att uppmärksamma. AI-kommentatorn @teortaxesTex skrev att bygget -0731 löste AIME 2026 problem 15, med ungefär 1 006 sekunder och cirka 100 000 utdata-tokens, och beskrev hur modellen synligt började spela systemet innan den övergav genvägen och löste problemet ärligt. Detta är en enda utövares enstaka körning, inte ett benchmarkresultat: det har inte reproducerats, ingen offentlig ledartavla har poängsatt bygget -0731, och ett ensamt transkript är ingen utvärdering. Det som kan kontrolleras är intern konsistens, och den håller — Artificial Analysis mäter modellens utdata till cirka 116 tokener per sekund, och 1 006 sekunder i den takten är ungefär 117 000 tokener, i samma härad som det rapporterade antalet. Ett svar på 100 000 tokener ligger också väl inom vad DeepSeek förväntar sig, eftersom de rekommenderar att tillåta upp till 384 000 utdata-tokens vid hög eller maximal resoneringsansträngning. Båda siffrorna ligger ungefär tre gånger över MathArenas uppmätta genomsnitt för denna modell (33 588 utdata-tokens och 6 min 50 s per svar), vilket är vad man kan förvänta sig för det enskilt svåraste problemet i uppsättningen. Så: trolig till formen, overifierad i utfall, och om det replikeras är det ett rejält kliv jämfört med förhandsbygget, som misslyckas med det problemet fyra gånger av fyra.

Prissättning: siffran som förändrar budgetar

På OrcaRouter, som förmedlar leverantörspriserna med 0 % påslag, kostar V4 Flash ungefär $0.15 per miljon inmatningstokens och $0.29 per miljon utmatningstokens, och DeepSeek har hållit priset oförändrat för denna uppgradering. Det är ungefär en tredjedel av DeepSeek V4 Pros $0.44 / $0.88. Cacheträffar är billigare än de flesta tror: DeepSeek listar cachad inmatning till $0.0028 per miljon, ungefär 98 % under färsk inmatning, vilket är det som gör att agenter och chatt med en stabil systemprompt är så billiga att hålla igång. I reala termer landar 10 miljoner tokens i månaden med en uppdelning på 70 % inmatning / 30 % utmatning på ungefär ett par dollar; skala upp till en miljard tokens och gapet mot en flaggskeppsmodell blir en budgetpost som ekonomiavdelningen noterar.

På en resoneringsmodell är dock prislistan den mindre intressanta halvan av notan — det som påverkar budgetar är hur många tokens modellen väljer att använda. Artificial Analysis behövde cirka 206 miljoner utdatatokens för att köra sitt fullständiga Intelligence Index på V4 Flash, ungefär dubbelt så mycket som medianen på ~100 miljoner bland de modeller de testar, och beskriver den som snabb men väldigt mångordig. Räknat på priset kostar ett enskilt svar på 100 000 tokens cirka tre cent, och taket på 384K utdata begränsar ett svar till nära elva cent. Billigt i absoluta tal, men några hundra gånger kostnaden för ett kort svar — vilket är anledningen till att resoneringsinsats är en budgetspak snarare än en kvalitetsratt du lämnar på max. Simon Willisons praktiska genomgång gör samma poäng från andra hållet: med standardinställningar var hans testgenerering nedslående, och att höja resoneringsinsatsen till hög förbättrade den avsevärt. Mät dina egna tunga förfrågningar innan du antar att listpriset är din kostnad.

Där V4 Flash passar in: DeepSeek V4-stegen

DeepSeeks V4-serie är en stege. V4 Pro är flaggskeppet — en betydligt större modell i toppklass för resonemang och kodning. V4 Flash är effektivitetsnivån: långt mindre aktiv beräkningskraft, en bråkdel av priset och, efter denna efterträningsuppgradering, genuint stark agentisk och kodningsmässig förmåga. Det faktum att DeepSeek investerade i att göra Flash till en bättre agent (Responses API, Codex-anpassning, riktmärken för verktygsanvändning) säger var man förväntar sig att volymen ska hamna. Men AIME 2026-siffrorna komplicerar den snygga versionen av den historien till Flashs fördel: på tävlingsmatematik ligger de två modellerna inom varandras felmarginaler, så "skicka de svåra problemen till Pro" är inte automatiskt rätt. Den ärliga uppdelningen är att Pro köper bredd av kunskap och det svåraste agentiska arbetet, inte en bättre chans på ett svårt matematikproblem — vilket är anledningen till att routing baserat på uppmätt svårighet på dina egna uppgifter slår att som standard välja den största modellen.

Tre verkliga scenarier

1. Kodningsagenter och Codex-liknande arbetsflöden

-0731-byggets inbyggda stöd för Responses-API och Codex, tillsammans med dess resultat i Terminal-Bench (82,7) och DSBench-FullStack (68,7), gör V4 Flash till en stark och billig motor för autonoma kodningsagenter — buggfixning, refaktoreringar, testgenerering och flerstegsverktygsanvändning.

2. Verktygsanvändande agenter med hög volym

Snabba första tokens (~394 ms), hög genomströmning (~184 tok/s), en 1M-kontext och stark Toolathlon-tillförlitlighet (70.3) passar produktionsagenter som anropar verktyg i stor skala — hämtning, automatisering, orkestrering.

3. Bearbetning av långa dokument med begränsad budget

Den fullständiga 1M-tokenkontexten och 384K-utdata hanterar sammanfattning, analys eller transformering av mycket stora indata — loggar, kodbaser, långa rapporter — i en enda genomgång, till låg kostnad.

Så här kommer du åt V4 Flash

Du kan anropa V4 Flash direkt på DeepSeeks API (modell-id deepseek-v4-flash; det stöder Responses API, OpenAI ChatCompletions och gränssnitt i Anthropic-stil), eller via en leverantörsoberoende endpoint. OrcaRouter exponerar V4 Flash med 0 % påslag genom en enda OpenAI-kompatibel endpoint (deepseek/deepseek-v4-flash) tillsammans med 200+ andra modeller — så att du kan jämföra den mot GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen3.8-Max och Kimi K3 på ett ställe, och dirigera varje förfrågan till det som är billigast för jobbet. Eftersom priset skickas vidare snarare än belagt med påslag, når en prisförändring från DeepSeek din faktura samma dag som den kommer ut. Och eftersom gränssnittet är OpenAI-kompatibelt, är att anta V4 Flash — eller att lämna den efter en veckas mätning — en konfigurationsändring, inte en omintegration.

Begränsningar och ärliga förbehåll

V4 Flash är en effektivitetsmodell, inte ett flaggskepp, men de oberoende mätningarna har gjort den gränsen mer specifik än ”sämre på svåra saker”. På AIME 2026 matchar den V4 Pro inom konfidensintervallen; där den tydligt ligger efter är kunskapsbredden — AA-Omniscience -16 och en hög uppmätt hallucinationsfrekvens — och det mest krävande agentiska arbetet. Indata är endast text, utan inbyggd bildinmatning. Rubriksiffrorna för agentiskt arbete är rapporterade av DeepSeek från dess egen testmiljö, och den enda siffra som ett oberoende labb har kört om kom in lägre (Artificial Analysis mätte Terminal-Bench 2.1 till 79 % mot de rapporterade 82,7), så betrakta leverantörssiffrorna som vägledande. Och ”billigt per token” är inte ”billigt per uppgift”: den här modellen är mätbart mångordig, så begränsa resonemangsinsatsen och verktygsiterationerna vid enkla anrop i stället för att ha maxinsatsen påslagen som standard. Validera mot din egen arbetsbelastning innan du släpper på produktionstrafik.

FAQ

Vad är DeepSeek V4 Flash?

DeepSeeks effektivitetsmodell i V4-serien: en mixture-of-experts-modell med 284B / 13B aktiva parametrar, ett kontextfönster på 1M-token, upp till 384K i utdata, optimerad för snabbt, högvolymigt, agentiskt och kodningsarbete. Dess officiella lansering (build -0731) släpptes den 31 juli 2026.

Vad ändrades i den officiella releasen?

Arkitekturen är oförändrad; det är en post-training-uppgradering som avsevärt förbättrar agentiska förmågor, kodning och verktygsanrop, och lägger till inbyggt stöd för Responses-API med Codex-anpassning. Endast Flash API uppgraderades — V4 Pro och appen/webben är desamma.

Hur mycket kostar V4 Flash?

Cirka 0,15 $ per miljon inmatningstokens och 0,29 $ per miljon utmatningstokens på OrcaRouter (0% påslag) — ungefär en tredjedel av V4 Pro:s 0,44 $ / 0,88 $ — med cacheträffar angivna till 0,0028 $ per miljon, cirka 98% under färsk inmatning. Priserna var oförändrade i denna utgåva. Budgetera för tokenvolym såväl som pris: detta är en mångordig resonemangsmodell, och ett svar på 100 000 tokens kostar cirka tre cent.

Hur bra är V4 Flash på agentiska och kodningsuppgifter?

DeepSeek rapporterar starka resultat: Terminal-Bench 2.1 82.7, Toolathlon (verifierat) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — alla siffror från leverantörens testmiljö, så verifiera på dina egna uppgifter.

Är V4 Flash något bra på tävlingsmatte?

Bättre än vad priset antyder. På MathArenas AIME 2026-grid får aprilförhandsversionen 95,83 % över fyra körningar med 30 problem — inom konfidensintervallet för V4 Pros 96,67 %, till ungefär en niondel av kostnaden per problem — även om MathArena flaggar båda modellerna för möjlig kontaminering, och den har ännu inte poängsatt versionen -0731. Det enda problem den aldrig löser är problem 15, som endast GPT-5.5 med extra hög ansträngning och Claude Opus 4.8 på max löser tillförlitligt.

Hur står sig V4 Flash jämfört med V4 Pro?

Pro är det vida större flaggskeppet för det svåraste resonerandet och kodandet; Flash är effektivitetsnivån till ungefär en tredjedel av priset med stark agentisk/kodningsförmåga. Dirigera svåra uppgifter till Pro, allt annat till Flash.

Vad är kontextfönstret?

Hela 1 048 576 tokens (cirka 1M), med upp till 384K output-token.

Är V4 Flash multimodal?

Nej — indata är endast text. Den stöder resonemang, verktygsanrop och JSON-utdata.

Fungerar V4 Flash med Responses API och Codex?

Ja — versionen -0731 lägger till inbyggt stöd för Responses-API och specifik Codex-anpassning, tillsammans med OpenAI ChatCompletions och Anthropic-liknande gränssnitt.

Hur använder jag V4 Flash?

Direkt via DeepSeeks API, eller genom OrcaRouters OpenAI-kompatibla slutpunkt med 0 % påslag (deepseek/deepseek-v4-flash), där du också kan jämföra och dirigera mellan konkurrerande modeller.

Slutsats

DeepSeek V4 Flash:s officiella lansering behåller det billiga, snabba receptet och gör den till en betydligt bättre agent: samma 284B / 13B-aktiva MoE och 1M kontext, eftertränad för starkare kodning och verktygsanvändning, med inbyggt Responses-API och Codex-stöd, till samma ~0,15 $ / 0,29 $. De oberoende siffrorna backar nu upp det mesta av marknadsföringen — Artificial Analysis placerar -0731-bygget i nivå med Gemini 3.6 Flash på intelligens, och MathArena har förhandsbygget i nivå med V4 Pro på AIME 2026 för en niondel av kostnaden per problem. Vad det låga priset inte köper är kunskapsbredd eller ett frikort från mångordighet: den här modellen tänker i ungefär dubbla tokenbudgeten jämfört med en medianmodell, så din kostnad per uppgift beror mer på hur mycket resonerande du tillåter än på det utropade priset. Kör den genom en OpenAI-kompatibel slutpunkt utan påslag, som OrcaRouter, mät vad dina egna tuffa förfrågningar faktiskt förbrukar, och dirigera upp till en flaggskeppsmodell endast där mätningen visar att du måste.

Jämförda i den här artikeln4

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen