En hero-titelbild för DeepSeek V4.1 Flash med underrubriken "Tvådagars API-beta: vad vi vet hittills", pillerformade märken med texterna "MELLANVERSION" och "API-TEST – GÅR UT 09-10", en sidfotsrad med texten "Officiellt releaseinlägg väntas inom kort" och OrcaRouter-logotypen placerad i det nedre högra hörnet.
Guides & Insights

DeepSeek V4.1 Flash lanseras i tvådagars API-beta: Ny arkitektur, inbyggd multimodal och ambition på pronivå

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

DeepSeek V4.1 Flash dök upp precis där Deep​Seek testar saker innan de tillkännages: i live-API:et, under ett modell-ID som bär sitt eget utgångsdatum. ID:t — deepseek-v4.1-flash-expires-on-0910 — började leverera den 8 september 2026, efter att Deep​Seeks team postade ett internt test av en "mellanversion" i sina officiella communitygrupper, och det avslutande 0910 är berättelsen i miniatyr. Det här är en build som släppts i den verkliga API-miljön för ett begränsat test som är planerat att tas offline runt den 10 september, inför det officiella releaseinlägg som de tipsare som flaggat modellen förväntar sig "mycket snart". Det är inte en lansering. Det finns inget modellkort, ingen teknisk rapport, ingen changelogg-post, och sedan i kväll listar Deep​Seeks publika sida Models & Pricing fortfarande bara DeepSeek V4 Flash, DeepSeek V4 Pro och DeepSeek-V4-Flash-Vision-Exp.

Allt nedan bör läsas med den asterisken i åtanke. Den officiella kanalen här är ett tillkännagivande i en communitygrupp och ett tillhörande feedbackformulär, inte en versionsnotis. Det som följer är en sammanställning av det tillkännagivandet, rapporteringen från kinesiska medier inom några timmar efter det, och första dagens mätningar från utvecklare som riktade sina egna nycklar mot slutpunkten — där leverantörens påståenden och communityns siffror är tydligt märkta som just det de är.

Vad hände egentligen idag?

Omkring klockan 15.00 pekingtid den 8 september meddelade Deep​Seeks team sina officiella communitygrupper att en mellanversion – på kinesiska beskriven som 中间版本, en mellanliggande checkpoint – öppnades för begränsad testning i den riktiga API-miljön innan en slutlig version släpps. Alla med en Deep​Seek API-nyckel kan anropa den: behåll din befintliga bas-URL och nyckel, och ställ in modellnamnet till deepseek-v4.1-flash-expires-on-0910. Det är hela åtkomsthistorien – det finns ingen separat endpoint, ingen väntelista och ingen ny konsol.

Det praktiska utrymmet är snävt. Suffixen kodar planen: testversionen "kommer automatiskt att upphöra och gå offline den 10 september", vilket lämnar ungefär två dagars drifttid. Varje konto är begränsat till 20 samtidiga förfrågningar — jämfört med gränsen på 2 500 samtidiga anslutningar som Deep​Seek publicerar för deepseek-v4-flash — vilket är en stark ledtråd om avsikten: detta är för funktionstestning och utvärdering, inte för att dirigera produktionstrafik mot.

• Vad det är — en "mellanversion"-checkpoint placerad i live-API:et för kortvarig testning inför en officiell build.

Var den körs — DeepSeeks eget API; bas-URL och nyckel oförändrade, modellnamn bytt till deepseek-v4.1-flash-expires-on-0910.

• Hur länge — namnet anger expires-on-0910; testet förväntas gå offline runt den 10 september.

• Vem kan anropa det — vilket konto som helst med en Deep​Seek-nyckel, med 20 samtidiga förfrågningar per konto.

A single-column scoreboard titled 'DeepSeek V4.1 Flash - the scoreboard' listing Model ID deepseek-v4.1-flash-expires-on-0910, Status 2-day API beta - expires 09-10, Concurrency 20 req/account (V4 Flash: 2,500), Billing same rate card as DeepSeek V4 Flash, Speed (community) ~420 tok/s peaks 500+, Native multimodal text + image (official claim), with a footer reading 'Speed is community-measured; no official benchmarks or specs published yet.'

Vad betan tar betalt: prislistan för DeepSeek V4 Flash

Deep​Seek sade att testet debiteras enligt samma priser som deepseek-v4-flash, och att modellens nuvarande prislista är den som gäller. Sedan prisjusteringen den 16 augusti 2026 tillämpar Deep​Seek topp-/lågtrafikspriser; de exakta siffrorna är de officiella för Flash-nivån:

• Inmatning, cacheträff — $0.007 per 1M tokens utanför högtrafik, $0.014 högtrafik

• Input, cache miss — $0.22 per 1M tokens i lågtrafik, $0.44 i högtrafik

• Utdata — $0,66 per 1M tokens i lågtrafik, $1,32 i högtrafik

• Rusningstid — 01:00–04:00 och 06:00–10:00 UTC, måndag–fredag; alla andra timmar är lågtrafik till halva rusningstaxan

A screenshot of the DeepSeek API docs Models & Pricing page (captured September 8, 2026) showing the current public lineup — deepseek-v4-flash, deepseek-v4-pro and deepseek-v4-flash-vision-exp — with 1M context and 384K max output, the off-peak/peak price columns (deepseek-v4-flash: $0.007 cache-hit input, $0.22 cache-miss input and $0.66 output off-peak, doubled at peak), and published concurrency limits of 2,500 / 500 / 2,500.

Observera vad som inte ändrades: priset per token. Deep​Seeks påstående om att V4.1 Flash är ”billigare” är därför ett effektivitetsanspråk, inte en prissänkning – en poäng som flera testare från första dagen fick lära sig den dyra vägen, när de såg en fem minuter lång session dra betydligt mer från sitt saldo än en lika lång session på DeepSeek V4 Flash, eftersom modellen gör av med tokens mycket snabbare. Huruvida kostnaden per uppgift faktiskt sjunker beror på om den slutför jobbet med färre tokens och färre försök, vilket ingen kan bedöma utifrån två dagars hastighetstester.

Vad "ny arkitektur, native multimodal" betyder — hittills overifierat.

Deep​Seeks officiella beskrivning av V4.1 Flash innehåller fyra påståenden: en ny modellstruktur, nativt multimodalt stöd, starkare kapacitet och snabbare generering. Arkitekturpåståendet är det som sticker ut, eftersom det bryter ett mönster. Den tidigare uppdateringen, DeepSeek V4 Flash 0731, var en efterträningsuppdatering som behöll samma arkitektur och skala som sin förhandsversion; Deep​Seeks formulering här tyder på en strukturell förändring, och flera medier tolkade det som ett tecken på att modellen var omtränad snarare än finjusterad. Utöver det är allt spekulation. Spekulationerna i communityn om ändrade uppmärksamhetsmekanismer, expertnätverk eller en integrerad visionsmodul är just det — spekulation. Varken antalet parametrar, kontextfönstrets storlek, någon benchmarktabell eller någon teknisk rapport har publicerats.

Formuleringen "native multimodal" är viktig av en specifik anledning. DeepSeek-V4-Flash-Vision-Exp, som lanserades den 21 augusti och har haft öppna vikter sedan den 31 augusti, fäste en vision-encoder på DeepSeek V4 Flash-textbasen — DeepSeek:s eget material beskrev paret som en textmodell plus en extern visionsväg. V4.1 Flash beskrivs som multimodal från grunden, med bild- och textinmatning som hanteras av själva basmodellen. Det är i princip en verklig arkitekturell skillnad, men modalitetspecifikationen har inte publicerats: det som testarna har prövat är text-plus-bilder, och en läsare bör behandla "multimodal" som bekräftat endast i den text-och-bild-bemärkelsen tills ett modellkort publiceras. Huruvida en bredare uppsättning indata ingår i planen är, i skrivande stund, okänt snarare än bekräftat.

Hastigheten är rubriken — och den är en gemenskapsmätning.

Siffran som cirkulerar den första dagen är ungefär 420 utdatatokens per sekund i långa genereringar, med toppar på över 500 tokens/s rapporterade i enskilda körningar. Ett vida delat test genererade mer än 71 000 tokens på under tre minuter. Inget av detta är officiellt: det rör sig om utvecklares mätningar mot betaändpunkten under okontrollerade förhållanden, och Deep​Seek har inte publicerat något eget prestandatest. För jämförelse mäter Artificial Analysis den publika DeepSeek V4 Flash 0731-ändpunkten till ungefär 128 tokens/s, så de tidiga rapporterna tyder på ett rågenomströmningshopp på omkring tre gånger eller mer – med sedvanliga reservationer att genomströmningen beror på inmatningslängd, samtidighet och serverförhållanden.

Jämförelserna från början till slut mot DeepSeek-V4-Flash-Vision-Exp är där gapet ser störst ut, eftersom de mäter samma uppgift efter varandra. Testpersoner rapporterade ungefär 6× snabbare från början till slut på en SVG-kodgenereringsuppgift, cirka 5.2× på en långkontextsökning med 49k-token, runt 5× på en stor SQL-genererings- och optimeringsuppgift, 4.6× på ett algoritmiskt problem och 3.9× på en asynkron omstruktureringsuppgift. Betrakta dem som vägledande, inte exakta: samma uppgifts siffror från början till slut inkluderar tanketid, första-token-latens och genereringshastighet, och de kommer från enskilda testare snarare än en kontrollerad testsvit. Den konsekventa riktningen genom alla är den intressanta signalen, inte någon enskild multipel.

Frågan i hjärtat av betan

Den mest strategiska detaljen gömmer sig i feedbackformuläret som Deep​Seek bifogade till testet. Vid sidan av frågor om agentramverk och verkliga scenarier frågar det testarna direkt om mellanversionen DeepSeek V4.1 Flash ”kan helt ersätta onlineversionen av DeepSeek V4 Pro”. Det är en anmärkningsvärd fråga för ett företag att ställa till användare, eftersom DeepSeek V4 Pro ligger tre prisnivåer högre än Flash: till nuvarande officiella priser debiterar Pro-modellen $0,66 per 1M input tokens (cache miss) och $1,98 per 1M output tokens under lågtrafik, jämfört med $0,22 och $0,66 för DeepSeek V4 Flash — exakt 3× på varje rad. Om en modell på Flash-nivå verkligen närmar sig Pro-nivåns kapacitet till priser på Flash-nivå, besvarar frågan sig själv för en stor del av användarna, och Deep​Seek vet det.

Läst tillsammans med formuleringen "new structure" antyder enkäten att V4.1 Flash är det första synliga steget mot något större än en punktuppdatering – en Flash-linje som ompositionerats för att minska avståndet till flaggskeppet, på samma sätt som Deep​Seek upprepade gånger har använt en billigare, snabbare modell för att återställa marknadens förväntningar på vad en priskategori ger. Inget av detta bekräftas av ett benchmark; det är en strategisk läsning av en fråga på två meningar. Men det är det mest intressanta Deep​Seek har sagt om V4.1 Flash under hela dagen.

Var man ska prova det, och vad man ska köra i produktion under tiden

Under testfönstret är den enda platsen att nå V4.1 Flash Deep​Seeks eget API – det finns ingen tredjepartshosting av en build som upphör att fungera om två dagar, och ingen bör koppla en produktionsväg till ett modell-ID som är planerat att sluta svara. Det vettiga sättet att använda de närmaste två dagarna är utvärdering: kör dina representativa arbetsbelastningar, mät kvalitet och verklig tokenekonomi, och behandla varje hastighetssiffra du ser som anekdotisk tills en formell release dyker upp med ett modellkort.

För trafik som måste fortsätta fungera är den publika Deep​Seek-serien oförändrad, och det är där ett routningslager visar sitt värde. På OrcaRouter är DeepSeek V4 Flash, DeepSeek V4 Pro och DeepSeek-V4-Flash-Vision-Exp alla nåbara genom ett enda API till Deep​Seeks listpris, förmedlat utan påslag — så prissänkningen i augusti har varit live hos oss sedan den dag den kom, inte när ett marginalkalkylblad hann ikapp. När en formell V4.1 Flash så småningom levereras till leverantörer är samma upplägg det sätt som ger låg bytekostnad för att införa den: skicka en del av trafiken till den nya modellen, behåll DeepSeek V4 Flash eller V4 Pro som automatisk failover och låt routerns DSL avgöra vilka anrop som förtjänar den oprövade modellen och vilka som ska stanna kvar på arbetshästen. Du behöver inte satsa en produktionsväg på en tvådagarsbeta för att ta reda på om den är bra.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash (captured September 5, 2026) showing the Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, text input, a p50 time-to-first-token of 434 ms, and the description 'DeepSeek V4 Flash efficient MoE — 284B total / 13B active params, 1M context, optimized for fast everyday workloads.'

Öppna frågor

• När kommer den officiella releasen? Signalen som flaggade den här modellen säger att ett releaseinlägg väntas "mycket snart"; att betan bara varade i två dagar tyder på att DeepSeek inte tänker låta världen vänta länge.

• Motsvarar den slutgiltiga versionen den här? Oberoende testare som följer Deep​Seek testcykler noterar att företaget verkar köra flera kandidatbyggen parallellt, och den snabbaste kandidaten i ett tidigt test är inte alltid den som lanseras — så dagens hastighetssiffror kanske inte beskriver GA-modellen.

• Vilka är specifikationerna? Parameterantal, arkitekturdetaljer, kontextlängd och den fullständiga listan över inmatningsmodaliteter är alla opublicerade, och alla är det första en riktig recension behöver.

• Håller priset, och överlever "lägre kostnad" kontakt med verkliga arbetsbelastningar? Betaversionen fakturerar till DeepSeek V4 Flash-priser; en lansering kan innebära en ny prislista, och kostnaden per uppgift är inte uppmätt.

• Kan den verkligen klara Pro-jobbet? Frågeformuläret ställer frågan, men bara oberoende utvärderingar av agentiska och resonemangsbaserade testsviter — de benchmarks som idag skiljer Flash-nivån från Pro-nivån — kan besvara den.

Om du har en Deep​Seek-nyckel är tvådagarsklockan hela historien: anropa deepseek-v4.1-flash-expires-on-0910 innan den försvinner, kör dina egna arbetsbelastningar och arkivera siffrorna under ”communitymätt, förhållandena varierar”. För alla andra är det lanseringsinlägget man ska hålla koll på, och frågan bakom det — huruvida Deep​Seeks billigaste nivå just har börjat sikta på sin dyraste.

Medan den två dagar långa betan faller på plats, är den stabila Flash-modellen som du faktiskt kan köra idag bara ett API-anrop bort: DeepSeek V4 Flash on OrcaRouter — till Deep​Seek:s listpris, utan påslag.

Och flaggskeppet som betafrågeformuläret ständigt ber testarna jämföra V4.1 Flash med: DeepSeek V4 Pro på OrcaRouter.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen