Hero-rubrikkort med texten 'DeepSeek V4.1 Flash vs DeepSeek V4 Pro' med underrubriken 'Den planerade överlämningen, inställd 2026-09-11', två kort med texten 'DeepSeek V4.1 Flash — AA Index 40, $0.15 / $0.60' och 'DeepSeek V4 Pro 0813 — AA Index 36, $0.66 / $1.98', och en sidfot med texten 'AA Index enligt Artificial Analysis; priser enligt DeepSeek, off-peak, per 1 miljon tokens.'
Guides & Insights

DeepSeek V4.1 Flash vs DeepSeek V4 Pro: Överlämningen som DeepSeek planerade men sedan ställde in

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

DeepSeek V4.1 Flash släpptes den 10 september 2026, och DeepSeek V4 Pro skulle redan vara borta vid det här laget. Planen, som tillkännagavs två dagar före Flash-släppet och fastställdes på släppdagen, var att den 14 september 2026 kl. 12:00 pekingtid varje anrop till deepseek-v4-pro skulle i tysthet omdirigeras till den nyare, billigare deepseek-flash och faktureras enligt Flash-priser. DeepSeek ställde in det den 11 september 2026 efter att utvecklare protesterade, och den 14 september 2026 passerades tidsfristen med V4 Pro fortfarande uppe och faktureringen oförändrad. Så detta är inte en lanseringsjämförelse – modellen till vänster är åtta dagar gammal och modellen till höger är en ett år gammal flaggskeppsmodell i sin fjärde månad av allmän tillgänglighet. Det är en jämförelse av två modeller vars tillverkare publicerade benchmarks som visade att den billiga vann, och sedan upptäckte att dess användare inte höll med, och backade. Den sekvensen är det mest användbara som någon har publicerat om någon av modellerna den här månaden, eftersom det är exakt det beslut du själv står i begrepp att fatta.

Vad som faktiskt hände, i ordning.

Tidslinjen spelar större roll än något enskilt benchmark här, eftersom vändningen är själva berättelsen och tillkännagivandet var avsiktligt lågmält.

2026-09-09 — DeepSeek meddelar användarna att innan V4.1 Pro anländer kommer V4 Pro-förfrågningar att dirigeras till V4.1 Flash och faktureras enligt Flash-priser. Budskapet är att Flash helt har överträffat Pro när det gäller prestanda, kostnad, hastighet och tid för att slutföra uppgifter.

2026-09-10 — DeepSeek V4.1 Flash blir allmänt tillgänglig i appen, på webben och i API:et. Vikterna publiceras på Hugging Face under MIT. API-modellens namn blir deepseek-flash. Den tidigare generationen deepseek-v4-flash och deepseek-v4-flash-vision-exp avvecklas helt, och deras äldre ID:n dirigeras tillfälligt till V4.1 Flash. Nedstängningen av Pro skjuts upp till 2026-09-14, 12:00 kinesisk tid (04:00 UTC).

2026-09-11 — DeepSeek gör en helomvändning. Som svar på användarnas efterfrågan meddelar företaget att V4 Pro API-tjänsten fortsätter efter 2026-09-14 med oförändrad fakturering, och det automatiska bytet till V4.1 Flash ställs in.

2026-09-14 — tidsfristen passerar. V4 Pro levererar fortfarande till $0.66 / $1.98 per miljon tokens under lågtrafik.

Asymmetrin i den sekvensen är hela artikeln. Flash-användare migrerades vare sig de ville eller inte – det gamla V4 Flash-ID:t svarar nu med en annan modell. Pro-användare fick respit, och anledningen är inte att V4 Pro presterar bättre i benchmarks. Det är att produktionssystem hade trimmats mot den: promptar, agentramverk, utvärderingsharnessar och antaganden om reproducerbarhet som ett backend-byte ogiltigförklarar utan någon kodändring på anroparens sida. DeepSeeks jämförelsesida listar fortfarande båda modellerna idag, sida vid sida, vilket visar att företaget avser att erbjuda båda.

Sida vid sida: de två SKU:erna

Allt nedan är DeepSeeks egen publicerade specifikation om inte en källa anges. Priserna gäller per miljon tokens, utanför högtrafik, med högtrafikpriset inom parentes – DeepSeek har högtrafik mellan 01:00 och 04:00 och igen mellan 06:00 och 10:00 UTC, måndag till fredag, och alla andra tider är utanför högtrafik till halva högtrafikpriset.

API-modellnamndeepseek-flash (DeepSeek-V4.1-Flash) vs deepseek-v4-pro (DeepSeek-V4-Pro-0813).

Indata, cachemiss — 0,15 $ (0,30 $) mot 0,66 $ (1,32 $).

Indata, cacheträff — $0.003 ($0.006) vs $0.022 ($0.044).

Utdata — 0,60 $ (1,20 $) mot 1,98 $ (3,96 $).

Kontext / max utdata — 1M tokens / 384K på båda. Identiska.

Bildinmatning — stöds inbyggt på Flash; anges som inte stöds på V4 Pro.

Samtidighetsgräns — 2 500 på Flash mot 500 på V4 Pro.

Rapporterade parametrar — Flash: 552B totalt, leverantörens siffra, med en trovärdig invändning från communityn mot den (mer om det nedan). V4 Pro: 1.6T totalt, ~49B aktiva, vilket Artificial Analysis också listar och vLLM-receptsidan bekräftar.

Aktiv budget per token — Flash aktiverar ungefär 8B vid prefill och 16B vid decode, vilket är själva poängen med dess arkitektur; Pro aktiverar ~49B per token.

Licens — MIT öppna vikter på båda.

GA-datum — Flash 2026-09-10; V4 Pro 0813 2026-08-13, efter en förhandsvisning i april.

Two-column scoreboard comparing DeepSeek V4.1 Flash and DeepSeek V4 Pro 0813 across six dimensions: AA Intelligence Index 40 vs 36, input $0.15 vs $0.66 per 1M off-peak, output $0.60 vs $1.98 per 1M off-peak, output speed 214.4 vs 94.4 tokens/s, image input supported vs not supported, and concurrency limit 2,500 vs 500, with a footer reading 'AA Intelligence Index and output speed per Artificial Analysis; prices, image input and concurrency per DeepSeek, off-peak.'

Prisskillnaden är hela argumentet

Indata är 4,4× dyrare på Pro. Utdata är 3,3×. Cacheträffar – nivån som dominerar en lång agentkörning med en stabil systemprompt – är 7,3×. Eftersom peak fördubblas för varje nivå på båda sidor är kvoten identisk vid peak; gapet är inte en rabattartefakt.

Kör en arbetsbelastning på den. Ta en kodagent som använder 10 miljoner indatatokens i månaden med en cacheträffsfrekvens på 70 % och 2 miljoner utdatatokens. På V4.1 Flash vid off-peak är det $0,45 för ny indata, $0,021 för cachad indata och $1,20 för utdata: $1,67. På V4 Pro vid off-peak är det $1,98, $0,154 och $3,96: $6,09. Ungefär 3,6×, på en arbetsbelastning som är medvetet oansenlig.

Det är DeepSeeks egen lista, och den är priset du faktiskt betalar här: OrcaRouter för vidare leverantörernas listpriser med 0 % påslag, så en prisförändring från DeepSeek slår igenom på vår sida samma dag i stället för att paketeras om. Båda modellerna använder samma nyckel, vilket spelar roll för avsnittet längre fram – det om att testa en migrering du inte längre behöver göra.

Screenshot of DeepSeek's official Models & Pricing page showing deepseek-flash and deepseek-v4-pro side by side: vision supported for Flash and 'Not supported' for V4 Pro; cache-hit input $0.003 vs $0.022 off-peak; cache-miss input $0.15 vs $0.66; output $0.60 vs $1.98; concurrency limit 2500 vs 500; and a footnote stating that in response to user demand DeepSeek will continue providing V4 Pro API services after September 14, 2026 with billing unchanged.

Där DeepSeek V4.1 Flash verkligen vinner

Det starkaste beviset för Flash är inte DeepSeeks benchmarktabell. Det är Artificial Analysis, som är oberoende och läses direkt från deras modellsidor.

Intelligence Index — Flash (Reasoning, Max Effort) får 40 poäng, rankad #6 av 113 modeller. V4 Pro 0813 (Reasoning, Max Effort) får 36 poäng, rankad #7. Samma index, samma ansträngningsinställning, fyra poängs skillnad, med den billigare modellen före.

Utdatashastighet — 214,4 tokens/s mot 94,4 tokens/s. Det är 2,3×, och det är uppmätt, inte påstått.

Tid till första token — 1,21 s mot 1,74 s.

DeepSWE v1.1 — 74,2 för Flash på den bevakade resultattavlan, förstaplats, före GPT-6 Astra på 74,10, Claude Opus 5 på 74,00 och Gemini 3.8 Flash på 73,70. V4 Pro 0813:s 62,7 på samma benchmark är DeepSeeks egen siffra. Marginalen i toppen är 0,2 punkter, vilket är ett dött lopp, inte en vinst — men en lucka på 11,5 punkter över Pro är inte ett dött lopp.

Serveringseffektivitet — Flashs dekoder härleder sin globala KV från encoderns slutliga dolda tillstånd i stället för att räkna om den per lager, vilket är det som ger den asymmetriska aktiveringen med 8B-prefill / 16B-decode. InferenceX-profilen från SemiAnalysis uppskattar KV-cachen till ungefär 890 byte per token — ungefär en fjärdedel av V4 Flashs — med persistent KV-lagring ner till ungefär en åttondel. Det är anledningen till att priset är vad det är, och det är också därför modellen är tillgänglig vid 2 500 samtidighet medan Pro har ett tak på 500.

Vision i det tillhandahållna API:et – inte bara i vikterna. DeepSeeks egen prissida listar bildinmatning som stödd för Flash och inte stödd för V4 Pro, och DeepSeek beskriver den som sin första flaggskeppsmodell med inbyggd multimodal förståelse. Detta är det första DeepSeek-flaggskeppet där läsning av en skärmbild inte kräver någon separat slutpunkt.

Alla de andra rubriksiffror du kommer att se citerade — Terminal-Bench 2.1 på 90.6, GPQA Diamond på 90.9, Codeforces 3471 — är DeepSeeks egna, inte reproducerade av oss, och bör läsas med det i åtanke.

Där DeepSeek V4 Pro fortfarande är rätt val

Det skulle vara lätt att döma ut V4 Pro efter en sådan vecka. Den omvända utfasningen säger motsatsen, och specifikationsbladet säger också motsatsen.

Pro har 1,6T totala parametrar och aktiverar ~49B per token, mot Flashs 16B vid avkodning. Vad index än säger är kapacitet per token en verklig resurs, och de arbetsbelastningar där den visar sig är de med lång horisont: flera timmar långa agentkörningar, stora refaktoreringar, uppgifter där ett tidigt felsteg kostar hela banan. En indexskillnad på fyra punkter mäter genomsnittet av tio utvärderingar, inte svansen av din fördelning.

Pro är också en känd kvantitet. Det har varit allmänt tillgängligt sedan 2026-08-13 efter en förhandsvisning i april, och 0813-versionen fick sin prestanda från efterträning snarare än arkitektur – samma parameterantal, samma form som förhandsvisningen, annat beteende. Det är fyra månader av community-verktyg, publicerade agentramverk, promptmönster och felmoder. Flash har varit GA i åtta dagar, och ekosystemet kring det är motsvarande tunt. Om ditt teams tillförlitlighet kommer från att veta exakt hur en modell misslyckas, är Pro där den kunskapen finns.

Och tjänsten upphörde inte. DeepSeeks åtagande är uttryckligt och dess fakturering är oförändrad, vikterna är MIT, och V4 Pro finns fortfarande i vår katalog till samma listpris. Den inställda avvecklingen är inte en uppskjuten verkställighet – den är ett uttalande om att DeepSeek avser att fortsätta betjäna nivån.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro showing the model ID deepseek/deepseek-v4-pro, the description 'DeepSeek V4 Pro flagship MoE — 1.6T total / 49B active params, 1M context', 1M-token context and 384K max output, text-only input, $0.66 per 1M input tokens and $1.98 per 1M output tokens, and p50 TTFT of 5.79 seconds.

Tre saker att ha emot båda modellerna

Skyddsräcken, eftersom det är dyrt att fatta detta beslut fel.

Antalet parametrar är omdiskuterat. 552B är DeepSeeks siffra. En trovärdig community-analys hävdar att den släppta checkpointen är 748B — 552B-transformerryggraden plus den ~196B stora Engram-tabellen för villkorligt minne, vilket är en uppslagsstruktur som konsulteras vid två punkter i nätverket snarare än ett lager som signalen flödar genom. Den publicerade nedladdningen är 510,3 GB över 48 safetensors-shards av FP8-täta vikter med FP4-routade experter. Båda siffrorna kan vara korrekta samtidigt, beroende på om man räknar hämtning separat från beräkning. Behandla 552B som leverantörsuppgivet och kontrollera diskutrymmet innan du planerar en driftsättning.

En poäng på en resultattavla är en fasad, inte ett kontrakt.DeepSWE v1.1:s 74,2 är ett riktmärke för testramverk. En egenpublicerad granskning från EyesTech Systems Lab hävdar att dessa poäng i Flash-klassen kollapsar när de flyttas till isolerade, verkliga flerfiliga repositorier — vilket placerar DeepSeek V4.1 Flash på 31,4 % på SWE-bench Pro mot rubrikens 74,2 %, ett större tapp än de främsta modellerna i dess egen jämförelse. Den granskningen är inte oberoende — författaren säljer ett verktyg för att upptäcka precis det utnyttjande av testramverk som han beskriver — och vi har inte sett någon replikering av den. Det är ändå rätt hållning: verifiera i dina egna repositorier innan du migrerar.

Mångordighet är en kostnadspost.Artificial Analysis mätte att V4.1 Flash genererade 250M utdatatokens under sin Intelligence Index-körning, mot en median på 140M för jämförbara modeller med öppna vikter, och kallar den för mycket ordrik. Utdata är den dyra riktningen i den här pristabellen, så en modell som tänker högt urholkar sina egna besparingar. I en resonemangstung arbetsbelastning bör du budgetera för antalet tokens, inte bara tokenpriset.

En sak till, sagt rakt ut så att ingen planerar utifrån ett rykte: DeepSeek V4.1 Pro är inte släppt. Den inställda migreringen framställdes som en tillfällig lösning ”innan V4.1 Pro lanseras”, och inget kring det har förändrats.

Välj DeepSeek V4.1 Flash om

• Din arbetsbelastning har hög volym, är latenskänslig eller kostnadsbegränsad — klassificering, extrahering, routning, sammanfattning, chatt, de flesta former av kodgenerering.

• Du behöver bildinmatning på samma slutpunkt som text. Detta är den första DeepSeek-flaggskeppsmodellen där det är ett enda anrop i stället för en andra modell.

• Dina promptar är cachebara. Vid 7,3× vid cacheträffar är gapet som störst precis där agenttrafiken finns, och en stabil systemprompt utgör större delen av indata för en lång körning.

• Du börjar på nytt den här veckan och har ingen testrigg som är anpassad till en specifik modells egenheter. Det finns inget att skydda.

• Du vill ha ett högre samtidighetstak. 2 500 mot 500 är en femfaldig skillnad i hur mycket du kan pressa igenom innan du börjar köa.

Välj DeepSeek V4 Pro om

• Du har redan en produktion som är trimmad mot det. Omvändningen innebär att du har tid – använd den för att testa i stället för att undvika frågan.

• Dina uppgifter är långsiktiga och misslyckanden är kostsamma, och du har uppmätt att ~49B aktiva parametrar per token ger dig något som Flashs 16B inte gör, på dina data snarare än på en leaderboard.

• Du behöver ett förutsägbart, enbart textbaserat beteende utan någon visuell väg att resonera kring, eller så har du utvärderingsbaslinjer som ett modellbyte skulle ogiltigförklara mitt i studien.

• Ditt åtkomstmönster har låg volym och höga insatser, där 3.6× på en liten räkning inte är den avgörande termen.

Om du redan har byggt på DeepSeek V4 Pro

Det användbara som förändrades den 11 september 2026 är att din migrering slutade vara en deadline och blev ett beslut. Det är strikt bättre för dig och strikt sämre för din inkorg, eftersom beslutet fortfarande måste fattas och nu är det ingen som fattar det åt dig.

Börja med att prissätta det. Gapet på 3,3–4,4× är siffran du lämnar på bordet, och det genomräknade exemplet ovan gör om det till en månadssiffra på ungefär en minut. Testa det sedan på det enda sätt som räknas: spegla en del av produktionstrafiken till Flash, behåll Pro på den primära vägen och diffa utdata på dina egna uppgifter. Eftersom båda modellerna svarar på samma nyckel till leverantörens listpris med automatisk failover, är den skuggkörningen en routingändring snarare än en andra integration, och routern kan skicka tillbaka en förfrågan till Pro utan att du skriver fallbacken. Team som bränner tokens på en migrering de inte bad om är anledningen till att routinglagret finns från första början.

Anta inte att Flash är en direkt utbytbar komponent. Det är en annan arkitektur – en 40-lagers kausal encoder–decoder med asymmetrisk aktivering – och den är mer utförlig i sitt resonemang. Beteende på promptnivå kommer inte att porteras problemfritt i någon riktning, så mät migreringen på utdata, inte på indexet.

Vad du ska titta på

Tre saker avgör hur den här kombinationen ser ut om en månad. För det första: om V4.1 Pro släpps och återställer en riktig Pro-nivå — hela den inställda migreringen var uttryckligen en tillfällig lösning för den, så DeepSeeks färdplan har fortfarande ett hål där ett flaggskepp borde finnas. För det andra: om uppskovet överlever DeepSeeks nästa prisdrag; ett företag som är villigt att en gång schemalägga en tyst omdirigering har lärt sig att det inte kan, inte att det inte borde. För det tredje: om någon utanför DeepSeek återskapar Flash-benchmarksiffrorna i omodifierade kodförråd, vilket är det enda resultat som skulle avgöra argumentet om effektivitet kontra kapacitet som hela den här jämförelsen hänger på. Fram till dess är den ärliga hållningen den som själva vändningen antyder: Flash är det bättre standardvalet för allt nytt, Pro är det bättre kortet för allt som redan är byggt, och DeepSeek har just sagt till dig att de kommer att betjäna båda medan du kommer fram till vilken av dem du är.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen