Hero-titelkort med texten 'DeepSeek V4.1 Flash-priser' och raden '$0.15 indata, $0.60 utdata, $0.003 cache-träff', bildtexten 'Per 1M tokens, utanför högtrafik. Högtrafik fördubblar alla priser.', samt tre kort med texten 'Cache-träff: 50x billigare än en miss', '1M tokens kontext' och 'Öppna vikter, MIT-licens'
Guides & Insights

DeepSeek V4.1 Flash-prissättning: Hela prislistan, och cacheträffsiffran som avgör din faktura

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

DeepSeek V4.1 Flash har varit allmänt tillgänglig sedan 2026-09-10, och i dag är dess publicerade prislista det billigaste i toppskiktet på modellmarknaden: 0,15 USD per miljon indatatoken, 0,60 USD per miljon utdatatoken och 0,003 USD per miljon vid cacheträffar. De tre siffrorna gäller lågtrafikkolumnen. Under DeepSeeks toppfönster på vardagar fördubblas varenda en, även cacheträffar. Jämförelsen som spelar roll är inte mot DeepSeeks eget åldrande flaggskepp – DeepSeek-V4-Pro-0813 har ett listpris på 0,66 / 1,98 USD per miljon i lågtrafik, så Flash underbjuder sin egen syskonmodell med ungefär 4x på indata – utan mot den stängda frontlinjenivån som köpare faktiskt prisar mot: GPT-5.6 Sol, Claude Opus 5 och Gemini 3.8 Flash, som var och en tar en storleksordning mer per token.

En rättelse innan siffrorna, eftersom läckan som föregick lanseringen fortfarande cirkulerar. Siffrorna som spreds före GA beskrev en prissänkning som skulle träda i kraft "imorgon". Priserna är verkliga; inramningen var det inte. V4.1 Flash släpptes 2026-09-10 med dessa priser redan i kraft, och DeepSeeks egen ändringslogg registrerar sänkningen som en del av utgåvan snarare än som en senare sänkning. Allt nedan är avläst från DeepSeeks aktuella prissida idag, 2026-09-16.

Den fullständiga prislistan, per 2026-09-16

DeepSeek publicerar ett kalkylblad som täcker de aktuella SKU:erna, där varje radpost är uppdelad i en kolumn för högtrafik och en för lågtrafik. För modell-id:t deepseek-flash, som betjänar DeepSeek-V4.1-Flash, är de publicerade priserna:

Indata, cachemiss — $0,15 per 1 miljon tokens under lågtrafik; $0,30 per 1 miljon under högtrafik

Indata, cacheträff — 0,003 USD per 1 miljon tokens i lågtrafik; 0,006 USD per 1 miljon vid högtrafik

Utdata — 0,60 USD per 1 miljon tokens i lågtrafik; 1,20 USD per 1 miljon i högtrafik

Kontextfönster — 1M tokens, med en maximal utdata på 384K

Gräns för samtidighet — 2 500 samtidiga förfrågningar på Flash-SKU:n

Äldre modell-id:ndeepseek-v4-flash och deepseek-v4-flash-vision-exp har tagits ur bruk som separata produkter men dirigeras fortfarande till V4.1 Flash och faktureras till Flash-priser

Gapet mellan de två första raderna är hela historien om det här bladet. En cacheträff kostar 50 gånger mindre än en cachemiss i lågtrafik – en rabatt på 98 %, vilket också är hur Artificial Analysis framställer det i sin kostnadsmodell. Inget annat på kortet flyttar en räkning så långt.

Single-column scoreboard card titled 'DeepSeek V4.1 Flash — the rate card, 2026-09-16', with rows reading 'Off-peak input: $0.15 / 1M tokens', 'Off-peak output: $0.60 / 1M tokens', 'Cache hit: $0.003 / 1M tokens', 'Peak hours: 2x every rate', 'Context window: 1M tokens' and 'Weights: MIT, open', over the footer 'All figures from DeepSeek's published API pricing page, 2026-09-16.'Screenshot of DeepSeek's own Models & Pricing page, showing the deepseek-flash and deepseek-v4-pro columns side by side under MODEL VERSION DeepSeek-V4.1-Flash and DeepSeek-V4-Pro-0813, with 1M context and 384K max output for both, Vision supported on Flash but not on V4 Pro, and the pricing block reading cache-hit input $0.003 off-peak / $0.006 peak against $0.022 / $0.044, cache-miss input $0.15 / $0.3 against $0.66 / $1.32, and output $0.6 / $1.2 against $1.98 / $3.96, above a concurrency limit row of 2500 and 500

Peak är inte ett avrundningsfel, och det är tidsinställt för Peking.

DeepSeeks högtrafikfönster är måndag till fredag 01:00–04:00 UTC och 06:00–10:00 UTC. Allt utanför dem – inklusive alla helgtimmar – debiteras till halv taxa. Fördubblingen gäller alla tre raderna, så en cachemiss under högtrafik kostar $0,30 och utdata under högtrafik kostar $1,20.

Var dessa fönster infaller beror helt och hållet på var du befinner dig. I Peking är de 09:00–12:00 och 14:00–18:00 – två arbetsblock, vilket är själva poängen. I Berlin, i september, är det andra fönstret 08:00–12:00 CEST: ett europeiskt teams hela morgon är peak. I New York är samma fönster 02:00–06:00 EDT. Ett USA-baserat team som arbetar normala tider debiteras i praktiken aldrig vid peak, och ett EU-team betalar dubbelt varje morgon före lunch. Om du väljer när du ska köra ett batchjobb är det ett beslut värt 0,15 dollar per miljon tokens, och det kostar ingenting att fatta.

Vad prissättning för cacheträffar faktiskt gör med en agents räkning

Cacheträffar är automatiska på DeepSeek – dokumentationen säger att diskcachning är aktiverad som standard för alla användare utan kodändring – så rabatten är inget du behöver arkitektera för. Det är också bästa möjliga ansträngning, inte garanterat: DeepSeek uppger att det inte finns någon fast TTL, en oanvänd cache rensas "vanligtvis inom några timmar till några dagar", och systemet lovar inte en 100 % träffrekvens. Det är värt att läsa svarets prompt_cache_hit_tokens och prompt_cache_miss_tokens fält innan du modellerar något utifrån detta.

Aritmetiken spelar större roll än adjektivet. Ta en kodagent med ett stabilt prefix på 40 000 token – systemprompt, verktygsscheman, repo-kontext – som körs i en session på 60 turer, där varje tur lägger till ungefär 2 000 token i verktygsutdata och modellen genererar ungefär 1 200 token. Den totala indatan under sessionen är 5,94 miljoner token och den totala utdatan 72 000 token.

Fakturerat helt utan cachelagring, under lågtrafik: 5,94 M indata till $0,15 är $0,891, plus 72 000 utdata till $0,60 är $0,043 — cirka $0,93 för sessionen.

Faktureras med prefixet cachat, vilket är vad som faktiskt sker som standard: 5,782M av dessa indatatoken kommer in som cacheträffar till $0,003 ($0,017), 158 000 kommer in som cachemissar till $0,15 ($0,024) och samma 72 000 utdatatoken kostar $0,043. Cirka $0,084 — ungefär 11 gånger billigare. Indata sjunker från 95 % av fakturan till 49 % av den, den cachade delen utgör i sig 21 %, och utdatatoken blir den största enskilda posten. Samma modell, samma session, samma utdata — det enda som förändrades är om prefixet återanvändes.

Lägg märke till vad som inte finns på DeepSeeks blad: en radpost för cacheskrivning. Anthropic tar 1,25x basinput för att fylla en 5-minuterscache och 2x för en timme; DeepSeeks kort listar bara hit och miss, och dess cacheguide beskriver ingen skriv- eller lagringsavgift. Om du jämför cacheekonomin mellan leverantörer snarare än de tokenpriser som anges i rubriken, är den frånvaron värd mer än vad 50x hit-rabatten antyder.

Det är också därför som detaljen om vidaredebitering för DeepSeek V4.1 Flash på OrcaRouter spelar roll här. Vi debiterar enligt leverantörens eget listpris med noll påslag, så en prisändring från leverantören slår igenom hos oss samma dag i stället för att vänta på en omprissättningsrunda – och kolumnerna för cacheträffar och hög-/lågtrafik som du ser ovan är de som du faktiskt debiteras enligt, inte en sammanvägd approximation av dem.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model id, Vision / Tools / JSON / Reasoning tags, a 2026-09-10 release date, 1M-token context, 384K max output, text + image input, text output, $0.15 input and $0.60 output per 1M tokens, a p50 time to first token of 784 ms, a p95 of 2.95 s, 59,150.9M tokens of traffic over seven days, and body text stating OrcaRouter bills at the provider rate with zero markup added

Jämfört med DeepSeek-V4-Pro-0813: ett gap på 4x, och en pensionering som inte blev av

Den självklara interna jämförelsen är flaggskepps-SKU:n, och den är mindre dramatisk än vad rubrikpriset antyder. DeepSeek-V4-Pro-0813, modell-id deepseek-v4-pro, listas till $0,66 per 1 miljon indata vid cachemiss och $1,98 per 1 miljon utdata utanför högtrafik, och fördubblas under högtrafik till $1,32 och $3,96. Dess cacheträffar kostar $0,022 utanför högtrafik – mer än 7 gånger Flashs.

Indata vid cachemiss — $0,15 mot $0,66 i lågtrafik, så Flash är 4,4 gånger billigare

Utdata — $0.60 vs $1.98 i lågtrafik, så Flash är 3.3x billigare

Indata med cacheträff — 0,003 $ vs 0,022 $ i lågtrafik, så Flash är 7,3x billigare

Kontext och utdatatak — identiska vid 1M och 384K på båda SKU:erna

Samtidighet — 2 500 på Flash mot 500 på V4 Pro, en 5x skillnad som helt försvinner från prislistan

Tre saker i den här jämförelsen är lätta att få fel. För det första är återanvändningsargumentet starkare för flaggskeppet i absoluta tal, även om Flash har den större multiplikatorn: att cacha en miljon tokens sparar $0,638 på V4 Pro och $0,147 på Flash, eftersom flaggskeppets missfrekvens är så mycket högre från början. För det andra: modellen som alla trodde skulle vara borta är det inte: DeepSeek meddelade att man skulle sluta betjäna V4 Pro den 2026-09-14 och dirigera om dessa förfrågningar till Flash, väckte en motreaktion bland utvecklare för att man bytte ut en backend-modell under produktionsarbetsflöden och tog tillbaka beslutet den 2026-09-11. V4 Pro betjänas fortfarande, med oförändrad fakturering. För det tredje, och det här är fällan som bevakningen av läckan gick i — det finns ingen lanserad V4.1 Pro. DeepSeek-V4-Pro-0813 är fortfarande flaggskepps-SKU:n, och leverantören har inte släppt en efterträdare under det namnet. Den som prissätter en migrering till "V4.1 Pro" prissätter en modell som inte finns.

Versus den slutna frontier-nivån

Jämfört med de slutna modeller som köpare faktiskt har på sin kortlista är multiplikatorn rubriken. Alla siffror nedan kommer från varje leverantörs egen publicerade prissida i dag.

GPT-5.6 Sol — listas till $5,00 per 1M indata och $30,00 per 1M utdata på OpenAI:s kortkontextnivå, och har för närvarande ett kampanjpris på $4,00 / $20,00 som OpenAI säger är tillgängligt åtminstone till och med 2026-11-21, med cachad indata på $0,40. Jämfört med kampanjpriset är DeepSeek V4.1 Flash 26,7x billigare på indata och 33,3x på utdata; jämfört med listpriset 33x och 50x. Sols cacheträff kostar 133x vad Flashs gör.

Claude Opus 5 — 5,00 USD per 1 miljon indata och 25,00 USD per 1 miljon utdata, med cacheträffar till 0,50 USD per 1 miljon enligt Anthropics publicerade prislista. Det är 33 gånger Flashs indatapris, 42 gånger dess utdatapris och 167 gånger dess pris för cacheträffar. Anthropics 5-minuters cacheskrivningar lägger till ytterligare 1,25x ovanpå; DeepSeeks prislista har ingen motsvarande rad.

Gemini 3.8 Flash — 0,75 USD per 1 miljon indata-tokens och 3,75 USD per 1 miljon utdata-tokens till och med 2026-12-31, där båda priserna planeras att fördubblas den 2027-01-01, cachad indata till 0,075 USD, och — det här är raden som återkommer på en riktig faktura — cachelagring till 0,50 USD per 1 miljon tokens per timme. Flash är 5x billigare på indata, 6,25x på utdata och 25x på cacheträffar gentemot den, och DeepSeek tar inget betalt för att hålla en cache.

Kapacitetskontexten är det som gör att detta förblir ärligt. På Artificial Analysis Intelligence Index v4.3 får DeepSeek V4.1 Flash (reasoning, max effort) 40 poäng och rankas som 6:a av 113 modeller, till $0,27 per indextask och 214,4 utdatatokens per sekund. Det är en genuint frontier-nära placering till ett pris som är 26x lägre än skiktet den jämförs med — men samma mätning visar att den är en av de mest mångordiga modeller som AA har testat, med 250M genererade utdatatokens under indexkörningen jämfört med en median på 140M. Mångordighet förändrar inte priset per token, men den förändrar räkningen. En modell som skriver 62 % fler tokens än medianen kostar fortfarande mycket mindre här, men "billig per token" och "billig per uppgift" är olika påståenden, och bara det andra är vad du betalar.

Finns det en gratisnivå?

Nej. DeepSeeks egen prissättningssida dokumenterar ingen gratis API-nivå, ingen gratis månadskvot och ingen gratis modell — faktureringen sker enligt betalning per användning mot ett uppladdat eller tilldelat saldo, där tilldelat saldo förbrukas först. Konsumentchat-appen är gratis; API:et bakom deepseek-flash är det inte, och det finns ingen gratis slutpunkt för det på DeepSeeks plattform. Flera tredjepartsgateways annonserar ut gratis eller testbaserad åtkomst till den här modellen, och vi skulle betrakta dem alla som prototypytor snarare än produktionsbackends, eftersom villkoren ändras utan förvarning och ingen av dem har leverantörens egen prislista.

Effektivitetsanspråken bakom priset

Priset är inte en subvention, åtminstone inte enligt DeepSeeks egen utsago. Leverantörens modellkort och tekniska rapport beskriver V4.1 Flash som en mixture-of-experts med 552B parametrar i en Causal Encoder-Decoder-layout som aktiverar ungefär 8B parametrar per token under prefill och 16B under decode — asymmetrisk till sin design, billig att läsa med och dyrare att skriva med. På minnessidan rapporterar DeepSeek en global KV-cache på cirka 890 byte per token, ungefär en fjärdedel av DeepSeek-V4-Flashs, och ett beständigt cacheavtryck på ungefär en åttondel av den under identiska arbetsbelastningar, vilket uppnås genom att kassera sliding-window-tillstånd och återspela de senaste 128 tokens vid en träff. Detta är leverantörsrapporterade mätningar på leverantörens egen hårdvara, och den tekniska rapporten gör inte anspråk på matematisk ekvivalens med fullständig beräkning för återspelningsvägen.

Parameternantalet är den enda siffran i den här utgåvan som verkligen är omtvistad, och det är värt att vara noggrann med varför. DeepSeeks prosa rapporterar 552B, och det är stommen – den del som utför beräkningarna. Vid sidan av den finns Engram, en villkorlig minnesuppslagstabell som modellkortet anger till 196B parametrar, och som nås via tokenuppslag snarare än beräknas genom. Lägg ihop dem och du landar nära 748B, vilket är det antal som en brett läst community-analys på r/LocalLLaMA argumenterade för inom timmar efter att vikterna landade, och som Hugging Face-repositoriets egen filpanel driver ännu högre, mot 763B. Community-distributionsrapporter har räknat checkpointen till omkring 510 GB över 48 shards, levererad nativt kvantiserad som FP8-täta vikter med FP4-experter. Betrakta summan som omtvistad och stommens siffra som leverantörsrapporterad. Antalet aktiva parametrar är de som driver hastigheten; de residenta vikterna är de som avgör om modellen överhuvudtaget startar.

Självhosting är ett verkligt alternativ till detta pris, under MIT.

Vikterna finns på deepseek-ai/DeepSeek-V4.1-Flash under MIT-licensen, som tillåter kommersiell användning, modifiering och vidaredistribution. Det gör API-prislistan till ett val snarare än en vägtull: enligt MIT hindrar inget i licensen dig från att själv servera den här modellen och betala för beräkningskraft i stället för tokens.

Det gör det inte billigt att göra. Checkpointen är ungefär 510 GB residenta vikter före cache och aktiveringar, DeepSeek anger inget GPU-krav någonstans i repot, och communityns driftsättningsartiklar sätter den praktiska lägstanivån vid en multi-GPU-nod snarare än en arbetsstation. Tre serving-stackar levererade day-0-stöd den 2026-09-10 – vLLM, SGLang med Miles och Cambricons vLLM-baserade NeuWare-anpassning för sina egna acceleratorer – men på releasedagen levererade vLLM och SGLang dedikerade preview-avbildningar i stället för officiella paket, och llama.cpp hade inte mergat stöd för V4.1-arkitekturen. Självhosting på konsumenthårdvara är inte alternativet till API-priset i dag; en hyrd 8-GPU-nod är det. Om din volym är tillräckligt stor för att amortera det, tillåter licensen dig; om den inte är det är $0.15 per miljon tokens det billigare svaret, och det är inte ens nära.

Vad prislistan faktiskt ber dig att bestämma

Tre saker, i ordning efter hur mycket pengar de flyttar. Behåll ett stabilt prompt-prefix och låt cachen göra sitt jobb – den är automatisk, den ger 50x rabatt, och i en agentloop på 60 turer förvandlar den en session på 0,93 $ till en på 0,084 $. Kör din batchtrafik utanför 01:00–04:00 och 06:00–10:00 UTC på vardagar, vilket för ett amerikanskt team inte spelar någon roll och för ett europeiskt team innebär att flytta morgonjobbet till eftermiddagen. Och om du jämför priset på detta med DeepSeeks egen flaggskeppsmodell, kom ihåg att flaggskeppet fortfarande är på rea – den planerade pensioneringen ställdes in den 11 september 2026, båda SKU:erna ligger bakom en och samma nyckel, och bytet mellan dem är en ändring av modell-id snarare än en migrering.

Det prislistan inte berättar för dig är om modellen är tillräckligt bra för din arbetsbelastning, och siffrorna för det är nyare och tunnare än prisbladet. Placeringen i Artificial Analysis-indexet är en enda mätning vid maximal resonemangsinsats, leverantörens benchmarkrader är leverantörsrapporterade, och parameterantalet är omtvistat. Priset är den fastställda delen av den här lanseringen. Prissätt din migrering utifrån det, och testa förmågan innan du satsar på den.

Jämförda i den här artikeln3

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen