Ett hero-titelkort som visar 'DeepSeek V4.1 Flash' med undertiteln 'En helt ny basmodell som bär ett .1-versionsnummer', två pill-märken som visar 'GA - 10 SEP 2026' och 'OPEN WEIGHTS - MIT', en sidfotsrad som visar 'Leverantörsrapporterad arkitektur; ingen oberoende utvärdering ännu', ett kompressionsstapelmotiv till vänster och OrcaRouter-logotypen kompositerad i det nedre högra hörnet.
Guides & Insights

DeepSeek V4.1 Flash: En helt ny basmodell som bär ett punktversionsnummer

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

DeepSeek V4.1 Flash släpptes den 10 september 2026: öppna MIT-vikter, en kontext på en miljon tokens, en helt ny Causal Encoder-Decoder-arkitektur och en mixture-of-experts-stomme med 552 miljarder parametrar som DeepSeeks eget modellkort kategoriserar under vad företaget kallar sin ”nya arkitekturfamilj.” Det är också, om spåraren som flaggade namnet har rätt, första gången DeepSeek har satt en .1-version på en helt ny basmodell — en etikett som normalt signalerar en finjustering, inte en ombyggnad. DeepSeek V4.1 Pro, flaggskeppet som den siffran nu antyder, existerar fortfarande inte.

Den skillnaden är värd mer än en namnfråga. Den som jämför DeepSeeks generationer utifrån versionsnummer kommer att läsa "V4 Flash till V4.1 Flash" som ett patchsteg och budgetera sin uppmärksamhet därefter. Arkitekturen under ytan säger något annat, och företagets eget beslut att pensionera en flaggskeppsmodell med 1,6 biljoner parametrar till förmån för en Flash-modell säger något annat, ännu högre.

A single-column scoreboard titled 'DeepSeek V4.1 Flash - the scoreboard' listing Released 10 Sep 2026 (web, app, API), Backbone 552B-parameter MoE, Architecture Causal Encoder-Decoder, Active per token 8B prefill / 16B decode, KV cache 890 bytes per token (FP4), and Price $0.15 in / $0.60 out per 1M, with a footer reading 'Figures per DeepSeek's model card and API docs; no independent evaluation has been published.'

Vad som faktiskt släpptes den 10 september

Detta är inte en läcka och inte en beta. Det två dagar långa API-testet som började den 8 september under modell-ID:t deepseek-v4.1-flash-expires-on-0910 slutade som dess suffix sa att det skulle, och den riktiga releasen kom idag i DeepSeeks webbapp, mobilapp och förstaparts-API, med vikter och en teknisk rapport publicerade på Hugging Face under deepseek-ai/DeepSeek-V4.1-Flash.

{{1}}De praktiska detaljerna betyder mer än ceremonin:{{/1}}

• Modellnamn — kalla deepseek-flash. De äldre namnen deepseek-v4-flash och deepseek-v4-flash-vision-exp accepteras fortfarande, men de pekar inte längre på de modeller de tidigare gjorde: båda är avvecklade, och förfrågningar som namnger dem betjänas av DeepSeek V4.1 Flash och faktureras enligt Flash-priset.

• Vad som ingår — 552B backbone-parametrar, ett kontextfönster på 1M token, 384K maximalt utdata, JSON-utdata, funktionsanrop och ett tankeläge som är på som standard med inställningarna låg, hög och max.

• Licens — MIT, med vikter inkluderade, med en inferensmapp och en separat kodningsmodul i arkivet. DeepSeek uppmanar uttryckligen open source-communityn att bygga inferensstöd, vilket är den vanliga signalen att dag-noll-stöd i de stora runtime-miljöerna är en fråga om dagar snarare än veckor.

Den .1 som inte är en punktversion

Påståendet som startade den här texten kom från teortaxesTex, en pseudonym men flitigt följd DeepSeek-bevakare, i ett inlägg den 10 september: att detta är "första gången DeepSeek märker en helt ny basmodell med en .1-utgåva", att V4.1 är "mer olik V4 än, säg, LLaMA 3 från LLaMA 1", och att DeepSeek "inte känner att detta är värt V5 ännu" — utan att skribenten kan säga varför inte.

Behandla den kausala delen som slutledning och den strukturella delen som kontrollerbar. Slutledningen — varför DeepSeek valde .1 framför V5 — är en observatörs tolkning och inget mer; ingen utanför företaget har förklarat beslutet, och DeepSeeks eget material tar aldrig upp det. Den kontrollerbara delen är arkitekturen, och den läser inte som en punktrelease. DeepSeeks ändringslogg beskriver V4.1 Flash som "den minsta modellen i vår nya arkitekturfamilj," vilket är en märklig mening att skriva om en versionshöjning: en versionshöjning utökar en familj, den grundar inte en.

Det finns en verklig kostnad för tvetydigheten, och den drabbar köparna snarare än DeepSeek. Versionsnummer är den billigaste signal en utvecklare har för ”är detta en ny generation eller en finjustering, och hur mycket av min utvärderingsbudget förtjänar den?” DeepSeek har nu gjort den signalen opålitlig i en riktning — en modell som grundar en arkitekturfamilj ligger en decimal bort från en som ändrade sitt recept för efterträning. Företaget får behålla sin V5-markör i reserv. Alla som gör en migreringsbedömning betalar för förvirringen.

Vad "ny arkitektur" betyder i vikterna

Modellkortet är ovanligt specifikt, vilket gör generationspåståendet lätt att testa utan ett enda benchmark. Fyra saker sticker ut.

A screenshot of the DeepSeek-V4.1-Flash model card on Hugging Face (captured September 10, 2026) showing the MIT licence tag, Image-Text-to-Text and safetensors tags, 485B parameters in the sidebar, and model-card text describing a multimodal Mixture-of-Experts with 552B backbone parameters, a Causal Encoder-Decoder architecture of a 20-layer causal encoder followed by a 20-layer decoder, activation of 8B parameters per token during prefill and 16B during decode, SWA Bounded Replay, Compressed Sparse Attention 2, and a KV cache footprint of 890 bytes per token.

• Asymmetrisk aktivering — Causal Encoder-Decoder-uppdelningen är en transformer med 40 lager, organiserad som en kausal encoder med 20 lager följd av en decoder med 20 lager, där decoderns globala KV-cache projiceras från encoderns slutliga dolda tillstånd snarare än att härledas från varje decoderlagers egna. Poängen med den designen är att modellen aktiverar endast 8B parametrar per token under prefill och 16B under decode. Inmatningstunga agentarbetsbelastningar — långa dokument, långa verktygsspår — får den billiga halvan av modellen; generering får den dyra halvan.

• KV-cache-komprimering, mätt per token — DeepSeek-V4.1-Flash använder FP4-huvudkvantifiering för KV-cache på 890 byte per token, vilket kortet anger som ungefär en fjärdedel av DeepSeek V4 Flash. Kinesiska rapporter gick längre och beskrev komprimeringen mot den första generationens V4-modell som en 437× reduktion; den större siffran är leverantörsberäknad aritmetik på en annan baslinje, så betrakta den som ett påstående snarare än en mätning.

• SWA Bounded Replay — sliding-window attention tvingar normalt dig att spara KV-tillstånd till SSD för att rekonstruera kontext. Detta återskapar saknade SWA-KV-tillstånd genom att istället spela upp endast det senaste fönstret av tokens, vilket minskar det beständiga KV-fotavtrycket till ungefär en åttondel av DeepSeek V4 Flash:s.

• Compressed Sparse Attention 2 — varje attention-lager körs i ett av tre statiska lägen (Full, Reindex eller Reuse), vilket delar KV- och indexerartillstånd mellan lager, med en hierarkisk gles indexerare som begränsar kostnaden för djupare lager oberoende av kontextlängden.

Läs dessa fyra tillsammans och den strategiska bilden blir tydlig: detta är i första hand en arkitektur för gleshet och cache-effektivitet, dimensionerad så att samma struktur kan skalas upp senare. Omnämnandet av en ”ny arkitekturfamilj” gör verkligt arbete — det är ett uttalande om att det kommer mer.

Riktmärkena: leverantörsrapporterade och ännu inte motsagda.

DeepSeek publicerade en benchmarkuppsättning i samband med lanseringen. Enligt företagets egna siffror får V4.1 Flash GPQA Diamond 90,9, en Codeforces-rating på 3471, MathArena Apex 65,6, Terminal-Bench 2.1 på 90,6, DeepSWE v1.1 på 74,2 och 63,9 på HLE med verktyg – det senare med en fotnot som begränsar baslinjen 36,8 till den rena textdelen av det benchmarket.

Kalla dem för vad de är. De är leverantörsrapporterade, publicerade utan en åtföljande oberoende utvärdering, och de är de siffror som DeepSeek använde för att motivera utfasningen av sitt eget flaggskepp — vilket gör dem till de siffror som är mest värda att granska. Vid lanseringen den 10 september hade Artificial Analysis inte publicerat en mätning av DeepSeek V4.1 Flash, och Hugging Faces egen modellsida innehöll fortfarande noteringen att modellen "inte är driftsatt av någon inferensleverantör." Det bärande påståendet i denna lansering — att en Flash-modell fullständigt överträffar ett flaggskepp med 1,6 biljoner parametrar när det gäller prestanda, kostnad, hastighet och total bearbetningstid — är för närvarande ett leverantörspåstående utan extern granskning.

Det finns en ärlig invändning på andra sidan också. Samma leverantörsrapportering visar att V4.1 Flash vinner 13 av 16 jämförelser mot Kimi K3 och 11 av 13 mot GLM-5.3, samtidigt som den fortfarande ligger efter GPT-5.6 Sol och Claude Opus 5 på de nyare Terminal-Bench 3.0- och 4.0-uppgifterna och på ProgramBench. Det är en sammanhängande form — starkast på kodning, terminal- och agentautomatisering som denna arkitektur är optimerad för, svagare på frontlinjeresonemangsuppgifter — och det är den form ett verkligt generationssteg skulle ha.

Priset, och routing-switchen värd att boka in.

Nya priser trädde i kraft med lanseringen, och det är samma Flash-prislista som tidigare snarare än en sänkning: på deepseek-flash, inmatning med cacheträff kostar $0.003 per miljon tokens utanför högtrafik och $0.006 vid högtrafik, inmatning med cachemiss $0.15 och $0.30, och utdata $0.60 och $1.20. Högtrafik är exakt dubbelt så dyr som lågtrafik och gäller 01:00–04:00 och 06:00–10:00 UTC på vardagar.

Nedskärningen träffar istället Pro-trafiken. DeepSeek V4 Pro är prissatt till $0,022 och $0,044 för cache-hit-inmatning, $0,66 och $1,32 för cache-miss-inmatning, och $1,98 och $3,96 för utdata — så att dirigera Pro-namngivna förfrågningar till V4.1 Flash sänker deras utdatakostnad med ungefär 70% samtidigt som det, enligt DeepSeek, ökar kapaciteten som besvarar dem.

A screenshot of DeepSeek's official API Models & Pricing page (captured September 10, 2026) showing columns for deepseek-flash and deepseek-v4-pro, with model versions DeepSeek-V4.1-Flash and DeepSeek-V4-Pro-0813, both at 1M context length and 384K maximum output. Vision is marked supported for deepseek-flash and 'not supported' for deepseek-v4-pro. Pricing shows 1M cache-hit input tokens at $0.003 off-peak and $0.006 at peak for deepseek-flash versus $0.022 and $0.044 for deepseek-v4-pro, and 1M cache-miss input tokens at $0.15 off-peak and $0.3 at peak for deepseek-flash versus $0.66 and $1.32 for deepseek-v4-pro.

Den omdirigeringen är planerad, inte hypotetisk. Efter klockan 12:00 Pekingtid den 14 september 2026 går förfrågningar som anger deepseek-v4-pro till V4.1 Flash och debiteras enligt Flash-prissättningen, och de stannar där tills DeepSeek V4.1 Pro släpps. Om din integration hårdkodar Pro-modellnamnet går inget sönder — du får en annan modell till ungefär en tredjedel av utdatapriset, utan kodändring och utan något meddelande utöver en changelog-post. Om du dirigerar efter kapacitetsnivå snarare än modellnamn är den 14 september datumet att testa om.

Vad detta innebär om du ringer DeepSeek idag

OrcaRouter har ännu inte DeepSeek V4.1 Flash — från och med idag returnerar modellsidan för deepseek-v4.1-flash "model not found", och vi föredrar att säga det rakt ut snarare än att antyda något annat. Två saker följer av detta. För det första: den omdirigering som DeepSeek aviserat är ett API-beteende från första part, så växlingen den 14 september sker på DeepSeeks egen slutpunkt oavsett hur du når den. För det andra: om du vill ha den nya arkitekturen idag, så ringer du leverantören direkt.

Det vi routar är resten av DeepSeek-serien på en nyckel: DeepSeek V4 Flash och DeepSeek V4 Pro, tillsammans med 200+ andra modeller. Prissättningen där är DeepSeeks leverantörsprislista som förs vidare med 0 % påslag, vilket är det som spelar roll för en release som denna — när en leverantör sänker ett pris, är sänkningen live hos oss samma dag snarare än efter en omprissättningscykel. Och när V4.1 Flash väl landar i katalogen, är halvpriset utanför högtrafik ovan det pris som gäller, inte en rabatt vi förhandlar om.

Routningsargumentet för en så här ny modell handlar egentligen inte om pris. Det handlar om hur stor del av din produktionskedja du satsar på en arkitektur som bara är en vecka gammal, utan oberoende benchmark och utan tredjepartsserving. Att hålla den nya modellen bakom en nivå som du kan växla — eller testa den med en nyckel som inte är din produktionsnyckel — är skillnaden mellan en utvärdering och en incident.

Vad skulle avgöra namnfrågan

Tre saker, i stigande ordning av hur mycket de skulle berätta för dig.

En oberoende utvärdering av DeepSeek V4.1 Flash skulle testa arkitekturpåståendet i någon annans testmiljö. Det är den mätning som förvandlar en leverantörstabell till ett faktum, och det är den mest troliga nästa nyheten.

DeepSeek V4.1 Pro skulle testa familjepåståendet. Routningsmeddelandet angav den som slutpunkten för Pro-to-Flash-fönstret, vilket gör den till modellen som hela den här releasen är strukturerad kring — och den är fortfarande den som DeepSeek har bekräftat minst om: inget modellkort, inget antal parametrar, inget datum, inga vikter, inget pris.

Och den användbara om än oglamorösa: om DeepSeek gör om detta. En andra .1-etikett på en annan ny basmodell skulle förvandla en avvikelse till en konvention, och en konvention är något en utvecklare kan planera utifrån. En enskild modell är en kuriositet. Namngivningen blir bara vilseledande på ett användbart sätt när det finns ett mönster.

Just nu går den praktiska tolkningen tydligt isär beroende på vem du är. Om du använder DeepSeek V4 Pro, notera den 14 september i kalendern och kör om dina utvärderingar före dess, eftersom modellen bakom det namnet ändras vare sig du ber om det eller inte. Om du använder DeepSeek V4 Flash flyttas du redan, till samma pris, till en arkitektur som DeepSeek byggt för att skala. Och om du väntade på V5 är det ärliga svaret att DeepSeek verkar ha levererat generationen och avstått från att namnge den — vilket är den typ av sak man bara får göra en gång innan folk slutar lita på numret.

Jämförda i den här artikeln3

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen