Hero-titelkort: DeepSeek V4.1 Flash vs DeepSeek V4 Pro — samma leverantör, olika generationer
Guides & Insights

DeepSeek V4.1 Flash vs DeepSeek V4 Pro: Samma leverantör, olika generationer

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det intressanta med att ställa DeepSeek V4.1 Flash mot DeepSeek V4 Pro är att den nyare modellen inte är den större. DeepSeek V4 Pro är en mixture-of-experts-modell med 1,6 biljoner parametrar och 49 miljarder aktiva parametrar, och den serveras fortfarande. DeepSeek V4.1 Flash är en MoE med 552 miljarder parametrar, med 8 miljarder aktiva vid indata och 16 miljarder aktiva vid utdata, och det är modellen som DeepSeek byggde för att ersätta den. Båda finns på samma leverantörs prislista, båda tar en miljon token i kontext, och båda levereras under MIT. Att välja mellan dem är inte en fråga om storlek. Det är en fråga om vilken arkitektur du vill betala för, och svaret ändrades den 10 september 2026.

Vad som faktiskt skiljer sig, sida vid sida

• Parametrar — V4.1 Flash 552B totalt / 8B aktiva vid indata och 16B vid utdata jämfört med V4 Pro 1,6T totalt / 49B aktiva. V4 Pro har ungefär tre gånger så många totala parametrar och sex gånger så många aktiva på indatasidan.

• Arkitektur — V4.1 Flash är en Causal Encoder-Decoder, en ny basarkitektur jämfört med V4 Pro:s tidigare design. Detta är den väsentliga skillnaden mellan de två och anledningen till att ".1" inte är en punktrelease.

• Pris per 1 miljon tokens — V4.1 Flash $0.15 in / $0.60 ut i lågtrafik jämfört med V4 Pro $0.66 in / $1.98 ut, enligt OrcaRouters listningar.

• Cachad indata — V4.1 Flash $0,003 per 1M vs V4 Pro $0,024 per 1M.

• KV-cache per token — V4.1 Flash: 890 byte jämfört med V4 Pros större minnesavtryck. Vid en kontext på en miljon tokens är detta posten som avgör om en lång agenttranskription förblir resident.

• Kontext och utdata — 1M kontext och 384K maximal utdata på båda. Nivå.

• Observerad latens till första token — V4.1 Flash 2,63 s p50 vs V4 Pro 3,58 s p50, enligt OrcaRouters 7-dagars telemetri, med p95 på 10,00 s för V4 Pro.

• Indatamodaliteter — V4.1 Flash hanterar text och bilder jämfört med V4 Pro, som endast har text in och text ut, på samma listningar. Den nyare modellen är den bredare av de två vad gäller indata, samt den billigare kostnadsmässigt.

Läs listan utan leverantörens vinkling, och mönstret är ovanligt. Efterträdaren är billigare på varje rad, snabbare till första token, bredare på input och mindre på varje rad. Det är så en genuin arkitekturförändring ser ut när den landar, och det är därför ”vilken är bättre” har ett kort svar här och ett längre under det.

Two-column scoreboard: DeepSeek V4.1 Flash vs DeepSeek V4 Pro — total parameters 552B vs 1.6T, active parameters 8B input and 16B output vs 49B, architecture Causal Encoder-Decoder vs an earlier design, price per 1M tokens $0.15 input and $0.60 output vs $0.66 and $1.98, max output 384K tokens vs 384K tokens, and release date 2026-09-10 vs still served and not retired

V4 Pro-tidslinjen, eftersom den är viktig för alla som fortfarande kör den

DeepSeek V4 Pro var planerad att avvecklas. API:et skulle stängas av den 14 september 2026 kl. 12:00 Peking-tid, och trafiken skulle dirigeras om till V4.1 Flash. Det skedde inte. Den 11 september ändrade leverantören sitt beslut och uppgav att "Som svar på användarnas efterfrågan har vi beslutat att fortsätta tillhandahålla API-tjänster för DeepSeek V4 Pro efter den 14 september 2026, med oförändrad faktureringsmetod."

Två saker följer av detta, och båda är värda att vara precis om, eftersom situationen inbjuder till övertolkning.

Det första är att V4 Pro inte är utfasat. Det är en modell som stöds och har ett oförändrat pris, och det är den som DeepSeeks eget meddelande dirigerar befintlig V4 Pro-trafik till. Om du har en produktionsväg pinnad till den har inget tagits bort.

Det andra är att DeepSeek V4.1 Pro existerar inte. Avvecklingsmeddelandet hänvisade till att V4 Pro-trafik betjänas av V4.1 Flash "tills V4.1-Pro lanseras", vilket har lett till en del spekulationer om ett större syskon. Per den 22 september 2026 finns det inget V4.1 Pro-API, inget modellkort, inga vikter och inget tillkännagivande. En rapport den 21 september 2026 antydde en modell med 2 biljoner parametrar som förväntas i mitten till slutet av oktober, vilket är ett påstående från en enda källa om en icke tillkännagiven produkt och bör behandlas därefter. Den som planerar kapacitet kring en lansering av V4.1 Pro planerar kring ett rykte.

Vilken ska man egentligen ringa?

Migreringsfallet är enkelt, och det är det som DeepSeek själva gjorde genom att dirigera V4 Pro-trafik till den nya modellen. Enligt siffrorna ovan är V4.1 Flash billigare, snabbare till första token och snabbare i stabilt tillstånd, med en mindre KV-cache per token. Om din arbetsbelastning är en V4 Pro-arbetsbelastning som inte gör något som bara 49B aktiva parametrar kan göra, är den nyare modellen det bättre instrumentet vad gäller kostnad och latens, och det finns ingen avvägning att göra.

Argumentet för att stanna kvar på V4 Pro handlar om vad ett mycket större antal aktiva parametrar ger dig vid krävande resonemang och agentiskt arbete över långa tidshorisonter, och det är ett argument du måste underbygga med dina egna utvärderingar snarare än med ett datablad. Anledningen är att de två modellerna inte jämförs på en gemensam offentlig resultattavla på ett sätt som isolerar dem: DeepSeek V4.1 Flash finns med i Agents on Rails-svepet från den 21 september 2026 med 17 % vid maximal ansträngning, medan V4 Pro inte finns med på den tavlan. Det finns inget direkt jämförelsetal att peka på. Det som finns är ett rimligt argument utifrån arkitekturen – sex gånger de aktiva parametrarna är mycket kapacitet att ge upp – och det är ett argument, inte en mätning.

Två praktiska anmärkningar för den som flyttar trafik mellan dem. För det första gäller schemat för högtrafik för båda modellerna, så en kostnadsjämförelse som körs vid fel tid på dygnet blir fel med en faktor två; högtrafik är 01:00–04:00 och 06:00–10:00 UTC på vardagar och helger är helt utanför högtrafik. För det andra delar de två modellerna ett kontextfönster och ett tak för utdata, så en migrering ändrar inte din promptbudget — vilket gör bytet ovanligt lågrisk på applikationssidan.

Kör båda via en och samma slutpunkt

Den situation där du verkligen vill ha båda är övergångsperioden, och den är vanligare än den låter: ett team som vill gå över till V4.1 Flash men har en pipeline vars beteende på den nya arkitekturen ännu inte är verifierat. Att köra de två sida vid sida via separata leverantörer innebär två avtal och två uppsättningar nycklar för vad som, på modellnivå, är en och samma leverantör.

Båda finns på OrcaRouter under en och samma nyckel, vilket reducerar det hela till ett routingbeslut. OrcaRouter för vidare leverantörernas listpriser med 0 % påslag, så siffrorna ovan är DeepSeeks egna priser och inte våra, och DeepSeeks schema för högtrafik och lågtrafik gäller exakt så som DeepSeek definierar det – inklusive en prisändring mitt i en övergång, som är aktiv hos oss samma dag. Du kan skicka en del av trafiken till den nya modellen och jämföra utdata, eller routa efter uppgiftstyp, och lägga automatisk failover bakom den nya vägen så att om V4.1 Flash gör något oväntat med dina data hamnar begäran hos V4 Pro i stället för på en felsida.

Med tanke på att leverantören redan har ändrat sig en gång om vilken av dessa modeller som ska försvinna, är att hålla båda åtkomliga bakom en enda integration det alternativ som inte kräver att du förutser nästa helomvändning.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, showing the model id with a flagship badge, 1M-token context, 384K max output, text input and text output, $0.66 input and $1.98 output per 1M tokens, a cache rate of $0.024, and observed time to first token of 3.58 s at p50 and 10.00 s at p95

Vad du ska titta på

• Huruvida V4 Pros pris eller avvecklingsstatus ändras igen. Vändningen i september var tydlig med att faktureringen förblir oförändrad, och det är det åtagandet som leverantören ska hållas fast vid.

• Huruvida V4.1 Pro blir verklighet. Tills det finns ett modellkort eller ett släpp av vikter är historien om 2T-parametern ett rykte med en enda källa.

• En oberoende utvärdering som kör båda modellerna på samma testbänk. Tills en sådan finns, är den ärliga jämförelsen mellan dessa två kostnad, latens och arkitektur, vilka är mätbara, plus en välgrundad gissning om förmåga, som inte är mätbar.

Till dess att den tredje av dessa anländer är den korrekta sammanfattningen: DeepSeek V4.1 Flash är den billigare, snabbare efterföljaren till DeepSeek V4 Pro, V4 Pro stöds fortfarande till oförändrat pris, och frågan huruvida den nyare arkitekturen gör avkall på förmåga är en som ingen offentlig benchmark för närvarande besvarar.

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen