
DeepSeek V4.1 Flash vs DeepSeek V4 Flash: Samma Flash-prislista, en omtränad modell
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Intelligens49Kodning
Veckan då DeepSeek V4.1 Flash gick från en ryktad efterträdare till den levererade Flash-modellen har varit kort och högljudd. Den 8 september dök modellen upp som ett tvådagars API-test under modell-id:t deepseek-v4.1-flash-expires-on-0910 — en byggversion som DeepSeek själv kallade en "mellanversion". Den 9 september sade dess öppna plattform att den officiella releasen, DeepSeek V4.1 Flash, skulle lanseras runt den 10 september och att den "överträffar på bred front" DeepSeek V4 Pro när det gäller kapacitet, kostnad, hastighet och end-to-end-tid. Den 10 september kom releasebeskedet med ett nytt prisblad för Flash-serien, med prissänkningar från klockan 12:00 Peking-tid, som DeepSeek V4 Flash inte har sett sedan en prishöjning i augusti. Oavsett vad som annars är sant är textarbetshästen DeepSeek V4 Flash inte längre det senaste sättet att köra en Flash-arbetsbelastning, och den här texten handlar om vad det faktiskt innebär för appen du kör idag.
Jämförelser så här tidigt är skeva, och det är värt att säga det innan siffrorna börjar. DeepSeek V4 Flash har ett publicerat specifikationsblad, en månad av produktionstrafik bakom DeepSeek-V4-Flash-0731-uppdateringen, öppna vikter och oberoende mätningar från Artificial Analysis. DeepSeek V4.1 Flash har ett officiellt tillkännagivande, två dagars community-hastighetstester, och inget publicerat specifikationsblad, ingen teknisk rapport och ännu inget tredjepartsresultat. Leverantörspåståenden märks som leverantörspåståenden nedan; community-siffror märks som community-uppmätta.
Flash-nivån återställdes precis — tre ändringar, en vecka
DeepSeek V4 Flash, den 284B-parametriga mixture-of-experts-modellen med 13B aktiva parametrar, har sedan sin uppdatering den 31 juli varit det vettiga standardvalet med låg kostnad och hög genomströmning för en stor del av produktionstexttrafiken. Tre tillkännagivanden på tre dagar rubbade grunden under den:
• 8 september — DeepSeek öppnade en tidsbegränsad beta av V4.1 Flash för alla API-konton, begränsad till 20 samtidiga förfrågningar och planerad att löpa ut den 10 september, under ett modellnamn som bar sitt eget utgångsdatum.
• 9 september — den öppna plattformen tillkännagav den formella lanseringen av DeepSeek V4.1 Flash runt den 10 september, och beskrev en ny modellstruktur med inbyggt multimodalt stöd, samt hävdade att den överträffar DeepSeek V4 Pro när det gäller prestanda, kostnad, hastighet och total slutförandetid.
• 10 september — den formella lanseringen medför en ny prislista för Flash-serien, som träder i kraft klockan 12:00 Peking-tid, och sänker de priser som DeepSeek V4 Flash har tagit ut sedan en prishöjning den 17 augusti som väckte hård kritik från utvecklare.
Den sista av dessa förtjänar ett eget utrymme, eftersom det är den sällsynta prissänkning som faktiskt är en prissänkning. I den nya listan sjunker off-peak-input med cacheträff från ¥0,05 till ¥0,02 per miljon tokens – en minskning med 60 % – medan cache-miss-input går från ¥1,5 till ¥1 och output från ¥4,5 till ¥4. Avgifterna under högtrafik är dubbelt så höga som siffrorna vid lågtrafik. Avrundat i amerikanska dollar motsvarar det cirka $0,003 per miljoner cacheträff-input, $0,14 per miljoner cache-miss-input och $0,56 per miljoner output vid lågtrafik, och det dubbla vid högtrafik. Det 24 dagar långa gapet mellan höjningen i augusti och denna sänkning var ingen olycka i schemaläggningen; prisjusteringen är en del av lanseringen av V4.1 Flash.
Samma nivå, annan modell
Den enkla tolkningen är att V4.1 Flash är V4 Flash med en hastighetsratt uppvriden. Det är det inte. Uppdateringen 0731 var en post-training-uppdatering av den befintliga DeepSeek V4 Flash-basen – samma arkitektur, samma 284B-total / 13B-aktiva mixture-of-experts-layout. DeepSeeks beskrivning av V4.1 Flash pekar på något större: en ny modellstruktur, som flera medier läser som en ny pre-training-körning snarare än en finjustering. Skillnaden spelar roll eftersom en omtränad modell inte ärver den gamla modellens beteende på samma sätt som en uppdatering gör – prompting, verktygsanrop och utdatastil kan alla förändras även där förmågan inte gör det.
• Arkitektur — DeepSeek V4.1 Flash: ny modellstruktur, beskriven av DeepSeek som en nybyggd modell med inbyggt multimodalt stöd. DeepSeek V4 Flash: V4-Flash-0731-postträningsuppdateringen av en MoE med totalt 284B / 13B aktiva parametrar.
V4.1 Flash hanterar text- och bildinmatning inbyggt i basmodellen; DeepSeek V4 Flash är endast textbaserad, och bilder kräver den separata tilläggsversionen DeepSeek-V4-Flash-Vision-Exp.
• Kontext och utdata — DeepSeek V4 Flash publicerar 1M kontext och 384K max utdata; DeepSeeks lanseringsmaterial säger att V4.1 Flash behåller kontextfönstret i miljon-token-skala, men inget formellt kort har publicerats.
• Samtidighet — DeepSeek V4 Flash anger en samtidighetsgräns på 2 500; V4.1 Flash-beta var begränsad till 20 och DeepSeeks påstående om "hög samtidighet" för releasebygget var ännu inte underbyggt av en publicerad siffra när detta skrivs.
• Vikter — DeepSeek V4 Flash har öppna vikter under MIT-licens; inget har tillkännagivits för V4.1 Flash.
• Oberoende ställning — DeepSeek V4 Flash har utvärderats av Artificial Analysis; DeepSeek V4.1 Flash har ännu inget tredjepartsresultat.
Punkten om text kontra multimodalt förtjänar en extra mening även i en textjämförelse, eftersom den avgör vem V4.1 Flash är till för. Om din pipeline körde DeepSeek V4 Flash för text och DeepSeek-V4-Flash-Vision-Exp för bilder, är V4.1 Flash den första DeepSeek-versionen som täcker båda vägarna i en enda modell – en endpoint att underhålla, ingen encoder påklistrad vid sidan om.

Där de verkligen skiljer sig åt: genomströmning och vad en avslutad uppgift kostar.
Vid paritetspriser skiljer sig de två modellerna åt i hastighet, och det är där siffrorna blir mest högljudda. Artificial Analysis mäter DeepSeek V4 Flash 0731 till ungefär 120–140 tokens per sekund på DeepSeeks eget API, beroende på konfiguration och mätfönster. Första dagens testare av V4.1 Flash rapporterade ihållande generering på mellan ungefär 280 och 500 tokens per sekund beroende på uppgift, med toppar över 500 i körningar med låg samtidighet; de högre siffrorna är uppmätta av communityn, inte publicerade av leverantören, och tokens per sekund är aldrig en inneboende egenskap hos en modell. Ändå är riktningen konsekvent i varje rapport från första dagen, och DeepSeeks eget påstående om snabbare generering och lägre total slutförandetid pekar åt samma håll.
Den hastighetsskillnaden ändrar ekonomin även om de två modellerna har samma prislista, eftersom du betalar per token och token anländer snabbare. Ett jobb med lång kontext-hämtning eller kodgenerering som tog en minut på V4 Flash kan slutföras på en bråkdel av tiden på V4.1 Flash till samma pris per token — flera testare från den första dagen rapporterade fem till sex gånger snabbare från början till slut för exakt dessa uppgiftsklasser. Betans tidiga klagomål om att ”det spenderar pengar snabbare” var baksidan av samma mynt: till ett oförändrat pris per token tömmer en modell som genererar token två till tre gånger snabbare ett saldo snabbare per minut. Huruvida kostnaden per uppgift faktiskt sjunker beror på om den nya modellen blir klar med färre token och färre försök, vilket är precis vad ingen ännu kan bevisa.
På priskortet sitter de två modellerna sida vid sida. Per miljon token i lågtrafik enligt listan från 10 september: ¥0,02 för cacheträff vid inmatning, ¥1 för cachemiss vid inmatning och ¥4 för utdata, dubbelt under högtrafik — samma lista som gällde för Flash-nivån före sänkningen var ¥0,05, ¥1,5 och ¥4,5. För en cache-tung arbetsbelastning är sänkningen rubriken: ¥0,02 mot ¥0,05 är en 60-procentig minskning för de token som utgör större delen av en inmatningsström för antingen autocomplete eller agent-loop. För ett färskt ingest-jobb som missar cachen är besparingen närmare en tredjedel. Inget av detta gör V4.1 Flash billigare per token än V4 Flash — de delar priskortet — men arkitekturens högre genomströmning är det som skiljer, och den kostar inget extra.

Kvittona avser V4 Flash; anspråken avser V4.1 Flash
Den enskilt viktigaste benchmark-fakta om den här jämförelsen just nu är att det inte finns något benchmark för den nya modellen. DeepSeek V4.1 Flash:s huvudpåstående – att den överträffar DeepSeek V4 Pro på bred front i kapacitet, kostnad och hastighet – bygger på leverantörens egna uppgifter och har inte oberoende reproducerats. Inget antal parametrar, ingen utvärderingstabell och ingen teknisk rapport har publicerats, och Artificial Analysis hade inte heller mätt modellen när detta skrevs. För en modellfamilj vars senaste flaggskeppslansering granskades oberoende är ”lita på oss, den slår Pro” ett påstående som läsaren bör betrakta med skepsis tills en tredje part har verifierat det.
DeepSeek V4 Flash har däremot en verklig meritlista. Artificial Analysis räknar 0731 reasoning build bland de ledande modellerna i sin klass, ger den betydligt högre poäng än medianen för jämförbara open-weight-modeller, och mäter dess utdatagenomströmning på DeepSeeks eget API i det ovan nämnda intervallet ~120–140 tokens per sekund. Det är de siffror som V4.1 Flash kommer att bedömas mot när dess egen poäng publiceras, och de sätter ribban högre än vad etiketten "snabb och billig Flash" antyder. Modellen som den nya builden ersätter är inte svag; den är en genuint stark open-weight-arbetshäst. Det är det som gör uppgraderingsbeslutet verkligt snarare än ceremoniellt.
Routing gör grovjobbet — inuti DeepSeek, och för dig
Den mest underrapporterade delen av denna lansering är att DeepSeek dirigerar trafik mellan sina egna modeller. Dess tillkännagivande är tydligt: så snart V4.1 Flash är live och tills V4.1 Pro släpps, kommer varje API-förfrågan riktad mot deepseek-v4-pro att betjänas av DeepSeek V4.1 Flash och faktureras till Flash-tier-priset. V4 Pro-anropare får den nya arkitekturen och en bråkdel av kostnaden per token utan att ändra en enda rad kod. Notera vad som inte omdirigeras: deepseek-v4-flash-anrop. Den gamla Flash-modellen fortsätter att betjäna den som fortfarande pekar på den, vilket är precis anledningen till att denna jämförelse finns — om du använder V4 Pro sker bytet åt dig, och om du använder V4 Flash är det ett beslut du måste fatta själv.
Att en leverantör tyst beslutar att en billigare modell ska hantera anropen som riktar sig mot dess premiummodell är ett slående kvitto på V4.1 Flash – och det är också samma logik som ett routinglager tillämpar över leverantörer. Det är klyftan som en plattform som OrcaRouter fyller: ett API för 200+ modeller, med leverantörernas listpriser som skickas vidare med 0 % påslag, så att DeepSeeks Flash-prissänkning från den 10 september är live hos oss samma dag.DeepSeek V4 Flash på OrcaRouter förblir anropsbar med samma nyckel som alla andra modeller du kör, vilket gör det säkra sättet att anta en dag-ett-modell genuint billigt: rikta en del av trafiken mot DeepSeek V4.1 Flash på DeepSeeks eget API, behåll DeepSeek V4 Flash som automatisk reserv på samma routingregel, och låt failover fånga upp gränsfallen medan den nya arkitekturen visar sitt värde.
DeepSeek V4.1 Flash vs DeepSeek V4 Flash: vilken ska du anropa?
Om det ärliga svaret vore den ena eller den andra modellen för alla, skulle det inte finnas någon artikel. De två passar nu in på olika riskprofiler, och uppdelningen är ovanligt tydlig.

Byt till DeepSeek V4.1 Flash om du startar en ny Flash-arbetsbelastning idag, om latens och genomströmning är den begränsande faktorn, om du vill ha bildinmatning utan att underhålla en andra modell, eller om du är nöjd med att låta DeepSeeks egen routning minska risken med Pro-tier-anspråket. Modellen finns på DeepSeeks förstaparts-API under namnet deepseek-v4.1-flash, prissatt på samma Flash-kort som modellen den ersätter, och varje signal från första dagen säger att den är väsentligt snabbare.
Stanna kvar på DeepSeek V4 Flash om du servar produktionstrafik vid det publicerade {{1}}samtidighetstaket om 2,500{{/1}}, om du förlitar dig på dess öppna vikter för egen hosting eller regelefterlevnad, eller om dina prompts, utvärderingar och verktygsanropslogik är anpassade till {{2}}0731-beteendet{{/2}} och inte kan absorbera en omtränad modells egenheter från dag ett. En ny förträningskörning är en beteendeförändring, inte bara en hastighetsändring, och {{3}}0731{{/3}}-versionen är den version som har månadens kvitton.
För de flesta team är det försvarbara standardvalet medelvägen: behandla DeepSeek V4.1 Flash som standard för nya arbetsbelastningar, behåll DeepSeek V4 Flash som redundans för den arbetsbelastning som betalar räkningarna, och låt den första oberoende resultattavlan — plus ett publicerat spec-kort och ett samtidighetstal — avgöra den dispyt som ingen tvådagars beta kan. Flash-nivån fick just en ny motor; den gamla är inte föråldrad, den är riktmärket.
Nyfiken på hur trafik i Pro-klass ser ut medan DeepSeek dirigerar den till V4.1 Flash till Flash-priser? DeepSeek V4 Pro på OrcaRouter — båda på en nyckel, fakturerade till DeepSeeks listpris.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
