
DeepSeek V4.1 Flash-prestandatester: Vad 74,2 bevisar och inte bevisar
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 984 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 195 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
DeepSeek V4.1 Flash fick 74,2 på DeepSWE v1.1, en tiondels poäng över GPT-6 Astra, en halv poäng över Gemini 3.8 Flash och Claude Opus 5, och siffran har citerats hela veckan som ett maktskifte. Det är värt att vara exakt om vad det faktiskt är. Modellen i sig är inte ny — DeepSeek V4.1 Flash blev allmänt tillgänglig den 2026-09-10, för sex dagar sedan — så inget här är en lansering. Det som har landat inom det fönstret är mätlagret: de första oberoende indexposterna, det första oberoende arenaresultatet, day-0-servingstöd över tre stackar och ett leverantörsbeslut att pensionera sin egen flaggskeppsmodell till förmån för den här. Den här sidan är en sammanställning av vad som faktiskt har mätts, med källan angiven för varje siffra, och ett enkelt konstaterande av vad ingen ännu har fastställt.
DeepSWE-siffran, och de fyra modellerna inom en halv poäng från den
DeepSWE v1.1 är ett långsiktigt benchmark för mjukvaruutveckling från Datacurve – 113 originella uppgifter över 91 öppen källkods-repositorier och fem programmeringsspråk, uppbyggt kring ändringar över flera filer och beteendemässig korrekthet. På DeepSeeks eget modellkort lyder den leverantörsrapporterade tabellen: DeepSeek V4.1 Flash 74,2, Claude Opus 5 74,0, GPT-5.6 Sol 73,0, Kimi K3 67,5, GLM-5.3 66,9, DeepSeek V4-Pro-0813 62,7, DeepSeek V4-Flash 54,4.
Den oberoende topplistan för samma benchmark återskapar inte den ordningen, och skillnaderna spelar större roll än rubriken. Datacurves DeepSWE v1.1 Pass@1-topplista placerar Muse Spark 1.3 (FAIR) först på 75.40, före DeepSeek V4.1 Flash på 74.20. Bakom den: GPT-6 Astra på 74.12 (extra hög) och 74.10 (max), Gemini 3.8 Flash på 73.83 (hög), Claude Opus 5 på 73.65 (max).
Så 74.2 är en riktig post på en riktig topplista från tredje part, och den är tvåa, inte etta. Påståendet som cirkulerade på releasedagen – att detta är det bästa som finns på DeepSWE – överlever inte kontakt med topplistan som har poängen. Muse Spark 1.3 ligger 1,2 poäng före.
Nu kommer delen som hoppas över. Fyra frontier-modeller ligger inom 0,55 poäng från varandra i detta benchmark: 74,20, 74,12, 73,83, 73,65. Det är ett smalare band än mätbruset. Publicerad variation mellan körningar på DeepSWE ligger i storleksordningen 1,4 till 3,2 poäng – tre till sex gånger så stor som hela spridningen bland topp fyra. En ledning på 0,2 poäng över GPT-6 Astra är inte ett fynd; det är hur ett oavgjort resultat ser ut när man skriver ut det med två decimaler.
Scaffold-känslighet är den andra anledningen att inte fästa sig alltför hårt vid siffran, och här levererar leverantörens egen dokumentation beviset. DeepSeek rapporterar DeepSWE för åtta scaffolds i samma release-material. 74,2 uppnåddes på mini-SWE. Samma modell fick 72,6 på DSH Minimal, 70,5 på DSH Standard, 69,8 på Claude Code, 67,6 på DSH PTC, 66,2 på Pi, 65,6 på Codex och 65,5 på OpenCode. Det är en spridning på 8,7 punkter för en och samma modell och ett och samma benchmark, helt och hållet driven av den harness som omger den. Den som jämför en DeepSeek-siffra framtagen på mini-SWE med en rivals siffra framtagen i en annan agentloop jämför scaffolds, inte modeller.
Var det oberoende indexet faktiskt placerar det
Artificial Analysis kör en fast svit med deklarerade effort-inställningar, vilket gör deras Intelligence Index till den renaste externa kontroll som finns. På modellsidan för DeepSeek V4.1 Flash, vid reasoning max effort, visar index 40 – rankad #6 av 113 modeller i den klassen, mot en klassmedian på 18. De slutna konkurrenterna ligger ovanför: Claude Opus 5 (max) 51, GPT-5.6 Sol (max) 47, GLM-5.3 (max) 45, Kimi K3 (max) 44, Gemini 3.8 Flash (high) 41. DeepSeeks egen tidigare flaggskeppsmodell, V4-Pro-0813, ligger under på 36.
Läs de två resultattavlorna sida vid sida, och meningsskiljaktigheten är strukturell, inte ett misstag. På DeepSeeks valda benchmark, med rätt scaffold, ligger modellen jämsides med frontlinjen. På en fast extern svit som genomsnitt över resonemang, kodning, matematik och agentiskt arbete ligger den elva punkter efter Claude Opus 5 och en punkt efter Gemini 3.8 Flash. Båda kan vara sanna. En leverantörstabell är ett argument; ett index är ett genomsnitt.
Indexsidan innehåller också två siffror som är viktiga för ett routingbeslut och sällan hamnar i rubrikerna. DeepSeek V4.1 Flash körs vid 214,4 utdatatoken per sekund vid maximal ansträngning – snabbt. Den genererade också 250M utdatatoken när den slutförde Intelligence Index, mot en median på 140M, vilket Artificial Analysis flaggar som påtagligt mångordigt. Mångordighet är inte ett kvalitetsproblem; det är en räkning. En modell som tänker i 79 % fler token än sina likar lämnar tillbaka en del av sin prisfördel vid varje långt resonemangsanrop.

ProgramBench: ett resultat för en enskild modell och ett resultat för ett multiagentsystem är inte samma mätning
Det här är den siffra som med störst sannolikhet blir felläst, så det är värt att separera den noggrant.
• En modell, standardkonfiguration — DeepSeek V4.1 Flash får 20,3 på ProgramBench (Almost@1), enligt DeepSeeks eget modellkort. Det är under GPT-5.6 Sol på 23,0 och långt under Claude Opus 5 på 37,0, och bara något över GLM-5.3 på 19,0 och Kimi K3 på 17,5. Rapporterat av tillverkaren, och det smickrar inte modellen.
• Konfiguration för multiagentteam — DeepSeeks teknikrapport, DeepSeek-V4.1-Flash: Att tänja på gränserna för KV-cache-komprimering, beskriver ett preliminärt Agent Swarm RL-recept där en ledande agent koordinerar teamkamrater via en gemensam uppgiftstavla. På en delmängd av ProgramBench med 172 uppgifter och hög konfidens — uppgifter där referenslösningen klarar sig med 95 % eller bättre — klättrar multiagentkonfigurationen från 13,59 % vid en timmes tidsgräns till en topp på 30,04 % vid åtta timmar, medan baslinjen för en enskild agent går från 12,79 % till 20,39 %.
30,04 % är källan till påståendet om "30 %", och det är inte en poäng för en enskild modell. Det är ett team av agenter som fått åtta timmar, mätt på en filtrerad delmängd, i leverantörens egen preliminära utvärdering. Jämförelsen den inbjuder till – "väl över en enskild Sol, nästan 2x Kimi K3" – är aritmetiskt rättvis mot Sols 23,0 och K3:s 17,5, och det är också en jämförelse mellan en multiagentkonfiguration och baslinjer för enskilda modeller på en annan uppsättning uppgifter. Samma rapport visar effekten på FrontierSWE v2: multiagent når 32,90 % vid tjugo timmar mot 28,20 % för en enskild agent. Gapet är verkligt, det minskar när tidsfristen förlängs, och tokenkostnaden för att uppnå det är inte liten – en praktisk redogörelse rapporterar mer än 10x tokens och körtider som närmar sig fyra timmar.
Parameterantalet är inte fastställt, så behandla varje storleksjämförelse som preliminär
DeepSeeks versionsanteckningar beskriver en ”MoE med 552B parametrar”. Det är leverantörens siffra, och det är den som de flesta rapporteringar upprepar. Det är inte heller hela artefakten.
DeepSeeks eget modellkort dokumenterar en andra komponent vid sidan av transformer-backbonen: "Engram-villkorsminne (196B parametrar, glest åtkommet via tokenbaserad uppslagning)." Adderar man de två får man 748B. Det är aritmetiken bakom den community-tolkning som cirkulerade på r/LocalLLaMA inom timmar efter lanseringen, och modellkortets eget safetensors-index listar 763B parametrar över dess tensortyper. Den ungefärliga FP8-siffran på 510 GB kommer från samma analyslinje: det du faktiskt laddar ner och har i minnet.
Förklaringen är att de räknar olika saker. 552B är den beräkningsmässiga ryggraden – de parametrar som en token flödar genom. 196B är en uppslagstabell som konsulteras vid specifika lager och returnerar lagrad information i stället för att utföra beräkningar på den. 8B och 16B, de aktiveringssiffror som DeepSeek anger, är de per-token-delar som är aktiva under prefill respektive decode. Alla fyra siffrorna beskriver samma modell.
Inget av det där gör jämförelsen säker. Varje påstående av formen "den här modellen matchar en frontier-modell till en bråkdel av storleken" vilar på en leverantörsrubrik som utesluter en femtedel av artefakten. Tills någon publicerar en reproducerbar parameterredovisning bör storleksbaserade argument bära förbehållet inline.
ARC-AGI: inget resultat för denna modell
Det finns ingen ARC-AGI-2- eller ARC-AGI-1-poäng för DeepSeek V4.1 Flash. ARC Prizes verifierade resultatsida innehåller ingen post för denna checkpoint, och DeepSeeks egen benchmarktabell har ingen ARC-rad. Det enda ARC Prize-verifierade DeepSeek-resultatet är för den äldre V4 Flash 0731-checkpointen – 61,4 % på ARC-AGI-2 semi-private vid maximal resonemangsansträngning och 89,0 % på ARC-AGI-1, till $0,04 respektive $0,02 per uppgift. Det är föregångarens siffror för en annan modell, och att citera dem som V4.1 Flash-resultat vore fel. Om ARC-AGI har betydelse för din utvärdering är denna modell för närvarande inte poängsatt.
Vad mer landade inuti fönstret?
Tre saker har förändrats för en läsare som överväger att prova den här modellen, och ingen av dem är modellens eget släpp.
• Oberoende arenaresultat. OpenDesign Arena lät tretton modeller genomföra identiska designuppgifter – webbappar, dashboards, mobila skärmar, landningssidor. DeepSeek V4.1 Flash fick 81,2 av 100 mot GPT-6 Astras 82,7, till en kostnad av 0,023 USD per färdig design mot 1,61 USD, och blev klar på 5,3 minuter mot 11,1. Leveransgraden – utdata som kan användas utan revidering – var 57,7 % mot Astras 60 %. Detta är en av de första genuint oberoende mätningarna av modellen, och den mäter specifikt designutdata, inte allmän resonemangsförmåga eller kodning.
• Day-0-serveringsstöd på tre stackar. vLLM publicerade en Day-0-image (2026-09-09) validerad på NVIDIA- och AMD-hårdvara. SGLang och Miles publicerade Day-0-stöd för inferens och RL den 2026-09-10, inklusive en Engram host-offload-väg som ökade KV-cache-kapaciteten med 36 % på 4x GB300 och en bounded-replay-optimering som höjde prefill-genomströmningen 1,56x på 8x H200. Cambricon tillkännagav Day-0-anpassning på vLLM-stacken samma dag. För en modell vars säljargument är aggressiv KV-cache-komprimering – en fjärdedel av föregående generations HBM-avtryck, en åttondel av dess SSD – är att kunna köras på standardstackar från dag ett skillnaden mellan ett labbresultat och något du kan driftsätta.
• Leverantören avvecklade sitt eget flaggskepp. DeepSeek fasas ut V4-Pro. Från och med 04:00 UTC den 2026-09-14 dirigeras varje begäran som anger ”deepseek-v4-pro” till V4.1 Flash och debiteras enligt Flash-taxor, vilket fortsätter tills en V4.1 Pro lanseras. DeepSeek V4.1 Pro är inte släppt — det är en framtida modell, och omdirigeringen är en tillfällig lösning som förhindrar att pinnade integrationer går sönder. Även avvecklade: ”deepseek-v4-flash” och ”deepseek-v4-flash-vision-exp”, båda tillfälligt dirigerade till V4.1 Flash för kompatibilitet. Om du har ett pinnat modell-ID i produktion är den omdirigeringen det enda operativa faktum på den här sidan som du inte kan ignorera.
Vad priset gör med beslutet
Prissättningen är där den här modellen slutar vara en benchmark-historia. Enligt DeepSeeks egna publicerade priser, gällande från 04:00 UTC 2026-09-10, med högtrafiktimmar definierade som 01:00–04:00 och 06:00–10:00 UTC på vardagar och allt annat utanför högtrafik.
• Lågtrafik, per miljon tokens — $0.003 för cacheträff, $0.15 för cachemiss, $0.60 för utdata.
• Topp, per miljon tokens — 0,006 $ vid cacheträff, 0,30 $ vid cachemiss, 1,20 $ för utdata.
• Cachad indata, jämfört med en sluten frontiermodell — tre tiondels cent per miljon mot cirka femtio cent. För en agent som loopar över samma kodförråd svarar den nivån för merparten av tokens.
• Uppmätt på vår egen katalog — $0.15 in och $0.60 ut per miljon, 784 ms i median för tid till första token, 211 tokens per sekund under de senaste sju dagarna.
Artificial Analysis listar samma modell till $0.30 för indata och $1.20 för utdata med 98 % cacheringsrabatt och ett sammanvägt pris på $0.18 per miljon — det är den högsta nivån, och de två siffrorna är samma pris vid olika tider på dygnet. Skillnaden är värd att ta till sig innan du jämför leverantörer: en modell med en tvåskiktad klocka kan inte jämföras utifrån ett enda rubrikpris.
Det är också därför som vidarefakturerad prissättning spelar större roll än vanligt här. OrcaRouter dirigerar DeepSeek V4.1 Flash vid sidan av resten av sin katalog till 0 % påslag — leverantörens listpris, oförändrat, så att DeepSeeks nivåer för högtrafik och lågtrafik når oss exakt som DeepSeek publicerar dem, och en prisändring från leverantören gäller samma dag. För en modell vars taxa fördubblas i fyra timmar varje vardagsmorgon döljer en plattform som jämnar ut nivåerna det enda tal du behövde.


Vad ingen har fastställt
Gapet i den här historien är inte ett saknat benchmark. Det är att det inte finns någon trovärdig direkt jämförelse mellan DeepSeek V4.1 Flash och dess namngivna rivaler i ett gemensamt testramverk, körd av någon som inte har något intresse i utfallet. Varje siffra på den här sidan är en av tre saker: rapporterad av leverantören, framtagen av en tredje part i en annan konfiguration, eller ett genomsnitt över en fast testsvit som inte var utformad för att isolera just den här matchningen. Det finns ingen körning där DeepSeek V4.1 Flash och GPT-6 Astra utvärderades på samma uppgifter, med samma scaffold och samma effort-inställning, och som publicerades med varians.
Tre specifika saker skulle förändra bilden, och ingen av dem existerar i dag.
• En scaffold-kontrollerad DeepSWE-jämförelse. Spridningen på 8,7 punkter mellan DeepSeeks egna scaffolds är större än något gap mellan de fyra bästa modellerna på topplistan. Förrän frontlinjen har mätts med en enda harness är ordningen högst upp i den tabellen inte meningsfull.
• En oberoende reproduktion av ProgramBench agent-team-resultat. De 30,04 % kommer från leverantörens tekniska rapport om en filtrerad delmängd på 172 uppgifter, i en preliminär konfiguration, med en tokenkostnad som inte har karaktäriserats för produktionsbudgetar.
• ARC-AGI. Det finns inget resultat alls för denna checkpoint.
Den praktiska konsekvensen är ett smalare påstående än rubrikerna stöder. DeepSeek V4.1 Flash ligger mätbart inom bruset från frontlinjen på ett långsiktigt kodningsbenchmark, är verkligt konkurrenskraftig på oberoende designuppgifter till ungefär 1,4 % av kostnaden, och ligger ungefär tio punkter efter på ett aggregerat index. Det räcker för att motivera att köra den mot din egen arbetsbelastning och låta din utvärdering avgöra frågan. Det räcker inte för att motivera att skriva om en produktionsroutningstabell med 0,2 poäng som grund — och att båda dessa påståenden är sanna är hela fyndet.
Jämförda i den här artikeln3
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
