
DeepSeek V4.1 Flash Benchmarks: Was 74,2 beweist und was nicht
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 984 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 195 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
DeepSeek V4.1 Flash erzielte 74,2 auf DeepSWE v1.1, einen Zehntelpunkt über GPT-6 Astra, einen halben Punkt über Gemini 3.8 Flash und Claude Opus 5, und diese Zahl wurde die ganze Woche über als Wachablösung zitiert. Es lohnt sich, präzise zu sein, was sie tatsächlich ist. Das Modell selbst ist nicht neu – DeepSeek V4.1 Flash wurde am 10. September 2026 allgemein verfügbar, vor sechs Tagen –, es handelt sich hier also um keinen Launch. Was in diesem Zeitfenster dazugekommen ist, ist die Messschicht: die ersten unabhängigen Index-Einträge, das erste unabhängige Arena-Ergebnis, Day-0-Serving-Support über drei Stacks hinweg und die Entscheidung eines Anbieters, sein eigenes Flaggschiff zugunsten dieses Modells auszumustern. Diese Seite ist eine Zusammenfassung dessen, was tatsächlich gemessen wurde, mit der für jede Zahl genannten Quelle und einer klaren Aussage darüber, was noch niemand belegt hat.
Der DeepSWE-Wert und die vier Modelle, die weniger als einen halben Punkt davon entfernt liegen
DeepSWE v1.1 ist ein Software-Engineering-Benchmark mit langem Zeithorizont von Datacurve — 113 originale Aufgaben aus 91 Open-Source-Repositories und fünf Programmiersprachen, aufgebaut um Multi-Datei-Änderungen und Verhaltenskorrektheit. Auf DeepSeeks eigener Modellkarte lautet die vom Anbieter gemeldete Tabelle: DeepSeek V4.1 Flash 74.2, Claude Opus 5 74.0, GPT-5.6 Sol 73.0, Kimi K3 67.5, GLM-5.3 66.9, DeepSeek V4-Pro-0813 62.7, DeepSeek V4-Flash 54.4.
Die unabhängige Rangliste für denselben Benchmark gibt diese Reihenfolge nicht wieder, und die Unterschiede sind wichtiger als die Schlagzeile. Datacurves DeepSWE v1.1 Pass@1-Rangliste setzt Muse Spark 1.3 (FAIR) mit 75,40 auf den ersten Platz, vor DeepSeek V4.1 Flash mit 74,20. Dahinter: GPT-6 Astra mit 74,12 (extra high) und 74,10 (max), Gemini 3.8 Flash mit 73,83 (high), Claude Opus 5 mit 73,65 (max).
Also ist die 74,2 ein echter Eintrag in einem echten Drittanbieter-Leaderboard, und sie steht auf Platz zwei, nicht auf Platz eins. Die Behauptung, die am Veröffentlichungstag kursierte – dass dies bei DeepSWE der Stand der Technik sei –, übersteht den Kontakt mit dem Leaderboard, das die Punktzahl führt, nicht. Muse Spark 1.3 liegt 1,2 Punkte vorn.
Jetzt der Teil, der übersprungen wird. Vier Frontier-Modelle liegen bei diesem Benchmark innerhalb von 0,55 Punkten voneinander: 74,20, 74,12, 73,83, 73,65. Das ist ein schmaleres Band als das Messrauschen. Die veröffentlichte Schwankung von Durchlauf zu Durchlauf bei DeepSWE liegt in der Größenordnung von 1,4 bis 3,2 Punkten – drei- bis sechsmal so groß wie die gesamte Spannweite der Top vier. Ein Vorsprung von 0,2 Punkten gegenüber GPT-6 Astra ist kein Befund; es ist schlicht, wie ein Gleichstand aussieht, wenn man ihn auf zwei Nachkommastellen ausdruckt.
Scaffold-Sensitivität ist der zweite Grund, die Zahl mit Vorsicht zu behandeln, und hier liefert die Dokumentation des Anbieters selbst den Beleg. DeepSeek berichtet im selben Release-Material über DeepSWE mit acht Scaffolds. Die 74,2 wurden auf mini-SWE erreicht. Dasselbe Modell erzielte 72,6 auf DSH Minimal, 70,5 auf DSH Standard, 69,8 auf Claude Code, 67,6 auf DSH PTC, 66,2 auf Pi, 65,6 auf Codex und 65,5 auf OpenCode. Das ist eine Spanne von 8,7 Punkten bei einem einzigen Modell und einem einzigen Benchmark, allein verursacht durch das darum herum gebaute Harness. Wer eine auf mini-SWE erzeugte DeepSeek-Zahl mit der Zahl eines Konkurrenten vergleicht, die in einer anderen Agent-Loop erzeugt wurde, vergleicht Scaffolds, nicht Modelle.
Wo der unabhängige Index es tatsächlich einordnet
Artificial Analysis führt eine feste Testsuite mit angegebenen Effort-Einstellungen aus, was seinen Intelligence Index zur saubersten verfügbaren externen Überprüfung macht. Auf der Modellseite für DeepSeek V4.1 Flash liegt der Index bei maximalem Reasoning-Aufwand bei 40 — auf Platz 6 von 113 Modellen dieser Klasse, gegenüber einem Klassenmedian von 18. Die geschlossenen Konkurrenten liegen darüber: Claude Opus 5 (max) 51, GPT-5.6 Sol (max) 47, GLM-5.3 (max) 45, Kimi K3 (max) 44, Gemini 3.8 Flash (hoch) 41. DeepSeeks eigenes vorheriges Flaggschiff, V4-Pro-0813, liegt mit 36 darunter.
Liest man die beiden Ranglisten nebeneinander, ist die Abweichung struktureller Natur, kein Fehler. Auf dem von DeepSeek gewählten Benchmark und mit dem richtigen Scaffold zieht das Modell mit der Frontier gleich. In einer festen externen Suite, gemittelt über Reasoning, Coding, Mathematik und agentische Arbeit, liegt es elf Punkte hinter Claude Opus 5 und einen Punkt hinter Gemini 3.8 Flash. Beides kann wahr sein. Eine Anbietertabelle ist ein Argument; ein Index ist ein Durchschnitt.
Die Indexseite enthält außerdem zwei Zahlen, die für eine Routing-Entscheidung wichtig sind und selten Schlagzeilen machen. DeepSeek V4.1 Flash läuft bei maximalem Aufwand mit 214,4 Ausgabe-Tokens pro Sekunde – schnell. Außerdem generierte es 250 Mio. Ausgabe-Tokens beim Abschluss des Intelligence Index, gegenüber einem Median von 140 Mio., was Artificial Analysis als ausgesprochen wortreich einstuft. Wortfülle ist kein Qualitätsproblem; sie ist eine Rechnung. Ein Modell, das in 79 % mehr Tokens denkt als seine Vergleichsmodelle, gibt bei jedem langen Reasoning-Aufruf einen Teil seines Preisvorteils zurück.

ProgramBench: Ein Single-Model-Score und ein Multi-Agent-Score sind nicht dieselbe Messung.
Dies ist die Zahl, die am ehesten falsch gelesen wird, daher lohnt es sich, sie sorgfältig zu trennen.
• Einzelmodell, Standardkonfiguration — DeepSeek V4.1 Flash erzielt 20,3 im ProgramBench (Almost@1), laut DeepSeeks eigener Modellkarte. Das ist unter GPT-5.6 Sol mit 23,0 und weit unter Claude Opus 5 mit 37,0 und nur leicht über GLM-5.3 mit 19,0 und Kimi K3 mit 17,5. Vom Anbieter angegeben, und es schmeichelt dem Modell nicht.
• Multi-Agenten-Team-Konfiguration — DeepSeeks Tech-Bericht, DeepSeek-V4.1-Flash: Die Grenzen der KV-Cache-Komprimierung ausloten, beschreibt ein vorläufiges Agent-Swarm-RL-Rezept, bei dem ein leitender Agent Teammitglieder über ein gemeinsames Task-Board koordiniert. In einem ProgramBench-Teilset mit 172 Aufgaben und hoher Konfidenz – Aufgaben, bei denen die Referenzlösung mit 95 % oder besser besteht – steigt die Multi-Agenten-Konfiguration von 13,59 % bei einer Frist von einer Stunde auf einen Spitzenwert von 30,04 % bei acht Stunden, während die Single-Agent-Baseline von 12,79 % auf 20,39 % steigt.
Die 30,04 % sind die Quelle der Behauptung „30 %“, und es ist kein Single-Model-Score. Es ist ein Team von Agenten, dem acht Stunden gegeben wurden, gemessen auf einer gefilterten Teilmenge, in der vorläufigen Bewertung des Anbieters selbst. Der Vergleich, zu dem sie einlädt – „weit über einem einzelnen Sol, fast 2× Kimi K3“ –, ist gegenüber Sols 23,0 und K3s 17,5 arithmetisch fair, und er ist zugleich ein Vergleich zwischen einer Multi-Agent-Konfiguration und Single-Model-Baselines auf einem anderen Aufgabensatz. Derselbe Bericht zeigt den Effekt auf FrontierSWE v2: Multi-Agent erreicht 32,90 % bei zwanzig Stunden gegenüber 28,20 % bei Single-Agent. Der Abstand ist real, er verringert sich, je weiter die Frist verlängert wird, und die Token-Kosten, um ihn zu erzielen, sind nicht gering – ein Praxisbericht nennt mehr als 10× so viele Tokens und Laufzeiten, die sich vier Stunden nähern.
Die Parameteranzahl ist noch nicht festgelegt, daher sind alle Größenvergleiche als vorläufig zu betrachten.
Die Versionshinweise von DeepSeek beschreiben ein „552B-Parameter-MoE“. Das ist die Herstellerangabe, und genau das wiederholen die meisten Berichte. Es ist auch nicht das gesamte Artefakt.
DeepSeeks eigene Model Card dokumentiert eine zweite Komponente neben dem Transformer-Backbone: „Engram conditional memory (196B Parameter, sparse über tokenbasiertes Lookup abgerufen).“ Addiert man die beiden, erhält man 748B. Das ist die Arithmetik hinter der Community-Lesart, die innerhalb von Stunden nach der Veröffentlichung auf r/LocalLLaMA kursierte, und der Safetensors-Index der Model Card selbst listet 763B Parameter über ihre Tensortypen hinweg auf. Die grob 510 GB FP8 Zahl stammt aus derselben Analyselinie: das, was man tatsächlich herunterlädt und im Speicher hält.
Die Auflösung ist, dass sie unterschiedliche Dinge erfassen. 552B ist das rechnerische Rückgrat – die Parameter, durch die ein Token fließt. 196B ist eine Nachschlagetabelle, die in bestimmten Schichten herangezogen wird und gespeicherte Informationen zurückgibt, statt über sie zu rechnen. 8B und 16B, die von DeepSeek genannten Aktivierungswerte, sind die Pro-Token-Slices, die während Prefill bzw. Decode aktiv sind. Alle vier Zahlen beschreiben dasselbe Modell.
Nichts davon macht den Vergleich sicher. Jede Behauptung der Form „dieses Modell erreicht ein Frontier-Modell bei einem Bruchteil der Größe“ stützt sich auf eine Hersteller-Schlagzeile, die ein Fünftel des Artefakts ausschließt. Solange niemand eine reproduzierbare Parameterabrechnung veröffentlicht, sollten größenbasierte Argumente den Vorbehalt direkt mitführen.
ARC-AGI: Kein Ergebnis für dieses Modell
Für DeepSeek V4.1 Flash gibt es weder einen ARC-AGI-2- noch einen ARC-AGI-1-Wert. Die Seite mit den verifizierten Ergebnissen von ARC Prize enthält keinen Eintrag für diesen Checkpoint, und DeepSeeks eigene Benchmark-Tabelle hat keine ARC-Zeile. Das einzige von ARC Prize verifizierte DeepSeek-Ergebnis betrifft den älteren V4 Flash 0731-Checkpoint – 61,4 % bei ARC-AGI-2 semi-private mit maximalem Reasoning-Aufwand und 89,0 % bei ARC-AGI-1, bei 0,04 $ bzw. 0,02 $ pro Aufgabe. Das sind die Zahlen des Vorgängers auf einem anderen Modell, und sie als V4.1-Flash-Ergebnisse anzuführen, wäre falsch. Wenn ARC-AGI für Ihre Bewertung relevant ist, ist dieses Modell derzeit nicht bewertet.
Was sonst noch im Fenster gelandet ist
Drei Dinge haben sich für einen Leser geändert, der entscheidet, ob er dieses Modell ausprobieren soll, und keines davon ist die Veröffentlichung des Modells selbst.
• Unabhängiges Arena-Ergebnis. OpenDesign Arena ließ dreizehn Modelle identische Designaufgaben durchlaufen – Web-Apps, Dashboards, mobile Screens, Landingpages. DeepSeek V4.1 Flash erzielte 81,2 von 100 Punkten gegenüber den 82,7 von GPT-6 Astra, bei 0,023 $ pro fertiggestelltem Design gegenüber 1,61 $, und benötigte 5,3 Minuten gegenüber 11,1. Die Auslieferungsquote – Ergebnisse, die ohne Überarbeitung verwendbar sind – lag bei 57,7 % gegenüber den 60 % von Astra. Dies ist eine der ersten wirklich unabhängigen Messungen des Modells, und sie misst speziell die Designausgabe, nicht allgemeines Schlussfolgern oder Programmieren.
• Day-0-Serving-Support auf drei Stacks. vLLM veröffentlichte ein Day-0-Image (09.09.2026), das auf NVIDIA- und AMD-Hardware validiert wurde. SGLang und Miles veröffentlichten am 10.09.2026 Day-0-Inferenz- und RL-Support, einschließlich eines Engram-Host-Offload-Pfads, der die KV-Cache-Kapazität auf 4x GB300 um 36 % erhöhte, und einer Bounded-Replay-Optimierung, die den Prefill-Durchsatz auf 8x H200 um das 1,56-Fache steigerte. Cambricon kündigte am selben Tag die Day-0-Anpassung auf dem vLLM-Stack an. Für ein Modell, dessen Verkaufsargument eine aggressive KV-Cache-Kompression ist – ein Viertel des HBM-Footprints der vorherigen Generation, ein Achtel ihres SSD –, ist die Ausführbarkeit auf Standard-Stacks ab dem ersten Tag der Unterschied zwischen einem Laborergebnis und etwas, das man deployen kann.
• Der Anbieter hat sein eigenes Flaggschiff eingestellt. DeepSeek nimmt V4-Pro außer Betrieb. Ab 04:00 UTC am 2026-09-14 wird jede Anfrage, die „deepseek-v4-pro“ nennt, zu V4.1 Flash weitergeleitet und zu Flash-Tarifen abgerechnet; das gilt so lange, bis ein V4.1 Pro erscheint. DeepSeek V4.1 Pro ist nicht veröffentlicht – es ist ein zukünftiges Modell, und die Weiterleitung ist eine Übergangslösung, damit fest angeheftete Integrationen nicht brechen. Ebenfalls außer Betrieb genommen: „deepseek-v4-flash“ und „deepseek-v4-flash-vision-exp“, beide werden vorübergehend aus Kompatibilitätsgründen zu V4.1 Flash weitergeleitet. Wenn Sie eine fest angeheftete Modell-ID in der Produktion verwenden, ist diese Weiterleitung die einzige operative Tatsache auf dieser Seite, die Sie nicht ignorieren können.
Was der Preis mit der Entscheidung macht
Die Preisgestaltung ist der Punkt, an dem dieses Modell aufhört, eine reine Benchmark-Story zu sein. Laut den von DeepSeek selbst veröffentlichten Preisen, gültig ab 04:00 UTC am 10.09.2026, wobei Spitzenzeiten als 01:00–04:00 und 06:00–10:00 UTC an Wochentagen definiert sind und alles andere als Nebenzeiten gilt.
• Außerhalb der Spitzenzeiten, pro Million Tokens — 0,003 $ Cache-Treffer, 0,15 $ Cache-Fehltreffer, 0,60 $ Ausgabe.
• Spitzenwert, pro Million Token — 0,006 $ Cache-Hit, 0,30 $ Cache-Miss, 1,20 $ Ausgabe.
• Zwischengespeicherte Eingabe, verglichen mit einem geschlossenen Frontier-Modell — drei Zehntel eines Cents pro Million gegenüber rund fünfzig Cents. Für einen Agenten, der dieselbe Repository in einer Schleife durchläuft, entfällt der Großteil der Tokens auf diese Stufe.
• Gemessen an unserem eigenen Katalog — 0,15 $ pro Million für die Eingabe und 0,60 $ pro Million für die Ausgabe, 784 ms Median-Zeit bis zum ersten Token, 211 Token pro Sekunde in den letzten sieben Tagen.
Artificial Analysis führt dasselbe Modell mit $0,30 für die Eingabe und $1,20 für die Ausgabe, mit einem Cache-Rabatt von 98 % und einem Mischpreis von $0,18 pro Million auf — das ist die Spitzenstufe, und die beiden Zahlen sind derselbe Preis zu unterschiedlichen Tageszeiten. Diese Unterscheidung sollten Sie verinnerlichen, bevor Sie Anbieter vergleichen: Ein Modell mit zweistufiger Taktung lässt sich nicht anhand eines einzigen Nennpreises vergleichen.
Das ist auch der Grund, warum Pass-through-Preisgestaltung hier mehr als sonst zählt. OrcaRouter führt DeepSeek V4.1 Flash neben dem übrigen Katalog zu 0 % Aufschlag — der Listenpreis des Anbieters, unverändert, sodass DeepSeeks Peak- und Off-Peak-Stufen bei uns genau so ankommen, wie DeepSeek sie veröffentlicht, und eine Preisänderung eines Anbieters noch am selben Tag wirksam wird. Bei einem Modell, dessen Tarif sich an jedem Werktagmorgen für vier Stunden verdoppelt, verbirgt eine Plattform, die die Tarifstufen einebnet, die einzige Zahl, die Sie gebraucht hätten.


Was niemand festgestellt hat
Die Lücke in dieser Geschichte ist kein fehlender Benchmark. Sie besteht darin, dass es keinen glaubwürdigen direkten Vergleich zwischen DeepSeek V4.1 Flash und seinen namentlich genannten Konkurrenten auf einem gemeinsamen Harness gibt, der von jemandem durchgeführt wurde, der kein Interesse am Ergebnis hat. Jede Zahl auf dieser Seite ist eines von drei Dingen: vom Anbieter gemeldet, von einem Dritten in einer anderen Konfiguration erzeugt oder ein Durchschnitt über eine feste Suite, die nicht darauf ausgelegt war, dieses Duell zu isolieren. Es gibt keinen Durchlauf, bei dem DeepSeek V4.1 Flash und GPT-6 Astra auf denselben Aufgaben, demselben Scaffold und derselben Effort-Einstellung bewertet und mit Varianz veröffentlicht wurden.
Drei konkrete Dinge würden das Bild verändern, und keines davon existiert heute.
• Ein Scaffold-kontrollierter DeepSWE-Vergleich. Die Spanne von 8,7 Punkten über DeepSeeks eigene Scaffolds hinweg ist größer als jede Lücke zwischen den vier besten Modellen der Rangliste. Solange die Frontier nicht auf einem einzigen Harness gemessen wird, ist die Reihenfolge an der Spitze dieser Tabelle nicht aussagekräftig.
• Eine unabhängige Reproduktion des Ergebnisses des ProgramBench-Agententeams. Die 30,04 % stammen aus dem technischen Bericht des Anbieters zu einem gefilterten Teilsatz von 172 Aufgaben in einer vorläufigen Konfiguration, mit einem Token-Aufwand, der für Produktionsbudgets nicht charakterisiert wurde.
• ARC-AGI.Für diesen Checkpoint existiert überhaupt kein Score.
Die praktische Konsequenz ist eine engere Aussage, als die Schlagzeilen nahelegen. DeepSeek V4.1 Flash liegt messbar im Rauschen der Frontier bei einem Long-Horizon-Coding-Benchmark, ist bei unabhängigen Design-Aufgaben zu etwa 1,4 % der Kosten wirklich wettbewerbsfähig und liegt bei einem aggregierten Index etwa zehn Punkte zurück. Das reicht aus, um es gegen Ihre eigene Workload laufen zu lassen und Ihre Evaluierung die Frage klären zu lassen. Es reicht nicht aus, um eine Produktions-Routing-Tabelle aufgrund von 0,2 Punkten neu zu schreiben – und die Tatsache, dass beide Aussagen wahr sind, ist der ganze Befund.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
