
DeepSeek V4.1 Flash vs. DeepSeek V4 Pro: Die Übergabe, die DeepSeek geplant und dann abgesagt hat
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
DeepSeek V4.1 Flash wurde am 10.09.2026 veröffentlicht, und DeepSeek V4 Pro sollte inzwischen abgeschaltet sein. Der Plan, zwei Tage vor der Flash-Veröffentlichung angekündigt und am Tag der Veröffentlichung konkretisiert, sah vor, dass am 14.09.2026 um 12:00 Uhr Pekinger Zeit jede Anfrage an deepseek-v4-pro still auf das neuere, günstigere deepseek-flash umgeleitet und zu Flash-Tarifen abgerechnet würde. DeepSeek sagte das am 11.09.2026 ab, nachdem Entwickler Einwände erhoben hatten, und am 14.09.2026 verstrich die Frist, während V4 Pro weiterhin online war und seine Abrechnung unverändert blieb. Das ist also kein Launch-Vergleich – das Modell links ist acht Tage alt, und das Modell rechts ist ein ein Jahr altes Flaggschiff im vierten Monat seiner allgemeinen Verfügbarkeit. Es ist ein Vergleich zweier Modelle, deren Hersteller Benchmarks veröffentlichte, die besagten, dass das günstigere gewonnen habe, dann feststellte, dass seine Nutzer anderer Meinung waren, und einen Rückzieher machte. Diese Abfolge ist das Nützlichste, was in diesem Monat über eines der beiden Modelle veröffentlicht wurde, denn es ist genau die Entscheidung, die Sie gleich selbst treffen werden.
Was tatsächlich passiert ist, der Reihe nach.
Die zeitliche Abfolge ist hier wichtiger als jeder einzelne Benchmark, denn die Umkehr ist die eigentliche Geschichte, und die Ankündigung war bewusst leise.
• 2026-09-09 — DeepSeek teilt Nutzern mit, dass V4-Pro-Anfragen, bevor V4.1 Pro erscheint, an V4.1 Flash weitergeleitet und zu Flash-Tarifen abgerechnet werden. Die Botschaft lautet, dass Flash Pro bei Leistung, Kosten, Geschwindigkeit und Aufgabenabschlusszeit umfassend übertroffen hat.
• 2026-09-10 — DeepSeek V4.1 Flash wird in der App, im Web und über die API allgemein verfügbar (GA). Die Gewichte werden auf Hugging Face unter MIT veröffentlicht. Der API-Modellname lautet dann deepseek-flash. Die Modelle der vorherigen Generation deepseek-v4-flash und deepseek-v4-flash-vision-exp werden endgültig eingestellt, wobei ihre Legacy-IDs vorübergehend auf V4.1 Flash umgeleitet werden. Die Abschaltung von Pro wird auf den 2026-09-14, 12:00 Uhr Pekinger Zeit (04:00 UTC) verschoben.
• 2026-09-11 — DeepSeek lenkt ein. Auf Nutzerwunsch heißt es, der V4 Pro API-Dienst werde über den 2026-09-14 hinaus mit unveränderter Abrechnung fortgesetzt und die automatische Umstellung auf V4.1 Flash sei abgesagt.
• 2026-09-14 — Die Frist läuft ab. V4 Pro wird weiterhin für 0,66 $ / 1,98 $ pro Million Tokens außerhalb der Hauptverkehrszeiten bereitgestellt.
Die Asymmetrie in dieser Abfolge macht den ganzen Artikel aus. Flash-Nutzer wurden migriert, ob sie wollten oder nicht – die alte V4-Flash-ID antwortet jetzt mit einem anderen Modell. Pro-Nutzer bekamen einen Aufschub, und der Grund ist nicht, dass V4 Pro bessere Benchmarks erzielt. Es ist, dass Produktionssysteme darauf abgestimmt worden waren: Prompts, Agent-Scaffolds, Eval-Harnesses und Reproduzierbarkeitsannahmen, die ein Backend-Wechsel ungültig macht, ohne jegliche Codeänderung auf Seiten des Aufrufers. DeepSeeks Vergleichsseite listet heute noch beide Modelle nebeneinander auf, was zeigt, dass das Unternehmen beabsichtigt, beide weiterhin anzubieten.
Seite an Seite: die beiden SKUs
Alles im Folgenden ist DeepSeeks eigene veröffentlichte Spezifikation, sofern keine Quelle genannt wird. Die Preise gelten pro Million Token in der Nebenzeit; der Spitzenpreis steht in Klammern – DeepSeek hat Spitzenzeiten zwischen 01:00 und 04:00 Uhr sowie erneut zwischen 06:00 und 10:00 Uhr UTC, Montag bis Freitag, und alle anderen Stunden sind Nebenzeit zum halben Spitzenpreis.
• API-Modellname — deepseek-flash (DeepSeek-V4.1-Flash) vs. deepseek-v4-pro (DeepSeek-V4-Pro-0813).
• Eingabe, Cache-Miss — 0,15 $ (0,30 $) vs. 0,66 $ (1,32 $).
• Input, Cache-Treffer — 0,003 $ (0,006 $) vs. 0,022 $ (0,044 $).
• Output — 0,60 $ (1,20 $) vs. 1,98 $ (3,96 $).
• Kontext / max. Ausgabe — 1 Mio. Token / 384K bei beiden. Identisch.
• Bildeingabe – nativ auf Flash unterstützt; bei V4 Pro als nicht unterstützt aufgeführt.
• Nebenläufigkeitslimit — 2.500 bei Flash gegenüber 500 bei V4 Pro.
• Gemeldete Parameter — Flash: 552B insgesamt, Herstellerangabe, mit einer glaubwürdigen Infragestellung durch die Community (mehr dazu weiter unten). V4 Pro: 1,6T insgesamt, ~49B aktiv, was Artificial Analysis ebenfalls aufführt und die vLLM-Rezeptseite bestätigt.
• Aktives Budget pro Token — Flash aktiviert konstruktionsbedingt etwa 8B beim Prefill und 16B beim Decode, was genau der Sinn seiner Architektur ist; Pro aktiviert ~49B pro Token.
• Lizenz — MIT, offene Gewichte bei beiden.
• GA-Termin — Flash 2026-09-10; V4 Pro 0813 2026-08-13, nach einer Vorschau im April.

Die Preisdifferenz ist das gesamte Argument
Input ist bei Pro 4,4× teurer. Output ist 3,3×. Cache-Treffer – die Stufe, die einen langen Agentenlauf mit stabilem System-Prompt dominiert – liegen bei 7,3×. Da sich der Peak auf beiden Seiten pro Stufe verdoppelt, ist das Verhältnis im Peak identisch; die Differenz ist kein Rabatt-Artefakt.
Lass eine Arbeitslast darauf laufen. Nimm einen Coding-Agenten, der monatlich 10 Mio. Eingabe-Tokens bei einer Cache-Trefferquote von 70 % und 2 Mio. Ausgabe-Tokens verarbeitet. Bei V4.1 Flash zu Off-Peak-Zeiten sind das 0,45 $ für frische Eingabe, 0,021 $ für gecachte Eingabe und 1,20 $ für Ausgabe: 1,67 $. Bei V4 Pro zu Off-Peak-Zeiten sind es 1,98 $, 0,154 $ und 3,96 $: 6,09 $. Etwa das 3,6-Fache, bei einer Arbeitslast, die bewusst unauffällig ist.
Das ist DeepSeeks eigene Liste, und es ist der Preis, den Sie tatsächlich zahlen – hier: OrcaRouter gibt die Listenpreise der Anbieter mit 0 % Aufschlag weiter, sodass eine Preisänderung von DeepSeek noch am selben Tag bei uns ankommt, statt neu verpackt zu werden. Beide Modelle laufen über denselben Schlüssel, was für den Abschnitt weiter unten wichtig ist – den, in dem es um das Testen einer Migration geht, die Sie nicht mehr durchführen müssen.

Wo DeepSeek V4.1 Flash wirklich gewinnt
Der stärkste Beleg für Flash ist nicht DeepSeeks Benchmark-Tabelle. Es ist Artificial Analysis, das unabhängig ist und direkt von seinen Modellseiten abgelesen wird.
• Intelligence Index — Flash (Reasoning, Max Effort) erreicht 40 Punkte und belegt Rang 6 von 113 Modellen. V4 Pro 0813 (Reasoning, Max Effort) erreicht 36 Punkte und belegt Rang 7. Gleicher Index, gleiche Effort-Einstellung, vier Punkte Unterschied – und das günstigere Modell liegt vorn.
• Ausgabegeschwindigkeit — 214,4 Tokens/s gegenüber 94,4 Tokens/s. Das ist 2,3×, und es ist gemessen, nicht behauptet.
• Zeit bis zum ersten Token — 1,21 s gegenüber 1,74 s.
• DeepSWE v1.1 — 74,2 für Flash auf der gewerteten Bestenliste, erster Platz, vor GPT-6 Astra mit 74,10, Claude Opus 5 mit 74,00 und Gemini 3.8 Flash mit 73,70. Die 62,7 von V4 Pro 0813 im selben Benchmark ist DeepSeeks eigene Zahl. Der Vorsprung an der Spitze beträgt 0,2 Punkte, was ein Gleichstand ist, kein Sieg — aber ein Abstand von 11,5 Punkten zu Pro ist kein Gleichstand.
• Serving-Effizienz — Der Decoder von Flash leitet seinen globalen KV aus dem letzten Hidden State des Encoders ab, statt ihn pro Layer neu zu berechnen, was die asymmetrische 8B-Prefill-/16B-Decode-Aktivierung erzeugt. Das InferenceX-Profil von SemiAnalysis beziffert den KV-Cache auf ungefähr 890 Bytes pro Token — etwa ein Viertel von V4 Flash —, wobei der persistente KV-Speicher bis auf ungefähr ein Achtel sinkt. Das ist der Grund, warum der Preis so ist, wie er ist, und es ist auch der Grund, warum das Modell bei 2.500 Parallelität verfügbar ist, während Pro bei 500 begrenzt ist.
• Vision in der bereitgestellten API — nicht nur in den Gewichten. DeepSeeks eigene Preisseite gibt an, dass Bildeingabe für Flash unterstützt und für V4 Pro nicht unterstützt wird, und DeepSeek beschreibt es als sein erstes Flaggschiff mit nativem multimodalen Verständnis. Dies ist das erste DeepSeek-Flaggschiff, bei dem das Lesen eines Screenshots keinen separaten Endpunkt erfordert.
Alle anderen Schlagzeilenwerte, die Sie zitiert sehen werden – Terminal-Bench 2.1 bei 90,6, GPQA Diamond bei 90,9, Codeforces 3471 – sind DeepSeeks eigene, von uns nicht reproduziert, und sollten mit diesem Hintergrund gelesen werden.
Wo DeepSeek V4 Pro nach wie vor die richtige Wahl ist
Es wäre leicht, V4 Pro nach so einer Woche abzuschreiben. Die rückgängig gemachte Deprecation sagt etwas anderes, und das Datenblatt sagt ebenfalls etwas anderes.
Pro hat insgesamt 1,6 T Parameter und aktiviert ~49 B pro Token, gegenüber 16 B bei Flash während der Dekodierung. Was auch immer der Index sagt: Kapazität pro Token ist eine echte Ressource, und die Workloads, bei denen sie zum Tragen kommt, sind die mit langem Zeithorizont: mehrstündige Agentenläufe, große Refactorings, Aufgaben, bei denen eine frühe falsche Weiche die gesamte Trajektorie kostet. Eine Vier-Punkte-Lücke im Index misst den Durchschnitt von zehn Evaluierungen, nicht den Ausläufer deiner Verteilung.
Pro ist auch die bekannte Größe. Es ist seit dem 13.08.2026 allgemein verfügbar, nach einer Vorschau im April, und der 0813-Build bezog seine Leistung aus dem Post-Training statt aus der Architektur — gleiche Parameteranzahl, gleiche Form wie die Vorschau, anderes Verhalten. Das sind vier Monate Community-Tooling, veröffentlichte Agent-Harnesses, Prompt-Muster und Fehlermodi. Flash ist seit acht Tagen allgemein verfügbar, und das Ökosystem darum herum ist entsprechend dünn. Wenn die Zuverlässigkeit Ihres Teams darauf beruht, genau zu wissen, wie ein Modell versagt, dann ist Pro der Ort, an dem dieses Wissen zu Hause ist.
Und der Dienst wurde nicht eingestellt. DeepSeeks Zusage ist ausdrücklich, und seine Abrechnung ist unverändert, die Gewichte stehen unter MIT, und V4 Pro ist weiterhin in unserem Katalog zum gleichen Listenpreis. Die abgesagte Abschaffung ist kein Aufschub der Hinrichtung – sie ist eine Erklärung, dass DeepSeek beabsichtigt, diese Stufe weiterhin zu bedienen.

Drei Dinge, die man beiden Modellen vorhalten kann
Leitplanken, denn es ist teuer, diese Entscheidung falsch zu treffen.
• Die Parameteranzahl ist umstritten. 552B ist DeepSeeks Angabe. Eine glaubwürdige Community-Analyse argumentiert, dass der veröffentlichte Checkpoint 748B umfasst – das 552B-Transformer-Backbone plus die ~196B große Engram-Tabelle für konditionales Gedächtnis, eine Nachschlagestruktur, die an zwei Stellen im Netzwerk herangezogen wird, statt einer Schicht, durch die das Signal fließt. Der veröffentlichte Download umfasst 510,3 GB verteilt auf 48 safetensors-Shards mit dichten FP8-Gewichten und gerouteten FP4-Experten. Beide Zahlen können gleichzeitig richtig sein, je nachdem, ob man den Abruf getrennt von der Berechnung zählt. Behandle 552B als vom Anbieter gemeldete Zahl und prüfe den Speicherplatzbedarf auf der Festplatte, bevor du ein Deployment planst.
• Ein Leaderboard-Score ist eine Anzeige, kein Vertrag. Die 74,2 von DeepSWE v1.1 sind ein Harness-Benchmark. Ein selbst veröffentlichtes Audit des EyesTech Systems Lab behauptet, dass diese Flash-Klasse-Scores zusammenbrechen, sobald man sie auf isolierte, reale Multi-File-Repositories überträgt – das würde DeepSeek V4.1 Flash auf 31,4 % bei SWE-bench Pro bringen, gegenüber den 74,2 % der Schlagzeile, ein größerer Rückgang als bei den Frontier-Modellen in seinem eigenen Vergleich. Dieses Audit ist nicht unabhängig – der Autor verkauft ein Tool, das genau die Harness-Ausnutzung aufspürt, die er beschreibt – und wir haben keine Replikation davon gesehen. Dennoch ist es die richtige Haltung: Verifizieren Sie an Ihren eigenen Repos, bevor Sie migrieren.
• Ausführlichkeit ist eine Kostenposition.Artificial Analysis hat gemessen, dass V4.1 Flash in seinem Intelligence-Index-Durchlauf 250 Mio. Output-Tokens erzeugt, gegenüber einem Median von 140 Mio. bei vergleichbaren Open-Weights-Modellen, und bezeichnet es als sehr ausführlich. Output ist die teure Richtung in dieser Preistabelle, ein Modell, das laut denkt, zehrt also an seinen eigenen Einsparungen. Bei einer reasoning-intensiven Workload sollte man die Token-Anzahl einkalkulieren, nicht nur den Token-Preis.
Noch eine Sache, klar gesagt, damit niemand aufgrund eines Gerüchts plant: DeepSeek V4.1 Pro ist nicht veröffentlicht. Die abgesagte Migration wurde als Übergangslösung „vor dem Start von V4.1 Pro“ dargestellt, und daran hat sich nichts geändert.
Wähle DeepSeek V4.1 Flash, wenn
• Ihr Workload ist hochvolumig, latenzsensibel oder kostenbegrenzt — Klassifizierung, Extraktion, Routing, Zusammenfassung, Chat, die meisten Codegen-Aufgaben.
• Sie benötigen Bildeingabe am selben Endpunkt wie Text. Dies ist das erste DeepSeek-Flaggschiff, bei dem das ein einzelner Aufruf statt eines zweiten Modells ist.
• Ihre Prompts sind cachefähig. Bei 7,3× bei Cache-Treffern ist die Lücke genau dort am größten, wo Agenten-Traffic anfällt, und ein stabiler System-Prompt macht den größten Teil des Inputs eines langen Laufs aus.
• Du startest diese Woche von vorn und hast kein auf die Eigenheiten eines bestimmten Modells abgestimmtes Harness. Es gibt nichts zu schützen.
• Sie wollen die höhere Parallelitätsobergrenze. 2.500 gegenüber 500 bedeutet einen fünfmal so großen Durchsatz, bevor Sie in die Warteschlange geraten.
Wähle DeepSeek V4 Pro, wenn
• Sie haben bereits eine Produktion, die dagegen abgestimmt ist. Die Umkehrung bedeutet, dass Sie Zeit haben – nutzen Sie sie zum Testen, statt der Frage auszuweichen.
• Ihre Aufgaben sind langfristig angelegt und Fehler teuer, und Sie haben anhand Ihrer eigenen Daten statt auf einem Leaderboard gemessen, dass ~49B aktive Parameter pro Token Ihnen etwas bringen, was Flashs 16B nicht bietet.
• Sie benötigen vorhersehbares, rein textbasiertes Verhalten ohne einen Vision-Pfad, der berücksichtigt werden müsste, oder Sie verfügen über Eval-Baselines, die ein Modellwechsel mitten in der Studie ungültig machen würde.
• Ihr Zugriffsmuster ist von geringem Volumen und hohem Risiko geprägt, sodass das 3,6-Fache einer kleinen Rechnung nicht der ausschlaggebende Faktor ist.
Wenn du bereits auf DeepSeek V4 Pro aufgebaut hast
Das Nützliche, das sich am 2026-09-11 geändert hat, ist, dass Ihre Migration aufgehört hat, eine Frist zu sein, und zu einer Entscheidung geworden ist. Das ist streng besser für Sie und streng schlechter für Ihren Posteingang, denn die Entscheidung muss immer noch getroffen werden, und jetzt nimmt sie Ihnen niemand ab.
Fangen Sie damit an, den Preis zu berechnen. Die 3,3–4,4×-Lücke ist die Zahl, die Sie ungenutzt lassen, und das oben durchgerechnete Beispiel macht daraus in etwa einer Minute eine monatliche Summe. Testen Sie es dann auf die einzige Weise, die zählt: Spiegeln Sie einen Teil des Produktionsverkehrs auf Flash, behalten Sie Pro auf dem primären Pfad und vergleichen Sie die Ausgaben bei Ihren eigenen Aufgaben. Da beide Modelle auf denselben Schlüssel zum Listenpreis des Anbieters mit automatischem Failover antworten, ist dieser Shadow-Run eine Routing-Änderung statt einer zweiten Integration, und der Router kann eine Anfrage an Pro zurückgeben, ohne dass Sie den Fallback schreiben müssen. Teams, die Tokens für eine Migration verbrennen, um die sie nicht gebeten haben, sind der Grund, warum es die Routing-Ebene überhaupt gibt.
Gehen Sie nicht davon aus, dass Flash sich einfach als Drop-in einsetzen lässt. Es ist eine andere Architektur – ein 40-schichtiger kausaler Encoder-Decoder mit asymmetrischer Aktivierung – und beim Schlussfolgern ausführlicher. Verhalten auf Prompt-Ebene lässt sich in keine der beiden Richtungen sauber übertragen, messen Sie die Migration daher an den Ausgaben, nicht am Index.
Was zu sehen
Drei Dinge entscheiden darüber, wie dieses Paar in einem Monat aussieht. Erstens, ob V4.1 Pro erscheint und eine echte Pro-Stufe wiederherstellt – die gesamte abgesagte Migration war ausdrücklich eine Überbrückungslösung dafür, sodass DeepSeeks Roadmap noch immer ein Loch in Form eines Flaggschiffs hat. Zweitens, ob die Gnadenfrist den nächsten Preisvorstoß von DeepSeek überlebt; ein Unternehmen, das bereit ist, einmal eine stille Umleitung zu planen, hat gelernt, dass es das nicht kann, nicht dass es das nicht sollte. Drittens, ob jemand außerhalb von DeepSeek die Flash-Benchmark-Zahlen auf unveränderten Repositorys reproduziert, denn das ist das eine Ergebnis, das die Effizienz-gegen-Kapazität-Debatte entscheiden würde, um die sich dieser ganze Vergleich dreht. Bis dahin ist die ehrliche Position diejenige, die die Umkehr selbst impliziert: Flash ist die bessere Standardwahl für alles Neue, Pro ist die bessere Wette für alles, was bereits gebaut wurde, und DeepSeek hat Ihnen gerade gesagt, dass es beide bedienen wird, während Sie herausfinden, welche der beiden Sie sind.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
