
DeepSeek V4 Flash Offizielle Veröffentlichung: Das günstige, schnelle, agentische 1M-Kontext-Modell, erklärt
- qwenNEUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens · 224 tok/s
- orcaNEUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNEUAnthropic: Claude Opus 52026-07-2461Intelligenz78Coding
- googleNEUGoogle: Gemini 3.6 Flash2026-07-2150Intelligenz69Coding
- googleNEUGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1651Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1557Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligenz77Coding
- grokxAI: Grok 4.52026-07-0854Intelligenz72Coding
- tencentTencent: Hy32026-07-0641Intelligenz59Coding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligenz42Coding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligenz39Coding
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligenz72Coding
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligenz52Coding57Mathe
- z-aiZ.ai: GLM 5.22026-06-1651Intelligenz69Coding60Mathe
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligenz61Coding61Mathe
- anthropicAnthropic: Claude Fable 52026-06-0960Intelligenz77Coding
- qwenQwen: Qwen3.7 Plus2026-06-0139Intelligenz56Coding59Mathe
Das Effizienzmodell von DeepSeek, V4 Flash, ist von der Vorschau zu einer offiziellen öffentlichen Beta-Version übergegangen — der code>-0731/code> Build wurde am 31. Juli 2026 veröffentlicht. Die Architektur änderte sich nicht (es ist weiterhin ein Mixture-of-Experts-Modell mit 284 Milliarden Parametern und einem Kontext von 1 Million Token), aber eine Runde zusätzlicher Nachbearbeitung verbesserte seine agentischen, Programmier- und Tool-Calling-Fähigkeiten erheblich, und es unterstützt jetzt nativ die Responses API mit spezifischen Anpassungen für Codex-artige Agenten. Dieser Leitfaden erklärt, was V4 Flash ist, was die offizielle Veröffentlichung tatsächlich verbessert hat, wie seine (von DeepSeek gemeldeten) Benchmarks zu lesen sind, was es kostet und wie man es verwendet — jede Zahl nach Quelle gekennzeichnet.
Genauigkeitshinweis: Die unten genannten Veröffentlichungsdetails und Benchmark-Ergebnisse stammen aus dem offiziellen API-Änderungsprotokoll von DeepSeek (Stand 2026-07-31); Architektur, Kontext und Preise wurden gegen die Modellseite von OrcaRouter abgeglichen; die Artificial-Analysis-Composite-Werte sind unabhängig. Die von DeepSeek gemeldeten Benchmarks verwenden eigene Harness-Einstellungen — behandeln Sie sie als Herstellerangaben und führen Sie Ihre eigenen Evaluierungen durch. Spezifikationen und Preise ändern sich; überprüfen Sie sie vor dem Erstellen.
TL;DR. V4 Flash ist das kosteneffiziente Geschwistermodell des riesigen DeepSeek V4 Pro: ein 284B/13B-aktives MoE mit 1M-Token-Kontext und bis zu 384K Ausgabe, optimiert für hohe Volumina, geringe Latenz und agentische Arbeit. Die offizielle Veröffentlichung am 31. Juli ist ein Post-Training-Upgrade – gleiche Größe, deutlich bessere Agents und Coding – und fügt außerdem native Responses-API- und Codex-Unterstützung hinzu. DeepSeek berichtet starke Agentik-/Coding-Werte (z. B. Terminal-Bench 2.1 82,7, Toolathlon 70,3), und es kostet etwa 0,15 $ / 0,29 $ pro Million Eingabe-/Ausgabe-Tokens, ungefähr ein Drittel des Preises von V4 Pro. Nur die Flash-API wurde aktualisiert; V4 Pro und die DeepSeek-App/Web sind unverändert. Auf OrcaRouter erhalten Sie es mit 0 % Aufschlag über einen OpenAI-kompatiblen Endpunkt.
Wichtige Erkenntnisse
• Offizielle Veröffentlichung (Build -0731, 31. Juli 2026): ein Post-Training-Upgrade der Vorschauversion — gleiche Architektur, viel stärkere Agenten, Programmierung und Tool-Nutzung.
• Architektur unverändert: 284B gesamt / 13B aktiv (MoE), 1M-Token-Kontext (1.048.576), bis zu 384K Ausgabe, reine Texteingabe, mit Reasoning, Tools und JSON.
• Neu: native Unterstützung für die Responses API plus spezifische Codex-Anpassung; unterstützt weiterhin OpenAI-ChatCompletions und Schnittstellen im Anthropic-Stil. Modell-ID code>deepseek-v4-flash/code>.
• Von DeepSeek gemeldete Agentic-/Coding-Fortschritte: Terminal-Bench 2.1 82,7, Toolathlon (verifiziert) 70,3, Cybergym 76,7, DeepSWE 54,4, NL2Repo 54,2, DSBench-FullStack 68,7.
• Sehr günstig: etwa 0,15 $ / 0,29 $ pro 1 Mio. Input-/Output-Tokens mit ~0,02 $ Cache-Reads (OrcaRouter, 0 % Aufschlag) — ungefähr ein Drittel von V4 Pro (0,44 $ / 0,88 $). Nur die Flash-API wurde geändert; Pro und App/Web sind gleich.
Was die offizielle Version tatsächlich verbessert hat
V4 Flash erschien erstmals am 24. April 2026 als Vorschau. Die offizielle Veröffentlichung vom 31. Juli 2026 (der code>-0731/code> Build, laut DeepSeeks API-Änderungsprotokoll) ist ausdrücklich keine neue Architektur: die Gesamt- und Aktivparameter (284B / 13B) und der 1M-Kontext bleiben unverändert. Was sich geändert hat, ist das Post-Training – ein zusätzliches Feintuning, das laut DeepSeek die zentralen Agenten-, Code- und Tool-Calling-Fähigkeiten erheblich verbessert hat. Zwei praktische Ergänzungen sind wichtig: V4 Flash unterstützt jetzt nativ die Responses API und ist speziell für Codex-artige Programmieragenten angepasst, während es weiterhin OpenAI-ChatCompletions- und Anthropic-artige Schnittstellen unterstützt. Wichtig ist, dass in diesem Release nur die Flash-API aktualisiert wurde; V4 Pro und die DeepSeek-App- und Web-Erlebnisse bleiben unverändert. Für Teams bedeutet das eine sofort einsetzbare Verbesserung für agentische Workloads zum gleichen Preis, ohne Migration.

Architektur: ein small-active MoE, entwickelt für hohen Durchsatz
V4 Flash ist ein Mixture-of-Experts-Modell mit insgesamt etwa 284 Milliarden Parametern, aber nur etwa 13 Milliarden aktiven Parametern pro Token. Genau diese geringe Anzahl aktiver Parameter ist der Punkt: Sie hält die Inferenz schnell und günstig, während ein großer Expert-Pool die Qualität bewahrt. Das Kontextfenster umfasst volle 1.048.576 Tokens (etwa 1M), mit einem sehr großen Maximum von 384K für die Ausgabe, und das Modell unterstützt Reasoning (erweitertes Denken), Tool-Aufrufe und strukturiertes JSON. Die Eingabe ist rein textbasiert. Das Designziel – hochvolumige, latenzarme, agentische Arbeit – zeigt sich in den Serving-Zahlen: eine p50-Zeit bis zum ersten Token von etwa 394 Millisekunden und eine Ausgabe von etwa 184 Tokens pro Sekunde laut OrcaRouter-Messungen.
Benchmarks: was die offiziellen Zahlen sagen
Die offizielle Veröffentlichung stützt sich stark auf agentische und Code-Evaluierungen, die mit DeepSeeks eigenem Harness durchgeführt wurden (Minimal-Modus / Max-Effort-Einstellungen). So lesen Sie die wichtigsten Ergebnisse, alle von DeepSeek gemeldet:
• Terminal-Bench 2.1: 82,7 — agentische Befehlszeilen-/Softwareaufgaben in einem echten Terminal. Ein hoher Wert hier signalisiert ein Modell, das tatsächlich Werkzeuge und Shells bedienen kann, nicht nur Fragen beantwortet.
• Toolathlon (verifiziert): 70.3 und Automation Bench (Public): 25.1 — Breite und Zuverlässigkeit der Werkzeugnutzung sowie End-to-End-Automatisierung. Die Zuverlässigkeit von Tool-Aufrufen ist das ausschlaggebende Merkmal für Agenten.
• Cybergym: 76.7 — Security-/CTF-artiges agentisches Problemlösen.
• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — Software-Engineering und Full-Stack-Programmierung, von der Repo-Ebene-Generierung bis zu anspruchsvollen Data-Science-Aufgaben. Die starke DSBench-FullStack-Leistung (68.7) deutet auf praktische, dateiübergreifende Programmierkompetenz hin.
• Agent Last Exam: 25.2 — eine absichtlich schwierige Prüfung für agentisches Denken, bei der selbst die besten Modelle niedrig abschneiden; als relatives Signal nützlich, nicht als absolutes.
Zur unabhängigen Einordnung: Artificial Analysis (bewertet am 25.06.2026, Preview-Build) stufte V4 Flash bei etwa 56,2 AA Coding, 40,3 AA Intelligence und 50,0 AA Math ein – ein auf Coding ausgerichteter Generalist oberhalb des Medians der offenen Modelle. Der offizielle Post-Training-Schub zielt direkt auf die Agentik-/Coding-Achse, daher dürfte sich der neuere Build bei genau diesen Aufgaben stärker anfühlen. Wie immer fallen die Zahlen aus Hersteller-Testumgebungen optimistisch aus; validieren Sie sie anhand Ihrer eigenen Arbeitslasten.
Preisgestaltung: die Zahl, die Budgets verändert
Bei OrcaRouter, das die Anbieterpreise mit 0 % Aufschlag weitergibt, kostet V4 Flash etwa 0,15 $ pro Million Eingabe-Tokens und 0,29 $ pro Million Ausgabe-Tokens, bei Cache-Lesevorgängen rund 0,02 $ – und DeepSeek hat die Preise in diesem Release niedrig gehalten (keine Erhöhung für das Upgrade). Das ist ungefähr ein Drittel der 0,44 $ / 0,88 $ von DeepSeek V4 Pro. Konkret: 10 Millionen Token pro Monat bei einer 70/30-Aufteilung (Eingabe/Ausgabe) schlagen bei V4 Flash mit ein paar Dollar zu Buche; skaliert man auf eine Milliarde Token, wird die Differenz zu einem Flaggschiff zu einem Posten, den die Finanzabteilung bemerkt. Prompt-Caching senkt die Kosten für Agenten und Chat mit stabilem System-Prompt weiter, da zwischengespeicherte Eingaben mit etwa einem Zehntel des Preises frischer Eingaben abgerechnet werden. Günstigere Agentenfähigkeiten zum gleichen niedrigen Preis sind das gesamte Verkaufsargument dieses Releases.
Wo V4 Flash passt: die DeepSeek V4-Leiter
Die V4-Reihe von DeepSeek ist eine Leiter. V4 Pro ist das Flaggschiff – ein viel größeres, erstklassiges Reasoning-und-Coding-Modell. V4 Flash ist die Effizienzstufe: deutlich weniger aktive Rechenleistung, ein Bruchteil des Preises und, nach diesem Post-Training-Upgrade, wirklich starke Agenten- und Coding-Fähigkeiten. Die Tatsache, dass DeepSeek darin investiert hat, Flash zu einem besseren Agenten (Responses API, Codex-Adaption, Benchmarks für die Tool-Nutzung) zu machen, zeigt dir, wo das Volumen laufen soll: alltäglicher Agenten- und Coding-Verkehr auf Flash, während die anspruchsvollsten Reasoning-Aufgaben für Pro reserviert bleiben. Das spiegelt das Muster der gesamten Branche wider – günstiger Standard plus Premium-Flaggschiff – und genau deshalb ist die Weiterleitung nach Schwierigkeit besser, als standardmäßig das größte Modell zu verwenden.

Drei reale Szenarien
1. Coding-Agenten und Codex-artige Workflows
Die native Responses-API- und Codex-Unterstützung des -0731-Builds sowie seine Terminal-Bench- (82,7) und DSBench-FullStack-Ergebnisse (68,7) machen V4 Flash zu einer starken, günstigen Engine für autonome Coding-Agenten — Fehlerbehebung, Refactoring, Testgenerierung, mehrstufige Tool-Nutzung.
2. Agenten mit umfangreicher Werkzeugnutzung
Schnelle erste Tokens (~394 ms), hoher Durchsatz (~184 tok/s), ein 1M-Kontext und eine hohe Zuverlässigkeit im Toolathlon (70.3) passen zu Produktionsagenten, die Tools in großem Umfang aufrufen — Retrieval, Automatisierung, Orchestrierung.
3. Verarbeitung langer Dokumente mit kleinem Budget
Der vollständige 1M-Token-Kontext und die 384K-Ausgabe verarbeiten das Zusammenfassen, Analysieren oder Transformieren sehr großer Eingaben – Logs, Codebasen, lange Berichte – in einem einzigen Durchgang, kostengünstig.
So greifen Sie auf V4 Flash zu
Sie können V4 Flash direkt über die DeepSeek-API aufrufen (Modell-ID code>deepseek-v4-flash/code>; es unterstützt die Responses-API, OpenAI ChatCompletions und Schnittstellen im Anthropic-Stil) oder über einen anbieterneutralen Endpunkt. a href="https://www.orcarouter.ai/">OrcaRouter/a> stellt V4 Flash ohne Aufschlag über einen einzigen OpenAI-kompatiblen Endpunkt (code>deepseek/deepseek-v4-flash/code>) neben 185+ weiteren Modellen bereit — so können Sie es an einem Ort mit GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen 3.8 und Kimi K3 vergleichen und jede Anfrage an das Modell weiterleiten, das für die jeweilige Aufgabe am günstigsten ist. Da es OpenAI-kompatibel ist, ist die Einführung von V4 Flash — oder der Wechsel weg davon — eine Konfigurationsänderung, keine Neuintegration.

Einschränkungen und ehrliche Vorbehalte
V4 Flash ist ein Effizienzmodell, kein Flaggschiff: Bei den schwierigsten Denkaufgaben bleibt es hinter V4 Pro und den besten westlichen Modellen zurück. Der Input ist rein textbasiert (keine native Bildeingabe). Die hier genannten Benchmark-Werte stammen von DeepSeek und wurden mit der eigenen Testumgebung erhoben. Behandeln Sie die genauen Zahlen daher nur als Richtwerte und rechnen Sie damit, dass unabhängige Bewertungen etwas niedriger ausfallen. Und „günstig pro Token“ ist nicht „günstig pro Aufgabe“, wenn Sie Reasoning- oder Agentenschleifen lange laufen lassen – begrenzen Sie bei einfachen Abfragen den Denkaufwand und die Anzahl der Tool-Iterationen. Validieren Sie die Leistung anhand Ihres eigenen Workloads, bevor Sie Produktionsverkehr umstellen.
FAQ
Was ist DeepSeek V4 Flash?
DeepSeeks Effizienzmodell in der V4-Linie: ein Mixture-of-Experts-Modell mit 284B / 13B aktiven Parametern, einem 1M-Token-Kontext und bis zu 384K Ausgabetoken, optimiert für schnelle, hochvolumige, agentische und Coding-Aufgaben. Die offizielle Veröffentlichung (Build -0731) erschien am 31. Juli 2026.
Was hat sich in der offiziellen Version geändert?
Die Architektur ist unverändert; es handelt sich um ein Post-Training-Upgrade, das die agentischen, Programmier- und Tool-Calling-Fähigkeiten deutlich verbessert und native Responses-API-Unterstützung mit Codex-Anpassung hinzufügt. Nur die Flash-API wurde aktualisiert — V4 Pro und die App/Web sind dieselben.
Wie viel kostet V4 Flash?
Etwa $0.15 pro Million Input-Tokens und $0.29 pro Million Output-Tokens auf OrcaRouter (0% Aufschlag), mit ~$0.02 Cache-Lesezugriffen – rund ein Drittel der $0.44 / $0.88 von V4 Pro. Die Preise blieben in diesem Release niedrig.
Wie gut ist V4 Flash bei Agenten- und Programmieraufgaben?
DeepSeek berichtet starke Ergebnisse: Terminal-Bench 2.1 82.7, Toolathlon (verifiziert) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 – alles Werte aus den Hersteller-Harnesses, also prüfen Sie es anhand Ihrer eigenen Aufgaben.
Wie schneidet V4 Flash im Vergleich zu V4 Pro ab?
Pro ist das deutlich größere Flaggschiff für die schwierigsten Reasoning- und Coding-Aufgaben; Flash ist die Effizienzstufe für etwa ein Drittel des Preises mit starken Agenten- und Coding-Fähigkeiten. Leiten Sie schwierige Aufgaben an Pro weiter, alles Weitere an Flash.
Was ist das Kontextfenster?
Volle 1.048.576 Token (etwa 1M), mit bis zu 384K Ausgabe-Token.
Ist V4 Flash multimodal?
Nein — die Eingabe ist reiner Text. Es unterstützt Reasoning, Tool-Aufrufe und JSON-Ausgabe.
Funktioniert V4 Flash mit der Responses API und Codex?
Ja — das Release -0731 fügt native Unterstützung für die Responses-API und spezifische Codex-Anpassung hinzu, zusammen mit OpenAI-ChatCompletions- und Anthropic-artigen Schnittstellen.
Wie verwende ich V4 Flash?
Direkt über die DeepSeek-API oder über den OpenAI-kompatiblen Endpunkt von OrcaRouter mit 0% Aufschlag (code>deepseek/deepseek-v4-flash/code>), wo Sie auch Modelle von Mitbewerbern vergleichen und über sie routen können.
Fazit
Die offizielle Veröffentlichung von DeepSeek V4 Flash behält das günstige, schnelle Rezept bei und macht es zu einem deutlich besseren Agenten: gleiche 284B / 13B-aktive MoE und 1M-Kontext, aber nachtrainiert für stärkeres Coding und Tool-Nutzung, mit nativer Responses-API- und Codex-Unterstützung — zum gleichen Preis von ca. 0,15 $ / 0,29 $. Es ist kein Flaggschiff und nicht multimodal, aber für die große Mehrheit agentischer, Coding- und Langdokument-Aufgaben ist es 2026 eine der besten Optionen mit dem besten Preis-Leistungs-Verhältnis pro Token. Probieren Sie es über einen OpenAI-kompatiblen Endpunkt ohne Aufschlag wie OrcaRouter aus und leiten Sie die schwierigste Minderheit der Anfragen an ein Flaggschiff weiter — diese Kombination ist preislich kaum zu schlagen.
