
DeepSeek V4 Flash vs. V4 Pro: Die Effizienzklasse gegen das Flaggschiff, im Vergleich
- obsidianNEUQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 pro 1 Mio. Tokens · 24 tok/s
- qwenNEUQwen: Qwen3.8 27B (free)2026-08-1328 tok/s
- deepseekNEUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokNEUSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaNEUMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenNEUQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens · 2657 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenz77Coding
- grokxAI: Grok 4.52026-07-0856Intelligenz72Coding
- tencentTencent: Hy32026-07-0642Intelligenz59Coding
DeepSeeks V4-Linie ist eine Leiter mit zwei Sprossen: V4 Flash, das günstige, schnelle Effizienzmodell — jetzt in seiner offiziellen Version -0731 mit deutlich stärkeren Agents — und V4 Pro, das große Flaggschiff für die anspruchsvollsten Reasoning- und Coding-Aufgaben, das am 12. August 2026 zu seinem offiziellen GA-Build (0813) wechselte. Das Interessante daran ist, wie wenig sie bei praktischer Arbeit trennt und wie viel beim Preis. Dieser Leitfaden vergleicht die beiden hinsichtlich Leistungsfähigkeit, Kosten, Geschwindigkeit und Eignung, wobei jede Zahl mit einer Quelle gekennzeichnet ist.
Hinweis zur Genauigkeit: Die Agentic-/Coding-Ergebnisse von V4 Flash stammen von DeepSeek (offizielles Änderungsprotokoll, 31.07.2026, DeepSeek-Harness); die GA-Ergebnisse (0813) von V4 Pro wurden ebenfalls von DeepSeek auf demselben Harness gemeldet, und es wurde noch keine unabhängige Bewertung des 0813-Builds veröffentlicht. Die Preise gelten Stand 12. August 2026; die GA-Preissenkung wird auf OrcaRouter mit 0 % Aufschlag weitergegeben. Zahlen aus Hersteller-Harness fallen optimistisch aus – überprüfen Sie sie anhand Ihrer eigenen Aufgaben.
TL;DR. V4 Flash ist ein 284B/13B-aktives MoE für 0,08 $/0,18 $ pro Million Tokens; V4 Pro ist das weitaus größere Flaggschiff, jetzt im offiziellen GA-Build (0813) für 0,435 $/0,87 $ – etwa das Fünffache des Flash-Preises, gegenüber rund dem Vierzehnfachen vor der August-Preissenkung. Beim praktischen Coding liegt Flash nur wenige Punkte hinter Pro (z. B. SWE-bench Verified ~79 % vs. ~80,6 %, laut Aggregator-Meldungen), und das Post-Training-Upgrade -0731 macht Flash zu einem eigenständigen starken Agenten. Verwenden Sie Pro für das anspruchsvollste Reasoning und das anspruchsvollste Multi-File-Coding; verwenden Sie Flash für die volumenstarke Mehrheit – und routen Sie nach Schwierigkeitsgrad, um den Großteil der Pro-Qualität für etwa ein Fünftel der Kosten zu erhalten.
Wichtige Erkenntnisse
Größe und Preis: Flash ist 284B / 13B-aktiv bei 0,08 $ / 0,18 $; Pro ist das viel größere Flaggschiff bei 0,435 $ / 0,87 $ — Flash kostet etwa ein Fünftel, und die GA-Preissenkung von Pro hat die alte Lücke von ~14x auf etwa 5x verringert.
• Die Coding-Lücke ist klein: Aggregator SWE-bench Verified ~79 % (Flash) gegenüber ~80,6 % (Pro, Preview-Ära; der GA-Build hat noch keine unabhängigen Ergebnisse); auf DeepSeeks Harness erzielt GA Pro Terminal-Bench 2.1 87,9 gegenüber 82,7 von Flash.
• Beide teilen sich den 1M-Token-Kontext und die 384K-Ausgabe; beide sind rein textbasiert, mit Reasoning, Tools und JSON.
• Flash ist schneller und kostengünstiger bereitzustellen (p50 TTFT ~394 ms, ~184 tok/s); Pro tauscht Geschwindigkeit gegen Spitzenleistung.
• Best Practice: nach Schwierigkeit routen — Flash für die Masse, Pro für die schwierige Minderheit.
Was jedes Modell ist
V4 Flash ist die Effizienzstufe: ein Mixture-of-Experts-Modell mit insgesamt 284B, aber nur ~13B aktiven Parametern, einem 1M-Token-Kontext, bis zu 384K Ausgabe, optimiert für hohe Volumina, geringe Latenz und agentische Arbeit. Seine offizielle Version -0731 (31. Juli 2026) ist ein Post-Training-Upgrade, das Agenten, Programmierung und Tool-Nutzung verbesserte und native Unterstützung für die Responses-API und Codex hinzufügte. V4 Pro ist DeepSeeks Flaggschiff – ein viel größeres Modell, das für die schwierigsten Denk- und Codierungsaufgaben gebaut wurde, bei denen maximale Leistung wichtiger ist als Kosten. Es lief von April an als Vorschau und wechselte dann am 12. August 2026 mit einem deutlich niedrigeren Preis zu seinem offiziellen GA-Build. Beide gehören zur selben V4-Familie und teilen sich den 1M-Kontext, die reine Texteingabe und die Unterstützung für Reasoning, Tools und JSON.

Leistungsfähigkeit: Wie nah ist Flash an Pro?
Das ist näher, als es die Preisdifferenz vermuten lässt, zumindest bei praktischer Programmierarbeit. Aggregator-Auswertungen verorten V4 Flash (Max) bei etwa 79,0 % auf SWE-bench Verified — also beim Lösen realer GitHub-Issues — gegenüber etwa 80,6 % für V4 Pro, wie es in seiner Preview-Ära getestet wurde. Der GA-Build (0813) ist zu neu für unabhängige Bewertungen — es wurden noch keine veröffentlicht —, daher ist der beste verfügbare Pro-Vergleich die eigene Testumgebung von DeepSeek, wo der GA-Build Terminal-Bench 2.1 mit 87,9 und DeepSWE mit 62,7 erzielt, gegenüber den -0731-Werten von Flash (82,7 und 54,4) – alle von DeepSeek gemeldet. Wo Pro die Nase vorn hat, ist am anspruchsvollsten Ende: bei der komplexesten mehrstufigen Argumentation, den kniffligsten Multi-Datei-Programmieraufgaben und Aufgaben, bei denen ein größeres Budget an aktiven Parametern wirklich hilft. Wenn der Großteil Ihrer Arbeit „schwierig, aber nicht Frontier“ ist, deckt Flash das ab; reservieren Sie Pro für die wirklich an der Frontier tätige Minderheit.
Preis und Geschwindigkeit: Flash' entscheidender Vorteil
Hier gehen die beiden am stärksten auseinander — und hier hat sich die Mathematik gerade geändert. Flash kostet 0,08 $ / 0,18 $ pro Million Input-/Output-Tokens; der offizielle GA-Build (0813) von V4 Pro kostet 0,435 $ / 0,87 $ — etwa das Fünffache des Flash-Preises. Das ist immer noch ein echter Aufpreis, aber nur ein Bruchteil der ~14-fachen Lücke vor der Preissenkung: Das ältere deepseek-v4-pro-Listing stand bei 1,168 $ / 2,336 $, der GA-Build ist also rund 63 % günstiger. Bei einem Monat mit 10 Millionen Tokens und 70 % Input kostet Flash etwa 1,10 $ und Pro etwa 5,66 $ — das Verhältnis bleibt auch bei Milliarden von Tokens bestehen. Flash ist zudem auf Durchsatz ausgelegt (p50 TTFT ~394 ms, ~184 tok/s) und damit die bessere Wahl für latenzempfindliche, hochvolumige Agenten. Der Aufpreis von Pro erkauft Spitzenleistung, nicht Geschwindigkeit oder Ersparnis — aber da die Lücke nun bei ~5x statt ~14x liegt, ist der Preis für diese Spitzenreserve deutlich gesunken.
Das richtige Muster: nach Schwierigkeit ordnen
Sie müssen sich nicht für eines entscheiden. Das günstigste hochwertige Setup sendet den Großteil der einfach bis mittelschweren Anfragen an Flash und eskaliert nur die schwierigsten an Pro. Da beide aus derselben Familie stammen und denselben Kontext und dieselben Schnittstellen besitzen, ist dieses Routing nahtlos – und das -0731-Upgrade bedeutet, dass Flash jetzt mehr von der mittleren Stufe übernimmt, bevor Sie eskalieren müssen. Gut umgesetzt, liefert das Routing nach Schwierigkeit den Großteil der Qualität von Pro zu nahezu den Kosten von Flash, und die GA-Preissenkung macht die gelegentliche Pro-Eskalation deutlich günstiger als während der Vorschau.

Welche solltest du wählen?
Wählen Sie V4 Flash, wenn…
Sie führen hochvolumige agentische, Codierungs- oder Langdokument-Workloads aus, bei denen Kosten und Geschwindigkeit zählen, und Qualität auf „Near-Flagship“-Niveau ausreicht – was nach dem -0731-Upgrade ein weites Feld abdeckt.
Wählen Sie V4 Pro, wenn…
Sie benötigen maximale Leistungsfähigkeit für das anspruchsvollste Denken und die anspruchsvollste dateiübergreifende Programmierung, und Sie sind bereit, etwa das Fünffache des Flash-Preises für diese Leistungsreserve an der Spitze zu zahlen — was viel leichter zu verkraften ist als die ~14-fache Prämie, die die Preisgestaltung der Vorschau-Ära mit sich brachte.
Beide über einen Endpunkt nutzen.
Beide sind auf OrcaRouter mit 0 % Aufschlag über einen OpenAI-kompatiblen Endpunkt verfügbar – Flash als deepseek/deepseek-v4-flash-0731 und Pro als der offizielle deepseek/deepseek-v4-pro-0813 GA-Build – so kannst du das Routing nach Schwierigkeitsgrad als Konfigurationsoption umsetzen, beide anhand deiner eigenen Aufgaben benchmarken und den Datenverkehr umschalten, ohne neu zu integrieren. Das ist der einfachste Weg, die Einsparungen von Flash mitzunehmen und Pro für die schwierige Minderheit griffbereit zu halten.

FAQ
Ist V4 Flash so gut wie V4 Pro?
Bei praktischem Coding fast — Aggregator SWE-bench Verified ~79 % vs. ~80,6 % (Preview-Ära für Pro; der GA-Build hat noch keine unabhängigen Ergebnisse). Bei den schwierigsten Reasoning- und komplexesten Coding-Aufgaben führt Pro. Für die meisten Arbeitslasten reicht Flash nach dem -0731-Upgrade.
Wie viel günstiger ist V4 Flash?
Flash kostet etwa ein Fünftel des Preises von Pro: $0,08 / $0,18 pro Million Tokens gegenüber den $0,435 / $0,87 von GA Pro. Vor der Preissenkung von Pro im August betrug der Unterschied etwa das 14-Fache; jetzt ist er etwa das 5-Fache.
Teilen sie sich dasselbe Kontextfenster?
Ja – beide bieten einen 1M-Token-Kontext (1,048,576) und bis zu 384K Ausgabe.
Welches ist schneller?
Flash, von Haus aus — p50-Zeit bis zum ersten Token bei etwa 394 ms und ~184 Token/Sekunde, optimiert für hohe Volumina und geringe Latenz.
Kann ich beide zusammen verwenden?
Ja — routen Sie je nach Schwierigkeit über den einzelnen Endpunkt von OrcaRouter: Flash für das Volumen, Pro für die schwierigsten Aufgaben.
Fazit
V4 Flash vs. V4 Pro ist Effizienz versus Spitzenleistung. Flash bietet den Großteil der praktischen Programmierfähigkeit von Pro, dazu einen wirklich starken Agenten nach dem -0731-Upgrade, zu etwa einem Fünftel des Preises und mit höherer Geschwindigkeit; der offizielle GA-Build von Pro ist das Flaggschiff für die schwierigsten Aufgaben, und seine Preissenkung — auf $0,435 / $0,87, etwa das Fünffache von Flash statt des alten Vierzehnfachen — macht diese Spitzenklasse erschwinglicher als je zuvor. Der clevere Ansatz ist kein Entweder-oder — sondern ein Routing nach Schwierigkeitsgrad über einen einzigen Endpunkt wie OrcaRouter, sodass das Massenvolumen günstig auf Flash läuft und nur die schwierige Minderheit für Pro zahlt.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
