
DeepSeek V4 Flash Vision (Exp) vs DeepSeek V4 Flash: Gleicher Preis, einer sieht
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianNEUQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenNEUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokNEUSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenz77Coding
DeepSeek V4 Flash Vision (Exp) und DeepSeek V4 Flash sind dasselbe Modell mit genau einem Unterschied, und dieser Unterschied ist die ganze Geschichte: Das Vision-Modell sieht Bilder, das Textmodell nicht. DeepSeek V4 Flash Vision (Exp) wurde heute, am 21. August 2026, als experimentelle Version veröffentlicht und übernimmt das Textgehirn von DeepSeek V4 Flash unverändert — denselben 1M-Token-Kontext, dieselbe maximale Ausgabe von 384K, dieselben Token-Preise — und fügt Bildeingabe hinzu, die seine Ergebnisse bei den Agent-Benchmarks neu ordnet, bei denen das Textmodell stillschweigend versagt. Die einzige echte Frage ist, ob „experimental" dich mehr kostet, als es einspart.
Die beiden Modelle
DeepSeek V4 Flash ist das offizielle Budget-Arbeitspferd des Unternehmens: ein Mixture-of-Experts-Modell mit insgesamt rund 284 Milliarden Parametern und 13 Milliarden aktiven Parametern, rein textbasiert, optimiert für alltägliche Arbeitslasten mit hoher Parallelität, mit einem Parallelitätsbudget von 2.500 Token pro Sekunde auf der API des Anbieters. DeepSeek V4 Flash Vision (Exp) gehört zur gleichen Gewichts-Familie mit einem vorgeschalteten Vision-Encoder, wird identisch abgerechnet und ist als experimentell gekennzeichnet. Alles unterhalb der Augen ist identisch.
• Parameter — Vision-Exp: 284B gesamt / 13B aktives MoE vs. V4-Flash: 284B gesamt / 13B aktives MoE (gleiche Familie)
• Eingabe — Vision-Exp: Text + Bilder (JPEG, PNG, GIF, WebP) vs. V4-Flash: nur Text
• Kontext — Vision-Exp: 1M Tokens vs. V4-Flash: 1M Tokens
• Maximale Ausgabe — Vision-Exp: 384K Tokens vs. V4-Flash: 384K Tokens
• Denkmodi — beide unterstützen Denken und Nicht-Denken
• API-Formate — beide: Chat Completions, Messages, Responses
• Preis — identisch (beide rechnen zu den Spitzen-/Nebenzeiten-Tokenraten von V4-Flash ab)
• Status — Vision-Exp: experimentell, kein GA-Termin vs. V4-Flash: offizielle Veröffentlichung (V4-Flash-0731)

Wo Vision die Ergebnisse verändert
Bei reinem Text sagt DeepSeek, dass die beiden gleichauf sind, und es gibt keinen Grund, daran zu zweifeln – das Vision-Modell basiert auf derselben Textfähigkeit. Der Unterschied zeigt sich bei Agent-Benchmarks, die Screenshots, Diagramme und UI-Bilder enthalten, bei denen das reine Textmodell die multimodalen Inhalte buchstäblich ignoriert. Alle folgenden Zahlen stammen aus dem heutigen Launch-Hinweis des Anbieters und wurden nicht unabhängig reproduziert:
• ApexBench Pass@1 — Vision-Exp 36.5 gegenüber V4-Flash 26.2
• Agents' Last Exam — Vision-Exp 27.3 gegen V4-Flash 25.2
• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7
NL2Repo — Vision-Exp 57.7 vs. V4-Flash 54.2
• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4
• Chartography — Vision-Exp 64.3 (V4-Flash kann es nicht versuchen)
• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash kann nicht versucht werden)

Der größte einzelne Sprung ist ApexBench, wo das Hinzufügen von Vision die Punktzahl von 26,2 auf 36,5 anhebt – ein Ausschlag von zehn Punkten, der nicht darauf zurückzuführen ist, dass das Modell härter denkt, sondern dass es die Aufgabe endlich liest. Für einen Agenten, der über einen Bildschirm arbeitet – einen Browser, einen Desktop, ein Terminal mit gerenderter Ausgabe – war das Textmodell genau bei den Teilen der Aufgabe blind, die die Informationen enthalten.
Die Preisfrage hat eine Antwort.
Es gibt keinen Preisunterschied, und genau hier wird der Vergleich in eine Richtung zum No-Brainer. DeepSeek V4 Flash Vision (Exp) wird zu genau denselben Tarifen abgerechnet wie DeepSeek V4 Flash, die seit dem 16. August 2026 Peak/Off-Peak betragen:
Input, Cache-Miss — 0,22 $ pro 1 M Token außerhalb der Spitzenzeiten, 0,44 $ zu Spitzenzeiten (beide Modelle)
• Eingabe, Cache-Treffer — 0,007 $ pro 1M Tokens außerhalb der Spitzenzeiten, 0,014 $ zur Spitzenzeit (beide Modelle)
• Output — $0,66 pro 1M Token außerhalb der Spitzenzeiten, $1,32 zu Spitzenzeiten (beide Modelle)
• Spitzenzeiten — 01:00–04:00 und 06:00–10:00 UTC, beide Modelle
Die einzigen zusätzlichen Kosten, die Vision mit sich bringt, ist das Bild selbst: Jedes Bild wird mit bis zu 384 Tokens tokenisiert, sodass ein Screenshot außerhalb der Spitzenzeiten ungefähr 0,0085 Cent kostet. Selbst ein vision-lastiger Agent, der 50 Bilder pro Durchlauf liest, kommt auf unter einen Cent Eingabe. Sich für das Textmodell zu entscheiden, um Geld zu sparen, heißt, Pfennige über Augenlicht zu stellen — die Ersparnis ist nicht real.
Wann welches wählen?
Wählen Sie DeepSeek V4 Flash Vision (Exp), wenn Ihre Pipeline jemals ein Bild erhalten kann. UI-Tests und screenshotbasierte QA-Agenten, Web-Browsing-Agenten, die die Seite lesen müssen, auf der sie sich befinden, Diagramm- und Schaubild-Extraktion, Dokument-Screenshots, Erfassung von Fehlermeldungen vom Bildschirm eines Benutzers – in all diesen Fällen ist das Vision-Modell das eindeutig bessere Modell zum gleichen Preis. Laut Anbieter gibt es keine Einbußen bei der Textqualität, der einzige Grund, es nicht zu verwenden, ist also die Stabilität.
Wählen Sie DeepSeek V4 Flash, wenn Ihr Traffic ausschließlich aus Text besteht und sich daran nichts ändern wird. Bei Code-Vervollständigung, Retrieval und reinen Text-Agent-Schleifen schneiden beide Modelle bei Text gleich ab, und die offizielle Version ist per Definition die sicherere Wahl. Wenn Sie bereits V4-Flash nutzen und nie ein Bild senden, gibt es keinen Grund zu wechseln — und auch keinen Grund, die Option nicht in Ihrer Routing-Konfiguration zu haben.
Der einzige wirkliche Unterschied: experimenteller Status
Alles oberhalb der Augen ist identisch; die Kosten für Vision sind vernachlässigbar; die Benchmarks sprechen für das Vision-Modell. Der einzige Faktor, der Sie in der Produktion legitimerweise bei DeepSeek V4 Flash halten kann, ist, dass das Vision-Modell experimentell ist. DeepSeek kennzeichnet es entsprechend, nennt kein GA-Datum und sagt, dass es nicht für den Produktionseinsatz empfohlen wird. Das Text-Gehirn dahinter ist bewährt, aber der Vision-Pfad ist neu, und eine experimentelle API-Oberfläche ist genau der Ort, an dem man um 2 Uhr morgens keinen stillen Ausfall haben möchte.
Dies ist die eine Stelle, an der der Vergleich nicht durch Spezifikationen entschieden wird, und zugleich die eine Stelle, an der ein Router die Antwort verändert. Auf OrcaRouter sind beide Modelle live — deepseek/deepseek-v4-flash-vision-exp und deepseek/deepseek-v4-flash — hinter einem einzigen API-Schlüssel zum Listenpreis des Anbieters, ohne jeden Aufschlag durchgereicht. Da dieselbe Plattform beide Modelle routet, können Sie das Vision-Modell dort einsetzen, wo es sich bezahlt macht, und den Rest an das offizielle Release binden — mit automatischem Failover, sodass ein experimenteller Aussetzer niemals die gesamte Pipeline lahmlegt. Sie erhalten den Zehn-Punkte-Zugewinn bei ApexBench für die Aufrufe, die ihn brauchen, und die Stabilität des offiziellen Releases für die Aufrufe, die das nicht brauchen, ohne zweiten Vertrag und ohne zweiten Codepfad.

Fazit
Wenn Ihre Workload Bilder empfangen kann, übertrifft DeepSeek V4 Flash Vision (Exp) DeepSeek V4 Flash in jeder relevanten Hinsicht und verliert nur in der einen Hinsicht, die Sie umgehen können: dem experimentellen Status. Wenn Ihre Workload reiner Text ist, sind die Modelle bei der Ausgabe gleichwertig, und das offizielle Release gewinnt bei der Stabilität. Die beiden sind keine echten Konkurrenten — das Vision-Modell ist das Textmodell mit einer freigeschalteten Fähigkeit, ohne Aufpreis. Die einzige Entscheidung, die sich lohnt, ist, wie viel Ihres Traffics Sie auf eine experimentelle API ausrichten möchten, und das ist eine Routing-Entscheidung, keine Modellentscheidung.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
