Ein Hero-Titelbild für DeepSeek-V4-Flash-Vision-Exp mit dem Untertitel „Gleicher Preis wie V4-Flash, jetzt mit Augen“, einem Liniensymbol aus Auge und Preisschild, einem kleinen abgerundeten Abzeichen mit der Aufschrift ‚EXPERIMENTAL • API • 2026-08-21‘ und dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

DeepSeek V4 Flash Vision (Exp) startet auf der API: gleicher Preis wie V4-Flash, jetzt mit Augen

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

DeepSeek V4 Flash Vision (Exp) ist heute, am 21. August 2026, auf der Deep​Seek-API-Plattform live gegangen, und die wichtigste Zahl in der Ankündigung ist kein Benchmark — es ist der Preis: Dieses experimentelle Vision-Modell wird zu exakt denselben Token-Raten abgerechnet wie DeepSeek V4 Flash, das reine Text-Arbeitspferd, dessen reine-Text-Fähigkeiten es vollständig erreicht. Damit ist es das erste Mal, dass Deep​Seek's eigene API überhaupt Bilder akzeptiert, und es bedeutet, dass der günstigste Weg, einen Agenten mit 1M-Kontext zu betreiben, gerade kostenlos multimodal geworden ist.

Was tatsächlich ausgeliefert wurde

DeepSeek V4 Flash Vision (Exp) ist ein experimentelles multimodales Modell, auf das über die Modell-ID deepseek-v4-flash-vision-exp zugegriffen wird. Es nimmt Text und Bilder entgegen und erzeugt Textausgaben über ein Kontextfenster von 1M-Token mit einem maximalen Output von 384K, sowohl im Denk- als auch im Nicht-Denk-Modus. Es unterstützt das Chat-Completions-Format, Anthropic-Stil-Messages und das Responses-Format – das Trio, das ein Agent-Framework benötigt, um es ohne benutzerdefinierten Adapter anzubinden.

Bei Bildeingabe akzeptiert DeepSeek JPEG, PNG, GIF und WebP, die auf drei Arten übergeben werden können: als Inline-Base64, über eine externe URL oder als Datei, die über die neue Files API hochgeladen wird. Video- oder Audioeingabe gibt es noch nicht – die „Vision“ hier beschränkt sich auf Standbilder.

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

Deep​Seeks eigene Positionierung, in seinem Release-Hinweis: Die reine Textfähigkeit – Agenten, Reasoning, Weltwissen – ist auf dem Niveau der offiziellen DeepSeek V4 Flash Version, während die multimodale Agentenfähigkeit einen großen Sprung macht und nahe an Opus-4.8 herankommt. Das ist eine Herstellerangabe, nicht reproduziert, und es lohnt sich, sie genau zu lesen, denn das Benchmark-Detail dahinter ist interessanter als die Schlagzeile.

Warum der Benchmark-Sprung größer ist, als er aussieht

Alle folgenden Zahlen sind Deep​Seek-eigene, heute in der Launch-Notiz veröffentlichte und nicht unabhängig verifizierte Angaben. Bei den Agent-Benchmarks, die Screenshots und Bilder einbetten, liest das reine Textmodell DeepSeek V4 Flash sie nicht — es ignoriert einfach die multimodalen Teile der Aufgabe. DeepSeek V4 Flash Vision (Exp) schaut tatsächlich hin, weshalb die Unterschiede so groß sind:

• ApexBench Pass@1 — Vision-Exp 36,5 vs. V4-Flash 26,2 (Opus-4.8 39,4)

• Agents' Last Exam — Vision-Exp 27,3 vs. V4-Flash 25,2 (Opus-4.8 25,7)

• Terminal-Bench 2.1 — Vision-Exp 83.9 vs. V4-Flash 82.7 (Opus-4.8 85.0)

• NL2Repo — Vision-Exp 57,7 vs. V4-Flash 54,2 (Opus-4.8 69,7)

• DeepSWE — Vision-Exp 59.3 gegen V4-Flash 54.4 (Opus-4.8 58.0)

• Chartography — Vision-Exp 64.3 (Nur-Text-V4-Flash kann es nicht versuchen)

• ZeroBench Pass@5 — Vision-Exp 35.0 (das reine Textmodell V4-Flash kann es nicht versuchen)

A single-column scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp — the scoreboard' listing Context 1M tokens, Max output 384K tokens, Input text + images, Image billing up to 384 tokens each, ApexBench Pass@1 36.5, Status experimental — no GA date, with a footer reading 'All benchmark figures vendor-reported; no independent scores yet.'

Zwei dieser Zahlen verdienen einen zweiten Blick. Beim Agents' Last Exam liegt Vision-Exp (27,3) knapp vor Opus-4.8 (25,7), und bei DeepSWE schlägt es Opus-4.8 ebenfalls (59,3 zu 58,0). Darauf beruht das „nahe an Opus-4.8“ tatsächlich — nicht auf einem einzelnen Vorzeigeergebnis, sondern auf einer Reihe agentischer Benchmarks, bei denen das Sehen des Bildschirms den Großteil der Lücke zum führenden multimodalen Modell schließt, während es preislich um etwa eine Größenordnung darunterliegt.

Was ein Bild kostet, bis auf die Dezimalstelle

Bilder werden für die Abrechnung tokenisiert – bis zu 384 Token pro Bild – und dann zu denselben Preisen pro Token abgerechnet wie DeepSeek V4 Flash. Da Deep​Seek alle seine Modelle am 16. August 2026 auf Spitzen-/Nebenzeitenpreise umgestellt hat, hängen die genauen Zahlen davon ab, wann Sie aufrufen:

• Eingabe, Cache-Miss — 0,22 $ pro 1 Mio. Tokens außerhalb der Spitzenzeiten, 0,44 $ zur Spitzenzeit

• Eingabe, Cache-Treffer — 0,007 $ pro 1 Mio. Tokens außerhalb der Spitzenzeiten, 0,014 $ zu Spitzenzeiten

• Ausgabe — $0,66 pro 1M Tokens außerhalb der Spitzenzeiten, $1,32 zu Spitzenzeiten

• Spitzenzeiten — 01:00–04:00 und 06:00–10:00 UTC (alle anderen Stunden außerhalb der Spitzenzeiten)

Rechnet man nach, verschwinden die Kosten für Vision nahezu. Ein Bild mit seinem 384-Token-Limit kostet als Input außerhalb der Spitzenzeiten etwa 0,0085 Cent und zur Spitzenzeit 0,017 Cent. Ein Agent, der in einem einzigen Durchlauf 50 Screenshots liest, fügt etwa einen halben Cent an Input-Tokens hinzu – bevor das Modell überhaupt sein erstes Ausgabe-Token schreibt. Deep​Seek begrenzt die Auflösung ebenfalls vor der Inferenz: Die niedrige Detailstufe skaliert auf 512×512 um, und high/original skaliert das Bild vorab (kleine Bilder auf etwa 384×384 hoch, große auf etwa 800×800 herunter), sodass ein hochauflösendes Original dem Modell niemals in seiner nativen Pixelanzahl zugeführt wird.

Die Nebendarsteller: eine kostenlose Files API und Harness 0.1.1

Zwei Infrastrukturkomponenten wurden zusammen mit dem Modell ausgeliefert. Die Files API ist live und kostenlos: ein Bild einmal hochladen, es über die file_id referenzieren und über mehrere Anfragen hinweg wiederverwenden, ohne die Bytes erneut zu senden — wichtig für einen Browser-Agenten, der eine Seite über mehrere Turns im Kontext hält. Und Deep​Seek Harness 0.1.1, das am selben Tag veröffentlicht wurde, bietet sofort einsatzbereite Unterstützung für das neue Modell, sodass das Harness, das Deep​Seek-Agenten-Workloads benchmarkt und ausführt, das neue Modell sofort ansteuern kann.

Der Produktionsvorbehalt, klar ausgedrückt.

Dies ist ein experimentelles Modell. Deep​Seek kennzeichnet es ausdrücklich als solches, hat kein GA-Datum angekündigt und empfiehlt, es nicht direkt in der Produktion einzusetzen; der erklärte Plan ist, auf Feedback zu reagieren und später eine stabile Version zu veröffentlichen. Die praktische Konsequenz ist, dass das Text-Gehirn bewährt ist – es ist dieselbe Gewichtsfamilie, die auch V4-Flash antreibt – aber der Vision-Pfad ist neuer Code, und niemand außerhalb von Deep​Seek hat ihn im großen Maßstab unter Belastung getestet.

Das ist genau die Situation, in der sich eine Routing-Schicht bezahlt macht. Auf OrcaRouter sind sowohl deepseek/deepseek-v4-flash-vision-exp als auch deepseek/deepseek-v4-flash hinter einer einzigen API live, zum Listenpreis von Deep​Seek, ohne Aufschlag durchgereicht. Sie können bildbasierten Traffic auf das experimentelle Modell lenken und in derselben Konfiguration ein automatisches Failover auf einen Fallback einstellen, sobald ein Fehler auftritt oder ein Timeout eintritt – was das gesamte Problem des „neuen Codes“ entschärft. Die Routing-DSL ermöglicht es außerdem, nur die Aufrufe, die tatsächlich Bilder enthalten, an das Vision-Modell zu senden und reinen Text-Traffic auf DeepSeek V4 Flash zu belassen – so erzielt man die Benchmark-Gewinne dort, wo es sie gibt, und zahlt nichts extra, wo es keine gibt.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash-vision-exp showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text + Image', 'Output: text', p50 TTFT 275 ms, and the model description 'Experimental vision-enabled variant of DeepSeek V4 Flash: text + image in, text out'.

Was als Nächstes ansehen

Die offenen Fragen sind die üblichen für einen experimentellen Launch. Wann erreicht DeepSeek V4 Flash Vision (Exp) die GA, und bleibt der Preis bestehen? Folgt Video- oder Audioeingabe? Das Modell verarbeitet derzeit nur Standbilder, wodurch die großen multimodalen Grenzmodelle bei bewegten Medien unangefochten bleiben. Und reproduzieren die unabhängigen Auswertungen (der erste Drittanbieter-Lauf auf ApexBench oder Terminal-Bench) die veröffentlichten Zahlen? Das Interessante ist, dass selbst wenn alle Benchmarks nach unten abweichen, die eine Behauptung, die bereits kosteneffektiv ist — Vision zu Textpreisen — eine Preistatsache ist, keine Benchmark-Behauptung, und die muss nicht reproduziert werden.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube