Eine Hero-Titelkarte für ‚DeepSeek V4.1 Flash vs DeepSeek V4 Flash‘ mit dem Untertitel ‚Gleiche Flash-Preiskarte. Ein neu trainiertes Modell.‘, Pill-Badges mit der Aufschrift ‚VERÖFFENTLICHT AM 10. SEPT. 2026‘ und ‚UPGRADE DER FLASH-STUFE‘ sowie dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

DeepSeek V4.1 Flash vs. DeepSeek V4 Flash: Gleiche Flash-Preisliste, ein neu trainiertes Modell

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die Woche, in der DeepSeek V4.1 Flash von einem bloß gemunkelten Nachfolger zum tatsächlich ausgelieferten Flash-Modell wurde, war kurz und lautstark. Am 8. September tauchte das Modell als zweitägiger API-Test unter der Modell-ID deepseek-v4.1-flash-expires-on-0910 auf – ein Build, den DeepSeek selbst als „Zwischenversion“ bezeichnete. Am 9. September kündigte seine offene Plattform an, dass die offizielle Veröffentlichung, DeepSeek V4.1 Flash, um den 10. September herum erscheinen werde und dass es DeepSeek V4 Pro bei Leistungsfähigkeit, Kosten, Geschwindigkeit und End-to-End-Zeit „umfassend übertrifft“. Am 10. September ging mit der Release-Ankündigung eine neue Tarifkarte für die Flash-Serie einher, die um 12:00 Uhr Pekinger Zeit in Kraft trat und die DeepSeek V4 Flash seit einer Preiserhöhung im August nicht mehr gesehen hat. Was auch immer sonst zutrifft: Das Text-Arbeitstier DeepSeek V4 Flash ist nicht länger der neueste Weg, einen Flash-Workload auszuführen – und dieser Artikel handelt davon, was sich dadurch tatsächlich für die App ändert, die Sie heute betreiben.

So früh angestellte Vergleiche sind einseitig, und es ist angebracht, das zu sagen, bevor die Zahlen beginnen. DeepSeek V4 Flash hat eine veröffentlichte Spec-Karte, einen Monat Produktionsverkehr hinter dem DeepSeek-V4-Flash-0731-Update, offene Gewichte und unabhängige Messungen von Artificial Analysis. DeepSeek V4.1 Flash hat eine offizielle Ankündigung, zwei Tage Community-Geschwindigkeitstests und noch keine veröffentlichte Karte, keinen technischen Bericht und keine Drittanbieter-Bewertung. Herstellerangaben werden unten als Herstellerangaben gekennzeichnet; Community-Zahlen werden als community-gemessen gekennzeichnet.

Der Flash-Tier wurde soeben zurückgesetzt — drei Änderungen, eine Woche

DeepSeek V4 Flash, das Mixture-of-Experts-Modell mit 284B Parametern und 13B aktiven Parametern, ist seit seiner Aktualisierung am 31. Juli die vernünftige, kostengünstige Standardwahl mit hohem Durchsatz für einen großen Teil des Produktionstextverkehrs. Drei Ankündigungen an drei Tagen haben den Boden unter ihm weggezogen:

• 8. September — DeepSeek stellte eine zeitlich begrenzte Beta von V4.1 Flash für alle API-Konten bereit, begrenzt auf 20 gleichzeitige Anfragen und mit geplantem Ablauf am 10. September, unter einem Modellnamen, der sein eigenes Ablaufdatum trug.

• 9. September — die offene Plattform kündigte die offizielle Veröffentlichung von DeepSeek V4.1 Flash für etwa den 10. September an, beschrieb eine neue Modellstruktur mit nativer Multimodal-Unterstützung und behauptete, dass sie DeepSeek V4 Pro bei Leistung, Kosten, Geschwindigkeit und Gesamtbearbeitungszeit übertrifft.

• 10. September — die offizielle Veröffentlichung bringt eine neue Preisliste für die Flash-Serie, gültig ab 12:00 Uhr Pekinger Zeit, und senkt die Raten, die DeepSeek V4 Flash seit einer Erhöhung am 17. August verlangt hat, die heftige Kritik von Entwicklern hervorrief.

Der letzte davon verdient eine eigene Erwähnung, denn es ist die seltene Preissenkung, die tatsächlich eine Preissenkung ist. Auf der neuen Liste sinkt der Off-Peak-Input mit Cache-Treffer von ¥0.05 auf ¥0.02 pro Million Tokens – eine Reduzierung um 60 % –, während der Cache-Fehler-Input von ¥1.5 auf ¥1 und der Output von ¥4.5 auf ¥4 sinkt. Die Preise zu Spitzenzeiten sind doppelt so hoch wie die Off-Peak-Werte. In runden US-Dollar-Beträgen sind das ungefähr $0.003 pro Million Input mit Cache-Treffer, $0.14 Input mit Cache-Fehler und $0.56 Output zu Off-Peak-Zeiten; zu Spitzenzeiten das Doppelte. Die 24-tägige Lücke zwischen der August-Erhöhung und dieser Senkung war kein Zufall der Terminplanung; die Preisneusetzung ist Teil des Starts von V4.1 Flash.

Gleiche Stufe, anderes Modell

Die einfache Lesart ist, dass V4.1 Flash ein V4 Flash mit aufgedrehtem Tempo-Regler ist. Das ist es nicht. Das 0731-Refresh war ein Post-Training-Update auf der bestehenden DeepSeek-V4-Flash-Basis – gleiche Architektur, gleiches 284B-Gesamt- / 13B-aktives Mixture-of-Experts-Layout. DeepSeeks Beschreibung von V4.1 Flash deutet auf etwas Größeres hin: eine neue Modellstruktur, die mehrere Medien als einen frischen Pre-Training-Lauf statt eines Fine-Tunings lesen. Diese Unterscheidung ist wichtig, denn ein neu trainiertes Modell erbt das Verhalten des alten Modells nicht so wie ein Refresh – Prompting, Tool-Aufrufe und Ausgabestil können sich alle verschieben, selbst wenn die Leistungsfähigkeit gleich bleibt.

• Architektur — DeepSeek V4.1 Flash: neue Modellstruktur, von DeepSeek als kompletter Neuaufbau mit nativem multimodalem Input beschrieben. DeepSeek V4 Flash: das Post-Training-Refresh V4-Flash-0731 eines MoE mit 284B gesamt / 13B aktiv.

• Eingabe — V4.1 Flash verarbeitet Text- und Bildeingaben nativ im Basismodell; DeepSeek V4 Flash unterstützt nur Text, und Bilder erfordern den separaten Zusatz-Build DeepSeek-V4-Flash-Vision-Exp.

• Kontext und Ausgabe — DeepSeek V4 Flash bietet 1M Kontext und 384K maximale Ausgabe; DeepSeeks Launch-Materialien besagen, dass V4.1 Flash das Kontextfenster im Millionen-Token-Maßstab beibehält, aber es wurde keine formelle Karte veröffentlicht.

• Nebenläufigkeit — DeepSeek V4 Flash nennt eine Obergrenze von 2.500 gleichzeitigen Verbindungen; die V4.1-Flash-Beta war auf 20 begrenzt, und DeepSeeks Behauptung einer „hohen Nebenläufigkeit“ für den Release-Build war zum Zeitpunkt der Erstellung noch nicht durch eine veröffentlichte Zahl gestützt.

• Gewichte — DeepSeek V4 Flash hat offene Gewichte unter einer MIT-Lizenz; für V4.1 Flash wurde nichts angekündigt.

• Unabhängige Bewertung — DeepSeek V4 Flash wurde von Artificial Analysis gemessen; DeepSeek V4.1 Flash hat noch keine Drittanbieter-Bewertung.

Der Punkt Text vs. multimodal verdient sogar in einem Textvergleich einen zusätzlichen Satz, denn er entscheidet, für wen V4.1 Flash gedacht ist. Wenn Ihre Pipeline für Text DeepSeek V4 Flash und für Bilder DeepSeek-V4-Flash-Vision-Exp verwendet hat, ist V4.1 Flash der erste DeepSeek-Build, der beide Pfade in einem Modell abdeckt – ein Endpunkt, der gewartet werden muss, kein Encoder, der seitlich angeflanscht ist.

A two-column comparison scoreboard titled 'DeepSeek V4.1 Flash vs DeepSeek V4 Flash — the scoreboard': left column DeepSeek V4.1 Flash — Architecture New pre-trained structure, Context window 1M expected (not published), Speed (output) ~280-500 tok/s (community), Multimodal input Native text + image, Price (off-peak, per 1M) Flash list from Sep 10, Open weights Not announced; right column DeepSeek V4 Flash — Architecture V4-Flash-0731, 284B/13B MoE, Context window 1M in / 384K out, Speed (output) ~120-140 tok/s (AA-measured), Multimodal input Text only; Vision-Exp bolt-on, Price (off-peak, per 1M) Flash list from Sep 10, Open weights MIT-licensed; footer 'V4.1 Flash figures vendor- and community-reported; DeepSeek V4 Flash per Artificial Analysis and DeepSeek API docs.'

Wo sie sich wirklich unterscheiden: Durchsatz und was eine abgeschlossene Aufgabe kostet

Bei identischen Preisen unterscheiden sich die beiden Modelle in der Geschwindigkeit, und genau hier werden die Zahlen am lautesten. Artificial Analysis misst DeepSeek V4 Flash 0731 mit etwa 120–140 Ausgabe-Token pro Sekunde auf DeepSeeks eigener API, abhängig von Konfiguration und Messfenster. Erste Tester von V4.1 Flash berichteten am ersten Tag von einer anhaltenden Generierung zwischen etwa 280 und 500 Token pro Sekunde, je nach Aufgabe, mit Spitzen über 500 in Szenarien mit geringer Parallelität; die höheren Werte stammen aus Community-Messungen, nicht vom Anbieter veröffentlicht, und Token pro Sekunde ist niemals eine intrinsische Eigenschaft eines Modells. Dennoch ist die Richtung in allen Berichten des ersten Tages konsistent, und DeepSeeks eigene Behauptung schnellerer Generierung und kürzerer Gesamtbearbeitungszeit weist in dieselbe Richtung.

Dieses Geschwindigkeitsgefälle verändert die Wirtschaftlichkeit, selbst wenn beide Modelle auf derselben Preisliste stehen, denn man zahlt pro Token und die Tokens kommen schneller an. Ein Job zum Abrufen langer Kontexte oder zur Codegenerierung, der auf V4 Flash eine Minute dauerte, kann auf V4.1 Flash bei demselben Preis pro Token in einem Bruchteil der Zeit abgeschlossen werden – mehrere Tester berichteten am ersten Tag von fünf- bis sechsmal schnelleren End-to-End-Laufzeiten genau bei diesen Aufgabenklassen. Die frühen Beschwerden der Beta, es „gebe Geld schneller aus“, waren die Kehrseite derselben Medaille: Bei unverändertem Preis pro Token entleert ein Modell, das zwei- bis dreimal so schnell Tokens ausgibt, ein Guthaben pro Minute schneller. Ob die Rechnung pro Aufgabe tatsächlich sinkt, hängt davon ab, ob das neue Modell mit weniger Tokens und weniger Wiederholungsversuchen auskommt – genau das kann noch niemand beweisen.

Auf der Preiskarte selbst stehen die beiden Modelle nebeneinander. Pro Million Tokens außerhalb der Spitzenzeiten laut Liste vom 10. September: ¥0,02 für Eingabe mit Cache-Treffer, ¥1 für Eingabe ohne Cache-Treffer und ¥4 für Ausgabe, in Spitzenzeiten das Doppelte — dieselbe Liste, die vor der Senkung für die Flash-Stufe galt: ¥0,05, ¥1,5 und ¥4,5. Bei einer cache-intensiven Arbeitslast ist die Senkung der Kernpunkt: ¥0,02 gegenüber ¥0,05 bedeutet eine Reduzierung um 60 % bei den Tokens, die den Großteil eines Eingabestroms für Autovervollständigung oder Agentenschleifen ausmachen. Bei einem frischen Ingest-Auftrag, der den Cache verfehlt, liegt die Ersparnis näher an einem Drittel. All das macht V4.1 Flash nicht pro Token günstiger als V4 Flash — sie teilen sich die Karte —, aber der höhere Durchsatz der Architektur ist das Unterscheidungsmerkmal, und er kostet nichts extra.

A screenshot of the DeepSeek API docs Models & Pricing page (captured September 8, 2026) showing the three public models — deepseek-v4-flash, deepseek-v4-pro and deepseek-v4-flash-vision-exp — with 1M context and 384K max output, off-peak/peak price columns (deepseek-v4-flash: $0.007 cache-hit input, $0.22 cache-miss input and $0.66 output off-peak, doubled at peak) and published concurrency limits.

Die Belege gelten für V4 Flash; die Ansprüche für V4.1 Flash.

Die wichtigste Benchmark-Tatsache über diesen Vergleich ist derzeit, dass es für das neue Modell keinen Benchmark gibt. DeepSeek V4.1 Flashs zentrale Behauptung – dass es DeepSeek V4 Pro in Bezug auf Leistungsfähigkeit, Kosten und Geschwindigkeit umfassend übertrifft – stammt vom Anbieter selbst und wurde nicht unabhängig reproduziert. Weder Parameteranzahl, noch Evaluierungstabelle, noch technischer Bericht wurden veröffentlicht, und Artificial Analysis hatte es zum Zeitpunkt des Schreibens nicht gemessen. Angesichts einer Modellfamilie, deren letzter Flaggschiff-Start unabhängiger Prüfung ausgesetzt war, ist „vertraut uns, es schlägt den Pro" eine Behauptung, die ein Leser auf Abstand halten sollte, bis ein Dritter sie überprüft hat.

DeepSeek V4 Flash hingegen hat eine echte, dokumentierte Erfolgsbilanz. Artificial Analysis zählt den 0731-Reasoning-Build zu den führenden Modellen seiner Klasse, bewertet ihn deutlich über dem Median vergleichbarer Open-Weight-Modelle und misst seinen Output-Durchsatz auf DeepSeek-eigener API in dem oben genannten Bereich von ~120–140 Token pro Sekunde. Das sind die Zahlen, an denen V4.1 Flash gemessen wird, wenn seine eigene Bewertung vorliegt, und sie setzen die Messlatte höher, als das Etikett „schnelles, billiges Flash“ vermuten lässt. Das Modell, das der neue Build ersetzt, ist nicht schwach; es ist ein wirklich starkes Open-Weight-Arbeitstier. Genau das macht die Upgrade-Entscheidung real statt zeremoniell.

Routing übernimmt die Schwerstarbeit — in DeepSeek und für dich.

Der am wenigsten beachtete Teil dieses Launches ist, dass DeepSeek den Datenverkehr zwischen seinen eigenen Modellen umleitet. Die Ankündigung ist eindeutig: Sobald V4.1 Flash live ist und bis V4.1 Pro erscheint, wird jede API-Anfrage, die an deepseek-v4-pro gerichtet ist, von DeepSeek V4.1 Flash bedient und zum Flash-Tarif abgerechnet. V4-Pro-Nutzer erhalten die neue Architektur und einen Bruchteil der Kosten pro Token, ohne eine Zeile Code zu ändern. Beachten Sie, was nicht umgeleitet wird: deepseek-v4-flash-Aufrufe. Das alte Flash-Modell bedient weiterhin jeden, der weiterhin darauf zeigt – genau deshalb gibt es diesen Vergleich: Wenn Sie V4 Pro nutzen, erfolgt der Wechsel automatisch für Sie, und wenn Sie V4 Flash nutzen, müssen Sie die Entscheidung selbst treffen.

Ein Anbieter, der stillschweigend entscheidet, dass ein günstigeres Modell die Aufrufe bedienen soll, die für sein Premium-Modell bestimmt sind, ist eine eindrucksvolle Bestätigung von V4.1 Flash — und es ist auch dieselbe Logik, die eine Routing-Ebene anbieterübergreifend anwendet. Das ist die Lücke, die eine Plattform wie OrcaRouter füllt: eine API für über 200 Modelle, wobei die Listenpreise der Anbieter ohne Aufschlag durchgereicht werden, sodass die Preissenkung von DeepSeek für Flash vom 10. September bei uns am selben Tag live ist.DeepSeek V4 Flash auf OrcaRouter bleibt mit demselben Schlüssel aufrufbar wie jedes andere Modell, das Sie betreiben, was den sicheren Weg, ein gerade veröffentlichtes Modell zu übernehmen, wirklich günstig macht: Richten Sie einen Teil des Datenverkehrs auf DeepSeek V4.1 Flash über die eigene API von DeepSeek aus, behalten Sie DeepSeek V4 Flash als automatisches Fallback in derselben Routing-Regel, und lassen Sie das Failover die Randfälle abfangen, während die neue Architektur ihren Wert unter Beweis stellt.

DeepSeek V4.1 Flash vs DeepSeek V4 Flash: welches sollten Sie aufrufen?

Wenn die ehrliche Antwort für alle lautete, dass beide Modelle für jeden infrage kommen, gäbe es keinen Artikel. Die beiden passen nun zu unterschiedlichen Risikoprofilen, und die Trennung ist ungewöhnlich sauber.

A two-panel decision infographic titled 'DeepSeek V4.1 Flash vs DeepSeek V4 Flash — which should you call?': left panel 'Move to DeepSeek V4.1 Flash' with bullets Starting a new Flash workload today / Latency- or throughput-bound tasks / Needs native image input in one model / Comfortable with day-one risk; right panel 'Stay on DeepSeek V4 Flash' with bullets Serving production at high concurrency / Relies on open weights / self-hosting / Prompts and evals tuned to V4-Flash-0731 / Wants published limits and track record; footer 'No independent benchmark for V4.1 Flash yet — keep V4 Flash as the fallback.'

Wechseln Sie zu DeepSeek V4.1 Flash, wenn Sie heute eine neue Flash-Workload starten, wenn Latenz und Durchsatz die maßgebliche Einschränkung sind, wenn Sie Bildeingabe ohne Wartung eines zweiten Modells wünschen, oder wenn Sie DeepSeeks eigenes Routing das Risiko des Pro-Stufen-Anspruchs abnehmen lassen möchten. Das Modell ist über DeepSeeks eigene API unter dem Namen deepseek-v4.1-flash verfügbar, wird auf derselben Flash-Preiskarte abgerechnet wie das Modell, das es ersetzt, und alle Signale vom ersten Tag deuten darauf hin, dass es deutlich schneller ist.

Bleiben Sie bei DeepSeek V4 Flash, wenn Sie Produktionsverkehr an der veröffentlichten Obergrenze von 2.500 gleichzeitigen Verbindungen bedienen, wenn Sie für Self-Hosting oder Compliance auf seine offenen Gewichte angewiesen sind, oder wenn Ihre Prompts, Auswertungen und Tool-Calling-Logik auf das 0731-Verhalten abgestimmt wurden und die Eigenheiten eines neu trainierten Modells nicht ab dem ersten Tag verkraften können. Ein frischer Pre-Training-Lauf ist eine Verhaltensänderung, nicht nur eine Geschwindigkeitsänderung, und der 0731-Build ist die Version mit dem Monat der Nachweise.

Für die meisten Teams ist der vertretbare Standard der Mittelweg: DeepSeek V4.1 Flash als Standard für neue Workloads verwenden, DeepSeek V4 Flash als Failover für den Workload beibehalten, der die Rechnungen zahlt, und die erste unabhängige Bewertung – plus ein veröffentlichtes Spezifikationsblatt und eine Nebenläufigkeitszahl – den Streit beilegen lassen, den keine zweitägige Beta beilegen kann. Die Flash-Stufe hat gerade eine neue Engine bekommen; die alte Engine ist nicht veraltet, sie ist der Maßstab.

Neugierig, wie Pro-Traffic aussieht, während DeepSeek ihn zu V4.1 Flash zu Flash-Preisen weiterleitet? DeepSeek V4 Pro auf OrcaRouter — beides auf einem Key, abgerechnet zu DeepSeeks Listenpreis.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert