
DeepSeek V4.1 Flash Preisgestaltung: Die vollständige Preisliste und die Cache-Hit-Zahl, die über Ihre Rechnung entscheidet
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 177 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1323 tok/s
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
DeepSeek V4.1 Flash ist seit dem 10.09.2026 allgemein verfügbar, und die heute veröffentlichte Preisliste ist das Günstigste im obersten Segment des Modellmarkts: 0,15 $ pro Million Input-Tokens, 0,60 $ pro Million Output und 0,003 $ pro Million bei Cache-Treffern. Diese drei Zahlen sind die Off-Peak-Spalte. Während der Peak-Zeitfenster von DeepSeek an Wochentagen verdoppelt sich jede einzelne davon, Cache-Treffer eingeschlossen. Der entscheidende Vergleich ist nicht der mit DeepSeeks eigenem alternden Flaggschiff – DeepSeek-V4-Pro-0813 ist mit 0,66 $ / 1,98 $ pro Million zu Off-Peak-Preisen gelistet, sodass Flash sein eigenes Schwestermodell beim Input um etwa das Vierfache unterbietet –, sondern der mit der geschlossenen Frontier-Klasse, gegen die Käufer tatsächlich kalkulieren: GPT-5.6 Sol, Claude Opus 5 und Gemini 3.8 Flash, die jeweils eine Größenordnung mehr pro Token verlangen.
Eine Korrektur vor den Zahlen, weil das Leck, das dieser Markteinführung vorausging, noch immer die Runde macht. Die Zahlen, die vor der GA verbreitet wurden, beschrieben eine Preissenkung, die „morgen“ in Kraft treten sollte. Die Preise sind echt; das Framing war es nicht. V4.1 Flash wurde am 2026-09-10 veröffentlicht, wobei diese Tarife bereits in Kraft waren, und DeepSeeks eigener Changelog verzeichnet die Senkung als Teil der Veröffentlichung und nicht als spätere Kürzung. Alles Folgende ist von DeepSeeks aktueller Preisseite heute, dem 2026-09-16, abgelesen.
Die vollständige Preisliste, Stand 2026-09-16
DeepSeek veröffentlicht eine Tabelle mit den aktuellen SKUs, wobei jeder Einzelposten in eine Peak- und eine Off-Peak-Spalte aufgeteilt ist. Für die Modell-ID deepseek-flash, die DeepSeek-V4.1-Flash bedient, lauten die veröffentlichten Tarife:
• Eingabe, Cache-Miss — 0,15 $ pro 1 Mio. Token außerhalb der Spitzenzeiten; 0,30 $ pro 1 Mio. Token zu Spitzenzeiten
• Eingabe, Cache-Treffer — 0,003 $ pro 1 Mio. Tokens außerhalb der Spitzenzeiten; 0,006 $ pro 1 Mio. Tokens zu Spitzenzeiten
• Ausgabe — 0,60 $ pro 1 Mio. Tokens außerhalb der Spitzenzeiten; 1,20 $ pro 1 Mio. zu Spitzenzeiten
• Kontextfenster — 1M Token, mit einer maximalen Ausgabe von 384K
• Parallelitätslimit — 2.500 gleichzeitige Anfragen beim Flash-SKU
• Legacy-Modell-IDs — deepseek-v4-flash und deepseek-v4-flash-vision-exp sind als eigenständige Produkte eingestellt, werden aber weiterhin an V4.1 Flash weitergeleitet und zu Flash-Preisen abgerechnet
Der Abstand zwischen den ersten beiden Zeilen ist die ganze Aussage dieses Sheets. Ein Cache-Hit kostet außerhalb der Spitzenzeiten 50-mal weniger als ein Cache-Miss – ein Rabatt von 98 %, den Artificial Analysis in seinem Kostenmodell ebenfalls so abbildet. Nichts anderes auf der Karte bewegt eine Rechnung so stark.


Peak ist kein Rundungsfehler, und es ist auf Peking getimt.
DeepSeeks Spitzenzeitfenster sind Montag bis Freitag, 01:00–04:00 UTC und 06:00–10:00 UTC. Alles außerhalb davon – einschließlich aller Wochenendstunden – wird zum halben Tarif abgerechnet. Die Verdopplung gilt für alle drei Posten, sodass ein Cache-Miss in der Spitzenzeit $0.30 kostet und eine Ausgabe in der Spitzenzeit $1.20.
Wo diese Zeitfenster liegen, hängt ganz davon ab, wo Sie sich befinden. In Peking sind sie 09:00–12:00 und 14:00–18:00 Uhr – zwei Arbeitsblöcke, und genau darum geht es. In Berlin ist im September das zweite Zeitfenster 08:00–12:00 CEST: Der gesamte Morgen eines europäischen Teams liegt im Peak. In New York ist dasselbe Zeitfenster 02:00–06:00 EDT. Ein in den USA ansässiges Team mit normalen Arbeitszeiten wird praktisch nie zum Peak-Tarif abgerechnet, und ein EU-Team zahlt jeden Morgen vor dem Mittagessen das Doppelte. Wenn Sie auswählen, wann ein Batch-Job ausgeführt wird, ist das eine Entscheidung im Wert von 0,15 $ pro Million Tokens – und sie zu treffen kostet nichts.
Was Cache-Hit-Pricing tatsächlich mit einer Agent-Rechnung macht
Cache-Treffer sind bei DeepSeek automatisch – die Dokumentation besagt, dass Disk-Caching für alle Nutzer standardmäßig aktiviert ist, ohne Codeänderung – der Rabatt ist also nichts, wofür du eine Architektur entwerfen musst. Das ist außerdem Best-Effort, nicht garantiert: DeepSeek gibt an, dass es keine feste TTL gibt, ein ungenutzter Cache wird „gewöhnlich innerhalb von ein paar Stunden bis ein paar Tagen“ geleert, und das System verspricht keine 100 % Trefferrate. Es lohnt sich, die prompt_cache_hit_tokens- und prompt_cache_miss_tokens-Felder der Antwort zu lesen, bevor du irgendetwas darauf aufbaust.
Die Arithmetik zählt mehr als das Adjektiv. Nehmen Sie einen Coding-Agenten mit einem stabilen Präfix von 40.000 Tokens – System-Prompt, Tool-Schemas, Repo-Kontext –, der in einer Sitzung mit 60 Turns läuft, wobei jeder Turn etwa 2.000 Tokens Tool-Ausgabe anhängt und das Modell etwa 1.200 Tokens ausgibt. Der Gesamt-Input über die Sitzung beträgt 5,94 Mio. Tokens und der Gesamt-Output 72.000 Tokens.
Ohne jegliches Caching abgerechnet, außerhalb der Spitzenzeiten: 5,94 Mio. Input zu 0,15 $ sind 0,891 $, plus 72.000 Output zu 0,60 $ sind 0,043 $ — etwa 0,93 $ für die Sitzung.
Mit gecachtem Präfix abgerechnet, was standardmäßig tatsächlich passiert: 5,782 Mio. dieser Input-Tokens kommen als Cache-Treffer zu $0.003 ($0.017) an, 158.000 kommen als Cache-Fehlschläge zu $0.15 ($0.024) an, und dieselben 72.000 Output-Tokens kosten $0.043. Etwa $0.084 — rund 11-mal günstiger. Der Input-Anteil an der Rechnung sinkt von 95 % auf 49 %, allein der gecachte Anteil beträgt 21 %, und die Output-Tokens werden zum größten Einzelposten. Gleiches Modell, gleiche Sitzung, gleiche Ausgabe — das Einzige, was sich geändert hat, ist, ob das Präfix wiederverwendet wurde.
Beachten Sie, was nicht auf DeepSeeks Preisliste steht: eine Position für Cache-Schreibvorgänge. Anthropic berechnet das 1,25-Fache des Basis-Inputs, um einen 5-Minuten-Cache zu befüllen, und das 2-Fache für eine Stunde; DeepSeeks Karte listet nur Hit und Miss auf, und der Caching-Leitfaden nennt keine Schreib- oder Speichergebühr. Wenn Sie die Caching-Ökonomie über Anbieter hinweg vergleichen statt nur die beworbenen Tokenpreise, ist dieses Fehlen mehr wert, als der 50-fache Hit-Rabatt vermuten lässt.
Das ist auch der Grund, warum das Detail zur Preisweitergabe bei DeepSeek V4.1 Flash auf OrcaRouter hier eine Rolle spielt. Wir rechnen zum eigenen Listenpreis des Anbieters ohne Aufschlag ab, sodass eine Preisänderung eines Anbieters bei uns noch am selben Tag live ist, statt auf einen Repricing-Durchlauf zu warten – und die Spalten für Cache-Hits und Peak/Off-Peak, die Sie oben sehen, sind genau die, nach denen Sie tatsächlich abgerechnet werden, nicht eine gemittelte Näherung davon.

Gegenüber DeepSeek-V4-Pro-0813: eine 4-fache Lücke und eine Stilllegung, die nicht stattfand
Der naheliegende interne Vergleich ist das Flaggschiff-SKU, und er fällt weniger dramatisch aus, als der Schlagzeilen-Tarif vermuten lässt. DeepSeek-V4-Pro-0813, die Modell-ID deepseek-v4-pro, wird mit $0,66 pro 1M Input bei einem Cache-Miss und $1,98 pro 1M Output außerhalb der Spitzenzeiten gelistet; zu Spitzenzeiten verdoppelt sich das auf $1,32 und $3,96. Seine Cache-Hits kosten außerhalb der Spitzenzeiten $0,022 – mehr als das 7-Fache von Flash.
• Cache-Miss-Eingabe — 0,15 $ vs. 0,66 $ außerhalb der Stoßzeiten, Flash ist also 4,4-mal günstiger
• Ausgabe — 0,60 $ vs. 1,98 $ außerhalb der Stoßzeiten, damit ist Flash 3,3-mal günstiger
• Cache-Hit-Eingabe — $0,003 vs. $0,022 außerhalb der Stoßzeit, Flash ist also 7,3-mal günstiger
• Kontext- und Ausgabegrenze — identisch bei 1M und 384K bei beiden SKUs
• Nebenläufigkeit — 2.500 bei Flash gegenüber 500 bei V4 Pro, ein 5-facher Unterschied, der in der Preisliste vollkommen verschwindet
Drei Dinge an diesem Vergleich kann man leicht falsch verstehen. Erstens: Das Wiederverwendungsargument ist beim Flaggschiff in absoluten Zahlen stärker, obwohl Flash den größeren Multiplikator trägt: Das Zwischenspeichern einer Million Tokens spart 0,638 $ bei V4 Pro und 0,147 $ bei Flash, weil die Miss-Rate des Flaggschiffs von vornherein viel höher ist. Zweitens: Das Modell, von dem alle annahmen, es sei verschwunden, ist es nicht: DeepSeek kündigte an, V4 Pro ab dem 2026-09-14 nicht mehr zu bedienen und diese Anfragen an Flash weiterzuleiten, handelte sich einen Entwickler-Aufschrei ein, weil ein Backend-Modell unter laufenden Produktions-Workflows ausgetauscht wurde, und nahm die Entscheidung am 2026-09-11 zurück. V4 Pro wird weiterhin bedient, zu unveränderten Abrechnungskonditionen. Drittens, und das ist die Falle, in die die Leak-Berichterstattung getappt ist — es gibt kein veröffentlichtes V4.1 Pro. DeepSeek-V4-Pro-0813 bleibt die Flaggschiff-SKU, und der Anbieter hat keinen Nachfolger unter diesem Namen auf den Markt gebracht. Wer eine Migration auf „V4.1 Pro“ kalkuliert, kalkuliert ein Modell, das es nicht gibt.
Im Vergleich zur geschlossenen Frontier-Stufe
Im Vergleich zu den geschlossenen Modellen, die Käufer tatsächlich in die engere Wahl ziehen, ist der Multiplikator die Schlagzeile. Alle unten aufgeführten Zahlen stammen von der heute veröffentlichten Preisseite des jeweiligen Anbieters.
• GPT-5.6 Sol — Listenpreis: 5,00 $ pro 1 Mio. Input und 30,00 $ pro 1 Mio. Output in OpenAIs Kurzkontext-Tarif; derzeit gilt ein Aktionspreis von 4,00 $ / 20,00 $, der laut OpenAI mindestens bis zum 21.11.2026 verfügbar ist, bei gecachtem Input zu 0,40 $. Gegenüber dem Aktionspreis ist DeepSeek V4.1 Flash beim Input 26,7-mal günstiger und beim Output 33,3-mal; gegenüber dem Listenpreis sind es 33-mal bzw. 50-mal. Ein Cache-Treffer kostet bei Sol 133-mal so viel wie bei Flash.
• Claude Opus 5 — 5,00 $ pro 1 Mio. Input und 25,00 $ pro 1 Mio. Output, mit Cache-Treffern zu 0,50 $ pro 1 Mio. laut Anthropics veröffentlichtem Preisblatt. Das ist das 33-Fache von Flashs Input-Rate, das 42-Fache seiner Output-Rate und das 167-Fache seiner Cache-Treffer-Rate. Anthropics Schreibvorgänge für den 5-Minuten-Cache kommen mit weiteren 1,25x obendrauf; bei DeepSeek gibt es im Preisblatt keine entsprechende Position.
• Gemini 3.8 Flash — 0,75 $ pro 1 Mio. Eingabe und 3,75 $ pro 1 Mio. Ausgabe bis zum 31.12.2026, wobei sich beide Tarife zum 01.01.2027 verdoppeln sollen, zwischengespeicherte Eingabe zu 0,075 $, und — das ist die Zeile, die auf einer echten Rechnung wiederkehrt — Cache-Speicher zu 0,50 $ pro 1 Mio. Tokens pro Stunde. Flash ist dagegen 5-mal günstiger bei der Eingabe, 6,25-mal bei der Ausgabe und 25-mal bei Cache-Treffern, und DeepSeek berechnet nichts für das Vorhalten eines Caches.
Der Kontext der Leistungsfähigkeit sorgt dafür, dass das hier ehrlich bleibt. Auf dem Intelligence Index v4.3 von Artificial Analysis erreicht DeepSeek V4.1 Flash (Reasoning, max. Aufwand) 40 Punkte und belegt Rang 6 von 113 Modellen, bei 0,27 $ pro Index-Aufgabe und 214,4 Ausgabe-Tokens pro Sekunde. Das ist eine tatsächlich frontier-nahe Platzierung zu einem Preis, der 26-mal niedriger ist als der der Leistungsklasse, mit der es verglichen wird – doch dieselbe Messung zeigt, dass es eines der ausführlichsten Modelle ist, die AA getestet hat, und über den Index-Durchlauf 250 Mio. Ausgabe-Tokens erzeugt, gegenüber einem Median von 140 Mio. Ausführlichkeit ändert nichts am Preis pro Token, aber sehr wohl an der Rechnung. Ein Modell, das 62 % mehr Tokens als der Median ausgibt, kostet hier trotzdem weit weniger, aber „günstig pro Token“ und „günstig pro Aufgabe“ sind unterschiedliche Aussagen, und nur Letzteres ist das, was Sie bezahlen.
Gibt es eine kostenlose Version?
Nein. Die eigene Preisseite von DeepSeek dokumentiert keine kostenlose API-Stufe, kein kostenloses monatliches Kontingent und kein kostenloses Modell – die Abrechnung erfolgt nutzungsabhängig gegen ein aufgeladenes oder gewährtes Guthaben, wobei gewährtes Guthaben zuerst verbraucht wird. Die Consumer-Chat-App ist kostenlos; die API hinter deepseek-flash ist es nicht, und es gibt keinen kostenlosen Endpunkt dafür auf DeepSeeks Plattform. Mehrere Drittanbieter-Gateways bewerben kostenlosen oder Testzugang zu diesem Modell, und wir würden sie alle als Prototyping-Oberflächen statt als Produktions-Backends behandeln, weil sich diese Bedingungen ohne Vorankündigung ändern und keines von ihnen die eigene Preisliste des Anbieters enthält.
Die Effizienzbehauptungen hinter dem Preis
Der Preis ist keine Subvention, zumindest nicht nach DeepSeeks eigener Darstellung. Model Card und technischer Bericht des Anbieters beschreiben V4.1 Flash als Mixture-of-Experts mit 552 Mrd. Parametern in einem kausalen Encoder-Decoder-Layout, das pro Token während des Prefill etwa 8 Mrd. Parameter aktiviert und während des Decode 16 Mrd. – konstruktionsbedingt asymmetrisch, günstig zu lesen und teurer zu schreiben. Was den Speicher betrifft, meldet DeepSeek einen globalen KV-Cache von etwa 890 Bytes pro Token, rund ein Viertel desjenigen von DeepSeek-V4-Flash, sowie unter identischen Workloads einen persistenten Cache-Footprint von etwa einem Achtel davon, erreicht dadurch, dass der Sliding-Window-Zustand verworfen und bei einem Treffer die letzten 128 Token erneut abgespielt werden. Dies sind vom Anbieter gemeldete Messwerte auf der eigenen Hardware des Anbieters, und der technische Bericht erhebt für den Replay-Pfad keinen Anspruch auf mathematische Äquivalenz zur vollständigen Berechnung.
Die Parameteranzahl ist die einzige Zahl in diesem Release, die wirklich ungeklärt ist, und es lohnt sich, genau zu benennen, warum. DeepSeeks Prosa nennt 552B, und das ist das Backbone – der Teil, der die eigentliche Rechenarbeit leistet. Daneben steht Engram, eine Lookup-Tabelle für bedingtes Gedächtnis, die die Model Card mit 196B Parametern beziffert und die per Token-Lookup statt durch Berechnung angesprochen wird. Addiert man beide, landet man bei ungefähr 748B – die Zahl, für die eine viel gelesene Community-Analyse auf r/LocalLLaMA innerhalb von Stunden nach Veröffentlichung der Gewichte argumentierte und die das Dateipanel des Hugging-Face-Repositories sogar noch höher treibt, in Richtung 763B. Berichte aus der Community zum Deployment beziffern den Checkpoint auf etwa 510 GB über 48 Shards, nativ quantisiert ausgeliefert als FP8-dichte Gewichte mit FP4-Experten. Betrachten Sie die Gesamtsumme als umstritten und die Backbone-Zahl als vom Anbieter angegeben. Die Anzahl der aktiven Parameter bestimmt die Geschwindigkeit; die residenten Gewichte entscheiden, ob das Modell überhaupt startet.
Self-Hosting ist zu diesem Preis eine echte Alternative – unter MIT-Lizenz.
Die Gewichte sind unter deepseek-ai/DeepSeek-V4.1-Flash verfügbar, unter der MIT-Lizenz, die kommerzielle Nutzung, Änderung und Weitergabe erlaubt. Dadurch wird die API-Preisliste zu einer Option statt zu einer Gebühr: Bei MIT hindert nichts in der Lizenz daran, dieses Modell selbst zu hosten und für Rechenleistung statt für Tokens zu bezahlen.
Billig wird die Umsetzung dadurch nicht. Der Checkpoint umfasst grob 510 GB residente Gewichte, bevor Cache und Aktivierungen hinzukommen, DeepSeek gibt im gesamten Repository keine GPU-Anforderung an, und Community-Berichte zur Bereitstellung setzen die praktische Untergrenze bei einem Multi-GPU-Knoten statt bei einer Workstation an. Drei Serving-Stacks lieferten am 10. September 2026 Day-0-Unterstützung — vLLM, SGLang mit Miles und Cambricons vLLM-basierte NeuWare-Adaption für die eigenen Beschleuniger —, doch am Veröffentlichungstag lieferten vLLM und SGLang dedizierte Preview-Images statt offizieller Pakete, und llama.cpp hatte die Unterstützung für die V4.1-Architektur noch nicht integriert. Selbsthosting auf Consumer-Hardware ist heute nicht die Alternative zum API-Preis; ein gemieteter 8-GPU-Knoten ist es. Wenn Ihr Volumen groß genug ist, um das zu amortisieren, erlaubt Ihnen die Lizenz das; wenn nicht, sind 0,15 US-Dollar pro Million Tokens die günstigere Antwort, und das nicht knapp.
Was die Preisliste tatsächlich von Ihnen zu entscheiden verlangt
Drei Dinge, geordnet danach, wie viel Geld sie bewegen. Halte ein stabiles Prompt-Präfix ein und lass den Cache seine Arbeit tun — er ist automatisch, er ist ein 50-facher Rabatt, und bei einer Agent-Schleife mit 60 Runden verwandelt er eine Sitzung von 0,93 $ in eine von 0,084 $. Betreibe deinen Batch-Verkehr an Wochentagen außerhalb von 01:00–04:00 und 06:00–10:00 UTC, was für ein US-Team ein No-op ist und für ein europäisches Team bedeutet, den morgendlichen Job auf den Nachmittag zu verschieben. Und wenn du das gegen das eigene Flaggschiff von DeepSeek kalkulierst, denk daran: Das Flaggschiff ist noch im Angebot — die geplante Stilllegung wurde am 2026-09-11 abgesagt, beide SKUs liegen hinter einem Schlüssel, und der Wechsel zwischen ihnen ist eine Änderung der Modell-ID statt einer Migration.
Was die Preisliste nicht verrät, ist, ob das Modell für Ihre Arbeitslast gut genug ist, und die Zahlen dafür sind neuer und dünner als das Preisblatt. Die Platzierung im Artificial Analysis Index ist eine einzelne Messung bei maximalem Reasoning-Aufwand, die Anbieter-Benchmark-Zeilen sind vom Anbieter gemeldet, und die Parameteranzahl ist umstritten. Der Preis ist der geklärte Teil dieser Veröffentlichung. Kalkulieren Sie Ihre Migration darauf, und testen Sie die Leistungsfähigkeit, bevor Sie sich darauf festlegen.
In diesem Artikel verglichen4
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
