
DeepSeek V4.1 Flash vs. DeepSeek V4 Pro: Gleicher Anbieter, unterschiedliche Generationen
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Das Interessante daran, DeepSeek V4.1 Flash gegen DeepSeek V4 Pro zu stellen, ist, dass das neuere Modell nicht das größere ist. DeepSeek V4 Pro ist ein Mixture-of-Experts-Modell mit 1,6 Billionen Parametern und 49 Milliarden aktiven Parametern, und es wird weiterhin angeboten. DeepSeek V4.1 Flash ist ein MoE mit 552 Milliarden Parametern und 8 Milliarden aktiven Parametern bei der Eingabe sowie 16 Milliarden aktiven Parametern bei der Ausgabe, und es ist das Modell, das DeepSeek gebaut hat, um es zu ersetzen. Beide stehen auf der Preisliste desselben Anbieters, beide unterstützen eine Million Token Kontext, und beide werden unter MIT veröffentlicht. Die Wahl zwischen ihnen ist keine Frage der Größe. Es ist eine Frage, für welche Architektur Sie bezahlen möchten, und die Antwort änderte sich am 10. September 2026.
Was sich tatsächlich unterscheidet, Seite an Seite
• Parameter — V4.1 Flash 552B insgesamt / 8B aktiv bei der Eingabe und 16B bei der Ausgabe vs. V4 Pro 1,6T insgesamt / 49B aktiv. V4 Pro hat etwa dreimal so viele Gesamtparameter und sechsmal so viele aktive Parameter auf der Eingabeseite.
• Architektur — V4.1 Flash ist ein Causal Encoder-Decoder, eine neue Basisarchitektur im Vergleich zum früheren Design von V4 Pro. Das ist der wesentliche Unterschied zwischen den beiden und der Grund, warum die „.1“ kein Point-Release ist.
• Preis pro 1 Mio. Token — V4.1 Flash 0,15 $ Input / 0,60 $ Output außerhalb der Stoßzeiten vs. V4 Pro 0,66 $ Input / 1,98 $ Output, auf den Listings von OrcaRouter.
• Zwischengespeicherte Eingabe — V4.1 Flash 0,003 $ pro 1 Mio. vs. V4 Pro 0,024 $ pro 1 Mio.
• KV-Cache pro Token — V4.1 Flash 890 Bytes gegenüber dem größeren Speicherbedarf von V4 Pro. Bei einer Million Tokens Kontext ist dies der Posten, der entscheidet, ob ein langes Agent-Transkript resident bleibt.
• Kontext und Ausgabe — 1M Kontext und 384K maximale Ausgabe bei beiden. Level.
• Beobachtete Latenz bis zum ersten Token – V4.1 Flash 2,63 s p50 vs. V4 Pro 3,58 s p50, laut OrcaRouters 7-Tage-Telemetrie, mit p95 bei 10,00 s für V4 Pro.
• Eingabemodalitäten — V4.1 Flash verarbeitet Text und Bilder, im Vergleich zu V4 Pro, das nur Texteingabe und Textausgabe unterstützt, bei denselben Listings. Das neuere Modell ist das breitere der beiden bei der Eingabe sowie das kostengünstigere.
Lies die Liste ohne das Anbieter-Framing, und das Muster ist ungewöhnlich. Der Nachfolger ist in jeder Zeile günstiger, schneller bis zum ersten Token, breiter bei der Eingabe und in jeder Zeile kleiner. So sieht eine echte Architekturänderung aus, wenn sie umgesetzt wird, und deshalb hat „Welches ist besser“ hier eine kurze Antwort und eine längere darunter.

Die V4-Pro-Zeitleiste, denn sie ist für alle wichtig, die noch mit V4 Pro arbeiten.
DeepSeek V4 Pro war zur Stilllegung vorgesehen. Die API sollte am 14. September 2026 um 12:00 Uhr Pekinger Zeit abgeschaltet werden, wobei der Datenverkehr zu V4.1 Flash umgeleitet werden sollte. Dazu kam es nicht. Am 11. September machte der Anbieter die Entscheidung rückgängig und erklärte: „Aufgrund der Nutzernachfrage haben wir beschlossen, nach dem 14. September 2026 weiterhin API-Dienste für DeepSeek V4 Pro anzubieten, wobei die Abrechnungsmethode unverändert bleibt.“
Daraus folgen zwei Dinge, und beide verdienen Präzision, weil die Situation dazu verleitet, zu viel hineinzulesen.
Der erste Punkt ist, dass {{1}}V4 Pro{{/1}} nicht veraltet ist. Es ist ein unterstütztes Modell mit unverändertem Preis, und es ist dasjenige, auf das {{2}}DeepSeek{{/2}}s eigene Mitteilung vorhandenen {{1}}V4 Pro{{/1}}-Traffic leitet. Wenn Sie einen Produktionspfad haben, der darauf festgelegt ist, wurde nichts weggenommen.
Der zweite Punkt ist, dass DeepSeek V4.1 Pro nicht existiert. Die Abkündigung bezog sich darauf, dass V4-Pro-Traffic von V4.1 Flash bedient wird, „bis V4.1-Pro startet“, was zu einigem Maß an Spekulation über ein größeres Geschwistermodell geführt hat. Stand 22. September 2026 gibt es keine V4.1 Pro API, keine Modellkarte, keine Gewichte und keine Ankündigung. Ein Bericht vom 21. September 2026 deutete auf ein 2-Billionen-Parameter-Modell hin, das Mitte bis Ende Oktober erwartet wird, was eine Einzelquellen-Behauptung über ein nicht angekündigtes Produkt ist und als solche behandelt werden sollte. Wer Kapazität für einen Start von V4.1 Pro plant, plant auf Basis eines Gerüchts.
Welche man nun tatsächlich aufrufen sollte
Der Migrationsfall ist eindeutig, und es ist derjenige, den DeepSeek selbst vollzogen hat, indem es den V4-Pro-Traffic auf das neue Modell umleitete. Nach den obigen Zahlen ist V4.1 Flash günstiger, schneller beim ersten Token und schneller im Dauerbetrieb, mit einem kleineren KV-Cache pro Token. Wenn Ihre Workload eine V4-Pro-Workload ist, die nicht etwas tut, das nur 49B aktive Parameter leisten können, ist das neuere Modell das bessere Instrument in Bezug auf Kosten und Latenz, und es gibt keinen Trade-off abzuwägen.
Das Argument dafür, bei V4 Pro zu bleiben, dreht sich darum, was eine deutlich größere Zahl aktiver Parameter bei anspruchsvollem Reasoning und langfristiger agentischer Arbeit bringt, und dieses Argument muss man mit eigenen Evaluationen belegen statt mit einem Datenblatt. Der Grund dafür ist, dass die beiden Modelle nicht auf einem gemeinsamen öffentlichen Board so verglichen werden, dass sie isoliert gegenübergestellt würden: DeepSeek V4.1 Flash erscheint im Agents on Rails Sweep vom 21. September 2026 mit 17 % bei maximalem Aufwand, während V4 Pro nicht auf diesem Board vertreten ist. Es gibt keine direkte Vergleichszahl, auf die man zeigen könnte. Was es gibt, ist ein plausibles Argument aus der Architektur – sechsmal so viele aktive Parameter sind eine Menge Kapazität, die man aufgibt – und es ist ein Argument, keine Messung.
Zwei praktische Hinweise für alle, die Traffic zwischen ihnen verlagern. Erstens gilt der Stoßzeiten-Plan für beide Modelle, ein Kostenvergleich zur falschen Tageszeit liegt daher um den Faktor zwei daneben; Stoßzeiten sind 01:00–04:00 und 06:00–10:00 UTC an Wochentagen, Wochenenden liegen vollständig außerhalb der Stoßzeiten. Zweitens teilen sich die beiden Modelle ein Kontextfenster und eine Obergrenze für die Ausgabe, sodass eine Migration Ihr Prompt-Budget nicht verändert — was den Wechsel auf der Anwendungsseite ungewöhnlich risikoarm macht.
Beide über einen einzigen Endpunkt laufen lassen
Die Situation, in der man wirklich beides möchte, ist die Übergangsphase, und sie ist häufiger, als es klingt: ein Team, das auf V4.1 Flash umsteigen möchte, aber eine Pipeline hat, deren Verhalten auf der neuen Architektur noch nicht verifiziert ist. Die beiden parallel über getrennte Anbieter laufen zu lassen, bedeutet zwei Verträge und zwei Sätze Schlüssel für etwas, das auf Modellebene ein einziger Anbieter ist.
Beide sind bei OrcaRouter unter einem einzigen Schlüssel verfügbar, wodurch sich das auf eine Routing-Entscheidung reduziert. OrcaRouter gibt die Listenpreise der Anbieter mit 0 % Aufschlag weiter, daher sind die oben genannten Zahlen DeepSeeks eigene Tarife und nicht unsere, und DeepSeeks Peak-/Off-Peak-Zeitplan gilt genau so, wie DeepSeek ihn definiert – einschließlich einer Preisänderung mitten im Übergang, die auf unserer Seite am selben Tag live ist. Du kannst einen Bruchteil des Traffics an das neue Modell senden und die Ausgaben vergleichen oder nach Aufgabentyp routen und automatisches Failover hinter den neuen Pfad legen, sodass die Anfrage, falls V4.1 Flash bei deinen Daten etwas Unerwartetes tut, auf V4 Pro landet statt auf einer Fehlerseite.
Da der Anbieter seine Meinung bereits einmal dazu geändert hat, welches dieser Modelle wegfallen wird, ist es die Option, beide über eine einzige Integration erreichbar zu halten, bei der Sie die nächste Kehrtwende nicht vorhersehen müssen.

Was zu sehen
• Ob sich der Preis oder der Ruhestandsstatus von V4 Pro erneut ändert. Die Umkehr im September war eindeutig, dass die Abrechnung unverändert bleibt, und das ist die Zusage, an der der Anbieter festgehalten werden muss.
• Ob V4.1 Pro Realität wird. Solange es keine Modellkarte oder eine Veröffentlichung der Gewichte gibt, ist die Geschichte mit den 2T-Parametern ein Gerücht mit nur einer Quelle.
• Eine unabhängige Evaluierung, die beide Modelle auf demselben Board laufen lässt. Solange es keine gibt, besteht der ehrliche Vergleich zwischen diesen beiden aus Kosten, Latenz und Architektur, die messbar sind, plus einer begründeten Vermutung über die Leistungsfähigkeit, die nicht messbar ist.
Bis der dritte davon eintrifft, lautet die zutreffende Zusammenfassung: DeepSeek V4.1 Flash ist der günstigere, schnellere Nachfolger von DeepSeek V4 Pro, V4 Pro wird weiterhin zu unverändertem Preis unterstützt, und die Frage, ob die neuere Architektur bei der Leistungsfähigkeit Abstriche macht, beantwortet derzeit kein öffentlicher Benchmark.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
