DeepSeek V4 Review: Die günstigsten ernsthaften 1M-Token-Modelle in der KI?

DeepSeek V4 Review: Die günstigsten ernsthaften 1M-Token-Modelle in der KI?

Autor

Fengya Tian

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

DeepSeek veröffentlichte die V4-Familie am 24. April 2026 – zwei Modelle, V4-Pro und V4-Flash, live auf der API und sofort Open-Source – und legte damit leise die neue Messlatte für die Kosten ernsthafter KI-Fähigkeiten fest. Beide Modelle haben standardmäßig ein Kontextfenster von 1 Mio. Token, bieten sowohl Denk- als auch Nicht-Denk-Modi, und das Flaggschiff V4-Pro kostet maximal 0,87 $ pro Million Output-Token: ein Preis, der jedes vergleichbare 1M-Kontextmodell auf dem Markt unterbietet, ob offen oder geschlossen.

Und der Juli ist der Entscheidungsmonat. In einem am 29. Juni datierten Schreiben bestätigte DeepSeek, dass die offizielle Version V4 Mitte Juli 2026 erscheint, mit Versprechungen von Feature- und Leistungsverbesserungen – und der Einführung von Spitzenzeiten-Preisen, die die Tarife während der Geschäftszeiten in Peking verdoppeln. Zehn Tage später, am 24. Juli, werden die Legacy-Modellnamen `deepseek-chat` und `deepseek-reasoner` endgültig eingestellt. Diese Übersicht behandelt, was V4 eigentlich ist, was es heute und nach der offiziellen Veröffentlichung kostet, wo es gewinnt, wo es eindeutig nicht gewinnt, und was vor den Fristen zu tun ist.

Kurzes Fazit

Ziehen Sie DeepSeek V4 in Betracht, wenn Sie…

- Führen Sie produktive Workloads mit hohem Volumen aus, bei denen die Stückkosten über die Wirtschaftlichkeit entscheiden – die Preisgestaltung von V4 ist eine Klasse für sich

- Benötigen Sie günstig langen Kontext: Standardmäßig 1M Token, bis zu 384K Ausgabe-Token pro Antwort, mit aggressiven Rabatten für Context-Caching.

- Nahtlose Integration gewünscht — die API spricht sowohl OpenAI ChatCompletions als auch Anthropic-Formate, sodass vorhandene Tools größtenteils einfach funktionieren.

- Wert legen auf offene Gewichte und Self-Hosting-Optionen, insbesondere das kleinere V4-Flash

Abwarten (oder woanders hin umleiten), wenn Sie…

- Führen Sie autonome Agenten mit langem Horizont aus — laut Z.ais veröffentlichter Cross-Model-Tabelle hinkt V4-Pro sowohl GLM-5.2 als auch der geschlossenen Front weit hinterher, und das bei Marathon-Benchmarks.

- Bild-Eingabe erforderlich: V4 ist nur Text

- Verlassen Sie sich rund um die Uhr auf Festpreise – ab der offiziellen Veröffentlichung Mitte Juli 2026 verdoppeln sich die Spitzenzeiten während der Geschäftszeiten in Peking (Nebenzeiten behalten die heutigen Preise).

Was ist DeepSeek V4?

V4 ist DeepSeek's Modellfamilie der vierten Generation, die als zwei Mixture-of-Experts-Modelle ausgeliefert wird. DeepSeek-V4-Pro ist das Flaggschiff: 1,6 Billionen Parameter insgesamt, mit 49 Milliarden aktiven pro Token. DeepSeek-V4-Flash ist die Effizienzstufe: 284 Milliarden insgesamt, 13 Milliarden aktiv. Beide verwenden standardmäßig ein 1M-Token-Kontextfenster über DeepSeek's offizielle Dienste hinweg, und beide bieten zwei Modi – Denken für schwierige Probleme, Nicht-Denken für Geschwindigkeit – unter den Modell-IDs deepseek-v4-pro und `deepseek-v4-flash`.

Zwei Positionierungsdetails sind wichtig. Erstens wurde V4 als eine Vorschau veröffentlicht, die DeepSeek als produktionstauglich betrachtet – und laut der Mitteilung des Unternehmens vom 29. Juni die offizielle Version erscheint Mitte Juli 2026 mit "Funktionsoptimierungen und Leistungsverbesserungen." Zweitens wurde es als Open-Source veröffentlicht, was DeepSeeks Muster fortsetzt, Gewichte öffentlich freizugeben – was Self-Hosting und Feinabstimmung realistisch möglich macht, insbesondere für den 284B Flash mehr als für den 1.6T Pro.

Was ist neu in DeepSeek V4?

Ein 1M-Token-Kontext als Standard, kein Upsell.Jeder offizielle DeepSeek-Dienst läuft jetzt standardmäßig mit dem vollen Million-Token-Fenster — keine separate Long-Context-SKU, kein Premium-Tarif.

Enorme Ausgabereserven.Beide Modelle unterstützen bis zu 384K Ausgabe-Token pro Antwort – das Dreifache dessen, was die meisten Konkurrenten mit 1M Kontext erlauben – was für die Code-Generierung ganzer Dateien, lange strukturierte Extraktionen und das Schreiben von Berichten wichtig ist.

Doppelte Modi auf einem Endpunkt. Denkmodus für schwierige Probleme, Nicht-Denken für günstige schnelle Aufrufe, umschaltbar pro Anfrage statt pro Modell.

Zwei Stufen mit einer API-Form.Pro für Leistungsfähigkeit, Flash für Volumen — gleicher Kontext, gleiche Modi, gleiche Integration.

Duale API-Kompatibilität. V4 spricht sowohl OpenAI ChatCompletions als auch Anthropic API-Formate nativ, sodass die meisten bestehenden Agent-Tools ohne Umschreibung verbunden werden können.

Preise: Was es tatsächlich kostet

Dies ist der Abschnitt, der V4 berühmt macht. V4-Pro kostet $0,435 pro Million Eingabe-Token und $0,87 pro Million Ausgabe-Token. V4-Flash kostet $0,14 und $0,28.Cache-Treffer bei wiederholtem Kontext werden mit deutlich unter einem Cent pro Million Token angegeben — effektiv kostenlos für Agentenschleifen, die denselben Projektstatus erneut einlesen.

Zur Orientierung: GLM-5.2, selbst als das Preis-Leistungs-Wunder des Sommers gefeiert, listet $1,40 / $4,40. Claude Sonnet 5 listet $3 / $15, Claude Opus 4.8 $5 / $25. Der Ausgabepreis von V4-Pro beträgt ein Fünftel von GLM-5.2 und etwa 3 % von Opus 4.8. Selbst wenn V4-Pro einige direkte Qualitätsvergleiche verliert – und das tut es –, ändern die wirtschaftlichen Faktoren die Frage, welche Fragen man einem Modell überhaupt stellen sollte.

Mit der offiziellen Veröffentlichung kommt eine Änderung.Laut DeepSeeks Mitteilung vom 29. Juni verdoppeln sich ab Mitte Juli alle Token-Preise während der Spitzenzeiten – 09:00–12:00 und 14:00–18:00 Uhr Pekinger Zeit – während die Preise außerhalb der Spitzenzeiten auf dem heutigen Niveau bleiben. Selbst verdoppelt liegt V4-Pros Spitzenausgabepreis (etwa 1,74 $ pro Million) immer noch unter GLM-5.2s Standardpreis, aber die Ära der Festpreise endet mit der Vorschau: Wenn Ihr Verkehr während der chinesischen Geschäftszeiten Spitzenwerte erreicht, modellieren Sie den Ausschlag – oder planen und leiten Sie ihn um.

Bewertungspunktzahl

Die nachfolgenden Bewertungen sind unsere redaktionelle Einschätzung auf Grundlage der offiziellen Dokumentation von DeepSeek und der veröffentlichten Cross-Model-Benchmark-Tabelle von Z.ai – behandeln Sie die vendorübergreifenden Zahlen als kontextuelle Drittanbieterinformationen und nicht als eigene Behauptungen von DeepSeek.

- Programmieren: 8/10 — fähig für alltägliche Softwareentwicklung; nicht der Open-Weight-Leader

Agentic / Werkzeugnutzung: 7/10 — solide Werkzeugorchestrierung, schwach bei marathonlanger Autonomie.

- Logik: 8/10 — starke Mathematik- und Naturwissenschaften-Ergebnisse für die Preisklasse.

- Kosteneffizienz: 10/10 — nichts Vergleichbares kommt dem nahe.

- Kontext und lange Dokumente: 9/10 — 1M rein, 384K raus, nahezu kostenlose Cache-Treffer

- Geschwindigkeit: 8/10 — schlanke Anzahl aktiver Parameter, plus einen Nicht-Denk-Modus für schnelle Pfade

Gesamt: ~8,3/10 — der Preis-Leistungs-König Mitte 2026, mit einem langfristigen Sternchen.

Vorteile

Preisgestaltung, die die Kurve zurücksetzt: 0,14–0,87 $ pro Million Token in der gesamten Familie.

- 1M Kontext Standard mit 384K Ausgabe – die größte Ausgabegrenze in ihrer Klasse

Denk- und Nicht-Denkmodi auf einem Endpunkt, pro Anfrage umschaltbar

- Die Kompatibilität mit den APIs von OpenAI und Anthropic bedeutet nahezu null Migrationsaufwand.

- Open-Source-Gewichte halten Self-Hosting und Feintuning auf dem Tisch.

Nachteile

- Langfristige agentische Arbeit ist die klare Schwäche – in Z.ais veröffentlichter Tabelle erzielt V4-Pro 29.0 bei FrontierSWE, während GLM-5.2 74.4 und Claude Opus 4.8 75.1 erreichen.

Nur Text: kein Bildeingang in der V4-API

Die Preise für Spitzenzeiten kommen mit der offiziellen Veröffentlichung Mitte Juli – die Tarife verdoppeln sich während der Geschäftszeiten in Peking, sodass die Budgets nicht mehr flach bleiben.

- Noch eine Vorschau bis Mitte Juli, daher kann sich das Verhalten mit der offiziellen Version ändern.

- Die Einstellung von deepseek-chat und deepseek-reasoner am 24. Juli 2026 zwingt Legacy-Benutzer, nach DeepSeeks Zeitplan zu migrieren.

- Das Self-Hosting des 1,6T-Parameter-Pro ist für fast alle unpraktisch (Flash, mit 284B, ist das realistische Ziel).

Wie DeepSeek V4 abschneidet

V4-Pro vs V4-Flash.Gleicher Kontext, gleiche Modi, gleiche API — der Unterschied liegt zwischen Qualität und Durchsatz bei einer Preislücke von 3x. Eine sinnvolle Standardeinstellung: Flash für Zusammenfassungen, Extraktion, Klassifikation und Chat; Pro für Code, Analyse und alles, was ein Mensch überprüft.

gegen GLM-5.2. Der Open-Weight-Kampf des Sommers, und es ist wirklich knapp beim Wert. GLM-5.2 ist der stärkere Coder — in der veröffentlichten Tabelle von Z.ai führt es V4-Pro mit 81,0 zu 64,0 auf Terminal-Bench 2.1 und dominiert bei langfristigen Arbeiten (74,4 vs 29,0 auf FrontierSWE) — während V4 mit Preisen 3–5x niedriger und der dreifachen Ausgabegrenze kontert. Volume-Pipelines tendieren zu V4; Coding-Agenten tendieren zu GLM-5.2.

gegenüber der geschlossenen Grenze. Claude Opus 4.8 und GPT-5.5 bleiben klar stärkere Modelle bei anspruchsvollen Benchmarks. Aber bei einer 30- bis 60-fachen Output-Preis-Lücke gegenüber Opus 4.8 versucht V4 nicht, diesen Kampf zu gewinnen – es versucht, 90 % Ihres Traffics so billig zu machen, dass es sich nicht lohnt, ihn woanders hinzuschicken.

Der Stichtag 24. Juli: Migration von Legacy-Namen

Falls Ihre Integration weiterhin `deepseek-chat` oder `deepseek-reasoner` aufruft, funktionieren diese Namen nach 24. Juli 2026, 15:59 UTC nicht mehr. Sie leiten derzeit an V4-Flash weiter, was bedeutet, dass Ihr Traffic bereits auf V4-Ökonomie läuft – aber nach dem Stichtag schlagen Anfragen komplett fehl. Die Migration selbst ist eine Zeile (`model: "deepseek-v4-pro"` oder `"deepseek-v4-flash"`), die eigentliche Arbeit besteht also darin, Prompts gegen das V4-Verhalten erneut zu testen und Endpunkt für Endpunkt zu entscheiden, welche Stufe jeder Workload verdient – oder einen Router davorzuschalten, sodass die nächste Einstellung eine Konfigurationsänderung und keine Codeänderung ist.

Für wen ist DeepSeek V4 geeignet?

Hochvolumige Produkte – Support, Zusammenfassung, Extraktion, Klassifikation – bei denen die V4-Preisgestaltung marginale Funktionen profitabel macht.

Langdokument- und RAG-intensive Workloads, die täglich 1M-Token-Fenster füllen und von nahezu kostenlosen Cache-Treffern profitieren

Teams, die lange Ausgaben generieren: Codebasen, Berichte, strukturierte Daten — 384K Ausgabe ist die Klassendecke

Kostenbewusste Bauherren, die eine leistungsfähige Standardeinstellung wünschen und bereit sind, die harten 10% anderswo zu eskalieren.

Wer sollte woanders suchen?

Teams, deren Kernaufgabe langlebige autonome Agenten sind — GLM-5.2 oder ein geschlossenes Flaggschiff ist der sicherere Weg.

Visionabhänge Arbeitsabläufe (V4 macht keine Bilder)

Jeder, der heute eher ein vertragliches 'stabiles' Label als eine Vorschau benötigt.

Lohnt sich DeepSeek V4?

Für den Preis, eindeutig ja – als eine Spur, nicht als Religion. V4 schlägt weder den besten Open-Weight-Coder (GLM-5.2) noch die führenden Flaggschiffe in puncto Qualität, und seine Langzeit-Agenten-Zahlen sind wirklich schwach. Was es tut, ist, riesige Bereiche alltäglicher KI-Arbeit – die Zusammenfassungen, Extraktionen, Entwürfe und Chat-Runden, die die tatsächlichen Token-Rechnungen dominieren – fast nichts kosten zu lassen. Das erfolgreiche Muster ist V4 als das Volumenfundament, mit Eskalationsspuren darüber.

Endgültiges Urteil

DeepSeek V4 ist der Preis-Leistungs-Benchmark, an dem jedes andere Modell jetzt gemessen wird – unsere Bewertung: ~8,3/10. Nutze Flash, wo das Volumen regiert, Pro, wo Qualität zählt, aber Budgets real sind, und leite die Spitzenarbeit an ein stärkeres Modell weiter. Führe deine Kostenrechnung neu durch, wenn die Spitzenpreise Mitte Juli kommen – billig bleibt billig, aber es hört auf, flach zu sein. Und wenn du immer noch deepseek-chat oder deepseek-reasoner verwendest: Du hast bis zum 24. Juli Zeit. Wechsle.

Verwendung von DeepSeek V4 über OrcaRouter

Eine Drei-Spur-Strategie – V4 für Volumen, ein stärkeres offenes oder geschlossenes Modell für schwierige Aufgaben, ein Fallback für Zuverlässigkeit – ist genau das Setup, das von Hand mühsam zu betreiben und hinter einem Gateway trivial ist. OrcaRouter bedient DeepSeek V4 neben GLM-5.2, Claude, GPT, Gemini und über 200 weiteren Modellen über einen einzigen OpenAI-kompatiblen Endpunkt, zu Listenpreisen der Anbieter mit null Token-Aufschlag: Intelligentes Routing wählt die Spur pro Anfrage, automatisches Failover deckt Aussetzer in der Vorschauphase ab, und die Beobachtbarkeit pro Modell zeigt, was jede Spur pro abgeschlossener Aufgabe tatsächlich kostet. Es entschärft auch anbieterseitige Änderungen wie den Namensrückzug vom 24. Juli oder die Spitzenlastpreise Mitte Juli – wenn ein Modellname stirbt oder ein Preisfenster aufgeht, aktualisieren Sie eine Routing-Regel, nicht Ihre Codebasis.

FAQ

Ist DeepSeek V4 jetzt verfügbar?

Ja — V4-Pro und V4-Flash sind seit dem 24. April 2026 auf der DeepSeek API unter den Modell-IDs deepseek-v4-pro und deepseek-v4-flash mit Open-Source-Gewichten verfügbar. Offiziell handelt es sich um eine Vorschau; die Ankündigung von DeepSeek vom 29. Juni sieht die offizielle Version für Mitte Juli 2026 vor.

Was ist die Preisgestaltung von DeepSeek für Spitzenzeiten?

Angekündigt für die offizielle Veröffentlichung: Ab Mitte Juli 2026 verdoppeln sich alle Token-Preise während der Geschäftszeiten in Peking (09:00–12:00 und 14:00–18:00 Peking-Zeit), während in den Nebenzeiten die aktuellen Tarife gelten. Verkehr, der außerhalb der chinesischen Geschäftszeiten Spitzenwerte erreicht – die meisten westlichen Workloads – umgeht weitgehend den Aufschlag.

Was passiert mit deepseek-chat und deepseek-reasoner?

Sie leiten aktuell automatisch zu V4-Flash weiter, aber nach dem 24. Juli 2026 (15:59 UTC) werden beide Namen vollständig eingestellt und Anfragen schlagen fehl. Aktualisieren Sie den Modellparameter explizit vor dem Stichtag.

Sollte ich V4-Pro oder V4-Flash verwenden?

Flash für Massenarbeit, die ein Mensch nie Zeile für Zeile prüft – Zusammenfassungen, Extraktion, Klassifizierung, Chat. Pro für Code, Analyse und Entwurf, zu etwa dem dreifachen Preis von Flash, aber immer noch weit unter jedem vergleichbaren Modell.

Ist DeepSeek V4 besser als GLM-5.2?

Billiger, nicht besser. In Z.ais veröffentlichter Tabelle führt GLM-5.2 klar beim Coden und dominiert bei langfristigen Agentenaufgaben; V4 kontert mit 3–5x niedrigeren Preisen, einem 384K Ausgabelimit und nahezu kostenlosen Cache-Treffern. Viele Teams setzen beide ein: V4 für Volumen, GLM-5.2 für Code-Agenten.

Kann DeepSeek V4 Bilder verarbeiten?

Nein – die V4-API ist nur für Text. Leiten Sie Bildverarbeitungsaufgaben (Screenshots, PDFs als Pixel, Diagramme) stattdessen an ein multimodales Modell wie Claude oder Gemini weiter.

Kann ich DeepSeek V4 selbst hosten?

Die Gewichte sind als Open Source verfügbar, aber seien Sie realistisch, was den Maßstab angeht: V4-Pro ist ein 1,6T-Parameter-MoE – Rechenzentrums-Territorium – während der 284B V4-Flash das praktische Selbsthosting-Ziel für gut ausgestattete Teams ist.

Funktioniert V4 mit meinen vorhandenen OpenAI- oder Claude-Tools?

Größtenteils ja – die API unterstützt nativ sowohl OpenAI ChatCompletions als auch Anthropic-Formate, sodass Agent-Frameworks und SDKs, die für eines von beiden entwickelt wurden, normalerweise mit einer Änderung der Basis-URL und des Modellnamens verbunden werden.

Kann ich DeepSeek V4 über OrcaRouter nutzen?

Ja — DeepSeek-Modelle sind auf OrcaRouter zu den Listenpreisen der Anbieter ohne Aufschlag verfügbar, neben GLM, Claude, GPT und Gemini, sodass Sie den Volume-Plus-Eskalations-Split hinter einem einzigen Endpunkt ausführen können.

Sind Sie bereit, Ihre Token-Abrechnung langweilig zu machen? Erstellen Sie Ihr OrcaRouter-Konto, richten Sie Ihren OpenAI-kompatiblen Client auf einen Endpunkt aus und leiten Sie das Volumen an DeepSeek V4 weiter, während stärkere Modelle den Gipfel bewältigen – ohne Token-Aufschlag und mit einer am 24. Juli bestätigten Integration.


© 2026 OrcaRouter

Für Anbieter

Sie betreiben eine Inferenz-Plattform? Bringen Sie Ihre Modelle auf OrcaRouter.

Kontaktieren Sie uns

Community beitreten

DiscordEmailXGitHubYouTube