DeepSeek V4 Flash (Free) vs. DeepSeek V4 Pro Vergleich: Benchmarks, Preise & Geschwindigkeit (August 2026)

Ein direkter Vergleich von DeepSeek V4 Flash (Free) (deepseek) und DeepSeek V4 Pro (deepseek) auf OrcaRouter — Preise, Kontextfenster, Latenz, Durchsatz und Benchmark-Qualität nebeneinander, damit Sie das richtige Modell für Ihre Arbeitslast wählen können.

Fazit

Für latenzsensible Arbeitslasten liefert DeepSeek V4 Flash (Free) das erste Token schneller.

Kostenlos starten · beide Modelle mit einem Schlüssel · Abrechnung zum Anbieterpreis, kein Token-Aufschlag

DeepSeek V4 Flash (Free) und DeepSeek V4 Pro sind beide über denselben OrcaRouter-Endpoint zum Anbieterpreis ohne jeglichen Token-Aufschlag verfügbar; der Wechsel zwischen beiden ist eine einzeilige Änderung, und die Zahlen unten sind das, was Sie tatsächlich zahlen.

Vollständige Analyse lesen

Dieser Vergleich zieht Live-Preise, die veröffentlichte Context Window sowie OrcaRouters eigene Latency- und Throughput-Messungen heran, damit Sie Kosten gegen Leistung für Ihre konkrete Arbeitslast abwägen können, statt sich auf den Schaufenster-Benchmark eines Anbieters zu verlassen. Die richtige Wahl hängt fast immer von der Form Ihres Traffics ab — Promptlänge, wie viel Text Sie erzeugen, wie latenzempfindlich Ihre Nutzer sind und wie schwer das Reasoning ist —, weshalb die folgenden Abschnitte die Entscheidung Dimension für Dimension aufschlüsseln und mit einer konkreten Empfehlung enden. Wo eine Metrik für eines der beiden Modelle fehlt, wird die Zeile ausgelassen statt geraten, sodass jede Aussage hier durch eine echte Zahl gestützt ist.

Auf einen Blick

  • p50-Latenz387 msDeepSeek V4 Flash (Free) 58%

Modellvergleich

Preise, Kontext, Latenz, Durchsatz und Qualität für DeepSeek V4 Flash (Free) und DeepSeek V4 Pro.
MetrikDeepSeek V4 Flash (Free)DeepSeek V4 ProFazit
Eingabe $/M$0.44
Ausgabe $/M$0.88
Kontext1M1MDeepSeek V4 Flash (Free) und DeepSeek V4 Pro haben dasselbe Kontextfenster.
p50-Latenz387 ms916 msDeepSeek V4 Flash (Free) antwortet im Median 58% schneller als DeepSeek V4 Pro.
Durchsatz18 tok/s69 tok/sDeepSeek V4 Pro streamt Tokens 275% schneller als DeepSeek V4 Flash (Free).
Qualität8.0

Für latenzsensible Arbeitslasten liefert DeepSeek V4 Flash (Free) das erste Token schneller.

Beide Modelle, ein API-Schlüssel. Starten Sie mit einem und wechseln Sie, indem Sie eine Zeichenfolge ändern.

API-Schlüssel holen

DeepSeek V4 Flash (Free) und DeepSeek V4 Pro mit einem API-Schlüssel nutzen

Sie müssen sich nicht entscheiden. Beide Modelle laufen über denselben OpenAI-kompatiblen Endpunkt auf OrcaRouter und werden zum Preis des vorgelagerten Anbieters ohne Token-Aufschlag abgerechnet. Der Wechsel ist eine Änderung des Modellnamens – kein zweites Konto, kein zweites SDK, keine getrennten Zugangsdaten.

Genau das macht den obigen Kompromiss im Produktivbetrieb handhabbar: Schicken Sie den Großteil des Traffics an das Modell, das bei der für Sie entscheidenden Dimension vorn liegt, halten Sie das andere für die Anfragen bereit, die es brauchen, und verschieben Sie die Aufteilung, sobald sich Ihre Zahlen ändern.

curl
# Ein Schlüssel, ein Endpunkt, beide Modelle.
curl https://api.orcarouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $ORCAROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek/deepseek-v4-flash-free",
    "messages": [{"role":"user","content":"..."}]
  }'

# Modell wechseln, indem Sie eine Zeichenfolge ändern.
#     "model": "deepseek/deepseek-v4-pro"

Praxistest: DeepSeek V4 Flash (Free) vs. DeepSeek V4 Pro im Battle-Modus

Battle-Modus — beide nebeneinander ausprobierenLive
Im Playground öffnen
DeepSeek: DeepSeek V4 Flash (Free)
$0.00 /M · p50 387ms
DeepSeek: DeepSeek V4 Pro
$0.44 /M · p50 916ms

Preis- und Kostenanalyse

Eines oder beide dieser Modelle geben hier keinen Preis pro Token an (es kann sich um ein Modell mit Gratis-Stufe, mit Abrechnung pro Aufruf oder ein noch nicht bepreistes Modell

Vollständige Analyse lesen

handeln); behandeln Sie die Kostenspalten daher als Richtwert und bestätigen Sie den Live-Tarif auf der eigenen Seite jedes Modells, bevor Sie danach budgetieren.

DeepSeek V4 Flash (Free) nimmt bis zu 1M Tokens Kontext an und DeepSeek V4 Pro nimmt 1M an.

Vollständige Analyse lesen

Die Context Window begrenzt, wie viel Ausgangsmaterial — Dokumente, Code, bisherige Konversation — Sie in einer einzigen Anfrage senden können. Eine größere Fenstergröße erspart Ihnen Chunking und die Abruf-Verrohrung für lange Eingaben, doch Sie zahlen für alles Gesendete weiterhin den Eingabe-Token-Tarif; ein größeres Fenster ist also eine Fähigkeit, kein Rabatt. Passen Sie das Fenster an die längste einzelne Anfrage an, die Ihre Arbeitslast realistisch erzeugt, nicht an die größte Zahl auf der Seite. Bedenken Sie zudem, dass die Qualität gegen Ende eines sehr langen Kontexts bei jedem Modell nachlassen kann; ein großes Fenster behandeln Sie daher am besten als Reserve für gelegentliche lange Eingaben und nicht als Freibrief, jede Anfrage bis ans Limit zu füllen.

Beide Preise sind der reine Anbieterpreis – OrcaRouter schlägt nichts auf, die berechnete Ersparnis bleibt Ihnen also erhalten.

Kostenlos starten

Geschwindigkeit und Latenz

Latency und Throughput entscheiden, wie sich das Modell in der Produktion anfühlt. Die mediane (p50) Antwort-Latency ist die Wartezeit einer typischen Anfrage bis zum ersten Token; der Throughput (Tokens pro Sekunde) legt fest, wie schnell die Antwort streamt, sobald sie beginnt.

Vollständige Analyse lesen

Für interaktiven Chat und Agent-Schleifen zählt eine niedrige p50-Latency am meisten, weil der Nutzer auf das erste Token wartet; für Batch-Generierung und Langformausgaben dominiert der Throughput die Gesamtzeit, weil die Antwort lang ist. Die 7-Tage-Trendcharts oben zeigen, ob die Latency jedes Modells stabil ist oder driftet — etwas, das eine einzelne Schlagzeilen-Zahl verbirgt: Ein Modell mit hervorragendem Durchschnitt, aber verrauschtem Tail kann ein striktes p95-SLA dennoch verfehlen. Hat Ihr Produkt ein Latency-Budget, lesen Sie sowohl den Median als auch die Form der Kurve, und denken Sie daran, dass die Ende-zu-Ende-Latency auch Ihren Netzwerk-Hop sowie alle Abrufe oder Tool-Aufrufe rund um das Modell umfasst.

In den letzten 7 Tagen hält DeepSeek V4 Flash (Free) die niedrigere mediane Antwortlatenz.

DeepSeek V4 Flash (Free)
DeepSeek V4 Pro

Benchmarks und Qualität

Benchmark-Werte nähern die Fähigkeit an, ersetzen aber nicht das Testen mit Ihren eigenen Prompts.

Vollständige Analyse lesen

Die hier gezeigten zusammengesetzten Indizes aggregieren mehrere öffentliche Evaluierungen, und das Perzentil markiert, wo jedes Modell gegenüber allen vergleichbaren Modellen im Katalog liegt — ein nützliches Vorauswahl-Signal, keine Garantie für Ihre Aufgabe. Ein bei einem Index für allgemeine Intelligenz führendes Modell kann in Ihrer Domäne (Coding, Extraktion, mehrsprachig, Long-Context-Reasoning) dennoch zurückliegen; nutzen Sie die Benchmarks also zum Eingrenzen des Feldes und lassen Sie dann beide Modelle auf einem repräsentativen Ausschnitt Ihres Traffics laufen. Achten Sie auf den spezifischen Index, der zu Ihrem Anwendungsfall passt, statt auf die Kopfzahl: Ein codelastiges Produkt sollte den Coding-Index gewichten, ein Rechercheassistent den Reasoning-Index. Benchmarks veralten außerdem, während Modelle aktualisiert werden, behandeln Sie sie daher als Ausgangshypothese, die Sie mit Ihrem eigenen Evaluierungssatz bestätigen.

DeepSeek V4 Flash (Free)
69.1
AA Coding
Besser als 83 % der verglichenen Modelle
Nr. 21 von 127
51.8
AA Intelligence
Besser als 78 % der verglichenen Modelle
Nr. 27 von 129
50.0
AA Math
Besser als 26 % der verglichenen Modelle
Nr. 60 von 81
DeepSeek V4 Pro
68.8
AA Coding
Besser als 80 % der verglichenen Modelle
Nr. 23 von 127
53.0
AA Intelligence
Besser als 82 % der verglichenen Modelle
Nr. 23 von 129
62.5
AA Math
Besser als 49 % der verglichenen Modelle
Nr. 41 von 81
Direktvergleich der Community (Design Arena)Quelle: Design Arena Elo
DeepSeek V4 Flash (Free)1285Elo-Wertung57.0 % Siegquote
DeepSeek V4 Pro1491Elo-Wertung81.3 % Siegquote

In direkten Community-Turnieren hat DeepSeek V4 Pro die höhere Elo-Wertung (1491 gegenüber 1285), was bedeutet, dass es mehr direkte Duelle gegen vergleichbare Modelle gewinnt.

Welches sollten Sie wählen?

Ist Kosten die bindende Einschränkung, beginnen Sie mit dem günstigeren Modell auf Ihrem tatsächlichen Eingabe-zu-Ausgabe-Mix und steigen Sie nur auf, wenn die Qualität nicht reicht.

Vollständige Analyse lesen

Hat Reaktionsfähigkeit Priorität — nutzerseitiger Chat, Agents, alles, wo jemand wartet — gewichten Sie p50-Latency und Throughput höher als eine kleine Preisdifferenz. Treiben Sie das anspruchsvollste Reasoning, Coding oder Long-Context-Arbeit voran, lassen Sie den Sieger bei Benchmark und Context Window führen und akzeptieren Sie den höheren Tarif dort, wo er sich rechnet. Da beide Modelle hinter derselben API sitzen, ist der risikoarme Schritt, einen Bruchteil des echten Traffics an jedes zu routen und Kosten, Latency und Antwortqualität auf Ihren eigenen Prompts zu vergleichen, bevor Sie sich festlegen. Ein gängiges Muster ist die Staffelung (Tier): Schicken Sie den Großteil einfacher, hochvolumiger Anfragen an das günstigere oder schnellere Modell und reservieren Sie das stärkere Modell für die Anfragen, die es wirklich brauchen — das holt den größten Teil des Qualitätsvorteils zu einem Bruchteil der Kosten. Was Sie auch wählen, halten Sie den Wechsel reversibel — Sie verschieben den Traffic zurück, sobald sich die Zahlen oder Ihre Anforderungen ändern.

Oder entscheiden Sie sich nicht – verteilen Sie pro Anfrage auf beide, mit einem Schlüssel und einem Endpunkt.

Beide holen

Am besten für

  • Latenzkritische Chats und AgentenDeepSeek V4 Flash (Free)

DeepSeek V4 Flash (Free) vs DeepSeek V4 Pro FAQ

Welches ist schneller, DeepSeek V4 Flash (Free) oder DeepSeek V4 Pro?
DeepSeek V4 Flash (Free) hat in den Live-Messungen von OrcaRouter die niedrigere mediane (p50) Antwortlatenz.
Welches streamt schneller, DeepSeek V4 Flash (Free) oder DeepSeek V4 Pro?
DeepSeek V4 Pro hat den höheren gemessenen Throughput (Tokens pro Sekunde), sodass lange Completions früher fertig sind, sobald die Generierung beginnt.
Wer gewinnt mehr direkte Duelle, DeepSeek V4 Flash (Free) oder DeepSeek V4 Pro?
DeepSeek V4 Pro hat die höhere Design-Arena-Elo-Wertung (1491 gegenüber 1285) und gewinnt daher mehr blinde Direktvergleiche gegen vergleichbare Modelle.
Sollte ich DeepSeek V4 Flash (Free) oder DeepSeek V4 Pro verwenden?
Wählen Sie DeepSeek V4 Flash (Free) oder DeepSeek V4 Pro je nach Priorität: Kosten, Kontextfenster, Latenz oder Benchmark-Qualität. Die Tabelle oben zeigt, welches Modell bei jedem Kriterium gewinnt; ordnen Sie den Sieger der Dimension zu, die für Ihre Arbeitslast am wichtigsten ist.
Wie werden DeepSeek V4 Flash (Free) und DeepSeek V4 Pro auf OrcaRouter abgerechnet?
Beide werden zum Tarif des vorgelagerten Anbieters ohne jeglichen Token-Aufschlag abgerechnet — Sie zahlen denselben Preis pro Token, den Sie dem Anbieter direkt zahlen würden, über einen einzigen OrcaRouter-API-Schlüssel und -Endpoint.
Kann ich DeepSeek V4 Flash (Free) und DeepSeek V4 Pro mit demselben Code aufrufen?
Ja. Beide werden über OrcaRouters OpenAI-compatible API bereitgestellt, sodass Sie nur den Modellnamen ändern, um zwischen ihnen zu routen — kein SDK-Wechsel, keine separaten Anmeldedaten.

Mit DeepSeek V4 Flash (Free) oder DeepSeek V4 Pro starten

Ein Schlüssel. Beide Modelle. Über 40 Anbieter.

Abrechnung zum Anbieterpreis, ohne Token-Aufschlag. Kostenlos starten, Modelle mit einer Zeichenfolge wechseln und die Entscheidung jederzeit zurücknehmen.

Kostenloses Konto erstellen