DeepSeek V4.1 Flash

deepseek/deepseek-v4.1-flash
NeuEmpfohlen
VisionToolsJSONReasoning
von DeepSeek · 2026-09-10

DeepSeek-V4.1-Flash ist das kleinste Modell der neuen Architekturfamilie von DeepSeek, veröffentlicht am 10. September 2026, mit nativem multimodalen visuellen Verständnis – der Produktionsnachfolger sowohl von V4 Flash als auch vom V4 Flash Vision-Experiment. Die neue Architektur zielt auf eine höhere Leistungsobergrenze, schnellere Inferenz und höheren Durchsatz ab, und DeepSeek berichtet, dass V4.1 Flash V4 Pro in Bezug auf Leistung, Kosten, Geschwindigkeit und Gesamtaufgabenzeit umfassend übertrifft. Es akzeptiert Text und Bilder als Eingabe mit Textausgabe, bietet ein Kontextfenster von 1M Token mit bis zu 384K Ausgabe-Tokens und unterstützt Denkmodus (Standard, mit wählbarem Aufwand niedrig / hoch / maximal) sowie Nicht-Denkmodi über die Chat-Completions-, Responses- und Anthropic-kompatiblen APIs, zusammen mit JSON-Ausgabe, Tool-Aufrufen und Chat-Präfix-Vervollständigung; FIM funktioniert nur im Nicht-Denkmodus. Die Modellgewichte sind auf Hugging Face offen verfügbar (deepseek-ai/DeepSeek-V4.1-Flash). Offizielle Benchmarks bei der Veröffentlichung: 90,6 auf Terminal-Bench 2.1, 74,2 auf DeepSWE v1.1, 65,4 auf NL2Repo-Bench, 90,9 auf GPQA Diamond, 63,9 auf HLE mit Tools, und starke Ergebnisse für native Vision-Agenten (89,6 BabyVision, 78,9 Chartography mit Tools). Die Preise wurden im Zuge der Veröffentlichung gesenkt: 0,15 $/M Input (Cache-Miss), 0,60 $/M Output und 0,003 $/M bei Cache-Hits zu Off-Peak-Preisen, mit Verdopplung während der Spitzenzeiten an Wochentagen (01:00-04:00 und 06:00-10:00 UTC); alle anderen Stunden einschließlich Wochenenden sind Off-Peak.

Ktx1M Tokens
Max. Ausgabe384K
Eingabetext + image
Ausgabetext
p50 TTFT412 ms
EINGABE$0.15/ 1M Tokens
AUSGABE$0.60/ 1M Tokens
p50 TTFT412 ms7 T
p95 TTFT1.60 s7 T
DATENVERKEHR299.5MTokens / 7 T

DeepSeek V4.1 Flash ist ein DeepSeek-Modell, das über OrcaRouter, das OpenAI-kompatible API-Gateway, verfügbar ist. Es akzeptiert Text- und Bildeingaben, verfügt über ein Kontextfenster von 1.048.576…

Was ist DeepSeek V4.1 Flash?

Für wen wurde DeepSeek V4.1 Flash entwickelt?

Warum ist das Kontextfenster von 1,048,576 Token wichtig?

Code-Beispiele

Aus jedem SDK aufrufen

OpenAI-kompatibel — behalte dein bisheriges SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Anthropic SDKhttps://api.orcarouter.ai
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Unterstützte Parameter

  • include_reasoning
  • logprobs
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • stop
  • stream
  • stream_options
  • temperature
  • thinking
  • tool_choice
  • tools
  • top_logprobs
  • top_p
  • user_id

Preise

Preise
Eingabe / 1M Tokens · Nebenzeiten$0.150
Ausgabe / 1M Tokens · Nebenzeiten$0.600
Cache-Lesen / 1M · Nebenzeiten$0.0030
Spitzenzeiten01:00–04:00, 06:00–10:00 ×2 (UTC)
Eingabe / 1M Tokens · ×2$0.300
Ausgabe / 1M Tokens · ×2$1.20
Cache-Lesen / 1M · ×2$0.0060
WährungUSD

Kostenrechner

Tokens / Monat10MM
Eingabeanteil70%%
Geschätzt / Monat $2.85 · Mit Prompt-Caching $2.34

Schätzung auf Basis des Listenpreises

Token- und Kostenschätzer

Eingabe-Tokens: 27Kosten pro Anfrage: $0.000304

Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.

Leistung

p50 TTFT
412 ms
Ausgabegeschwindigkeit
215 tok/s
p95 TTFT
1.60 s
Fehlerquote
0.07%

Öffentliche Benchmarks

Agents' Last Exam
31.8
Automation-Bench
54.8
BabyVision (with tools)
89.6
Chartography (with tools)
78.9
CyberGym
88.1
DeepSWE v1.1
74.2
ExploitGym
15.3
GPQA Diamond
90.9
HLE
36.8
HLE (with tools)
63.9
MathArena Apex
65.6
NL2Repo-Bench
65.4
ProgramBench
20.3
SEC-Bench Pro
62.8
Terminal-Bench 2.1
90.6
Terminal-Bench 3.0
30.0
Terminal-Bench 4.0
31.2
ZeroBench-main (with tools)
49.0
Quelle: api-docs.deepseek.com

Community-Buzz

Worüber Entwickler diese Woche sprechen

Hacker News13 Erwähnungen · 7 T13 mehr als in der Vorwoche

Im Vergleich

DeepSeek V4.1 FlashDeepSeek V4 ProDeepSeek V4 FlashDeepSeek V4 Flash Vision (Exp)
Eingabe $/M$0.15$0.73$0.24$0.24
Ausgabe $/M$0.60$2.18$0.73$0.73
Kontext1.0M1.0M1.0M1.0M
Qualität8/108/107/107/10
Nebeneinander vergleichenNebeneinander vergleichenNebeneinander vergleichenNebeneinander vergleichen

FAQ

Wie viel kostet DeepSeek V4.1 Flash auf OrcaRouter?
OrcaRouter berechnet DeepSeek V4.1 Flash mit 0,15 $ pro 1 Mio. Eingabe-Tokens und 0,60 $ pro 1 Mio. Ausgabe-Tokens, weitergegeben zum Anbieterpreis ohne Aufschlag. Für das Kontextfenster selbst ist keine separate Gebühr angegeben: 1.048.576 Tokens sind ein Limit, keine Gebühr. Eingabe-Tokens umfassen Text, Bilder und den Gesprächsverlauf, den Sie senden; Ausgabe-Tokens decken alles Generierte ab, bis zu 384.000 Tokens.
Wie groß sind das Kontextfenster und die maximale Ausgabe?
DeepSeek V4.1 Flash hat ein Kontextfenster von 1,048,576 Tokens und eine maximale Ausgabe von 384,000 Tokens. Das Eingabefenster ermöglicht es Ihnen, vollständige Dokumente, Transkripte oder Repository-Snapshots in einem einzigen Aufruf zu übermitteln, während die Ausgabegrenze lange Artefakte in einem einzigen Durchlauf unterstützt, wie Spezifikationen, Migrationspläne oder erweiterte Diffs.
Worin ist DeepSeek V4.1 Flash am besten?
Es ist für Arbeit mit langen Eingaben und langen Ausgaben konzipiert: Analyse ganzer Dokumente, Codeverständnis großer Repositories, multimodale Analyse von Text und Bildern sowie Workflows, die umfangreiche generierte Antworten statt kurzer Erwiderungen benötigen. Seine 90,9-Punkte-Wertung bei GPQA Diamond deutet zudem auf solides wissenschaftliches und technisches Denkvermögen auf Graduiertenniveau hin. Die Eingabe unterstützt sowohl Text als auch Bilder; die Ausgabe ist ausschließlich Text.
Wie schneidet es im Vergleich zu größeren Frontier-Modellen ab?
Frontier-Modelle können bei den schwierigsten Reasoning-Benchmarks führend sein und berechnen in der Regel mehr pro Token, während DeepSeek V4.1 Flash ein Kontextfenster von 1.048.576 Token und eine Ausgabegrenze von 384.000 Token zu $0,15 pro 1 Mio. Eingabe- und $0,60 pro 1 Mio. Ausgabe-Token bietet. Für Arbeiten mit langem Kontext und hohem Volumen ist es oft die praktische Wahl; für die schwierigsten einzelnen Reasoning-Schritte ist es ein vernünftiges Muster, diese Aufrufe an ein teureres Modell auf OrcaRouter weiterzuleiten.
Wie werden Daten gehandhabt, wenn ich dieses Modell aufrufe?
OrcaRouter leitet Anfragen an die API von DeepSeek weiter und rechnet zum Anbietertarif ohne Aufschlag ab. Aufbewahrung, Nutzung für Trainingszwecke und damit zusammenhängende Bedingungen richten sich nach den Richtlinien des Anbieters und nicht nach einer hier beschriebenen separaten Vereinbarung. Bestätigen Sie daher die aktuellen Bedingungen des Anbieters, bevor Sie sensible Daten senden. Schwärzen Sie Identifikatoren, die Sie nicht benötigen, und beschränken Sie Prompts auf das für die Aufgabe erforderliche Minimum; ein kleinerer Kontext senkt zudem die Eingabekosten auf $0.15 pro 1M Token.
Wie rufe ich es über eine OpenAI-kompatible API auf?
Setze die Basis-URL deines Clients auf https://api.orcarouter.ai/v1 und verwende die Modell-ID deepseek/deepseek-v4.1-flash mit deinem OrcaRouter-API-Schlüssel. Anfragen und Antworten folgen dem OpenAI-Chat-Completions-Schema, sodass bestehende SDKs, Streaming-Handler und Tool-Call-Parsing unverändert funktionieren. Die Migration besteht in der Regel aus einer Änderung der Basis-URL und des Modell-Strings sowie einem erneuten Durchlauf deines Evaluierungs-Sets.
Kann DeepSeek V4.1 Flash Bilder annehmen?
Ja. Bildeingabe wird über das standardmäßige multimodale Inhalts-Array unterstützt, wobei Text- und Bildteile in derselben Benutzernachricht enthalten sind. Bild-Tokens zählen als Eingabe und werden auf OrcaRouter mit $0.15 pro 1 Mio. Eingabe-Tokens abgerechnet. Die Ausgabe bleibt reiner Text, das Modell beschreibt oder extrahiert also aus Bildern, anstatt sie zu generieren.
Reicht ein Wert von 90,9 auf GPQA Diamond aus, um ihm für meine Aufgabe zu vertrauen?
Es ist ein nützliches Signal, keine Garantie. GPQA Diamond misst wissenschaftliches Reasoning auf Graduierten-Niveau in einem festen Prompt-Format, was für technische Fragebeantwortung relevant ist, aber wenig über Long-Context-Recall, Tonalität oder Extraktionsgenauigkeit bei Ihren Daten aussagt. Erstellen Sie ein kleines Evaluationsset aus realen Eingaben, testen Sie es mit DeepSeek V4.1 Flash und allen alternativen Modell-IDs auf OrcaRouter, und vergleichen Sie Kosten und Qualität, bevor Sie Produktionsverkehr weiterleiten.

Dieses Abzeichen einbetten

DeepSeek: DeepSeek V4.1 Flash$0.15/M in412ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg" alt="DeepSeek: DeepSeek V4.1 Flash auf OrcaRouter" /> </a>
Markdown [![DeepSeek: DeepSeek V4.1 Flash](https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg)](https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash)

Modellkarte als Daten

GET /api/public/models/deepseek/deepseek-v4.1-flashÖffnen
Maschinenlesbar:/llms.txt/llms-full.txt