DeepSeek V4.1 Flash

deepseek/deepseek-v4.1-flash
NieuwUitgelicht
VisieToolsJSONRedeneren
door DeepSeek · 2026-09-10

DeepSeek-V4.1-Flash is het kleinste model in de nieuwe architectuurfamilie van DeepSeek, uitgebracht op 10 september 2026, met native multimodaal visueel begrip — de productie-opvolger van zowel V4 Flash als het V4 Flash Vision-experiment. De nieuwe architectuur is gericht op een hoger capaciteitsplafond, snellere inferentie en hogere doorvoer, en DeepSeek meldt dat V4.1 Flash V4 Pro ruimschoots overtreft op het gebied van prestaties, kosten, snelheid en totale taaktijd. Het accepteert tekst en afbeeldingen met tekstuitvoer, biedt een contextvenster van 1M tokens met maximaal 384K uitvoertokens, en ondersteunt denkmodus (standaard, met selecteerbare denkinspanning: laag / hoog / maximaal) en niet-denkmodus via de Chat Completions-, Responses- en Anthropic-compatibele API's, naast JSON-uitvoer, toolcalls en chatprefix-voltooiing; FIM werkt alleen in niet-denkmodus. De modelgewichten zijn openbaar beschikbaar op Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash). Officiële benchmarks bij release: 90,6 op Terminal-Bench 2.1, 74,2 op DeepSWE v1.1, 65,4 op NL2Repo-Bench, 90,9 op GPQA Diamond, 63,9 op HLE met tools, en sterke resultaten met native-vision-agents (89,6 BabyVision, 78,9 Chartography met tools). De prijzen zijn gelijktijdig met de release verlaagd: tegen dalurentarieven geldt $0,15/M invoer (cachemisser), $0,60/M uitvoer en $0,003/M bij cachetreffers; tijdens piekuren op weekdagen (01:00-04:00 en 06:00-10:00 UTC) verdubbelen deze tarieven. Alle andere uren, inclusief weekends, zijn daluren.

ctx1M tokens
Max. uitvoer384K
Invoertext + image
Uitvoertext
p50 TTFT412 ms
INPUT$0.15/ 1M tokens
OUTPUT$0.60/ 1M tokens
p50 TTFT412 ms7d
p95 TTFT1.60 s7d
VERKEER299.5Mtokens / 7d

DeepSeek V4.1 Flash is een DeepSeek-model dat beschikbaar is via OrcaRouter, de OpenAI-compatibele API-gateway. Het accepteert tekst- en afbeeldingsinvoer, heeft een contextvenster van 1.048.576…

Wat is DeepSeek V4.1 Flash?

Voor wie is DeepSeek V4.1 Flash gebouwd?

Waarom is het contextvenster van 1.048.576 tokens belangrijk?

Codevoorbeelden

Aanroepen vanuit elke SDK

OpenAI-compatibel — behoud je huidige SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Anthropic SDKhttps://api.orcarouter.ai
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Ondersteunde parameters

  • include_reasoning
  • logprobs
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • stop
  • stream
  • stream_options
  • temperature
  • thinking
  • tool_choice
  • tools
  • top_logprobs
  • top_p
  • user_id

Prijzen

Prijzen
Invoer / 1M tokens · Daluren$0.150
Uitvoer / 1M tokens · Daluren$0.600
Cache lezen / 1M · Daluren$0.0030
Piekuren01:00–04:00, 06:00–10:00 ×2 (UTC)
Invoer / 1M tokens · ×2$0.300
Uitvoer / 1M tokens · ×2$1.20
Cache lezen / 1M · ×2$0.0060
ValutaUSD

Kostencalculator

Tokens / maand10MM
Invoeraandeel70%%
Geschat / maand $2.85 · Met prompt-caching $2.34

Schatting op basis van catalogusprijs

Token- en kostenschatter

Invoertokens: 20Kosten per verzoek: $0.000303

Alleen een schatting — het werkelijke aantal tokens hangt af van de tokenizer van de aanbieder.

Prestaties

p50 TTFT
412 ms
Outputsnelheid
215 tok/s
p95 TTFT
1.60 s
Foutpercentage
0.07%

Openbare benchmarks

Agents' Last Exam
31.8
Automation-Bench
54.8
BabyVision (with tools)
89.6
Chartography (with tools)
78.9
CyberGym
88.1
DeepSWE v1.1
74.2
ExploitGym
15.3
GPQA Diamond
90.9
HLE
36.8
HLE (with tools)
63.9
MathArena Apex
65.6
NL2Repo-Bench
65.4
ProgramBench
20.3
SEC-Bench Pro
62.8
Terminal-Bench 2.1
90.6
Terminal-Bench 3.0
30.0
Terminal-Bench 4.0
31.2
ZeroBench-main (with tools)
49.0
Bron: api-docs.deepseek.com

Community-buzz

Waar ontwikkelaars het deze week over hebben

Hacker News13 vermeldingen · 7 d13 meer dan vorige week

Vergelijking

DeepSeek V4.1 FlashDeepSeek V4 ProDeepSeek V4 FlashDeepSeek V4 Flash Vision (Exp)
Invoer $/M$0.15$0.73$0.24$0.24
Uitvoer $/M$0.60$2.18$0.73$0.73
Context1.0M1.0M1.0M1.0M
Kwaliteit8/108/107/107/10
Naast elkaar vergelijkenNaast elkaar vergelijkenNaast elkaar vergelijkenNaast elkaar vergelijken

FAQ

Hoeveel kost DeepSeek V4.1 Flash op OrcaRouter?
OrcaRouter factureert DeepSeek V4.1 Flash tegen $0,15 per 1 miljoen inputtokens en $0,60 per 1 miljoen outputtokens, doorberekend tegen het tarief van de provider zonder opslag. Er wordt geen aparte kostenpost genoemd voor het contextvenster zelf: 1.048.576 tokens is een limiet, geen kostenpost. Inputtokens omvatten tekst, afbeeldingen en gespreksgeschiedenis die u verzendt; outputtokens dekken alles wat wordt gegenereerd, tot 384.000 tokens.
Hoe groot zijn het contextvenster en de maximale uitvoer?
DeepSeek V4.1 Flash heeft een contextvenster van 1.048.576 tokens en een maximale uitvoer van 384.000 tokens. Het invoervenster laat je volledige documenten, transcripties of repository-snapshots in één aanroep indienen, terwijl het uitvoerplafond lange artefacten in één enkele pass ondersteunt, zoals specificaties, migratieplannen of uitgebreide diffs.
Waar is DeepSeek V4.1 Flash het beste in?
Het is gebouwd voor werk met lange invoer en lange uitvoer: analyse van volledige documenten, begrip van code in grote repositories, multimodale beoordeling van tekst plus afbeeldingen, en workflows die substantiële gegenereerde antwoorden nodig hebben in plaats van korte reacties. De score van 90,9 op GPQA Diamond wijst ook op gedegen wetenschappelijk en technisch redeneren op masterniveau. Invoer ondersteunt zowel tekst als afbeeldingen; uitvoer is alleen tekst.
Hoe verhoudt het zich tot grotere frontier-modellen?
Frontier-modellen lopen mogelijk voorop bij de moeilijkste redeneerbenchmarks en rekenen doorgaans meer per token, terwijl DeepSeek V4.1 Flash een contextvenster van 1,048,576 tokens en een uitvoerplafond van 384,000 tokens biedt tegen $0.15 per 1M input en $0.60 per 1M outputtokens. Voor lange contexten en werk met grote volumes is het vaak de praktische keuze; voor de moeilijkste individuele redeneerstappen is het een redelijk patroon om die aanroepen naar een duurder model op OrcaRouter te routeren.
Hoe worden gegevens verwerkt wanneer ik dit model aanroep?
OrcaRouter stuurt verzoeken door naar de API van DeepSeek en factureert tegen het tarief van de provider, zonder opslag. Bewaring, gebruik voor training en gerelateerde voorwaarden vallen onder het beleid van de provider in plaats van onder een afzonderlijke regeling die hier wordt beschreven. Controleer daarom de actuele voorwaarden van de provider voordat u gevoelig materiaal verstuurt. Verwijder identificatoren die u niet nodig hebt en houd prompts tot het minimum dat de taak vereist; een kleinere context verlaagt ook de invoerkosten bij een tarief van $0.15 per 1 miljoen tokens.
Hoe roep ik het aan via een OpenAI-compatibele API?
Stel de basis-URL van je client in op https://api.orcarouter.ai/v1 en gebruik het model-id deepseek/deepseek-v4.1-flash met je OrcaRouter API-sleutel. Verzoeken en antwoorden volgen het OpenAI chat completions-schema, dus bestaande SDK's, streaming-handlers en tool-call-parsing werken ongewijzigd. Migratie is meestal een wijziging van de basis-URL en de modelstring plus het opnieuw uitvoeren van je evaluatieset.
Kan DeepSeek V4.1 Flash afbeeldingen accepteren?
Ja. Beeldinvoer wordt ondersteund via de standaard multimodale content-array, met tekst- en afbeeldingsonderdelen in hetzelfde gebruikersbericht. Afbeeldingstokens tellen mee als invoer en worden op OrcaRouter gefactureerd tegen $0.15 per 1M invoertokens. De uitvoer blijft alleen tekst, dus het model beschrijft of extraheert uit afbeeldingen in plaats van ze te genereren.
Is een 90,9 op GPQA Diamond genoeg om erop te vertrouwen voor mijn taak?
Het is een nuttig signaal, geen garantie. GPQA Diamond meet wetenschappelijk redeneren op graduate-niveau binnen een vast promptformaat, wat relevant is voor technische vraagbeantwoording, maar weinig zegt over long-context recall, toon of extractienauwkeurigheid op jouw data. Bouw een kleine evaluatieset op basis van echte inputs, draai die tegen DeepSeek V4.1 Flash en eventuele alternatieve model-id's op OrcaRouter, en vergelijk kosten en kwaliteit voordat je productieverkeer routeert.

Sluit deze badge in

DeepSeek: DeepSeek V4.1 Flash$0.15/M in412ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg" alt="DeepSeek: DeepSeek V4.1 Flash op OrcaRouter" /> </a>
Markdown [![DeepSeek: DeepSeek V4.1 Flash](https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg)](https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash)

Modelkaart als data

GET /api/public/models/deepseek/deepseek-v4.1-flashOpenen
Machineleesbaar:/llms.txt/llms-full.txt