DeepSeek V4.1 Flash

deepseek/deepseek-v4.1-flash
NowyPolecane
WizjaNarzędziaJSONRozumowanie
przez DeepSeek · 2026-09-10

DeepSeek-V4.1-Flash to najmniejszy model w nowej rodzinie architektur DeepSeek, wydany 10 września 2026 r., z natywnym multimodalnym rozumieniem obrazu — produkcyjny następca zarówno V4 Flash, jak i eksperymentu V4 Flash Vision. Nowa architektura celuje w wyższy sufit możliwości, szybszą inferencję i wyższą przepustowość, a DeepSeek podaje, że V4.1 Flash kompleksowo przewyższa V4 Pro pod względem wydajności, kosztów, szybkości i całkowitego czasu realizacji zadań. Akceptuje tekst i obrazy z wyjściem tekstowym, obsługuje okno kontekstowe 1M tokenów z maksymalnie 384K tokenami wyjściowymi oraz wspiera tryby myślenia (domyślny, z wybieranym poziomem zaangażowania niski / wysoki / maksymalny) i bez myślenia w ramach API Chat Completions, Responses i API kompatybilnych z Anthropic, a także wyjście JSON, wywołania narzędzi i dopełnianie prefiksu czatu; tryb FIM działa wyłącznie w trybie bez myślenia. Wagi modelu są otwarte na Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash). Oficjalne benchmarki w momencie wydania: 90.6 w Terminal-Bench 2.1, 74.2 w DeepSWE v1.1, 65.4 w NL2Repo-Bench, 90.9 w GPQA Diamond, 63.9 w HLE z narzędziami oraz mocne wyniki agenta z natywnym widzeniem (89.6 BabyVision, 78.9 Chartography z narzędziami). Ceny zostały obniżone wraz z wydaniem: $0.15/mln tokenów wejściowych (brak trafienia w pamięć podręczną), $0.60/mln tokenów wyjściowych i $0.003/mln tokenów przy trafieniach w pamięć podręczną według stawek poza godzinami szczytu, z podwojeniem w godzinach szczytu w dni powszednie (01:00-04:00 i 06:00-10:00 UTC); wszystkie pozostałe godziny, w tym weekendy, są poza godzinami szczytu.

kont.1M tokenów
Maks. wyjście384K
Wejścietext + image
Wyjścietext
p50 TTFT412 ms
WEJŚCIE$0.15/ 1M tokenów
WYJŚCIE$0.60/ 1M tokenów
p50 TTFT412 ms7 d
p95 TTFT1.60 s7 d
RUCH299.5Mtokenów / 7 d

DeepSeek V4.1 Flash to model DeepSeek dostępny przez OrcaRouter, bramę API zgodną z OpenAI. Przyjmuje dane wejściowe w formie tekstu i obrazów, ma okno kontekstowe wynoszące 1 048 576 tokenów i może…

Czym jest DeepSeek V4.1 Flash?

Dla kogo jest przeznaczony DeepSeek V4.1 Flash?

Dlaczego okno kontekstu o rozmiarze 1,048,576 tokenów ma znaczenie?

Przykłady kodu

Wywołuj z dowolnego SDK

Zgodne z OpenAI — zostań przy swoim SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Anthropic SDKhttps://api.orcarouter.ai
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Obsługiwane parametry

  • include_reasoning
  • logprobs
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • stop
  • stream
  • stream_options
  • temperature
  • thinking
  • tool_choice
  • tools
  • top_logprobs
  • top_p
  • user_id

Cennik

Cennik
Wejście / 1M tokenów · Poza szczytem$0.150
Wyjście / 1M tokenów · Poza szczytem$0.600
Odczyt cache / 1M · Poza szczytem$0.0030
Godziny szczytu01:00–04:00, 06:00–10:00 ×2 (UTC)
Wejście / 1M tokenów · ×2$0.300
Wyjście / 1M tokenów · ×2$1.20
Odczyt cache / 1M · ×2$0.0060
WalutaUSD

Kalkulator kosztów

Tokeny / miesiąc10MM
Udział wejścia70%%
Szacunkowo / miesiąc $2.85 · Z cache promptów $2.34

Szacunek na podstawie cennika

Kalkulator tokenów i kosztów

Tokeny wejściowe: 19Koszt na żądanie: $0.000303

Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.

Wydajność

p50 TTFT
412 ms
Prędkość wyjścia
215 tok/s
p95 TTFT
1.60 s
Wskaźnik błędów
0.07%

Publiczne benchmarki

Agents' Last Exam
31.8
Automation-Bench
54.8
BabyVision (with tools)
89.6
Chartography (with tools)
78.9
CyberGym
88.1
DeepSWE v1.1
74.2
ExploitGym
15.3
GPQA Diamond
90.9
HLE
36.8
HLE (with tools)
63.9
MathArena Apex
65.6
NL2Repo-Bench
65.4
ProgramBench
20.3
SEC-Bench Pro
62.8
Terminal-Bench 2.1
90.6
Terminal-Bench 3.0
30.0
Terminal-Bench 4.0
31.2
ZeroBench-main (with tools)
49.0
Źródło: api-docs.deepseek.com

Aktywność społeczności

O czym mówią programiści w tym tygodniu

Hacker News13 wzmianek · 7 dniwzrost o 13 wobec poprzedniego tygodnia

Porównanie

DeepSeek V4.1 FlashDeepSeek V4 ProDeepSeek V4 FlashDeepSeek V4 Flash Vision (Exp)
Wejście $/M$0.15$0.73$0.24$0.24
Wyjście $/M$0.60$2.18$0.73$0.73
Kontekst1.0M1.0M1.0M1.0M
Jakość8/108/107/107/10
Porównaj obok siebiePorównaj obok siebiePorównaj obok siebiePorównaj obok siebie

FAQ

Ile kosztuje DeepSeek V4.1 Flash na OrcaRouter?
OrcaRouter rozlicza DeepSeek V4.1 Flash według stawki $0.15 za 1M tokenów wejściowych i $0.60 za 1M tokenów wyjściowych, przekazywanej po stawce dostawcy bez marży. Nie ma osobno opisanej opłaty za samo okno kontekstowe: 1 048 576 tokenów to limit, a nie opłata. Tokeny wejściowe obejmują tekst, obrazy i historię rozmowy, którą wysyłasz; tokeny wyjściowe obejmują wszystko, co zostanie wygenerowane, do 384 000 tokenów.
Jak duże są okno kontekstowe i maksymalny rozmiar danych wyjściowych?
DeepSeek V4.1 Flash ma okno kontekstowe o rozmiarze 1 048 576 tokenów i maksymalny limit wyjściowy wynoszący 384 000 tokenów. Okno wejściowe pozwala przesłać całe dokumenty, transkrypcje lub migawki repozytorium w jednym wywołaniu, natomiast limit wyjściowy obsługuje długie artefakty generowane w jednym przebiegu, takie jak specyfikacje, plany migracji lub rozbudowane diffy.
W czym DeepSeek V4.1 Flash jest najlepszy?
Jest stworzony do pracy z długimi danymi wejściowymi i długimi danymi wyjściowymi: analizy całych dokumentów, rozumienia kodu w dużych repozytoriach, multimodalnego przeglądu tekstu i obrazów oraz przepływów pracy, które wymagają obszernych generowanych odpowiedzi, a nie krótkich odpowiedzi. Jego wynik 90,9 w GPQA Diamond również wskazuje na solidne rozumowanie naukowe i techniczne na poziomie studiów magisterskich. Wejście obsługuje zarówno tekst, jak i obrazy; wyjście to wyłącznie tekst.
Jak wypada w porównaniu z większymi modelami frontier?
Modele frontier mogą przodować w najtrudniejszych benchmarkach rozumowania i zazwyczaj pobierają wyższą opłatę za token, podczas gdy DeepSeek V4.1 Flash oferuje okno kontekstowe o rozmiarze 1 048 576 tokenów oraz limit wyjściowy wynoszący 384 000 tokenów przy $0.15 za 1M tokenów wejściowych i $0.60 za 1M tokenów wyjściowych. W przypadku pracy z długim kontekstem i dużym wolumenem często jest to praktyczny wybór; w przypadku najtrudniejszych pojedynczych kroków rozumowania kierowanie tych wywołań do droższego modelu w OrcaRouter jest rozsądnym wzorcem.
Jak są obsługiwane dane, gdy wywołuję ten model?
OrcaRouter kieruje żądania do API DeepSeek i rozlicza według stawki dostawcy z zerową marżą. Zasady przechowywania, wykorzystywania do trenowania i powiązane warunki podlegają politykom dostawcy, a nie odrębnemu uzgodnieniu opisanemu tutaj, więc przed wysłaniem wrażliwych materiałów potwierdź aktualne warunki dostawcy. Usuwaj identyfikatory, których nie potrzebujesz, i ograniczaj prompty do minimum wymaganego przez zadanie; mniejszy kontekst obniża także koszt danych wejściowych wynoszący 0,15 USD za 1 mln tokenów.
Jak mogę to wywołać przez API zgodne z OpenAI?
Ustaw bazowy adres URL swojego klienta na https://api.orcarouter.ai/v1 i użyj identyfikatora modelu deepseek/deepseek-v4.1-flash z kluczem API OrcaRouter. Żądania i odpowiedzi są zgodne ze schematem OpenAI chat completions, więc istniejące zestawy SDK, obsługa strumieniowania i parsowanie wywołań narzędzi działają bez zmian. Migracja zwykle polega na zmianie bazowego adresu URL i ciągu modelu oraz ponownym uruchomieniu zestawu ewaluacyjnego.
Czy DeepSeek V4.1 Flash obsługuje obrazy?
Tak. Dane wejściowe obrazów są obsługiwane przez standardową multimodalną tablicę treści, z częściami tekstowymi i obrazowymi w tej samej wiadomości użytkownika. Tokeny obrazów liczą się jako dane wejściowe i są rozliczane według stawki $0.15 za 1M tokenów wejściowych w OrcaRouter. Dane wyjściowe pozostają wyłącznie tekstowe, więc model opisuje lub wyodrębnia treści z obrazów, a nie je generuje.
Czy wynik 90,9 w GPQA Diamond wystarczy, aby zaufać mu w moim zadaniu?
To użyteczny sygnał, a nie gwarancja. GPQA Diamond mierzy rozumowanie naukowe na poziomie absolwenta w ustalonym formacie promptu, co ma znaczenie w odpowiadaniu na pytania techniczne, ale niewiele mówi o przywoływaniu z długiego kontekstu, tonie czy dokładności ekstrakcji na Twoich danych. Zbuduj niewielki zestaw ewaluacyjny na podstawie rzeczywistych danych wejściowych, uruchom go w odniesieniu do DeepSeek V4.1 Flash i wszelkich alternatywnych identyfikatorów modeli w OrcaRouter, a następnie porównaj koszt i jakość przed kierowaniem ruchu produkcyjnego.

Osadź tę odznakę

DeepSeek: DeepSeek V4.1 Flash$0.15/M in412ms p50przez OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg" alt="DeepSeek: DeepSeek V4.1 Flash w OrcaRouter" /> </a>
Markdown [![DeepSeek: DeepSeek V4.1 Flash](https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg)](https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash)

Karta modelu jako dane

GET /api/public/models/deepseek/deepseek-v4.1-flashOtwórz
Odczyt maszynowy:/llms.txt/llms-full.txt