Karta tytułowa hero z napisem „Cennik DeepSeek V4.1 Flash”, wierszem „$0.15 za wejście, $0.60 za wyjście, $0.003 za trafienie w cache”, podpisem „Za 1 mln tokenów, poza godzinami szczytu. W godzinach szczytu każda stawka jest podwajana.” oraz trzema kartami z napisami „Trafienie w cache: 50 razy taniej niż chybienie”, „Kontekst 1 mln tokenów” i „Otwarte wagi, licencja MIT”.
Guides & Insights

DeepSeek V4.1 Flash — cennik: pełna tabela stawek i liczba trafień w pamięć podręczną, która decyduje o wysokości Twojego rachunku

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

DeepSeek V4.1 Flash jest ogólnie dostępny od 2026-09-10, a na dziś jego opublikowany cennik jest najtańszą pozycją w najwyższej klasie rynku modeli: 0,15 USD za milion tokenów wejściowych, 0,60 USD za milion wyjściowych i 0,003 USD za milion przy trafieniach w pamięć podręczną. Te trzy liczby to kolumna poza szczytem. W dni powszednie w oknach szczytu DeepSeek każda z nich się podwaja, łącznie z trafieniami w pamięć podręczną. Porównanie, które ma znaczenie, nie dotyczy własnego starzejącego się flagowca DeepSeek — DeepSeek-V4-Pro-0813 ma cennik 0,66 USD / 1,98 USD za milion poza szczytem, więc Flash jest tańszy od własnego brata o około 4x na wejściu — lecz zamkniętej czołówki, z którą nabywcy faktycznie porównują ceny: GPT-5.6 Sol, Claude Opus 5 i Gemini 3.8 Flash, z których każdy liczy sobie o rząd wielkości więcej za token.

Jedna poprawka przed liczbami, bo przeciek, który poprzedził tę premierę, wciąż krąży. Liczby, które rozeszły się przed GA, opisywały obniżkę cen mającą wejść w życie „jutro”. Ceny są prawdziwe; sposób ich przedstawienia już nie. V4.1 Flash zadebiutował 10 września 2026 r., a te stawki już wtedy obowiązywały; własny changelog DeepSeek odnotowuje obniżkę jako część wydania, a nie późniejsze cięcie. Wszystko poniżej odczytano z aktualnej strony cennika DeepSeek dzisiaj, 16 września 2026 r.

Pełna karta stawek, na dzień 2026-09-16

DeepSeek publikuje jeden arkusz obejmujący bieżące SKU, w którym każda pozycja jest podzielona na kolumnę szczytową i pozaszczytową. Dla identyfikatora modelu deepseek-flash, który obsługuje DeepSeek-V4.1-Flash, opublikowane stawki wynoszą:

Wejście, chybienie pamięci podręcznej — 0,15 USD za 1 mln tokenów poza szczytem; 0,30 USD za 1 mln w szczycie

Wejście, trafienie w cache — $0,003 za 1 mln tokenów poza godzinami szczytu; $0,006 za 1 mln w godzinach szczytu

Dane wyjściowe — $0,60 za 1 mln tokenów poza godzinami szczytu; $1,20 za 1 mln w godzinach szczytu

Okno kontekstowe — 1 mln tokenów, z maksymalnym wyjściem 384K

Limit współbieżności — 2 500 współbieżnych żądań w SKU Flash

Starsze identyfikatory modelideepseek-v4-flash i deepseek-v4-flash-vision-exp zostały wycofane jako osobne produkty, ale nadal są kierowane do V4.1 Flash i rozliczane po cenach Flash

Różnica między dwoma pierwszymi wierszami to cała historia tego arkusza. Trafienie w pamięć podręczną kosztuje 50 razy mniej niż chybienie poza godzinami szczytu — 98% zniżki, co również odzwierciedla Artificial Analysis w swoim modelu kosztów. Nic innego na karcie nie zmienia rachunku aż tak bardzo.

Single-column scoreboard card titled 'DeepSeek V4.1 Flash — the rate card, 2026-09-16', with rows reading 'Off-peak input: $0.15 / 1M tokens', 'Off-peak output: $0.60 / 1M tokens', 'Cache hit: $0.003 / 1M tokens', 'Peak hours: 2x every rate', 'Context window: 1M tokens' and 'Weights: MIT, open', over the footer 'All figures from DeepSeek's published API pricing page, 2026-09-16.'Screenshot of DeepSeek's own Models & Pricing page, showing the deepseek-flash and deepseek-v4-pro columns side by side under MODEL VERSION DeepSeek-V4.1-Flash and DeepSeek-V4-Pro-0813, with 1M context and 384K max output for both, Vision supported on Flash but not on V4 Pro, and the pricing block reading cache-hit input $0.003 off-peak / $0.006 peak against $0.022 / $0.044, cache-miss input $0.15 / $0.3 against $0.66 / $1.32, and output $0.6 / $1.2 against $1.98 / $3.96, above a concurrency limit row of 2500 and 500

Szczyt nie jest błędem zaokrągleń, a jego czas jest dostosowany do Pekinu

Okna szczytowe DeepSeek to od poniedziałku do piątku, 01:00–04:00 UTC oraz 06:00–10:00 UTC. Wszystko poza nimi — w tym wszystkie godziny weekendowe — jest rozliczane według połowy stawki. Podwojenie dotyczy wszystkich trzech pozycji, więc chybienie pamięci podręcznej w godzinach szczytu kosztuje 0,30 USD, a dane wyjściowe w godzinach szczytu kosztują 1,20 USD.

To, gdzie wypadają te okna, zależy wyłącznie od tego, gdzie jesteś. W Pekinie to 09:00–12:00 i 14:00–18:00 — dwa bloki pracy, i o to właśnie chodzi. W Berlinie we wrześniu drugie okno to 08:00–12:00 CEST: cały poranek europejskiego zespołu to godziny szczytu. W Nowym Jorku to samo okno to 02:00–06:00 EDT. Zespół z USA pracujący w normalnych godzinach w praktyce nigdy nie jest rozliczany według stawek szczytowych, a zespół z UE płaci podwójnie każdego ranka przed lunchem. Jeśli wybierasz, kiedy uruchomić zadanie wsadowe, to decyzja warta 0,15 USD za milion tokenów, a jej podjęcie nic nie kosztuje.

Co cennik trafień w pamięci podręcznej faktycznie robi z rachunkiem agenta

Trafienia w pamięć podręczną są automatyczne w DeepSeek — dokumentacja mówi, że buforowanie dyskowe jest domyślnie włączone dla wszystkich użytkowników bez zmian w kodzie — więc zniżka nie jest czymś, co trzeba projektować architektonicznie. Jest to również rozwiązanie typu best-effort, a nie gwarantowane: DeepSeek podaje, że nie ma stałego TTL, nieużywana pamięć podręczna jest czyszczona „zwykle w ciągu kilku godzin do kilku dni", a system nie obiecuje 100% współczynnika trafień. Warto przeczytać w odpowiedzi pola prompt_cache_hit_tokens i prompt_cache_miss_tokens, zanim cokolwiek na tym oprzesz.

Arytmetyka ma większe znaczenie niż przymiotnik. Weźmy agenta do kodowania ze stabilnym prefiksem o rozmiarze 40 000 tokenów — prompt systemowy, schematy narzędzi, kontekst repozytorium — działającego w sesji liczącej 60 tur, w której każda tura dodaje około 2 000 tokenów danych wyjściowych narzędzi, a model generuje około 1 200 tokenów. Łączne wejście w całej sesji to 5,94 mln tokenów, a łączne wyjście to 72 000 tokenów.

Rozliczenie bez żadnego buforowania, poza godzinami szczytu: 5,94 mln tokenów wejściowych po $0,15 to $0,891, plus 72 000 tokenów wyjściowych po $0,60 to $0,043 — około $0,93 za sesję.

Rozliczenie z prefiksem w pamięci podręcznej, co faktycznie dzieje się domyślnie: 5,782 mln z tych tokenów wejściowych to trafienia w pamięci podręcznej po $0,003 ($0,017), 158 000 to chybienia pamięci podręcznej po $0,15 ($0,024), a koszt tych samych 72 000 tokenów wyjściowych wynosi $0,043. Około $0,084 — około 11 razy taniej. Udział danych wejściowych spada z 95% rachunku do 49%, sama zbuforowana część to 21%, a tokeny wyjściowe stają się największą pojedynczą pozycją. Ten sam model, ta sama sesja, ten sam wynik — zmieniło się tylko to, czy prefiks został ponownie użyty.

Zauważ, czego nie ma w cenniku DeepSeeka: pozycji zapisu do pamięci podręcznej. Anthropic pobiera 1,25x bazowej stawki za wejście za zapełnienie 5-minutowej pamięci podręcznej i 2x za godzinę; karta DeepSeeka wymienia tylko trafienia i chybienia, a jego przewodnik po buforowaniu nie opisuje żadnej opłaty za zapis ani przechowywanie. Jeśli porównujesz ekonomikę buforowania u różnych dostawców, a nie tylko nagłówkowe stawki za tokeny, ten brak jest wart więcej, niż sugeruje 50-krotny rabat za trafienie.

To także powód, dla którego szczegół dotyczący przekazywania cen w DeepSeek V4.1 Flash w OrcaRouter ma tu znaczenie. Rozliczamy według ceny katalogowej samego dostawcy, bez żadnej marży, więc zmiana ceny u dostawcy obowiązuje u nas tego samego dnia, zamiast czekać na aktualizację cennika — a widoczne powyżej kolumny trafień w pamięć podręczną oraz szczytu/poza szczytem to te, według których faktycznie naliczane są opłaty, a nie ich uśrednione przybliżenie.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model id, Vision / Tools / JSON / Reasoning tags, a 2026-09-10 release date, 1M-token context, 384K max output, text + image input, text output, $0.15 input and $0.60 output per 1M tokens, a p50 time to first token of 784 ms, a p95 of 2.95 s, 59,150.9M tokens of traffic over seven days, and body text stating OrcaRouter bills at the provider rate with zero markup added

W porównaniu z DeepSeek-V4-Pro-0813: czterokrotna różnica i wycofanie, do którego nie doszło

Oczywistym wewnętrznym porównaniem jest flagowy SKU i wypada ono mniej dramatycznie, niż sugeruje stawka z nagłówka. DeepSeek-V4-Pro-0813, identyfikator modelu deepseek-v4-pro, ma cennik na poziomie 0,66 USD za 1 mln tokenów wejściowych przy chybieniu w pamięci podręcznej i 1,98 USD za 1 mln tokenów wyjściowych poza szczytem, a w szczycie stawki podwajają się do 1,32 USD i 3,96 USD. Trafienia w pamięć podręczną kosztują 0,022 USD poza szczytem — ponad 7 razy więcej niż w Flash.

Dane wejściowe bez trafienia w cache — 0,15 USD vs 0,66 USD poza szczytem, więc Flash jest 4,4x tańszy

Dane wyjściowe — $0.60 vs $1.98 poza szczytem, więc Flash jest 3,3 razy tańszy

Wejście z trafieniem w pamięć podręczną — $0,003 vs $0,022 poza godzinami szczytu, więc Flash jest 7,3 razy tańszy

Limit kontekstu i wyjścia — identyczny przy 1M i 384K w obu SKU

Współbieżność — 2 500 w Flash wobec 500 w V4 Pro, pięciokrotna różnica, która całkowicie znika z cennika

Trzy rzeczy w tym porównaniu łatwo jest źle zrozumieć. Po pierwsze, argument za ponownym wykorzystaniem jest silniejszy w przypadku flagowca w ujęciu bezwzględnym, mimo że to Flash ma większy mnożnik: buforowanie miliona tokenów oszczędza 0,638 USD w przypadku V4 Pro i 0,147 USD w przypadku Flash, ponieważ wskaźnik nietrafień flagowca jest znacznie wyższy już na starcie. Po drugie, model, którego wszyscy spodziewali się, że zniknie, nie zniknął: DeepSeek ogłosił, że 14.09.2026 przestanie obsługiwać V4 Pro i przekieruje te żądania do modelu Flash, wywołał oburzenie deweloperów z powodu podmiany modelu backendowego w produkcyjnych przepływach pracy i 11.09.2026 wycofał tę decyzję. V4 Pro jest nadal obsługiwany, przy niezmienionym rozliczaniu. Po trzecie — i to jest pułapka, w którą wpadły materiały o wycieku — nie ma wydanego V4.1 Pro. DeepSeek-V4-Pro-0813 pozostaje flagowym SKU, a dostawca nie wypuścił następcy pod tą nazwą. Każdy, kto wycenia migrację do „V4.1 Pro”, wycenia model, który nie istnieje.

W porównaniu z zamkniętym poziomem frontier

W porównaniu z zamkniętymi modelami, które nabywcy faktycznie biorą pod uwagę na krótkiej liście, najważniejszy jest mnożnik. Wszystkie poniższe liczby pochodzą z opublikowanych dzisiaj stron cennikowych poszczególnych dostawców.

GPT-5.6 Sol — w cenniku po 5,00 USD za 1 mln tokenów wejściowych i 30,00 USD za 1 mln tokenów wyjściowych w warstwie krótkiego kontekstu OpenAI; obecnie obowiązuje promocyjna stawka 4,00 USD / 20,00 USD, która według OpenAI jest dostępna co najmniej do 2026-11-21, a wejście z pamięci podręcznej kosztuje 0,40 USD. W porównaniu ze stawką promocyjną DeepSeek V4.1 Flash jest 26,7x tańszy na wejściu i 33,3x na wyjściu; wobec cennika — 33x i 50x. Trafienie w pamięć podręczną Sol kosztuje 133x tyle, ile trafienie w pamięć podręczną Flash.

Claude Opus 5 — 5,00 USD za 1 mln tokenów wejściowych i 25,00 USD za 1 mln tokenów wyjściowych, a trafienia w pamięć podręczną po 0,50 USD za 1 mln w opublikowanym cenniku Anthropic. To 33-krotność stawki Flasha za wejście, 42-krotność jego stawki za wyjście i 167-krotność jego stawki za trafienia w pamięć podręczną. Zapisy do 5-minutowej pamięci podręcznej Anthropic dodają jeszcze 1,25x; cennik DeepSeek nie ma odpowiednika tej pozycji.

Gemini 3.8 Flash — 0,75 USD za 1 mln tokenów wejściowych i 3,75 USD za 1 mln tokenów wyjściowych do 31.12.2026, przy czym obie stawki mają się podwoić 1 stycznia 2027 r., wejście z pamięci podręcznej po 0,075 USD oraz — to jest pozycja, która powtarza się na prawdziwym rachunku — pamięci podręcznej przechowywanie po 0,50 USD za 1 mln tokenów na godzinę. Flash jest 5 razy tańszy na wejściu, 6,25 razy na wyjściu i 25 razy na trafieniach w pamięci podręcznej w porównaniu z nim, a DeepSeek nie pobiera żadnych opłat za przechowywanie pamięci podręcznej.

Kontekst możliwości jest tym, co sprawia, że to pozostaje uczciwe. W Intelligence Index v4.3 firmy Artificial Analysis DeepSeek V4.1 Flash (rozumowanie, maksymalny wysiłek) uzyskuje wynik 40 i zajmuje 6. miejsce na 113 modeli, przy 0,27 USD za zadanie w indeksie i 214,4 tokenu wyjściowego na sekundę. To naprawdę pozycja na pograniczu czołówki w cenie 26 razy niższej niż poziom, z którym jest porównywana — ale ten sam pomiar pokazuje, że to jeden z najbardziej gadatliwych modeli, jakie AA testowało, generujący 250 mln tokenów wyjściowych w całym przebiegu indeksu wobec mediany wynoszącej 140 mln. Gadatliwość nie zmienia ceny za token, ale zmienia rachunek. Model, który generuje o 62% więcej tokenów niż mediana, i tak kosztuje tu znacznie mniej, ale „tanie za token” i „tanie za zadanie” to różne twierdzenia, a płacisz tylko za to drugie.

Czy jest darmowy plan?

Nie. Strona z cennikiem samego DeepSeek nie dokumentuje żadnego darmowego poziomu API, darmowego miesięcznego limitu ani darmowego modelu — rozliczenie odbywa się w modelu pay-as-you-go względem doładowanego lub przyznanego salda, przy czym przyznane saldo jest zużywane jako pierwsze. Aplikacja czatu dla konsumentów jest darmowa; API stojące za deepseek-flash nie jest, a na platformie DeepSeek nie ma dla niego darmowego punktu końcowego. Kilka bram firm trzecich reklamuje darmowy lub próbny dostęp do tego modelu, a my traktowalibyśmy je wszystkie jako środowiska prototypowania, a nie produkcyjne backendy, ponieważ warunki te zmieniają się bez powiadomienia i żadna z nich nie ma własnego cennika dostawcy.

Twierdzenia o wydajności kryjące się za ceną

Cena nie jest subsydium, przynajmniej według samego DeepSeek. Karta modelu i raport techniczny dostawcy opisują V4.1 Flash jako mieszaninę ekspertów o 552B parametrów w układzie przyczynowego enkodera-dekodera, która aktywuje około 8B parametrów na token podczas prefillu i 16B podczas dekodowania — asymetryczną z założenia, tanią w odczycie i droższą w zapisie. Po stronie pamięci DeepSeek podaje globalną pamięć podręczną KV o rozmiarze około 890 bajtów na token, czyli około jednej czwartej tego w DeepSeek-V4-Flash, oraz trwały ślad pamięci podręcznej około jednej ósmej tego rozmiaru przy identycznych obciążeniach, osiągnięty przez odrzucanie stanu okna przesuwnego i odtwarzanie ostatnich 128 tokenów przy trafieniu. Są to pomiary raportowane przez dostawcę na jego własnym sprzęcie, a raport techniczny nie twierdzi, że ścieżka odtwarzania jest matematycznie równoważna pełnemu obliczeniu.

Liczba parametrów to jedyna wartość w tym wydaniu, która jest naprawdę nieustalona, i warto dokładnie wyjaśnić dlaczego. Proza DeepSeeka podaje 552B i to jest szkielet — część, która wykonuje obliczenia. Obok niego znajduje się Engram, warunkowa tablica wyszukiwania pamięci, którą karta modelu szacuje na 196B parametrów, dostępna przez wyszukiwanie tokenów, a nie obliczana. Dodaj je do siebie, a otrzymasz blisko 748B, co jest liczbą, za którą w ciągu kilku godzin od udostępnienia wag opowiadała się szeroko czytana analiza społeczności na r/LocalLLaMA, a którą panel plików samego repozytorium Hugging Face wypycha jeszcze wyżej, w stronę 763B. Społecznościowe opisy wdrożeń doliczyły się checkpointu o rozmiarze około 510 GB w 48 shardach, dostarczanego natywnie skwantyzowanego jako gęste wagi FP8 z ekspertami FP4. Traktuj sumę jako sporną, a wartość szkieletu jako raportowaną przez dostawcę. To liczba aktywnych parametrów decyduje o szybkości; wagi rezydujące decydują o tym, czy model w ogóle się uruchomi.

Samodzielne hostowanie jest realną alternatywą dla tej ceny, na licencji MIT

Wagi znajdują się pod adresem deepseek-ai/DeepSeek-V4.1-Flash na licencji MIT, która zezwala na użycie komercyjne, modyfikację i redystrybucję. To sprawia, że cennik API jest wyborem, a nie opłatą za przejazd: w przypadku MIT nic w licencji nie zabrania samodzielnego hostowania tego modelu i płacenia za moc obliczeniową zamiast za tokeny.

Nie sprawia to jednak, że jest to tanie. Checkpoint to około 510 GB wag rezydujących w pamięci przed uwzględnieniem pamięci podręcznej i aktywacji, DeepSeek nigdzie w repozytorium nie podaje wymagań dotyczących GPU, a społecznościowe opisy wdrożeń wskazują, że praktyczne minimum to węzeł z wieloma GPU, a nie stacja robocza. Trzy stosy serwowania udostępniły wsparcie w dniu premiery 10 września 2026 r. — vLLM, SGLang z Miles oraz opartą na vLLM adaptację NeuWare firmy Cambricon dla jej własnych akceleratorów — ale w dniu premiery vLLM i SGLang udostępniły dedykowane obrazy podglądowe, a nie oficjalne pakiety, a llama.cpp nie scaliło jeszcze wsparcia architektury V4.1. Samodzielne hostowanie na sprzęcie konsumenckim nie jest dziś alternatywą dla ceny API; jest nią wynajęty węzeł z 8 GPU. Jeśli Twój wolumen jest wystarczająco duży, by to zamortyzować, licencja na to pozwala; jeśli nie, 0,15 USD za milion tokenów jest tańszą odpowiedzią i nie ma tu nawet porównania.

Co tak naprawdę każe ci zdecydować cennik stawek

Trzy rzeczy, w kolejności od tego, jak duże pieniądze przesuwają. Utrzymuj stabilny prefiks promptu i pozwól pamięci podręcznej robić swoje — jest automatyczna, daje 50-krotną zniżkę, a w pętli agenta na 60 tur zamienia sesję za 0,93 USD w sesję za 0,084 USD. Uruchamiaj ruch wsadowy w dni robocze poza godzinami 01:00–04:00 i 06:00–10:00 UTC, co dla zespołu z USA nic nie zmienia, a dla zespołu europejskiego oznacza przeniesienie porannego zadania na popołudnie. A jeśli wyceniasz to w porównaniu z flagowym modelem samego DeepSeek, pamiętaj, że flagowy model jest nadal w promocji — planowane wycofanie zostało odwołane 2026-09-11, oba SKU korzystają z jednego klucza, a przełączenie między nimi to zmiana identyfikatora modelu, a nie migracja.

Cennik nie mówi ci, czy model jest wystarczająco dobry do twojego obciążenia, a dane na ten temat są nowsze i uboższe niż arkusz cenowy. Pozycja w indeksie Artificial Analysis to pojedynczy pomiar przy maksymalnym wysiłku rozumowania, wiersze benchmarków dostawcy są zgłaszane przez dostawcę, a liczba parametrów jest sporna. Cena jest ustaloną częścią tego wydania. Wyceń swoją migrację na jej podstawie i przetestuj możliwości, zanim się na nią zdecydujesz.

Porównane w tym artykule4

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie