
DeepSeek V4.1 Flash — cennik: pełna tabela stawek i liczba trafień w pamięć podręczną, która decyduje o wysokości Twojego rachunku
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 177 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1323 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
DeepSeek V4.1 Flash jest ogólnie dostępny od 2026-09-10, a na dziś jego opublikowany cennik jest najtańszą pozycją w najwyższej klasie rynku modeli: 0,15 USD za milion tokenów wejściowych, 0,60 USD za milion wyjściowych i 0,003 USD za milion przy trafieniach w pamięć podręczną. Te trzy liczby to kolumna poza szczytem. W dni powszednie w oknach szczytu DeepSeek każda z nich się podwaja, łącznie z trafieniami w pamięć podręczną. Porównanie, które ma znaczenie, nie dotyczy własnego starzejącego się flagowca DeepSeek — DeepSeek-V4-Pro-0813 ma cennik 0,66 USD / 1,98 USD za milion poza szczytem, więc Flash jest tańszy od własnego brata o około 4x na wejściu — lecz zamkniętej czołówki, z którą nabywcy faktycznie porównują ceny: GPT-5.6 Sol, Claude Opus 5 i Gemini 3.8 Flash, z których każdy liczy sobie o rząd wielkości więcej za token.
Jedna poprawka przed liczbami, bo przeciek, który poprzedził tę premierę, wciąż krąży. Liczby, które rozeszły się przed GA, opisywały obniżkę cen mającą wejść w życie „jutro”. Ceny są prawdziwe; sposób ich przedstawienia już nie. V4.1 Flash zadebiutował 10 września 2026 r., a te stawki już wtedy obowiązywały; własny changelog DeepSeek odnotowuje obniżkę jako część wydania, a nie późniejsze cięcie. Wszystko poniżej odczytano z aktualnej strony cennika DeepSeek dzisiaj, 16 września 2026 r.
Pełna karta stawek, na dzień 2026-09-16
DeepSeek publikuje jeden arkusz obejmujący bieżące SKU, w którym każda pozycja jest podzielona na kolumnę szczytową i pozaszczytową. Dla identyfikatora modelu deepseek-flash, który obsługuje DeepSeek-V4.1-Flash, opublikowane stawki wynoszą:
• Wejście, chybienie pamięci podręcznej — 0,15 USD za 1 mln tokenów poza szczytem; 0,30 USD za 1 mln w szczycie
• Wejście, trafienie w cache — $0,003 za 1 mln tokenów poza godzinami szczytu; $0,006 za 1 mln w godzinach szczytu
• Dane wyjściowe — $0,60 za 1 mln tokenów poza godzinami szczytu; $1,20 za 1 mln w godzinach szczytu
• Okno kontekstowe — 1 mln tokenów, z maksymalnym wyjściem 384K
• Limit współbieżności — 2 500 współbieżnych żądań w SKU Flash
• Starsze identyfikatory modeli — deepseek-v4-flash i deepseek-v4-flash-vision-exp zostały wycofane jako osobne produkty, ale nadal są kierowane do V4.1 Flash i rozliczane po cenach Flash
Różnica między dwoma pierwszymi wierszami to cała historia tego arkusza. Trafienie w pamięć podręczną kosztuje 50 razy mniej niż chybienie poza godzinami szczytu — 98% zniżki, co również odzwierciedla Artificial Analysis w swoim modelu kosztów. Nic innego na karcie nie zmienia rachunku aż tak bardzo.


Szczyt nie jest błędem zaokrągleń, a jego czas jest dostosowany do Pekinu
Okna szczytowe DeepSeek to od poniedziałku do piątku, 01:00–04:00 UTC oraz 06:00–10:00 UTC. Wszystko poza nimi — w tym wszystkie godziny weekendowe — jest rozliczane według połowy stawki. Podwojenie dotyczy wszystkich trzech pozycji, więc chybienie pamięci podręcznej w godzinach szczytu kosztuje 0,30 USD, a dane wyjściowe w godzinach szczytu kosztują 1,20 USD.
To, gdzie wypadają te okna, zależy wyłącznie od tego, gdzie jesteś. W Pekinie to 09:00–12:00 i 14:00–18:00 — dwa bloki pracy, i o to właśnie chodzi. W Berlinie we wrześniu drugie okno to 08:00–12:00 CEST: cały poranek europejskiego zespołu to godziny szczytu. W Nowym Jorku to samo okno to 02:00–06:00 EDT. Zespół z USA pracujący w normalnych godzinach w praktyce nigdy nie jest rozliczany według stawek szczytowych, a zespół z UE płaci podwójnie każdego ranka przed lunchem. Jeśli wybierasz, kiedy uruchomić zadanie wsadowe, to decyzja warta 0,15 USD za milion tokenów, a jej podjęcie nic nie kosztuje.
Co cennik trafień w pamięci podręcznej faktycznie robi z rachunkiem agenta
Trafienia w pamięć podręczną są automatyczne w DeepSeek — dokumentacja mówi, że buforowanie dyskowe jest domyślnie włączone dla wszystkich użytkowników bez zmian w kodzie — więc zniżka nie jest czymś, co trzeba projektować architektonicznie. Jest to również rozwiązanie typu best-effort, a nie gwarantowane: DeepSeek podaje, że nie ma stałego TTL, nieużywana pamięć podręczna jest czyszczona „zwykle w ciągu kilku godzin do kilku dni", a system nie obiecuje 100% współczynnika trafień. Warto przeczytać w odpowiedzi pola prompt_cache_hit_tokens i prompt_cache_miss_tokens, zanim cokolwiek na tym oprzesz.
Arytmetyka ma większe znaczenie niż przymiotnik. Weźmy agenta do kodowania ze stabilnym prefiksem o rozmiarze 40 000 tokenów — prompt systemowy, schematy narzędzi, kontekst repozytorium — działającego w sesji liczącej 60 tur, w której każda tura dodaje około 2 000 tokenów danych wyjściowych narzędzi, a model generuje około 1 200 tokenów. Łączne wejście w całej sesji to 5,94 mln tokenów, a łączne wyjście to 72 000 tokenów.
Rozliczenie bez żadnego buforowania, poza godzinami szczytu: 5,94 mln tokenów wejściowych po $0,15 to $0,891, plus 72 000 tokenów wyjściowych po $0,60 to $0,043 — około $0,93 za sesję.
Rozliczenie z prefiksem w pamięci podręcznej, co faktycznie dzieje się domyślnie: 5,782 mln z tych tokenów wejściowych to trafienia w pamięci podręcznej po $0,003 ($0,017), 158 000 to chybienia pamięci podręcznej po $0,15 ($0,024), a koszt tych samych 72 000 tokenów wyjściowych wynosi $0,043. Około $0,084 — około 11 razy taniej. Udział danych wejściowych spada z 95% rachunku do 49%, sama zbuforowana część to 21%, a tokeny wyjściowe stają się największą pojedynczą pozycją. Ten sam model, ta sama sesja, ten sam wynik — zmieniło się tylko to, czy prefiks został ponownie użyty.
Zauważ, czego nie ma w cenniku DeepSeeka: pozycji zapisu do pamięci podręcznej. Anthropic pobiera 1,25x bazowej stawki za wejście za zapełnienie 5-minutowej pamięci podręcznej i 2x za godzinę; karta DeepSeeka wymienia tylko trafienia i chybienia, a jego przewodnik po buforowaniu nie opisuje żadnej opłaty za zapis ani przechowywanie. Jeśli porównujesz ekonomikę buforowania u różnych dostawców, a nie tylko nagłówkowe stawki za tokeny, ten brak jest wart więcej, niż sugeruje 50-krotny rabat za trafienie.
To także powód, dla którego szczegół dotyczący przekazywania cen w DeepSeek V4.1 Flash w OrcaRouter ma tu znaczenie. Rozliczamy według ceny katalogowej samego dostawcy, bez żadnej marży, więc zmiana ceny u dostawcy obowiązuje u nas tego samego dnia, zamiast czekać na aktualizację cennika — a widoczne powyżej kolumny trafień w pamięć podręczną oraz szczytu/poza szczytem to te, według których faktycznie naliczane są opłaty, a nie ich uśrednione przybliżenie.

W porównaniu z DeepSeek-V4-Pro-0813: czterokrotna różnica i wycofanie, do którego nie doszło
Oczywistym wewnętrznym porównaniem jest flagowy SKU i wypada ono mniej dramatycznie, niż sugeruje stawka z nagłówka. DeepSeek-V4-Pro-0813, identyfikator modelu deepseek-v4-pro, ma cennik na poziomie 0,66 USD za 1 mln tokenów wejściowych przy chybieniu w pamięci podręcznej i 1,98 USD za 1 mln tokenów wyjściowych poza szczytem, a w szczycie stawki podwajają się do 1,32 USD i 3,96 USD. Trafienia w pamięć podręczną kosztują 0,022 USD poza szczytem — ponad 7 razy więcej niż w Flash.
• Dane wejściowe bez trafienia w cache — 0,15 USD vs 0,66 USD poza szczytem, więc Flash jest 4,4x tańszy
• Dane wyjściowe — $0.60 vs $1.98 poza szczytem, więc Flash jest 3,3 razy tańszy
• Wejście z trafieniem w pamięć podręczną — $0,003 vs $0,022 poza godzinami szczytu, więc Flash jest 7,3 razy tańszy
• Limit kontekstu i wyjścia — identyczny przy 1M i 384K w obu SKU
• Współbieżność — 2 500 w Flash wobec 500 w V4 Pro, pięciokrotna różnica, która całkowicie znika z cennika
Trzy rzeczy w tym porównaniu łatwo jest źle zrozumieć. Po pierwsze, argument za ponownym wykorzystaniem jest silniejszy w przypadku flagowca w ujęciu bezwzględnym, mimo że to Flash ma większy mnożnik: buforowanie miliona tokenów oszczędza 0,638 USD w przypadku V4 Pro i 0,147 USD w przypadku Flash, ponieważ wskaźnik nietrafień flagowca jest znacznie wyższy już na starcie. Po drugie, model, którego wszyscy spodziewali się, że zniknie, nie zniknął: DeepSeek ogłosił, że 14.09.2026 przestanie obsługiwać V4 Pro i przekieruje te żądania do modelu Flash, wywołał oburzenie deweloperów z powodu podmiany modelu backendowego w produkcyjnych przepływach pracy i 11.09.2026 wycofał tę decyzję. V4 Pro jest nadal obsługiwany, przy niezmienionym rozliczaniu. Po trzecie — i to jest pułapka, w którą wpadły materiały o wycieku — nie ma wydanego V4.1 Pro. DeepSeek-V4-Pro-0813 pozostaje flagowym SKU, a dostawca nie wypuścił następcy pod tą nazwą. Każdy, kto wycenia migrację do „V4.1 Pro”, wycenia model, który nie istnieje.
W porównaniu z zamkniętym poziomem frontier
W porównaniu z zamkniętymi modelami, które nabywcy faktycznie biorą pod uwagę na krótkiej liście, najważniejszy jest mnożnik. Wszystkie poniższe liczby pochodzą z opublikowanych dzisiaj stron cennikowych poszczególnych dostawców.
• GPT-5.6 Sol — w cenniku po 5,00 USD za 1 mln tokenów wejściowych i 30,00 USD za 1 mln tokenów wyjściowych w warstwie krótkiego kontekstu OpenAI; obecnie obowiązuje promocyjna stawka 4,00 USD / 20,00 USD, która według OpenAI jest dostępna co najmniej do 2026-11-21, a wejście z pamięci podręcznej kosztuje 0,40 USD. W porównaniu ze stawką promocyjną DeepSeek V4.1 Flash jest 26,7x tańszy na wejściu i 33,3x na wyjściu; wobec cennika — 33x i 50x. Trafienie w pamięć podręczną Sol kosztuje 133x tyle, ile trafienie w pamięć podręczną Flash.
• Claude Opus 5 — 5,00 USD za 1 mln tokenów wejściowych i 25,00 USD za 1 mln tokenów wyjściowych, a trafienia w pamięć podręczną po 0,50 USD za 1 mln w opublikowanym cenniku Anthropic. To 33-krotność stawki Flasha za wejście, 42-krotność jego stawki za wyjście i 167-krotność jego stawki za trafienia w pamięć podręczną. Zapisy do 5-minutowej pamięci podręcznej Anthropic dodają jeszcze 1,25x; cennik DeepSeek nie ma odpowiednika tej pozycji.
• Gemini 3.8 Flash — 0,75 USD za 1 mln tokenów wejściowych i 3,75 USD za 1 mln tokenów wyjściowych do 31.12.2026, przy czym obie stawki mają się podwoić 1 stycznia 2027 r., wejście z pamięci podręcznej po 0,075 USD oraz — to jest pozycja, która powtarza się na prawdziwym rachunku — pamięci podręcznej przechowywanie po 0,50 USD za 1 mln tokenów na godzinę. Flash jest 5 razy tańszy na wejściu, 6,25 razy na wyjściu i 25 razy na trafieniach w pamięci podręcznej w porównaniu z nim, a DeepSeek nie pobiera żadnych opłat za przechowywanie pamięci podręcznej.
Kontekst możliwości jest tym, co sprawia, że to pozostaje uczciwe. W Intelligence Index v4.3 firmy Artificial Analysis DeepSeek V4.1 Flash (rozumowanie, maksymalny wysiłek) uzyskuje wynik 40 i zajmuje 6. miejsce na 113 modeli, przy 0,27 USD za zadanie w indeksie i 214,4 tokenu wyjściowego na sekundę. To naprawdę pozycja na pograniczu czołówki w cenie 26 razy niższej niż poziom, z którym jest porównywana — ale ten sam pomiar pokazuje, że to jeden z najbardziej gadatliwych modeli, jakie AA testowało, generujący 250 mln tokenów wyjściowych w całym przebiegu indeksu wobec mediany wynoszącej 140 mln. Gadatliwość nie zmienia ceny za token, ale zmienia rachunek. Model, który generuje o 62% więcej tokenów niż mediana, i tak kosztuje tu znacznie mniej, ale „tanie za token” i „tanie za zadanie” to różne twierdzenia, a płacisz tylko za to drugie.
Czy jest darmowy plan?
Nie. Strona z cennikiem samego DeepSeek nie dokumentuje żadnego darmowego poziomu API, darmowego miesięcznego limitu ani darmowego modelu — rozliczenie odbywa się w modelu pay-as-you-go względem doładowanego lub przyznanego salda, przy czym przyznane saldo jest zużywane jako pierwsze. Aplikacja czatu dla konsumentów jest darmowa; API stojące za deepseek-flash nie jest, a na platformie DeepSeek nie ma dla niego darmowego punktu końcowego. Kilka bram firm trzecich reklamuje darmowy lub próbny dostęp do tego modelu, a my traktowalibyśmy je wszystkie jako środowiska prototypowania, a nie produkcyjne backendy, ponieważ warunki te zmieniają się bez powiadomienia i żadna z nich nie ma własnego cennika dostawcy.
Twierdzenia o wydajności kryjące się za ceną
Cena nie jest subsydium, przynajmniej według samego DeepSeek. Karta modelu i raport techniczny dostawcy opisują V4.1 Flash jako mieszaninę ekspertów o 552B parametrów w układzie przyczynowego enkodera-dekodera, która aktywuje około 8B parametrów na token podczas prefillu i 16B podczas dekodowania — asymetryczną z założenia, tanią w odczycie i droższą w zapisie. Po stronie pamięci DeepSeek podaje globalną pamięć podręczną KV o rozmiarze około 890 bajtów na token, czyli około jednej czwartej tego w DeepSeek-V4-Flash, oraz trwały ślad pamięci podręcznej około jednej ósmej tego rozmiaru przy identycznych obciążeniach, osiągnięty przez odrzucanie stanu okna przesuwnego i odtwarzanie ostatnich 128 tokenów przy trafieniu. Są to pomiary raportowane przez dostawcę na jego własnym sprzęcie, a raport techniczny nie twierdzi, że ścieżka odtwarzania jest matematycznie równoważna pełnemu obliczeniu.
Liczba parametrów to jedyna wartość w tym wydaniu, która jest naprawdę nieustalona, i warto dokładnie wyjaśnić dlaczego. Proza DeepSeeka podaje 552B i to jest szkielet — część, która wykonuje obliczenia. Obok niego znajduje się Engram, warunkowa tablica wyszukiwania pamięci, którą karta modelu szacuje na 196B parametrów, dostępna przez wyszukiwanie tokenów, a nie obliczana. Dodaj je do siebie, a otrzymasz blisko 748B, co jest liczbą, za którą w ciągu kilku godzin od udostępnienia wag opowiadała się szeroko czytana analiza społeczności na r/LocalLLaMA, a którą panel plików samego repozytorium Hugging Face wypycha jeszcze wyżej, w stronę 763B. Społecznościowe opisy wdrożeń doliczyły się checkpointu o rozmiarze około 510 GB w 48 shardach, dostarczanego natywnie skwantyzowanego jako gęste wagi FP8 z ekspertami FP4. Traktuj sumę jako sporną, a wartość szkieletu jako raportowaną przez dostawcę. To liczba aktywnych parametrów decyduje o szybkości; wagi rezydujące decydują o tym, czy model w ogóle się uruchomi.
Samodzielne hostowanie jest realną alternatywą dla tej ceny, na licencji MIT
Wagi znajdują się pod adresem deepseek-ai/DeepSeek-V4.1-Flash na licencji MIT, która zezwala na użycie komercyjne, modyfikację i redystrybucję. To sprawia, że cennik API jest wyborem, a nie opłatą za przejazd: w przypadku MIT nic w licencji nie zabrania samodzielnego hostowania tego modelu i płacenia za moc obliczeniową zamiast za tokeny.
Nie sprawia to jednak, że jest to tanie. Checkpoint to około 510 GB wag rezydujących w pamięci przed uwzględnieniem pamięci podręcznej i aktywacji, DeepSeek nigdzie w repozytorium nie podaje wymagań dotyczących GPU, a społecznościowe opisy wdrożeń wskazują, że praktyczne minimum to węzeł z wieloma GPU, a nie stacja robocza. Trzy stosy serwowania udostępniły wsparcie w dniu premiery 10 września 2026 r. — vLLM, SGLang z Miles oraz opartą na vLLM adaptację NeuWare firmy Cambricon dla jej własnych akceleratorów — ale w dniu premiery vLLM i SGLang udostępniły dedykowane obrazy podglądowe, a nie oficjalne pakiety, a llama.cpp nie scaliło jeszcze wsparcia architektury V4.1. Samodzielne hostowanie na sprzęcie konsumenckim nie jest dziś alternatywą dla ceny API; jest nią wynajęty węzeł z 8 GPU. Jeśli Twój wolumen jest wystarczająco duży, by to zamortyzować, licencja na to pozwala; jeśli nie, 0,15 USD za milion tokenów jest tańszą odpowiedzią i nie ma tu nawet porównania.
Co tak naprawdę każe ci zdecydować cennik stawek
Trzy rzeczy, w kolejności od tego, jak duże pieniądze przesuwają. Utrzymuj stabilny prefiks promptu i pozwól pamięci podręcznej robić swoje — jest automatyczna, daje 50-krotną zniżkę, a w pętli agenta na 60 tur zamienia sesję za 0,93 USD w sesję za 0,084 USD. Uruchamiaj ruch wsadowy w dni robocze poza godzinami 01:00–04:00 i 06:00–10:00 UTC, co dla zespołu z USA nic nie zmienia, a dla zespołu europejskiego oznacza przeniesienie porannego zadania na popołudnie. A jeśli wyceniasz to w porównaniu z flagowym modelem samego DeepSeek, pamiętaj, że flagowy model jest nadal w promocji — planowane wycofanie zostało odwołane 2026-09-11, oba SKU korzystają z jednego klucza, a przełączenie między nimi to zmiana identyfikatora modelu, a nie migracja.
Cennik nie mówi ci, czy model jest wystarczająco dobry do twojego obciążenia, a dane na ten temat są nowsze i uboższe niż arkusz cenowy. Pozycja w indeksie Artificial Analysis to pojedynczy pomiar przy maksymalnym wysiłku rozumowania, wiersze benchmarków dostawcy są zgłaszane przez dostawcę, a liczba parametrów jest sporna. Cena jest ustaloną częścią tego wydania. Wyceń swoją migrację na jej podstawie i przetestuj możliwości, zanim się na nią zdecydujesz.
Porównane w tym artykule4
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
