
DeepSeek V4.1 Flash kontra DeepSeek V4 Pro: przekazanie, które DeepSeek zaplanował, a następnie odwołał
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
DeepSeek V4.1 Flash został wydany 2026-09-10, a DeepSeek V4 Pro powinien już dawno zniknąć. Plan, ogłoszony dwa dni przed premierą Flasha i potwierdzony w dniu premiery, zakładał, że 2026-09-14 o 12:00 czasu pekińskiego każde żądanie kierowane do deepseek-v4-pro zostanie po cichu przekierowane do nowszego, tańszego deepseek-flash i rozliczone według stawek Flasha. DeepSeek odwołał to 2026-09-11 po sprzeciwie deweloperów, a 2026-09-14 termin minął, gdy V4 Pro wciąż działał, a jego rozliczenia pozostały bez zmian. Nie jest to więc porównanie premier — model po lewej ma osiem dni, a model po prawej to roczny flagowiec w czwartym miesiącu ogólnej dostępności. To porównanie dwóch modeli, których twórca opublikował benchmarki mówiące, że wygrał ten tani, a potem odkrył, że jego użytkownicy się z tym nie zgadzają, i się wycofał. Ta sekwencja zdarzeń jest najużyteczniejszą rzeczą, jaką ktokolwiek opublikował w tym miesiącu o którymkolwiek z tych modeli, ponieważ to dokładnie ta decyzja, którą sam za chwilę podejmiesz.
Co właściwie się wydarzyło, po kolei.
Oś czasu ma tu większe znaczenie niż jakikolwiek pojedynczy benchmark, ponieważ to odwrócenie jest całą historią, a ogłoszenie było celowo ciche.
• 2026-09-09 — DeepSeek informuje użytkowników, że zanim pojawi się V4.1 Pro, żądania V4 Pro będą kierowane do V4.1 Flash i rozliczane według stawek Flash. Przekaz jest taki, że Flash kompleksowo przewyższył Pro pod względem wydajności, kosztów, szybkości i czasu realizacji zadań.
• 2026-09-10 — DeepSeek V4.1 Flash wchodzi do ogólnej dostępności w aplikacji, internecie i API. Wagi trafiają na Hugging Face na licencji MIT. Nazwa modelu API staje się deepseek-flash. Poprzednia generacja deepseek-v4-flash i deepseek-v4-flash-vision-exp zostają całkowicie wycofane, a ich starsze identyfikatory są tymczasowo kierowane do V4.1 Flash. Wyłączenie Pro zostaje przesunięte na 2026-09-14, 12:00 czasu pekińskiego (04:00 UTC).
• 2026-09-11 — DeepSeek odwraca decyzję. W odpowiedzi na żądanie użytkowników informuje, że usługa V4 Pro API będzie kontynuowana po 2026-09-14 bez zmian w rozliczeniach, a automatyczne przełączenie na V4.1 Flash zostaje anulowane.
• 2026-09-14 — termin mija. V4 Pro jest nadal oferowany w cenie 0,66 / 1,98 USD za milion tokenów poza godzinami szczytu.
Asymetria w tej sekwencji to sedno całego artykułu. Użytkownicy Flash zostali zmigrowani, czy tego chcieli, czy nie — stary identyfikator V4 Flash odpowiada teraz innemu modelowi. Użytkownicy Pro dostali odroczenie, a powód nie jest taki, że V4 Pro wypada lepiej w benchmarkach. Chodzi o to, że systemy produkcyjne były dostrojone pod niego: prompty, szkielety agentów, harnessy ewaluacyjne i założenia dotyczące odtwarzalności, które podmiana backendu unieważnia bez żadnej zmiany w kodzie po stronie wywołującego. Strona porównawcza DeepSeek nadal wymienia dziś oba modele obok siebie, co mówi, że firma zamierza obsługiwać oba.
Obok siebie: dwa SKU
Wszystko poniżej pochodzi z własnej opublikowanej specyfikacji DeepSeek, chyba że wskazano źródło. Ceny podane są za milion tokenów, poza godzinami szczytu, a stawka w godzinach szczytu znajduje się w nawiasach — DeepSeek ma godziny szczytu między 01:00 a 04:00 oraz ponownie między 06:00 a 10:00 UTC od poniedziałku do piątku, a wszystkie pozostałe godziny są poza godzinami szczytu po połowie stawki szczytowej.
• Nazwa modelu API — deepseek-flash (DeepSeek-V4.1-Flash) vs deepseek-v4-pro (DeepSeek-V4-Pro-0813).
• Wejście, chybienie cache — 0,15 USD (0,30 USD) vs 0,66 USD (1,32 USD).
• Wejście, trafienie w cache — 0,003 USD (0,006 USD) vs 0,022 USD (0,044 USD).
• Wynik — $0.60 ($1.20) vs $1.98 ($3.96).
• Kontekst / maks. liczba tokenów wyjściowych — 1M tokenów / 384K w obu. Identyczne.
• Wejście obrazu — obsługiwane natywnie na Flash; wymienione jako nieobsługiwane na V4 Pro.
• Limit współbieżności — 2500 w Flash wobec 500 w V4 Pro.
• Zgłoszone parametry — Flash: 552 mld łącznie, wartość podana przez dostawcę, wiarygodnie kwestionowana przez społeczność (więcej o tym poniżej). V4 Pro: 1,6 bln łącznie, ~49 mld aktywnych, co również wymienia Artificial Analysis i potwierdza strona z przepisem vLLM.
• Aktywny budżet na token — Flash aktywuje około 8B przy prefill i 16B przy decode z założenia, co jest istotą jego architektury; Pro aktywuje ~49B na token.
• Licencja — otwarte wagi na licencji MIT w obu przypadkach.
• Data GA — Flash 2026-09-10; V4 Pro 0813 2026-08-13, po kwietniowym podglądzie.

Różnica cen to cały argument
Dane wejściowe są 4,4× droższe w Pro. Dane wyjściowe są 3,3×. Trafienia w pamięć podręczną — warstwa, która dominuje w długim przebiegu agenta ze stabilnym promptem systemowym — są 7,3×. Ponieważ szczyt podwaja się na każdym poziomie po obu stronach, stosunek jest identyczny w szczycie; różnica nie jest artefaktem rabatu.
Uruchommy na tym obciążenie. Weźmy agenta kodującego, który miesięcznie zużywa 10 mln tokenów wejściowych przy 70-procentowym współczynniku trafień w pamięci podręcznej i 2 mln tokenów wyjściowych. W przypadku V4.1 Flash poza godzinami szczytu to 0,45 USD za świeże tokeny wejściowe, 0,021 USD za tokeny wejściowe z pamięci podręcznej i 1,20 USD za tokeny wyjściowe: 1,67 USD. W przypadku V4 Pro poza godzinami szczytu to 1,98 USD, 0,154 USD i 3,96 USD: 6,09 USD. Mniej więcej 3,6×, w przypadku obciążenia, które jest celowo zupełnie przeciętne.
To jest własna lista DeepSeek, a to jest cena, którą faktycznie płacisz tutaj: OrcaRouter przekazuje stawki z cennika dostawcy bez marży (0%), więc zmiana ceny DeepSeek trafia po naszej stronie tego samego dnia, zamiast być przepakowywana. Oba modele działają na tym samym kluczu, co ma znaczenie dla sekcji poniżej — tej o testowaniu migracji, której nie musisz już przeprowadzać.

Gdzie DeepSeek V4.1 Flash naprawdę wygrywa
Najmocniejszym dowodem na rzecz Flash nie jest tabela wyników DeepSeek. Jest nim Artificial Analysis — niezależny i odczytywany bezpośrednio z jego stron modeli.
• Indeks Inteligencji — Flash (Rozumowanie, maksymalny wysiłek) uzyskuje 40 punktów, zajmując 6. miejsce spośród 113 modeli. V4 Pro 0813 (Rozumowanie, maksymalny wysiłek) uzyskuje 36 punktów, zajmując 7. miejsce. Ten sam indeks, to samo ustawienie wysiłku, różnica czterech punktów, a tańszy model jest wyżej.
• Szybkość generowania — 214,4 tokena/s w porównaniu z 94,4 tokena/s. To 2,3× i jest to zmierzone, a nie deklarowane.
• Czas do pierwszego tokena — 1,21 s wobec 1,74 s.
• DeepSWE v1.1 — 74,2 dla Flash w śledzonym rankingu, pierwsze miejsce, przed GPT-6 Astra z 74,10, Claude Opus 5 z 74,00 i Gemini 3.8 Flash z 73,70. Wynik 62,7 V4 Pro 0813 w tym samym benchmarku to własny wynik DeepSeek. Różnica na szczycie wynosi 0,2 punktu, co oznacza remis, a nie zwycięstwo — ale 11,5-punktowa różnica względem Pro to nie remis.
• Wydajność obsługi — Dekoder Flasha wyprowadza swoje globalne KV z końcowego stanu ukrytego enkodera, zamiast przeliczać je ponownie dla każdej warstwy, co daje asymetryczną aktywację 8B-prefill / 16B-decode. Profil InferenceX od SemiAnalysis szacuje pamięć podręczną KV na około 890 bajtów na token — około jednej czwartej wartości V4 Flash — przy czym trwałe przechowywanie KV spada do około jednej ósmej. To dlatego cena jest taka, jaka jest, i również dlatego model jest dostępny przy współbieżności 2500, gdy Pro ma limit 500.
• Obsługa wizji w udostępnianym API — nie tylko w wagach. Strona z cennikiem samego DeepSeek podaje, że wejście obrazowe jest obsługiwane dla Flash, a nieobsługiwane dla V4 Pro, a DeepSeek opisuje go jako swój pierwszy flagowy model z natywnym rozumieniem multimodalnym. To pierwszy flagowy model DeepSeek, w którym odczyt zrzutu ekranu nie wymaga osobnego punktu końcowego.
Wszystkie pozostałe kluczowe liczby, które zobaczysz w cytowaniach — Terminal-Bench 2.1 na poziomie 90,6, GPQA Diamond na poziomie 90,9, Codeforces 3471 — są własnymi wynikami DeepSeek, nieodtworzonymi przez nas, i należy je odczytywać, mając to na uwadze.
Gdzie DeepSeek V4 Pro wciąż jest właściwym wyborem
Łatwo byłoby przekreślić V4 Pro po takim tygodniu. Odwrócona deprecjacja mówi co innego, a karta specyfikacji też mówi co innego.
Pro ma łącznie 1,6 bln parametrów i aktywuje ~49 mld na token, wobec 16 mld w przypadku Flasha przy dekodowaniu. Cokolwiek mówi indeks, pojemność na token to realny zasób, a obciążenia, w których się ona ujawnia, to te o długim horyzoncie: wielogodzinne przebiegi agentów, duże refaktoryzacje, zadania, w których wczesny zły zakręt kosztuje całą trajektorię. Czteropunktowa różnica w indeksie mierzy średnią z dziesięciu ewaluacji, a nie ogon twojego rozkładu.
Pro jest również znaną wielkością. Jest ogólnie dostępny od 2026-08-13 po kwietniowym podglądzie, a kompilacja 0813 swoją wydajność zawdzięcza douczeniu, a nie architekturze — ta sama liczba parametrów, ten sam kształt co w podglądzie, inne zachowanie. To cztery miesiące społecznościowych narzędzi, opublikowanych środowisk agentowych, wzorców promptów i trybów awarii. Flash jest ogólnie dostępny od ośmiu dni, a ekosystem wokół niego jest odpowiednio skromny. Jeśli niezawodność Twojego zespołu wynika z dokładnej znajomości tego, jak model zawodzi, Pro jest miejscem, w którym tkwi ta wiedza.
A usługa nie została wstrzymana. Zobowiązanie DeepSeek jest wyraźne, a rozliczenia pozostają bez zmian, wagi są na licencji MIT, a V4 Pro nadal znajduje się w naszym katalogu w tej samej stawce cennikowej. Odwołane wycofanie nie jest odroczeniem wykonania — to deklaracja, że DeepSeek zamierza nadal obsługiwać ten poziom.

Trzy rzeczy, które można zarzucić obu modelom
Zabezpieczenia, ponieważ pomyłka w tej decyzji jest kosztowna.
• Liczba parametrów jest sporna. 552B to wartość podana przez DeepSeek. Wiarygodna analiza społeczności przekonuje, że wydany checkpoint ma 748B — 552B szkieletu transformera plus około 196B tabeli pamięci warunkowej Engram, która jest strukturą wyszukiwania odpytywaną w dwóch punktach sieci, a nie warstwą, przez którą przepływa sygnał. Opublikowany plik do pobrania ma 510,3 GB w 48 shardach safetensors gęstych wag FP8 z ekspertami routowanymi w FP4. Obie liczby mogą być jednocześnie prawidłowe, zależnie od tego, czy liczyć wyszukiwanie oddzielnie od obliczeń. Traktuj 552B jako wartość podaną przez dostawcę i sprawdź zajętość dysku, zanim zaplanujesz wdrożenie.
• Wynik w tabeli liderów to przesiew, a nie kontrakt. Wynik 74,2 w DeepSWE v1.1 to benchmark harnessa. Samodzielnie opublikowany audyt EyesTech Systems Lab twierdzi, że te wyniki klasy Flash załamują się, gdy przenieść je do izolowanych, rzeczywistych repozytoriów wieloplikowych — dając DeepSeek V4.1 Flash 31,4% w SWE-bench Pro wobec 74,2% z nagłówka, czyli większy spadek niż u modeli frontier w jego własnym porównaniu. Ten audyt nie jest niezależny — autor sprzedaje narzędzie do wykrywania dokładnie takiej eksploatacji harnessa, jaką opisuje — i nie widzieliśmy jego replikacji. To wciąż właściwa postawa: zweryfikuj na własnych repozytoriach, zanim przeprowadzisz migrację.
• Gadatliwość to pozycja kosztowa.Artificial Analysis zmierzyło, że V4.1 Flash generuje 250 mln tokenów wyjściowych w przebiegu swojego Intelligence Index, wobec mediany 140 mln dla porównywalnych modeli z otwartymi wagami, i określa go jako bardzo gadatliwy. Wyjście to drogi kierunek w tej tabeli cen, więc model, który myśli na głos, uszczupla własne oszczędności. Przy obciążeniu z przewagą rozumowania należy zaplanować budżet na liczbę tokenów, a nie tylko na cenę tokena.
Jeszcze jedna rzecz, powiedziana wprost, żeby nikt nie planował w oparciu o plotkę: DeepSeek V4.1 Pro nie został wydany. Odwołana migracja została przedstawiona jako rozwiązanie tymczasowe „przed premierą V4.1 Pro” i nic się w tej kwestii nie zmieniło.
Wybierz DeepSeek V4.1 Flash, jeśli
• Twoje obciążenie jest duże, wrażliwe na opóźnienia lub ograniczone kosztowo — klasyfikacja, ekstrakcja, routing, streszczanie, czat, większość generowania kodu.
• Potrzebujesz obsługi obrazów wejściowych w tym samym punkcie końcowym co tekst. To pierwszy flagowy model DeepSeek, w którym jest to pojedyncze wywołanie, a nie drugi model.
• Twoje prompty można buforować. Przy 7,3× w przypadku trafień w pamięć podręczną luka jest największa dokładnie tam, gdzie występuje ruch agentów, a stabilny prompt systemowy stanowi większość danych wejściowych w długim przebiegu.
• Zaczynasz w tym tygodniu od zera i nie masz żadnego środowiska testowego dostrojonego do osobliwości konkretnego modelu. Nie ma czego chronić.
• Chcesz wyższego pułapu współbieżności. 2500 w porównaniu z 500 to pięciokrotna różnica w tym, ile możesz przepchnąć, zanim zaczniesz trafiać do kolejki.
Wybierz DeepSeek V4 Pro, jeśli
• Masz już produkcję dostrojoną pod to. Odwrócenie sytuacji oznacza, że masz czas — wykorzystaj go na testowanie, a nie na unikanie pytania.
Twoje zadania mają długi horyzont i są kosztowne w razie niepowodzenia, a według twoich pomiarów ~49B aktywnych parametrów na token daje ci coś, czego 16B Flasha nie daje — na twoich danych, a nie na tabeli liderów.
• Potrzebujesz przewidywalnego zachowania wyłącznie tekstowego, bez ścieżki wizyjnej, którą trzeba by brać pod uwagę, albo masz bazowe wyniki ewaluacji, które podmiana modelu unieważniłaby w trakcie badania.
• Twój wzorzec dostępu charakteryzuje się niskim wolumenem i wysoką stawką, gdzie 3,6× na niewielkim rachunku nie jest decydującym czynnikiem.
Jeśli już zbudowałeś na DeepSeek V4 Pro
Pożyteczna zmiana, która nastąpiła 11 września 2026 r., polega na tym, że twoja migracja przestała być terminem, a stała się decyzją. To jednoznacznie lepsze dla ciebie i jednoznacznie gorsze dla twojej skrzynki odbiorczej, ponieważ decyzję wciąż trzeba podjąć, a teraz nikt nie podejmuje jej za ciebie.
Zacznij od wyceny. Luka 3,3–4,4× to liczba, którą zostawiasz na stole, a powyższy przykład zamienia ją w miesięczną kwotę w około minutę. Potem przetestuj to w jedyny sposób, który się liczy: skieruj wycinek ruchu produkcyjnego do Flash, pozostaw Pro na ścieżce głównej i porównaj wyniki na własnych zadaniach. Ponieważ oba modele odpowiadają na tym samym kluczu w cenie katalogowej dostawcy z automatycznym przełączaniem awaryjnym, ten bieg w tle to zmiana routingu, a nie druga integracja, a router może przekierować żądanie z powrotem do Pro, bez konieczności pisania przez ciebie mechanizmu awaryjnego. Zespoły przepalające tokeny na migrację, o którą nie prosiły, są powodem, dla którego warstwa routingu w ogóle istnieje.
Nie zakładaj, że Flash to gotowy zamiennik. To inna architektura — 40-warstwowy przyczynowy enkoder–dekoder z asymetryczną aktywacją — i jest bardziej rozwlekły w rozumowaniu. Zachowanie na poziomie promptu nie przeniesie się czysto w żadnym kierunku, więc oceniaj migrację po wynikach, a nie po indeksie.
Co obejrzeć
Trzy rzeczy zdecydują, jak to zestawienie będzie wyglądać za miesiąc. Po pierwsze, czy V4.1 Pro zostanie wydany i przywróci prawdziwy poziom Pro — cała anulowana migracja była wyraźnie rozwiązaniem zastępczym do czasu jego wydania, więc mapa drogowa DeepSeek wciąż ma lukę w kształcie flagowca. Po drugie, czy to wytchnienie przetrwa kolejny ruch cenowy DeepSeek; firma gotowa raz zaplanować ciche przekierowanie nauczyła się, że nie może, a nie że nie powinna. Po trzecie, czy ktokolwiek poza DeepSeek odtworzy wyniki benchmarków Flasha na niezmodyfikowanych repozytoriach — to jedyny wynik, który rozstrzygnąłby spór o wydajność kontra pojemność, na którym opiera się całe to porównanie. Do tego czasu uczciwe stanowisko jest tym, które sugeruje sama zmiana kursu: Flash jest lepszym domyślnym wyborem dla wszystkiego nowego, Pro jest lepszym zakładem dla wszystkiego, co już zbudowano, a DeepSeek właśnie powiedział ci, że będzie obsługiwać oba, dopóki nie ustalisz, którym z nich jesteś.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
