Karta tytułowa: DeepSeek V4.1 Flash vs DeepSeek V4 Pro — ten sam dostawca, różne generacje
Guides & Insights

DeepSeek V4.1 Flash vs DeepSeek V4 Pro: Ten sam dostawca, różne generacje

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Ciekawostka w zestawieniu DeepSeek V4.1 Flash z DeepSeek V4 Pro polega na tym, że nowszy model nie jest tym większym. DeepSeek V4 Pro to model typu mixture-of-experts o 1,6 biliona parametrów, z 49 miliardami aktywnych parametrów, i wciąż jest udostępniany. DeepSeek V4.1 Flash to MoE o 552 miliardach parametrów, z 8 miliardami aktywnymi na wejściu i 16 miliardami aktywnymi na wyjściu, i to jest model, który DeepSeek zbudował, aby go zastąpić. Oba znajdują się w cenniku tego samego dostawcy, oba przyjmują milion tokenów kontekstu i oba są dostarczane na licencji MIT. Wybór między nimi nie jest kwestią rozmiaru. To kwestia tego, za jaką architekturę chcesz płacić, a odpowiedź zmieniła się 10 września 2026 r.

Co tak naprawdę się różni, obok siebie

• Parametry — V4.1 Flash: łącznie 552B / 8B aktywnych na wejściu i 16B na wyjściu vs V4 Pro: łącznie 1,6T / 49B aktywnych. V4 Pro ma około trzy razy więcej parametrów całkowitych i sześć razy większą liczbę aktywnych po stronie wejścia.

• Architektura — V4.1 Flash to przyczynowy koder-dekoder (Causal Encoder-Decoder), nowa architektura bazowa w porównaniu z wcześniejszym projektem V4 Pro. To zasadnicza różnica między nimi i powód, dla którego „.1” nie jest wydaniem punktowym.

• Cena za 1 mln tokenów — V4.1 Flash 0,15 USD za wejście / 0,60 USD za wyjście poza godzinami szczytu vs V4 Pro 0,66 USD za wejście / 1,98 USD za wyjście, według ofert OrcaRouter.

• Wejście z pamięci podręcznej — V4.1 Flash 0,003 USD za 1M vs V4 Pro 0,024 USD za 1M.

• Pamięć podręczna KV na token — V4.1 Flash: 890 bajtów, a V4 Pro ma większy ślad. Przy milonie tokenów kontekstu to pozycja, która decyduje, czy długi transkrypt agenta pozostanie w pamięci.

• Kontekst i dane wyjściowe — 1M kontekstu i 384K maksymalnego wyjścia w obu. Poziom.

• Zaobserwowane opóźnienie do pierwszego tokenu — V4.1 Flash 2,63 s p50 vs V4 Pro 3,58 s p50, na podstawie 7-dniowej telemetrii OrcaRouter, przy p95 wynoszącym 10,00 s dla V4 Pro.

• Modalności wejściowe — V4.1 Flash przyjmuje tekst i obrazy, podczas gdy V4 Pro obsługuje wyłącznie tekst na wejściu i wyjściu, na tych samych listingach. Nowszy model ma szerszy zakres danych wejściowych niż drugi, a także jest tańszy.

Przeczytaj tę listę bez narracji dostawcy, a wzorzec jest nietypowy. Następca jest tańszy w każdym wierszu, szybciej osiąga pierwszy token, ma szersze wejście i jest mniejszy w każdym wierszu. Tak właśnie wygląda prawdziwa zmiana architektury, gdy się pojawia, i dlatego „który jest lepszy” ma tu krótką odpowiedź, a pod nią dłuższą.

Two-column scoreboard: DeepSeek V4.1 Flash vs DeepSeek V4 Pro — total parameters 552B vs 1.6T, active parameters 8B input and 16B output vs 49B, architecture Causal Encoder-Decoder vs an earlier design, price per 1M tokens $0.15 input and $0.60 output vs $0.66 and $1.98, max output 384K tokens vs 384K tokens, and release date 2026-09-10 vs still served and not retired

Oś czasu V4 Pro, ponieważ ma znaczenie dla każdego, kto wciąż go używa.

DeepSeek V4 Pro miał zostać wycofany. API miało zostać wyłączone 14 września 2026 r. o godzinie 12:00 czasu pekińskiego, a ruch przekierowany do V4.1 Flash. Tak się nie stało. 11 września dostawca odwrócił decyzję, stwierdzając: „W odpowiedzi na zapotrzebowanie użytkowników zdecydowaliśmy, że po 14 września 2026 r. będziemy nadal świadczyć usługi API dla DeepSeek V4 Pro, a sposób rozliczeń pozostanie bez zmian”.

Wynikają z tego dwie rzeczy i obie warto precyzyjnie ująć, ponieważ sytuacja aż prosi się o nadinterpretację.

Po pierwsze, V4 Pro nie jest przestarzały. To wspierany model o niezmienionej cenie i to właśnie do niego własny komunikat DeepSeek kieruje istniejący ruch V4 Pro. Jeśli masz ścieżkę produkcyjną przypiętą do niego, nic nie zostało odebrane.

Drugą rzeczą jest to, że DeepSeek V4.1 Pro nie istnieje. W ogłoszeniu o wycofaniu wspomniano, że ruch V4 Pro jest obsługiwany przez V4.1 Flash „do momentu premiery V4.1-Pro”, co doprowadziło do pewnych spekulacji na temat większego brata. Na dzień 22 września 2026 r. nie ma API V4.1 Pro, karty modelu, wag ani ogłoszenia. W raporcie z 21 września 2026 r. zasugerowano model o 2 bilionach parametrów, którego można się spodziewać od połowy do końca października, co jest twierdzeniem z jednego źródła na temat niezapowiedzianego produktu i należy je tak traktować. Każdy, kto planuje przepustowość w związku z premierą V4.1 Pro, planuje w oparciu o plotkę.

Który właściwie wywołać

Przypadek migracji jest prosty i to ten, którego sam DeepSeek dokonał, kierując ruch V4 Pro do nowego modelu. Na podstawie powyższych liczb V4.1 Flash jest tańszy, szybciej osiąga pierwszy token i jest szybszy w stanie ustalonym, przy mniejszej pamięci podręcznej KV na token. Jeśli Twoje obciążenie to obciążenie V4 Pro, które nie robi czegoś, co może zrobić tylko 49B aktywnych parametrów, nowszy model jest lepszym narzędziem pod względem kosztu i opóźnienia, a nie ma żadnego kompromisu do rozważenia.

Argument za pozostaniem przy V4 Pro dotyczy tego, co daje znacznie większa liczba aktywnych parametrów w trudnym rozumowaniu i długohoryzontowej pracy agentowej, i jest to argument, który trzeba przedstawić za pomocą własnych ewaluacji, a nie karty specyfikacji. Powód jest taki, że oba modele nie są porównywane na wspólnej publicznej tablicy wyników w sposób, który je izoluje: DeepSeek V4.1 Flash pojawia się w ramach Agents on Rails sweep z 21 września 2026 r. z wynikiem 17% przy maksymalnym wysiłku, podczas gdy V4 Pro nie znajduje się na tej tablicy. Nie ma liczby z bezpośredniego porównania, na którą można by wskazać. Istnieje prawdopodobny argument oparty na architekturze — sześciokrotnie większa liczba aktywnych parametrów to dużo zdolności, z których trzeba zrezygnować — i jest to argument, a nie pomiar.

Dwie praktyczne uwagi dla każdego, kto przenosi ruch między nimi. Po pierwsze, harmonogram godzin szczytu dotyczy obu modeli, więc porównanie kosztów przeprowadzone o niewłaściwej porze dnia będzie błędne dwukrotnie; szczyt przypada na 01:00–04:00 i 06:00–10:00 UTC w dni powszednie, a weekendy są w całości poza szczytem. Po drugie, oba modele mają wspólne okno kontekstu i górny limit danych wyjściowych, więc migracja nie zmienia budżetu na prompty — co sprawia, że przełączenie jest wyjątkowo mało ryzykowne po stronie aplikacji.

Uruchamianie obu przez jeden punkt końcowy

Sytuacja, w której naprawdę chcesz mieć jedno i drugie, to okres przejściowy — a zdarza się częściej, niż mogłoby się wydawać: zespół chce przejść na V4.1 Flash, ale ma jeden pipeline, którego zachowanie w nowej architekturze nie zostało jeszcze zweryfikowane. Uruchamianie obu równolegle przez różnych dostawców oznacza dwie umowy i dwa zestawy kluczy dla czegoś, co na poziomie modelu jest jednym dostawcą.

Oba są dostępne na OrcaRouter w ramach jednego klucza, co sprowadza to do decyzji o routingu. OrcaRouter przekazuje ceny katalogowe dostawców bez doliczania marży (0%), więc powyższe kwoty to stawki samego DeepSeek, a nie nasze, a harmonogram szczytowy i poza szczytem DeepSeek obowiązuje dokładnie tak, jak definiuje go DeepSeek — łącznie ze zmianą ceny w trakcie okresu przejściowego, która po naszej stronie obowiązuje tego samego dnia. Możesz skierować niewielką część ruchu do nowego modelu i porównać wyniki albo kierować ruch według typu zadania, a za nową ścieżką ustawić automatyczne przełączanie awaryjne, tak aby w razie nieoczekiwanego zachowania V4.1 Flash na Twoich danych żądanie trafiło do V4 Pro, a nie na stronę z błędem.

Biorąc pod uwagę, że dostawca już raz zmienił zdanie co do tego, który z tych modeli zostanie wycofany, utrzymanie obu z nich dostępnych w ramach jednej integracji to opcja, która nie wymaga przewidywania kolejnej zmiany zdania.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, showing the model id with a flagship badge, 1M-token context, 384K max output, text input and text output, $0.66 input and $1.98 output per 1M tokens, a cache rate of $0.024, and observed time to first token of 3.58 s at p50 and 10.00 s at p95

Co obejrzeć

• Czy cena lub status wycofania V4 Pro znów się zmienią. Wrześniowe odwrócenie decyzji było jednoznaczne: rozliczenia pozostają bez zmian — i tego zobowiązania należy egzekwować od dostawcy.

• Czy V4.1 Pro stanie się rzeczywistością. Dopóki nie pojawi się karta modelu lub publikacja wag, historia o parametrach 2T to pogłoska oparta na jednym źródle.

• Niezależna ocena, która uruchamia oba modele na tej samej platformie. Dopóki taka nie istnieje, uczciwe porównanie między tymi dwoma to koszt, opóźnienie i architektura, które są mierzalne, plus uzasadnione przypuszczenie co do możliwości, które nie jest mierzalne.

Do czasu, aż pojawi się trzeci z nich, trafne podsumowanie brzmi: DeepSeek V4.1 Flash jest tańszym, szybszym następcą DeepSeek V4 Pro, V4 Pro jest nadal wspierany w niezmienionej cenie, a pytanie, czy nowsza architektura wiąże się z utratą możliwości, jest pytaniem, na które obecnie nie odpowiada żaden publiczny benchmark.

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie