
DeepSeek V4.1 Flash: Całkiem nowy model bazowy pod numerem wersji punktowej
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Inteligencja49Kod
DeepSeek V4.1 Flash został wydany 10 września 2026 roku: otwarte wagi na licencji MIT, kontekst miliona tokenów, zupełnie nowa architektura Causal Encoder-Decoder oraz szkielet mixture-of-experts z 552 miliardami parametrów, który własna karta modelu DeepSeek klasyfikuje w ramach tak zwanej „nowej rodziny architektur”. Jest to również, jeśli tropiciel, który zwrócił uwagę na nazwę, ma rację, pierwszy przypadek, gdy DeepSeek nadaje numer wersji .1 zupełnie nowemu modelowi bazowemu — oznaczenie, które zwykle sygnalizuje poprawkę, a nie przebudowę. DeepSeek V4.1 Pro, flagowiec, na który wskazuje ten numer, nadal nie istnieje.
Ta rozbieżność znaczy więcej niż spór o nazewnictwo. Każdy, kto porównuje generacje DeepSeek po numerze wersji, odczyta przejście z „V4 Flash" do „V4.1 Flash" jako krok łatkowy i odpowiednio do tego dozuje swoją uwagę. Architektura pod spodem mówi co innego, a decyzja samej firmy o wycofaniu flagowego modelu o 1,6 biliona parametrów na rzecz modelu Flash mówi co innego jeszcze głośniej.

Co tak naprawdę wypuszczono 10 września
To nie jest przeciek ani wersja beta. Dwudniowy test API, który rozpoczął się 8 września pod identyfikatorem modelu deepseek-v4.1-flash-expires-on-0910, zakończył się tak, jak zapowiadał jego przyrostek, a prawdziwe wydanie trafiło dziś do aplikacji webowej DeepSeek, aplikacji mobilnej i autorskiego API, z wagami i raportem technicznym opublikowanymi na Hugging Face pod deepseek-ai/DeepSeek-V4.1-Flash.
Praktyczne szczegóły liczą się bardziej niż ceremonia:
• Nazwa modelu — wywołaj deepseek-flash. Przestarzałe nazwy deepseek-v4-flash oraz deepseek-v4-flash-vision-exp są nadal akceptowane, ale nie odnoszą się już do modeli, do których kiedyś się odnosiły: oba zostały wycofane, a żądania używające tych nazw są obsługiwane przez DeepSeek V4.1 Flash i rozliczane według stawki Flash.
• Co jest w pudełku — parametry rdzenia 552B, okno kontekstu 1M tokenów, maksymalne wyjście 384K, wyjście JSON, wywoływanie funkcji oraz tryb myślenia domyślnie włączony z ustawieniami niskiego, wysokiego i maksymalnego wysiłku.
• Licencja — MIT, z dołączonymi wagami, z folderem wnioskowania i osobnym modułem kodowania w repozytorium. DeepSeek wprost zaprasza społeczność open-source do zbudowania wsparcia dla wnioskowania, co jest standardowym sygnałem, że serwowanie od pierwszego dnia w głównych środowiskach uruchomieniowych to kwestia dni, a nie tygodni.
Ten .1, który nie jest wydaniem punktowym
Twierdzenie, od którego zaczął się ten artykuł, pochodziło od teortaxesTex — pseudonimowego, ale bacznie śledzonego obserwatora DeepSeek — z wpisu z 10 września: że to „pierwszy raz, gdy DeepSeek nadaje całkowicie nowemu modelowi bazowemu wersję wydawniczą .1”, że V4.1 „różni się od V4 bardziej niż, powiedzmy, LLaMA 3 od LLaMA 1”, oraz że DeepSeek „nie uważa, żeby to było warte V5” — a autor wpisu nie potrafił powiedzieć dlaczego.
Potraktuj część przyczynową jako wnioskowanie, a część strukturalną jako coś do zweryfikowania. Wnioskowanie — dlaczego DeepSeek wybrał .1 zamiast V5 — to jedynie odczyt jednego obserwatora i nic więcej; nikt spoza firmy nie wyjaśnił tej decyzji, a materiały samego DeepSeeka nigdy jej nie poruszają. Część możliwa do sprawdzenia to architektura, a ona nie wygląda jak wydanie punktowe. Dziennik zmian DeepSeeka opisuje V4.1 Flash jako „najmniejszy model w naszej nowej rodzinie architektur", co jest dziwnym zdaniem jak na opis zmiany wersji: zmiana wersji rozszerza rodzinę, nie zakłada nowej.
Ta dwuznaczność ma realny koszt, który ponoszą kupujący, a nie DeepSeek. Numery wersji to najtańszy sygnał, jaki deweloper ma na pytanie: „czy to nowa generacja, czy tylko dostrojenie, i ile mojego budżetu na ewaluację się jej należy?” DeepSeek sprawił, że ten sygnał jest teraz niewiarygodny w jednym kierunku — model, który zapoczątkował rodzinę architektur, znajduje się o jedno miejsce po przecinku od tego, który zmienił swoją recepturę po treningu. Firma może zachować swój znacznik V5 w rezerwie. Każdy, kto przeprowadza ocenę migracji, płaci za to zamieszanie.
Co oznacza „nowa architektura” w wagach
Karta modelu jest niezwykle szczegółowa, co sprawia, że twierdzenie o generowaniu można łatwo przetestować bez żadnego benchmarku. Cztery rzeczy rzucają się w oczy.

• Asymetryczna aktywacja — architektura Causal Encoder-Decoder to transformer złożony z 40 warstw, zorganizowany jako 20-warstwowy enkoder przyczynowy, po którym następuje 20-warstwowy dekoder, gdzie globalna pamięć podręczna KV dekodera jest rzutowana z końcowych stanów ukrytych enkodera, a nie wyprowadzana z własnych warstw dekodera. Celem tego projektu jest to, że model aktywuje tylko 8B parametrów na token podczas prefillu i 16B podczas dekodowania. Obciążenia agentów intensywne pod względem danych wejściowych — długie dokumenty, długie ślady narzędzi — korzystają z taniej połowy modelu; generowanie korzysta z drogiej połowy.
• Kompresja pamięci podręcznej KV mierzona na token — DeepSeek-V4.1-Flash stosuje główną pamięć podręczną KV w formacie FP4 przy 890 bajtach na token, co według karty specyfikacji stanowi około jednej czwartej wartości DeepSeek V4 Flash. Chińskie doniesienia poszły dalej i przedstawiły kompresję w odniesieniu do modelu V4 pierwszej generacji jako redukcję 437×; ta większa liczba to wyliczenia pochodzące od producenta na innej bazie odniesienia, więc należy traktować ją jako deklarację, a nie pomiar.
• SWA Bounded Replay — uwaga z przesuwnym oknem zwykle wymusza utrwalanie stanu KV na dysku SSD, aby odtworzyć kontekst. To rozwiązanie odtwarza brakujące stany SWA KV, przetwarzając ponownie tylko najbardziej aktualne okno tokenów, zmniejszając trwały ślad KV do około jednej ósmej w porównaniu z DeepSeek V4 Flash.
• Compressed Sparse Attention 2 — każda warstwa uwagi działa w jednym z trzech statycznych trybów (Full, Reindex lub Reuse), współdzieląc stan KV i indeksatora między warstwami, a hierarchiczny rzadki indeksator ogranicza koszt głębszych warstw niezależnie od długości kontekstu.
Przeczytaj te cztery razem, a obraz strategiczny stanie się czytelny: to przede wszystkim architektura pod kątem rzadkości i efektywności pamięci podręcznej, zaprojektowana tak, aby później można było skalować tę samą strukturę. Wzmianka o „nowej rodzinie architektur” niesie realną treść — to deklaracja, że nadchodzi więcej.
Benchmarki: raportowane przez producenta i jak dotąd niepodważone.
DeepSeek opublikował zestaw benchmarków wraz z premierą. Według własnych danych firmy, V4.1 Flash osiąga GPQA Diamond 90,9, rating Codeforces 3471, MathArena Apex 65,6, Terminal-Bench 2.1 na poziomie 90,6, DeepSWE v1.1 74,2 oraz 63,9 w HLE z narzędziami — przy czym ostatni wynik ma przypis ograniczający bazową wartość 36,8 do podzbioru czysto tekstowego tego benchmarku.
Nazwijmy te liczby po imieniu. To dane raportowane przez dostawcę, publikowane bez towarzyszącej niezależnej ewaluacji, i to na nich DeepSeek oparł uzasadnienie wycofania własnego flagowego modelu — co czyni je liczbami, które najbardziej warto sprawdzić. Na dzień premiery, 10 września, Artificial Analysis nie opublikował jeszcze pomiaru DeepSeek V4.1 Flash, a sama strona modelu na Hugging Face wciąż zawierała notę, że model „nie jest wdrożony przez żadnego dostawcę inferencji”. Kluczowe twierdzenie tej premiery — że model klasy Flash kompleksowo pokonuje flagowca z 1,6 biliona parametrów pod względem wydajności, kosztów, szybkości i całkowitego czasu przetwarzania — jest obecnie jedynie deklaracją dostawcy, bez zewnętrznego audytu.
Po drugiej stronie jest też uczciwe zastrzeżenie. Te same raporty dostawcy pokazują, że V4.1 Flash wygrywa 13 z 16 porównań z Kimi K3 i 11 z 13 z GLM-5.3, wciąż jednak ustępując GPT-5.6 Sol i Claude Opus 5 w nowszych zadaniach Terminal-Bench 3.0 i 4.0 oraz w ProgramBench. To spójny obraz — najmocniejszy w kodowaniu, pracy z terminalem i automatyzacji agentów, do których ta architektura jest zoptymalizowana, słabszy w zadaniach wymagających rozumowania na granicy możliwości — i jest to obraz, jaki miałby prawdziwy krok generacyjny.
Cena i przełącznik routingu warte wpisania do kalendarza.
Nowe ceny weszły w życie wraz z premierą i jest to ta sama stawka Flash co wcześniej, a nie obniżka: dla deepseek-flash, wejście z trafieniem w pamięć podręczną kosztuje 0,003 USD za milion tokenów poza szczytem i 0,006 USD w szczycie, wejście z chybieniem 0,15 i 0,30 USD, a wyjście 0,60 i 1,20 USD. Szczyt kosztuje dokładnie dwa razy tyle, co poza szczytem, i obowiązuje od 01:00 do 04:00 oraz od 06:00 do 10:00 UTC w dni powszednie.
Obniżka obejmuje natomiast ruch Pro. DeepSeek V4 Pro wyceniono na $0,022 i $0,044 za wejście z trafieniem w pamięć podręczną, $0,66 i $1,32 za wejście z chybieniem w pamięć podręczną oraz $1,98 i $3,96 za wyjście — więc kierowanie żądań z nazwą Pro do V4.1 Flash obniża ich koszt wyjścia o około 70%, zwiększając przy tym — według DeepSeeka — możliwości, które na nie odpowiadają.

To przekierowanie jest zaplanowane, a nie hipotetyczne. Po 12:00 czasu pekińskiego 14 września 2026 roku żądania określające deepseek-v4-pro będą kierowane do V4.1 Flash i rozliczane według cennika Flash, i w tym stanie pozostaną do czasu premiery DeepSeek V4.1 Pro. Jeśli Twoja integracja ma na sztywno wpisaną nazwę modelu Pro, nic się nie zepsuje — otrzymasz inny model w cenie około jednej trzeciej ceny wyjściowej, bez zmiany kodu i bez powiadomienia poza wpisem w dzienniku zmian. Jeśli routujesz według poziomu możliwości zamiast nazwy modelu, 14 września to data ponownego testowania.
Co to oznacza, jeśli dziś wywołasz DeepSeek
OrcaRouter nie oferuje jeszcze DeepSeek V4.1 Flash — stan na dziś: strona modelu deepseek-v4.1-flash zwraca „model not found” i wolelibyśmy powiedzieć to wprost, niż sugerować co innego. Wynikają z tego dwie rzeczy. Po pierwsze, przekierowanie ogłoszone przez DeepSeek to natywne zachowanie API, więc przełączenie 14 września następuje na własnym endpoincie DeepSeek, niezależnie od tego, jak do niego docierasz. Po drugie, jeśli chcesz dziś nową architekturę, wywołujesz ją bezpośrednio u dostawcy.
To, co kierujemy, to reszta linii DeepSeek przez jeden klucz: DeepSeek V4 Flash oraz DeepSeek V4 Pro, wraz z ponad 200 innymi modelami. Ceny to cennik dostawcy DeepSeek przenoszony dalej z 0% marży, co ma znaczenie przy takiej premierze — gdy dostawca obniża stawkę, obniżka jest u nas aktywna tego samego dnia, a nie po cyklu aktualizacji cen. A gdy V4.1 Flash faktycznie trafi do katalogu, wspomniana wyżej stawka poza szczytem (połowa stawki) to po prostu stawka, a nie zniżka, którą negocjujemy.
Argument routingu dla tak nowego modelu nie tak naprawdę dotyczy ceny. Chodzi o to, jak dużą część swojej ścieżki produkcyjnej stawiasz na architekturę z pierwszego tygodnia, bez niezależnego benchmarku i bez serwowania przez strony trzecie. Trzymanie nowego modelu za warstwą, którą możesz przełączyć — lub testowanie go na kluczu, który nie jest twoim kluczem produkcyjnym — to różnica między oceną a incydentem.
Co rozstrzygnęłoby kwestię nazewnictwa?
Trzy rzeczy, w kolejności rosnącej według tego, ile by ci powiedziały.
Niezależna ocena DeepSeek V4.1 Flash przetestowałaby twierdzenie o architekturze na cudzym środowisku testowym. To jedyny pomiar, który zamienia tabelę producenta w fakt, i najbardziej prawdopodobna kolejna wiadomość.
DeepSeek V4.1 Pro miałby przetestować twierdzenie rodziny. Informacja o routingu wskazywała go jako punkt końcowy okna Pro-to-Flash, co czyni go modelem, wokół którego zorganizowana jest cała ta wersja — i pozostaje on tym, o którym DeepSeek potwierdził najmniej: bez karty, bez liczby parametrów, bez daty, bez wag, bez ceny.
I ta użyteczna, choć mało efektowna kwestia: czy DeepSeek zrobi to ponownie. Drugie oznaczenie .1 na innym nowym modelu bazowym zamieniłoby anomalię w konwencję, a konwencja to coś, wokół czego programista może zaplanować pracę. Jeden model to ciekawostka. Nazewnictwo staje się mylące w użyteczny sposób dopiero wtedy, gdy pojawia się wzorzec.
Na razie praktyczna interpretacja dzieli się wyraźnie w zależności od tego, kim jesteś. Jeśli korzystasz z DeepSeek V4 Pro, zaznacz 14 września w kalendarzu i ponownie przeprowadź swoje ewaluacje przed tym terminem, ponieważ model kryjący się za tą nazwą zmienia się, niezależnie od tego, czy o to poprosisz. Jeśli korzystasz z DeepSeek V4 Flash, jesteś już przenoszony, w tej samej cenie, na architekturę, którą DeepSeek zbudował z myślą o skalowaniu. A jeśli czekałeś na V5, szczera odpowiedź brzmi: DeepSeek najwyraźniej wypuścił tę generację i odmówił nadania jej nazwy — co można zrobić tylko raz, zanim ludzie przestaną ufać numerowi.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
