
DeepSeek V4.1 Flash kontra DeepSeek V4 Flash: Ta sama karta cenowa Flash, ponownie wytrenowany model
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Inteligencja49Kod
Tydzień, w którym DeepSeek V4.1 Flash przeszedł od plotkowanego następcy do oficjalnie dostępnego modelu Flash, był krótki i głośny. 8 września model pojawił się jako dwudniowy test API pod identyfikatorem deepseek-v4.1-flash-expires-on-0910 — wersja, którą sam DeepSeek nazwał „wersją pośrednią”. 9 września jego otwarta platforma poinformowała, że oficjalne wydanie, DeepSeek V4.1 Flash, pojawi się około 10 września i że „wszechstronnie przewyższa” DeepSeek V4 Pro pod względem możliwości, kosztów, szybkości i czasu end-to-end. 10 września komunikat o wydaniu został opublikowany wraz z nowym cennikiem serii Flash, wprowadzonym o 12:00 czasu pekińskiego, jakiego DeepSeek V4 Flash nie widział od sierpniowej podwyżki cen. Niezależnie od reszty, tekstowy koń roboczy DeepSeek V4 Flash nie jest już najnowszym sposobem na uruchamianie zadań Flash, a ten artykuł jest o tym, co to faktycznie zmienia dla aplikacji, której używasz dzisiaj.
Tak wczesne porównania są wypaczone i warto to powiedzieć, zanim pojawią się liczby. DeepSeek V4 Flash ma opublikowaną kartę specyfikacji, miesiąc ruchu produkcyjnego od aktualizacji DeepSeek-V4-Flash-0731, otwarte wagi oraz niezależne pomiary od Artificial Analysis. DeepSeek V4.1 Flash ma oficjalne ogłoszenie, dwa dni społecznościowych testów szybkości, ale nie ma jeszcze opublikowanej karty, raportu technicznego ani wyniku od strony trzeciej. Twierdzenia producenta są poniżej oznaczone jako twierdzenia producenta; wyniki społeczności są oznaczone jako zmierzone przez społeczność.
Poziom Flash właśnie się zresetował — trzy zmiany, jeden tydzień
DeepSeek V4 Flash, model mieszanki ekspertów (MoE) z 284 miliardami parametrów, z czego 13 miliardów aktywnych, był rozsądnym domyślnym wyborem o niskich kosztach i wysokiej przepustowości dla dużej części produkcyjnego ruchu tekstowego od czasu odświeżenia 31 lipca. Trzy ogłoszenia w ciągu trzech dni zachwiały jego pozycją:
• 8 września — DeepSeek udostępnił ograniczoną czasowo betę V4.1 Flash dla każdego konta API, z limitem 20 równoczesnych żądań i wygaśnięciem zaplanowanym na 10 września, pod nazwą modelu, która miała własną datę wygaśnięcia.
• 9 września — otwarta platforma ogłosiła oficjalne wydanie DeepSeek V4.1 Flash na około 10 września, opisując nową strukturę modelu z natywną obsługą multimodalną i twierdząc, że przewyższa DeepSeek V4 Pro pod względem wydajności, kosztów, szybkości i całkowitego czasu realizacji.
• 10 września — oficjalne wydanie wprowadza nowy cennik serii Flash, obowiązujący od godziny 12:00 czasu pekińskiego, obniżając stawki, które DeepSeek V4 Flash pobierał od podwyżki z 17 sierpnia, która spotkała się z ostrą krytyką ze strony deweloperów.
Ostatnia z nich zasługuje na osobne omówienie, ponieważ to rzadka obniżka cen, która jest faktyczną obniżką. Na nowej liście poza szczytem wejście z trafieniem pamięci podręcznej spada z ¥0,05 do ¥0,02 za milion tokenów — czyli o 60% — podczas gdy wejście z brakiem trafienia spada z ¥1,5 do ¥1, a wyjście z ¥4,5 do ¥4. Stawki w godzinach szczytu są dwukrotnie wyższe niż poza szczytem. W zaokrągleniu do dolarów amerykańskich to mniej więcej 0,003 USD za milion wejścia z trafieniem, 0,14 USD za wejście z brakiem trafienia i 0,56 USD za wyjście poza szczytem, a w szczycie dwukrotnie więcej. 24-dniowy odstęp między sierpniową podwyżką a tą obniżką nie był przypadkiem w harmonogramie; reset cen jest częścią premiery V4.1 Flash.
Ten sam poziom, inny model
Łatwo uznać, że V4.1 Flash to V4 Flash z podkręconym pokrętłem prędkości. To nieprawda. Odświeżenie 0731 było aktualizacją po treningu na istniejącej bazie DeepSeek V4 Flash — ta sama architektura, ten sam układ mixture-of-experts: 284B łącznie / 13B aktywnych parametrów. To, jak DeepSeek opisuje V4.1 Flash, wskazuje na coś większego: nową strukturę modelu, którą kilka serwisów odebrało jako nowy przebieg pre-treningu, a nie fine-tuning. To rozróżnienie ma znaczenie, ponieważ model wytrenowany od nowa nie dziedziczy zachowań starego modelu tak, jak robi to odświeżenie — reagowanie na prompty, wywoływanie narzędzi i styl wypowiedzi mogą się zmienić, nawet tam, gdzie możliwości pozostają bez zmian.
• Architektura — DeepSeek V4.1 Flash: nowa struktura modelu, określana przez DeepSeek jako świeża konstrukcja z natywnym wejściem multimodalnym. DeepSeek V4 Flash: potreningowe odświeżenie V4-Flash-0731 modelu MoE o łącznej liczbie 284B parametrów / 13B aktywnych.
• Dane wejściowe — V4.1 Flash natywnie obsługuje tekst i obrazy w modelu bazowym; DeepSeek V4 Flash obsługuje wyłącznie tekst, a obrazy wymagają osobnej wersji dodatkowej DeepSeek-V4-Flash-Vision-Exp.
DeepSeek V4 Flash zapewnia kontekst o wielkości 1M i maksymalne wyjście 384K; materiały premierowe DeepSeek mówią, że V4.1 Flash zachowuje okno kontekstowe o skali miliona tokenów, ale nie opublikowano żadnej oficjalnej karty specyfikacji.
• Współbieżność — DeepSeek V4 Flash deklaruje limit 2500 jednoczesnych połączeń; wersja beta V4.1 Flash była ograniczona do 20, a deklaracja DeepSeek o „wysokiej współbieżności” dla wersji wydaniowej nie była jeszcze poparta opublikowaną liczbą w momencie pisania tego tekstu.
• Wagi — DeepSeek V4 Flash ma otwarte wagi na licencji MIT; nic nie ogłoszono w sprawie V4.1 Flash.
• Niezależny status — DeepSeek V4 Flash został zmierzony przez Artificial Analysis; DeepSeek V4.1 Flash nie ma jeszcze wyniku od strony trzeciej.
Kwestia tekstu kontra multimodalności zasługuje na jedno dodatkowe zdanie nawet w porównaniu tekstowym, ponieważ przesądza o tym, dla kogo przeznaczony jest V4.1 Flash. Jeśli Twój pipeline opierał się na DeepSeek V4 Flash do tekstu i DeepSeek-V4-Flash-Vision-Exp do obrazów, V4.1 Flash to pierwsza wersja DeepSeek, która obejmuje obie ścieżki w jednym modelu — jeden endpoint do utrzymania, bez enkodera doczepionego z boku.

To, w czym naprawdę się różnią: przepustowość i koszt ukończonego zadania.
Przy równych cenach oba modele różnią się szybkością, a właśnie szybkość jest tym, co najbardziej rzuca się w oczy. Artificial Analysis mierzy model DeepSeek V4 Flash 0731 na poziomie około 120–140 tokenów na sekundę w API DeepSeek, w zależności od konfiguracji i okna pomiarowego. Osoby testujące V4.1 Flash pierwszego dnia zgłaszały ciągłe generowanie między około 280 a 500 tokenów na sekundę, w zależności od zadania, z szczytami powyżej 500 w przebiegach o niskim współbieżności; wyższe wartości pochodzą z pomiarów społeczności, a nie od producenta, a liczba tokenów na sekundę nigdy nie jest wewnętrzną cechą modelu. Mimo to kierunek zmian jest spójny we wszystkich raportach z pierwszego dnia, a własna deklaracja DeepSeek o szybszym generowaniu i krótszym całkowitym czasie realizacji wskazuje na to samo.
Ta różnica w szybkości zmienia ekonomikę nawet przy tych samych stawkach dla obu modeli, bo płacisz za token, a tokeny docierają szybciej. Zadanie z wyszukiwaniem w długim kontekście lub generowaniem kodu, które na V4 Flash zajmowało minutę, na V4.1 Flash może zakończyć się w ułamku tego czasu przy tej samej cenie za token — kilku testerów pierwszego dnia zgłosiło pięcio- lub sześciokrotnie szybsze wykonanie całościowe właśnie w tych klasach zadań. Wczesne narzekania w becie, że „szybciej wydaje pieniądze”, były drugą stroną tego samego medalu: przy niezmienionej cenie za token model, który emituje tokeny dwa–trzy razy szybciej, szybciej opróżnia saldo w każdej minucie. To, czy rachunek za pojedyncze zadanie faktycznie spadnie, zależy od tego, czy nowy model skończy z mniejszą liczbą tokenów i mniejszą liczbą ponownych prób — a tego właśnie nikt jeszcze nie potrafi udowodnić.
Na samej karcie cenowej oba modele widnieją obok siebie. Za milion tokenów poza szczytem na liście z 10 września: ¥0,02 za wejście z trafieniem w pamięć podręczną, ¥1 za wejście z chybieniem i ¥4 za wyjście, w szczycie dwukrotnie więcej — ta sama lista, która przed obniżką obowiązywała dla warstwy Flash, wynosiła ¥0,05, ¥1,5 i ¥4,5. W przypadku obciążenia intensywnie korzystającego z pamięci podręcznej obniżka jest najważniejsza: ¥0,02 wobec ¥0,05 to redukcja o 60% w odniesieniu do tokenów stanowiących większość strumienia wejściowego autouzupełniania lub pętli agenta. W przypadku zadania pozyskiwania nowych danych, które nie trafia w pamięć podręczną, oszczędność jest bliższa jednej trzeciej. Nic z tego nie sprawia, że V4.1 Flash jest tańszy za token niż V4 Flash — dzielą tę samą kartę — ale wyższa przepustowość architektury jest wyróżnikiem i nie kosztuje nic dodatkowo.

Paragony dotyczą V4 Flash; roszczenia dotyczą V4.1 Flash
Najważniejszym obecnie faktem dotyczącym porównania tych modeli jest to, że dla nowego modelu nie ma żadnego benchmarku. Główna deklaracja DeepSeek V4.1 Flash — że model ten wszechstronnie przewyższa DeepSeek V4 Pro pod względem możliwości, kosztów i szybkości — pochodzi od producenta i nie została potwierdzona. Nie opublikowano ani liczby parametrów, ani tabel wyników, ani raportu technicznego, a Artificial Analysis nie zmierzył tego modelu w momencie pisania tego tekstu. W zestawieniu z rodziną modeli, której ostatnia premiera flagowego modelu została poddana niezależnej weryfikacji, stwierdzenie „zaufajcie nam, bije Pro" należy traktować z rezerwą, dopóki nie zweryfikuje go niezależna strona trzecia.
DeepSeek V4 Flash ma natomiast prawdziwe udokumentowane osiągnięcia. Artificial Analysis zalicza wersję rozumującą 0731 do czołowych modeli w swojej klasie, ocenia ją znacznie powyżej mediany dla porównywalnych modeli o otwartych wagach i mierzy jej przepustowość wyjściową na własnym API DeepSeek w zakresie ~120–140 tokenów na sekundę, o którym mowa powyżej. To z tymi liczbami będzie porównywany V4.1 Flash, gdy pojawi się jego własny wynik, a wyznaczają one wyższą poprzeczkę, niż sugerowałaby etykieta „szybki i tani Flash”. Model, który zastępuje nowa wersja, nie jest słaby; to naprawdę mocny koń roboczy o otwartych wagach. To właśnie sprawia, że decyzja o aktualizacji jest realna, a nie ceremonialna.
Routing wykonuje ciężką pracę — wewnątrz DeepSeek i dla Ciebie.
Najmniej nagłośnionym elementem tej premiery jest to, że DeepSeek przekierowuje ruch pomiędzy własnymi modelami. Ogłoszenie DeepSeek jest jednoznaczne: gdy V4.1 Flash będzie dostępny i dopóki nie pojawi się V4.1 Pro, każde żądanie API skierowane do deepseek-v4-pro będzie obsługiwane przez DeepSeek V4.1 Flash i rozliczane według ceny tieru Flash. Użytkownicy V4 Pro otrzymują nową architekturę i ułamek kosztu za token bez zmiany ani jednej linii kodu. Zwróć uwagę na to, co nie podlega przekierowaniu: wywołania deepseek-v4-flash. Stary model Flash nadal obsługuje każdego, kto wciąż się do niego odwołuje, i właśnie dlatego istnieje to porównanie — jeśli korzystasz z V4 Pro, przełączenie następuje za Ciebie, a jeśli korzystasz z V4 Flash, to decyzja, którą musisz podjąć sam.
To, że dostawca po cichu postanawia, iż tańszy model ma obsługiwać wywołania kierowane do jego wersji premium, jest wyrazistym potwierdzeniem V4.1 Flash — a zarazem jest to ta sama logika, którą warstwa routingu stosuje wobec dostawców. To właśnie tę lukę wypełnia platforma taka jak OrcaRouter: jedno API dla ponad 200 modeli, z cenami katalogowymi dostawców przekazywanymi dalej przy 0% marży, dzięki czemu obniżka Flasha z 10 września u DeepSeek jest u nas aktywna tego samego dnia.DeepSeek V4 Flash na OrcaRouter pozostaje wywoływalny przy użyciu tego samego klucza co każdy inny model, który uruchamiasz, co sprawia, że bezpieczne wdrożenie modelu dostępnego od pierwszego dnia jest naprawdę tanie: skieruj część ruchu na DeepSeek V4.1 Flash przez API DeepSeek, pozostaw DeepSeek V4 Flash jako automatyczny fallback w tej samej regule routingu i pozwól, aby failover wychwytywał przypadki brzegowe, podczas gdy nowa architektura udowodni swoją wartość.
DeepSeek V4.1 Flash vs DeepSeek V4 Flash: który powinieneś wywołać?
Gdyby uczciwa odpowiedź brzmiała: ten czy tamten model dla każdego, nie byłoby żadnego artykułu. Oba pasują teraz do różnych profili ryzyka, a podział jest wyjątkowo wyraźny.

Przejdź na DeepSeek V4.1 Flash, jeśli dziś zaczynasz nowe obciążenie Flash, jeśli opóźnienie i przepustowość są wiążącym ograniczeniem, jeśli chcesz wprowadzać obrazy bez utrzymywania drugiego modelu, albo jeśli chcesz, aby routing DeepSeek sam zniwelował ryzyko związane z deklaracją poziomu Pro. Model jest dostępny w autorskim API DeepSeek pod nazwą deepseek-v4.1-flash, wyceniony w tym samym planie Flash co model, który zastępuje, a każdy sygnał z pierwszego dnia wskazuje, że jest znacznie szybszy.
Pozostań przy DeepSeek V4 Flash, jeśli obsługujesz ruch produkcyjny przy opublikowanym pułapie 2500 jednoczesnych połączeń, jeśli polegasz na jego otwartych wagach do samodzielnego hostingu lub zgodności, albo jeśli Twoje prompty, ewaluacje i logika wywoływania narzędzi zostały dostrojone pod zachowanie wersji 0731 i nie mogą od pierwszego dnia zaabsorbować dziwactw ponownie wytrenowanego modelu. Świeży przebieg pre-treningu to zmiana zachowania, a nie tylko szybkości, a build 0731 to wersja z miesiącem przychodów.
Dla większości zespołów rozsądną domyślną opcją jest środkowa droga: traktuj DeepSeek V4.1 Flash jako domyślny model dla nowych obciążeń, pozostaw DeepSeek V4 Flash jako rozwiązanie awaryjne dla obciążenia, które przynosi dochody, i pozwól, aby pierwszy niezależny raport porównawczy — wraz z opublikowaną kartą specyfikacji i liczbą współbieżności — rozstrzygnął spór, którego żadna dwudniowa beta nie rozstrzygnie. Poziom Flash właśnie otrzymał nowy silnik; stary nie jest przestarzały — to punkt odniesienia.
Ciekawi Cię, jak wygląda ruch klasy Pro, gdy DeepSeek kieruje go do V4.1 Flash po cenach Flash? DeepSeek V4 Pro na OrcaRouter — oba na jednym kluczu, rozliczane po cenie katalogowej DeepSeek.
Porównane w tym artykule4
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
