
DeepSeek V4.1 Flash Wchodzi w Dwudniową Betę API: Nowa Architektura, Natywna Multimodalność i Ambicje Klasy Pro
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0455Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0247Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0247Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0157Inteligencja82Kod
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2646Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1849Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1541Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1251Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0547Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Inteligencja49Kod
DeepSeek V4.1 Flash pojawił się dokładnie tam, gdzie DeepSeek testuje rzeczy, zanim je ogłosi: w produkcyjnym API, pod ID modelu, które ma wbudowaną datę wygaśnięcia. To ID — deepseek-v4.1-flash-expires-on-0910 — zaczęło obsługiwać żądania 8 września 2026 r., po tym jak zespół DeepSeek opublikował w swoich oficjalnych grupach społecznościowych wewnętrzny test „wersji pośredniej”, a ta końcówka 0910 to cała ta historia w miniaturze. To build wrzucony do produkcyjnego środowiska API na ograniczony test, który ma zostać wyłączony około 10 września — przed oficjalnym wpisem o premierze, którego informatorzy wskazujący na ten model spodziewają się „bardzo szybko”. To nie jest premiera. Nie ma karty modelu, raportu technicznego ani wpisu w changelogu, a według stanu na dziś wieczór publiczna strona Models & Pricing firmy DeepSeek nadal wymienia jedynie DeepSeek V4 Flash, DeepSeek V4 Pro i DeepSeek-V4-Flash-Vision-Exp.
Wszystko poniżej należy czytać, mając na uwadze tę gwiazdkę. Oficjalnym kanałem jest tutaj ogłoszenie w grupie społecznościowej i towarzyszący mu formularz opinii, a nie nota wydawnicza. To, co następuje, stanowi połączenie tego ogłoszenia, relacji chińskich mediów powstałych w ciągu kilku godzin od jego publikacji oraz pomiarów z pierwszego dnia, dokonanych przez deweloperów, którzy skierowali własne klucze na ten endpoint — przy czym twierdzenia dostawcy i liczby od społeczności są oznaczone tym, czym są.
Co właściwie wydarzyło się dzisiaj?
Około 15:00 czasu pekińskiego 8 września zespół DeepSeek poinformował swoje oficjalne grupy społecznościowe, że wersja pośrednia — opisywana po chińsku jako 中间版本, czyli punkt pomiędzy wersjami — została udostępniona do ograniczonych testów w rzeczywistym środowisku API, zanim ukaże się wersja finalna. Każdy, kto ma klucz API DeepSeek, może z niej skorzystać: zachowaj dotychczasowy bazowy URL i klucz, a następnie ustaw nazwę modelu na deepseek-v4.1-flash-expires-on-0910. To cała historia dostępu — nie ma osobnego endpointu, listy oczekujących ani nowej konsoli.
Praktyczny margines jest wąski. Sufiks określa plan: wersja testowa „automatycznie wygaśnie i przejdzie w tryb offline 10 września”, pozostawiając około dwóch dni działania. Każde konto jest ograniczone do 20 równoczesnych żądań — w porównaniu z limitem 2500 jednoczesnych połączeń, który DeepSeek publikuje dla deepseek-v4-flash — co jest mocną wskazówką co do intencji: to służy do testów funkcjonalnych i ewaluacji, a nie do kierowania na nie ruchu produkcyjnego.
• Co to jest — punkt kontrolny „wersji pośredniej” umieszczony w produkcyjnym API w celu krótkoterminowych testów przed oficjalną kompilacją.
• Gdzie działa — własne API DeepSeek; adres URL i klucz bez zmian, nazwa modelu zmieniona na deepseek-v4.1-flash-expires-on-0910.
• Jak długo — nazwa wskazuje expires-on-0910; test ma zostać wyłączony około 10 września.
Kto może to wywołać — dowolne konto z kluczem DeepSeek, przy 20 równoczesnych żądaniach na konto.

Za co płaci beta: cennik DeepSeek V4 Flash
DeepSeek stwierdził, że test jest rozliczany według tych samych stawek co deepseek-v4-flash, a obowiązuje aktualna taryfa tego modelu. Od zmiany cen z 16 sierpnia 2026 r. DeepSeek stosuje ceny szczytowe i pozaszczytowe; dokładne kwoty to oficjalne stawki dla warstwy Flash:
• Wejście, trafienie w cache — 0,007 USD za 1 mln tokenów poza szczytem, 0,014 USD w szczycie
• Wejście, brak trafienia w cache — 0,22 USD za 1 mln tokenów poza szczytem, 0,44 USD w szczycie
• Wyjście — 0,66 USD za 1 mln tokenów poza szczytem, 1,32 USD w szczycie
• Godziny szczytu — 01:00–04:00 i 06:00–10:00 UTC, od poniedziałku do piątku; wszystkie pozostałe godziny są pozaszczytowe, a ich stawka wynosi połowę stawki szczytowej.

Zauważ, co się nie zmieniło: cena za token. Twierdzenie DeepSeek, że V4.1 Flash jest „tańszy”, jest więc twierdzeniem o wydajności, a nie obniżką stawki — o czym kilku pierwszodniowych testerów przekonało się na własnej kieszeni, obserwując, jak pięciominutowa sesja wyraźnie mocniej uszczupla ich saldo niż te same pięć minut na DeepSeek V4 Flash, bo model zużywa tokeny znacznie szybciej. To, czy koszt pojedynczego zadania rzeczywiście spadnie, zależy od tego, czy model wykona je, zużywając mniej tokenów i podejmując mniej ponownych prób, czego nikt nie może ocenić po dwóch dniach testów szybkości.
Co oznacza „nowa architektura, natywna multimodalność" — jak dotąd niezweryfikowane
Oficjalny opis modelu V4.1 Flash od DeepSeek składa się z czterech twierdzeń: nowej struktury modelu, natywnego wsparcia multimodalnego, większych możliwości i szybszego generowania. Twierdzenie o architekturze jest tym, które się wyróżnia, ponieważ przełamuje ono utarty schemat. Poprzednie odświeżenie, DeepSeek V4 Flash 0731, było aktualizacją potreningową, która zachowała tę samą architekturę i skalę co wersja preview; sformułowania DeepSeek wskazują tu na zmianę strukturalną, a kilka serwisów odczytało to jako sygnał, że model przetrenowano od nowa, a nie tylko poddano fine-tuningowi. Poza tym cała reszta to już tylko domysły. Spekulacje społeczności o zmienionych mechanizmach uwagi, sieciach eksperckich czy zintegrowanym module wizyjnym są właśnie tym — spekulacjami. Nie opublikowano ani liczby parametrów, ani wielkości okna kontekstowego, ani tabeli benchmarków, ani raportu technicznego.
Sformułowanie „native multimodal” ma znaczenie z konkretnego powodu. DeepSeek-V4-Flash-Vision-Exp — wydany 21 sierpnia, z otwartymi wagami od 31 sierpnia — dosztukował enkoder wizyjny do tekstowej bazy DeepSeek V4 Flash; materiały samego DeepSeeka opisywały to jako model tekstowy plus zewnętrzna ścieżka wizyjna. V4.1 Flash jest natomiast opisywany jako multimodalny od podstaw — wejście w postaci tekstu i obrazów obsługuje sam model bazowy. Zasadniczo to realna różnica architektoniczna, ale specyfikacja modalności nie została opublikowana: testerzy mieli do czynienia z tekstem i obrazami, więc czytelnik powinien traktować „multimodalność” jako potwierdzoną tylko w tym teksto-obrazowym sensie, dopóki nie ukaże się karta modelu. To, czy w planach jest szerszy zakres wejść, pozostaje w chwili pisania tego tekstu niewiadomą, a nie potwierdzonym faktem.
Prędkość jest nagłówkiem — i jest to miara społecznościowa
Liczba krążąca pierwszego dnia wynosi mniej więcej 420 tokenów wyjściowych na sekundę w długich generacjach, a w pojedynczych przebiegach zgłaszano szczyty powyżej 500 tokenów/s. Jeden szeroko udostępniany test wygenerował ponad 71 000 tokenów w mniej niż trzy minuty. Nic z tego nie jest oficjalne: to pomiary deweloperów wykonane względem endpointu beta, w niekontrolowanych warunkach, a DeepSeek nie opublikował żadnego własnego benchmarku szybkości. Dla porównania: Artificial Analysis mierzy publiczny endpoint DeepSeek V4 Flash 0731 na mniej więcej 128 tokenów/s, więc wczesne raporty wskazują na około trzykrotny lub większy skok surowej przepustowości — z typowym zastrzeżeniem, że przepustowość zależy od długości wejścia, współbieżności i warunków serwerowych.
Porównania end-to-end z DeepSeek-V4-Flash-Vision-Exp pokazują największe różnice, ponieważ mierzą to samo zadanie jedno po drugim. Testerzy zgłaszali około 6× szybsze działanie end-to-end przy zadaniu generowania kodu SVG, około 5.2× przy wyszukiwaniu w długim kontekście 49k tokenów, około 5× przy dużym zadaniu generowania i optymalizacji SQL, 4.6× przy zadaniu algorytmicznym oraz 3.9× przy zadaniu refaktoryzacji asynchronicznej. Traktuj te wyniki jako orientacyjne, a nie precyzyjne: liczby end-to-end dla tego samego zadania uwzględniają czas myślenia, opóźnienie pierwszego tokena i szybkość generowania, a pochodzą od pojedynczych testerów, a nie z kontrolowanego zestawu testów. Spójny kierunek we wszystkich przypadkach jest interesującym sygnałem, a nie pojedynczy mnożnik.
Pytanie leżące u podstaw wersji beta
Najbardziej strategiczny szczegół kryje się w formularzu zwrotnym, który DeepSeek dołączył do testu. Obok pytań o frameworki agentowe i scenariusze ze świata rzeczywistego pyta testerów wprost, czy pośrednia wersja DeepSeek V4.1 Flash „może w pełni zastąpić dostępny online DeepSeek V4 Pro”. To niezwykłe pytanie, jakie firma stawia przed użytkownikami, ponieważ DeepSeek V4 Pro jest trzy poziomy cenowe powyżej Flasha: przy obecnych oficjalnych stawkach model Pro kosztuje 0,66 USD za 1 mln tokenów wejściowych (cache miss) i 1,98 USD za 1 mln tokenów wyjściowych poza szczytem, wobec 0,22 i 0,66 USD za DeepSeek V4 Flash — czyste 3× w każdym przypadku. Jeśli model klasy Flash naprawdę zbliża się do możliwości klasy Pro przy cenach klasy Flash, to pytanie samo sobie odpowiada dla dużej części użytkowników — a DeepSeek o tym wie.
Czytany razem z sformułowaniem „nowa struktura", kwestionariusz sugeruje, że V4.1 Flash to pierwszy widoczny krok czegoś większego niż punktowe odświeżenie — przestawienie linii Flash mające na celu skrócenie dystansu do flagowca, tak jak DeepSeek wielokrotnie używał tańszego, szybszego modelu, by zresetować oczekiwania rynku co do tego, co daje dany poziom cenowy. Nic z tego nie jest potwierdzone żadnym benchmarkiem; to strategiczna interpretacja pytania składającego się z dwóch zdań. Ale to najciekawsza rzecz, jaką DeepSeek powiedział o V4.1 Flash przez cały dzień.
Gdzie to wypróbować, a co wdrożyć na produkcji w międzyczasie.
W oknie testowym jedynym miejscem, w którym można uzyskać dostęp do V4.1 Flash, jest własne API DeepSeek — nie ma hostingu u stron trzecich dla wersji, która wygasa za dwa dni, i nikt nie powinien podłączać ścieżki produkcyjnej do ID modelu, który ma przestać odpowiadać. Rozsądne wykorzystanie najbliższych dwóch dni to ewaluacja: uruchom swoje reprezentatywne obciążenia, zmierz jakość i rzeczywistą ekonomikę tokenów, a każdą liczbę dotyczącą szybkości traktuj jako anegdotyczną, dopóki nie pojawi się oficjalna premiera z kartą modelu.
Dla ruchu, który musi działać bez przerwy, publiczna oferta DeepSeek pozostaje bez zmian — i właśnie tam warstwa routingu pokazuje swoją przydatność. Na OrcaRouter modele DeepSeek V4 Flash, DeepSeek V4 Pro i DeepSeek-V4-Flash-Vision-Exp są dostępne przez jedno API, po cenie katalogowej DeepSeek, bez żadnego narzutu — więc sierpniowa obniżka cen działa u nas od dnia jej wejścia w życie, a nie od momentu, w którym arkusz marż w końcu ją przeliczył. Gdy oficjalny V4.1 Flash trafi do dostawców, ta sama konfiguracja będzie sposobem na wdrożenie go przy niskim koszcie przełączenia: skieruj część ruchu do nowego modelu, pozostaw DeepSeek V4 Flash lub V4 Pro jako automatyczny failover i pozwól, aby DSL routera decydował, które wywołania zasługują na nieprzetestowany model, a które powinny zostać przy sprawdzonym koniu roboczym. Nie musisz stawiać ścieżki produkcyjnej na dwudniowej becie, żeby przekonać się, czy model jest dobry.

Otwarte pytania
• Kiedy nastąpi oficjalna premiera? Sygnał, który wytypował ten model, mówi, że post o wydaniu ma się pojawić „bardzo szybko”; dwudniowy okres wersji beta sugeruje, że DeepSeek nie zamierza kazać światu długo czekać.
Czy finalna kompilacja odpowiada tej? Niezależni testerzy śledzący cykle testowe DeepSeeka zauważają, że firma wydaje się równolegle prowadzić wiele kompilacji kandydujących, a najszybszy kandydat we wczesnym teście nie zawsze jest tym, który trafia do wydania — więc dzisiejsze wyniki prędkości mogą nie opisywać modelu GA.
• Jakie są specyfikacje? Liczba parametrów, szczegóły architektury, długość kontekstu i pełna lista modalności wejściowych — wszystko to nie zostało opublikowane, a to pierwsze rzeczy, których potrzebuje rzetelna recenzja.
• Czy cena się utrzyma i czy „niższy koszt” przetrwa kontakt z rzeczywistymi obciążeniami? Wersja beta rozliczana jest według stawek DeepSeek V4 Flash; premiera może przynieść nowy cennik, a koszt pojedynczego zadania nie jest zmierzony.
• Czy naprawdę sprosta roli Pro? Kwestionariusz zadaje to pytanie, ale odpowiedzieć na nie mogą tylko niezależne ewaluacje na zestawach agentowych i do rozumowania — czyli benchmarki, które obecnie oddzielają poziom Flash od poziomu Pro.
Jeśli masz klucz DeepSeek, dwudniowy zegar to sedno sprawy: wywołaj deepseek-v4.1-flash-expires-on-0910, zanim zniknie, uruchom własne obciążenia, a wyniki zapisz pod hasłem "community-measured, conditions vary". Dla wszystkich pozostałych najważniejszy jest post o wydaniu i pytanie, które za nim stoi — czy najtańszy poziom DeepSeek właśnie zaczął celować w ten najdroższy.
Podczas gdy dwudniowa beta dochodzi do siebie, od stabilnego modelu Flash, który możesz faktycznie uruchomić już dziś, dzieli Cię jedno wywołanie API: DeepSeek V4 Flash na OrcaRouter — po cenie katalogowej DeepSeek, z 0% narzutu.
A flagowym modelem, z którym ankieta beta wciąż każe testerom porównywać V4.1 Flash, jest: DeepSeek V4 Pro na OrcaRouter.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
