
Benchmarki DeepSeek V4.1 Flash: co 74,2 dowodzi, a czego nie dowodzi
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 984 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 195 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
DeepSeek V4.1 Flash uzyskał 74,2 punktu w DeepSWE v1.1, o jedną dziesiątą punktu więcej niż GPT-6 Astra, o pół punktu więcej niż Gemini 3.8 Flash i Claude Opus 5, a liczba ta jest przez cały tydzień cytowana jako zmiana warty. Warto być precyzyjnym co do tego, czym to właściwie jest. Sam model nie jest nowy — DeepSeek V4.1 Flash stał się ogólnie dostępny 2026-09-10, sześć dni temu — więc nic tutaj nie jest premierą. Tym, co pojawiło się w tym oknie, jest warstwa pomiarowa: pierwsze niezależne wpisy w indeksach, pierwszy niezależny wynik areny, wsparcie serwowania od dnia zerowego w trzech stosach oraz decyzja dostawcy o wycofaniu własnego flagowego modelu na rzecz tego. Ta strona to podsumowanie tego, co faktycznie zostało zmierzone, ze wskazaniem źródła przy każdej liczbie, oraz jasne stwierdzenie, czego nikt jeszcze nie ustalił.
Wynik DeepSWE i cztery modele w granicach pół punktu od niego
DeepSWE v1.1 to benchmark inżynierii oprogramowania o długim horyzoncie od Datacurve — 113 oryginalnych zadań w 91 repozytoriach open source i pięciu językach programowania, oparty na zmianach w wielu plikach i poprawności behawioralnej. W karcie modelu samego DeepSeek tabela podana przez dostawcę przedstawia się następująco: DeepSeek V4.1 Flash 74,2, Claude Opus 5 74,0, GPT-5.6 Sol 73,0, Kimi K3 67,5, GLM-5.3 66,9, DeepSeek V4-Pro-0813 62,7, DeepSeek V4-Flash 54,4.
Niezależny ranking dla tego samego benchmarku nie odtwarza tej kolejności, a różnice mają większe znaczenie niż sam nagłówek. Ranking DeepSWE v1.1 Pass@1 firmy Datacurve umieszcza Muse Spark 1.3 (FAIR) na pierwszym miejscu z wynikiem 75,40, przed DeepSeek V4.1 Flash z wynikiem 74,20. Za nim: GPT-6 Astra z 74,12 (bardzo wysoki) i 74,10 (maks.), Gemini 3.8 Flash z 73,83 (wysoki), Claude Opus 5 z 73,65 (maks.).
A więc 74,2 to prawdziwy wpis na prawdziwym rankingu zewnętrznym, i jest drugi, a nie pierwszy. Twierdzenie, które krążyło w dniu premiery — że jest to absolutnie najlepszy wynik w DeepSWE — nie wytrzymuje konfrontacji z rankingiem, na którym widnieje ten wynik. Muse Spark 1.3 ma 1,2 punktu przewagi.
Teraz część, którą się pomija. Cztery czołowe modele mieszczą się w granicach 0,55 punktu od siebie w tym benchmarku: 74,20, 74,12, 73,83, 73,65. To węższy przedział niż szum pomiarowy. Publikowana zmienność między kolejnymi uruchomieniami w DeepSWE wynosi rzędu od 1,4 do 3,2 punktu — trzy do sześciu razy więcej niż cały rozrzut najlepszej czwórki. Przewaga 0,2 punktu nad GPT-6 Astra nie jest odkryciem; to, jak wygląda remis, gdy wydrukuje się go z dokładnością do dwóch miejsc po przecinku.
Wrażliwość na scaffold to drugi powód, by nie traktować tej liczby zbyt dosłownie, a tutaj dowody dostarcza sama dokumentacja dostawcy. DeepSeek podaje wyniki DeepSWE dla ośmiu scaffoldów w tych samych materiałach premierowych. Wynik 74,2 osiągnięto na mini-SWE. Ten sam model uzyskał 72,6 na DSH Minimal, 70,5 na DSH Standard, 69,8 na Claude Code, 67,6 na DSH PTC, 66,2 na Pi, 65,6 na Codex i 65,5 na OpenCode. To rozrzut 8,7 punktu w przypadku jednego modelu i jednego benchmarku, wynikający wyłącznie z harnessu, w który został opakowany. Kto porównuje wynik DeepSeek uzyskany na mini-SWE z wynikiem konkurenta uzyskanym w innej pętli agenta, ten porównuje scaffoldy, a nie modele.
Gdzie tak naprawdę umieszcza to niezależny indeks
Artificial Analysis przeprowadza stały zestaw testów przy zadeklarowanych ustawieniach wysiłku, co czyni jego Intelligence Index najczystszą dostępną zewnętrzną weryfikacją. Na stronie modelu DeepSeek V4.1 Flash, przy maksymalnym wysiłku rozumowania, wskaźnik wynosi 40 — co daje 6. miejsce wśród 113 modeli w tej klasie, przy medianie dla klasy wynoszącej 18. Zamknięci rywale plasują się powyżej niego: Claude Opus 5 (max) 51, GPT-5.6 Sol (max) 47, GLM-5.3 (max) 45, Kimi K3 (max) 44, Gemini 3.8 Flash (high) 41. Poprzedni flagowy model samego DeepSeek, V4-Pro-0813, plasuje się poniżej z wynikiem 36.
Spójrz na dwa rankingi obok siebie, a rozbieżność okaże się strukturalna, a nie błędem. Na wybranym przez DeepSeek benchmarku, przy odpowiednim szkielecie, model dorównuje czołówce. W stałym zewnętrznym zestawie testów, uśrednionym w zakresie rozumowania, kodowania, matematyki i pracy agentowej, ma jedenaście punktów straty do Claude Opus 5 i jeden punkt straty do Gemini 3.8 Flash. Jedno i drugie może być prawdą. Tabela dostawcy to argument; indeks to średnia.
Na stronie indeksu znajdują się także dwie liczby, które mają znaczenie dla decyzji routingowej i rzadko trafiają na nagłówki. DeepSeek V4.1 Flash osiąga 214,4 tokena wyjściowego na sekundę przy maksymalnym wysiłku — szybko. Wygenerował także 250 mln tokenów wyjściowych podczas ukończenia Intelligence Index, wobec mediany 140 mln, co Artificial Analysis określa jako wyraźnie rozwlekłe. Rozwlekłość nie jest problemem jakościowym; to rachunek. Model, który zużywa o 79% więcej tokenów na myślenie niż jego odpowiedniki, oddaje część swojej przewagi cenowej przy każdym długim wywołaniu wymagającym rozumowania.

ProgramBench: wynik pojedynczego modelu i wynik systemu wieloagentowego to nie ten sam pomiar.
To liczba, którą najłatwiej błędnie odczytać, dlatego warto ją starannie oddzielić.
• Pojedynczy model, standardowa konfiguracja — DeepSeek V4.1 Flash uzyskuje 20,3 w ProgramBench (Almost@1), według własnej karty modelu DeepSeek. To wynik poniżej GPT-5.6 Sol z 23,0 i znacznie poniżej Claude Opus 5 z 37,0, a tylko nieznacznie powyżej GLM-5.3 z 19,0 i Kimi K3 z 17,5. Raportowane przez dostawcę i nie przedstawia modelu w korzystnym świetle.
• Konfiguracja zespołu wieloagentowego — raport techniczny DeepSeek, DeepSeek-V4.1-Flash: Przesuwanie granic kompresji KV Cache, opisuje wstępny przepis Agent Swarm RL, w którym agent prowadzący koordynuje pracę współpracowników za pośrednictwem wspólnej tablicy zadań. Na podzbiorze ProgramBench obejmującym 172 zadania o wysokiej pewności — czyli zadania, w których rozwiązanie referencyjne przechodzi testy na poziomie 95% lub wyższym — konfiguracja wieloagentowa wspina się z 13,59% przy jednogodzinnym terminie do szczytowego wyniku 30,04% przy ośmiu godzinach, podczas gdy bazowy pojedynczy agent przechodzi z 12,79% do 20,39%.
Wartość 30,04% jest źródłem twierdzenia o „30%” i nie jest wynikiem pojedynczego modelu. To zespół agentów, któremu dano osiem godzin, mierzony na filtrowanym podzbiorze, we własnej wstępnej ocenie dostawcy. Porównanie, które się nasuwa — „znacznie powyżej pojedynczego modelu Sol, prawie 2x Kimi K3” — jest arytmetycznie uczciwe wobec wyniku 23,0 modelu Sol i 17,5 modelu K3, a jest to także porównanie między konfiguracją wieloagentową a wynikami bazowymi pojedynczych modeli na innym zestawie zadań. Ten sam raport pokazuje efekt na FrontierSWE v2: konfiguracja wieloagentowa osiąga 32,90% przy dwudziestu godzinach wobec 28,20% w przypadku pojedynczego agenta. Różnica jest realna, maleje w miarę wydłużania terminu, a koszt tokenów potrzebny do jej uzyskania nie jest mały — jedna praktyczna relacja podaje ponad 10x więcej tokenów i czasy działania zbliżające się do czterech godzin.
Liczba parametrów nie jest ustalona, więc każde porównanie rozmiarów traktuj jako tymczasowe.
Notatki o wydaniu DeepSeek opisują „MoE z 552 mld parametrów”. To liczba podana przez dostawcę i właśnie ją powtarza większość doniesień. Nie jest to jednak cały artefakt.
Karta modelu samego DeepSeeka dokumentuje drugi komponent obok szkieletu transformera: „pamięć warunkowa Engram (196B parametrów, rzadko dostępna poprzez wyszukiwanie oparte na tokenach)”. Dodaj oba i otrzymasz 748B. To arytmetyka stojąca za interpretacją społeczności, która krążyła na r/LocalLLaMA w ciągu kilku godzin od wydania, a własny indeks safetensors karty modelu wymienia 763B parametrów w swoich typach tensorów. Liczba około 510 GB w FP8 pochodzi z tego samego nurtu analizy: to, co faktycznie pobierasz i trzymasz w pamięci.
Uzgodnienie polega na tym, że te liczby dotyczą różnych rzeczy. 552B to szkielet obliczeniowy — parametry, przez które przepływa token. 196B to tabela wyszukiwania używana w określonych warstwach, która zwraca zapisane informacje, zamiast wykonywać na nich obliczenia. 8B i 16B, czyli wartości aktywacji podawane przez DeepSeek, to przypadające na token wycinki aktywne odpowiednio podczas prefill i decode. Wszystkie cztery liczby opisują ten sam model.
Nic z tego nie czyni tego porównania bezpiecznym. Każde twierdzenie w rodzaju „ten model dorównuje modelowi czołowemu, będąc ułamkiem jego rozmiaru” opiera się na nagłówku dostawcy, który pomija jedną piątą artefaktu. Dopóki ktoś nie opublikuje odtwarzalnego rozliczenia parametrów, argumenty oparte na rozmiarze powinny zawierać to zastrzeżenie w treści.
ARC-AGI: brak wyników dla tego modelu
Nie istnieje wynik ARC-AGI-2 ani ARC-AGI-1 dla DeepSeek V4.1 Flash. Na stronie zweryfikowanych wyników ARC Prize nie ma wpisu dla tego checkpointu, a własna tabela benchmarków DeepSeek nie zawiera wiersza ARC. Jedynym zweryfikowanym przez ARC Prize wynikiem DeepSeek jest ten dla starszego checkpointu V4 Flash 0731 — 61,4% w ARC-AGI-2 semi-private przy maksymalnym wysiłku rozumowania i 89,0% w ARC-AGI-1, odpowiednio po $0.04 i $0.02 na zadanie. To są wyniki poprzednika na innym modelu i podawanie ich jako wyników V4.1 Flash byłoby błędem. Jeśli ARC-AGI ma znaczenie dla Twojej oceny, ten model nie ma obecnie wyniku.
Co jeszcze wylądowało w oknie?
Dla czytelnika decydującego, czy wypróbować ten model, zmieniły się trzy rzeczy, a żadna z nich nie jest wydaniem samego modelu.
• Niezależny wynik z areny. OpenDesign Arena przepuściła trzynaście modeli przez identyczne zadania projektowe — aplikacje webowe, dashboardy, ekrany mobilne, strony docelowe. DeepSeek V4.1 Flash zdobył 81,2 na 100 punktów wobec 82,7 uzyskanych przez GPT-6 Astra, przy koszcie 0,023 USD za gotowy projekt wobec 1,61 USD, i ukończył w 5,3 minuty wobec 11,1. Wskaźnik dostarczenia — wyniki nadające się do użycia bez poprawek — wyniósł 57,7% wobec 60% w przypadku Astra. To jeden z pierwszych naprawdę niezależnych pomiarów tego modelu i mierzy on konkretnie wyniki projektowe, a nie ogólne rozumowanie czy kodowanie.
• Wsparcie serwowania Day-0 na trzech stackach. vLLM opublikował obraz day-0 (2026-09-09) zwalidowany na sprzęcie NVIDIA i AMD. SGLang i Miles opublikowały wsparcie inferencji i RL typu day-0 w dniu 2026-09-10, obejmujące ścieżkę host-offload Engram, która zwiększyła pojemność pamięci podręcznej KV o 36% na 4x GB300, oraz optymalizację bounded-replay, która podniosła przepustowość prefill 1,56x na 8x H200. Cambricon ogłosił tego samego dnia adaptację Day-0 w stacku vLLM. Dla modelu, którego atutem jest agresywna kompresja pamięci podręcznej KV — jedna czwarta śladu HBM poprzedniej generacji, jedna ósma jej SSD — możliwość uruchomienia na standardowych stackach od pierwszego dnia to różnica między wynikiem laboratoryjnym a czymś, co można wdrożyć.
• Dostawca wycofał swój flagowy model. DeepSeek wycofuje V4-Pro. Od 04:00 UTC 14 września 2026 r. każde żądanie wskazujące „deepseek-v4-pro” jest kierowane do V4.1 Flash i rozliczane według stawek Flash, aż do premiery V4.1 Pro. DeepSeek V4.1 Pro nie został wydany — to przyszły model, a przekierowanie to rozwiązanie tymczasowe, które chroni przypięte integracje przed awarią. Wycofano również: „deepseek-v4-flash” i „deepseek-v4-flash-vision-exp”, oba tymczasowo kierowane do V4.1 Flash w celu zachowania zgodności. Jeśli masz przypięty identyfikator modelu w środowisku produkcyjnym, to przekierowanie jest jedynym faktem operacyjnym na tej stronie, którego nie możesz zignorować.
Co cena robi z decyzją
Cennik to moment, w którym ten model przestaje być historią o benchmarkach. Według własnych opublikowanych stawek DeepSeek, obowiązujących od 04:00 UTC 2026-09-10, przy czym godziny szczytu zdefiniowano jako 01:00–04:00 i 06:00–10:00 UTC w dni powszednie, a wszystko inne jako godziny poza szczytem.
• Poza godzinami szczytu, za milion tokenów — 0,003 USD za trafienie w pamięć podręczną, 0,15 USD za chybienie, 0,60 USD za wyjście.
• Szczytowe, za milion tokenów — 0,006 USD przy trafieniu w pamięć podręczną, 0,30 USD przy chybieniu, 1,20 USD za wyjście.
• Dane wejściowe z pamięci podręcznej w porównaniu z czołowym modelem zamkniętym — trzy dziesiąte centa za milion wobec około pięćdziesięciu centów. W przypadku agenta zapętlającego się na tym samym repozytorium ten poziom obejmuje większość tokenów.
• Zmierzone na naszym własnym katalogu — 0,15 USD za wejście i 0,60 USD za wyjście za milion, 784 ms mediany czasu do pierwszego tokenu, 211 tokenów na sekundę w ciągu ostatnich siedmiu dni.
Artificial Analysis podaje ten sam model po 0,30 USD za tokeny wejściowe i 1,20 USD za tokeny wyjściowe, ze zniżką 98% na pamięć podręczną i mieszaną stawką 0,18 USD za milion — to poziom szczytowy, a obie liczby oznaczają tę samą cenę o różnych porach dnia. Warto przyswoić tę różnicę, zanim porównasz dostawców: modelu z dwustrefową taryfą czasową nie można porównywać na podstawie jednej stawki nagłówkowej.
To także dlatego ceny typu pass-through mają tu większe znaczenie niż zwykle. OrcaRouter udostępnia DeepSeek V4.1 Flash obok pozostałej części swojego katalogu przy 0% marży — cena katalogowa dostawcy, bez zmian, więc szczyty i poza szczytem DeepSeek trafiają po naszej stronie dokładnie tak, jak publikuje je DeepSeek, a zmiana ceny dostawcy obowiązuje tego samego dnia. W przypadku modelu, którego stawka podwaja się na cztery godziny każdego poranka w dni robocze, platforma, która spłaszcza te progi, ukrywa jedyną liczbę, której potrzebowałeś.


Czego nikt nie ustalił
Luka w tej historii nie polega na brakującym benchmarku. Polega na tym, że nie istnieje wiarygodne bezpośrednie porównanie między DeepSeek V4.1 Flash a jego nazwanymi rywalami na wspólnym środowisku testowym, przeprowadzone przez kogoś, kto nie ma interesu w wyniku. Każda liczba na tej stronie jest jedną z trzech rzeczy: raportowana przez dostawcę, uzyskana przez stronę trzecią na innej konfiguracji lub średnią ze stałego zestawu testów, który nie został zaprojektowany do wyizolowania tego starcia. Nie ma przebiegu opublikowanego z wariancją, w którym DeepSeek V4.1 Flash i GPT-6 Astra zostałyby ocenione na tych samych zadaniach, z tym samym szkieletem, przy tym samym ustawieniu wysiłku.
Trzy konkretne rzeczy zmieniłyby obraz, a żadna z nich nie istnieje dziś.
• Porównanie DeepSWE z kontrolowanym szkieletem. Rozpiętość 8,7 punktu między własnymi szkieletami DeepSeek jest większa niż jakakolwiek różnica między czterema najlepszymi modelami w tabeli wyników. Dopóki czołówka nie zostanie zmierzona na jednym środowisku testowym, kolejność na szczycie tej tabeli nie ma znaczenia.
• Niezależna reprodukcja wyniku zespołu agentowego ProgramBench. Wynik 30,04% pochodzi z raportu technicznego dostawcy dotyczącego przefiltrowanego podzbioru 172 zadań, w konfiguracji wstępnej, przy koszcie tokenów, który nie został scharakteryzowany dla budżetów produkcyjnych.
• ARC-AGI. Dla tego checkpointu nie istnieje żaden wynik.
Praktyczna konsekwencja jest węższym wnioskiem, niż sugerują nagłówki. DeepSeek V4.1 Flash mieści się mierzalnie w granicach szumu względem czołówki na jednym benchmarku kodowania o długim horyzoncie, jest naprawdę konkurencyjny w niezależnych zadaniach projektowych przy około 1,4% kosztu i pozostaje około dziesięciu punktów z tyłu w zagregowanym wskaźniku. To wystarcza, by uzasadnić uruchomienie go na własnym obciążeniu i pozwolenie, by Twoja ocena rozstrzygnęła tę kwestię. To nie wystarcza, by uzasadnić przepisanie produkcyjnej tabeli routingu w oparciu o 0,2 punktu — a fakt, że oba te stwierdzenia są prawdziwe, stanowi całe ustalenie.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
