
DeepSeek V4 Pro — benchmarki: pełna karta wyników 0813, każde niezależne sprawdzenie i to, czego nikt jeszcze nie zweryfikował
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 143 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Odpowiedź w jednym zdaniu: DeepSeek V4 Pro osiąga naprawdę solidne wyniki agentowe według danych samego DeepSeeka — Terminal-Bench 2.1 na poziomie 87,9, DeepSWE 62,7, CyberGym 83,3 — ale niemal wszystkie najważniejsze liczby pochodzą od producenta, a niezależny obraz jest chłodniejszy. Artificial Analysis plasuje oficjalny build 0813 na poziomie 53 punktów w swoim indeksie inteligencji, na równi z GLM 5.2, cztery punkty za GPT-5.6 Terra i siedem za Kimi K3; Vals AI umieszcza go na 12. miejscu, poniżej GPT-5.5 poprzedniej generacji. Ten artykuł to pełne zestawienie, jakiego nikt inny nie opracował: kompletna karta wyników dla builda 0813, rozszerzony zestaw zadań programistycznych z raportu technicznego, wszystkie istniejące niezależne weryfikacje oraz uczciwy bilans tego, które liczby zostały odtworzone, a które wciąż są wyłącznie słowem DeepSeeka. Tydzień po publikacji karty zaczyna się też wyłaniać obraz serwowania modelu — 19 sierpnia 2026 r. LMSYS i Ant Group opublikowały stack serwowania oparty na H20, który osiąga 271 tokenów wyjściowych na sekundę przy batch size 1; został on omówiony w osobnej sekcji poniżej i — jak wszystko po stronie producenta na tej stronie — zakwalifikowany jako dane deklarowane samodzielnie, dopóki ktoś ich nie odtworzy.
Oficjalna karta wyników 0813 — własne liczby DeepSeeka, wszystkie z nich
Oficjalne ogłoszenie DeepSeek (dokumentacja API, news260813, 13 sierpnia 2026) informuje o wersji produkcyjnej względem kwietniowej zapowiedzi. Wszystkie liczby w tej sekcji pochodzą od producenta — żadna nie została niezależnie odtworzona według stanu na 16 sierpnia 2026:
• Terminal-Bench 2.1 — 87,9 (wersja preview: 72,1).
• DeepSWE — 62.7 (podgląd: 12.8) — skok o około 5x, który jest zdecydowanie najbardziej uderzającym twierdzeniem na karcie.
• CyberGym — 83.3 (podgląd: 52.7).
• Humanity's Last Exam — 42.7 bez narzędzi, 60.0 z narzędziami (podgląd: 37.7 / 48.2).
• Toolathlon-Verified — 74.1 (podgląd: 55.9).
• AutomationBench (publiczny) — 31.8 (podgląd: 12.8).
• DSBench-FullStack — 71,1; DSBench-Hard — 67,2 (wersja preview: 41,8 / 31,1).
• NL2Repo — 61.5 (podgląd: 38.5).
• Agents' Last Exam — 25,7 (preview: 16,5).
Wzorzec, na który należy zwrócić uwagę, to to, gdzie koncentrują się przyrosty: benchmarki agentowe i cyberbezpieczeństwa. To dokładnie taki rodzaj wyników, jaki laboratorium tworzy, gdy chce reklamować model agenta — i dokładnie taki, który wymaga neutralnego powtórzenia, zanim wydasz na niego pieniądze produkcyjne.

Rozszerzony zestaw kodowania z raportu technicznego DeepSeek
Poza kartą agentową, raport techniczny DeepSeek (zagregowany przez BenchLM 16 sierpnia 2026 r.) dodaje szerszy zestaw dotyczący kodowania i długiego kontekstu. Również raportowany przez dostawcę i oznaczony przez BenchLM jako „Provider exact" — bez niezależnego testu:
• SWE-bench Verified — 80,6%; SWE-bench Pro — 55,4%.
• LiveCodeBench Pass@1-CoT — 93,5% — najlepszy zweryfikowany w katalogu BenchLM.
• Codeforces rating — 3206 — również najlepszy zweryfikowany w katalogu.
• BrowseComp — 83,4%; Terminal-Bench 2.0 — 67,9%.
• MRCR 1M — 83,5%; CorpusQA 1M — 62,0% — oba są najlepsze w katalogu dla wyszukiwania na 1M tokenów, co ma znaczenie dla modelu, który reklamuje okno kontekstowe 1M tokenów.
• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (wymienione na stronie modelu OrcaRouter).
Co tak naprawdę mierzą niezależni ewaluatorzy
Trzy niezależne źródła uruchomiły DeepSeek V4 Pro, a ich werdykty skupiają się poniżej karty producenta:
• Artificial Analysis Intelligence Index — 53 (raport SCMP, sierpień 2026; strona modelu OrcaRouter pokazuje 53,2, co daje 20. miejsce na 132). Na równi z GLM 5.2, cztery punkty za GPT-5.6 Terra, siedem za Kimi K3.
• Artificial Analysis Coding — 68.8, zajmując 24. miejsce na 130 (według strony modelu OrcaRouter).
• Vals AI Index — 12. miejsce, plasując się za GPT-5.5 poprzedniej generacji i znacznie za Kimi K3 oraz Claude Opus 5 (SCMP). Własne testy Vals AI wskazały dwie konkretne słabości: wykonywanie zadań w sandboxowym środowisku terminala oraz budowanie złożonych modeli finansowych w arkuszach kalkulacyjnych Excel.
• Vibe Code Bench v1.1 — 49.93 (Vals AI, jedyne niezależne uruchomienie „Benchmark exact" w zestawie).
Uczciwe rozliczenie — co zostało odtworzone, a co wciąż jest tylko słowem DeepSeeka.
To sekcja, którą ma zapewnić artykuł o benchmarkach, i powód, dla którego warto dodać tę stronę do zakładek zamiast relacji z premiery. Podziel każdy wynik do jednego z dwóch koszyków:
• Z niezależnych źródeł: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI na 12. miejscu, Vibe Code Bench 49.93 — oraz osobno pozyskany przebieg Terminal-Bench 2.1 wynoszący 78.7, który znajduje się obok wyniku 87.9 DeepSeeka na stronie modelu OrcaRouter. Ta dziewięciopunktowa różnica między liczbą producenta a niezależnym przebiegiem jest najważniejszą pojedynczą daną na tej stronie: to luka reprodukcyjna, wyrażona liczbowo.
• Tylko dane od producenta, bez niezależnego odtworzenia: każda liczba z oficjalnej karty 0813 powyżej (Terminal-Bench 2.1 87,9, DeepSWE 62,7, CyberGym 83,3, HLE 42,7/60,0, Toolathlon 74,1, AutomationBench 31,8, DSBench 71,1/67,2, NL2Repo 61,5, Agents' Last Exam 25,7) oraz cały rozszerzony zestaw benchmarków kodowania (SWE-bench Verified 80,6, LiveCodeBench 93,5, Codeforces 3206, BrowseComp 83,4, MRCR 83,5, CorpusQA 62,0, GPQA Diamond 92,8). Dokumentacja firmy DeepSeek określa wynik Terminal-Bench 2.1 jako „uruchomienie u dostawcy”.
Czytany w ten sposób, przekaz jest spójny: DeepSeek V4 Pro to prawdziwy model graniczny, choć ze środka stawki — AA 53, notowany na pozycjach od 13. do 29. — a karta wyników dostawcy deklaruje niemal szczytową wydajność agentową i w kodowaniu. Oba stwierdzenia są prawdziwe i nie stoją w sprzeczności; jedno jest zmierzone, drugie zadeklarowane.

Ile kosztuje karta wyników
DeepSeek V4 Pro to flagowy model MoE o 1,6T parametrów łącznie / 49B aktywnych, z oknem kontekstowym 1M tokenów i maksymalnym wyjściem 384K. Na OrcaRouter jest wyceniany w cenie katalogowej DeepSeek z zerową marżą: 0,435 USD za milion tokenów wejściowych i 0,87 USD za milion tokenów wyjściowych (odczyt z pamięci podręcznej 0,060 USD za milion), według katalogu sprawdzonego 15 sierpnia 2026 r. i potwierdzonego na aktualnej stronie modelu. Przy takiej stawce kalkulacja ceny za punkt to najmocniejszy argument za tym modelem: to mniej więcej jedna dziesiąta ceny za tokeny wyjściowe modeli, które w niezależnym indeksie osiągają wyniki zbliżone do niego, więc płacisz ceny ze średniej półki za wynik, który — jeśli zapewnienia producenta się potwierdzą — plasuje się blisko czołówki. Jedno zastrzeżenie: DeepSeek ogłosił harmonogram cen szczytowych i pozaszczytowych (w okresie pozaszczytowym 50% stawki szczytowej), obowiązujący od 17 sierpnia czasu pekińskiego, więc stawka może się zmienić — podane liczby to aktualna cena katalogowa na dzień publikacji tego artykułu.

Serwowanie DeepSeek V4 Pro: 271 tokenów wyjściowych/s na H20
Benchmarki oceniają to, co model wie; liczby dotyczące serwowania oceniają, jak tanio można skłonić go do myślenia. 19 sierpnia 2026 roku LMSYS — organizacja stojąca za Chatbot Arena — oraz zespół open-source Ant Group opublikowali pierwszą poważną pracę nad serwowaniem dla wersji 0813: „stos serwowania specyficzny dla scenariusza” zbudowany na SGLang, silniku open-source utrzymywanym przez LMSYS. Najważniejsza liczba to 271 tokenów wyjściowych/s przy rozmiarze partii 1 na NVIDIA H20, którą zespół szacuje na 1,42× względem B300 — osiągnięto na układzie z brakiem natywnych Tensor Cores FP4. Są to własne pomiary LMSYS i Ant Group, ogłoszone na ich blogu i na X; żadne z nich nie zostało niezależnie odtworzone.
Pozostałe liczby stacku, wszystkie zgłoszone samodzielnie przez LMSYS i Ant Group na ich własnym stacku:
• Opóźnienie dekodowania — komponent „zoptymalizowany DSpark” skraca czas na token wyjściowy (TPOT) o 74,8–78,0% przy rozmiarze partii 1.
• Prefill — prefill z 1 milionem tokenów kończy się w 43,7 sekundy, co daje 36,5% wzrostu przepustowości prefillu (średnia geometryczna).
• Pamięć podręczna KV — schemat, który zespół nazywa „Humming MXFP4AFP8 + Online C128”, zwiększa pojemność pełnotokenowej pamięci podręcznej KV 10,14×, co czyni obciążenia agentów z 1M tokenów praktycznymi w tej klasie układów krzemowych.
• Dekodowanie per GPU — przy kontekście 4K przepustowość dekodowania na GPU wzrasta z 319,9 do 703,2 tokenów/s/GPU, co stanowi 2,20× poprawę.
Przeczytaj zastrzeżenia, zanim na tej podstawie zaplanujesz flotę. Rozmiar partii 1 to reżim jednego strumienia — to, z czym mierzy się agent interaktywny lub czat, a nie API o wysokiej współbieżności — a porównanie 1,42× względem B300 to wskaźnik podany przez LMSYS bez publikowania bezwzględnej wartości tokenów/s dla B300, więc różnica jest deklarowana, a nie weryfikowalna. Wynik mierzy też cały stos, a nie układ: te zyski pochodzą z optymalizacji na poziomie SGLang na sprzęcie, który w innym przypadku wyglądałby na zbyt słaby dla modelu MoE o łącznej liczbie parametrów 1,6T. Dla kontekstu: strona z modelem na żywo OrcaRouter mierzy DeepSeek V4 Pro na 80,8 tokenów/s na wyjściu przez wspólny endpoint API — wartość dla H20 to benchmark pojedynczego strumienia na dedykowanym stosie, inna liczba o innym znaczeniu.
Jeśli Twoje obciążenie jest obsługiwane przez API, nic z tego nie zmienia sposobu wywoływania modelu: DeepSeek V4 Pro to jeden klucz zgodny z OpenAI na OrcaRouter w cenie listowej DeepSeek, z automatycznym przełączaniem awaryjnym, gdy dostawca zwolni. Najważniejsze są liczby H20, jeśli Twój zespół rozważa wybór między samodzielnie hostowaną flotą H20 a płaceniem za API — luka, którą zamykają prace LMSYS i Ant Group, to decyzja o zakupie sprzętu, a nie o wyborze modelu.
Gdy to zalecenie jest błędne
Uczciwe przypadki, w których DeepSeek V4 Pro nie powinien być twoim wyborem:
• Potrzebujesz niezależnie potwierdzonego granicznego rozumowania. AA Index 53 to środek stawki — Kimi K3 (60) i GPT-5.6 Terra (57) wyprzedzają go i są potwierdzone. Jeśli Twoja decyzja zależy od zmierzonego pułapu, karta dostawcy tego nie zmienia.
• Stawiasz produkcję na DeepSWE 62.7, zanim ktoś powtórzy ten test. Skok 12.8→62.7 w jednej wersji to twierdzenie, nie fakt. Poczekaj na niezależne powtórzenie — różnica 87.9 vs 78.7 w Terminal-Bench pokazuje, co można znaleźć.
• Twoje zadania to automatyzacja terminala w sandboxie lub modelowanie finansowe w Excelu. Vals AI twierdzi, że to właśnie tam model ma trudności, niezależnie od oceny dostawcy.
• Podejmujesz decyzję dotyczącą cyberbezpieczeństwa na podstawie CyberGym 83.3. To DeepSeek testuje swój własny model na swoim własnym benchmarku — dostawca zabezpieczeń, który kupuje na podstawie tej liczby, kupuje nieaudytowane dane.
• Kupujesz H20s na podstawie samej liczby 271 tokenów/s. Ta liczba to benchmark oparty na pojedynczym stosie, deklarowany przez producenta, przy rozmiarze wsadu 1 — obiecujący, niezweryfikowany i jeden punkt na krzywej kosztów, która obejmuje również wykorzystanie zasobów, energię i jakikolwiek stos serwowania, który faktycznie byś uruchomił.
Konkluzja
DeepSeek V4 Pro 0813 to prawdziwy model graniczny z kartą wyników dostawcy, która wyprzedza jego niezależne osiągnięcia. Wydanie 0813 przekształciło tekstową zapowiedź w poważnego agentowego gracza — opis wydania omówiliśmy osobno — a jeśli chcesz go dziś przetestować, to jeden klucz zgodny z OpenAI na OrcaRouter w cenie katalogowej DeepSeek, z automatycznym przełączaniem awaryjnym, gdy dostawca się zaciągnie. Po prostu przeczytaj kartę wyników tak, jak dzieli ją ten artykuł: niezależne testy (AA 53, 12. miejsce w Vals, wynik 78.7 w Terminal-Bench) są tym, czemu możesz zaufać już dziś; wyniki 87.9 i 62.7 to coś, co powinieneś zweryfikować, zanim na nich coś zbudujesz. Ta sama dyscyplina dotyczy teraz serwowania: 271 tokenów/s na H20 od LMSYS i Ant Group to najlepszy obraz przepustowości, jaki mamy, i wciąż to ich słowa, dopóki neutralny test tego nie potwierdzi. Kupuj go za stosunek ceny do wydajności i kontekst 1M tokenów, a nie za nienadające się do odtworzenia liczby z nagłówków.
Porównane w tym artykule3
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
