Karta tytułowa hero dla artykułu 'DeepSeek V4 Pro Benchmarks': tablica wyników z dużym wskaźnikiem, nagłówek 'DeepSeek V4 Pro — karta wyników benchmarków', podtytuł 'Oficjalne wyniki 0813, niezależne sprawdzenia i to, czego wciąż nie odtworzono', oraz chipy z napisami 'TERMINAL-BENCH 2.1: 87.9', 'DEEPSWE: 62.7', 'AA INDEX: 53', '1M CONTEXT'. Logo OrcaRouter nałożone w prawym dolnym rogu.
Guides & Insights

DeepSeek V4 Pro — benchmarki: pełna karta wyników 0813, każde niezależne sprawdzenie i to, czego nikt jeszcze nie zweryfikował

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Odpowiedź w jednym zdaniu: DeepSeek V4 Pro osiąga naprawdę solidne wyniki agentowe według danych samego Deep​Seeka — Terminal-Bench 2.1 na poziomie 87,9, DeepSWE 62,7, CyberGym 83,3 — ale niemal wszystkie najważniejsze liczby pochodzą od producenta, a niezależny obraz jest chłodniejszy. Artificial Analysis plasuje oficjalny build 0813 na poziomie 53 punktów w swoim indeksie inteligencji, na równi z GLM 5.2, cztery punkty za GPT-5.6 Terra i siedem za Kimi K3; Vals AI umieszcza go na 12. miejscu, poniżej GPT-5.5 poprzedniej generacji. Ten artykuł to pełne zestawienie, jakiego nikt inny nie opracował: kompletna karta wyników dla builda 0813, rozszerzony zestaw zadań programistycznych z raportu technicznego, wszystkie istniejące niezależne weryfikacje oraz uczciwy bilans tego, które liczby zostały odtworzone, a które wciąż są wyłącznie słowem Deep​Seeka. Tydzień po publikacji karty zaczyna się też wyłaniać obraz serwowania modelu — 19 sierpnia 2026 r. LMSYS i Ant Group opublikowały stack serwowania oparty na H20, który osiąga 271 tokenów wyjściowych na sekundę przy batch size 1; został on omówiony w osobnej sekcji poniżej i — jak wszystko po stronie producenta na tej stronie — zakwalifikowany jako dane deklarowane samodzielnie, dopóki ktoś ich nie odtworzy.

Oficjalna karta wyników 0813 — własne liczby Deep​Seeka, wszystkie z nich

Oficjalne ogłoszenie DeepSeek (dokumentacja API, news260813, 13 sierpnia 2026) informuje o wersji produkcyjnej względem kwietniowej zapowiedzi. Wszystkie liczby w tej sekcji pochodzą od producenta — żadna nie została niezależnie odtworzona według stanu na 16 sierpnia 2026:

• Terminal-Bench 2.1 — 87,9 (wersja preview: 72,1).

• DeepSWE — 62.7 (podgląd: 12.8) — skok o około 5x, który jest zdecydowanie najbardziej uderzającym twierdzeniem na karcie.

• CyberGym — 83.3 (podgląd: 52.7).

• Humanity's Last Exam — 42.7 bez narzędzi, 60.0 z narzędziami (podgląd: 37.7 / 48.2).

• Toolathlon-Verified — 74.1 (podgląd: 55.9).

• AutomationBench (publiczny) — 31.8 (podgląd: 12.8).

• DSBench-FullStack — 71,1; DSBench-Hard — 67,2 (wersja preview: 41,8 / 31,1).

• NL2Repo — 61.5 (podgląd: 38.5).

• Agents' Last Exam — 25,7 (preview: 16,5).

Wzorzec, na który należy zwrócić uwagę, to to, gdzie koncentrują się przyrosty: benchmarki agentowe i cyberbezpieczeństwa. To dokładnie taki rodzaj wyników, jaki laboratorium tworzy, gdy chce reklamować model agenta — i dokładnie taki, który wymaga neutralnego powtórzenia, zanim wydasz na niego pieniądze produkcyjne.

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

Rozszerzony zestaw kodowania z raportu technicznego DeepSeek

Poza kartą agentową, raport techniczny Deep​Seek (zagregowany przez BenchLM 16 sierpnia 2026 r.) dodaje szerszy zestaw dotyczący kodowania i długiego kontekstu. Również raportowany przez dostawcę i oznaczony przez BenchLM jako „Provider exact" — bez niezależnego testu:

• SWE-bench Verified — 80,6%; SWE-bench Pro — 55,4%.

• LiveCodeBench Pass@1-CoT — 93,5% — najlepszy zweryfikowany w katalogu BenchLM.

• Codeforces rating — 3206 — również najlepszy zweryfikowany w katalogu.

• BrowseComp — 83,4%; Terminal-Bench 2.0 — 67,9%.

• MRCR 1M — 83,5%; CorpusQA 1M — 62,0% — oba są najlepsze w katalogu dla wyszukiwania na 1M tokenów, co ma znaczenie dla modelu, który reklamuje okno kontekstowe 1M tokenów.

• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (wymienione na stronie modelu OrcaRouter).

Co tak naprawdę mierzą niezależni ewaluatorzy

Trzy niezależne źródła uruchomiły DeepSeek V4 Pro, a ich werdykty skupiają się poniżej karty producenta:

• Artificial Analysis Intelligence Index — 53 (raport SCMP, sierpień 2026; strona modelu OrcaRouter pokazuje 53,2, co daje 20. miejsce na 132). Na równi z GLM 5.2, cztery punkty za GPT-5.6 Terra, siedem za Kimi K3.

• Artificial Analysis Coding — 68.8, zajmując 24. miejsce na 130 (według strony modelu OrcaRouter).

• Vals AI Index — 12. miejsce, plasując się za GPT-5.5 poprzedniej generacji i znacznie za Kimi K3 oraz Claude Opus 5 (SCMP). Własne testy Vals AI wskazały dwie konkretne słabości: wykonywanie zadań w sandboxowym środowisku terminala oraz budowanie złożonych modeli finansowych w arkuszach kalkulacyjnych Excel.

• Vibe Code Bench v1.1 — 49.93 (Vals AI, jedyne niezależne uruchomienie „Benchmark exact" w zestawie).

Uczciwe rozliczenie — co zostało odtworzone, a co wciąż jest tylko słowem Deep​Seeka.

To sekcja, którą ma zapewnić artykuł o benchmarkach, i powód, dla którego warto dodać tę stronę do zakładek zamiast relacji z premiery. Podziel każdy wynik do jednego z dwóch koszyków:

• Z niezależnych źródeł: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI na 12. miejscu, Vibe Code Bench 49.93 — oraz osobno pozyskany przebieg Terminal-Bench 2.1 wynoszący 78.7, który znajduje się obok wyniku 87.9 Deep​Seeka na stronie modelu OrcaRouter. Ta dziewięciopunktowa różnica między liczbą producenta a niezależnym przebiegiem jest najważniejszą pojedynczą daną na tej stronie: to luka reprodukcyjna, wyrażona liczbowo.

• Tylko dane od producenta, bez niezależnego odtworzenia: każda liczba z oficjalnej karty 0813 powyżej (Terminal-Bench 2.1 87,9, DeepSWE 62,7, CyberGym 83,3, HLE 42,7/60,0, Toolathlon 74,1, AutomationBench 31,8, DSBench 71,1/67,2, NL2Repo 61,5, Agents' Last Exam 25,7) oraz cały rozszerzony zestaw benchmarków kodowania (SWE-bench Verified 80,6, LiveCodeBench 93,5, Codeforces 3206, BrowseComp 83,4, MRCR 83,5, CorpusQA 62,0, GPQA Diamond 92,8). Dokumentacja firmy Deep​Seek określa wynik Terminal-Bench 2.1 jako „uruchomienie u dostawcy”.

Czytany w ten sposób, przekaz jest spójny: DeepSeek V4 Pro to prawdziwy model graniczny, choć ze środka stawki — AA 53, notowany na pozycjach od 13. do 29. — a karta wyników dostawcy deklaruje niemal szczytową wydajność agentową i w kodowaniu. Oba stwierdzenia są prawdziwe i nie stoją w sprzeczności; jedno jest zmierzone, drugie zadeklarowane.

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

Ile kosztuje karta wyników

DeepSeek V4 Pro to flagowy model MoE o 1,6T parametrów łącznie / 49B aktywnych, z oknem kontekstowym 1M tokenów i maksymalnym wyjściem 384K. Na OrcaRouter jest wyceniany w cenie katalogowej DeepSeek z zerową marżą: 0,435 USD za milion tokenów wejściowych i 0,87 USD za milion tokenów wyjściowych (odczyt z pamięci podręcznej 0,060 USD za milion), według katalogu sprawdzonego 15 sierpnia 2026 r. i potwierdzonego na aktualnej stronie modelu. Przy takiej stawce kalkulacja ceny za punkt to najmocniejszy argument za tym modelem: to mniej więcej jedna dziesiąta ceny za tokeny wyjściowe modeli, które w niezależnym indeksie osiągają wyniki zbliżone do niego, więc płacisz ceny ze średniej półki za wynik, który — jeśli zapewnienia producenta się potwierdzą — plasuje się blisko czołówki. Jedno zastrzeżenie: DeepSeek ogłosił harmonogram cen szczytowych i pozaszczytowych (w okresie pozaszczytowym 50% stawki szczytowej), obowiązujący od 17 sierpnia czasu pekińskiego, więc stawka może się zmienić — podane liczby to aktualna cena katalogowa na dzień publikacji tego artykułu.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

Serwowanie DeepSeek V4 Pro: 271 tokenów wyjściowych/s na H20

Benchmarki oceniają to, co model wie; liczby dotyczące serwowania oceniają, jak tanio można skłonić go do myślenia. 19 sierpnia 2026 roku LMSYS — organizacja stojąca za Chatbot Arena — oraz zespół open-source Ant Group opublikowali pierwszą poważną pracę nad serwowaniem dla wersji 0813: „stos serwowania specyficzny dla scenariusza” zbudowany na SGLang, silniku open-source utrzymywanym przez LMSYS. Najważniejsza liczba to 271 tokenów wyjściowych/s przy rozmiarze partii 1 na NVIDIA H20, którą zespół szacuje na 1,42× względem B300 — osiągnięto na układzie z brakiem natywnych Tensor Cores FP4. Są to własne pomiary LMSYS i Ant Group, ogłoszone na ich blogu i na X; żadne z nich nie zostało niezależnie odtworzone.

Pozostałe liczby stacku, wszystkie zgłoszone samodzielnie przez LMSYS i Ant Group na ich własnym stacku:

• Opóźnienie dekodowania — komponent „zoptymalizowany DSpark” skraca czas na token wyjściowy (TPOT) o 74,8–78,0% przy rozmiarze partii 1.

• Prefill — prefill z 1 milionem tokenów kończy się w 43,7 sekundy, co daje 36,5% wzrostu przepustowości prefillu (średnia geometryczna).

• Pamięć podręczna KV — schemat, który zespół nazywa „Humming MXFP4AFP8 + Online C128”, zwiększa pojemność pełnotokenowej pamięci podręcznej KV 10,14×, co czyni obciążenia agentów z 1M tokenów praktycznymi w tej klasie układów krzemowych.

• Dekodowanie per GPU — przy kontekście 4K przepustowość dekodowania na GPU wzrasta z 319,9 do 703,2 tokenów/s/GPU, co stanowi 2,20× poprawę.

Przeczytaj zastrzeżenia, zanim na tej podstawie zaplanujesz flotę. Rozmiar partii 1 to reżim jednego strumienia — to, z czym mierzy się agent interaktywny lub czat, a nie API o wysokiej współbieżności — a porównanie 1,42× względem B300 to wskaźnik podany przez LMSYS bez publikowania bezwzględnej wartości tokenów/s dla B300, więc różnica jest deklarowana, a nie weryfikowalna. Wynik mierzy też cały stos, a nie układ: te zyski pochodzą z optymalizacji na poziomie SGLang na sprzęcie, który w innym przypadku wyglądałby na zbyt słaby dla modelu MoE o łącznej liczbie parametrów 1,6T. Dla kontekstu: strona z modelem na żywo OrcaRouter mierzy DeepSeek V4 Pro na 80,8 tokenów/s na wyjściu przez wspólny endpoint API — wartość dla H20 to benchmark pojedynczego strumienia na dedykowanym stosie, inna liczba o innym znaczeniu.

Jeśli Twoje obciążenie jest obsługiwane przez API, nic z tego nie zmienia sposobu wywoływania modelu: DeepSeek V4 Pro to jeden klucz zgodny z OpenAI na OrcaRouter w cenie listowej Deep​Seek, z automatycznym przełączaniem awaryjnym, gdy dostawca zwolni. Najważniejsze są liczby H20, jeśli Twój zespół rozważa wybór między samodzielnie hostowaną flotą H20 a płaceniem za API — luka, którą zamykają prace LMSYS i Ant Group, to decyzja o zakupie sprzętu, a nie o wyborze modelu.

Gdy to zalecenie jest błędne

Uczciwe przypadki, w których DeepSeek V4 Pro nie powinien być twoim wyborem:

• Potrzebujesz niezależnie potwierdzonego granicznego rozumowania. AA Index 53 to środek stawki — Kimi K3 (60) i GPT-5.6 Terra (57) wyprzedzają go i są potwierdzone. Jeśli Twoja decyzja zależy od zmierzonego pułapu, karta dostawcy tego nie zmienia.

• Stawiasz produkcję na DeepSWE 62.7, zanim ktoś powtórzy ten test. Skok 12.8→62.7 w jednej wersji to twierdzenie, nie fakt. Poczekaj na niezależne powtórzenie — różnica 87.9 vs 78.7 w Terminal-Bench pokazuje, co można znaleźć.

• Twoje zadania to automatyzacja terminala w sandboxie lub modelowanie finansowe w Excelu. Vals AI twierdzi, że to właśnie tam model ma trudności, niezależnie od oceny dostawcy.

• Podejmujesz decyzję dotyczącą cyberbezpieczeństwa na podstawie CyberGym 83.3. To Deep​Seek testuje swój własny model na swoim własnym benchmarku — dostawca zabezpieczeń, który kupuje na podstawie tej liczby, kupuje nieaudytowane dane.

• Kupujesz H20s na podstawie samej liczby 271 tokenów/s. Ta liczba to benchmark oparty na pojedynczym stosie, deklarowany przez producenta, przy rozmiarze wsadu 1 — obiecujący, niezweryfikowany i jeden punkt na krzywej kosztów, która obejmuje również wykorzystanie zasobów, energię i jakikolwiek stos serwowania, który faktycznie byś uruchomił.

Konkluzja

DeepSeek V4 Pro 0813 to prawdziwy model graniczny z kartą wyników dostawcy, która wyprzedza jego niezależne osiągnięcia. Wydanie 0813 przekształciło tekstową zapowiedź w poważnego agentowego gracza — opis wydania omówiliśmy osobno — a jeśli chcesz go dziś przetestować, to jeden klucz zgodny z OpenAI na OrcaRouter w cenie katalogowej DeepSeek, z automatycznym przełączaniem awaryjnym, gdy dostawca się zaciągnie. Po prostu przeczytaj kartę wyników tak, jak dzieli ją ten artykuł: niezależne testy (AA 53, 12. miejsce w Vals, wynik 78.7 w Terminal-Bench) są tym, czemu możesz zaufać już dziś; wyniki 87.9 i 62.7 to coś, co powinieneś zweryfikować, zanim na nich coś zbudujesz. Ta sama dyscyplina dotyczy teraz serwowania: 271 tokenów/s na H20 od LMSYS i Ant Group to najlepszy obraz przepustowości, jaki mamy, i wciąż to ich słowa, dopóki neutralny test tego nie potwierdzi. Kupuj go za stosunek ceny do wydajności i kontekst 1M tokenów, a nie za nienadające się do odtworzenia liczby z nagłówków.

Porównane w tym artykule3

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie