Karta tytułowa hero dla artykułu 'DeepSeek V4 Pro Benchmarks': tablica wyników z dużym wskaźnikiem, nagłówek 'DeepSeek V4 Pro — karta wyników benchmarków', podtytuł 'Oficjalne wyniki 0813, niezależne sprawdzenia i to, czego wciąż nie odtworzono', oraz chipy z napisami 'TERMINAL-BENCH 2.1: 87.9', 'DEEPSWE: 62.7', 'AA INDEX: 53', '1M CONTEXT'. Logo OrcaRouter nałożone w prawym dolnym rogu.
Guides & Insights

DeepSeek V4 Pro — benchmarki: pełna karta wyników 0813, każde niezależne sprawdzenie i to, czego nikt jeszcze nie zweryfikował

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Odpowiedź w jednym zdaniu: DeepSeek V4 Pro może pochwalić się naprawdę mocną kartą wyników w testach agentowych według własnych liczb DeepSeek — Terminal-Bench 2.1 na poziomie 87,9, DeepSWE 62,7, CyberGym 83,3 — ale niemal każda kluczowa liczba pochodzi od producenta, a niezależny obraz jest chłodniejszy.Artificial Analysis ocenia oficjalną kompilację 0813 na 53 punkty w swoim Intelligence Index, na równi z GLM-5.2, cztery punkty za GPT-5.6 Terra i siedem za Kimi K3; Vals AI plasuje ją na 12. miejscu, poniżej poprzedniej generacji GPT-5.5. Ten artykuł to pełna agregacja, której nikt inny nie napisał: kompletna karta wyników 0813, rozszerzony zestaw zadań kodowania z raportu technicznego, każdy istniejący niezależny test oraz uczciwe zestawienie tego, które liczby zostały odtworzone, a które wciąż pozostają wyłącznie słowem DeepSeek.

Oficjalna karta wyników 0813 — własne liczby DeepSeeka, wszystkie z nich

Oficjalne ogłoszenie DeepSeek (dokumentacja API, news260813, 13 sierpnia 2026 r.) informuje o wersji produkcyjnej względem kwietniowej wersji zapoznawczej. Wszystkie liczby w tej sekcji pochodzą od dostawcy — żadna nie została niezależnie zweryfikowana na dzień 16 sierpnia 2026 r.:

Terminal-Bench 2.1 — 87,9 (wersja preview: 72,1).

DeepSWE — 62.7 (podgląd: 12.8) — skok o około 5x, który jest zdecydowanie najbardziej uderzającym twierdzeniem na karcie.

CyberGym — 83.3 (podgląd: 52.7).

Humanity's Last Exam — 42.7 bez narzędzi, 60.0 z narzędziami (podgląd: 37.7 / 48.2).

Toolathlon-Verified — 74.1 (podgląd: 55.9).

AutomationBench (publiczny) — 31.8 (podgląd: 12.8).

DSBench-FullStack — 71,1; DSBench-Hard — 67,2 (wersja preview: 41,8 / 31,1).

NL2Repo — 61.5 (podgląd: 38.5).

Agents' Last Exam — 25,7 (preview: 16,5).

Wzorzec, na który należy zwrócić uwagę, to to, gdzie koncentrują się przyrosty: benchmarki agentowe i cyberbezpieczeństwa. To dokładnie taki rodzaj wyników, jaki laboratorium tworzy, gdy chce reklamować model agenta — i dokładnie taki, który wymaga neutralnego powtórzenia, zanim wydasz na niego pieniądze produkcyjne.

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

Rozszerzony zestaw kodowania z raportu technicznego DeepSeek.

Poza kartą agentową raport techniczny DeepSeek (zestawiony przez BenchLM 16 sierpnia 2026 r.) dodaje szerszy zestaw dotyczący kodowania i długiego kontekstu. Również podany przez dostawcę, oznaczony przez BenchLM jako „Provider exact” — bez niezależnych testów:

SWE-bench Verified — 80,6%; SWE-bench Pro — 55,4%.

LiveCodeBench Pass@1-CoT — 93,5% — najlepszy zweryfikowany w katalogu BenchLM.

Codeforces rating — 3206 — również najlepszy zweryfikowany w katalogu.

BrowseComp — 83,4%; Terminal-Bench 2.0 — 67,9%.

MRCR 1M — 83,5%; CorpusQA 1M — 62,0% — oba są najlepsze w katalogu dla wyszukiwania na 1M tokenów, co ma znaczenie dla modelu, który reklamuje okno kontekstowe 1M tokenów.

GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (wymienione na stronie modelu OrcaRouter).

Co tak naprawdę mierzą niezależni ewaluatorzy

Trzy niezależne źródła uruchomiły DeepSeek V4 Pro, a ich werdykty skupiają się poniżej karty producenta:

Artificial Analysis Intelligence Index — 53 (raport SCMP, sierpień 2026; strona modelu OrcaRouter pokazuje 53.2, sklasyfikowany na 20. miejscu z 132). Na równi z GLM-5.2, o cztery punkty za GPT-5.6 Terra, o siedem punktów za Kimi K3.

Artificial Analysis Coding — 68.8, zajmując 24. miejsce na 130 (według strony modelu OrcaRouter).

Vals AI Index — 12. miejsce, plasując się za GPT-5.5 poprzedniej generacji i znacznie za Kimi K3 oraz Claude Opus 5 (SCMP). Własne testy Vals AI wskazały dwie konkretne słabości: wykonywanie zadań w sandboxowym środowisku terminala oraz budowanie złożonych modeli finansowych w arkuszach kalkulacyjnych Excel.

Vibe Code Bench v1.1 — 49.93 (Vals AI, jedyne niezależne uruchomienie „Benchmark exact" w zestawie).

Uczciwy rejestr — co zostało odtworzone, a co wciąż jest tylko słowem DeepSeeka

To sekcja, którą ma zapewnić artykuł o benchmarkach, i powód, dla którego warto dodać tę stronę do zakładek zamiast relacji z premiery. Podziel każdy wynik do jednego z dwóch koszyków:

Niezależnie pozyskane: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI zajmuje 12. miejsce, Vibe Code Bench 49.93 — oraz osobno pozyskany wynik Terminal-Bench 2.1 równy 78.7, który znajduje się obok wyniku DeepSeek (87.9) na stronie modelu OrcaRouter. Ta dziewięciopunktowa różnica między liczbą producenta a niezależnym uruchomieniem to najważniejsza informacja na tej stronie: to zmierzona luka reprodukcyjna.

Tylko raportowane przez producenta, bez niezależnego odtworzenia: każda wartość na oficjalnej karcie 0813 powyżej (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) oraz cały rozszerzony zestaw programistyczny (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). Własna dokumentacja DeepSeeka określa wynik Terminal-Bench 2.1 jako "provider run."

Czytany w ten sposób, przekaz jest spójny: DeepSeek V4 Pro to prawdziwy model graniczny, choć ze środka stawki — AA 53, notowany na pozycjach od 13. do 29. — a karta wyników dostawcy deklaruje niemal szczytową wydajność agentową i w kodowaniu. Oba stwierdzenia są prawdziwe i nie stoją w sprzeczności; jedno jest zmierzone, drugie zadeklarowane.

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

Ile kosztuje karta wyników

DeepSeek V4 Pro to flagowy model MoE o 1,6T parametrów łącznie / 49B aktywnych, z oknem kontekstowym 1M tokenów i maksymalnym wyjściem 384K tokenów. Na OrcaRouter jego cena odpowiada cennikowi DeepSeek z zerową marżą: 0,435 USD za milion tokenów wejściowych i 0,87 USD za milion tokenów wyjściowych (odczyt z pamięci podręcznej 0,060 USD za milion), według katalogu sprawdzonego 15 sierpnia 2026 r. i potwierdzonego na stronie modelu. Przy tej stawce wyliczenie ceny za punkt to najmocniejszy argument za tym modelem: to mniej więcej jedna dziesiąta ceny wyjściowej modeli, które w niezależnym indeksie osiągają wyniki zbliżone do niego, więc płacisz cenę ze średniej półki za wynik, który — jeśli zapewnienia dostawcy się potwierdzą — jest blisko szczytu. Jedno zastrzeżenie: DeepSeek ogłosił taryfę cenową szczyt/poza szczytem (poza szczytem 50% ceny szczytowej) obowiązującą od 17 sierpnia czasu pekińskiego, więc stawka może się zmienić — podane tu liczby to aktualna cena katalogowa na moment publikacji tego artykułu.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

Gdy to zalecenie jest błędne

Uczciwe przypadki, w których DeepSeek V4 Pro nie powinien być twoim wyborem:

Potrzebujesz niezależnie potwierdzonego granicznego rozumowania. AA Index 53 to środek stawki — Kimi K3 (60) i GPT-5.6 Terra (57) wyprzedzają go i są potwierdzone. Jeśli Twoja decyzja zależy od zmierzonego pułapu, karta dostawcy tego nie zmienia.

Stawiasz produkcję na DeepSWE 62.7, zanim ktoś powtórzy ten test. Skok 12.8→62.7 w jednej wersji to twierdzenie, nie fakt. Poczekaj na niezależne powtórzenie — różnica 87.9 vs 78.7 w Terminal-Bench pokazuje, co można znaleźć.

Twoje zadania to automatyzacja terminala w sandboxie lub modelowanie finansowe w Excelu. Vals AI twierdzi, że to właśnie tam model ma trudności, niezależnie od oceny dostawcy.

Podejmujesz decyzję dotyczącą cyberbezpieczeństwa na podstawie CyberGym 83.3. To DeepSeek testuje swój własny model na swoim własnym benchmarku — dostawca rozwiązań bezpieczeństwa, który kupuje na podstawie tej liczby, kupuje niezweryfikowane dane.

Sedno sprawy

DeepSeek V4 Pro 0813 to prawdziwy model graniczny z kartą wyników dostawcy, która wyprzedza jego niezależne osiągnięcia. Wydanie 0813 przekształciło podgląd tekstowy w poważnego kandydata agentowego — samą premierę opisaliśmy osobno — a jeśli chcesz go dziś przetestować, to jeden klucz zgodny z OpenAI na OrcaRouter w cenie katalogowej DeepSeek, z automatycznym przełączaniem awaryjnym, gdy dostawca zwolni. Po prostu przeczytaj kartę wyników tak, jak dzieli ją ten artykuł: niezależne testy (AA 53, Vals 12. miejsce, wynik 78.7 w Terminal-Bench) to dane, którym możesz ufać dziś; wyniki 87.9 i 62.7 to wartości, które powinieneś zweryfikować, zanim na nich coś zbudujesz. Kupuj go za stosunek ceny do wydajności i kontekst 1M tokenów, a nie za nieodtworzone liczby z nagłówków.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube