
DeepSeek V4 Pro — benchmarki: pełna karta wyników 0813, każde niezależne sprawdzenie i to, czego nikt jeszcze nie zweryfikował
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianNOWOŚĆQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligencja68Kod
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-1340 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaNOWOŚĆMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 221 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0856Inteligencja72Kod
Odpowiedź w jednym zdaniu: DeepSeek V4 Pro może pochwalić się naprawdę mocną kartą wyników w testach agentowych według własnych liczb DeepSeek — Terminal-Bench 2.1 na poziomie 87,9, DeepSWE 62,7, CyberGym 83,3 — ale niemal każda kluczowa liczba pochodzi od producenta, a niezależny obraz jest chłodniejszy.Artificial Analysis ocenia oficjalną kompilację 0813 na 53 punkty w swoim Intelligence Index, na równi z GLM-5.2, cztery punkty za GPT-5.6 Terra i siedem za Kimi K3; Vals AI plasuje ją na 12. miejscu, poniżej poprzedniej generacji GPT-5.5. Ten artykuł to pełna agregacja, której nikt inny nie napisał: kompletna karta wyników 0813, rozszerzony zestaw zadań kodowania z raportu technicznego, każdy istniejący niezależny test oraz uczciwe zestawienie tego, które liczby zostały odtworzone, a które wciąż pozostają wyłącznie słowem DeepSeek.
Oficjalna karta wyników 0813 — własne liczby DeepSeeka, wszystkie z nich
Oficjalne ogłoszenie DeepSeek (dokumentacja API, news260813, 13 sierpnia 2026 r.) informuje o wersji produkcyjnej względem kwietniowej wersji zapoznawczej. Wszystkie liczby w tej sekcji pochodzą od dostawcy — żadna nie została niezależnie zweryfikowana na dzień 16 sierpnia 2026 r.:
• Terminal-Bench 2.1 — 87,9 (wersja preview: 72,1).
• DeepSWE — 62.7 (podgląd: 12.8) — skok o około 5x, który jest zdecydowanie najbardziej uderzającym twierdzeniem na karcie.
• CyberGym — 83.3 (podgląd: 52.7).
• Humanity's Last Exam — 42.7 bez narzędzi, 60.0 z narzędziami (podgląd: 37.7 / 48.2).
• Toolathlon-Verified — 74.1 (podgląd: 55.9).
• AutomationBench (publiczny) — 31.8 (podgląd: 12.8).
• DSBench-FullStack — 71,1; DSBench-Hard — 67,2 (wersja preview: 41,8 / 31,1).
• NL2Repo — 61.5 (podgląd: 38.5).
• Agents' Last Exam — 25,7 (preview: 16,5).
Wzorzec, na który należy zwrócić uwagę, to to, gdzie koncentrują się przyrosty: benchmarki agentowe i cyberbezpieczeństwa. To dokładnie taki rodzaj wyników, jaki laboratorium tworzy, gdy chce reklamować model agenta — i dokładnie taki, który wymaga neutralnego powtórzenia, zanim wydasz na niego pieniądze produkcyjne.

Rozszerzony zestaw kodowania z raportu technicznego DeepSeek.
Poza kartą agentową raport techniczny DeepSeek (zestawiony przez BenchLM 16 sierpnia 2026 r.) dodaje szerszy zestaw dotyczący kodowania i długiego kontekstu. Również podany przez dostawcę, oznaczony przez BenchLM jako „Provider exact” — bez niezależnych testów:
• SWE-bench Verified — 80,6%; SWE-bench Pro — 55,4%.
• LiveCodeBench Pass@1-CoT — 93,5% — najlepszy zweryfikowany w katalogu BenchLM.
• Codeforces rating — 3206 — również najlepszy zweryfikowany w katalogu.
• BrowseComp — 83,4%; Terminal-Bench 2.0 — 67,9%.
• MRCR 1M — 83,5%; CorpusQA 1M — 62,0% — oba są najlepsze w katalogu dla wyszukiwania na 1M tokenów, co ma znaczenie dla modelu, który reklamuje okno kontekstowe 1M tokenów.
• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (wymienione na stronie modelu OrcaRouter).
Co tak naprawdę mierzą niezależni ewaluatorzy
Trzy niezależne źródła uruchomiły DeepSeek V4 Pro, a ich werdykty skupiają się poniżej karty producenta:
• Artificial Analysis Intelligence Index — 53 (raport SCMP, sierpień 2026; strona modelu OrcaRouter pokazuje 53.2, sklasyfikowany na 20. miejscu z 132). Na równi z GLM-5.2, o cztery punkty za GPT-5.6 Terra, o siedem punktów za Kimi K3.
• Artificial Analysis Coding — 68.8, zajmując 24. miejsce na 130 (według strony modelu OrcaRouter).
• Vals AI Index — 12. miejsce, plasując się za GPT-5.5 poprzedniej generacji i znacznie za Kimi K3 oraz Claude Opus 5 (SCMP). Własne testy Vals AI wskazały dwie konkretne słabości: wykonywanie zadań w sandboxowym środowisku terminala oraz budowanie złożonych modeli finansowych w arkuszach kalkulacyjnych Excel.
• Vibe Code Bench v1.1 — 49.93 (Vals AI, jedyne niezależne uruchomienie „Benchmark exact" w zestawie).
Uczciwy rejestr — co zostało odtworzone, a co wciąż jest tylko słowem DeepSeeka
To sekcja, którą ma zapewnić artykuł o benchmarkach, i powód, dla którego warto dodać tę stronę do zakładek zamiast relacji z premiery. Podziel każdy wynik do jednego z dwóch koszyków:
• Niezależnie pozyskane: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI zajmuje 12. miejsce, Vibe Code Bench 49.93 — oraz osobno pozyskany wynik Terminal-Bench 2.1 równy 78.7, który znajduje się obok wyniku DeepSeek (87.9) na stronie modelu OrcaRouter. Ta dziewięciopunktowa różnica między liczbą producenta a niezależnym uruchomieniem to najważniejsza informacja na tej stronie: to zmierzona luka reprodukcyjna.
• Tylko raportowane przez producenta, bez niezależnego odtworzenia: każda wartość na oficjalnej karcie 0813 powyżej (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) oraz cały rozszerzony zestaw programistyczny (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). Własna dokumentacja DeepSeeka określa wynik Terminal-Bench 2.1 jako "provider run."
Czytany w ten sposób, przekaz jest spójny: DeepSeek V4 Pro to prawdziwy model graniczny, choć ze środka stawki — AA 53, notowany na pozycjach od 13. do 29. — a karta wyników dostawcy deklaruje niemal szczytową wydajność agentową i w kodowaniu. Oba stwierdzenia są prawdziwe i nie stoją w sprzeczności; jedno jest zmierzone, drugie zadeklarowane.

Ile kosztuje karta wyników
DeepSeek V4 Pro to flagowy model MoE o 1,6T parametrów łącznie / 49B aktywnych, z oknem kontekstowym 1M tokenów i maksymalnym wyjściem 384K tokenów. Na OrcaRouter jego cena odpowiada cennikowi DeepSeek z zerową marżą: 0,435 USD za milion tokenów wejściowych i 0,87 USD za milion tokenów wyjściowych (odczyt z pamięci podręcznej 0,060 USD za milion), według katalogu sprawdzonego 15 sierpnia 2026 r. i potwierdzonego na stronie modelu. Przy tej stawce wyliczenie ceny za punkt to najmocniejszy argument za tym modelem: to mniej więcej jedna dziesiąta ceny wyjściowej modeli, które w niezależnym indeksie osiągają wyniki zbliżone do niego, więc płacisz cenę ze średniej półki za wynik, który — jeśli zapewnienia dostawcy się potwierdzą — jest blisko szczytu. Jedno zastrzeżenie: DeepSeek ogłosił taryfę cenową szczyt/poza szczytem (poza szczytem 50% ceny szczytowej) obowiązującą od 17 sierpnia czasu pekińskiego, więc stawka może się zmienić — podane tu liczby to aktualna cena katalogowa na moment publikacji tego artykułu.

Gdy to zalecenie jest błędne
Uczciwe przypadki, w których DeepSeek V4 Pro nie powinien być twoim wyborem:
• Potrzebujesz niezależnie potwierdzonego granicznego rozumowania. AA Index 53 to środek stawki — Kimi K3 (60) i GPT-5.6 Terra (57) wyprzedzają go i są potwierdzone. Jeśli Twoja decyzja zależy od zmierzonego pułapu, karta dostawcy tego nie zmienia.
• Stawiasz produkcję na DeepSWE 62.7, zanim ktoś powtórzy ten test. Skok 12.8→62.7 w jednej wersji to twierdzenie, nie fakt. Poczekaj na niezależne powtórzenie — różnica 87.9 vs 78.7 w Terminal-Bench pokazuje, co można znaleźć.
• Twoje zadania to automatyzacja terminala w sandboxie lub modelowanie finansowe w Excelu. Vals AI twierdzi, że to właśnie tam model ma trudności, niezależnie od oceny dostawcy.
• Podejmujesz decyzję dotyczącą cyberbezpieczeństwa na podstawie CyberGym 83.3. To DeepSeek testuje swój własny model na swoim własnym benchmarku — dostawca rozwiązań bezpieczeństwa, który kupuje na podstawie tej liczby, kupuje niezweryfikowane dane.
Sedno sprawy
DeepSeek V4 Pro 0813 to prawdziwy model graniczny z kartą wyników dostawcy, która wyprzedza jego niezależne osiągnięcia. Wydanie 0813 przekształciło podgląd tekstowy w poważnego kandydata agentowego — samą premierę opisaliśmy osobno — a jeśli chcesz go dziś przetestować, to jeden klucz zgodny z OpenAI na OrcaRouter w cenie katalogowej DeepSeek, z automatycznym przełączaniem awaryjnym, gdy dostawca zwolni. Po prostu przeczytaj kartę wyników tak, jak dzieli ją ten artykuł: niezależne testy (AA 53, Vals 12. miejsce, wynik 78.7 w Terminal-Bench) to dane, którym możesz ufać dziś; wyniki 87.9 i 62.7 to wartości, które powinieneś zweryfikować, zanim na nich coś zbudujesz. Kupuj go za stosunek ceny do wydajności i kontekst 1M tokenów, a nie za nieodtworzone liczby z nagłówków.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
