Hero-titelkort för artikeln 'DeepSeek V4 Pro Benchmarks': en resultattavla med en stor mätare, rubrik 'DeepSeek V4 Pro — benchmarkresultatkortet', undertitel 'Officiella 0813-resultat, oberoende kontroller och vad som fortfarande inte är reproducerat', och chips med texten 'TERMINAL-BENCH 2.1: 87.9', 'DEEPSWE: 62.7', 'AA INDEX: 53', '1M CONTEXT'. OrcaRouter-logotyp kompositerad längst ner till höger.
Guides & Insights

DeepSeek V4 Pro Benchmarks: Det fullständiga 0813-resultatkortet, varje oberoende kontroll och vad ingen har verifierat ännu

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Svaret i en mening: DeepSeek V4 Pro levererar ett genuint starkt agentiskt resultatkort på DeepSeeks egna siffror — Terminal-Bench 2.1 på 87,9, DeepSWE på 62,7, CyberGym på 83,3 — men nästan varje rubriksiffra är leverantörsrapporterad, och den oberoende bilden är svalare.Artificial Analysis placerar den officiella 0813-versionen på 53 på sitt Intelligence Index, i nivå med GLM-5.2, fyra poäng bakom GPT-5.6 Terra och sju bakom Kimi K3; Vals AI rankar den på 12:e plats, under förra generationens GPT-5.5. Den här artikeln är den fullständiga sammanställningen som ingen annan har skrivit: det kompletta 0813-resultatkortet, den utökade kodningsuppsättningen från den tekniska rapporten, varje oberoende kontroll som finns, och en ärlig redovisning av vilka siffror som har reproducerats och vilka som fortfarande enbart bygger på DeepSeeks egna ord.

Det officiella 0813-resultatkortet — DeepSeeks egna siffror, alla.

DeepSeeks officiella tillkännagivande (API-dokumentation, news260813, 13 augusti 2026) rapporterar produktionsbygget mot aprilförhandsversionen. Varje siffra i detta avsnitt är leverantörsrapporterad — ingen har oberoende reproducerats per den 16 augusti 2026:

Terminal-Bench 2.1 — 87.9 (förhandsversion: 72.1).

DeepSWE — 62.7 (förhandsvisning: 12.8) — en ungefär 5-faldig ökning som är det enskilt mest slående påståendet på kortet.

CyberGym — 83.3 (förhandsvisning: 52.7).

Humanity's Last Exam — 42.7 utan verktyg, 60.0 med verktyg (förhandsvisning: 37.7 / 48.2).

Toolathlon-Verified — 74.1 (förhandsvisning: 55,9).

AutomationBench (offentlig) — 31.8 (förhandsvisning: 12.8).

DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (förhandsvisning: 41.8 / 31.1).

NL2Repo — 61.5 (förhandsvisning: 38.5).

Agents' Last Exam — 25.7 (förhandsvisning: 16.5).

Mönstret att lägga märke till är var vinsterna koncentreras: agentiska och cybersäkerhetsbenchmarks. Det är precis den typ av resultatkort som ett labb tar fram när det vill marknadsföra en agentmodell – och precis den typ som behöver en neutral omkörning innan du lägger produktionspengar på den.

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

Det utökade kodningssetet från DeepSeeks tekniska rapport

Utöver det agentiska kortet lägger DeepSeeks tekniska rapport (så som den sammanställts av BenchLM den 16 augusti 2026) till en bredare uppsättning för kodning och lång kontext. Även leverantörsrapporterad och märkt ”Provider exact” av BenchLM — inget oberoende test:

SWE-bench Verified — 80.6%; SWE-bench Pro — 55.4%.

LiveCodeBench Pass@1-CoT — 93,5 % — det bästa verifierade i BenchLMs katalog.

Codeforces rating — 3206 — också den bästa verifierade i katalogen.

BrowseComp — 83.4%; Terminal-Bench 2.0 — 67.9%.

MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — båda de bästa i katalogen på 1M-token-hämtning, vilket är viktigt för en modell som annonserar ett kontextfönster på 1M-token.

GPQA Diamond — 92,8, SciCode — 49,2, Long-Context Recall — 75,3 (listade på OrcaRouters modellsida).

Vad oberoende utvärderare faktiskt mäter

Tre oberoende källor har kört DeepSeek V4 Pro, och deras omdömen samlas under leverantörskortet:

Artificial Analysis Intelligence Index — 53 (SCMP:s rapportering, augusti 2026; OrcaRouters modellsida visar 53.2, rankad 20:e av 132). I nivå med GLM-5.2, fyra poäng efter GPT-5.6 Terra, sju efter Kimi K3.

Artificial Analysis Coding — 68.8, rankad 24:a av 130 (enligt OrcaRouters modellsida).

Vals AI Index — 12:e, efter den tidigare generationens GPT-5.5 och väl bakom Kimi K3 och Claude Opus 5 (SCMP). Vals AI:s egna tester visade på två konkreta svagheter: att slutföra uppgifter i en sandlådemiljö för terminal, och att bygga komplexa finansiella modeller i Excel-kalkylblad.

Vibe Code Bench v1.1 — 49.93 (Vals AI, den enda oberoende "Benchmark exact"-körningen i uppsättningen).

Den ärliga redovisningen — vad som har återskapats vs vad som fortfarande bara är DeepSeeks ord.

Detta är avsnittet som en benchmark-artikel finns till för att tillhandahålla, och anledningen till att bokmärka denna sida framför lanseringsbevakningen. Dela upp varje poäng i en av två kategorier:

Oberoende källa: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI rank 12, Vibe Code Bench 49.93 — och en separat inhämtad Terminal-Bench 2.1-körning av 78.7 som ligger bredvid DeepSeeks 87.9 på OrcaRouters modellsida. Det nio poängs gapet mellan leverantörens siffra och en oberoende körning är den enskilt viktigaste datapunkten på denna sida: det är reproduktionsgapet, kvantifierat.

Endast leverantörsrapporterade, inte oberoende reproducerade:varje siffra i det officiella 0813-kortet ovan (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) och hela den utökade kodningsuppsättningen (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). DeepSeeks egna dokument benämner siffran för Terminal-Bench 2.1 som en "leverantörskörning".

Läst på det sättet är historien sammanhängande: DeepSeek V4 Pro är en riktig frontier-modell i mellanskiktet — AA 53, rankad i tio- till tjugotalet — med en leverantörsresultatrapport som hävdar nästan toppresultat inom agentprestanda och kodning. Båda påståendena är sanna, och de står inte i konflikt; det ena är uppmätt, det andra är påstått.

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

Vad scorecardet kostar

DeepSeek V4 Pro är en MoE-flaggskeppsmodell med 1.6T totala parametrar / 49B aktiva parametrar, ett kontextfönster på 1M-token och 384K maxutdata. På OrcaRouter är den prissatt till DeepSeeks listpris utan påslag: $0.435 per miljon inmatningstokens och $0.87 per miljon utdata (cacheläsning $0.060 per miljon), enligt katalogen som kontrollerades den 15 augusti 2026 och bekräftades på live-modellsidan. Vid den taxan är pris-per-poäng-uträkningen det starkaste argumentet för modellen: den är ungefär en tiondel av utdatapriset för de modeller som ligger nära den på det oberoende indexet, så du betalar priser i mellanklassen för ett resultatkort som, om leverantörens påståenden håller, ligger nära toppen. En varningsflagga: DeepSeek har meddelat en prisplan med peak/off-peak (off-peak till 50 % av peak) som träder i kraft den 17 augusti, Pekingtid, så priset kan komma att ändras — siffrorna här är det aktuella listpriset i skrivande stund.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

När denna rekommendation är fel

De ärliga fallen där DeepSeek V4 Pro inte borde vara ditt val:

Du behöver oberoende bekräftat resonemang i framkant.AA Index 53 är i mitten av fältet — Kimi K3 (60) och GPT-5.6 Terra (57) ligger före och är verifierade. Om ditt beslut hänger på det uppmätta taket, ändrar leverantörskortet inte det.

Du satsar produktionen på DeepSWE 62.7 innan någon kör om det. Ett 12.8→62.7-hopp i en enda release är ett påstående, inte ett faktum. Vänta på en oberoende reproduktion — gapet mellan 87.9 och 78.7 i Terminal-Bench visar vad man kan hitta.

Din arbetsbelastning består av sandboxad terminalautomation eller finansiell modellering i Excel. Vals AI säger att detta är exakt där modellen kämpar, oberoende av någon leverantörspoäng.

Du fattar ett cybersäkerhetsbeslut om CyberGym 83.3. Det är DeepSeek som testar sin egen modell på sitt eget benchmark — en säkerhetsleverantör som baserar ett köp på denna siffra köper oreviderad data.

Slutsats

DeepSeek V4 Pro 0813 är en genuin frontier-modell med en leverantörsresultattavla som springer ifrån sina oberoende resultat. 0813-versionen förvandlade en textförhandsvisning till en seriös agentisk utmanare — vi har täckt själva releasen separat — och om du vill utvärdera den idag är den en OpenAI-kompatibel nyckel på OrcaRouter till DeepSeeks listpris, med automatisk failover om leverantören stannar. Läs bara resultattavlan så som den här artikeln delar upp den: de oberoende kontrollerna (AA 53, Vals 12:a, 78.7-terminal-bench-körningen) är vad du kan lita på idag; 87.9- och 62.7-resultaten är vad du bör verifiera innan du bygger på dem. Köp den för prisvärdhet och 1M-tokens kontext, inte för de icke-reproducerbara rubriksiffrorna.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

Kontakta oss

Gå med i vår community

DiscordEmailXGitHubYouTube