Hero-titelkort för artikeln 'DeepSeek V4 Pro Benchmarks': en resultattavla med en stor mätare, rubrik 'DeepSeek V4 Pro — benchmarkresultatkortet', undertitel 'Officiella 0813-resultat, oberoende kontroller och vad som fortfarande inte är reproducerat', och chips med texten 'TERMINAL-BENCH 2.1: 87.9', 'DEEPSWE: 62.7', 'AA INDEX: 53', '1M CONTEXT'. OrcaRouter-logotyp kompositerad längst ner till höger.
Guides & Insights

DeepSeek V4 Pro Benchmarks: Det fullständiga 0813-resultatkortet, varje oberoende kontroll och vad ingen har verifierat ännu

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Enradigt svar: DeepSeek V4 Pro presenterar ett genuint starkt agentiskt resultatkort enligt Deep​Seeks egna siffror — Terminal-Bench 2.1 på 87,9, DeepSWE på 62,7, CyberGym på 83,3 — men nästan varje rubriksiffra är leverantörsrapporterad, och den oberoende bilden är svalare. Artificial Analysis placerar den officiella 0813-versionen på 53 på sitt Intelligence Index, i nivå med GLM 5.2, fyra poäng bakom GPT-5.6 Terra och sju bakom Kimi K3; Vals AI rankar den på 12:e plats, under föregående generations GPT-5.5. Den här artikeln är den fullständiga sammanställningen som ingen annan har skrivit: det fullständiga 0813-resultatkortet, den utökade kodningsuppsättningen från den tekniska rapporten, varje oberoende kontroll som finns, och en ärlig redovisning av vilka siffror som har reproducerats och vilka som fortfarande bara är Deep​Seeks ord. En vecka efter kortet har även bilden av serveringen börjat ta form — den 19 augusti 2026 publicerade LMSYS och Ant Group en H20-servingstack som når 271 utdata-tokens per sekund vid batchstorlek 1, som behandlas i ett eget avsnitt nedan och som, i likhet med allt på leverantörssidan av den här sidan, klassas som självrapporterad tills någon reproducerar den.

Det officiella 0813-resultatkortet — Deep​Seeks egna siffror, alla av dem.

Deep​Seeks officiella tillkännagivande (API-dokumentation, news260813, 13 augusti 2026) rapporterar om produktionsbygget i förhållande till aprilförhandsversionen. Alla siffror i detta avsnitt är leverantörsrapporterade — ingen har oberoende reproducerats per den 16 augusti 2026:

• Terminal-Bench 2.1 — 87.9 (förhandsversion: 72.1).

• DeepSWE — 62.7 (förhandsvisning: 12.8) — en ungefär 5-faldig ökning som är det enskilt mest slående påståendet på kortet.

• CyberGym — 83.3 (förhandsvisning: 52.7).

• Humanity's Last Exam — 42.7 utan verktyg, 60.0 med verktyg (förhandsvisning: 37.7 / 48.2).

• Toolathlon-Verified — 74.1 (förhandsvisning: 55,9).

• AutomationBench (offentlig) — 31.8 (förhandsvisning: 12.8).

• DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (förhandsvisning: 41.8 / 31.1).

• NL2Repo — 61.5 (förhandsvisning: 38.5).

• Agents' Last Exam — 25.7 (förhandsvisning: 16.5).

Mönstret att lägga märke till är var vinsterna koncentreras: agentiska och cybersäkerhetsbenchmarks. Det är precis den typ av resultatkort som ett labb tar fram när det vill marknadsföra en agentmodell – och precis den typ som behöver en neutral omkörning innan du lägger produktionspengar på den.

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

Det utökade kodningssetet från Deep​Seeks tekniska rapport

Utöver det agentiska kortet lägger Deep​Seek-teknikrapporten (som sammanställts av BenchLM den 16 augusti 2026) till en bredare uppsättning för kodning och lång kontext. Även leverantörsrapporterad och märkt "Provider exact" av BenchLM — inget oberoende test:

• SWE-bench Verified — 80.6%; SWE-bench Pro — 55.4%.

• LiveCodeBench Pass@1-CoT — 93,5 % — det bästa verifierade i BenchLMs katalog.

• Codeforces rating — 3206 — också den bästa verifierade i katalogen.

• BrowseComp — 83.4%; Terminal-Bench 2.0 — 67.9%.

• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — båda de bästa i katalogen på 1M-token-hämtning, vilket är viktigt för en modell som annonserar ett kontextfönster på 1M-token.

• GPQA Diamond — 92,8, SciCode — 49,2, Long-Context Recall — 75,3 (listade på OrcaRouters modellsida).

Vad oberoende utvärderare faktiskt mäter

Tre oberoende källor har kört DeepSeek V4 Pro, och deras omdömen samlas under leverantörskortet:

• Artificial Analysis Intelligence Index — 53 (SCMP:s rapportering, augusti 2026; OrcaRouters modellsida visar 53.2, rankad 20:e av 132). På samma nivå som GLM 5.2, fyra poäng efter GPT-5.6 Terra, sju efter Kimi K3.

• Artificial Analysis Coding — 68.8, rankad 24:a av 130 (enligt OrcaRouters modellsida).

• Vals AI Index — 12:e, efter den tidigare generationens GPT-5.5 och väl bakom Kimi K3 och Claude Opus 5 (SCMP). Vals AI:s egna tester visade på två konkreta svagheter: att slutföra uppgifter i en sandlådemiljö för terminal, och att bygga komplexa finansiella modeller i Excel-kalkylblad.

• Vibe Code Bench v1.1 — 49.93 (Vals AI, den enda oberoende "Benchmark exact"-körningen i uppsättningen).

Den ärliga räkenskapen — vad som har reproducerats vs vad som fortfarande bara är Deep​Seeks ord

Detta är avsnittet som en benchmark-artikel finns till för att tillhandahålla, och anledningen till att bokmärka denna sida framför lanseringsbevakningen. Dela upp varje poäng i en av två kategorier:

• Oberoende inhämtad: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI rankad 12:a, Vibe Code Bench 49.93 — och en separat inhämtad Terminal-Bench 2.1-körning på 78.7 som ligger bredvid Deep​Seek:s 87.9 på OrcaRouters modellsida. Detta gap på nio poäng mellan leverantörens siffra och en oberoende körning är den enskilt viktigaste uppgiften på denna sida: det är reproduktionsgapet, kvantifierat.

• Endast leverantörsrapporterat, inte oberoende reproducerat: varje siffra i det officiella 0813-kortet ovan (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) och hela den utökade kodningsuppsättningen (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). Deep​Seek:s egen dokumentation kallar Terminal-Bench 2.1-siffran för en "provider run."

Läst på det sättet är historien sammanhängande: DeepSeek V4 Pro är en riktig frontier-modell i mellanskiktet — AA 53, rankad i tio- till tjugotalet — med en leverantörsresultatrapport som hävdar nästan toppresultat inom agentprestanda och kodning. Båda påståendena är sanna, och de står inte i konflikt; det ena är uppmätt, det andra är påstått.

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

Vad scorecardet kostar

DeepSeek V4 Pro är MoE-flaggskeppet med 1,6T totala parametrar / 49B aktiva, med ett kontextfönster på 1M tokens och max 384K i utdata. På OrcaRouter prissätts den till Deep​Seeks listpris utan påslag: $0.435 per miljon inmatningstokens och $0.87 per miljon utdatatokens (cacheläsning $0.060 per miljon), enligt katalogen som kontrollerades den 15 augusti 2026 och bekräftades på den live-modellsidan. Vid denna prisnivå är pris-per-poäng-beräkningen det starkaste argumentet för modellen: det är ungefär en tiondel av utdatapriset för modellerna som ligger nära den på det oberoende indexet, så du betalar mellanklasspriser för ett resultatkort som, om leverantörens påståenden håller, ligger nära toppen. En varning: Deep​Seek har annonserat en prissättning för högtrafik/lågtrafik (lågtrafik till 50 % av högtrafikspriset) som träder i kraft den 17 augusti, Beijing-tid, så priset kan komma att ändras — siffrorna här är det aktuella listpriset från och med denna artikel.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

Serverar DeepSeek V4 Pro: 271 utdatatokens/s på H20

Benchmarks betygsätter vad modellen vet; servingsiffror betygsätter hur billigt du kan få den att tänka. Den 19 augusti 2026 publicerade LMSYS – organisationen bakom Chatbot Arena – och Ant Groups team för öppen källkod det första seriösa servingsarbetet på 0813-versionen: en "scenario-specifik serving-stack" byggd på SGLang, motorn med öppen källkod som LMSYS underhåller. Huvudresultatet är 271 output-tokens per sekund vid batchstorlek 1 på en NVIDIA H20, som teamet anger till 1,42× jämfört med en B300 — uppnått på ett chip med inga inbyggda FP4 Tensor Cores. Dessa är LMSYS och Ant Groups egna mätningar, offentliggjorda i deras blogg och på X; ingen av dem har oberoende reproducerats.

Resten av stackens siffror, alla självrapporterade av LMSYS och Ant Group på sin egen stack:

• Avkodningslatens — en "optimerad DSpark"-komponent minskar tid-per-utdatatoken (TPOT) med 74,8–78,0 % vid batchstorlek 1.

• Prefill — en prefill med 1 miljon token slutförs på 43,7 sekunder, en 36,5-procentig prefill-genomströmningsvinst (geometriskt medelvärde).

• KV-cache — en metod som teamet kallar "Humming MXFP4AFP8 + Online C128" utökar KV-cachekapaciteten för hela tokensekvensen med 10,14×, den hävstång som gör 1M-token-agentarbetsbelastningar praktiska på den här typen av kisel.

• Avkodning per GPU — vid 4K-kontext stiger genomströmningen per GPU från 319.9 till 703.2 tokens/s/GPU, en förbättring på 2.20×.

Läs varningarna innan du dimensionerar en serverpark utifrån det. {{1}}Batchstorlek 1 är enkelströmsregimen — det som en interaktiv agent eller chatt möter, inte ett API med hög samtidighet — och 1,42×-jämförelsen mot B300 är en kvot som LMSYS anger utan att publicera B300:s absoluta tokens/s, så skillnaden är påstådd, inte verifierbar.{{/1}} Resultatet mäter också stacken, inte chippet: {{2}}dessa vinster kommer från optimering på SGLang-nivå på hårdvara som annars skulle se underdimensionerad ut för en MoE med totalt 1,6T parametrar.{{/2}} Som referens: {{3}}OrcaRouters live-modellsida mäter DeepSeek V4 Pro till 80,8 utdatatokens/s via en delad API-endpoint{{/3}} — {{4}}H20-siffran är ett enkelströmsbenchmark på en dedikerad stack, ett annat tal med en annan betydelse.{{/4}}

Om din arbetsbelastning hanteras via ett API, ändrar inget av detta hur du anropar modellen: DeepSeek V4 Pro är en OpenAI-kompatibel nyckel på OrcaRouter till Deep​Seeks listpris, med automatisk växling om leverantören stannar. H20-siffrorna spelar störst roll om du är teamet som väger en självhostad H20-flotta mot att betala för API:et — klyftan som LMSYS och Ant Groups arbete sluter är ett hårdvaruinköpsbeslut, inte ett modellvalsbeslut.

När denna rekommendation är fel

De ärliga fallen där DeepSeek V4 Pro inte borde vara ditt val:

• Du behöver oberoende bekräftat resonemang i framkant.AA Index 53 är i mitten av fältet — Kimi K3 (60) och GPT-5.6 Terra (57) ligger före och är verifierade. Om ditt beslut hänger på det uppmätta taket, ändrar leverantörskortet inte det.

• Du satsar produktionen på DeepSWE 62.7 innan någon kör om det. Ett 12.8→62.7-hopp i en enda release är ett påstående, inte ett faktum. Vänta på en oberoende reproduktion — gapet mellan 87.9 och 78.7 i Terminal-Bench visar vad man kan hitta.

• Din arbetsbelastning består av sandboxad terminalautomation eller finansiell modellering i Excel. Vals AI säger att detta är exakt där modellen kämpar, oberoende av någon leverantörspoäng.

• Du fattar ett cybersäkerhetsbeslut om CyberGym 83.3. Det är Deep​Seek som testar sin egen modell på sitt eget riktmärke — en säkerhetsleverantör som köper på den här siffran köper oreviderade data.

• Du köper H20:or enbart på siffran 271 tokens/s. Den siffran är ett självrapporterat benchmark från en enda stack vid batchstorlek 1 — lovande, ej reproducerat, och en punkt på en kostnadskurva som även inkluderar utnyttjandegrad, strömförbrukning och vilken serving-stack du faktiskt skulle köra.

Slutsats

DeepSeek V4 Pro 0813 är en äkta frontmodell med en leverantörsresultattavla som överträffar dess oberoende facit. 0813-versionen förvandlade en textförhandsvisning till en seriös agentisk utmanare — vi har bevakat själva releasen separat — och om du vill utvärdera den idag är den en OpenAI-kompatibel nyckel på OrcaRouter till Deep​Seeks listpris, med automatisk växling om leverantören går i stå. Läs bara resultattavlan så som den här artikeln delar upp den: de oberoende kontrollerna (AA 53, Vals 12th, 78.7-körningen på Terminal-Bench) är det du kan lita på idag; 87.9- och 62.7-resultaten är det du bör verifiera innan du bygger på dem. Samma disciplin gäller nu även för servering: LMSYS och Ant Groups 271 utmatade tokens/s på H20 är den bästa genomströmningsbild vi har, och det är fortfarande deras ord tills en neutral körning bekräftar det. Köp den för pris-prestanda och 1M-tokens kontext, inte för de icke-reproducerade rubriksiffrorna.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen