Hero-Titelkarte für den Artikel „DeepSeek V4 Pro Benchmarks": eine Ergebnistafel mit großer Messanzeige, Überschrift „DeepSeek V4 Pro — die Benchmark-Scorecard", Untertitel „Offizielle 0813-Scores, unabhängige Gegenprüfungen und was noch nicht reproduziert wurde", sowie Chips mit der Beschriftung „TERMINAL-BENCH 2.1: 87.9", „DEEPSWE: 62.7", „AA INDEX: 53", „1M KONTEXT". OrcaRouter-Logo unten rechts eingebettet.
Guides & Insights

DeepSeek V4 Pro Benchmarks: Die vollständige 0813-Ergebnisübersicht, jede unabhängige Prüfung und was noch niemand verifiziert hat

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die Antwort in einem Satz: DeepSeek V4 Pro liefert nach Deep​Seeks eigenen Zahlen eine wirklich starke agentische Scorecard ab — Terminal-Bench 2.1 bei 87.9, DeepSWE bei 62.7, CyberGym bei 83.3 — aber fast jede Schlagzeilenzahl stammt vom Anbieter selbst, und das unabhängige Bild fällt nüchterner aus.Artificial Analysis stuft den offiziellen 0813-Build auf seinem Intelligence Index bei 53 ein, gleichauf mit GLM 5.2, vier Punkte hinter GPT-5.6 Terra und sieben hinter Kimi K3; Vals AI ordnet ihn auf Platz 12 ein, hinter dem GPT-5.5 der vorherigen Generation. Dieser Artikel ist die vollständige Zusammenstellung, die sonst niemand geschrieben hat: die komplette 0813-Scorecard, das erweiterte Coding-Set aus dem technischen Bericht, jede vorhandene unabhängige Prüfung und eine ehrliche Aufstellung darüber, welche Zahlen reproduziert wurden und welche weiterhin allein auf Deep​Seeks eigenen Angaben beruhen. Eine Woche nach der Scorecard beginnt sich auch das Serving-Bild zu füllen — am 19. August 2026 veröffentlichten LMSYS und Ant Group einen H20-Serving-Stack, der bei Batchgröße 1 271 Output-Token/s erreicht; er wird weiter unten in einem eigenen Abschnitt behandelt und, wie alle Anbieterangaben auf dieser Seite, als selbst gemeldet geführt, bis er unabhängig reproduziert wird.

Die offizielle 0813-Scorecard — Deep​Seeks eigene Zahlen, alle.

Deep​Seeks offizielle Ankündigung (API-Dokumente, news260813, 13. August 2026) berichtet, dass der Produktionsbuild auf Basis der April-Vorschau erstellt wurde. Jede Zahl in diesem Abschnitt stammt vom Anbieter – keine wurde bis zum 16. August 2026 unabhängig reproduziert:

• Terminal-Bench 2.1 — 87,9 (Vorschau: 72,1).

• DeepSWE — 62.7 (Vorschau: 12.8) — ein etwa 5-facher Sprung, der die mit Abstand auffälligste Angabe auf der Karte ist.

• CyberGym — 83.3 (Vorschau: 52.7).

• Humanity's Last Exam — 42.7 ohne Tools, 60.0 mit Tools (Vorschau: 37.7 / 48.2).

• Toolathlon-Verified — 74.1 (Vorschau: 55.9).

• AutomationBench (öffentlich) — 31.8 (Vorschau: 12.8).

• DSBench-FullStack — 71,1; DSBench-Hard — 67,2 (Vorschau: 41,8 / 31,1).

• NL2Repo — 61,5 (Vorschau: 38,5).

• Agents' Last Exam — 25.7 (Vorschau: 16.5).

Das Muster, auf das man achten sollte, ist, wo sich die Verbesserungen konzentrieren: bei Agentik- und Cybersicherheits-Benchmarks. Genau diese Art von Bewertungsbogen erstellt ein Labor, wenn es ein Agentenmodell bewerben will — und genau diese Art braucht eine neutrale Wiederholung, bevor man Produktionsbudget dafür ausgibt.

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

Der erweiterte Kodierungssatz aus {{1}}Deep​Seeks technischem Bericht{{/1}}

Über die Agentic Card hinaus fügt der technische Bericht von Deep​Seek (wie von BenchLM am 16. August 2026 aggregiert) einen breiteren Satz für Codierung und langen Kontext hinzu. Ebenfalls vom Anbieter gemeldet und von BenchLM als „Provider exact“ gekennzeichnet – kein unabhängiger Test:

• SWE-bench Verified — 80.6%; SWE-bench Pro — 55.4%.

• LiveCodeBench Pass@1-CoT — 93.5% — das beste verifizierte im BenchLM-Katalog.

• Codeforces-Rating — 3206 — auch das beste verifizierte im Katalog.

• BrowseComp — 83,4 %; Terminal-Bench 2.0 — 67,9 %.

• MRCR 1M — 83,5 %; CorpusQA 1M — 62,0 % — beide sind Katalog-Bestwerte beim 1M-Token-Retrieval, was für ein Modell wichtig ist, das mit einem 1M-Token-Kontextfenster wirbt.

• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (aufgeführt auf der Modellseite von OrcaRouter).

Was unabhängige Bewerter tatsächlich messen

Drei unabhängige Quellen haben DeepSeek V4 Pro getestet, und ihre Bewertungen gruppieren sich unterhalb der Herstellerkarte:

• Artificial Analysis Intelligence Index — 53 (Die Berichterstattung des SCMP, August 2026; OrcaRouters Modellseite zeigt 53,2, Rang 20 von 132). Gleichauf mit GLM 5.2, vier Punkte hinter GPT-5.6 Terra, sieben hinter Kimi K3.

• Artificial Analysis Coding — 68,8, belegt Platz 24 von 130 (laut OrcaRouter-Modellseite).

• Vals AI Index — Platz 12, hinter der Vorgängergeneration GPT-5.5 und deutlich hinter Kimi K3 und Claude Opus 5 (SCMP). Die eigenen Tests von Vals AI zeigten zwei konkrete Schwachstellen auf: das Erledigen von Aufgaben in einer Sandbox-Terminalumgebung und das Erstellen komplexer Finanzmodelle in Excel-Tabellen.

• Vibe Code Bench v1.1 — 49.93 (Vals AI, der einzige unabhängige „Benchmark exact“-Lauf im Set).

Die ehrliche Abrechnung — was reproduziert wurde vs. was immer noch nur Deep​Seeks Wort ist

Dies ist der Abschnitt, den ein Benchmark-Artikel bereitstellen soll, und der Grund, diese Seite gegenüber der Startberichterstattung mit einem Lesezeichen zu versehen. Teilen Sie jede Punktzahl in einen von zwei Eimern auf:

• Unabhängig recherchiert: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI-Rang 12, Vibe Code Bench 49.93 — und ein aus separater Quelle stammender Terminal-Bench-2.1-Lauf mit 78.7, der auf OrcaRouters Modellseite neben der 87.9 von Deep​Seek steht. Diese Neun-Punkte-Differenz zwischen der Zahl des Anbieters und einem unabhängigen Lauf ist der mit Abstand wichtigste Datenpunkt auf dieser Seite: Sie ist die Reproduktionslücke, quantifiziert.

• Nur vom Anbieter gemeldet, nicht unabhängig reproduziert: jede Zahl in der offiziellen 0813-Karte oben (Terminal-Bench 2.1 87,9, DeepSWE 62,7, CyberGym 83,3, HLE 42,7/60,0, Toolathlon 74,1, AutomationBench 31,8, DSBench 71,1/67,2, NL2Repo 61,5, Agents' Last Exam 25,7) sowie der gesamte erweiterte Codierungssatz (SWE-bench Verified 80,6, LiveCodeBench 93,5, Codeforces 3206, BrowseComp 83,4, MRCR 83,5, CorpusQA 62,0, GPQA Diamond 92,8). Deep​Seeks eigene Dokumentation bezeichnet den Wert für Terminal-Bench 2.1 als „Anbieterlauf“.

So gelesen, ist die Geschichte stimmig: DeepSeek V4 Pro ist ein echtes Frontier-Modell im Mittelfeld — AA 53, im Zehner- bis Zwanzigerbereich platziert — mit einer Anbieter-Scorecard, die nahezu Spitzenleistungen bei agentischen Aufgaben und beim Coden beansprucht. Beide Aussagen sind wahr und stehen nicht im Widerspruch; die eine ist gemessen, die andere ist behauptet.

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

Was die Scorecard kostet

DeepSeek V4 Pro ist das MoE-Flaggschiff mit 1,6 T Gesamtparametern und 49 B aktiven Parametern, einem Kontextfenster von 1 M Token und einer maximalen Ausgabe von 384 K. Auf OrcaRouter wird es zum Listenpreis von Deep​Seek ohne Aufschlag angeboten:0,435 $ pro Million Eingabe-Token und 0,87 $ pro Million Ausgabe-Token (Cache-Read 0,060 $ pro Million), laut dem Verzeichnis, das am 15. August 2026 geprüft und auf der Live-Modellseite bestätigt wurde. Bei diesem Preis ist die Preis-pro-Punkt-Rechnung das stärkste Argument für das Modell: Es kostet ungefähr ein Zehntel des Ausgabepreises der Modelle, die im unabhängigen Index in seiner Nähe liegen. Man zahlt also Preise der mittleren Preisklasse für eine Bewertung, die – falls die Behauptungen des Anbieters zutreffen – nahe an der Spitze liegt. Ein Hinweis: Deep​Seek hat eine Preisstaffelung für Haupt- und Nebenzeiten angekündigt (Nebenzeit zu 50 % des Hauptzeitpreises), die ab dem 17. August, Pekinger Zeit, gilt. Der Preis kann sich also ändern – die hier genannten Zahlen sind der aktuelle Listenpreis zum Zeitpunkt dieses Artikels.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

Serving von DeepSeek V4 Pro: 271 Ausgabe-Token/s auf H20

Benchmarks bewerten, was das Modell weiß; Serving-Zahlen bewerten, wie günstig man es zum Denken bringen kann. Am 19. August 2026 veröffentlichten LMSYS — die Organisation hinter Chatbot Arena — und das Open-Source-Team von Ant Group die erste ernsthafte Serving-Arbeit am 0813-Build: einen „szenariospezifischen Serving-Stack“, der auf SGLang basiert, der Open-Source-Engine, die LMSYS pflegt. Die wichtigste Kennzahl ist 271 Ausgabe-Token/s bei Batchgröße 1 auf einer NVIDIA H20, und das Team beziffert sie auf das 1,42-Fache einer B300 — erreicht auf einem Chip mit keinen nativen FP4-Tensor-Cores. Das sind LMSYS’ und Ant Groups eigene Messungen, angekündigt in ihrem Blog und auf X; keine davon wurde unabhängig reproduziert.

Die restlichen Zahlen des Stacks, alle von LMSYS und Ant Group selbst auf ihrem eigenen Stack gemeldet:

• Decode-Latenz — eine „optimierte DSpark“-Komponente reduziert die Zeit pro Ausgabe-Token (TPOT) bei Batch-Größe 1 um 74,8–78,0 %.

• Prefill — ein Prefill mit 1 Million Token wird in 43,7 Sekunden abgeschlossen, ein Prefill-Durchsatzgewinn von 36,5 % im geometrischen Mittel.

• KV-Cache – ein Schema, das das Team „Humming MXFP4AFP8 + Online C128“ nennt, erweitert die KV-Cache-Kapazität für vollständige Tokens um das 10,14-Fache, der Hebel, der 1-Millionen-Token-Agent-Workloads auf dieser Siliziumklasse praktikabel macht.

• Dekodierung pro GPU — bei 4K-Kontext steigt der Dekodierdurchsatz pro GPU von 319,9 auf 703,2 Token/s/GPU, eine Verbesserung um das 2,20-Fache.

Lesen Sie die Vorbehalte, bevor Sie eine Flotte darauf dimensionieren. Batchgröße 1 ist das Single-Stream-Regime – das, was ein interaktiver Agent oder ein Chat erreicht, nicht eine API mit hoher Nebenläufigkeit – und der 1,42×-Vergleich gegenüber B300 ist ein Verhältnis, das LMSYS angibt, ohne die absoluten Tokens/s von B300 zu veröffentlichen, sodass die Lücke behauptet, nicht überprüfbar ist. Das Ergebnis misst zudem den Stack, nicht den Chip: Diese Gewinne stammen aus SGLang-Level-Optimierung auf Hardware, die sonst für ein MoE mit insgesamt 1,6T unterdimensioniert wirken würde. Zum Kontext: Die Live-Modellseite von OrcaRouter misst DeepSeek V4 Pro bei 80,8 Ausgabe-Tokens/s über einen gemeinsamen API-Endpunkt – der H20-Wert ist ein Single-Stream-Benchmark auf einem dedizierten Stack, eine andere Zahl mit einer anderen Bedeutung.

Wenn Ihre Workload über eine API bereitgestellt wird, ändert sich dadurch nichts daran, wie Sie das Modell aufrufen: DeepSeek V4 Pro ist ein OpenAI-kompatibler Schlüssel auf OrcaRouter zum Listenpreis von DeepSeek, mit automatischem Failover, falls der Anbieter ins Stocken gerät. Die H20-Zahlen sind am wichtigsten, wenn Sie zu dem Team gehören, das eine selbst gehostete H20-Flotte gegen die Bezahlung der API abwägt – die Lücke, die die Arbeit von LMSYS und Ant Group schließt, ist eine Hardware-Kaufentscheidung und keine Modellauswahlentscheidung.

Wenn diese Empfehlung falsch ist

Die ehrlichen Fälle, in denen DeepSeek V4 Pro nicht die richtige Wahl sein sollte:

• Sie benötigen unabhängig bestätigtes Frontier-Reasoning. AA Index 53 liegt im Mittelfeld — Kimi K3 (60) und GPT-5.6 Terra (57) liegen vorn und sind verifiziert. Wenn Ihre Entscheidung von der gemessenen Obergrenze abhängt, ändert die Anbieterkarte nichts daran.

• Du setzt die Produktion auf DeepSWE 62.7, bevor jemand es erneut ausführt. Ein Sprung von 12.8 auf 62.7 in einer einzigen Version ist eine Behauptung, keine Tatsache. Warte auf eine neutrale Reproduktion — die 87.9-vs-78.7-Lücke bei Terminal-Bench zeigt, was man finden könnte.

• Ihre Arbeitslast ist Sandbox-Terminalautomatisierung oder Excel-Finanzmodellierung. Vals AI zufolge sind dies genau die Bereiche, in denen das Modell Schwierigkeiten hat, unabhängig von der Bewertung des Anbieters.

• Sie treffen eine Cybersicherheitsentscheidung auf Basis von CyberGym 83.3. Das ist Deep​Seek, das sein eigenes Modell an seinem eigenen Benchmark testet – ein Sicherheitsanbieter, der auf diese Zahl setzt, kauft ungeprüfte Daten.

• Du kaufst H20s allein wegen der Zahl 271 tokens/s. Dieser Wert ist ein selbst angegebener Benchmark auf einem einzelnen Stack bei Batchgröße 1 — vielversprechend, nicht reproduziert und nur ein Punkt auf einer Kostenkurve, die auch Auslastung, Stromverbrauch und jeden Serving-Stack umfasst, den du tatsächlich betreiben würdest.

Fazit

DeepSeek V4 Pro 0813 ist ein echtes Frontier-Modell mit einer Anbieter-Scorecard, die seine unabhängigen Ergebnisse übertrifft. Das 0813-Release verwandelte eine Textvorschau in einen ernstzunehmenden agentischen Kandidaten – wir haben die Veröffentlichung selbst separat behandelt –, und wenn Sie es heute testen möchten, ist es ein OpenAI-kompatibler Schlüssel auf OrcaRouter zum Listenpreis von Deep​Seek, mit automatischem Failover, falls der Anbieter stockt. Lesen Sie die Scorecard einfach so, wie dieser Artikel sie aufteilt: Die unabhängigen Prüfungen (AA 53, Vals 12., der 78,7-Terminal-Bench-Lauf) sind das, was Sie heute vertrauen können; die 87,9er und 62,7er sind das, was Sie verifizieren sollten, bevor Sie darauf aufbauen. Dieselbe Disziplin erstreckt sich nun auf das Serving: Die 271 Ausgabe-Tokens/s auf H20, die LMSYS und Ant Group melden, sind das beste Durchsatzbild, das wir haben, und es ist nach wie vor nur ihre Angabe, bis ein neutraler Lauf es bestätigt. Kaufen Sie es wegen des Preis-Leistungs-Verhältnisses und des 1M-Token-Kontexts, nicht wegen der nicht reproduzierten Schlagzeilenwerte.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert