
DeepSeek V4 Pro Benchmarks: Die vollständige 0813-Ergebnisübersicht, jede unabhängige Prüfung und was noch niemand verifiziert hat
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 143 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Die Antwort in einem Satz: DeepSeek V4 Pro liefert nach DeepSeeks eigenen Zahlen eine wirklich starke agentische Scorecard ab — Terminal-Bench 2.1 bei 87.9, DeepSWE bei 62.7, CyberGym bei 83.3 — aber fast jede Schlagzeilenzahl stammt vom Anbieter selbst, und das unabhängige Bild fällt nüchterner aus.Artificial Analysis stuft den offiziellen 0813-Build auf seinem Intelligence Index bei 53 ein, gleichauf mit GLM 5.2, vier Punkte hinter GPT-5.6 Terra und sieben hinter Kimi K3; Vals AI ordnet ihn auf Platz 12 ein, hinter dem GPT-5.5 der vorherigen Generation. Dieser Artikel ist die vollständige Zusammenstellung, die sonst niemand geschrieben hat: die komplette 0813-Scorecard, das erweiterte Coding-Set aus dem technischen Bericht, jede vorhandene unabhängige Prüfung und eine ehrliche Aufstellung darüber, welche Zahlen reproduziert wurden und welche weiterhin allein auf DeepSeeks eigenen Angaben beruhen. Eine Woche nach der Scorecard beginnt sich auch das Serving-Bild zu füllen — am 19. August 2026 veröffentlichten LMSYS und Ant Group einen H20-Serving-Stack, der bei Batchgröße 1 271 Output-Token/s erreicht; er wird weiter unten in einem eigenen Abschnitt behandelt und, wie alle Anbieterangaben auf dieser Seite, als selbst gemeldet geführt, bis er unabhängig reproduziert wird.
Die offizielle 0813-Scorecard — DeepSeeks eigene Zahlen, alle.
DeepSeeks offizielle Ankündigung (API-Dokumente, news260813, 13. August 2026) berichtet, dass der Produktionsbuild auf Basis der April-Vorschau erstellt wurde. Jede Zahl in diesem Abschnitt stammt vom Anbieter – keine wurde bis zum 16. August 2026 unabhängig reproduziert:
• Terminal-Bench 2.1 — 87,9 (Vorschau: 72,1).
• DeepSWE — 62.7 (Vorschau: 12.8) — ein etwa 5-facher Sprung, der die mit Abstand auffälligste Angabe auf der Karte ist.
• CyberGym — 83.3 (Vorschau: 52.7).
• Humanity's Last Exam — 42.7 ohne Tools, 60.0 mit Tools (Vorschau: 37.7 / 48.2).
• Toolathlon-Verified — 74.1 (Vorschau: 55.9).
• AutomationBench (öffentlich) — 31.8 (Vorschau: 12.8).
• DSBench-FullStack — 71,1; DSBench-Hard — 67,2 (Vorschau: 41,8 / 31,1).
• NL2Repo — 61,5 (Vorschau: 38,5).
• Agents' Last Exam — 25.7 (Vorschau: 16.5).
Das Muster, auf das man achten sollte, ist, wo sich die Verbesserungen konzentrieren: bei Agentik- und Cybersicherheits-Benchmarks. Genau diese Art von Bewertungsbogen erstellt ein Labor, wenn es ein Agentenmodell bewerben will — und genau diese Art braucht eine neutrale Wiederholung, bevor man Produktionsbudget dafür ausgibt.

Der erweiterte Kodierungssatz aus {{1}}DeepSeeks technischem Bericht{{/1}}
Über die Agentic Card hinaus fügt der technische Bericht von DeepSeek (wie von BenchLM am 16. August 2026 aggregiert) einen breiteren Satz für Codierung und langen Kontext hinzu. Ebenfalls vom Anbieter gemeldet und von BenchLM als „Provider exact“ gekennzeichnet – kein unabhängiger Test:
• SWE-bench Verified — 80.6%; SWE-bench Pro — 55.4%.
• LiveCodeBench Pass@1-CoT — 93.5% — das beste verifizierte im BenchLM-Katalog.
• Codeforces-Rating — 3206 — auch das beste verifizierte im Katalog.
• BrowseComp — 83,4 %; Terminal-Bench 2.0 — 67,9 %.
• MRCR 1M — 83,5 %; CorpusQA 1M — 62,0 % — beide sind Katalog-Bestwerte beim 1M-Token-Retrieval, was für ein Modell wichtig ist, das mit einem 1M-Token-Kontextfenster wirbt.
• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (aufgeführt auf der Modellseite von OrcaRouter).
Was unabhängige Bewerter tatsächlich messen
Drei unabhängige Quellen haben DeepSeek V4 Pro getestet, und ihre Bewertungen gruppieren sich unterhalb der Herstellerkarte:
• Artificial Analysis Intelligence Index — 53 (Die Berichterstattung des SCMP, August 2026; OrcaRouters Modellseite zeigt 53,2, Rang 20 von 132). Gleichauf mit GLM 5.2, vier Punkte hinter GPT-5.6 Terra, sieben hinter Kimi K3.
• Artificial Analysis Coding — 68,8, belegt Platz 24 von 130 (laut OrcaRouter-Modellseite).
• Vals AI Index — Platz 12, hinter der Vorgängergeneration GPT-5.5 und deutlich hinter Kimi K3 und Claude Opus 5 (SCMP). Die eigenen Tests von Vals AI zeigten zwei konkrete Schwachstellen auf: das Erledigen von Aufgaben in einer Sandbox-Terminalumgebung und das Erstellen komplexer Finanzmodelle in Excel-Tabellen.
• Vibe Code Bench v1.1 — 49.93 (Vals AI, der einzige unabhängige „Benchmark exact“-Lauf im Set).
Die ehrliche Abrechnung — was reproduziert wurde vs. was immer noch nur DeepSeeks Wort ist
Dies ist der Abschnitt, den ein Benchmark-Artikel bereitstellen soll, und der Grund, diese Seite gegenüber der Startberichterstattung mit einem Lesezeichen zu versehen. Teilen Sie jede Punktzahl in einen von zwei Eimern auf:
• Unabhängig recherchiert: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI-Rang 12, Vibe Code Bench 49.93 — und ein aus separater Quelle stammender Terminal-Bench-2.1-Lauf mit 78.7, der auf OrcaRouters Modellseite neben der 87.9 von DeepSeek steht. Diese Neun-Punkte-Differenz zwischen der Zahl des Anbieters und einem unabhängigen Lauf ist der mit Abstand wichtigste Datenpunkt auf dieser Seite: Sie ist die Reproduktionslücke, quantifiziert.
• Nur vom Anbieter gemeldet, nicht unabhängig reproduziert: jede Zahl in der offiziellen 0813-Karte oben (Terminal-Bench 2.1 87,9, DeepSWE 62,7, CyberGym 83,3, HLE 42,7/60,0, Toolathlon 74,1, AutomationBench 31,8, DSBench 71,1/67,2, NL2Repo 61,5, Agents' Last Exam 25,7) sowie der gesamte erweiterte Codierungssatz (SWE-bench Verified 80,6, LiveCodeBench 93,5, Codeforces 3206, BrowseComp 83,4, MRCR 83,5, CorpusQA 62,0, GPQA Diamond 92,8). DeepSeeks eigene Dokumentation bezeichnet den Wert für Terminal-Bench 2.1 als „Anbieterlauf“.
So gelesen, ist die Geschichte stimmig: DeepSeek V4 Pro ist ein echtes Frontier-Modell im Mittelfeld — AA 53, im Zehner- bis Zwanzigerbereich platziert — mit einer Anbieter-Scorecard, die nahezu Spitzenleistungen bei agentischen Aufgaben und beim Coden beansprucht. Beide Aussagen sind wahr und stehen nicht im Widerspruch; die eine ist gemessen, die andere ist behauptet.

Was die Scorecard kostet
DeepSeek V4 Pro ist das MoE-Flaggschiff mit 1,6 T Gesamtparametern und 49 B aktiven Parametern, einem Kontextfenster von 1 M Token und einer maximalen Ausgabe von 384 K. Auf OrcaRouter wird es zum Listenpreis von DeepSeek ohne Aufschlag angeboten:0,435 $ pro Million Eingabe-Token und 0,87 $ pro Million Ausgabe-Token (Cache-Read 0,060 $ pro Million), laut dem Verzeichnis, das am 15. August 2026 geprüft und auf der Live-Modellseite bestätigt wurde. Bei diesem Preis ist die Preis-pro-Punkt-Rechnung das stärkste Argument für das Modell: Es kostet ungefähr ein Zehntel des Ausgabepreises der Modelle, die im unabhängigen Index in seiner Nähe liegen. Man zahlt also Preise der mittleren Preisklasse für eine Bewertung, die – falls die Behauptungen des Anbieters zutreffen – nahe an der Spitze liegt. Ein Hinweis: DeepSeek hat eine Preisstaffelung für Haupt- und Nebenzeiten angekündigt (Nebenzeit zu 50 % des Hauptzeitpreises), die ab dem 17. August, Pekinger Zeit, gilt. Der Preis kann sich also ändern – die hier genannten Zahlen sind der aktuelle Listenpreis zum Zeitpunkt dieses Artikels.

Serving von DeepSeek V4 Pro: 271 Ausgabe-Token/s auf H20
Benchmarks bewerten, was das Modell weiß; Serving-Zahlen bewerten, wie günstig man es zum Denken bringen kann. Am 19. August 2026 veröffentlichten LMSYS — die Organisation hinter Chatbot Arena — und das Open-Source-Team von Ant Group die erste ernsthafte Serving-Arbeit am 0813-Build: einen „szenariospezifischen Serving-Stack“, der auf SGLang basiert, der Open-Source-Engine, die LMSYS pflegt. Die wichtigste Kennzahl ist 271 Ausgabe-Token/s bei Batchgröße 1 auf einer NVIDIA H20, und das Team beziffert sie auf das 1,42-Fache einer B300 — erreicht auf einem Chip mit keinen nativen FP4-Tensor-Cores. Das sind LMSYS’ und Ant Groups eigene Messungen, angekündigt in ihrem Blog und auf X; keine davon wurde unabhängig reproduziert.
Die restlichen Zahlen des Stacks, alle von LMSYS und Ant Group selbst auf ihrem eigenen Stack gemeldet:
• Decode-Latenz — eine „optimierte DSpark“-Komponente reduziert die Zeit pro Ausgabe-Token (TPOT) bei Batch-Größe 1 um 74,8–78,0 %.
• Prefill — ein Prefill mit 1 Million Token wird in 43,7 Sekunden abgeschlossen, ein Prefill-Durchsatzgewinn von 36,5 % im geometrischen Mittel.
• KV-Cache – ein Schema, das das Team „Humming MXFP4AFP8 + Online C128“ nennt, erweitert die KV-Cache-Kapazität für vollständige Tokens um das 10,14-Fache, der Hebel, der 1-Millionen-Token-Agent-Workloads auf dieser Siliziumklasse praktikabel macht.
• Dekodierung pro GPU — bei 4K-Kontext steigt der Dekodierdurchsatz pro GPU von 319,9 auf 703,2 Token/s/GPU, eine Verbesserung um das 2,20-Fache.
Lesen Sie die Vorbehalte, bevor Sie eine Flotte darauf dimensionieren. Batchgröße 1 ist das Single-Stream-Regime – das, was ein interaktiver Agent oder ein Chat erreicht, nicht eine API mit hoher Nebenläufigkeit – und der 1,42×-Vergleich gegenüber B300 ist ein Verhältnis, das LMSYS angibt, ohne die absoluten Tokens/s von B300 zu veröffentlichen, sodass die Lücke behauptet, nicht überprüfbar ist. Das Ergebnis misst zudem den Stack, nicht den Chip: Diese Gewinne stammen aus SGLang-Level-Optimierung auf Hardware, die sonst für ein MoE mit insgesamt 1,6T unterdimensioniert wirken würde. Zum Kontext: Die Live-Modellseite von OrcaRouter misst DeepSeek V4 Pro bei 80,8 Ausgabe-Tokens/s über einen gemeinsamen API-Endpunkt – der H20-Wert ist ein Single-Stream-Benchmark auf einem dedizierten Stack, eine andere Zahl mit einer anderen Bedeutung.
Wenn Ihre Workload über eine API bereitgestellt wird, ändert sich dadurch nichts daran, wie Sie das Modell aufrufen: DeepSeek V4 Pro ist ein OpenAI-kompatibler Schlüssel auf OrcaRouter zum Listenpreis von DeepSeek, mit automatischem Failover, falls der Anbieter ins Stocken gerät. Die H20-Zahlen sind am wichtigsten, wenn Sie zu dem Team gehören, das eine selbst gehostete H20-Flotte gegen die Bezahlung der API abwägt – die Lücke, die die Arbeit von LMSYS und Ant Group schließt, ist eine Hardware-Kaufentscheidung und keine Modellauswahlentscheidung.
Wenn diese Empfehlung falsch ist
Die ehrlichen Fälle, in denen DeepSeek V4 Pro nicht die richtige Wahl sein sollte:
• Sie benötigen unabhängig bestätigtes Frontier-Reasoning. AA Index 53 liegt im Mittelfeld — Kimi K3 (60) und GPT-5.6 Terra (57) liegen vorn und sind verifiziert. Wenn Ihre Entscheidung von der gemessenen Obergrenze abhängt, ändert die Anbieterkarte nichts daran.
• Du setzt die Produktion auf DeepSWE 62.7, bevor jemand es erneut ausführt. Ein Sprung von 12.8 auf 62.7 in einer einzigen Version ist eine Behauptung, keine Tatsache. Warte auf eine neutrale Reproduktion — die 87.9-vs-78.7-Lücke bei Terminal-Bench zeigt, was man finden könnte.
• Ihre Arbeitslast ist Sandbox-Terminalautomatisierung oder Excel-Finanzmodellierung. Vals AI zufolge sind dies genau die Bereiche, in denen das Modell Schwierigkeiten hat, unabhängig von der Bewertung des Anbieters.
• Sie treffen eine Cybersicherheitsentscheidung auf Basis von CyberGym 83.3. Das ist DeepSeek, das sein eigenes Modell an seinem eigenen Benchmark testet – ein Sicherheitsanbieter, der auf diese Zahl setzt, kauft ungeprüfte Daten.
• Du kaufst H20s allein wegen der Zahl 271 tokens/s. Dieser Wert ist ein selbst angegebener Benchmark auf einem einzelnen Stack bei Batchgröße 1 — vielversprechend, nicht reproduziert und nur ein Punkt auf einer Kostenkurve, die auch Auslastung, Stromverbrauch und jeden Serving-Stack umfasst, den du tatsächlich betreiben würdest.
Fazit
DeepSeek V4 Pro 0813 ist ein echtes Frontier-Modell mit einer Anbieter-Scorecard, die seine unabhängigen Ergebnisse übertrifft. Das 0813-Release verwandelte eine Textvorschau in einen ernstzunehmenden agentischen Kandidaten – wir haben die Veröffentlichung selbst separat behandelt –, und wenn Sie es heute testen möchten, ist es ein OpenAI-kompatibler Schlüssel auf OrcaRouter zum Listenpreis von DeepSeek, mit automatischem Failover, falls der Anbieter stockt. Lesen Sie die Scorecard einfach so, wie dieser Artikel sie aufteilt: Die unabhängigen Prüfungen (AA 53, Vals 12., der 78,7-Terminal-Bench-Lauf) sind das, was Sie heute vertrauen können; die 87,9er und 62,7er sind das, was Sie verifizieren sollten, bevor Sie darauf aufbauen. Dieselbe Disziplin erstreckt sich nun auf das Serving: Die 271 Ausgabe-Tokens/s auf H20, die LMSYS und Ant Group melden, sind das beste Durchsatzbild, das wir haben, und es ist nach wie vor nur ihre Angabe, bis ein neutraler Lauf es bestätigt. Kaufen Sie es wegen des Preis-Leistungs-Verhältnisses und des 1M-Token-Kontexts, nicht wegen der nicht reproduzierten Schlagzeilenwerte.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
