
DeepSeek V4 Pro Benchmarks: Die vollständige 0813-Ergebnisübersicht, jede unabhängige Prüfung und was noch niemand verifiziert hat
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianNEUQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligenz68Coding
- qwenNEUQwen: Qwen3.8 27B (free)2026-08-1340 tok/s
- deepseekNEUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokNEUSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaNEUMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens · 221 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenz77Coding
- grokxAI: Grok 4.52026-07-0856Intelligenz72Coding
Die Antwort in einem Satz: DeepSeek V4 Pro erzielt laut DeepSeeks eigenen Zahlen eine wirklich starke Agentic-Scorecard – Terminal-Bench 2.1 bei 87,9, DeepSWE bei 62,7, CyberGym bei 83,3 – aber fast jede wichtige Kennzahl stammt vom Anbieter selbst, und das unabhängige Bild ist nüchterner. Artificial Analysis bewertet den offiziellen 0813-Build mit 53 auf seinem Intelligence Index, gleichauf mit GLM-5.2, vier Punkte hinter GPT-5.6 Terra und sieben hinter Kimi K3; Vals AI stuft ihn auf Platz 12 ein, unter GPT-5.5 aus der vorherigen Generation. Dieser Artikel ist die vollständige Zusammenfassung, die sonst niemand geschrieben hat: die komplette 0813-Scorecard, das erweiterte Coding-Set aus dem technischen Bericht, jede vorhandene unabhängige Prüfung und eine ehrliche Bilanz darüber, welche Zahlen reproduziert wurden und welche weiterhin allein auf DeepSeeks Angaben beruhen.
Die offizielle 0813-Bewertungstabelle — DeepSeeks eigene Zahlen, alle davon.
DeepSeek offizielle Ankündigung (API-Dokumentation, news260813, 13. August 2026) berichtet über den Produktions-Build gegenüber der April-Vorschau. Jede Zahl in diesem Abschnitt stammt vom Anbieter — keine wurde bis zum 16. August 2026 unabhängig reproduziert:
• Terminal-Bench 2.1 — 87,9 (Vorschau: 72,1).
• DeepSWE — 62.7 (Vorschau: 12.8) — ein etwa 5-facher Sprung, der die mit Abstand auffälligste Angabe auf der Karte ist.
• CyberGym — 83.3 (Vorschau: 52.7).
• Humanity's Last Exam — 42.7 ohne Tools, 60.0 mit Tools (Vorschau: 37.7 / 48.2).
• Toolathlon-Verified — 74.1 (Vorschau: 55.9).
• AutomationBench (öffentlich) — 31.8 (Vorschau: 12.8).
• DSBench-FullStack — 71,1; DSBench-Hard — 67,2 (Vorschau: 41,8 / 31,1).
• NL2Repo — 61,5 (Vorschau: 38,5).
• Agents' Last Exam — 25.7 (Vorschau: 16.5).
Das Muster, auf das man achten sollte, ist, wo sich die Verbesserungen konzentrieren: bei Agentik- und Cybersicherheits-Benchmarks. Genau diese Art von Bewertungsbogen erstellt ein Labor, wenn es ein Agentenmodell bewerben will — und genau diese Art braucht eine neutrale Wiederholung, bevor man Produktionsbudget dafür ausgibt.

Das erweiterte Codierungsset aus dem technischen Bericht von DeepSeek.
Jenseits der Agenten-Karte ergänzt der DeepSeek-Technikbericht (wie von BenchLM am 16. August 2026 aggregiert) einen breiteren Coding- und Langkontext-Satz. Ebenfalls vom Anbieter gemeldet und von BenchLM als „Provider exact“ gekennzeichnet — kein unabhängiger Test:
• SWE-bench Verified — 80.6%; SWE-bench Pro — 55.4%.
• LiveCodeBench Pass@1-CoT — 93.5% — das beste verifizierte im BenchLM-Katalog.
• Codeforces-Rating — 3206 — auch das beste verifizierte im Katalog.
• BrowseComp — 83,4 %; Terminal-Bench 2.0 — 67,9 %.
• MRCR 1M — 83,5 %; CorpusQA 1M — 62,0 % — beide sind Katalog-Bestwerte beim 1M-Token-Retrieval, was für ein Modell wichtig ist, das mit einem 1M-Token-Kontextfenster wirbt.
• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (aufgeführt auf der Modellseite von OrcaRouter).
Was unabhängige Bewerter tatsächlich messen
Drei unabhängige Quellen haben DeepSeek V4 Pro getestet, und ihre Bewertungen gruppieren sich unterhalb der Herstellerkarte:
• Artificial Analysis Intelligence Index — 53 (SCMPs Berichterstattung, August 2026; OrcaRouters Modellseite zeigt 53.2, Rang 20 von 132). Gleichauf mit GLM-5.2, vier Punkte hinter GPT-5.6 Terra, sieben hinter Kimi K3.
• Artificial Analysis Coding — 68,8, belegt Platz 24 von 130 (laut OrcaRouter-Modellseite).
• Vals AI Index — Platz 12, hinter der Vorgängergeneration GPT-5.5 und deutlich hinter Kimi K3 und Claude Opus 5 (SCMP). Die eigenen Tests von Vals AI zeigten zwei konkrete Schwachstellen auf: das Erledigen von Aufgaben in einer Sandbox-Terminalumgebung und das Erstellen komplexer Finanzmodelle in Excel-Tabellen.
• Vibe Code Bench v1.1 — 49.93 (Vals AI, der einzige unabhängige „Benchmark exact“-Lauf im Set).
Das ehrliche Hauptbuch – was reproduziert wurde vs. was nur DeepSeeks Wort ist.
Dies ist der Abschnitt, den ein Benchmark-Artikel bereitstellen soll, und der Grund, diese Seite gegenüber der Startberichterstattung mit einem Lesezeichen zu versehen. Teilen Sie jede Punktzahl in einen von zwei Eimern auf:
• Aus unabhängiger Quelle: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI Rang 12, Vibe Code Bench 49.93 — und ein separat bezogener Terminal-Bench-2.1-Lauf von 78.7, der neben DeepSeeks 87.9 auf OrcaRouters Modellseite steht. Diese Neun-Punkte-Differenz zwischen der Zahl des Anbieters und einem unabhängigen Lauf ist der mit Abstand wichtigste Datenpunkt auf dieser Seite: Es ist die Reproduktionslücke, quantifiziert.
• Nur vom Anbieter gemeldet, nicht unabhängig reproduziert: jede Zahl in der offiziellen 0813-Karte oben (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) sowie das gesamte erweiterte Codierungs-Set (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). Die eigene Dokumentation von DeepSeek bezeichnet die Terminal-Bench-2.1-Zahl als „Anbieter-Lauf".
So gelesen, ist die Geschichte stimmig: DeepSeek V4 Pro ist ein echtes Frontier-Modell im Mittelfeld — AA 53, im Zehner- bis Zwanzigerbereich platziert — mit einer Anbieter-Scorecard, die nahezu Spitzenleistungen bei agentischen Aufgaben und beim Coden beansprucht. Beide Aussagen sind wahr und stehen nicht im Widerspruch; die eine ist gemessen, die andere ist behauptet.

Was die Scorecard kostet
DeepSeek V4 Pro ist das MoE-Flaggschiff (1.6T gesamt / 49B aktiv) mit einem Kontextfenster von 1M Token und einer maximalen Ausgabe von 384K. Auf OrcaRouter wird es zum Listenpreis von DeepSeek ohne Aufschlag angeboten: $0.435 pro Million Input-Token und $0.87 pro Million Output (Cache-Read $0.060 pro Million), laut dem Verzeichnis, geprüft am 15. August 2026 und bestätigt auf der Live-Modellseite. Bei diesem Preis ist die Preis-pro-Punkt-Rechnung das stärkste Argument für das Modell: Der Preis beträgt etwa ein Zehntel des Output-Preises der Modelle, die im unabhängigen Index nahe daran liegen, sodass Sie Mittelklasse-Preise für eine Bewertung zahlen, die, falls die Behauptungen des Anbieters zutreffen, nahe der Spitze liegt. Ein Hinweis: DeepSeek hat eine Peak/Off-Peak-Preisstruktur angekündigt (Off-Peak bei 50 % des Peak), die am 17. August (Pekinger Zeit) in Kraft tritt, sodass sich der Preis ändern kann — die Zahlen hier sind der aktuelle Listenpreis zum Zeitpunkt dieses Artikels.

Wenn diese Empfehlung falsch ist
Die ehrlichen Fälle, in denen DeepSeek V4 Pro nicht die richtige Wahl sein sollte:
• Sie benötigen unabhängig bestätigtes Frontier-Reasoning. AA Index 53 liegt im Mittelfeld — Kimi K3 (60) und GPT-5.6 Terra (57) liegen vorn und sind verifiziert. Wenn Ihre Entscheidung von der gemessenen Obergrenze abhängt, ändert die Anbieterkarte nichts daran.
• Du setzt die Produktion auf DeepSWE 62.7, bevor jemand es erneut ausführt. Ein Sprung von 12.8 auf 62.7 in einer einzigen Version ist eine Behauptung, keine Tatsache. Warte auf eine neutrale Reproduktion — die 87.9-vs-78.7-Lücke bei Terminal-Bench zeigt, was man finden könnte.
• Ihre Arbeitslast ist Sandbox-Terminalautomatisierung oder Excel-Finanzmodellierung. Vals AI zufolge sind dies genau die Bereiche, in denen das Modell Schwierigkeiten hat, unabhängig von der Bewertung des Anbieters.
• Sie treffen eine Cybersicherheitsentscheidung über CyberGym 83.3. Das ist DeepSeek, das sein eigenes Modell anhand seines eigenen Benchmarks testet – ein Sicherheitsanbieter, der auf diese Zahl setzt, kauft ungeprüfte Daten.
Fazit
DeepSeek V4 Pro 0813 ist ein echtes Frontier-Modell mit einer Anbieter-Bewertung, die die unabhängigen Ergebnisse übertrifft. Das 0813-Release hat aus einer Textvorschau einen ernstzunehmenden Agenten-Kandidaten gemacht – über das Release selbst haben wir separat berichtet – und wenn Sie es heute testen möchten, ist es ein OpenAI-kompatibler Key auf OrcaRouter zum Listenpreis von DeepSeek, mit automatischem Failover, falls der Anbieter ins Stocken gerät. Lesen Sie die Bewertung einfach so, wie dieser Artikel sie aufschlüsselt: Die unabhängigen Prüfungen (AA 53, Vals 12., der 78,7-Terminal-Bench-Lauf) sind das, worauf Sie sich heute verlassen können; die 87,9er und 62,7er Werte sollten Sie überprüfen, bevor Sie darauf aufbauen. Kaufen Sie es wegen des Preis-Leistungs-Verhältnisses und des 1M-Token-Kontexts, nicht wegen der nicht reproduzierten Schlagzeilenzahlen.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
