Hero-Titelkarte für einen Vergleich von DeepSeek V4 Pro und Qwen3.8 Max, mit dem Untertitel ‚Reasoning-Spezialist gegen den chinesischen Allrounder‘.
Guides & Insights

DeepSeek V4 Pro vs Qwen3.8 Max: Reasoning-Spezialist vs. der chinesische Allrounder

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Mit zehn Tagen Abstand gingen die beiden meistbeachteten Modelle Chinas an den Start: Alibaba veröffentlichte Qwen3.8 Max am 3. August 2026 — ein 2,4-Billionen-Parameter-Flaggschiff mit sparse-MoE, das als Allrounder für Agenten, Büroarbeit und multimodales Verständnis angepriesen wird — und D​eepSeek lieferte die offizielle Version von DeepSeek V4 Pro am 12. August, sein auf Reasoning und Coding spezialisiertes Modell mit 1,6 Billionen Gesamtparametern und einem Preis, der bei den Ausgabetokens etwa ein Siebtel dessen beträgt, was Q​wen verlangt. Die beiden zielen auf dieselben Entwickler-Geldbörsen, sind sich aber uneinig darüber, wofür ein Flaggschiff da ist. Qwen3.8 Max möchte das eine Modell sein, durch das du alles leitest; DeepSeek V4 Pro möchte das eine sein, an das du die schwierigen Aufgaben eskalierst.

The OrcaRouter DeepSeek V4 Pro model page showing the flagship MoE badge, 1M-token context, 384K max output, per-million pricing and an OpenAI-compatible code sample.

Wichtige Erkenntnisse

• Qwen3.8 Max ist das Modell mit der höheren Rohleistung auf den chinesischen allgemeinen Leaderboards (SuperCLUE #1, Juli) und das stärkere Multimodal-/Enterprise-Paket – Videoeingabe, integrierte Tools, strukturierte Ausgabe, alles in einer API.

• DeepSeek V4 Pro ist dramatisch günstiger (~7× beim Output), bereits mit offenen Gewichten, und hat nun die höheren Coding-/Agentic-Werte — Terminal-Bench 2.1 mit 87,9 gegenüber den von Q​wens Anbieter gemeldeten 86,6.

• Achten Sie auf die Kosten der Ausführlichkeit: Unabhängige Läufe zeigen, dass Qwen3.8 Max durchschnittlich ~64 Turns und ~$1.14 pro agentischer Aufgabe benötigt – ein Effektivkostenproblem, das das Datenblatt verschweigt.

• Die ehrliche Schlagzeile: Qwen3.8 Max ist das Flaggschiff im "Fähigkeitskrieg", das mit der Preisgestaltung der geschlossenen US-Modelle gleichzieht; DeepSeek V4 Pro ist das Preis-Leistungs-Gegenargument.

Zwei Philosophien in einer Spezifikationstabelle

• Gesamtparameter — Qwen3.8 Max 2,4T (sparse MoE, ~95B aktiv) vs DeepSeek V4 Pro 1,6T (MoE, ~49B aktiv)

• Kontext / maximale Ausgabe — beide mit 1M Kontext; Q​wen erreicht maximal etwa 128–131K Ausgabe gegenüber D​eepSeek mit 384K

• Eingaben — Q​wen akzeptiert Text, Bild und Video; DeepSeek V4 Pro akzeptiert Text und Bild, mit neuem nativem Bild-Reasoning im offiziellen Build.

• Offene Gewichte — DeepSeek V4 Pro: veröffentlicht (MIT); Qwen3.8 Max: für die Woche des 10. August versprochen, das erste Max-Klasse-Q​wen, das je als Open Source veröffentlicht wurde.

• API-Extras — Q​wen bringt integrierte Tools und strukturierte Ausgaben von Haus aus mit; DeepSeek V4 Pro bietet Denkmodus-Umschalter, strukturiertes JSON, eine Responses-API und Codex-Kompatibilität.

• Preis — Qwen3.8 Max $2.00 / $6.00 pro Million Tokens ($0.25 gecacht) vs. DeepSeek V4 Pro ~$0.42 / $0.87 ($0.0035 gecacht)

Scoreboard contrasting DeepSeek V4 Pro (Terminal-Bench 2.1 87.9 official, output price $0.87 per 1M, 1.6T total params, MIT open weights out now, 384K max output, text+image input) with Qwen3.8 Max (86.6 vendor, $6.00, 2.4T params, weights promised, ~128K max output, text+image+video input).

Wo Qwen3.8 Max überzeugt

Auf der Generalisten-Achse liegt Qwen3.8 Max vorn, und die unabhängigen Daten stimmen überein. Artificial Analysis verortet ihn bei einem Intelligence-Index von 58, einem Coding-Index von 71,8 und einem Agentic-Index von 58 – das ist das nächste, was ein chinesisches Labor an die Spitze dieser Agentic-Rangliste herangekommen ist. Im chinesischsprachigen Ranking von SuperCLUE vom Juli liegt er mit 71,48 auf Platz 1, während DeepSeek-V4-Pro mit 64,4 auf Platz 5 liegt. Alibabas Launch-Demos – ein 16-tägiger autonomer Programmierlauf, eine Papierreproduktion, die das AIME24-Ergebnis des Originalpapiers übertraf – sind der stärkste Beweis im gesamten Release-Zyklus, dass dies ein wirklich leistungsfähiger Langzeit-Agent ist.

Für einen Entwickler sind die praktischen Vorteile integrationsorientiert: Videoeingabe, integrierte Tool-Aufrufe, strukturierte Ausgabe ohne Konfiguration und ein Ökosystem (Model Studio, die Q​wen-Toolchain), das D​eepSeek nicht zu erreichen versucht. Wenn die Arbeitslast dokumentlastig oder multimodal ist oder eine Enterprise-Integrationslösung erfordert, ist Qwen3.8 Max das Modell, auf das der chinesische Markt derzeit standardmäßig zurückgreift.

Wo DeepSeek V4 Pro punktet

Was Codierung und Kosten betrifft, ist das offizielle V4 Pro die Erwiderung. D​eepSeek gibt für den offiziellen Build 87.9 bei Terminal-Bench 2.1 an (gegenüber 72.1 bei der Vorschau) und 62.7 bei DeepSWE – gegenüber dem von Q​wen angegebenen Wert von 86.6 bei Terminal-Bench. Die Vorschau hatte bereits 80.6 beim SWE-bench Verified, 90.1 beim GPQA Diamond und 93.5 beim LiveCodeBench – die beste Punktzahl eines offenen Modells bei Competitive Programming – und die Änderungen des offiziellen Builds konzentrieren sich genau auf die agentischen und Reasoning-Aufgaben, in denen diese Zahlen angesiedelt sind.

Dann ist da der Preis. Bei 0,42 $/0,87 $ pro Million Tokens ist DeepSeek V4 Pro beim Input etwa 4,8× günstiger und beim Output etwa 6,9× günstiger als Qwen3.8 Max mit 2 $/6 $. DeepSeek hat außerdem am 6. August angekündigt, dass eine Preiserhöhung bevorsteht, was den heutigen Tarif zu einem Zeitfenster macht, nicht zu einem Versprechen – mehr dazu weiter unten.

An infographic summarizing the official DeepSeek V4 Pro release: Terminal-Bench 2.1 at 87.9 (preview 72.1), DeepSWE 62.7 (preview 12.8), AutomationBench 31.8 (preview 12.8), with native image reasoning, 1M context, 384K output and $0.87 per 1M output.

Rechne bei einer echten agentischen Aufgabe durch.

Bei unabhängigen agentischen Läufen hört der Listenpreis von Qwen auf, der eigentliche Preis zu sein. Bei den agentischen Aufgaben von Artificial Analysis absolvierte Qwen3.8 Max durchschnittlich ~64 Turns pro Aufgabe und kostete ~1,14 $ pro Aufgabe, gegenüber ~0,53 $ für die vorherige Generation – das Modell ist ausführlich und plant viel. Lässt man dieselbe Aufgabenform auf DeepSeek V4 Pro zu einem Preis von 0,87 $ pro Million Output laufen, liegt die Kosten pro Aufgabe um etwa eine Größenordnung niedriger. Wenn Ihr Produkt eine Schleife ist, die das Modell hundertmal am Tag pro Benutzer aufruft, ist dieser Unterschied Ihre Marge.

Zuverlässigkeitsvorbehalte auf beiden Seiten

Die Ehrlichkeit bei Quellenangaben ist hier ein zweischneidiges Schwert. Unabhängige Tests wiesen darauf hin, dass die Halluzinationsrate von Qwen3.8 Max von 23 % auf 40 % gestiegen ist und der AA-Omniscience-Score um zehn Punkte gesunken ist – das Modell wurde im selben Release leistungsfähiger und weniger vertrauenswürdig. Das Preview von D​eepSeek wies eine dokumentierte Antwort-immer-Rate von 94 % bei AA-Omniscience auf, was bedeutet, dass es dazu neigt, eine Antwort zu liefern, ob es eine weiß oder nicht. Beide Befunde sind für den Produktionseinsatz relevant; keiner davon ist disqualifizierend für die Workloads, für die diese Modelle vorgesehen sind.

Warum das Timing der offenen Gewichte die Preisberechnung verändert.

Die Open-Weights-Veröffentlichung von Qwen3.8 Max wird, sobald sie erscheint, die wirtschaftliche Dynamik dieses Duells innerhalb einer Woche verändern – Self-Hoster bekommen ein 2,4-Billionen-Parameter-Flaggschiff, und der API-Preisdruck wird real. Genau in diesem Szenario sorgt ein Pass-through-Preismodell dafür, dass man ehrlich bleibt. OrcaRouter reicht den Listenpreis des Anbieters ohne Aufschlag durch, sodass eine Preisänderung von Alibaba oder DeepSeek – ob nach oben oder unten – noch am selben Tag unter einem einzigen Schlüssel live ist, ohne Nachverhandlungen und ohne einen zweiten Vertrag, den man lesen muss. Du routest zu dem Modell aus Qwen3.8 Max oder DeepSeek V4 Pro, das dein aktuelles Eval bevorzugt, und die Preisgestaltung bleibt das, was der Anbieter tatsächlich verlangt.

Welche für Ihre Entscheidung beim API-Builder?

Wählen Sie Qwen3.8 Max, wenn die Aufgabe das gesamte Spektrum benötigt – multimodale Eingabe, strukturierte Ausgabe, integrierte Werkzeuge, chinesischsprachige Qualität an der Spitze der aktuellen Ranglisten – und Ihr Kostenmodell wortreiche agentische Abläufe toleriert. Wählen Sie DeepSeek V4 Pro, wenn die Aufgabe stark reasoning- oder code-lastig ist, das Token-Volumen hoch ist, offene Gewichte für Compliance oder Self-Hosting wichtig sind oder die Budgetgrenze die bindende Beschränkung ist. Die klarste Lesart dieses Duells ist die, die die beiden Unternehmen selbst signalisieren: Qwen3.8 Max ist das Flaggschiff, an dem man alles misst, und DeepSeek V4 Pro ist dasjenige, das den Benchmark teuer aussehen lässt.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube