
DeepSeek V4 Pro vs Qwen3.8 Max: Reasoning-Spezialist vs. der chinesische Allrounder
- AlibabaNEUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.3 Flash2026-08-2658Intelligenz72Coding
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
Mit zehn Tagen Abstand gingen die beiden meistbeachteten Modelle Chinas an den Start: Alibaba veröffentlichte Qwen3.8 Max am 3. August 2026 — ein 2,4-Billionen-Parameter-Flaggschiff mit sparse-MoE, das als Allrounder für Agenten, Büroarbeit und multimodales Verständnis angepriesen wird — und DeepSeek lieferte die offizielle Version von DeepSeek V4 Pro am 12. August, sein auf Reasoning und Coding spezialisiertes Modell mit 1,6 Billionen Gesamtparametern und einem Preis, der bei den Ausgabetokens etwa ein Siebtel dessen beträgt, was Qwen verlangt. Die beiden zielen auf dieselben Entwickler-Geldbörsen, sind sich aber uneinig darüber, wofür ein Flaggschiff da ist. Qwen3.8 Max möchte das eine Modell sein, durch das du alles leitest; DeepSeek V4 Pro möchte das eine sein, an das du die schwierigen Aufgaben eskalierst.

Wichtige Erkenntnisse
• Qwen3.8 Max ist das Modell mit der höheren Rohleistung auf den chinesischen allgemeinen Leaderboards (SuperCLUE #1, Juli) und das stärkere Multimodal-/Enterprise-Paket – Videoeingabe, integrierte Tools, strukturierte Ausgabe, alles in einer API.
• DeepSeek V4 Pro ist dramatisch günstiger (~7× beim Output), bereits mit offenen Gewichten, und hat nun die höheren Coding-/Agentic-Werte — Terminal-Bench 2.1 mit 87,9 gegenüber den von Qwens Anbieter gemeldeten 86,6.
• Achten Sie auf die Kosten der Ausführlichkeit: Unabhängige Läufe zeigen, dass Qwen3.8 Max durchschnittlich ~64 Turns und ~$1.14 pro agentischer Aufgabe benötigt – ein Effektivkostenproblem, das das Datenblatt verschweigt.
• Die ehrliche Schlagzeile: Qwen3.8 Max ist das Flaggschiff im "Fähigkeitskrieg", das mit der Preisgestaltung der geschlossenen US-Modelle gleichzieht; DeepSeek V4 Pro ist das Preis-Leistungs-Gegenargument.
Zwei Philosophien in einer Spezifikationstabelle
• Gesamtparameter — Qwen3.8 Max 2,4T (sparse MoE, ~95B aktiv) vs DeepSeek V4 Pro 1,6T (MoE, ~49B aktiv)
• Kontext / maximale Ausgabe — beide mit 1M Kontext; Qwen erreicht maximal etwa 128–131K Ausgabe gegenüber DeepSeek mit 384K
• Eingaben — Qwen akzeptiert Text, Bild und Video; DeepSeek V4 Pro akzeptiert Text und Bild, mit neuem nativem Bild-Reasoning im offiziellen Build.
• Offene Gewichte — DeepSeek V4 Pro: veröffentlicht (MIT); Qwen3.8 Max: für die Woche des 10. August versprochen, das erste Max-Klasse-Qwen, das je als Open Source veröffentlicht wurde.
• API-Extras — Qwen bringt integrierte Tools und strukturierte Ausgaben von Haus aus mit; DeepSeek V4 Pro bietet Denkmodus-Umschalter, strukturiertes JSON, eine Responses-API und Codex-Kompatibilität.
• Preis — Qwen3.8 Max $2.00 / $6.00 pro Million Tokens ($0.25 gecacht) vs. DeepSeek V4 Pro ~$0.42 / $0.87 ($0.0035 gecacht)

Wo Qwen3.8 Max überzeugt
Auf der Generalisten-Achse liegt Qwen3.8 Max vorn, und die unabhängigen Daten stimmen überein. Artificial Analysis verortet ihn bei einem Intelligence-Index von 58, einem Coding-Index von 71,8 und einem Agentic-Index von 58 – das ist das nächste, was ein chinesisches Labor an die Spitze dieser Agentic-Rangliste herangekommen ist. Im chinesischsprachigen Ranking von SuperCLUE vom Juli liegt er mit 71,48 auf Platz 1, während DeepSeek-V4-Pro mit 64,4 auf Platz 5 liegt. Alibabas Launch-Demos – ein 16-tägiger autonomer Programmierlauf, eine Papierreproduktion, die das AIME24-Ergebnis des Originalpapiers übertraf – sind der stärkste Beweis im gesamten Release-Zyklus, dass dies ein wirklich leistungsfähiger Langzeit-Agent ist.
Für einen Entwickler sind die praktischen Vorteile integrationsorientiert: Videoeingabe, integrierte Tool-Aufrufe, strukturierte Ausgabe ohne Konfiguration und ein Ökosystem (Model Studio, die Qwen-Toolchain), das DeepSeek nicht zu erreichen versucht. Wenn die Arbeitslast dokumentlastig oder multimodal ist oder eine Enterprise-Integrationslösung erfordert, ist Qwen3.8 Max das Modell, auf das der chinesische Markt derzeit standardmäßig zurückgreift.
Wo DeepSeek V4 Pro punktet
Was Codierung und Kosten betrifft, ist das offizielle V4 Pro die Erwiderung. DeepSeek gibt für den offiziellen Build 87.9 bei Terminal-Bench 2.1 an (gegenüber 72.1 bei der Vorschau) und 62.7 bei DeepSWE – gegenüber dem von Qwen angegebenen Wert von 86.6 bei Terminal-Bench. Die Vorschau hatte bereits 80.6 beim SWE-bench Verified, 90.1 beim GPQA Diamond und 93.5 beim LiveCodeBench – die beste Punktzahl eines offenen Modells bei Competitive Programming – und die Änderungen des offiziellen Builds konzentrieren sich genau auf die agentischen und Reasoning-Aufgaben, in denen diese Zahlen angesiedelt sind.
Dann ist da der Preis. Bei 0,42 $/0,87 $ pro Million Tokens ist DeepSeek V4 Pro beim Input etwa 4,8× günstiger und beim Output etwa 6,9× günstiger als Qwen3.8 Max mit 2 $/6 $. DeepSeek hat außerdem am 6. August angekündigt, dass eine Preiserhöhung bevorsteht, was den heutigen Tarif zu einem Zeitfenster macht, nicht zu einem Versprechen – mehr dazu weiter unten.

Rechne bei einer echten agentischen Aufgabe durch.
Bei unabhängigen agentischen Läufen hört der Listenpreis von Qwen auf, der eigentliche Preis zu sein. Bei den agentischen Aufgaben von Artificial Analysis absolvierte Qwen3.8 Max durchschnittlich ~64 Turns pro Aufgabe und kostete ~1,14 $ pro Aufgabe, gegenüber ~0,53 $ für die vorherige Generation – das Modell ist ausführlich und plant viel. Lässt man dieselbe Aufgabenform auf DeepSeek V4 Pro zu einem Preis von 0,87 $ pro Million Output laufen, liegt die Kosten pro Aufgabe um etwa eine Größenordnung niedriger. Wenn Ihr Produkt eine Schleife ist, die das Modell hundertmal am Tag pro Benutzer aufruft, ist dieser Unterschied Ihre Marge.
Zuverlässigkeitsvorbehalte auf beiden Seiten
Die Ehrlichkeit bei Quellenangaben ist hier ein zweischneidiges Schwert. Unabhängige Tests wiesen darauf hin, dass die Halluzinationsrate von Qwen3.8 Max von 23 % auf 40 % gestiegen ist und der AA-Omniscience-Score um zehn Punkte gesunken ist – das Modell wurde im selben Release leistungsfähiger und weniger vertrauenswürdig. Das Preview von DeepSeek wies eine dokumentierte Antwort-immer-Rate von 94 % bei AA-Omniscience auf, was bedeutet, dass es dazu neigt, eine Antwort zu liefern, ob es eine weiß oder nicht. Beide Befunde sind für den Produktionseinsatz relevant; keiner davon ist disqualifizierend für die Workloads, für die diese Modelle vorgesehen sind.
Warum das Timing der offenen Gewichte die Preisberechnung verändert.
Die Open-Weights-Veröffentlichung von Qwen3.8 Max wird, sobald sie erscheint, die wirtschaftliche Dynamik dieses Duells innerhalb einer Woche verändern – Self-Hoster bekommen ein 2,4-Billionen-Parameter-Flaggschiff, und der API-Preisdruck wird real. Genau in diesem Szenario sorgt ein Pass-through-Preismodell dafür, dass man ehrlich bleibt. OrcaRouter reicht den Listenpreis des Anbieters ohne Aufschlag durch, sodass eine Preisänderung von Alibaba oder DeepSeek – ob nach oben oder unten – noch am selben Tag unter einem einzigen Schlüssel live ist, ohne Nachverhandlungen und ohne einen zweiten Vertrag, den man lesen muss. Du routest zu dem Modell aus Qwen3.8 Max oder DeepSeek V4 Pro, das dein aktuelles Eval bevorzugt, und die Preisgestaltung bleibt das, was der Anbieter tatsächlich verlangt.
Welche für Ihre Entscheidung beim API-Builder?
Wählen Sie Qwen3.8 Max, wenn die Aufgabe das gesamte Spektrum benötigt – multimodale Eingabe, strukturierte Ausgabe, integrierte Werkzeuge, chinesischsprachige Qualität an der Spitze der aktuellen Ranglisten – und Ihr Kostenmodell wortreiche agentische Abläufe toleriert. Wählen Sie DeepSeek V4 Pro, wenn die Aufgabe stark reasoning- oder code-lastig ist, das Token-Volumen hoch ist, offene Gewichte für Compliance oder Self-Hosting wichtig sind oder die Budgetgrenze die bindende Beschränkung ist. Die klarste Lesart dieses Duells ist die, die die beiden Unternehmen selbst signalisieren: Qwen3.8 Max ist das Flaggschiff, an dem man alles misst, und DeepSeek V4 Pro ist dasjenige, das den Benchmark teuer aussehen lässt.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
