
Qwen 4 Max vs. DeepSeek V4 Pro: 95 Milliarden aktive Parameter gegen 49 Milliarden
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Die Ankündigung von Qwen 4 Max auf der Yunqi-Konferenz am 22. September 2026 gab der Branche einen Namen und eine Stufengliederung und sonst nichts – keine Gewichte, keinen Preis, kein Kontextfenster, kein Datum. DeepSeek V4 Pro ist seit dem 24. April 2026 als Mixture-of-Experts mit 1,6 Billionen Parametern gelistet, von denen 49 Milliarden Parameter pro Token aktiv sind, mit einem Kontext von 1 Million Token und einem Off-Peak-Preis von 0,66 US-Dollar pro Million Input-Token und 1,98 US-Dollar pro Million Output-Token. Die Zahl, die man nebeneinanderstellen sollte, ist nicht die Gesamtzahl der Parameter, sondern die aktive Zahl: Das zuletzt veröffentlichte Qwen3.8-Max aktiviert 95 Milliarden Parameter pro Token, etwa doppelt so viele wie die 49 Milliarden aktiven Parameter, die DeepSeek V4 Pro verwendet, und diese eine Zahl erklärt den größten Teil der dreifachen Preislücke zwischen den beiden Labors, bevor auch nur ein einziger Benchmark herangezogen wird.
Zwei verschiedene Wetten auf Sparsity
Beide Labore entwickeln sparse Mixture-of-Experts-Modelle. Sie sind sich uneinig – und zwar deutlich – darüber, wie sparse sie sein sollten. Qwen3.8-Max – das derzeit ausgelieferte Qwen-Flaggschiff und die einzige konkrete Vergleichsbasis dafür, wie Qwen 4 Max aussehen wird – ist ein Modell mit 2,4 Billionen Parametern, das pro Token 95 Milliarden Parameter aktiviert, ein Verhältnis von etwa eins zu fünfundzwanzig. DeepSeek V4 Pro ist ein Modell mit 1,6 Billionen Parametern, das 49 Milliarden aktiviert, ein Verhältnis von etwa eins zu dreiunddreißig, und es speichert seine Expertengewichte in FP4, wobei die Attention-, Router- und Norm-Schichten in FP8 belassen werden, was den Rechenaufwand pro Token erneut senkt.
Das sind keine Unterschiede beim Tuning. Es sind zwei verschiedene Antworten auf dieselbe Frage – wie viel ein Frontier-Modell pro Token ausgeben sollte:
• Gesamtparameter — Qwen 3.8 Flaggschiff 2,4T gegenüber DeepSeek V4 Pro 1,6T
• Aktiv pro Token — Qwen 3.8 Flaggschiff 95B gegenüber DeepSeek V4 Pro 49B
• Aktivierungsquote — etwa 1 von 25 gegenüber etwa 1 von 33
• Eingabepreis, Off-Peak — Qwen3.8-Max 2,00 $ pro 1 Mio. gegenüber DeepSeek V4 Pro 0,66 $ pro 1 Mio.
• Ausgabepreis, außerhalb der Spitzenzeiten — Qwen3.8-Max $6,00 pro 1 Mio. gegenüber DeepSeek V4 Pro $1,98 pro 1 Mio.
• Flaggschiff-Gewichte — Qwen 3.8 Flaggschiff unter einer benutzerdefinierten Qwen-Lizenz versus DeepSeek V4 Pro, veröffentlicht unter der MIT-Lizenz
• Kontext — Qwen3.8-Max mit 1 Mio. Tokens im Vergleich zu DeepSeek V4 Pro mit 1 Mio. Tokens
• Modalität — Qwen3.8-Max mit Text-, Bild- und Videoeingabe gegenüber DeepSeek V4 Pro, das in seinem Listing nur Text unterstützt
• Beobachtete Latenz – Qwen3.8-Max p50-Zeit bis zum ersten Token 3,29 s gegenüber DeepSeek V4 Pro 3,52 s im selben Katalog
Der Sparsity-Unterschied und der Preisunterschied weisen diesmal in dieselbe Richtung, was nicht die Richtung ist, die die Gesamtparameterzahlen nahelegen. Qwen aktiviert pro Token etwa doppelt so viele Parameter wie DeepSeek und verlangt etwa dreimal so viel, und Sparsity allein schließt diese Lücke nicht. Was den Rest schließt, ist die Modalität: Qwens Flaggschiff enthält Vision- und Video-Encoder, sie werden bei jeder Anfrage mitbezahlt, unabhängig davon, ob ein Bild darin enthalten ist, und deshalb liegt der Eingabetarif dort, wo er liegt. DeepSeek V4 Pro nimmt Text entgegen und gibt Text zurück, und der Preis entspricht dem eines Modells, das nur das tut.
Ein einschränkender Hinweis gehört in die DeepSeek-Spalte, bevor sie für irgendetwas verwendet wird. DeepSeek rechnet nach einem Peak- und Off-Peak-Zeitplan ab: Die Beträge von 0,66 $ und 1,98 $ sind die Off-Peak-Sätze, und während der Peak-Fenster – werktags von 01:00 bis 04:00 und von 06:00 bis 10:00 UTC, mit Ausnahme chinesischer Feiertage – werden für dasselbe Modell 1,32 $ für Eingaben und 3,96 $ für Ausgaben berechnet. Alles andere, einschließlich aller Wochenenden und Feiertage, zählt als Off-Peak. Der Tarif, den Sie zahlen, ist daher eine Funktion davon, wann Ihr Traffic läuft, und ein Kostenmodell, das allein auf dem Off-Peak-Wert aufbaut, wird für jede Workload falsch sein, die eine Werktagmorgen-Komponente hat.

Die Qwen 4 Max-Spalte ist leer, und das ist kein vorübergehender Zustand.
Es ist verlockend, den Vergleich mit der Annahme zu füllen, dass Qwen 4 Max in der Nähe der Qwen 3.8-Werte landen und darunter preisen wird. Widerstehen Sie dem. Alibaba beschrieb die Qwen 4-Architektur als eine neue Generation und erklärte, sie befinde sich im Training; das einzige veröffentlichte Artefakt, das diese Architektur beschreibt, ist Qwen3.8-Flash-Next, Ende August 2026 als Open Source freigegeben und auf seiner eigenen Model Card als Vorschau auf das Qwen 4-Design gekennzeichnet. Es ist ein Hauptmodell mit 125 Milliarden Parametern, wobei 51 Milliarden Parameter auf N-Gramm-Embeddings entfallen und pro Schritt etwa 6 Milliarden aktivieren, mit QSA-Sparse-Attention, gated Residuals und einem nativen Kontext von 262.000 Token, der auf bis zu 1 Million erweiterbar ist.
Wenn dieses Design bis zur Max-Stufe skaliert, sollte die Anzahl der aktiven Parameter im Bereich mehrerer Zehn Milliarden bleiben, statt in Richtung von DeepSeeks Gesamtzahl zu steigen – den Rechenaufwand pro Schritt ungefähr konstant zu halten, während die Gesamtparameterzahl wächst, ist der eigentliche Sinn von QSA und von N-Gramm-Embeddings, die nachgeschlagen statt dicht berechnet werden. Das ist eine Richtung und keine Spezifikation, und es sollte nicht als Spezifikation ausgegeben werden.
Was jetzt erkennbar ist, ist die operative Asymmetrie. Ein Modell, das existiert, kann anhand Ihrer Workload gemessen werden; ein Modell, das nicht existiert, kann an nichts gemessen werden. Qwen 4 Max ist, sobald es erscheint, über die eigene API des Anbieters und mehrere Drittanbieter-Plattformen erreichbar – derselbe Weg, den jedes Alibaba-Flaggschiff genommen hat. Auf OrcaRouter ist es heute nicht vertreten: Der Katalog weist null Einträge für die Qwen-4-Familie auf. DeepSeek V4 Pro ist jetzt auf OrcaRouter verfügbar, und ebenso ein datierter Snapshot davon.
Reproduzierbarkeit ist das Argument, das niemand vorbringt
DeepSeek liefert datierte Snapshots aus und hält sie adressierbar. Der Katalog enthält sowohl den schwebenden DeepSeek V4 Pro-Bezeichner als auch eine gepinnte Variante vom 2026-08-13 – wobei dieses Datum der Build ist, den DeepSeek selbst als General-Availability-Release festgelegt hat. Das ist unspektakulär und für alle, die eine Evaluierungs-Harness oder eine compliance-kontrollierte Pipeline betreiben, wichtiger als ein Benchmark-Delta: Wenn Sie den Snapshot pinnen, misst Ihre Regressionssuite Ihren Code und nicht die Release-Kadenz des Anbieters.
Die Qwen-3.8-Generation hat dasselbe getan – im selben Katalog gibt es neben dem schwebenden Namen einen datierten Qwen3.8-Max-Snapshot – und es gibt keinen Grund anzunehmen, dass Alibaba damit aufhören wird. Aber das ist eine Eigenschaft ausgelieferter Modelle, und es lohnt sich, klar zu sagen: An dem Tag, an dem Qwen 4 Max angekündigt wird, wird es keinen Snapshot zum Fixieren geben, keine stabile Kennung zum Testen und keine Möglichkeit, mit den eigenen Daten einen Vorher-nachher-Vergleich durchzuführen. Welchen Vergleich Sie auch immer anstellen möchten – Sie werden ihn später anstellen.

Beides ausführen, ohne zwei Stacks laufen zu lassen
OrcaRouter leitet DeepSeek V4 Pro als deepseek/deepseek-v4-pro weiter – zu 0,66 $ pro Million Input-Tokens und 1,98 $ pro Million Output-Tokens, was DeepSeeks eigener Off-Peak-Listenpreis ist, der mit 0 % Aufschlag durchgereicht wird. Der letzte Punkt wiegt hier mehr als anderswo in diesem Stapel, denn 1,98 $ für den Output liegen bereits nahe an der Untergrenze für ein Modell der Frontier-Klasse: Selbst eine Plattformmarge von zehn Prozent wäre ein Fünftel der Differenz zwischen diesem Modell und einer Alternative der mittleren Klasse, und bei 0 % Aufschlag ist der Tarif, den Sie auf der Seite sehen, der Tarif, den DeepSeek veröffentlicht – einschließlich der Aufteilung in Peak und Off-Peak, die nach demselben Zeitplan durchgereicht wird, statt zu einem einheitlichen Tarif gemittelt zu werden.
Derselbe Endpunkt führt die Qwen-3.8-Familie — Qwen3.8-Max, Qwen3.8-Flash und Qwen3.8-27B — neben DeepSeek V4 Pro auf einer einzigen OpenAI-kompatiblen API mit knapp 200 Modellen, mit automatischem Failover, wenn ein Provider-Pfad degradiert, und einer Routing-DSL, mit der sich die Auswahl explizit treffen lässt, statt sie fest zu verdrahten. Wenn DeepSeek den Preis senkt, landet die Änderung noch am selben Tag auf deinem Key, weil es keine Margenebene gibt, hinter der eine Senkung hängen bleiben könnte. Wenn eine Qwen-4-Stufe erscheint, ist derselbe Katalog der Ort, an dem sie auftauchen würde.
Wo dich das hinstellt
DeepSeek V4 Pro gewinnt diesen Vergleich kampflos, und es lohnt sich, genau zu sagen, warum, statt es schönzureden. Es ist auf beiden Achsen um etwa den Faktor drei günstiger, aktiviert pro Token fünfmal so viele Parameter, sein Kontextfenster ist gleich groß, und es hat einen datierten Snapshot, den man pinnen kann. Qwen 4 Max hat einen Tier-Namen und einen Konferenz-Slot.
Der Vergleich, der tatsächlich live ist, lautet DeepSeek V4 Pro gegen Qwen3.8-Max, und er ist ein echter Schlagabtausch statt einer Abfuhr: DeepSeek ist ein reines Textmodell zu etwa einem Drittel des Preises, mit unter MIT veröffentlichten Gewichten und einem schlankeren Aktivierungsprofil pro Token, und Qwens Flaggschiff nimmt Bild- und Videoeingaben für 2,00 $ und 6,00 $ entgegen. Entscheide anhand der Modalität und der gemessenen Kosten pro erledigter Aufgabe, nicht anhand von Parameterzahlen, und führe den Vergleich erneut durch, wenn Alibaba eine Modellkarte veröffentlicht — dann wird die interessante Frage sein, ob Qwen 4 Max für seine multimodale Fähigkeit einen geringeren Aufschlag auf DeepSeeks Texttarif verlangt als heute.

In diesem Artikel verglichen3
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
