Eine Hero-Titelkarte für ‚Qwen3.8-Max vs Qwen 3.8‘ mit dem Untertitel ‚Ein 2,4T-Kern – gemietete API oder offene Gewichte‘, Abzeichen für das 0902-Refresh vom 2. September 2026, die gehostete API zu 2 $/6 $ pro 1 M Token und die offenen Gewichte vom 12. August sowie eine Fußzeile, die die unabhängige Code-Arena-WebDev-#1-Platzierung mit 1.691 für den 0902-Build vermerkt und dass der offene Checkpoint noch keine unabhängigen Ergebnisse vorweisen kann.
Guides & Insights

Qwen3.8-Max vs Qwen 3.8: Ein 2.4T-Kern, gemietet oder selbst betrieben — Nach dem 0902-Refresh

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Am 2. September 2026 veröffentlichte Alibaba eine datierte Aktualisierung von Qwen3.8-Max — den Build, den es als Qwen3.8-Max-0902 bezeichnet — und eine unabhängige Coding-Bestenliste stufte den neuen Snapshot noch in derselben Woche auf Platz 1 ein. Die herunterladbare Version desselben Kerns mit 2,4 Billionen Parametern — das Modell, das die meisten meinen, wenn sie „Qwen 3.8“ ohne Suffix schreiben — steht weiterhin auf dem Checkpoint vom 12. August: nur Text, Reasoning fest eingeschaltet und Hunderte Gigabyte davon entfernt, auf irgendetwas kleinerem als einem GPU-Rack lauffähig zu sein. Diese Kluft zwischen dem gehosteten Flaggschiff und den offenen Gewichten gab es im August noch nicht. Sie macht jetzt den gesamten Vergleich aus, und sie ist der Grund, warum Ihnen dasselbe Modell weiterhin unter zwei Namen verkauft wird.

Qwen3.8-Max ist Alibabas gehostetes Flaggschiff: ein sparse Mixture-of-Experts-Modell mit 2,4 Billionen Parametern, bei dem pro Token etwa 95 Milliarden Parameter aktiv sind, seit dem 3. August über eine kostenpflichtige API verfügbar und mit einem multimodalen Kontextfenster von 1 Million Token. Qwen 3.8 als eigenständiger Name ist das Open-Release derselben Generation – am bedeutendsten Qwen3.8-2.4T-A95B, dessen Gewichte Alibaba am 12. August unter einer eigenen Lizenz veröffentlichte. Es handelt sich nicht um ein günstigeres und ein Premium-Geschwistermodell. Es ist dasselbe Gehirn, das auf zwei Arten verkauft wird, und ein Post-Training-Durchgang im September hat begonnen, die beiden Ausführungen auseinanderzubringen. Dieser Artikel klärt, welche „Qwen 3.8“ Sie tatsächlich vor sich haben, was das 0902-Update geändert hat und welchen Weg Sie heute gehen sollten – die API mieten oder die Gewichte ausführen.

Die Paarung, die keine Rivalität ist

Vor den Daten und den Preislisten: die Architektur. Qwen3.8-Max und Qwen3.8-2.4T-A95B teilen sich ein feinkörniges MoE-Design mit 512 Experten pro Schicht (10 geroutete plus ein gemeinsamer), 92 Schichten und einem Hybrid-Stack, bei dem 69 der 92 Schichten lineare Attention verwenden – Gated DeltaNet kombiniert mit gated Attention –, mit zwischengeschalteter Full Attention für die Arbeit mit langen Kontexten. Deshalb kann die Modellkarte auf der API den Kontext von einer Million Token beanspruchen, und deshalb kommt der offene Build nativ auf 262K, das sich mit der richtigen Serving-Konfiguration in Richtung einer Million erweitern lässt. Die Unterschiede zwischen den beiden Namen liegen nicht in der Architektur der Gewichte; sie liegen an den Rändern – und die Ränder haben sich seit dem 2. September verschoben.

• Parameter — Qwen3.8-Max: 2,4 Billionen gesamt / ~95 Mrd. aktiv, MoE. Qwen3.8-2.4T-A95B: gleicher Kern, gleiche Anzahl aktiver Parameter.

• Bereitstellung — Qwen3.8-Max: gehostete API, live seit dem 3. August, aktualisiert als Qwen3.8-Max-0902 am 2. September. Qwen3.8-2.4T-A95B: herunterladbare Gewichte, erstmals veröffentlicht am 12. August, seitdem kein neuerer Checkpoint.

• Modalität — Qwen3.8-Max: Text-, Bild- und Videoeingabe. Qwen3.8-2.4T-A95B: nur Text.

• Reasoning-Steuerung — Qwen3.8-Max: Denkmodus umschaltbar, einschließlich eines Nicht-Denk-Modus. Qwen3.8-2.4T-A95B: Denken immer aktiv, nur mit einem Reasoning-Aufwand-Regler (niedrig / hoch / extra hoch).

• Werkzeuge — Qwen3.8-Max: native Funktionsaufrufe, fünf integrierte Werkzeuge und strukturierte Ausgaben. Qwen3.8-2.4T-A95B: keine native Werkzeugschicht; der Funktionsumfang hängt vom Inferenz-Framework ab, auf dem das Modell läuft.

Was die Aktualisierung vom 2. September geändert hat

Der 0902-Build ist ein nachgelagerter Trainingsdurchgang, keine neue Architektur. Alibaba hat ihn auf die beiden Dinge ausgerichtet, für die Qwen3.8-Max bereits bekannt war – Coding und „Cowork“, seine Bezeichnung für langfristig angelegte agentische und Büroarbeit –, und die Zahlen, die sich darum herum ansiedelten, sind der Grund, warum diese Aktualisierung von Bedeutung ist. Auf der unabhängigen Code-Arena: WebDev-Bestenliste debütierte Qwen3.8-Max-0902 mit 1.691 Elo-Punkten, einem Sprung von 22 Punkten gegenüber dem vorherigen Build – genug, um bei der Ankunft den ersten Platz zu belegen. Alibaba bezeichnet den Build außerdem als das Modell mit der höchsten Punktzahl auf der Kosten-Leistungs-Pareto-Grenze dieser Bestenliste, bei einem Mischpreis von etwa 5 US-Dollar pro Million Tokens – der Listenpreis von 2 und 6 US-Dollar, gewichtet nach ausgabestarkem agentischem Traffic, also etwa ein Viertel dessen, was ein vergleichbarer Aufruf eines Frontier-Modells anderswo kostet. Diese Zahlen sind eine Mischung, die der Leser auseinanderhalten sollte: Die 1.691 Elo sind das Ergebnis einer unabhängigen Arena; die Pareto-Grenz-Darstellung ist Alibabas eigene Charakterisierung dieser unabhängigen Bestenliste.

Alibabas interne Bewertungen für den 0902-Durchlauf, vom Anbieter gemeldet und nicht reproduziert, zeigen dieselbe Richtung: Terminal-Bench 3.0 steigt von 11,3 auf 29,0, ProgramBench von 10,5 auf 28,0, JobBench von 53,4 auf 64,0 und WorkArena-Elo von 1.348 auf 1.468. Lesen Sie diese Werte als „das Update hat die agentischen und Coding-Achsen verschoben“, nicht als verifizierte Ergebnisse. Im Bereich der allgemeinen Intelligenz liegt Qwen3.8-Max im Intelligence Index von Artificial Analysis bei 56 – konkurrenzfähig, aber nicht der Grund, danach zu greifen; die Coding- und Agentic-Ergebnisse sind es.

Das, was der Großteil der Berichterstattung übersehen hat, ist, dass das 0902-Post-Training zum Zeitpunkt dieses Schreibens nur über die API erhältlich ist. Alibaba hat keinen offenen Checkpoint des aktualisierten Modells veröffentlicht – die Qwen3.8-2.4T-A95B-Gewichte auf Hugging Face stammen weiterhin vom 12. August. Das bedeutet, dass das gehostete Qwen3.8-Max und der herunterladbare Kern nicht mehr dasselbe Modell sind, wie sie es Mitte August waren. Die API hat das September-Post-Training; die Gewichte nicht. Wenn Ihr einziger Grund, die offene Version auszuführen, darin bestand, exakt das zu reproduzieren, was das Flaggschiff tut, dann ist diese Annahme seit dem 2. September leise nicht mehr wahr.

A comparison scoreboard for Qwen3.8-Max (0902) and Qwen 3.8 (2.4T-A95B open): left column shows Hosted API with a Sep-2 build tag, Text + image + video, 1M native context, a thinking toggle including off, native tools and JSON, and $2/$6 per 1M with a $0.25 cache tag; right column shows Open weights with an Aug-12 tag, Text only, 262K native context, thinking always on, framework-level tools and JSON, and weights plus your own GPUs; the footer notes independent Code Arena WebDev 1,691 and AA Index 56 for the Max, and that the open checkpoint has no independent scores yet.

Die fünf Punkte, an denen sie wirklich voneinander abweichen

Stellt man die gemeinsame Architektur beiseite, ergeben sich die praktischen Unterschiede klar. Modalität ist der erste Filter: Wenn Ihre Arbeitslast Bilder oder Videos umfasst – Screenshots, Diagramme, Dokumente mit Abbildungen, Videoframes –, nimmt nur Qwen3.8-Max sie an, und sein 1M-Token-Fenster ist nativ, nicht erweitert. Die offenen Gewichte sind rein textbasiert. Reasoning-Steuerung ist der zweite Filter: Die gehostete API kann mit deaktiviertem Denken laufen, was für latenzsensible und hochvolumige Extraktion wichtig ist, bei der eine Gedankenkette reiner Overhead ist; der offene Build kann es nicht abschalten. Tooling ist der dritte Filter: Funktionsaufrufe, die fünf integrierten Tools und der JSON-Modus gehören zum gehosteten Produkt, während der offene Build davon abhängt, was Ihre Serving-Schicht bereitstellt.

Der Kontext ist subtiler, als es das Datenblatt vermuten lässt. Beide Seiten können grob eine Million Token erreichen – aber das gehostete Modell schafft das nativ mit multimodaler Eingabe, während der native Kontext des offenen Builds (262K) erst in der Konfiguration erweitert werden muss, und jedes Token in diesem erweiterten Fenster ist Text. Auch die Ausgabelimits unterscheiden sich: Die API erlaubt bis zu etwa 131K Ausgabe-Token, und der offene Build ist üblicherweise auf ein ähnliches Limit konfiguriert – aber die praktische Obergrenze auf der offenen Seite wird durch deinen Serving-Stack bestimmt, nicht durch das Modell.

Was jede Route tatsächlich kostet

Hier endet die Vergleichbarkeit der beiden Bereitstellungen völlig. Qwen3.8-Max hat einen Listenpreis: 2,00 $ pro Million Eingabe-Tokens, 6,00 $ pro Million Ausgabe-Tokens und 0,25 $ pro Million für gecachte Eingaben. Da OrcaRouter die Listenpreise der Anbieter mit 0 % Aufschlag durchreicht, zahlen Sie hier genau diesen Satz, und wenn Alibaba ihn ändert, ist der neue Wert am selben Tag live. Der 0902-Snapshot ist separat als qwen/qwen3.8-max-0902 fixiert, für Teams, die reproduzierbares Verhalten wünschen – gleicher Preis, gleiche Fähigkeiten, aber ein fester Prüfpunkt anstelle des fortlaufend aktualisierten Modells. Im OrcaRouter-Verkehr liegt der 7-Tage-Medianwert für die Zeit bis zum ersten Token bei Qwen3.8-Max bei ungefähr 2–4 Sekunden, und Artificial Analysis misst etwa 45–48 Ausgabe-Tokens pro Sekunde: nicht langsam, aber ausführlich, weshalb agentische Aufgaben mit diesem Modell trotz des günstigen Preises überraschend hohe Token-Zahlen verbrauchen können.

A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max), showing the flagship description, the price card at $2.00 per 1M input and $6.00 per 1M output tokens, a 1,000,000-token context window, and 7-day median time-to-first-token and traffic figures.

Qwen3.8-2.4T-A95B hat keinen Listenpreis, denn der Preis ist Ihre Infrastruktur. Die BF16-Gewichte umfassen etwa 4,9 TB, und selbst der offizielle FP8-Build liegt bei rund 2,4 TB – das ist also Hardware im Rack-Maßstab: Die kleinsten dokumentierten Serving-Konfigurationen beginnen bei etwa acht B300- oder GB300-GPUs, und ein vollständiges GB300-NVL72-Rack ist die Referenzbereitstellung. Aggressive Quantisierung ändert die Untergrenze – ein NVFP4-Build passt in etwa 1,3 TB, und Unsloths 1-Bit-Schichtquantisierung komprimiert das Modell auf rund 397 GB, was schließlich einen einzelnen gut ausgestatteten Knoten möglich macht – aber jeder dieser Wege setzt voraus, dass Sie GPUs im Rechenzentrumsmaßstab betreiben. Drittanbieter-Hosts, die den offenen Checkpoint anbieten, verkaufen Ihnen Token unter dem Preis pro Token des Max, aber Sie geben dabei die multimodale Eingabe, den Nicht-Denkmodus, die native Tool-Unterstützung und das 0902-Post-Training auf, und es wurde noch kein unabhängiger Benchmark dieses herunterladbaren Checkpoints selbst veröffentlicht. Alibabas eigene Modellkarte ist offen über das Verhältnis: Sie beschreibt Qwen3.8-Max als die offizielle Version, die auf Qwen3.8-2.4T-A95B basiert, und zusätzlich zum offenen Kern Bildeingabe, Unterstützung für den Nicht-Denkmodus, einen standardmäßigen 1M-Kontext und integrierte Tools hinzufügt.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-2.4T-A95B, showing the Text Generation and Transformers tags and the card text explaining that Qwen3.8-Max is the official version built on Qwen3.8-2.4T-A95B with vision input, non-thinking support, a 1M default context, and built-in tools.

Unabhängige Zahlen versus Anbieterangaben

Die Ehrlichkeit der Quellenlage ist hier wichtiger als bei den meisten Vergleichen, weil die beiden Seiten über sehr unterschiedlich alte Belege verfügen. Qwen3.8-Max wurde unabhängig bewertet: Das Code-Arena-WebDev-Ergebnis von 1.691 für den Build 0902 und der Intelligence Index von 56 von Artificial Analysis sind Messungen Dritter, und die Preisgestaltung, die die Pareto-Frontier-Behauptung interessant macht, ist eine veröffentlichte Preistabelle. Qwen3.8-2.4T-A95B hat das noch nicht vorzuweisen — die von Alibaba veröffentlichte Benchmark-Tabelle beschreibt den Kern der Max-Klasse, nicht einen unabhängigen Lauf des herunterladbaren Checkpoints. Die offene Seite dieses Vergleichs beruht also noch weitgehend auf Herstellerangaben dazu, wie der Kern abschneidet. Wenn Sie sich auf Basis der Leistungsfähigkeit zwischen ihnen entscheiden, behandeln Sie die Spitzenwerte der offenen Gewichte bis zu einem unabhängigen Test durch Dritte als Behauptungen.

Wer sollte welche auswählen?

Die Entscheidung ergibt sich aus der obigen Liste. Greifen Sie zum gehosteten Qwen3.8-Max — heute konkret zum 0902-Build — wenn Sie das September-Post-Training, Bild- oder Videoeingabe, einen Nicht-Denkmodus, native Tools und strukturierte Ausgabe oder ein Million-Token-Fenster benötigen, ohne Infrastruktur aufzubauen. Das ist die Spitzenposition bei Coding- und Agentic-Aufgaben, und bei 2 $/6 $ mit 0,25 $ für gecachten Input ist es für das, was es ist, aggressiv bepreist.

Wählen Sie Qwen3.8-2.4T-A95B, wenn Kontrolle vor Bequemlichkeit geht: Sie benötigen die Gewichte auf Ihrer eigenen Hardware oder bei einem Anbieter, den Sie bereits betreiben; Sie möchten einen festen Checkpoint, den Sie prüfen und reproduzieren können; oder Ihr dauerhaftes Volumen macht die Kosten pro Token zum dominierenden Faktor, und Sie sind bereit, ein 2,4-T-MoE zu betreiben. Akzeptieren Sie die Kompromissliste — nur Text, Denken immer aktiv, keine native Tool-Anbindung, noch kein 0902-Post-Training — und prüfen Sie die Lizenzbedingungen für Ihre Umsatzklasse, denn die kundenspezifische Qwen3.8-Max-Lizenz ist nicht Apache 2.0 und enthält zusätzliche Bedingungen für große kommerzielle Betreiber.

Wenn Ihre Arbeitslast ein hohes Volumen, eine einzelne GPU oder eine hohe Latenzempfindlichkeit aufweist, ist keiner von diesen möglicherweise die richtige Spur — das Schwestermodell der Generation mit 27 Milliarden Parametern, Qwen3.8-27B, ist genau dafür dimensioniert und wird separat in unserem Qwen3.8-27B-vs.-Qwen3.8-Max-Vergleich behandelt.

Wie Sie beides ausprobieren, ohne alles aufs Spiel zu setzen.

Der saubere Weg, diese Entscheidung zu treffen, besteht darin, beide Seiten mit eigenen Prompts laufen zu lassen – und genau hier beweist eine Routing-Ebene ihren Wert, anstatt nur nachträglich aufgesetzt zu werden. Qwen3.8-Max und der festgepinnte Qwen3.8-Max-0902-Snapshot liegen beide hinter einem einzigen OpenAI-kompatiblen Endpunkt auf OrcaRouter, sodass der Wechsel zwischen dem fortlaufend aktualisierten Flaggschiff und dem reproduzierbaren Checkpoint eine Änderung der Modell-ID ist – kein Redeployment. Wenn ein Team die offenen Gewichte ins eigene Haus holen möchte, kann die Routing-DSL einem selbst gehosteten vLLM- oder SGLang-Endpunkt, der Qwen3.8-2.4T-A95B bedient, vorgeschaltet und in denselben Aufrufgraph eingebunden werden. Der Großteil des Datenverkehrs läuft dann über die eigene Bereitstellung; schwierige Prompts und multimodale Anfragen werden an das gehostete Qwen3.8-Max weitergeleitet – mit automatischem Failover zwischen beiden. Einen neuen Checkpoint auf diese Weise auszuprobieren erfordert lediglich eine Konfigurationsänderung statt einer Migration – genau das, was man braucht, wenn sich die beiden Seiten dieses Vergleichs noch mit unterschiedlicher Geschwindigkeit bewegen.

Das Fazit

Qwen3.8-Max und Qwen 3.8 sind nicht zwei Modelle, die um denselben Job konkurrieren. Sie sind ein einziger Kern mit 2,4 Billionen Parametern, der als gemietete API und als herunterladbare Gewichte ausgeliefert wird – und das Update vom 2. September hat dafür gesorgt, dass die beiden Auslieferungen nun Unterschiedliches bedeuten. Mietest du die API, erhältst du das 0902-Post-Training, das die Führung in der Code Arena: WebDev übernommen hat, plus Vision, einen Modus ohne Denken, native Tooling-Unterstützung und ein natives Fenster von einer Million Tokens – für 2$/6$ mit 0,25$ für gecachten Input. Wenn du die offenen Gewichte ausführst, erhältst du dieselbe Architektur, eingefroren im Stand vom 12. August – nur Text, Reasoning fest aktiviert – ohne eigenständige Bewertungen bisher und mit einer Hardware-Rechnung für das Rechenzentrum. Wenn dir die Coding- und Agentic-Fortschritte von September wichtig sind, hat heute nur einer der beiden Namen sie. Wenn dir reproduzierbare Kontrolle wichtiger ist, gehört nur einer der beiden Namen dir.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert