Eine Hero-Titelkarte für „Qwen3.8-Max vs. Qwen3.7-Max“ mit dem Untertitel „Zwei Max-Stufen, 16 Indexpunkte und eine Promo, die den Preis umkehrt“, und einer Fußzeile, die darauf hinweist, dass die Qwen3.8-Max-Zahlen aus Alibabas Offenlegung vom 22. September 2026 und von Artificial Analysis stammen, während die Qwen3.7-Max-Zahlen von Artificial Analysis stammen.
Guides & Insights

Qwen3.8-Max vs. Qwen3.7-Max: Zwei Max-Stufen, 16 Indexpunkte und eine Aktion, die den Preis umkehrt

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Vor vier Tagen teilte uns der Anbieter mit, dass Qwen3.8-Maxnicht das Modell ist, das im August ausgeliefert wurde. In einer Pressemitteilung vom 22. September 2026, die von der Apsara-Konferenz in Hangzhou stammt, gab das Unternehmen bekannt, dass sein Flaggschiff 33 iterative Zyklen vollständig automatisierter Trainings- und Post-Training-Arbeit über mehr als einen Monat hinweg durchlief und dass der daraus resultierende Build seinen Artificial Analysis Intelligence Index von 40 auf 45 anhob. Die Modell-ID änderte sich nie. Die Zahl dahinter schon.

Am wichtigsten ist das an einer ganz bestimmten Stelle: dem Vergleich zwischen Qwen3.8-Max und Qwen3.7-Max, dem Max-Tier, das es ersetzt hat. Qwen3.8-Max erreichte die allgemeine Verfügbarkeit am 3. August 2026; Qwen3.7-Max erschien im Mai. Auf dem Papier wirkt das wie eine einfache Generationenentscheidung – neueres Flaggschiff, höhere Punktzahl, weiter geht’s. Die Zahlen sagen etwas Unangenehmeres. Das ältere Tier ist drei- bis viermal schneller, rund fünfmal günstiger pro abgeschlossener Aufgabe und bei reinen Wissens-Benchmarks identisch mit dem neueren. Das neuere Tier ist multimodal, dramatisch besser bei agentischen Arbeiten und günstiger auf der internationalen Preisliste. Welches man aufrufen sollte, hängt von einer Frage ab, die die meisten Vergleiche auslassen: ob man Wissen kauft oder Tool-Aufrufe.

Was die Apsara-Offenlegung tatsächlich behauptet

Die Offenlegung ist eine Anbietererklärung, die von Alibaba auf seiner eigenen Presseseite veröffentlicht wurde, und sie sollte als solche gelesen werden. Was darin steht, ist konkret: Über einen Monat vollautomatischer Durchläufe, die Pipelinedesign, Datenvalidierung, iterative Experimente und Fehlerdiagnose umfassten, absolvierte Qwen3.8-Max 33 Zyklen, und autonome Trainingsoptimierung plus Post-Training-Techniken führten zu der Punktveränderung. Alibaba beschrieb außerdem ein zweites Experiment im Chipdesign, bei dem das Modell über 60 Stunden Selbstverbesserung über einen Design-Lebenszyklus hinweg durchführte, mehr als 10.000 EDA-Tool-Aufrufe tätigte und produktionstaugliche Chip-Bus-Module erzeugte, während es die Chipfläche um 42 % reduzierte, ohne dass eine Leistungseinbuße angegeben wurde. All das ist Alibabas Darstellung seines eigenen Modells, die von niemandem außerhalb des Unternehmens reproduziert wurde.

Die Score-Bewegung selbst ist jedoch keine Anbieterbehauptung. Der Index stammt von Artificial Analysis, und die 45 steht auf der Qwen3.8 Max (0902)-Seite dieses Dritten. Die 40, von der sie sich wegbewegte, steht auf der Seite derselben Organisation für den Build vom 3. August, der inzwischen als veraltet markiert ist und auf den aktuellen vorausweist. Die Differenz ist also eine vom Anbieter berichtete Ursache, die an einen unabhängig bewerteten Effekt geknüpft ist, was eine stärkere Position ist als jeder der beiden Teile allein. Sie ist außerdem zum jetzigen Zeitpunkt der konkreteste öffentliche Beleg, den irgendjemand dafür hat, dass ein Frontier-Labor die gemessene Leistungsfähigkeit seines Flaggschiffs verändert hat, ohne eine neue Versionsnummer auszuliefern.

Zwei weitere Dinge an der Veröffentlichung sind leicht zu übersehen, und beide sind tragend. Erstens bestätigte Alibaba, dass Qwen 4 sich im Training befindet, wobei die Qwen-4.5- und Qwen-5-Serien voraussichtlich auf 5–10 Billionen Parameter skalieren sollen. Zweitens gibt es eine datierte Momentaufnahme des überarbeiteten Modells. Alibaba hat den nachtrainierten Build als qwen3.8-max-0902 am 2. September festgelegt, und er ist separat routbar. Diese Festlegung ist die praktische Antwort auf alles, was die RSI-Offenlegung impliziert, und wir werden darauf zurückkommen.

Die Anzeigetafel

Sechs Dimensionen, beide Seiten, wobei die Belegdisziplin explizit bleibt – die beiden Seiten sind nicht gleichermaßen verifiziert.

• Kontextfenster — Qwen3.8-Max 1.000.000 Token vs. Qwen3.7-Max 1.000.000 Token (identisch)

• Maximale Ausgabe — 131.072 Token gegenüber 131.072 Token laut Alibabas eigenen Modellseiten (identisch; beachten Sie, dass unsere Katalogseite für Qwen3.7-Max 64.000 angibt – eine Abweichung, die wir benennen, statt sie zu beschönigen)

• Eingabemodalität — Text, Bild und Video vs. nur Text

• Internationaler Listenpreis pro 1 Mio. Tokens — $2,00 Eingabe / $6,00 Ausgabe gegenüber $2,50 Eingabe / $7,50 Ausgabe; dieselbe Preisliste berechnet beiden Modellen bereits $1,65 / $4,951 in Peking, Frankfurt und Virginia

• Artificial Analysis Intelligence Index — 45 vs. 29

• Unabhängige Ausgabegeschwindigkeit — 39,7 Tokens/Sek. vs. 211,3 Tokens/Sek., gemessen an derselben Vergleichsklasse von 211 Modellen, wobei Artificial Analysis die neuere Stufe als deutlich langsam und die ältere als deutlich schnell einstuft

Die letzten beiden Zeilen sind der ganze Artikel. In derselben Indexfamilie liegt die neuere Stufe 16 Punkte vorn. Bei der Geschwindigkeit liegt sie mehr als fünfmal zurück.

A two-column comparison scoreboard: left column 'Qwen3.8-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text / image / video, International price per 1M $2.00 / $6.00, AA Intelligence Index 45 and Output speed 39.7 tok/s; right column 'Qwen3.7-Max' lists Context window 1,000,000 tokens, Max output 131,072 tokens, Input text only, International price per 1M $2.50 / $7.50, AA Intelligence Index 29 and Output speed 211.3 tok/s; a footer credits Alibaba's 22 Sep 2026 disclosure and Artificial Analysis.

Woher die 16 Punkte kommen — und woher nicht

Zerlegt man den Index in seine Bestandteile, wird die Gestalt des Upgrades klar, und sie entspricht nicht der Gestalt, die das Marketing suggeriert.

Bei Wissen und Schlussfolgern sind die beiden Modelle praktisch gleichauf. GPQA Diamond: 92,8 vs. 92,3. Humanity's Last Exam: 43,1 vs. 40,5. Langkontext-Rückruf: 80,33 vs. 79. SciCode: 52,1 vs. 49,5. Wenn Ihre Arbeitslast darin besteht, Fragen über einen großen Korpus zu beantworten, ist der Generationssprung ein Rundungsfehler. Dafür ein Vielfaches zu zahlen, wäre schwer zu rechtfertigen.

Bei agentischer Arbeit und Coding-Aufgaben klafft die Lücke deutlich. Terminal-Bench 2.1: 88,76 vs. 74,53. Der Coding-Index von Artificial Analysis: 76,2 vs. 66. Und die größte Abweichung im Set ist die Banking-Tool-Use-Aufgabe, bei der Qwen3.8-Max 47,84 gegenüber Qwen3.7-Max mit 11,75 verzeichnet – eine vierfache Lücke genau bei der Fähigkeit, die laut RSI-Beschreibung die automatisierten Zyklen optimierten: Pipeline-Design, Datenvalidierung, iteratives Experimentieren, Fehlerdiagnose. Ein Modell, das einen Monat damit verbringt, seine eigene Trainingsschleife zu verbessern, ist ein Modell, das besser in Schleifen geworden ist.

Ein ehrlicher Vorbehalt zu diesen einzelnen Zeilen. Beide Modellseiten gehören derselben Revisionsfamilie des Intelligence Index an (v4.3 und v4.3.2), was den Vergleich der Schlagzeile 45 gegen 29 zu einem fairen macht. Die Zeilen pro Benchmark sind nicht aus derselben Kohorte: Die Werte auf Aufgabenebene von Qwen3.7-Max stammen aus dem Mai-Evaluierungsfenster, während die von Qwen3.8-Max aus der September-Reihe stammen. Lesen Sie die Richtung der Entwicklung, nicht die dritte signifikante Stelle.

Die Preisfrage besteht aus zwei Fragen.

Auf Alibabas internationaler Preisliste ist das neuere Max günstiger als das, was es ersetzt hat: $2.00 / $6.00 für Qwen3.8-Max gegenüber $2.50 / $7.50 für Qwen3.7-Max, pro Million Token. Eine Senkung um 20 % in beide Richtungen mit fortschreitender Generation ist ungewöhnlich und für sich genommen bemerkenswert. Auch die Cache-Ökonomie begünstigt die neuere Stufe – impliziter Cache bei $0.25 gegenüber $0.50, explizites Cache-Lesen bei $0.17 gegenüber $0.25.

Das ist die erste Frage, und sie hat eine regionale Antwort, die die meisten Berichte einebnen. Alibaba berechnet für beide Modelle 1,65 $ Eingabe / 4,951 $ Ausgabe in Peking, Frankfurt und Virginia. Die 20%-Lücke existiert nur auf der internationalen Karte für Singapur. Wenn Ihr Traffic in den anderen drei Regionen landet, kosten Eingabe- und Ausgabe-Tokens heute bei beiden Max-Stufen gleich viel, und die Entscheidung reduziert sich auf die reine Leistungsfähigkeit – und dann gewinnt das neuere Modell bei allem außer dem Durchsatz, und es bleibt keine Rechnerei mehr übrig.

Die zweite Frage ist die Falle. Qwen3.7-Max kostet derzeit nicht 2,50 $ / 7,50 $. Der Preis liegt bei 1,25 $ / 3,75 $ — halber Listenpreis, ein Aktionspreis. Das macht die Preisklasse der vorherigen Generation heute zur günstigeren Option, und zwar mit großem Abstand. Es bedeutet außerdem, dass der Preis, den man diese Woche messen kann, nicht der Preis ist, auf den man sich festlegen würde. Alibabas eigene Modellseite erklärt unmissverständlich, dass die veröffentlichte Tabelle die ursprüngliche Preisgestaltung „ohne zeitlich begrenzte Aktionen“ zeigt, und verweist für aktuelle Angebote auf die Konsole. Ein Aktionsangebot ist konstruktionsbedingt ein Tarif, der enden kann. Wenn das geschieht, wird Qwen3.7-Max nicht bloß teurer als heute; es wird 25 % teurer als das Modell, das es übertrifft.

Wir geben den Anbietertarif mit 0 % Aufschlag weiter, sodass sowohl der Listenpreis als auch die Aktion bei uns am selben Tag live sind, an dem sie sich ändern – was für einen Vergleich praktisch ist und wenig hilfreich, wenn man versucht, ein Budget aufzustellen. Baue das Modell auf Basis der Listenkarte und behandle den Aktionspreis als Aufwärtspotenzial.

A screenshot of Alibaba Cloud Model Studio's 'Recommended models' documentation overview page, showing the console navigation on the left, the line 'Alibaba Cloud Model Studio offers Qwen and third-party models for text, image, audio, and video.', an 'Updated at: 2026-09-24 20:17:58' stamp, and category cards covering Text generation (listing qwen3.8-max and qwen3.7), Image & video, World models, and Audio & speech.

Die Zahl, die das Kostenargument umkehrt

Der Token-Preis ist nicht das, was eine Aufgabe kostet. Artificial Analysis veröffentlicht eine Kennzahl für die Kosten pro Aufgabe, die Cache-Ökonomie, Reasoning-Umfang und Antwortlänge einbezieht, und gemessen daran kehrt sich das Ranking vollständig um: 5,41 $ pro Intelligence-Index-Aufgabe für Qwen3.8-Max gegenüber 1,15 $ für Qwen3.7-Max. Ein Aufschlag von 4,7×, gegenüber einem Token-Preis, der je nach Region entweder 20 % günstiger oder identisch ist.

Der Unterschied besteht überwiegend in der Weitschweifigkeit. In derselben Evaluation erzeugte das neuere Modell 190 Mio. Ausgabe-Token gegenüber den 120 Mio. des älteren Modells, und es denkt ausführlich nach, um zu seinen Antworten zu gelangen. Wenn Sie pro Ausgabe-Token für eine Arbeitslast mit hohem Volumen und mittlerem Schwierigkeitsgrad bezahlen, ist das neuere Max bei keinem Tokenpreis auf einer der beiden Preislisten das günstigere Modell. Es ist das teurere, und der Token-Listenpreis ist das falsche Instrument, um darüber zu entscheiden.

Geschwindigkeit – und was unser eigener Traffic zeigt

Die Durchsatzlücke ist groß genug, um Architekturen zu ändern. Artificial Analysis verortet Qwen3.8-Max bei 39,7 Token pro Sekunde — die Zusammenfassung nennt das Modell bemerkenswert langsam — gegenüber 211,3 für Qwen3.7-Max, das dort als bemerkenswert schnell bezeichnet wird. Das ist der Unterschied zwischen einem Modell, das man hinter eine interaktive Oberfläche stellt, und einem, das man hinter eine Warteschlange stellt — und bei Qwen3.8-Maxist es das Erste, was unser eigenes Statistik-Panel Ihnen zeigt.

Unsere eigene Playground-Telemetrie über die sieben Tage bis zum 25. September erzählt eine etwas differenziertere Geschichte zur Latenz, und sie hat einen Haken: Dies sind unsere Messungen auf unserem Routing, kein kontrollierter Benchmark. Qwen3.8-Max zeigte einen Median von 2.611 ms bis zur ersten Antwort bei 54,7 Tokens pro Sekunde mit einer Fehlerrate von 2,45 %; der gepinnte 0902-Build zeigte einen Median von 3.360 ms bei 46,2 Tokens pro Sekunde mit einer auffallend saubereren Fehlerrate von 0,66 %. Qwen3.7-Max lag bei einem Median von 4.509 ms, aber 169,8 Tokens pro Sekunde mit einer Fehlerrate von 3,80 %. Die ältere Stufe antwortet also anfangs langsamer und streamt dann dreimal schneller, während sie häufiger fehlschlägt. Wenn Ihre Arbeitslast stoßweise ist, verdient dieser Unterschied bei der Fehlerrate mehr Aufmerksamkeit als der Median.

Beide Stufen sind zusammen mit dem fixierten Snapshot über einen einzigen OrcaRouter-Schlüssel live, mit automatischem Failover über Anbieter hinweg. Bei einem Vergleich wie diesem ist das der praktische Punkt: Ihre eigenen Prompts gegen beide Max-Generationen zu messen, ist eine Konfigurationsänderung, kein zweiter Vertrag.

A screenshot of OrcaRouter's own model page for Qwen3.7-Max (models/qwen/qwen3.7-max) in the dark theme, showing the Qwen3.7-Max heading, its model description, and the stat and price panel for the tier.

Reproduzierbarkeit ist jetzt der entscheidende Faktor.

Hier ist der Teil der Apsara-Offenlegung, den niemand eingepreist hat. Eine Live-Modell-ID, deren gemessene Leistungsfähigkeit innerhalb eines Monats von 40 auf 45 gestiegen ist, ohne Versionsänderung und ohne damalige Ankündigung, ist ein Reproduzierbarkeitsrisiko. Wenn das Verhalten Ihres Produkts eine Funktion einer sich bewegenden ID ist, haben Sie ein Modell, das sich unter einer eingefrorenen Evaluationssuite, einer zwischengespeicherten Prompt-Bibliothek oder einem freigegebenen Regressionsset verbessern – oder verschieben – kann.

Beide Generationen bieten datierte Snapshots, und das ist die Gegenmaßnahme. Qwen3.7-Max wird von Alibaba als funktional gleichwertig zu qwen3.7-max-2026-05-20 dokumentiert, mit weiteren datierten Builds vom 2026-05-17 und 2026-06-08. Qwen3.8-Max hat qwen3.8-max-0902, den nachtrainierten September-Build, worauf sich die 45 bezieht. Wenn Sie etwas ausliefern, das reproduzierbar sein muss, pinnen Sie die datierte ID und behandeln Sie die gleitende als Staging-Ziel. Die RSI-Zyklen sind ein Merkmal der gleitenden ID; das Pinning ist, wie Sie sich ihnen entziehen.

Ein Namensdetail, das man kennen sollte, damit man den Katalog nicht falsch liest. Alibaba führt eine dritte datierte Form, qwen3.8-max-2026-09-02, neben dem 0902-Alias auf; sie bezeichnen denselben Build. Das ursprüngliche Release vom 3. August ist auf unserer Seite nicht mehr routbar – wir bedienen Qwen3.8-Max, dessen 0902-Pin und Qwen3.7-Max.

Wer sollte welche auswählen?

Die Entscheidung hängt nicht davon ab, welches Modell besser ist. Sie hängt davon ab, was Sie kaufen.

Bleiben Sie bei Qwen3.7-Max, wenn Ihre Workload rein textbasiert, wissensintensiv statt tool-intensiv und durchsatzempfindlich ist – Klassifizierung, Extraktion, Long-Context-Retrieval und Batch-Zusammenfassungen in großem Umfang. Bei GPQA Diamond und beim Long-Context-Recall liegt es nur einen Punkt hinter dem neueren Modell, streamt drei- bis viermal schneller und kostet 1,15 $ pro Aufgabe statt 5,41 $. Es ist außerdem die richtige Wahl für alle, die eine günstige zweite Meinung in einer Fusions- oder Routing-Konfiguration möchten, denn zu seinem Aktionspreis liegt es in einer völlig anderen Preisklasse. Zwei Einschränkungen: Der Aktionspreis ist ein Aktionspreis, und Artificial Analysis hat das Modell bereits als veraltet gekennzeichnet, abgelöst durch Qwen3.8-Max. Gehen Sie damit keine mehrjährige Bindung ein.

Wechseln Sie zu Qwen3.8-Max, wenn einer der folgenden Punkte zutrifft: Sie benötigen Bild- oder Videoeingabe, die Qwen3.7-Max überhaupt nicht akzeptiert; Ihr Workload ist agentisch, mit langen Tool-Call-Ketten oder mehrstufigen Coding-Schleifen, wobei 88,76 gegenüber 74,53 auf Terminal-Bench 2.1 und die vierfache Tool-Nutzungslücke den Unterschied zwischen Auslieferung und Nichtauslieferung ausmachen; oder Ihre Abrechnung erfolgt nach der internationalen Preisliste für Singapur, bei der das neuere Modell einfach 20 % günstiger ist und es nichts abzuwägen gibt. Pinnen Sie qwen3.8-max-0902, wenn das Verhalten stabil bleiben soll.

Wenn Sie sich in Peking, Frankfurt oder Virginia befinden, ist die Wahl klarer, als jeder Vergleich vermuten lässt: Beide Max-Stufen kosten $1,65 / $4,951 pro Million Tokens. Identisch. Zu diesen Preisen ist es keine Entscheidung, nichts zusätzlich für multimodale Eingabe, einen um 16 Punkte höheren Index und eine viermal bessere Tool-Use-Wertung zu zahlen – es ist kostenlos – und der einzige Grund, bei Qwen3.7-Max zu bleiben, wird der reine Durchsatz.

Zwei Fragen, die es wert sind, direkt beantwortet zu werden

Bedeutet der Trainingslauf mit 33 Zyklen, dass sich das Modell unter bestehendem API-Verkehr geändert hat? Das ist es, was die Offenlegung nahelegt, und deshalb gibt es den datierten Pin. Alibaba beschreibt das verbesserte Modell als „das aktualisierte Qwen3.8-Max“, wobei es sich um die Floating-ID handelt, nicht um eine neue. Wenn Sie bis einschließlich September Workloads auf der Floating-ID hatten, wurden sie von einem Modell bedient, dessen gemessene Leistungsfähigkeit sich während dieses Zeitfensters veränderte. Alibaba hat für die dazwischenliegenden Builds kein Changelog veröffentlicht, deshalb besteht die einzige zuverlässige Möglichkeit herauszufinden, welches Verhalten Sie haben, darin, zu pinnen.

Ist die RSI-Behauptung unabhängig verifiziert? Der dabei erzeugte Score ist es – der Index stammt von Artificial Analysis, und die 45 steht auf deren Seite. Der dahinterstehende Mechanismus ist Alibabas eigene Beschreibung des eigenen Trainingsprozesses, ohne externe Replikation, ohne veröffentlichtes Evaluierungsprotokoll und ohne dass ein Dritter die 33 Zyklen beobachtet. Betrachten Sie „33 iterative Zyklen“ als Herstellerangabe und „45 nach 40“ als gemessenes Paar. Sie sind nicht die gleiche Art von Aussage, und der Unterschied ist der Grund, warum es sich lohnt, die Schlagzeile sorgfältig zu lesen, statt sie zu wiederholen.

Das nächste, worauf man achten sollte, ist nicht Qwen 4. Es ist die Frage, ob die Halbpreisaktion von Qwen3.7-Max die Ankunft des Modells übersteht, das es ersetzen soll. Wenn nicht, werden sehr viele Teams feststellen, dass sie einen Listenpreis mit einem Rabatt verglichen haben – und dass der ältere von zwei Geschwistern die ganze Zeit über der teurere war.