Generierte Hero-Karte mit dem Titel Claude Sonnet 5.5 vs Qwen 4 Max, mit dem Untertitel Ein Modell hat eine Karte, das andere hat einen Namen, und mit drei Karten, die lauten: Claude Sonnet 5.5 veröffentlicht am 2026-09-28, Qwen 4 Max angekündigt ohne Modellkarte, und Qwen3.8 Max, der Qwen, den man für $2.00 / $6.00 aufrufen kann, mit einer Fußzeile, die lautet: Qwen 4 Max wurde am 2026-09-22 angekündigt, ohne veröffentlichten Preis, Kontextfenster, Gewichte oder Score.
Guides & Insights

Claude Sonnet 5.5 vs. Qwen 4 Max: Das eine Modell hat eine Karte, das andere einen Namen

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die beiden Hälften dieses Titels sind nicht dieselbe Art von Objekt, und das ist das Erste, was ein Leser wissen muss. Claude Sonnet 5.5 wurde am 28. September 2026 veröffentlicht: Es hat eine API-Kennung, eine Preisliste, ein Kontextfenster, einen veröffentlichten frühesten Abschalttermin und eine Zeile in den unabhängigen Bestenlisten. Q​wen 4 Max wurde am 22. September 2026 auf der Yunqi-Konferenz in Hangzhou als Flaggschiff einer angekündigten, vier Modelle umfassenden Q​wen-4-Reihe vorgestellt – und Stand heute hat es keinen Preis, kein Kontextfenster, keine veröffentlichte Bewertung, keine Modellkarte und keine Seite bei Artificial Analysis zum Öffnen. Das ist kein Skandal; so wird eine Stufe eben angekündigt. Aber es verändert, wie ein sinnvoller Vergleich aussieht. Der Vergleich, der sich lohnt, ist der zwischen dem neuesten veröffentlichten Sonnet und dem Q​wen-Modell, das man heute tatsächlich aufrufen kann, nämlich Qwen3.8 Max – denn dieses hat eine Preisliste, und die Preisliste ist aufschlussreich.

Was A​libaba tatsächlich auf den Tisch legte

Q​wen 4 Max wurde als Name in einer Produktpalette gezeigt, nicht als Produkt. Die Konferenzvorschau stellte die Stufenstruktur der Q​wen 4-Familie vor, und nichts davon wurde seither in eine Spezifikation umgewandelt, anhand derer ein Entwickler planen könnte: kein Preis pro Million Token, keine Fenstergröße, keine maximale Ausgabe, keine Benchmark-Tabelle, kein Hugging-Face-Repository, kein Eintrag in der eigenen Modellliste des Anbieters. Ob es als geschlossene API-Stufe, als offene Gewichte oder in beiden Formen erscheint, wird nirgends angegeben, was der Anbieter veröffentlicht hat. Wenn eine Stufe so früh dran ist, ist das Einzige, was ein Artikel ehrlicherweise über ihre Spezifikationen sagen kann, dass es keine gibt — und jede Seite, die derzeit ein Datenblatt zu Q​wen 4 Max anbietet, druckt eine Projektion.

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Qwen 4 Max, the scoreboard, with six matched rows. Claude Sonnet 5.5: released 2026-09-28, $2.00 input, $10.00 output, Intelligence Index 56, 1,000,000-token context window, closed weights. Qwen 4 Max: announced with no model card, input and output price not published, no score published, context window not published, weights not stated. A footer reads Qwen 4 Max was announced 2026-09-22 with no specification published; Claude Sonnet 5.5 figures per Artificial Analysis v4.3.2 and Anthropic.

Das Einzige, was die Ankündigung sinnvoll festlegt, ist die Richtung. A​libabas jüngstes ausgeliefertes Flaggschiff, Qwen3.8 Max, wird im eigenen Migrationsleitfaden des Anbieters direkt gegen GPT-5.5, Claude Opus 4.7 und Gemini 3.1 Pro positioniert, und es ist die Stufe, die Q​wen 4 Max ersetzen soll. Das Ziel des Nachfolgers ist also erkennbar, auch wenn seine Zahlen es nicht sind, und das Modell, das er beim Preis schlagen muss, ist das bereits im Verkauf befindliche.

Das Q​wen, das du heute aufrufen kannst, preislich verglichen mit dem neuen Sonnet

Qwen3.8 Max ist seit dem 3. August 2026 allgemein verfügbar. Es ist A​libabas bislang leistungsfähigste Stufe: nativ multimodal mit Text-, Bild- und Videoeingabe und Textausgabe, einem Fenster von 1.000.000 Token, Denkmodus, Funktionsaufrufen, integrierten Tools und strukturierten Ausgaben, bereitgestellt über Open​AI-kompatible, Anthro​pic-kompatible und native DashScope-Endpunkte. A​libaba positioniert es für dieselbe anspruchsvolle mehrstufige Analyse und agentische Arbeit, für die der Anbieter Claude Sonnet 5.5 positioniert, und beide landen bei fast genau demselben beworbenen Preis — und genau hier wird der Vergleich interessant.

• Eingabepreis — Claude Sonnet 5.5 2,00 $ pro Million vs. Qwen3.8 Max 2,00 $ pro Million, identisch

• Ausgabepreis — Claude Sonnet 5.5 $10,00 pro Million vs. Qwen3.8 Max $6,00 pro Million

• Cache-Lesevorgang — Claude Sonnet 5.5 0,20 $ pro Million vs. Qwen3.8 Max 0,25 $ pro Million

• Cache-Schreibvorgang — Claude Sonnet 5.5 2,50 $ pro Million vs. Qwen3.8 Max 2,50 $ pro Million

• Kontext — Claude Sonnet 5.5 mit 1.000.000 Tokens vs. Qwen3.8 Max mit 1.000.000 Tokens laut Datenblatt des Anbieters; Artificial Analysis gibt den von ihm gemessenen Snapshot mit 983.616 an.

• Maximale Ausgabe – Claude Sonnet 5.5 128.000 synchron, 300.000 bei Batches, gegenüber Qwen3.8 Max: vom Anbieter nicht veröffentlicht

• Eingabemodalität — Claude Sonnet 5.5 Text, Bild und Datei vs. Qwen3.8 Max Text, Bild und Video

Ein identischer Input-Tarif und ein um 40 % günstigerer Output-Tarif sind eine wirklich starke Preisposition, und das ist der Grund, warum Qwen3.8 Max immer wieder in Vergleichen mit Frontier-Modellen auftaucht. Dann betrachtet man die unabhängigen Messungen, und der Vorteil verlagert sich an eine völlig andere Stelle.

Was die unabhängigen Zahlen über den Preisvorteil sagen

Beide Modelle befinden sich auf demselben Artificial Analysis Intelligence Index, Revision v4.3.2, und beide wurden gemessen statt geschätzt.

• Intelligence Index — Claude Sonnet 5.5 56 bei maximalem Aufwand vs. Qwen3.8 Max 45 im Snapshot vom 2. September

• Kosten pro Index-Aufgabe — Claude Sonnet 5.5 7,60 $ vs. Qwen3.8 Max 5,41 $

• Ausgabegeschwindigkeit — Claude Sonnet 5.5 138,7 Token/Sek. vs. Qwen3.8 Max 38,2 Token/Sek.

• Zeit bis zum ersten Chunk — Claude Sonnet 5.5 370,8 s bei Max Effort vs. Qwen3.8 Max 3,0 s

• Über den Index generierte Output-Tokens — Claude Sonnet 5.5 410M vs. Qwen3.8 Max 190M, die das Board im Vergleich zu einem Median von 88M als sehr ausführlich kennzeichnet

• GPQA Diamond — Claude Sonnet 5.5 nicht auf der aktuellen Rangliste veröffentlicht vs. Qwen3.8 Max 92,8 %

• Humanity's Last Exam — Claude Sonnet 5.5 55,0 % vs. Qwen3.8 Max 43,1 %

• Erinnerung an langen Kontext — Claude Sonnet 5.5 82,7 % vs. Qwen3.8 Max 80,3 %

Zwei Dinge stechen hervor, und keines davon ist der Preis. Das erste ist, dass eine um 40 % günstigere Ausgaberate zu einer um 30 % günstigeren Aufgabe schrumpft, sobald man die Token-Zahlen berücksichtigt – Qwen3.8 Max gibt über den Index hinweg 190 Mio. Token aus, gegenüber 410 Mio. bei Claude Sonnet 5.5, was schlanker ist, aber nicht schlank genug, um die volle Ratenlücke zu bewahren. Das zweite ist die Geschwindigkeit, und hier kehrt sich die Richtung deutlich um: Claude Sonnet 5.5 erzeugt Ausgaben 3,6-mal schneller als Qwen3.8 Max, 138,7 Token pro Sekunde gegenüber 38,2. Bei einer langen Generierung ist das der Unterschied zwischen einer Minute und mehreren, und das ist kein Unterschied, den irgendein Rabatt pro Token wettmacht.

Die Erst-Token-Zahl fällt in die andere Richtung aus und verdient eine klar benannte Einschränkung. 370,8 Sekunden sind Claude Sonnet 5.5 bei Max Effort mit Standard-Fallback – eine Reasoning-Konfiguration, die ein sehr großes Denkbudget verbraucht, bevor sie antwortet; wer ein niedrigeres Effort-Level konfiguriert, erhält das erste Token in Sekunden. Die 3,0 Sekunden von Qwen3.8 Max sind an einem Modell gemessen, dessen Denkverhalten sich unterscheidet. Der Vergleich ist echt, aber er vergleicht Konfigurationen, nicht Anbieter.

Artificial Analysis model page for Qwen3.8 Max (0902), a proprietary model released September 2026, showing an Intelligence Index of 45, an output speed of 38.2 tokens per second, $2.00 per million input tokens and $6.00 per million output tokens, $5.41 per Intelligence Index task, 190M output tokens generated during the Index evaluation described as very verbose, and a 984k-token context window.

Wo die fehlenden Sonnet-Migrationskosten landen

Ein operativer Unterschied taucht in keiner der obigen Zeilen auf und ist für alle mit laufendem Code wichtiger als die Preisdifferenz. Claude Sonnet 5.5 hat sechs Verhaltensweisen gegenüber Claude Sonnet 5 geändert, und fünf davon brechen bestehende Integrationen: nicht standardmäßige temperature, top_p und top_k geben jetzt einen 400-Fehler zurück; thinking: {"type": "disabled"} gibt jetzt einen 400-Fehler zurück und muss zu between_tools werden, wobei der Aufwand auf low, medium oder high begrenzt ist; die erzwungene Tool-Auswahl von "any" oder einem benannten Tool wird abgelehnt, sodass Schleifen zu auto mit strikter Tool-Nutzung oder strukturierten Ausgaben wechseln müssen; das computer_20251124 Computer-Use-Tool wird in der Claude API und in Google Cloud abgelehnt; und Thinking-Blöcke sind jetzt an das erzeugende Modell und Konto gebunden, sodass Reasoning von Sonnet 5 weitergetragen wird, aber nicht hinaus zu einer anderen Familie. Die sechste Änderung lässt nichts fehlschlagen und ist deshalb diejenige, die leicht fehlerhaft ausgeliefert wird: Text zwischen Tool-Aufrufen wird jetzt innerhalb von Thinking-Blöcken zurückgegeben, sodass eine Streaming-Anwendung zwischen Aufrufen verstummt, bis sie einen Anzeigewert setzt oder Thinking im Voraus deaktiviert.

Qwen3.8 Max verlangt von einem Qwen-Aufrufer nichts davon – es ist ein OpenAI-kompatibler Endpunkt mit der vollständigen Sampling-Oberfläche und der standardmäßigen Tool-Calling-Form – und sein Anthropic-kompatibler Endpunkt existiert genau deshalb, damit gegen Claude geschriebener Code mit einer geänderten Basis-URL auf ihn zeigen kann. Für ein Team, das bereits Sonnet 5 nutzt, ist der Wechsel zu Sonnet 5.5 ein Tag Migrationsarbeit mit einer Liste von fünf zu prüfenden Punkten; der Wechsel zu Qwen3.8 Max ist eine Konfigurationsänderung mit einem anderen Risikoprofil, vor allem rund um Verhaltensdrift statt um die API-Form.

Das Erreichbare auf dieselbe Taste legen

Eine realistische Pipeline Ende September 2026 wählt keine davon. Sie betreibt ein Claude-Modell für den agentischen Pfad und ein Qwen-Modell, wo die Video-Eingabe oder der Preis eine Rolle spielt, und die Kosten dieser Anordnung sind normalerweise zwei Verträge, zwei Schlüssel, zwei Rate-Limit-Oberflächen und zwei Stellen, an denen eine Anfrage fehlschlagen kann. OrcaRouter führt das zu einem einzigen OpenAI-kompatiblen Endpoint über 200 Modelle hinweg zusammen, wobei die Listenpreise der Anbieter durchgereicht und keine Aufschläge erhoben werden, sodass eine Tarifänderung eines Anbieters auf einer der beiden Seiten hier noch am selben Tag wirksam wird statt erst bei der nächsten Verlängerung – dazu automatisches Failover zwischen vorgelagerten Anbietern und eine Routing-DSL, mit der sich Aufrufe aus mehreren Modellen zusammensetzen lassen.

Qwen3.8 Max ist hier heute routbar als qwen/qwen3.8-max zu Alibabas Preisen von $2.00 für Eingabe und $6.00 für Ausgabe über das gesamte 1.000.000-Token-Fenster, und der von Artificial Analysis gemessene Snapshot vom 2. September ist adressierbar als qwen/qwen3.8-max-0902, wenn Sie die exakte Revision benötigen, auf der ein Score erhoben wurde. Weder Qwen 4 Max noch irgendeine andere Qwen-4-Stufe ist in unserem Katalog, und es wird keine Qwen-4-Stufe geben, bis Alibaba etwas zum Routen veröffentlicht. Claude Sonnet 5.5 ist ebenfalls nicht im Katalog — es ist einen Tag alt, und der Weg dorthin führt über Anthropics eigene API, wobei Claude Sonnet 5 hier zu Anthropics $2.00 und $10.00 verfügbar ist und in der Zwischenzeit als Failover-Ziel dient. Qwen3.8 Max verzeichnet wöchentlich 52,0 Millionen Token Traffic über diesen Katalog, und Claude Sonnet 5 verzeichnet 7,9 Millionen, was die praktische Version des obigen Arguments ist: Die Qwen-Stufe ist nicht nur dem Namen nach ein Fallback.

OrcaRouter model page for qwen/qwen3.8-max, dated 2026-08-03, showing text, image and video input, a 1M-token context window, $2.00 input and $6.00 output per million tokens, a p50 time to first token of 2.27 s, and 52.0M tokens of recent traffic.

Die Regel für eine angekündigte Stufe

Behandle eine angekündigte Stufe als Planungsgröße, nicht als Beschaffungsoption. Qwen 4 Max ist es wert, verfolgt zu werden, weil es zeigt, wohin Alibabas Flaggschiff steuert, und weil es irgendwann Qwen3.8 Max an der Spitze der Produktlinie ablösen wird. Es ist nicht wert, als Planungsgrundlage zu dienen, denn es gibt nichts, worauf man planen könnte: keine Kennung, keinen Preis, kein Zeitfenster, keine Gewichte, keinen gemessenen Score. Die Belege, die es real machen werden, sind konkret und leicht zu erkennen — ein Eintrag in Alibabas eigener Modellliste, eine Preiszeile, ein veröffentlichtes Kontextfenster, ein Hugging-Face-Repository, falls die Gewichte offen sind, und eine Seite bei Artificial Analysis, denn ein Modell, das niemand gemessen hat, ist kein Modell, das man vergleichen kann.

Bis dahin liegt die Entscheidung zwischen zwei Modellen, die beide existieren. Wenn Ihre Arbeit agentisch ist, sind die siebzehn Indexpunkte und die 3,6-fache Ausgabegeschwindigkeit das, was Sie kaufen, und der höhere Preis pro Aufgabe von Claude Sonnet 5.5 ist der Preis dafür. Wenn Ihre Arbeit Videoeingabe verarbeitet, einen nativen, Anthro​pic-kompatiblen Endpoint auf einer Q​wen-Rechnung benötigt oder schlicht keinen $10-Ausgabetarif rechtfertigen kann, ist Qwen3.8 Max gerade zum gleichen Eingabepreis im Angebot, mit einer um 40 % günstigeren Ausgabe und einem ersten Token, der in Sekunden ankommt — und die ehrliche Einschränkung ist, dass es sich langsam anfühlen wird, sobald die Generierung beginnt, was der Kompromiss ist, den der günstigere Tarif erkauft.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert