Hero-Karte mit dem Titel Claude Sonnet 5.5 vs. Qwen3.8 Max, mit dem Untertitel „sechs Wochen, zwei Stufen, ein Urteil zu den Kosten“, mit Pill-Elementen, auf denen „Input 2 $ bei beiden“, „Output 10 $ vs. 6 $“ und „Index 56 vs. 45“ zu lesen sind, sowie einer Fußzeile mit Verweis auf Artificial Analysis v4.3.2 und Anbieterpreise.
Guides & Insights

Claude Sonnet 5.5 vs. Qwen3.8 Max: Sechs Wochen, zwei Stufen, ein Urteil zu den Kosten

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Führe die Rechnung für drei Prompts durch, und der Vergleich ist größtenteils entschieden, bevor du bei den Benchmarks ankommst. Ein kurzer Support-Antwort-Aufruf: 2.000 Eingabe-Token, 500 Ausgabe-Token. Bei Qwen3.8 Max zu 2 $ pro Million Eingabe und 6 $ pro Million Ausgabe sind das vier Zehntel Cent; bei Claude Sonnet 5.5 zu 2 $ und 10 $ sind es neun Zehntel. Ein Repository-Refactoring: 400.000 Eingabe, 30.000 Ausgabe — 43 Cent gegenüber 83. Eine lange agentische Sitzung, die ihr Budget tatsächlich ausschöpft: zwei Millionen Token Eingabe, 200.000 Ausgabe, also 5,20 $ gegenüber 6,30 $, sobald die Zahlen groß genug sind, dass die Eingabeseite dominiert.

Die Lücke, die als 2,25-facher Unterschied beim Output-Preis beginnt, verengt sich bei agentischem Maßstab auf rund 1,2×, und diese Skalierung ist keine Kuriosität. Qwen3.8 Max und Claude Sonnet 5.5 sind beide 1M-Token-Modelle mit hohen Output-Obergrenzen, beide kosten 2 $ pro Million beim Input, und beide wurden innerhalb von acht Wochen zueinander veröffentlicht – die des Anbieters am 3. August 2026 mit einer datierten Aktualisierung am 2. September, die von Anthro​pic am 28. September. Der Unterschied zwischen ihnen ist nicht die Preisliste. Es ist das, was jedes aufwendet, um fertig zu werden.

Was wurde veröffentlicht, und wann?

Qwen3.8 Max ist Alibabas bisher leistungsfähigste Stufe. Alibaba positioniert es in seinem eigenen Migrationsleitfaden direkt gegen GPT-5.5, Claude Opus 4.7 und Gemini 3.1 Pro und empfiehlt es immer dann, wenn eine Aufgabe die stärkste verfügbare Reasoning-Leistung erfordert. Es bietet ein Kontextfenster von 1 Mio. Tokens, akzeptiert Text-, Bild- und Videoeingabe und gibt Text aus – die Videoeingabe ist die eine Fähigkeit, die Claude Sonnet 5.5 hier nicht besitzt. Die Preisgestaltung liegt bei 2 $ pro Million Eingabe- und 6 $ pro Million Ausgabe-Tokens, mit Cache-Lesevorgängen zu 0,25 $ und Cache-Schreibvorgängen zu 2,50 $. Zum Eintrag vom 3. August in unserem Katalog gesellt sich eine Aktualisierung vom 2. September, die als Qwen3.8 Max (0902) gelistet ist und dieselben Eckwerte sowie eine Ausgabegrenze von 131K aufweist.

Two-column scoreboard for Claude Sonnet 5.5 and Qwen3.8 Max across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, text and image input, AA Intelligence Index 56, cost per Index task $7.60, released September 28 2026. Right column Qwen3.8 Max: input $2.00 per million, output $6.00 per million, text image and video input, AA Intelligence Index 45, cost per Index task $5.41, September 2 2026 refresh. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5 ist das zweite Modell der 5.5-Generation von Anthropic und wurde am 28. September 2026 veröffentlicht, sechs Tage nach Claude Opus 5.5. Es wird als claude-sonnet-5-5 in der Claude API sowie über Amazon Bedrock, Google Cloud und Microsoft Foundry bereitgestellt, mit einem Kontextfenster von 1 Mio. Token, einer synchronen Ausgabegrenze von 128K, die sich in der Message Batches API hinter dem output-300k-2026-03-24-Header auf 300K erweitert, und die Preise von Claude Sonnet 5 bleiben exakt gleich: 2 $ Eingabe, 10 $ Ausgabe, 0,20 $ Cache-Lesevorgänge, 2,50 $ Cache-Schreibvorgänge. Keine Datenaufbewahrung ab Markteinführung, Einstellung nicht vor dem 28. September 2027.

Die Eingaberate ist also identisch, die Kontextfenster sind gleich groß, und die Aktualisierungen der beiden Anbieter lagen innerhalb eines Monats beieinander. Alles, was sie unterscheidet, liegt auf der Ausgabeseite der Rechnung oder in den Benchmarks.

Benchmarks: Herstellertabelle gegen unabhängigen Index

Es gibt hier zwei Arten von Belegen, und sie sind nicht austauschbar.

Anthropics Starttabelle basiert auf Angaben des Anbieters, wurde von keiner dritten Partei reproduziert und umfasst acht Evaluierungen. Die Zeilen, auf die es ankommt

• Terminal-Bench 4.0 — Claude Sonnet 5.5: 70,6 % gegenüber den 10,3 % von Claude Sonnet 5

• CursorBench 4.0 — 55,5 % gegenüber 34,1 % von Claude Sonnet 5

• GDPval-AA v2.1 — 1844 gegenüber 1449 für Claude Sonnet 5, 1846 für Claude Opus 5.5 und 1487 für GPT-6 Sol

• Humanity's Last Exam, mit Tools — 64,5 % gegenüber 54,9 %; Claude Opus 5.5 liegt bei 67,7 %

• OSWorld 2.1, teilweise — 80,1 % gegenüber 57,0 %

• Chartography, ohne Tools — 61,6 % gegenüber 15,6 %

Alibaba veröffentlicht keine direkt entsprechende vierspaltige Tabelle, daher sind die einzigen Zahlen, die auf derselben Achse dargestellt werden können, die unabhängigen. Artificial Analysis, Revision v4.3.2

• Zusammengesetzter Intelligenzindex — Claude Sonnet 5.5 56 auf Rang 3 von 216; Qwen3.8 Max 45 auf Rang 27

• Kosten pro Intelligence-Index-Aufgabe — 7,60 $ gegenüber 5,41 $

• Ausgabegeschwindigkeit — das Modell von Anthropic läuft gegen eine Claude-Sonnet-5-Baseline, die mit 78,7 Tokens pro Sekunde gemessen wurde; Qwen3.8 Max wird mit 39,1 gemessen

• Ausführlichkeit — 410 Mio. Ausgabe-Tokens im Index gegenüber 190 Mio.

Die eigenen Bewertungsergebnisse von Qwen3.8 Max sind respektabel statt marginal: 92,8 % bei GPQA Diamond, 88,8 % bei Terminal-Bench 2.1, 80,3 % beim Langkontext-Abruf, 47,8 % bei tau-banking. Beim Composite verliert es an Boden, weil es nichts entscheidend für sich gewinnt und die neuere Anthropic-Stufe mehrere Dinge direkt für sich entscheidet. Beachten Sie außerdem, dass die unabhängige Seite für Qwen3.8 Max ein Veröffentlichungsdatum vom 2. September 2026 und einen Kontextwert von 984K trägt – sie beschreibt das (0902)-Refresh, nicht den August-Build, und die Zahlen zwischen den beiden zu vermischen, wäre ein Fehler.

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56, a price of $2.00 per million input tokens and $10.00 per million output tokens, a cost of $7.60 per Intelligence Index task, a verbosity of 410M output tokens against a median of 88M, and a 1M-token context window.

Was in beiden Spalten fehlt, ist genauso wichtig wie das, was darin steht. Niemand hat Anthropics OSWorld- oder Terminal-Bench-Zahlen unabhängig reproduziert. Niemand hat einen Chartography- oder CursorBench-Wert für Qwen3.8 Max veröffentlicht. Der Composite-Wert ist die einzige Zahl, die bei beiden Modellen auf dieselbe Weise gemessen wurde – und genau deshalb leistet die Kosten-pro-Aufgabe-Zahl darunter so viel Arbeit.

Die Zahl, die den Ausschlag gibt, und sie steht auf keiner der beiden Tarifkarten.

Artificial Analysis berechnet beide Modelle auf dieselbe Weise: die zehn Evaluierungen im Index ausführen, die Tokens zählen, mit dem Listenpreis multiplizieren. Claude Sonnet 5.5 kommt auf 7,60 $ pro Aufgabe und Qwen3.8 Max auf 5,41 $ – ein Aufschlag von 40 % für das Anthropic-Modell trotz eines höheren Gesamtwerts. Die Ausführlichkeitswerte erklären die Richtung – 410 Mio. Tokens gegenüber 190 Mio. –, und die Geschwindigkeitswerte erklären den Rest: Ein Modell, das weniger Tokens ausgibt und länger pro Token braucht, ist nicht dasjenige, das für die Ausgabe zum doppelten Satz bezahlt.

Anthropics eigene Effizienzaussage passt zu derselben Erzählung, statt ihr zu widersprechen. Das Unternehmen gibt an, dass Claude Sonnet 5.5 Output um mehr als 30 % schneller als Claude Sonnet 5 erzeugt und bei identischen Preisen „bis zu 30 % weniger pro Aufgabe“ kostet – eine Aussage über Tokens pro Aufgabe, nicht über Raten. Ob sie gegenüber einem Modell Bestand hat, das weniger als halb so viele Tokens verbraucht, ist genau das, wonach die 7,60-Dollar-Zahl fragt, und ein unabhängiger Lauf ist ein Datenpunkt.

Die praktische Konsequenz: Die Output-Rate von 6 $ gegenüber 10 $ ist die Zahl, auf die die Beschaffung schauen wird, und sie ist die am wenigsten vorhersagekräftige Zahl im Artikel. Die vorhersagekräftige ist Tokens pro Aufgabe bei Ihren eigenen Prompts, und keiner der beiden Anbieter wird sie Ihnen geben.

Eingaben, Video und die Migrationsfalle

Der Fähigkeitsunterschied, der sofort ins Auge fällt, ist die Modalität. Qwen3.8 Max akzeptiert Video neben Text und Bildern; Claude Sonnet 5.5 akzeptiert Text und Bilder. Für die Analyse von Bildschirmaufzeichnungen, Pipelines für Meeting-Aufnahmen oder alles, was Video als erstklassige Eingabe behandelt, ist das keine Benchmark-Lücke – es ist eine binäre Eignungsfrage, und nur eines dieser Modelle besteht sie.

OrcaRouter model page for qwen/qwen3.8-max, attributed to Qwen and dated 2026-08-03, showing a 1M-token context window, text, image and video input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 2.25 seconds, and 53.0M tokens of traffic in the last seven days.

Der Unterschied, der sich eine Woche später zeigt, ist verhaltensbezogen. Claude Sonnet 5.5 nimmt fünf inkompatible Änderungen am Code vor, der auf Claude Sonnet 5 läuft. Ein nicht standardmäßiger Wert für temperature, top_p oder top_k gibt jetzt einen 400 zurück. Das Senden von thinking: {"type": "disabled"} gibt einen 400 zurück, der auf between_tools verweist, die neue niedrigste Thinking-Einstellung, die bei niedrigem, mittlerem und hohem Aufwand akzeptiert und bei xhigh oder max abgelehnt wird. Erzwungene Tool-Nutzung — tool_choice von "any" oder ein benanntes Tool — gibt direkt einen 400 zurück. Das ältere computer_20251124 Computer-Use-Tool wird in der Claude API und in Google Cloud abgelehnt. Und Thinking-Blöcke sind an das Modell und das Konto gebunden, die sie erzeugt haben, sodass Reasoning von Claude Sonnet 5 weitergetragen werden kann, aber nicht zu einer anderen Modellfamilie hinaus, und ein bearbeiteter Gesprächspräfix kann ein Replay in einen Fehler verwandeln.

Qwen3.8 Max verlangt nichts davon. Es ist ein Modell im OpenAI-Format mit einer konventionellen Anfrage-Oberfläche, und der Wechsel von einer anderen Qwen-Stufe dorthin ist eine Änderung der Modellbezeichnung.

Wäge die beiden Kosten ehrlich ab. Die Wahl des Qwen-Modells kostet dich die elf Punkte große Lücke im Gesamtergebnis und die Anthropic-Anbieterzahlen, die du ohnehin nicht unabhängig überprüfen kannst. Die Wahl des Anthropic-Modells kostet dich Videoeingabe und eine Checkliste mit vier API-Änderungen, die jeweils laut mit einem 400-Fehler fehlschlagen werden, sobald sie zum ersten Mal auftreten – was die gute Art von Fehlschlag ist, aber trotzdem ein Tag Arbeit.

Wo OrcaRouter hineinpasst

Der Grund, zu routen statt auszuwählen, ist, dass sich die ausschlaggebende Zahl – Kosten pro Aufgabe bei Ihrem Traffic – nicht aus der Dokumentation keines der beiden Anbieter berechnen lässt.

OrcaRouter ist ein einziger OpenAI-kompatibler Endpunkt über mehr als 200 Modelle hinweg, bei dem die Listenpreise der Anbieter ohne Aufschlag weitergegeben werden, sodass eine Preissenkung oder eine Tarifänderung auf einer der beiden Seiten am selben Tag live ist, an dem sie angekündigt wird. Beide Builds von Qwen3.8 Max sind im Katalog zu Alibabas eigenem Preis von 2 $ / 6 $ – der August-Eintrag und das (0902)-Refresh – neben Claude Sonnet 5, dem Modell, auf dem der meiste Claude-API-Traffic noch immer läuft, seit dem 30. Juni zu Anthropics 2 $ / 10 $ routbar mit gemessenen 150 Ausgabe-Tokens pro Sekunde. Claude Sonnet 5.5 selbst ist noch nicht in unserem Katalog; solange das der Fall ist, ist der ehrliche Weg dorthin die eigene API des Anbieters und die drei Clouds, die Anthropic auflistet, und die Möglichkeit, es auszuprobieren, ohne eine Workload zu verschieben, ist ein Teil des Traffics hinter automatischem Failover zu Claude Sonnet 5 oder Qwen3.8 Max.

Welche, für welchen Job?

Qwen3.8 Max gewinnt bei der Videoeingabe, bei der Ausgaberate, bei den gemessenen Kosten pro Index-Aufgabe und beim Integrationsaufwand. Es ist die richtige Standardwahl für umfangreiche, klar spezifizierte Arbeit, bei der sich eine zusammengesetzte Lücke von zwölf Punkten nicht in der Ausgabequalität niederschlägt.

Claude Sonnet 5.5 gewinnt beim unabhängigen Composite, bei agentischen Coding-Evaluierungen, bei denen die Herstellerzahlen von Anthropic einen Sprung von 60 Punkten gegenüber dem eigenen Vorgänger auf Terminal-Bench 4.0 zeigten, bei der 300K-Obergrenze für Batch-Ausgaben und bei einer jobförmigen Entscheidung, die eine Preiskarte nicht treffen kann: Es ist das Modell der Wahl, wenn die Aufgabe schwierig genug ist, dass richtig zu liegen wichtiger ist als billig zu sein.

Was die Antwort für beide ändern würde, ist dasselbe, und es ist kein neues Benchmark-Release. Es ist eine Tokens-pro-Aufgabe-Zahl bei deinen eigenen Prompts, mit deinen eigenen Effort-Einstellungen, für beide Modelle. Anthropics Effort-Parameter und Qwens Output-Obergrenze sind beides Hebel für diese Zahl, und beide werden von dir festgelegt, nicht von der Preisliste des Anbieters.

Das Einzige, was dieser Vergleich tatsächlich klärt: Bei 2 Dollar pro Million auf der Eingabeseite ist die Eingabeseite der Rechnung kein Unterscheidungsmerkmal mehr zwischen einem chinesischen Flaggschiff und Anthropics Mittelklasse. Dieses Rennen hat sich vor Monaten auf die Ausgabeseite und die Token-Anzahl verlagert.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert