
Qwen 4 Max vs. Claude Opus 5: der Benchmark, der sich unter beiden verschob
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen 4 Max wurde am 22. September 2026 auf der Yunqi-Konferenz in Hangzhou in einer Vorschau gezeigt – die Flaggschiffstufe einer aus vier Modellen bestehenden Qwen 4-Linie, die angekündigt und noch nicht veröffentlicht ist, ohne Preis, ohne Kontextfenster und ohne veröffentlichten Score. Claude Opus 5 ist seit dem 24. Juli 2026 allgemein verfügbar, für 5,00 US-Dollar pro Million Input-Tokens und 25,00 US-Dollar pro Million Output-Tokens, und es ist das Ziel gewesen, auf das jedes Flaggschiff seit der Veröffentlichung von Qwen3.8-Max abgezielt hat. Der naheliegende Weg, diesen Vergleich zu schreiben, ist ein Datenblatt mit einer leeren Spalte. Der nützliche Weg ist, zu bemerken, dass Artificial Analysis am 19. September 2026, drei Tage vor der Ankündigung, seinen Intelligence Index neu bewertete und Claude Opus 5 nicht mehr das Modell an dessen Spitze war. Diese eine Änderung verändert den Bezugsrahmen dafür, was Qwen 4 Max schlagen muss.
Was hat sich am 19. September geändert?
Artificial Analysis veröffentlichte am 19. September 2026 die Index-Revision v4.3.2. Unter der aktuellen Revision erreicht Claude Opus 5 bei maximalem Reasoning-Aufwand 51 Punkte im Intelligence Index — 50 bei xhigh, 48 bei high, 45 bei medium und 39 bei low — und liegt hinter Claude Fable 5.1 und GPT-6 Astra, beide bei 53. Die Kosten pro Aufgabe in diesem Index betragen 5,86 $.
Wenn das wie eine Herabstufung klingt, ist es keine. Das Modell hat sich nicht geändert. Der Index schon. Unsere eigene Berichterstattung für Juli und August nannte Claude Opus 5 mit 61 bis 63 und an der Spitze der Tabelle, und diese Zahlen waren nach den damals geltenden Revisionen korrekt. Wer sie immer noch ohne Revisionsdatum zitiert, zitiert eine nicht mehr gültige Zahl, und dies ist der häufigste Fehler überhaupt in Vergleichen, die in diesem Monat geschrieben wurden. Die praktische Konsequenz ist, dass eine Behauptung wie „Claude Opus 5 ist das verfügbare Modell mit der höchsten Punktzahl“ nicht mehr zutrifft, und ein darauf aufbauender Vergleich bricht zusammen.
Für die Qwen-Seite ist die Konsequenz noch schärfer. Eine Flaggschiff-Kategorie, die im September 2026 angekündigt wurde, zielt auf ein Ziel, das im September 2026 neu definiert wurde. Was auch immer Alibaba schließlich für Qwen 4 Max veröffentlicht, wird vor dem Hintergrund eines Leaderboards gelesen werden, bei dem 53 die Zahl ist, die es zu schlagen gilt, nicht 63.

Der Vergleich, ehrlich formuliert
Eine Seite dieser Tabelle ist vollständig und die andere Seite ist leer, und so zu tun, als wäre es anders, wäre genau der Fehlermodus dieses Artikels. Hier ist, was tatsächlich bekannt ist:
• Status — Claude Opus 5 allgemein verfügbar seit dem 24. Juli 2026, im Vergleich zu Qwen 4 Max, angekündigt am 22. September 2026 ohne Veröffentlichungsdatum
• Eingabepreis — Claude Opus 5 5,00 $ pro 1 Mio. Token, gegenüber Qwen 4 Max nicht veröffentlicht
• Ausgabepreis — Claude Opus 5: 25,00 $ pro 1 Mio. Token, im Vergleich zu Qwen 4 Max nicht veröffentlicht
• Zwischengespeicherte Eingabe — Claude Opus 5 0,50 $ pro 1 Mio. Token bei einem Cache-Lesevorgang, im Vergleich zu Qwen 4 Max: nicht veröffentlicht
• Kontext — Claude Opus 5 1M Token im Standard- und Maximalfall, gegenüber Qwen 4 Max: nicht veröffentlicht
• Ausgabegrenze — Claude Opus 5: 128K Tokens synchron und 300K über die Batches API mit einem Beta-Header, gegenüber Qwen 4 Max, für das keine Angaben veröffentlicht sind
• Modalität — Claude Opus 5: Text-, Bild- und Dateieingabe mit Textausgabe, im Vergleich zu Qwen 4 Max: nicht veröffentlicht
• Long-Context-Preise — Claude Opus 5 hat keinen Aufpreis, sodass eine Anfrage mit 900.000 Token zum gleichen Preis pro Token abgerechnet wird wie eine mit 9.000 Token, während die Preise von Qwen 4 Max nicht veröffentlicht sind.
• Unabhängige Bewertung — Claude Opus 5 erreicht 51 Punkte im Artificial Analysis Intelligence Index v4.3.2 bei maximalem Aufwand, während für Qwen 4 Max keine unabhängige Bewertung existiert
• Vom Anbieter gemeldete Werte — Claude Opus 5: SWE-bench Verified 96,0 %, SWE-bench Pro 79,2 %, OSWorld 2.0 70,6 %, Terminal-Bench 2.1 je nach Harness im mittleren 80er-Bereich, gegenüber Qwen 4 Max: nichts gemeldet
• Reasoning-Steuerung — adaptives Denken bei Claude Opus 5 standardmäßig aktiviert mit einer fünfstufigen Aufwandsleiter, im Gegensatz zu Qwen 4 Max, nicht veröffentlicht
Zehn Zeilen „nicht veröffentlicht“ sind kein rhetorisches Mittel. Sie sind der Zustand der Beweislage, und die ehrliche Schlussfolgerung daraus ist, dass noch niemand einen Fähigkeitsvergleich zwischen diesen beiden Modellen anstellen kann.
Der Teil der Lücke, der sich nicht schließen wird
Preise und Kontext werden irgendwann veröffentlicht. Ein Unterschied wird die Veröffentlichung überdauern, und es lohnt sich, jetzt darüber zu entscheiden statt in der Woche, in der Qwen 4 Max auf den Markt kommt: Die beiden Modelle sind darauf ausgelegt, auf unterschiedliche Weise gekauft zu werden.
Claude Opus 5 ist ein einzelnes geschlossenes Modell zu einem einzigen Preis von einem einzigen Anbieter, mit einer veröffentlichten Zusage zur Einstellung nicht vor dem 24. Juli 2027. Das ist ein stabiles Ziel für die Kapazitätsplanung. Qwen 4 Max ist das Flaggschiff einer Familie, die Alibaba wiederholt über eine viel breitere Preisspanne hinweg veröffentlicht hat – die Qwen-3.8-Generation umfasst ein Frontier-Flaggschiff bei 2,00 $ Input und eine Flash-Stufe weit darunter – und die Flaggschiff-Stufe der Qwen-Linie war historisch diejenige mit der kürzesten nützlichen Lebensdauer, bevor eine günstigere Stufe die Lücke zu ihr schließt.
Der andere Unterschied sind offene Gewichte, und er weist in die andere Richtung. Die Qwen-3.8-Generation hat die Gewichte für ihr größtes Modell unter einer eigenen Qwen-Lizenz veröffentlicht, was Fine-Tuning, Quantisierung und Self-Hosting überhaupt erst möglich macht. Claude Opus 5 veröffentlicht keine Gewichte und wird das auch nicht tun. Wenn Ihre Workload ein Modell erfordert, das Sie innerhalb Ihres eigenen Perimeters betreiben oder verändern können, ist das ein struktureller Vorteil, den keine Benchmark-Revision Alibaba nehmen kann – und es ist der stärkste Grund, sich für diesen speziellen Vergleich zu interessieren, statt ihn als ein Flaggschiff gegen ein anderes zu behandeln.

Wie man diesen Vergleich heute durchführt
Claude Opus 5 ist jetzt verfügbar, und OrcaRouter leitet es als anthropic/claude-opus-5 weiter zum Listenpreis von Anthropic mit 0 % Aufschlag — der Tarif des Anbieters wird unverändert durchgereicht, sodass die oben genannten Beträge von $5,00 und $25,00 genau das sind, was Ihnen berechnet wird, statt eines aufgeschlagenen Äquivalents. Das ist bei einem Modell in dieser Preisklasse wichtiger als sonst: Eine Plattformmarge von 10 Prozent auf einen Ausgabetarif von $25,00 sind $2,50 pro Million Tokens, was mehr ist als die gesamten Eingabekosten der meisten Open-Weight-Alternativen. Daneben umfasst der Katalog knapp 200 Modelle über einen einzigen OpenAI-kompatiblen Endpunkt, mit automatischem Failover, wenn die Leistung eines Anbieterpfads nachlässt, und einer Routing-DSL, um die Richtlinie explizit auszudrücken, anstatt einen Modellnamen fest in Ihrer Anwendung zu verdrahten.
Was OrcaRouter nicht führt, ist Qwen 4 Max oder irgendeine Qwen-4-Stufe. Der Katalog enthält null Einträge für diese Familie, was genau das ist, was man für ein angekündigtes, aber nicht veröffentlichtes Modell erwarten würde. Wenn die Stufen dann erscheinen, würden sie an derselben Stelle auftauchen, und bis dahin ist das Qwen-Modell, das einen Vergleich mit Claude Opus 5 verdient, dasjenige, das man tatsächlich aufrufen kann: Qwen3.8-Max, allgemein verfügbar seit dem 3. August 2026 zu 2,00 $ für Eingabe und 6,00 $ für Ausgabe pro Million Token, mit veröffentlichten Gewichten und einem dokumentierten unabhängigen Intelligenzwert von 56 bei 1,14 $ pro Aufgabe — ein Wert, der unter einer früheren Indexrevision verbucht wurde, sodass man ihn nur mit diesem Vorbehalt mit den 51 von Claude Opus 5 vergleichen sollte.
Was ist damit zu tun, bevor eine Modellkarte existiert
Hier gibt es kein Urteil zu fällen, weil eines der beiden Modelle nicht als Produkt existiert. Was sich sagen lässt, ist, dass der Vergleich am 19. September 2026 seine Gestalt änderte, ohne dass einer der Anbieter etwas tat: Claude Opus 5 ist nicht mehr das Modell mit der höchsten Punktzahl im unabhängigen Index, auf den sich die meisten Vergleiche stützen, und liegt nun zwei Punkte hinter zwei anderen Modellen. Eine Markteinführung von Qwen 4 Max wird in diese Tabelle fallen, nicht in die vom Juli.
Die Entscheidung für die nächsten Monate ist also nicht Qwen 4 Max gegen Claude Opus 5. Sie lautet Claude Opus 5 gegen das Qwen-Modell, das bereits veröffentlicht wurde – ein Flaggschiff zu einem Fünftel des Eingabepreises mit veröffentlichten Gewichten – und dieser Vergleich ist jetzt verfügbar, mit echten Zahlen auf beiden Seiten. Kommen Sie darauf zurück, wenn Alibaba eine Modellkarte veröffentlicht, und betrachten Sie jede Benchmark-Tabelle zu Qwen 4 Max, die Sie vorher sehen, als unbestätigt.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
