
Qwen 4 Max auf der Apsara 2026 angekündigt: Was Alibaba bestätigt hat – und was nicht
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Die Yunqi-Konferenz in Hangzhou – die Apsara Conference – wurde am 22. September 2026 genutzt, um vier Modelle zu zeigen, die noch nicht ausgeliefert wurden. Der LLM-Leiter des Labors, Liu Da Yiheng, stellte auf der Bühne Qwen 4 Max, Qwen 4 Flash, Qwen 4 Plus und Qwen 4 27B vor, beschrieb, dass die Familie auf einer Architektur der neuen Generation trainiert werde, und sagte nur, dass sie bald erscheinen werde. Zum Zeitpunkt dieses Artikels gibt es für keines der vier eine Modellkarte, keine offenen Gewichte, keine API-Kennung, kein Kontextfenster, keinen Preis und keinen Benchmark-Score. Das neueste Flaggschiff, das man heute tatsächlich aufrufen kann, ist Qwen3.8-Max, allgemein verfügbar seit dem 3. August 2026, und genau diese Distanz zwischen einer Ankündigung auf der Bühne und einem aufrufbaren Endpunkt ist der Teil dieser Geschichte, den man sorgfältig lesen sollte.
Die vier Stufen und wofür jede einzelne gedacht ist
Alibabas Qwen-Reihe ist seit der Qwen-3-Generation in Fähigkeitsstufen gegliedert, und die Ankündigung von Qwen 4 behielt diese Struktur bei, statt sie zu ersetzen. Was auf der Bühne gezeigt wurde, war eine Aufstellung, kein Datenblatt:
• Qwen 4 Max — die Flaggschiff-Klasse und das Modell, mit dem Alibaba gegen das Topmodell jedes anderen Frontier-Labors antritt
• Qwen 4 Flash — die High-Throughput-Stufe, ausgelegt für latenzempfindliche und umfangreiche Workloads statt für maximale Reasoning-Leistung
• Qwen 4 Plus — die ausgewogene mittlere Stufe, historisch diejenige mit dem breitesten Spektrum an multimodaler Unterstützung
• Qwen 4 27B — die lokale Open-Weight-Stufe, diejenige, die von Leuten heruntergeladen, feinabgestimmt und quantisiert wird, die nie eine gehostete API anfassen
• Architektur — beschrieben als neue Generation und als im Training befindlich, was nicht dasselbe ist wie fertiggestellt
• Hauptarbeitslast — agentische und Tool-nutzende Aufgaben, entsprechend der Konferenz-Rahmung, statt Chat
• Verfügbarkeit – keine. Keine Stufe hat ein Veröffentlichungsdatum, einen Preis, ein Kontextfenster, eine Modalitätenliste oder einen veröffentlichten Score.
Die 27B-Stufe ist die, auf die man achten sollte, und zwar aus einem Grund, der nichts mit Benchmarks zu tun hat. Sie ist die einzige Stufe der Familie, die historisch mit offenen Gewichten ausgeliefert wurde, und die Qwen 3.8-Generation zeigte, wie viel unabhängige Arbeit das freisetzt: Innerhalb weniger Tage nach dem Erscheinen der 27B-Gewichte hatte die Community MLX-Konvertierungen, NVFP4-Quantisierungen und unzensierte Fine-Tunes erstellt. Ein angekündigtes 27B-Modell ist ein Versprechen eines ganzen nachgelagerten Ökosystems, und es ist der Teil dieser Roadmap mit der planbarsten Bereitstellung.
Die Zahl von 5 bis 10 Billionen Parametern gehört nicht zu Qwen 4
Die Berichterstattung über die Konferenz war bei einer Zahl ungenau. Das Ziel von „5 bis 10 Billionen Parametern", das zusammen mit den Qwen-4-Neuigkeiten kursierte, ist keine Qwen-4-Spezifikation – es ist eine vorausschauende Aussage über die nachfolgenden Generationen, den Zeitrahmen von Qwen 4.5 und Qwen 5. Alibaba hat für Qwen 4 Max keine Parameterzahl genannt, und nach der verfügbaren Beweislage wäre es ein Fehler, eine zu nennen.
Das ist wichtig, weil die Parameteranzahl die Zahl ist, an der Leser sich orientieren, und die Zahl, die sich weiterverbreitet. Eine Behauptung von 5 Billionen Parametern für ein Modell ohne veröffentlichte Architektur ist in beide Richtungen nicht falsifizierbar: Niemand kann sie bestätigen, und niemand kann sie korrigieren, sobald sie wiederholt wurde. Wenn Sie Qwen 4 Max diese Woche als Modell mit mehreren Billionen Parametern beschrieben sehen, wurde die Zahl aus einer anderen Folie übernommen.
Was sich ehrlich sagen lässt, ist, dass das vorherige Flaggschiff ein Mixture-of-Experts mit 2,4 Billionen Parametern ist, von denen pro Token 95 Milliarden aktiv sind – bestätigt auf der offiziellen Modellkarte für Qwen3.8-Max und in der darauffolgenden Open-Weight-Veröffentlichung. Was auch immer Qwen 4 Max letztlich sein wird, das ist die Messlatte, die es schlagen muss, und es ist eine veröffentlichte, überprüfbare Zahl und nicht eine Roadmap-Wunschvorstellung.

Die Architektur ist kein Gerücht: Eine Vorschau davon wurde bereits ausgeliefert.
Das Nützlichste an der Ankündigung von Qwen 4 ist, dass ein Teil der Architektur bereits unter einem anderen Namen veröffentlicht wurde. Qwen3.8-Flash-Next wurde Ende August 2026 als Open Source veröffentlicht, und seine Modellkarte weist es schlicht als Vorschau auf die Qwen-4-Architektur aus. Damit ist es der einzige konkrete Beleg, den irgendjemand außerhalb von Alibaba dafür hat, wie die Qwen-4-Familie aufgebaut ist.
Es handelt sich um ein Sparse-Modell mit 125 Milliarden Hauptparametern plus 51 Milliarden Parametern an N-Gramm-Embeddings, das pro Inferenzschritt etwa 6 Milliarden aktiviert. Es verfügt über einen nativen Kontext von 262.000 Token, der laut Modellkarte in Richtung 1 Million reicht, und Alibaba gibt an, dass es mit etwa 90 Prozent geringeren Kosten als Qwen3.7-Plus trainiert wurde. Auf der Modellkarte werden drei Techniken genannt:
• QSA, ein Qwen-spezifisches Sparse-Attention-Verfahren, das den Mechanismus hinter der Behauptung des kostengünstigen Long-Context-Trainings darstellt
• Gesteuerte Residualverbindungen, eine Stabilitätsmaßnahme für tiefe sparse Netzwerke
• N-Gramm-Einbettungen, ein separater Parameterspeicher mit 51 Milliarden Parametern, der nachgeschlagen statt dicht berechnet wird
Wenn die Qwen-4-Tiers dieses Design übernehmen, ist die interessante Konsequenz wirtschaftlicher und nicht architektonischer Natur. Eine Familie, die darauf ausgelegt ist, mit etwa einem Zehntel der Trainingskosten Frontier-nahe Qualität zu erreichen, ist eine Familie, die aggressiv bepreist werden kann – und aggressive Preisgestaltung von Alibaba ist seit zwei Jahren die mit Abstand verlässlichste Kraft in der Ökonomie von Open-Weight-Modellen. Das ist eine Vorhersage, keine Tatsache, und sie sollte als solche gekennzeichnet werden – aber sie ist der Grund, diese Roadmap zu verfolgen, statt sie abzutun.
Was Sie ausführen können, während Sie warten
Nichts in der Qwen-4-Ankündigung ändert daran, was diese Woche verfügbar ist, und die ehrliche Antwort für jeden, der heute entwickelt, ist die Qwen-3.8-Generation. Qwen3.8-Max ist seit dem 3. August 2026 allgemein verfügbar, zu 2,00 US-Dollar pro Million Input-Token und 6,00 US-Dollar pro Million Output-Token, pauschal über den gesamten Kontext von 1 Million Token hinweg, ohne Zuschlag für lange Prompts, und seine Gewichte wurden am 12. August 2026 als Qwen3.8-2.4T-A95B sowohl in BF16 als auch in FP8 unter einer benutzerdefinierten Qwen-Lizenz veröffentlicht. Es ist das Modell, an dem sich die Qwen-4-Stufen messen lassen müssen, und es verarbeitet heute Produktionsverkehr.
Wenn du die aktuell verfügbare Qwen-Generation mit dem Rest der Frontier vergleichen möchtest, ohne für jedes Labor ein eigenes Konto, einen eigenen Schlüssel und eine eigene Abrechnung verwalten zu müssen, führt OrcaRouter die Qwen-3.8-Familie — Qwen3.8-Max, Qwen3.8-Flash und Qwen3.8-27B — neben Claude Opus 5, DeepSeek V4 Pro, Gemini 3.1 Pro Preview und GLM 5.3 auf einem OpenAI-kompatiblen Endpunkt. Das ist eine API für fast 200 Modelle mit 0 % Aufschlag, was bedeutet, dass der Listenpreis des Anbieters unverändert weitergegeben wird, sodass eine Preissenkung eines Anbieters noch am selben Tag bei deinem Schlüssel ankommt und nicht erst im nächsten Abrechnungszyklus. Wenn eine Qwen-4-Stufe tatsächlich auf den Markt kommt, wäre derselbe Katalog der Ort, an dem sie auftauchen würde; heute ist keine davon enthalten.

Das Fazit
Qwen 4 Max ist eine echte Ankündigung und kein echtes Produkt, und beide Hälften dieses Satzes sind wichtig. Die Aufstellung ist bestätigt: vier Stufen, eine Architektur der neuen Generation, ein agentischer Fokus und eine Open-Weight-Stufe mit 27B, die für mehr Menschen wichtiger sein wird als das Flaggschiff. Alles, was eine Kaufentscheidung braucht — Preis, Kontext, Modalität, Gewichte, Scores, ein Datum —, fehlt.
Betrachten Sie dies als Roadmap-Signal mit einer ungewöhnlich guten Papierspur, denn die Veröffentlichung von Qwen3.8-Flash-Next liefert Ihnen die Architekturvorschau kostenlos, und Qwen3.8-Max liefert Ihnen die etablierte Baseline mit veröffentlichten Gewichten und einem veröffentlichten Preis. Verfolgen Sie die 27B-Klasse wegen des Ökosystems, das sie schaffen wird, und die Flash-Klasse wegen der Durchsatzökonomie. Veröffentlichen Sie die Zahl von 5 bis 10 Billionen Parametern nicht als Fakt über Qwen 4 erneut, und planen Sie keine Migration um ein Modell herum, das kein Veröffentlichungsdatum hat — planen Sie sie um Qwen3.8-Max herum und wechseln Sie, sobald es einen Endpunkt gibt, zu dem Sie wechseln können.

