
Qwen 4 Max vs. GLM-5.3: offene Gewichte, individuelle Lizenzen und die Stufe, die tatsächlich ausgeliefert wird
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen 4 Max wurde am 22. September 2026 auf der Yunqi-Konferenz in Hangzhou als Flaggschiff einer Vier-Modell-Reihe vorgestellt, zu der auch Qwen 4 Flash, Qwen 4 Plus und eine Open-Weight-Stufe Qwen 4 27B gehören. GLM-5.3 von Z.ai wird seit dem 18. August 2026 gelistet, rein textbasiert, mit einem Kontextfenster von 1 Million Tokens und einer Obergrenze von 128.000 Tokens für die Ausgabe, zu 1,26 $ pro Million Eingabe-Tokens und 3,96 $ pro Million Ausgabe-Tokens in unserem Katalog, gegenüber den Listenpreisen von 1,40 $ und 4,40 $, die Z.ai veröffentlicht. Beide Labore stammen aus der Open-Weights-Tradition und beide verkaufen inzwischen Frontier-Modelle über gehostete APIs, sodass die übliche Gegenüberstellung von geschlossen und offen hier nicht greift. Die Achse, die tatsächlich zutrifft, ist diejenige, die niemand in eine Vergleichstabelle schreibt: was die Lizenz tatsächlich erlaubt und welche Stufe in jeder Familie die ist, mit der man überhaupt etwas Interessantes tun darf.
Zwei Labore, zwei Antworten auf dieselbe Frage
Alibaba und Z.ai sind die beiden beständigsten Open-Weights-Veröffentlicher unter den frontier-nahen Labors, und sie haben unterschiedliche Haltungen dazu eingenommen, wie viel von dieser Offenheit bis in die Flaggschiff-Klasse überlebt.
Die Qwen-3.8-Generation von Alibaba hat am 12. August 2026 Gewichte für ihr größtes Modell veröffentlicht – Qwen3.8-2.4T-A95B, in BF16 und FP8. Sie wurden unter einer eigenen Qwen-Lizenz veröffentlicht, nicht unter Apache 2.0. Genau darin liegt der entscheidende Unterschied: Die Gewichte existieren, was bedeutet, dass Feinabstimmung, Quantisierung und Selbst-Hosting möglich sind – auf eine Weise, wie sie bei einem geschlossenen Modell nie möglich sein werden –, doch die Bedingungen sind Alibabas eigene und nicht der permissive Standard, den der Ausdruck „offene Gewichte“ gemeinhin nahelegt.
Z.ais GLM-Reihe stammt aus einem Labor mit einer Open-Weights-Tradition, und das Flaggschiff bildet darauf keine Ausnahme mehr. Die eigenen Gewichte von GLM-5.3 wurden am 28. August 2026 veröffentlicht – das Flaggschiff mit 743 Milliarden Parametern, in 141 Safetensors-Shards – unter einer eigenen Lizenz, die Z.ai dafür geschrieben hat, statt unter MIT. Die Bedingungen entsprechen grob einer MIT-Gewährung mit einer angehängten Sicherheitsüberprüfungsauflage für Model-as-a-Service-Unternehmen oberhalb einer hohen Umsatzschwelle. Man beachte, was das für die Familie bedeutet: GLM-5.2 und GLM-5.3-Flash tragen MIT, das Flaggschiff nicht.
Wie angegeben ist GLM-5.3 ein reines Textmodell mit einem veröffentlichten Kontextfenster, einer veröffentlichten Ausgabegrenze und dokumentierter Tool-Nutzung, JSON-Modus und Reasoning.
Stell die beiden nebeneinander, und der praktische Kontrast ist folgender:
• Flaggschiff-Gewichte — Qwen 3.8-Flaggschiff veröffentlicht unter einer eigenen Qwen-Lizenz gegenüber GLM-5.3-Gewichten, veröffentlicht am 28. August 2026 unter einer eigenen Z.ai-Lizenz
• Eingabepreis — Qwen3.8-Max 2,00 $ pro 1 Mio. Tokens gegenüber GLM-5.3 1,26 $ pro 1 Mio. Tokens in unserem Katalog, 1,40 $ auf der eigenen Liste von Z.ai
• Ausgabepreis — Qwen3.8-Max 6,00 $ pro 1 Mio. Token im Vergleich zu GLM-5.3 3,96 $ pro 1 Mio. Token in unserem Katalog, 4,40 $ auf Z.ais eigener Liste
• Kontext — Qwen3.8-Max 1 Mio. Token gegenüber GLM-5.3 1 Mio. Token
• Ausgabeobergrenze — Qwen3.8-Max 128K Token gegenüber GLM-5.3 128K Token
• Modalität — Qwen3.8-Max mit Text-, Bild- und Videoeingabe versus GLM-5.3 nur mit Text, als solche dokumentiert
• Fähigkeits-Tags — Qwen3.8-Max Vision, Tools, JSON und Reasoning gegenüber GLM-5.3 Tools, JSON und Reasoning
• Qwen 4 Max — angekündigt am 22. September 2026, kein Preis, kein Kontext, keine Gewichte, kein Datum gegenüber GLM-5.3, das ausgeliefert wurde und Traffic bedient
Die multimodale Reihe ist es, die die Preislücke finanziert. Qwens Flaggschiff nimmt Bild- und Videoeingaben entgegen und berechnet 2,00 $ für die Eingabe und 6,00 $ für die Ausgabe; GLM-5.3 nimmt Text entgegen und berechnet 1,26 $ und 3,96 $. Wenn Ihre Arbeitslast Text ist, zahlen Sie einen Vision-Encoder-Aufschlag, den Sie nie nutzen, und das ist der konkreteste Grund, warum ein reiner Text-Spezialist ein multimodales Flaggschiff bei Textarbeit kostenseitig unterbietet.

Die 27B-Stufe ist diejenige, die hierüber entscheidet.
Qwen 4 Max ist die Schlagzeile, und die 27B-Stufe ist die eigentliche Geschichte. Jede Qwen-Generation hat ihre kleine offene Stufe unter Bedingungen veröffentlicht, die es Leuten ermöglichen, Dinge zu tun, und die nachgelagerten Belege sind eindeutig: Innerhalb von Tagen nach dem Eintreffen der Qwen 3.8 27B-Gewichte hatte das Ökosystem MLX-Konvertierungen, NVFP4-Quantisierungen und unzensierte Fine-Tunes hervorgebracht – wofür niemand eine Erlaubnis benötigte. Das ist es, was eine permissive Veröffentlichung kleiner Modelle einbringt, und es ist eine Form der Verbreitung, mit der keine gehostete API mithalten kann.
Die Flaggschiff-Stufe ist eine andere Sache. Ein Modell mit 2,4 Billionen Parametern, das unter einer individuellen Lizenz veröffentlicht wird, ist in dem Sinne offen, dass die Bytes herunterladbar sind, und in dem Sinne geschlossen, dass das, was man damit tun darf, vom Herausgeber festgelegt wird. Beides gilt gleichzeitig, und die Ankündigung von Qwen 4 hat daran nichts geändert. Wenn die 27B-Stufe von Qwen 4 dem Muster ihrer Vorgänger folgt, wird sie die Veröffentlichung sein, die für die größte Zahl von Menschen zählt, und sie ist zugleich die Veröffentlichung mit dem am besten vorhersehbaren Termin, weil kleine offene Stufen auf der Roadmap am einfachsten fertigzustellen sind.
Womit der Vergleich wieder auf etwas Brauchbares zurückkommt. GLM-5.3 ist ein gehostetes Modell zu einem veröffentlichten Preis mit einem dokumentierten Funktionsumfang, und es ist jetzt verfügbar. Qwen 4 Max ist ein Tarifname. Wenn du willst, dass das Offenheitsargument konkret statt philosophisch wird, ist das Modell, auf das man warten sollte, das 27B, nicht das Max.
Die Routing-Schicht ist der Punkt, an dem die Lizenzfrage keine Rolle mehr spielt.
Es gibt eine Variante dieser Entscheidung, die die Lizenzfrage vollständig umgeht, und es lohnt sich, ehrlich zu sagen, dass sie eine echte Option und nicht bloß ein Kompromiss ist. Wenn Ihre Anforderung darin besteht, ein Modell aufzurufen statt eines zu besitzen, ist die Lizenz für die Gewichte irrelevant, und die Bedingungen, auf die es ankommt, sind der Preis, die Latenz und das Ausfallverhalten.
OrcaRouter führt GLM-5.3 als z-ai/glm-5.3 zu $1,26 pro Million Input-Tokens und $3,96 pro Million Output-Tokens — unter den $1,40 und $4,40, die Z.ai veröffentlicht, wobei die Modellseite diese Listenpreise neben dem Preis anzeigt, den wir berechnen, und kein Aufschlag auf den Betrag erhoben wird, den wir dem Anbieter zahlen. Derselbe OpenAI-kompatible Endpunkt führt die Qwen-3.8-Familie, Qwen3.8-Max, Qwen3.8-Flash und Qwen3.8-27B, zusammen mit fast 200 weiteren Modellen, mit automatischem Failover, wenn ein Anbieterpfad beeinträchtigt ist, und einer Routing-DSL, mit der Sie die Substitutionsrichtlinie explizit ausdrücken können, statt einen Modell-String im Anwendungscode zu bearbeiten. Wenn ein Anbieter seinen Preis ändert, schlägt die Änderung noch am selben Tag auf Ihrem Schlüssel durch, weil es keine Margenebene gibt, hinter der sie hängen bleiben könnte.
Was OrcaRouter nicht führt, ist Qwen 4 Max oder irgendeine Qwen-4-Stufe. Der Katalog enthält keinen Eintrag für die Familie, was der korrekte Zustand für ein Modell ist, das auf einer Bühne angekündigt wurde und noch nicht ausgeliefert wurde. Qwen 4 Max wird, wenn überhaupt, über die eigene API des Anbieters und mehrere Drittanbieterplattformen erreichbar sein. Bis dahin ist das Qwen-Modell in diesem Vergleich, das Sie tatsächlich aufrufen können, Qwen3.8-Max, und es ist im selben Katalog wie GLM-5.3 — was die Live-Version dieses Duells zu einer Routing-Policy-Entscheidung statt zu einer Beschaffungsentscheidung macht.

Was die Lizenzfrage tatsächlich entscheidet
GLM-5.3 ist auf beiden Achsen günstiger, sein Kontextfenster und seine Ausgabeobergrenze entsprechen denen des Qwen-Flaggschiffs, seine Modalitätsgrenzen sind dokumentiert und nicht der Spekulation überlassen, und es bedient heute bereits Traffic. Qwen 4 Max hat einen Konferenz-Slot und einen Tier-Namen, und der einzige Teil der Qwen 4 Roadmap mit einer planbaren Auslieferung ist die 27B-Tier.
Die Entscheidung, die den Launch überdauert, ist nicht, welches Modell besser ist. Sie ist die Frage, ob Sie das Ding selbst besitzen müssen. Wenn Sie selbst hosten, feinabstimmen oder verändern müssen, bringen die Flaggschiff-Gewichte beider Labore Bedingungen mit, die Sie lesen sollten, bevor Sie ein Geschäft darauf aufbauen, und in der kleinen offenen Stufe waren die permissiven Optionen historisch zu Hause. Wenn Sie ein Modell aufrufen müssen, ist GLM-5.3 heute die günstigere Antwort für Textarbeit, Qwen3.8-Max ist die Antwort, wenn Sie Bild- oder Videoeingabe benötigen, und beide sind nur einen Endpunkt und eine Abrechnung entfernt. Kommen Sie auf die Flaggschiff-Frage zurück, wenn Alibaba eine Modellkarte veröffentlicht, und lesen Sie die Lizenz vor der Benchmark-Tabelle.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
