
Qwen 3.8 vs GLM-5.2: Der erste Benchmark, bei dem sie sich tatsächlich überschneiden
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
Diese beiden Modelle sind der deutlichste Ausdruck gegensätzlicher Wetten in der chinesischen Open-Weight-KI. Zhipus GLM-5.2 ist schlank und bewährt: insgesamt 753 Milliarden Parameter, davon nur 40 Milliarden aktiv, ein geprüfter Artificial Analysis Intelligence Index von 51, seit Juni 2026 herunterladbare Gewichte und ein veröffentlichter Preis von 0,95 $ / 3,00 $. Alibabas Qwen3.8-Max ist die maximalistische Wette: rund 2,4 Billionen Parameter, eine nicht offengelegte Anzahl aktiver Parameter und — bis vor Kurzem — überhaupt keine Zahlen.
Die allgemeine Verfügbarkeit am 3. August 2026 gab diesem Vergleich etwas, das kein anderer Artikel dieser Serie hat:einen Benchmark, bei dem beide Modelle einen Wert haben. Alibaba gibt Terminal-Bench 2.1 mit 86.6 an; Artificial Analysis hat GLM-5.2 bei 82.7 auf demselben Test geprüft. Zum ersten Mal kann Qwens Behauptung auf identischer Grundlage neben eine unabhängig gemessene Konkurrenzzahl gestellt werden – mit der wichtigen Einschränkung, dass nur eine der beiden von einem Schiedsrichter stammt.
Ein Hinweis für Entwickler — der schnellste Weg, das zu klären, ist, beide mit eigenen Prompts laufen zu lassen. OrcaRouter stellt 200+ Modelle hinter einen einzigen OpenAI-kompatiblen Endpunkt, sodass man Qwen 3.8 Max gegen GLM-5.2 bei derselben Aufgabe antreten lassen kann, ohne zwei SDKs einzubinden.
TL;DR-Fazit. Bei dem einzigen gemeinsamen Benchmark behauptet Qwen einen 3.9-Punkte-Vorsprung auf Terminal-Bench 2.1 (86.6 vs 82.7) — ein reales Ergebnis, wenn es sich wiederholen lässt, auch wenn Qwens Zahl selbst gemeldet ist und GLMs geprüft ist. Ansonsten hat GLM-5.2 die praktischen Vorteile: es ist ~2× günstiger bei $0.95 / $3.00 gegenüber Qwens $2 / $6, seine Gewichte sind heute herunterladbar, seine 40B aktiven Parameter machen es wirklich einsatzbereit, und es hat einen unabhängigen Indexwert von 51, wo Qwen keinen hat. Qwen antwortet mit einem Flatrate-Kontext von 1M Token, nativer Multimodalität, die GLM fehlt, und einer höheren potenziellen Obergrenze. Schlank und bewährt schlägt für die Produktion immer noch groß und unverifiziert — aber die Lücke schloss sich am 3. August.
Wichtige Erkenntnisse
• Erste direkte Benchmark-Überschneidung in der Serie: Terminal-Bench 2.1 — Qwen3.8-Max 86.6 (von Alibaba gemeldet) gegen GLM-5.2 82.7 (Artificial Analysis, auditiert). Qwen führt mit 3.9 Punkten, aber die beiden Zahlen sind nicht gleichermaßen vertrauenswürdig.
• GLM-5.2 kostet etwa die Hälfte: $0.95 / $3.00 pro 1M (AA gemischt ~$0.90) gegenüber Qwen3.8-Max' $2 / $6.
• Aktive Parameter sind die eigentliche Architektur-Story: GLM-5.2 nutzt 40B aktive von 753B insgesamt. Alibaba hat immer noch nicht die aktive Anzahl von Qwen offengelegt, was seine Serving-Kosten unmodellierbar macht.
• GLMs Gewichte sind heute herunterladbar; Qwens werden noch diese Woche versprochen, bisher ohne Lizenz oder Repository.
• GLM-5.2 hat einen geprüften Index von 51. Qwen3.8-Max bleibt unbewertet — obwohl sein Vorgänger Qwen3.7-Max 46 erzielte, unter GLM.
• Qwens einzigartige Angebote: ein 1M-Token-Fenster, pauschal abgerechnet ohne Aufschlag für lange Prompts, plus nativer Text-/Bild-/Videoeingabe und OmniDocBench 1.5 92.1. GLM-5.2 ist textfokussiert.
Hinweis zur Genauigkeit: Alle Qualitätsangaben zu Qwen3.8-Max stammen von Alibaba und sind nicht durch Dritte verifiziert. Die Angaben zu GLM-5.2 stammen von Artificial Analysis. Der Vergleich eines selbst gemeldeten Ergebnisses mit einem geprüften Ergebnis auf derselben Benchmark ist aufschlussreich, aber nicht aussagekräftig – die Harnesses (Testumgebungen) von Anbieter und Bewerter unterscheiden sich. Die Qwen-Preise entsprechen der GA-Preisliste und ersetzen den Vorschaurabatt vom Juli.
Die technischen Daten und der Preis, Seite an Seite
Hier sind die harten Daten, jede Zahl mit ihrer Quelle versehen.
• Hersteller / Status — Qwen3.8-Max: Alibaba; GA (3. August 2026); GLM-5.2: Zhipu; veröffentlicht Juni 2026
• Architektur — Qwen3.8-Max: ~2,4 Billionen insgesamt, sparse MoE; GLM-5.2: 753 Milliarden insgesamt, sparse MoE (Artificial Analysis)
• Aktive Parameter — Qwen3.8-Max: weiterhin nicht von Alibaba offengelegt; GLM-5.2: 40B aktiv (Artificial Analysis)
• Kontextfenster — Qwen3.8-Max: 1M Tokens, Flatrate (983.616 mit Denken; max. Ausgabe 131.072); GLM-5.2: 1M Tokens (Artificial Analysis)
• Terminal-Bench 2.1 — Qwen3.8-Max: 86.6 (von Alibaba gemeldet); GLM-5.2: 82.7 (Artificial Analysis, geprüft)
• AA Intelligence Index — Qwen3.8-Max: Noch nicht bewertet; GLM-5.2: 51 (Artificial Analysis)
• Von anderen Anbietern gemeldete Scores — Qwen3.8-Max: GPQA Diamond 92.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (von Alibaba gemeldet); GLM-5.2: Wert von Drittanbietern gemessen
• Modalitäten — Qwen3.8-Max: Text, Bild, Video rein → Text raus; GLM-5.2: textfokussiert
• Preise (Eingabe / Ausgabe) — Qwen3.8-Max: $2.00 / $6.00 pro 1M, pauschal; Cache-Eingabe $0.25; GLM-5.2: $0.95 / $3.00 pro 1M (AA gemischt ~$0.90)
• Offene Gewichte — Qwen3.8-Max: Für diese Woche versprochen (noch keine Lizenz); GLM-5.2: Ja — heute herunterladbar
Zwei Dinge rahmen diesen Vergleich ein, und das erste ist der nützlichste Datenpunkt der gesamten Serie.
Zunächst, die Überschneidung bei Terminal-Bench ist wirklich aufschlussreich. Terminal-Bench 2.1 misst, ob ein Modell eine echte Shell bis zum Abschluss bedienen kann – Befehle ausführen, Ausgabe lesen, sich von Fehlern erholen. Es ist der beste verfügbare Indikator dafür, ob etwas als Coding-Agent statt nur als Code-Vorschlagsfunktion fungieren kann, und es ist der Benchmark, den beide Anbieter gewählt haben, um darüber zu berichten. Qwens 86,6 gegenüber GLMs geprüften 82,7 ist ein Vorsprung von 3,9 Punkten zugunsten von Qwen.
Der Vorbehalt ist wichtig, sollte aber nicht überbewertet werden. Anbieter-Harnesses und Evaluator-Harnesses unterscheiden sich im Scaffolding, in der Retry-Policy und im Prompt-Aufbau, und diese Entscheidungen können ein Terminal-Bench-Ergebnis um mehr als vier Punkte verschieben. Das ist also kein Beweis dafür, dass Qwen das bessere agentische Modell ist. Was es jedoch belegt, ist, dass Qwens selbst gemeldete Angabe im selben wettbewerbsfähigen Bereich liegt wie ein geprüftes Open-Weight-Spitzenmodell und nicht in unplausiblem Terrain. Das ist eine deutlich stärkere Position als „unbewertet“.
Zweitens, beim Architekturvergleich gewinnt GLM leise. GLM-5.2 aktiviert 40B Parameter von 753B. Diese eine Zahl verrät Ihnen die Serving-Kosten, das Latenzprofil und dass ein gut ausgestattetes Team es tatsächlich betreiben kann. Alibaba hat die Zahl der aktiven Parameter von Qwen immer noch nicht veröffentlicht — was bedeutet, dass niemand außerhalb von Alibaba trotz allem, was die 2,4-Billionen-Schlagzeile vermittelt, abschätzen kann, was es kostet, Qwen3.8-Max zu betreiben oder wie es sich im Selbsthosting verhalten würde. In einem Mixture-of-Experts-Vergleich ist das keine Fußnote; es ist die wichtigste fehlende Zahl.

Schlank und bewährt vs. groß und ungeprüft
Der Fall von GLM-5.2 basiert auf einer kohärenten technischen Position: mit weniger mehr erreichen, die Zahlen veröffentlichen, die Gewichte ausliefern. Ein 40B-aktives Modell ist kostengünstig zu betreiben, von Natur aus schnell und von einem Team mit einem ernsthaften, aber nicht absurden GPU-Budget einsetzbar. Sein geprüfter Index von 51 und sein geprüfter Terminal-Bench von 82,7 bedeuten, dass ein Käufer nichts blind vertrauen muss. Und bei $0.95 / $3.00 ist es ungefähr halb so teuer wie Qwen.
Qwen3.8-Max' Fall ist die gegenteilige Wette: Baue das größte Modell, das du kannst, und lass die Leistungsfähigkeit die Kosten rechtfertigen. GA hat diesen Fall viel stärker gemacht, als er war, weil es endlich Zahlen gibt — GPQA Diamond 92.6 bei Graduiertenwissenschaften, OSWorld-Verified 86.1 bei der GUI-Bedienung, FrontierSWE 73.5 gegenüber 40,7 eines Vorgängermodells und die oben besprochene Terminal-Bench 86,6. Das sind Werte auf Frontier-Niveau, und die nahezu Verdoppelung bei FrontierSWE ist die Art von Generationssprung, die sich kaum vollständig vortäuschen lässt.
Aber zwei Lücken bestehen fort, und es sind dieselben zwei, die im Juli eine Rolle spielten. Es gibt keinen unabhängigen Score — Artificial Analysis und LMArena bleiben bei Qwen3.8-Max unbewertet, also stammt jede Qualitätsbehauptung von Alibaba selbst. Und es gibt keine Lizenz, sodass das Open-Weight-Versprechen noch nicht kommerziell bewertet werden kann.
Der historische Anker wirkt hier stärker gegen Qwen als in den meisten Vergleichen: der Vorgänger Qwen3.7-Max erreichte 46 beim AA-Index, unter der 51 von GLM-5.2. Alibabas implizite Behauptung ist also nicht nur, dass Qwen3.8-Max gut ist, sondern dass es in einer Generation von unter GLM auf deutlich darüber gesprungen ist. Die Verbesserung beim FrontierSWE verleiht dieser Behauptung etwas Glaubwürdigkeit. Eine unabhängige Punktzahl würde das klären.

Kosten in der Praxis: Wo 2× landet
Nehmen Sie eine agentische Codierungs-Pipeline: 180.000 Token Repository-Kontext, 10.000 Token Ausgabe pro Lauf.
• GLM-5.2: 0.18M × $0.95 = $0.171, plus 0.01M × $3.00 = $0.03. ≈ $0.20 pro Lauf.
• Qwen3.8-Max: 0,18M × $2 = $0,36, plus 0,01M × $6 = $0,06. ≈ $0,42 pro Durchlauf.
• Bei 3.000 Läufen/Tag: GLM ≈ 603 $/Tag; Qwen ≈ 1.260 $/Tag — etwa 20.000 $/Monat auseinander.
• Mit Qwens gecachtem Input bei 0,25 $/1M in einem stabilen Repository sinken die Kosten auf ≈ 0,11 $, was tatsächlich die Kosten von GLM ohne Cache unterbietet.
Diese letzte Zeile ist das praktisch Nützlichste in diesem Vergleich. Qwens Listenpreis ist doppelt so hoch wie der von GLM, aber seine Cache-Trefferrate von 0,25 $ pro 1 M ist aggressiv genug, dass eine gut gecachte Pipeline die Rangfolge umdrehen kann. Wenn Ihr Agent bei jeder Runde einen weitgehend unveränderten Kontext erneut liest – was auf die meisten Coding-Agenten zutrifft –, kann Qwen in der Praxis die günstigere Option sein, trotz der schlechteren Preisliste. Teams, die kein Caching konfigurieren, zahlen doppelt für nichts.
Beide Modelle berechnen Thinking-Tokens als Ausgabe, daher kosten reasoning-intensive Konfigurationen auf beiden Seiten mehr als diese Schätzungen.
Bereitstellbarkeit: die Achse, die GLM besitzt
Beide sind chinesische Open-Weight-MoE-Modelle mit 1M-Token-Kontextangaben, was die Bereitstellbarkeit zum schärfsten praktischen Unterschied macht.
Die Gewichte von GLM-5.2 sind seit Juni herunterladbar, und mit 40B aktiven Parametern ist es ein realistisches Ziel für Selbsthosting – quantisierbar, auf einer angemessenen Anzahl an GPUs betreibbar und bereits von der Community erprobt.
Die Gewichte von Qwen3.8-Max sind für diese Woche angekündigt, aber das Flaggschiff ist für niemanden ein realistisches Ziel: etwa 1,2 TB bei 4-Bit gegenüber etwa 141 GB pro H200 bedeutet acht oder mehr High-End-Beschleuniger, und die nicht offengelegte Anzahl aktiver Parameter macht den resultierenden Durchsatz unmöglich vorherzusagen. Hinzu kommt die fehlende Lizenz, und das Self-Hosting des Flaggschiffs ist derzeit kein Plan.
Das gleichzeitig angekündigte Qwen3.8-27B ist Alibabas echte Antwort in dieser Hinsicht. Darüber hinaus ist es als Open-Weight-Modell verfügbar und benötigt Berichten zufolge etwa 17 GB VRAM – eine einzelne High-End-Grafikkarte, weit unter dem Speicherbedarf von GLM-5.2 – und konkurriert damit direkt in Bezug auf die Bereitstellbarkeit. Wenn Ihr Interesse an einem der beiden Modelle darin besteht, es selbst auszuführen, ist der Vergleich zwischen Qwen 27B und GLM-5.2 der, auf den es wirklich ankommt, und es ist ein viel engeres Rennen als 2,4T gegen 753B.
FAQ
Ist Qwen 3.8 besser als GLM-5.2?
Bei dem einzigen Benchmark, den sie gemeinsam haben, {{1}}behauptet Qwen, vorn zu liegen{{/1}} — Terminal-Bench 2.1 86,6 gegenüber GLMs geprüftem 82,7. Aber Qwens Wert ist selbst angegeben und {{2}}GLMs wurde von Artificial Analysis gemessen{{/2}}, und Unterschiede im Testaufbau können mehr als vier Punkte ausmachen. GLM-5.2 weist zudem einen geprüften Index von 51 auf, während Qwen überhaupt keinen unabhängigen Wert hat. {{3}}GLM ist die sicherere Wahl{{/3}}; {{4}}Qwen hat die höhere unverifizierte Obergrenze{{/4}}.
Wie schneiden sie beim Terminal-Bench 2.1 ab?
Qwen3.8-Max meldet 86,6; Artificial Analysis hat GLM-5.2 mit 82,7 gemessen. Das ist ein nomineller Vorsprung von 3,9 Punkten für Qwen und die erste Überschneidung bei derselben Benchmark zwischen ihnen. Betrachten Sie es als Beleg, dass Qwen in diesem Bereich wettbewerbsfähig ist, nicht als Beweis, dass es vorn liegt, da nur GLMs Zahl unabhängig ermittelt wurde.
Welches ist günstiger?
GLM-5.2 auf der Preisliste — 0,95 $ / 3,00 $ pro 1M (AA-Mischpreis ~0,90 $) gegenüber Qwens 2 $ / 6 $, also ungefähr die Hälfte. Aber der gecachte Input von Qwen zu 0,25 $ pro 1M ist aggressiv genug, dass eine Pipeline mit hohem Cache-Anteil auf Qwen am Ende billiger sein kann als bei GLM ohne Cache.
Wie viele aktive Parameter verwendet Qwen 3.8 Max?
Alibaba hat die Zahl selbst zur allgemeinen Verfügbarkeit nie veröffentlicht. Das ist die Kennzahl, die in einem Mixture-of-Experts-Modell die Bereitstellungskosten und die Latenz bestimmt, daher ist ihr Fehlen eine echte Lücke. GLM-5.2 hingegen ist mit 40B aktiven von insgesamt 753B Parametern dokumentiert.
Welche kann ich eigentlich selbst hosten?
GLM-5.2 heute — die Gewichte sind veröffentlicht, und 40B aktiv macht es handhabbar. Die Gewichte von Qwen3.8-Max sind innerhalb der Woche versprochen, aber das Flaggschiff benötigt acht oder mehr GPUs der H200-Klasse bei ~1,2 TB in 4-Bit, wobei noch keine Lizenz veröffentlicht wurde. Das gleichzeitig angekündigte Qwen3.8-27B, Berichten zufolge ~17 GB VRAM, ist die einsetzbare Qwen-Option und passt näher zu GLMs Nische.
Hat Qwen 3.8 Max die Vorschauphase verlassen?
Ja, am 3. August 2026, mit einer veröffentlichten Preisliste und einem OpenAI- und DashScope-kompatiblen Endpunkt. Die Qoder-Credits-Kampagne vom Juli mit 90 % Rabatt beschreibt nicht mehr, wie sie verkauft wird.
Was bietet Qwen, das GLM-5.2 nicht bietet?
Native Multimodalität — Bild- und Videoeingabe, mit einem selbst angegebenen OmniDocBench-Wert von 92,1 für die Dokumentanalyse — sowie ein 1M-Token-Kontext zum Festpreis ohne Aufpreis für lange Prompts. GLM-5.2 ist textfokussiert, daher konkurriert Qwen bei Dokument-, Screenshot- oder Video-Pipelines nicht so sehr mit ihm, sondern macht etwas anderes.
Fazit
Qwen 3.8 vs GLM-5.2 ist das Duell, bei dem die allgemeine Verfügbarkeit die meisten wirklich neuen Informationen geliefert hat. Zum ersten Mal hat Qwen einen Wert in einem Benchmark, den auch ein unabhängiger Bewerter durchgeführt hat, und liegt dabei über GLM: Terminal-Bench 2.1 86.6 gegen 82.7. Das bringt Qwen von „nicht bewertet“ zu „plausibel wettbewerbsfähig auf gemessener Basis“, was ein echter Fortschritt ist, selbst wenn man den Vorbehalt der Selbstauskunft berücksichtigt.
Aber GLM-5.2 behält die Krone der Praktikabilität, und zwar durch unglamouröse Stärken: den halben Preis, einen geprüften Index von 51, 40B aktive Parameter, die seine Wirtschaftlichkeit vorhersehbar und seine Bereitstellung machbar machen, und Gewichte, die Sie sofort herunterladen können. Qwens Antworten — ein Flatrate-Kontext mit einer Million Token, native Multimodalität und eine höhere Obergrenze — sind bedeutsam, aber an Bedingungen geknüpft, und seine beiden Juli-Lücken sind unverändert: kein unabhängiger Score und keine Lizenz. Achten Sie auf drei Dinge: den ersten unabhängigen Intelligence-Index-Score für Qwen3.8-Max, ob ein Evaluator die 86,6-Terminal-Bench-Zahl reproduziert, und das Qwen3.8-27B-Release, wo diese beiden Philosophien wirklich aufeinandertreffen werden. Bis dahin ist GLM-5.2 das, was Sie ausliefern, und Qwen3.8-Max das, was Sie evaluieren — mit aktiviertem Caching.

In diesem Artikel verglichen3
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
