
Was ist GLM-5.2? Z.ais 1M-Kontext-Flaggschiff mit offenen Gewichten, zwei Versionen später
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GLM-5.2 ist ein rein textbasiertes Großes Sprachmodell mit offenen Gewichten von Z.ai, dem Pekinger Labor, das früher als Zhipu AI bekannt war, veröffentlicht am 16. Juni 2026 unter der MIT-Lizenz. Es ist ein Mixture-of-Experts-Modell mit 753 Milliarden Parametern und einem Kontextfenster von einer Million Token, und etwa zwei Monate lang war es das stärkste Open-Weight-Coding-Modell, das man herunterladen konnte. Diese Position hält es nicht mehr, denn Z.ai hat seitdem zwei Nachfolger auf den Markt gebracht, die auf ihm aufbauen – genau der Teil, den die meisten Seiten über GLM-5.2 auslassen, und der Teil, der entscheidet, ob Sie sich noch dafür interessieren sollten.
Dreiundvierzig Artikel im Archiv dieses Blogs erwähnen GLM-5.2. Bis jetzt handelte keiner von ihnen von ihm: Das Modell erscheint als Gegner in einem Vergleich nach dem anderen, als der feste Bezugspunkt, an dem neuere Modelle gemessen werden. Das ist eine seltsame Rolle für ein Modell, das sein eigener Hersteller bereits hinter sich gelassen hat, und sie ist der Grund, warum es diese Seite gibt – eine klare Beschreibung dessen, was GLM-5.2 tatsächlich ist, was es kostet, worin es gut ist und wer es noch wählen sollte.
Wo GLM-5.2 in der eigenen Produktlinie von Z.ai steht
Z.ai veröffentlicht ein datiertes Release-Log, und es ist die sauberste Quelle dafür. Liest man es der Reihenfolge nach, ist die Gestalt der Familie offensichtlich:

• GLM-5 — 12. Februar 2026. Das erste GLM-5, ausgerichtet auf komplexe Systemtechnik und langfristige Agentenaufgaben.
• GLM-5.1 — 7. April 2026. Arbeit über lange Zeiträume, kann in einem einzigen Lauf bis zu acht Stunden allein arbeiten.
• GLM-5.2 — 16. Juni 2026. Das 1M-Kontext-Flaggschiff für langfristige Aufgaben; das Log von Z.ai beschreibt es als „1M verlustfreier Kontext, deutlich verbesserte Fähigkeiten für langfristige Aufgaben“.
• GLM-5.3 — 18. August 2026. Dasselbe Basismodell wie GLM-5.2, wobei die Verbesserungen aus dem Post-Training stammen. Z.ai meldet einen Zuwachs von 50 % gegenüber GLM-5.2 in seinem hauseigenen Code Bench und Open-Source-Stand der Technik bei Terminal Bench 3.0.
• GLM-5.3-Flash — 26. August 2026. Ein anderes, kleineres Modell auf einer neu trainierten Basis (320B insgesamt, 18B aktiv), das erste nativ multimodale GLM-5.
Die wichtige Zeile ist der GLM-5.3-Eintrag. GLM-5.3 ist kein größeres GLM-5.2 – es sind dieselben Basisgewichte, die mit Post-Training weiter vorangetrieben wurden. Das macht GLM-5.2 zum letzten Modell der Produktlinie, dessen Fähigkeit aus der Architektur kam, und GLM-5.3 zum aktuellen Text-Flaggschiff. Wenn Sie heute ein Z.ai-Modell allein aufgrund der Qualität wählen, ist GLM-5.3 die Antwort und GLM-5.2 nicht.
GLM-5.3-Flash ist ein separater Zweig und nicht etwa ein günstigeres GLM-5.3: ein kleineres, nativ multimodales Modell (Text, Bild und Video), das preislich eine Größenordnung unter den Text-Flaggschiffen liegt. Wenn Sie Vision benötigen, ist GLM-5.2 in beiden Fällen nicht das Modell, das Sie wollen.
Das Datenblatt
• Parameter — insgesamt 753B, laut der Modellkarte unter zai-org/GLM-5.2-FP8. Z.ai gibt die Anzahl der aktiven Parameter auf dieser Karte nicht an; Drittanbieter-Angaben beziffern sie auf etwa 40B pro Token, und wir konnten diese Zahl nicht aus einer Primärquelle bestätigen.
• Kontextfenster — 1M Token, auf der Karte beschrieben als „ein solides 1M-Token-Kontextfenster, das Arbeit über lange Zeithorizonte stabil aufrechterhält“.
• Maximale Ausgabe — 128K Token.
• Modalität — Text rein, Text raus. Keine Bildeingabe, kein Audio. Unser eigener Katalogeintrag für das Modell gibt an, dass es „nur Texteingabe unterstützt“.
• Lizenz — MIT, ohne regionale Einschränkungen. Die Gewichte werden über die zai-org Organisation auf Hugging Face in BF16- und FP8-Varianten veröffentlicht.
• Reasoning-Steuerung — ein hybrider Denkmodus, gesteuert durch einen reasoning_effort-Parameter mit den Einstellungen high und max, standardmäßig auf max. Native Tool-Aufrufe und strukturierte Ausgabe werden unterstützt.
• Architektur — IndexShare, das einen einzigen leichtgewichtigen Indexer über jeweils vier Sparse-Attention-Schichten hinweg wiederverwendet und laut Modellkarte die FLOPs pro Token bei vollem Kontext um das 2,9-Fache senkt; dazu eine verbesserte Multi-Token-Prediction-Schicht, die die Akzeptanzlänge von Speculative Decoding um bis zu 20 % erhöht.
• Trainingshardware — Presseberichte zum Start geben an, dass das Modell auf Huawei-Ascend-Beschleunigern ohne Nvidia-Hardware trainiert wurde. Das ist eine Behauptung aus der Berichterstattung, nicht aus der Modellkarte, und wir geben sie als solche weiter.

Worin GLM-5.2 messbar gut ist
Fast alles, worin GLM-5.2 gut ist, ist eine Coding- oder Agentic-Messung, und die unten stehenden Zahlen sind Anbieterangaben – sie stammen aus der Benchmark-Tabelle auf der eigenen Model Card von Z.ai, nicht aus einer unabhängigen Reproduktion.
• Terminal Bench 2.1 (Terminus-2) — 81,0 gegenüber 63,5 für GLM-5.1. Das ist der größte Generationssprung in der Tabelle.
• SWE-bench Pro — 62,1 gegenüber 58,4 für GLM-5.1.
• FrontierSWE (Dominance) — 74,4 gegenüber 30,5 für GLM-5.1 und 72,6 für GPT-5.5.
• AIME 2026 — 99,2. GPQA-Diamond — 91,2. Beide sind in Z.ais eigener Tabelle problemlos konkurrenzfähig mit der geschlossenen Frontier.
• MCP-Atlas (öffentliches Set) — 76,8, praktisch gleichauf mit Claude Opus 4.8 mit 77,8 in derselben Tabelle.
• Long-Context-Recall — 78,3, und das ist die Zahl, die für das 1M-Token-Fenster am wichtigsten ist. Das Fenster ist nur nützlich, wenn der Recall in der Tiefe hält, und Z.ais eigene Zahl besagt, dass er das weitgehend tut.
Das unabhängige Bild ist dünner, aber real. Artificial Analysis führt GLM-5.2 mit einem Wert von 34 im Intelligence Index v4.3.2, womit es Platz 11 von 114 Modellen seiner Klasse belegt. An diese Zahl knüpfen sich zwei Vorbehalte, und Artificial Analysis nennt beide selbst: Das Modell ist auf ihrer Seite als veraltet (deprecated) gekennzeichnet, und sie „setzen das Performance-Benchmarking nur für den standardmäßigen Workload mit 10k Eingabe-Tokens fort“ – Ergebnisse für andere Workloads sind historisch und werden nicht mehr aktualisiert. Unser eigener Katalogeintrag für das Modell enthält einen älteren Evaluierungs-Snapshot vom 25. Juni 2026 mit einem Intelligence-Wert von 33,7, der nicht dieselbe Index-Revision wie der Live-Wert ist und nicht als Änderung am Modell gelesen werden sollte.
Worin es messbar schlecht ist
Drei Dinge, und es lohnt sich, sie unverblümt anzusprechen.
• Es ist reiner Text. Keine Bildeingabe, keine Audioeingabe. GLM-5.3-Flash ist das multimodale Modell dieser Familie, und wenn Ihre Workload Screenshots, PDFs oder Videos umfasst, ist GLM-5.2 völlig der falsche Zweig.
• Bei den Messungen mit dem längsten Horizont und den schwierigsten Software-Engineering-Aufgaben verliert es deutlich. Bei SWE-Marathon erreicht es 13,0 gegenüber 26,0 von Claude Opus 4.8. Bei DeepSWE erreicht es 46,2 gegenüber 58 für Claude Opus 4.8 und 70 für GPT-5.5. Bei NL2Repo erreicht es 48,9 gegenüber 69,7 von Opus 4.8. Dies sind alles vom Anbieter gemeldete Zahlen aus derselben Tabelle, die zeigt, dass GLM-5.2 an anderer Stelle gewinnt, und genau das macht sie glaubwürdig: Z.ai hat sie neben seinen eigenen Siegen veröffentlicht.
• Bei den Messungen, die es berühmt gemacht haben, wurde es überholt. GLM-5.3 nutzt dieselbe Basis und schlägt es auf dem hauseigenen Code Bench von Z.ai um 50 %, auf Terminal Bench 3.0 und beim Agents' Last Exam. GLM-5.2 ist bei Artificial Analysis zudem als deprecated gekennzeichnet.
Einen Wert konnten wir nicht ermitteln: Wir konnten keine aktuelle unabhängige Durchsatz- oder Latenzmessung für GLM-5.2 aus einer Quelle bestätigen, die wir öffnen konnten. Daher nennt diese Seite keinen Wert, statt eine Zahl zu wiederholen, die wir nicht überprüfen konnten.
Preis und wo man es ausführen kann
Z.ais eigene Preistabelle, heute abgelesen, nennt GLM-5.2 mit:
• Eingabe — 1,40 $ pro Million Token
• Zwischengespeicherte Eingabe — 0,26 $ pro Million Token
• Ausgabe — 4,40 $ pro Million Token
Die Speicherung gecachter Eingaben ist als zeitlich begrenzt kostenlos aufgeführt. Beachte, dass GLM-5.3 genau dieselben drei Tarife aufweist, das neuere Modell in Z.ais Liste also nicht teurer ist – womit der übliche Grund entfällt, beim älteren zu bleiben.
Zur Verfügbarkeit: Das Modell wird über den eigenen OpenAI-kompatiblen Endpunkt von Z.ai unter api.z.ai/api/paas/v4/chat/completions, mit offiziellen SDKs für Python und Java, und die Gewichte sind von Hugging Face zum Selbsthosting unter MIT herunterladbar. Darüber hinaus ist es über eine Reihe von Drittanbieter-Inferenzplattformen verfügbar. Wir routen es: OrcaRouter führt GLM-5.2 auf seiner Modellseite zum Z.ai-Anbietertarif ohne Aufschlag, sodass die oben genannten $1,40 / $4,40 das sind, was Sie über uns zahlen, statt einer mit Aufschlag versehenen Kopie davon. Derselbe Schlüssel erreicht auch den Rest des Katalogs, was hier aus einem bestimmten Grund wichtig ist — siehe unten.

Wer sollte GLM-5.2 wählen, und wer sollte etwas anderes wählen?
Wähle GLM-5.2wenn du selbst hostest und das 1M-Token-Fenster die Anforderung ist und nicht die Benchmark-Ergebnisse. Die MIT-Lizenz ohne regionale Beschränkungen, die veröffentlichten FP8-Gewichte und das IndexShare-Attention-Design machen es zu etwas, das sich bei langem Kontext wirklich praktisch betreiben lässt, und die Recall-Zahl in der Tiefe ist die Zahl, die das Fenster rechtfertigt. Es ist auch eine vernünftige Wahl, wenn du bereits eine Pipeline hast, die auf sein reasoning_effort-Verhalten abgestimmt ist und die Kosten für die erneute Validierung von Prompts gegen GLM-5.3 den Nutzen übersteigen.
Nimm stattdessen GLM-5.3, wenn du Tokens statt Gewichte kaufst und Qualität die einzige Achse ist. Es ist dasselbe Basismodell, besser nachtrainiert, zu identischen Listenpreisen. Es gibt kein Preisargument für das ältere Modell auf der eigenen Preisliste von Z.ai.
Wählen Sie stattdessen GLM-5.3-Flash, wenn Sie Bildverständnis benötigen oder wenn Sie die günstigste leistungsfähige Option brauchen: Sie verarbeitet Text, Bilder und Videos und ist deutlich günstiger als beide Text-Flaggschiffe.
Wählen Sie etwas ganz anderes, wenn Ihre Arbeit am anspruchsvollen Ende von Software-Engineering mit langem Zeithorizont angesiedelt ist. In der von Z.ai selbst veröffentlichten Tabelle schlägt Claude Opus 4.8 GLM-5.2 bei SWE-Marathon, DeepSWE, NL2Repo, SWE-bench Pro, ProgramBench und Tool-Decathlon; GPT-5.5 schlägt es bei DeepSWE und ProgramBench. Die Siege von GLM-5.2 sind real, aber sie konzentrieren sich auf terminalbasiertes agentisches Programmieren und Reasoning, nicht auf die Marathon-Aufgaben. Wenn Ihre Evaluierung wie ein zweistündiger Agentenlauf gegen ein großes, unbekanntes Repository aussieht, schließt der Preisvorteil von Open-Weight-Modellen diese Lücke angesichts dieser Zahlen nicht.
Die praktische Zusammenfassung
GLM-5.2 ist ein textbasiertes MoE-Modell mit 753B Parametern, MIT-Lizenz und 1M-Kontext, das am 16. Juni 2026 veröffentlicht wurde, zu 1,40 $ / 4,40 $ pro Million Token, mit vom Anbieter gemeldeten Terminal Bench 2.1 von 81,0, SWE-bench Pro von 62,1 und einem unabhängigen Artificial Analysis Intelligence Index von 34. Es ist das letzte GLM-Flaggschiff, dessen Fähigkeit aus der Architektur statt aus dem Post-Training stammte, es wurde zweimal von seinem eigenen Hersteller abgelöst, und es ist auf dem unabhängigen Index, der es bewertet hat, als veraltet gekennzeichnet.
Nichts davon macht es zu einem schlechten Modell. Es macht es zu einem etablierten Modell: Die interessante Frage bei GLM-5.2 im September 2026 ist nicht, ob es gut ist, sondern ob das, was Sie konkret brauchen – ein Long-Context-, selbst hostbares, MIT-lizenziertes Coding-Modell – Ihnen mehr wert ist als die drei Punkte, die GLM-5.3 auf dieselben Gewichte obendrauf setzt. Für die meisten Token-Käufer lautet die Antwort nein. Für alle, die Gewichte herunterladen, lautet sie weiterhin ja.
Wenn Sie das selbst testen möchten, ohne einen Produktionspfad darauf festzulegen, ist die Routing-Ebene der günstige Weg dafür: Richten Sie dieselbe Anfrage über einen Endpunkt an GLM-5.2 und GLM-5.3, vergleichen Sie mit Ihren eigenen Prompts, und lassen Sie automatisches Failover den Fall abfangen, in dem der Endpunkt des älteren Modells derjenige ist, der ausfällt.
Call GLM-5.2 through OrcaRouter at the Z.ai provider rate, zero markup. https://www.orcarouter.ai/models/z-ai/glm-5.2 One API key reaches GLM-5.2, GLM-5.3 and 200+ other models, with automatic failover if an endpoint goes down.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
