
Nex-N2.5 Pro vs GLM-5.2: Dieselben 82,7 auf Terminal-Bench, zwei sehr unterschiedliche Herkünfte.
- openaiNEUOpenAI: GPT-6 Astra2026-09-0455Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0247Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0247Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0157Intelligenz82Coding
- AlibabaNEUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.3 Flash2026-08-2646Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1541Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1251Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0547Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligenz49Coding
Zwei agentische Modelle mit offenen Gewichten, ein verdächtiger Zufall: Nex-N2.5 Pro und GLM-5.2 landen beide bei 82,7 auf Terminal-Bench 2.1. Nex-AGI weist auf der eigenen Modellkarte 82,7 für Nex-N2.5 Pro aus, gemessen mit dem eigenen NexCUA-Harness der Allianz, den die Öffentlichkeit nicht gesehen hat. Der beste von Z.ai gemeldete Wert für GLM-5.2 auf derselben Suite ist ebenfalls 82,7 – und als ein unabhängiger Harness das Modell erneut testete, landete es bei 77,9, etwa fünf Punkte unter der eigenen Angabe des Anbieters. Ein perfektes Unentschieden zwischen einem Wert, den niemand überprüfen kann, und einem Wert, der bereits geschrumpft ist, sobald er überprüft wurde, ist überhaupt kein Unentschieden. Es ist die denkbar klarste Demonstration dafür, warum der Unterschied zwischen „offenen Gewichten“ und „Gewichten, die es irgendwann geben wird“ dieses Aufeinandertreffen entscheidet, bevor auch nur eine einzige Benchmark-Zeile gelesen wird.
Beide Modelle bewegen sich im selben kommerziellen Umfeld und könnten in ihrer Art nicht unterschiedlicher sein. Das Nex-N2.5 Pro, angekündigt am 8. September 2026, ist ein multimodales Computer-Use-Modell – insgesamt 397 Milliarden Parameter, von denen etwa 17 Milliarden aktiv sind, basierend auf der Qwen3.5-Linie, entwickelt, um mit visueller Rückkopplung einen Bildschirm zu lesen und eine Browser- oder Desktop-Sitzung zu steuern. Das GLM-5.2 ist das MIT-lizenzierte Flaggschiff von Z.ai (Zhipu AI) für Denk- und Programmieraufgaben mit langem Zeithorizont – insgesamt etwa 743 Milliarden Parameter, davon rund 40 Milliarden aktiv, rein textbasiert, seit dem 16. Juni 2026 allgemein verfügbar und seit Monaten das Anker-Modell der unabhängigen Bewertungen der Open-Weights-Kategorie. Das eine Modell sieht die Welt durch Pixel und handelt in ihr. Das andere denkt in Text und liefert Code. Die Lizenzen beider Modelle erlauben, ein Geschäft auf ihnen aufzubauen; der Unterschied ist, dass diese Lizenz bei einem von ihnen derzeit nur ein Versprechen ist.
Dieselbe Nummer, zwei verschiedene Herkünfte
Beginnen wir mit dem Gleichstand, denn er lehrt uns das gesamte Matchup. Die Karte von Nex-AGI listet Terminal-Bench 2.1 mit 82,7 für Nex-N2.5 Pro auf, daneben OSWorld-2 mit 56,4, SWE-Bench Pro mit 61,2 und BrowseComp mit 89,7 – all diese Werte wurden über die NexCUA-Harness erzeugt, und keiner davon wurde in den ersten Tagen nach Erscheinen des Modells unabhängig reproduziert, aus dem einfachen Grund, dass die Gewichte nicht herunterladbar sind. Die von Z.ai genannte Zahl von 82,7 für GLM-5.2 auf Terminal-Bench 2.1 ist der beste vom Anbieter selbst berichtete Wert, aber sie bezieht sich auf ein Modell, das jeder von Hugging Face herunterladen und noch heute Nachmittag erneut ausführen kann; die unabhängige Harness-Messung von 77,9 liegt bereits vor und ist etwa fünf Punkte niedriger als die Angabe von Z.ai. Wenn eine Anbieterzahl unter unabhängiger Prüfung schrumpft, ist das kein Skandal – es ist die normale Steuer auf Selbstmessung. Wenn eine Zahl eines konkurrierenden Anbieters nicht einmal getestet werden kann, ist das Fehlen dieser Steuer das Problem, nicht ein Zeichen dafür, dass die Zahl makellos ist.

Lesen Sie die umliegenden Zeilen genauso. GLM-5.2 hat den höchsten unabhängigen Indexwert, den die offene Klasse bisher hervorgebracht hat – einen Wert im unteren Fünfzigerbereich beim aktuellen Intelligence Index von Artificial Analysis – weshalb es seit Monaten das Referenzmodell unter den offenen Modellen ist, obwohl es nicht die auffälligste Neuveröffentlichung ist. Nex-N2.5 Pro hat überhaupt keinen unabhängigen Indexeintrag. In den Zeilen, in denen beide Anbieter Zahlen angeben, ist die überprüfbare die des etablierten Anbieters; in den Zeilen, in denen nur Nex-AGI veröffentlicht hat, sind die Zahlen nicht reproduziert. Das ist kein Urteil darüber, welches Modell intelligenter ist. Es ist ein Urteil darüber, welches Modell Sie überprüfen dürfen.
Die technischen Datenblätter stimmen mehr überein, als man erwarten würde.
Lässt man die Benchmarks außer Acht, liegen die beiden Modelle bei den Grundlagen dicht beieinander:
• Veröffentlicht — Nex-N2.5 Pro: 8. September 2026 (gehostete Endpunkte live, Gewichte ausstehend). GLM-5.2: GA 16. Juni 2026, Gewichte live.
• Lizenz — Nex-N2.5 Pro: Apache-2.0, Gewichte folgen in Kürze. GLM-5.2: MIT, jetzt herunterladbar.
• Größe — Nex-N2.5 Pro: 397B insgesamt / ~17B aktiv. GLM-5.2: ~743B insgesamt / ~40B aktiv.
• Modalität — Nex-N2.5 Pro: Text- und Bildeingabe, Textausgabe, Computer-Use-Vision-Schleife. GLM-5.2: rein textbasiertes Reasoning-Modell.
• Kontext / Ausgabe — Nex-N2.5 Pro: 262.144-Token-Kontext. GLM-5.2: 1M-Token-Kontext, 128K-Ausgabegrenze.
• Reasoning-Steuerung — Nex-N2.5 Pro: keine / mittel (adaptiv, Standard) / hoch. GLM-5.2: Steuerung des Reasoning-Aufwands über denselben Modellstring.
• Preis pro 1M Tokens — Nex-N2.5 Pro: kostenloser gehosteter Tarif, kein Listenpreis. GLM-5.2: 1,40 $ Input / 4,40 $ Output, 0,26 $ gecachter Input.
Die Leistungsprofile unterscheiden sich ebenso wie die Aufgaben der beiden Modelle: GLM-5.2 bringt einen Textkontext von einer vollen Million Tokens und eine Ausgabegrenze von 128K in lange Engineering-Sessions ein, während Nex-N2.5 Pro Kontextgröße gegen einen Vision-Kanal und ein kleineres, auf bildschirmgroße Arbeitslasten ausgelegtes 262K-Fenster eintauscht. Keine Spezifikation ist falsch; sie sind für unterschiedliche Aufgaben konzipiert.
Offene Gewichte, zwei verschiedene Bedeutungen

Hier endet der Vergleich, was reine Zahlen angeht. GLM-5.2 ist so offen, wie man ein Produkt ausliefert, auf dem man ein Geschäft aufbauen kann: MIT-Lizenz, Gewichte auf Hugging Face, keine Einschränkung der kommerziellen Nutzung, keine Klausel zur Datenweitergabe, kein Anbieter, der einem über die Schulter schaut. Man kann es herunterladen, feinabstimmen, hinter den eigenen Compliance-Grenzen bereitstellen oder zu jedem beliebigen Hosting-Partner bringen – und weil die Gewichte verfügbar sind, hat sein Preis eine Untergrenze, die kein einzelner Anbieter anheben kann. Bei Nex-N2.5 Pro wird Apache-2.0 versprochen, eine ebenso permissive Lizenz, aber das Banner auf der Hugging-Face-Karte besagt, die Gewichte kämen bald – ein Datum ist nicht genannt. Für ein Team, das Data-Governance-Regeln unterliegt, oder eines, das die tokenbasierte Abrechnung im großen Maßstab ganz hinter sich lassen will, macht dieser Unterschied die gesamte Entscheidung aus: GLM-5.2 ist ein Modell, das man heute besitzen kann, und Nex-N2.5 Pro ist ein Modell, das einem versprochen wurde. Auch die Selbsthosting-Rechnung fällt zugunsten des Neulings aus, wenn die Gewichte endlich da sind – 17B aktive Parameter auf einem Acht-H100-Node sind ein weitaus zugänglicherer Footprint als GLM-5.2 mit ~40B aktiven Parametern – aber in diesem Satz leistet das „wenn die Gewichte da sind“ einen Großteil der Arbeit.
Die Familien bewegen sich in entgegengesetzte Richtungen.
Beide Modelle gehören zu Familien, die sich rasant weiterentwickeln, und ihre Entwicklungspfade zeigen in unterschiedliche Richtungen. Die Entwicklungslinie von GLM-5.2 ist transparent und iterativ: Z.ai hat GLM-5.3 im August als Post-Training-Refresh auf derselben 5.2-Basis ausgeliefert und GLM-5.3 Flash Anfang September. Die 5.2-Gewichte, auf denen Sie heute aufbauen, sind also das Fundament, das die Familie stetig verbessert – Ihr Architekturwissen und Ihre Fine-Tunings bleiben weiterhin nutzbar. Die Familie von Nex-AGI setzt dagegen auf eine völlig neue Generation: Nex-N2.5 Mini mit 35B, Nex-N2.5 Pro mit 397B und ein reines Textmodell Nex-N2.5 Max mit 1,6T, dessen Basis DeepSeek-V4-Pro-Base ist – wobei die Pro-Gewichte, die es jedem ermöglichen würden, die Behauptungen dieser Familie zu verifizieren, weiterhin unveröffentlicht sind. Ein Team, das eine Plattform als Grundlage für die eigene Entwicklung wählt, entscheidet sich damit zwischen einer Linie mit veröffentlichtem Fahrplan für Aktualisierungen und einer Erstveröffentlichung, deren zweiter Akt noch aussteht.
Welches verdient einen Platz in deinem Build?
Wenn Ihre Anforderung lautet: „Das Modell muss uns gehören“ – für Data Governance, für Audits, für ein Produkt, bei dem Sie nicht möchten, dass ein einzelner Anbieter die Kontrolle hat – dann ist GLM-5.2 in diesem Vergleich nicht die bessere Wahl; es ist die einzige Wahl, denn es ist das einzige Modell darin, das Sie herunterladen können. Es ist auch das einzige mit einer unabhängigen Bewertung, und es ist zum Listenpreis von Z.ai von 1,40 $ pro Million Input-Token und 4,40 $ pro Million Output-Token erhältlich. Wenn Ihre Anforderung ein multimodaler Computer-Use-Agent ist, der die geschlossenen Marktführer letztlich unterbieten könnte, dann ist Nex-N2.5 Pro die interessantere langfristige These – ein Vision-Operator mit 17B aktiven Parametern von einer Allianz, die genau weiß, was sie aufbauen will – aber eine These ist keine Abhängigkeit, und ein kostenloser gehosteter Endpunkt ist kein Fundament.

Der praktische Weg, mit all dem umzugehen, besteht darin, auf dem aufzubauen, was existiert, und das Leistungsversprechen zu messen, sobald es eingelöst wird. GLM-5.2 ist bei OrcaRouter zum Listenpreis von Z.ai erhältlich – d. h. $1.40 / $4.40, ohne Aufschlag durchgereicht – und da es offene Gewichte besitzt, lässt es sich auch selbst hosten, wenn Sie Ihren eigenen Serving-Stack in die Messung einbeziehen möchten. Es ist der Referenzpunkt, gegen den Sie Ihre tatsächliche agentische Workload heute laufen lassen können, wobei die Routing-DSL als Platzhalter für den Tag dient, an dem Nex-N2.5 Pro bei einem Anbieter zum Listenpreis erscheint: Wenn es so weit ist, ist das Umschalten des Vergleichs eine Routing-Regel, keine Migration. Bis die Shards veröffentlicht werden und eine unabhängige Testumgebung den Wert 82.7 bestätigt oder korrigiert, ist Nex-N2.5 Pro gegen GLM-5.2 ein Aufeinandertreffen zwischen einem Modell, das Sie verifizieren können, und einer Zahl, die Sie nicht verifizieren können.
