
GLM 5.5 oder GLM 5.3-Vision? Ein anonymes Modell, das Z.ais Fingerabdruck entspricht, ist gerade aufgetaucht
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 150 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Ein nicht identifiziertes Modell, dessen Serving-Profil — Geschwindigkeit, Time-to-First-Token, Cache-Trefferquote — mit dem GLM-Stack von Z.ai übereinstimmt, hat die Aufmerksamkeit von Kapazitätsanalysten auf sich gezogen, und die Arbeitshypothese lautet, dass es GLM 5.3-Vision oder GLM 5.5 heißen könnte. Am 20. August postete der Compute- und Kapazitätsanalyst teortaxesTex, dass ein anonymes Modell, das er verfolgt, „zumindest eindeutig nicht DeepSeek“ sei, dass „bisher nichts gegen GLM spricht“ und dass „Geschwindigkeit, ttft und Cache-Trefferquote ebenfalls zu GLM passen“. Seine Einschätzung: Es werde voraussichtlich GLM 5.3-Vision oder 5.5 heißen und im Artificial Analysis Intelligence Index etwa 61 Punkte erreichen — einen Punkt über dem Wert, den das ausgelieferte GLM-5.3 derzeit hat. Nichts davon ist bestätigt. Es gibt keine Modellkarte, keine Ankündigung von Z.ai und keine API; diese Seite behandelt die Sichtung als das, was sie ist: ein frühes, nicht reproduziertes Leak-Signal, das es gerade deshalb zu verfolgen lohnt, weil GLM-5.5 den ganzen Monat über als Z.ai-Flaggschiff erwartet wurde und nicht erschienen ist. Fünf Tage nach diesem Beitrag kam ein zweiter, diesmal vollständig überprüfbarer Datenpunkt: Am 25. August eröffnete vLLM — die Inferenz-Runtime hinter den meisten groß angelegten Modell-Serving-Systemen — einen Do-Not-Merge-Pull-Request, der Masked-MHA-Kernel-Unterstützung für die GLM-5-Head-Dimensionen ermöglicht. Er nennt keine Variante und beweist keine Veröffentlichung; es handelt sich um Grundlagenarbeit für den Serving-Stack, die Art von Hintergrundaktivität, die ein neues Modell hinterlässt.
Was das Signal tatsächlich sagt
Die Quelle ist ein einzelner X-Beitrag von teortaxesTex, datiert auf den 20. August — derselbe Account, dessen Zeitangabe von „etwa einer Woche“ zum Start von GLM-5.3 im August auf den Tag genau eingetroffen war. Die Einordnung ist hinsichtlich der Evidenzlage eindeutig: „starke Evidenz (nicht repliziert).“ Der Analyst schließt DeepSeek aus, findet nichts, was GLM widerspricht, und führt drei Serving-Level-Messungen an — Durchsatz, Time-to-First-Token und Cache-Trefferquote — die zum Stack von Z.ai passen. Dann die zwei Kandidatennamen und eine prognostizierte Punktzahl: „Derzeit erwarte ich, dass es GLM 5.3-Vision oder 5.5 heißt und bei AA ungefähr 61 Punkte erreicht.“
Nehmen Sie jeden Teil einzeln. Die Identitätsbehauptungen (nicht DeepSeek, passt zu GLM) sind Fingerabdruck-Rückschlüsse daraus, wie das Modell ausgeliefert wird, keine Modellkarte. Der Score ist eine Erwartung, keine Messung. Die Namen sind Vermutungen. Was das Signal wertvoller als Rauschen macht, ist, dass es richtungsmäßig mit allem übereinstimmt, was wir sonst über die Roadmap von Z.ai in diesem Monat wissen: GLM-5.3 wurde nur mit Text ausgeliefert, die lauteste Forderung der Community war Vision, und GLM-5.5 wurde von mehreren Medien (über JPMorgan, Reuters, CGTN und ein Goldman-Schreiben vom 18. August) als „noch im August“ erscheinend gemeldet — das Finale des Monats ist jetzt.
Warum der Serving-Fingerprint wichtig ist
{{1}}Time-to-first-token und Cache-Trefferquote sind Signaturen auf Infrastrukturebene. Sie werden dadurch festgelegt, wie ein Anbieter seinen Inferenz-Stack aufbaut – den Scheduler, das Cache-Layout, die Batching-Strategie – und nicht dadurch, welcher Modellname von einem Prompt aufgerufen wird. Wenn ein Analyst sagt, dass TTFT und Cache-Trefferquote eines anonymen Modells mit GLM übereinstimmen, meint er, dass sich der dahinterstehende Serving-Stack wie der von Z.ai verhält – das kommt einem Fingerabdruck so nahe, wie man es ohne Gewichte oder eine Modellkarte bekommen kann. Es ist kein Beweis. Ein anderer Anbieter könnte denselben Stack nachbilden, oder Z.ai könnte ein Modell für einen Partner bereitstellen. Aber es ist eine spezifische, überprüfbare Behauptung, und der Vorbehalt „nicht repliziert“ verrät dir, dass der Analyst sie nicht als endgültig gesichert darstellt.
Der Ausschluss von DeepSeek ist ebenfalls wichtig. DeepSeek V4 Pro wurde am 13. August allgemein verfügbar und sein Flash-Build war das andere schnelle chinesische Open-Weight-Release in diesem Monat. Ein anonymes Modell, das DeepSeek ausschließt, aber auf GLM verweist, grenzt das Feld auf Z.ai's Pipeline ein — und Z.ai's Pipeline hat zwei plausible Kandidaten, was genau die Abzweigung ist, die das Signal benennt.
Ein zweites Signal: Der Serving-Stack wird für GLM-5-Attention aufgebaut.
Am 25. August traf ein zweiter Datenpunkt ein – dieser vollständig überprüfbar. vLLM, die Inferenz-Laufzeitumgebung hinter den meisten großen Modell-Serving-Systemen, erhielt Pull-Request #53785 mit dem Titel „[Do Not Merge][Attention] Enable masked MHA for GLM-5 head dimensions“. Gegen das Repository verifiziert, ermöglicht er den masked-MHA-Prefill-Pfad für die GLM-5-Attention-Geometrie: 64 Heads, ein KV-Rang von 512, QK-Head-Dimension 192+64 und V-Head-Dimension 256 – ein 256/256-QK/V-Layout, laut PR-Beschreibung. Er hängt von einer FlashAttention-Änderung für die Maskenunterstützung mit Head-Dimension 256 ab, pinnt FlashAttention vorübergehend auf einen Fork-Commit (wofür der Do-Not-Merge-Marker gedacht ist) und fügt benchmarkte Routing-Schwellenwerte für den neuen Pfad hinzu: FlashMLA-Grenzen für reines Prefill von 8K / 20K / 48K / 112K Tokens bei TP 1/2/4/8 sowie eine gerundete 64K-Grenze für FlashInfer bei TP8. Der Autor merkt an, dass kein anderer offener PR die masked-MHA-Unterstützung für GLM-5 abgedeckt hat.
Lies es als das, was es ist: Grundlagenarbeit am Serving-Stack, keine Ankündigung. Der PR nennt weder GLM 5.5 noch GLM 5.3-Vision — er sagt „GLM-5“ — und die Aktivierung eines Masked-MHA-Prefill-Pfads für GLM-5-Kopfdimensionen ist Infrastrukturarbeit an einer Familie, die das vLLM-Ökosystem bereits über den Sparse-MLA-Pfad betreibt (die eigene Linie von GLM-5.3 wird dort heute bereits bereitgestellt). Es ist auch nicht isoliert: Schwester-PRs deckten diesen Monat FlashInfer-MLA-Dimensionsprüfungen für GLM-5, einen Triton-Sparse-MLA-Fallback für Modelle der GLM-5-Klasse sowie die angegebene Dimensionsunterstützung von FlashAttention ab. Zwei Details halten es auf dem Radar eines Leak-Trackers. Erstens: Die Zielgeometrie — 64 Köpfe, KV-Rang 512, 256/256 QK/V — unterscheidet sich von DeepSeeks 192/128, was dieselbe „nicht DeepSeek, passt zu GLM“-Unterscheidung ist, die der Fingerprint des anonymen Modells zieht, nun sichtbar auf Ebene des Attention-Kernels. Zweitens: das Timing. Der PR wurde am 25. August eröffnet, im selben August-Fenster, in dem GLM-5.5 den ganzen Monat über erwartet wurde. Nichts davon beweist, dass das anonyme Modell ein GLM der nächsten Generation ist — es könnte ebenso gut Engineering an dem bereits veröffentlichten Modell sein —, aber es ist die Art von Hintergrundaktivität, die das Serving-Ökosystem im Vorfeld eines Modells betreibt, und sie ist auf eine Weise verifizierbar, wie es kein X-Post ist.
Zwei Namen, eine Abspaltung: GLM 5.3-Vision vs. GLM 5.5
Die beiden Kandidatenidentitäten sind tatsächlich verschiedene Produkte, und das Leak klärt nicht, welche davon auf dem Board ist.
• GLM 5.3-Vision wäre eine visionsfähige Variante des Modells, das am 14. August veröffentlicht wurde. GLM-5.3 ist nur für Texteingabe geeignet – Artificial Analysis listet es als Texteingabe, Textausgabe, ohne Bildunterstützung – und diese Lücke ist die lauteste Beschwerde der Community. Als Z.ais Tang Jie eine globale Feedback-Kampagne durchführte, waren die Kommentare im Wesentlichen einstimmig für Vision, und Z.ai verfügt bereits über die Bausteine (das multimodale Modell GLM-5V-Turbo und den CogVLM-Encoder), die es noch nicht in die Flaggschiff-Linie integriert hat. Eine 5.3-Vision-Variante wäre der schnellste Weg, diese Lücke zu schließen.
• GLM 5.5 ist das Flaggschiff selbst. Gemeldete, aber unbestätigte Spezifikationen deuten auf eine Basis von über einer Billion Parametern hin (gegenüber 743B bei GLM-5.3), einen übernommenen Kontext von 1M Token, offene Gewichte und einen stärkeren Fokus auf Agenten und Codierung. Jede Analystennotiz in diesem Monat behandelt 5.5 als das große Ding – das Fahrzeug, von dem Z.ai-Mitbegründer Tang Jie angedeutet hat, dass es die Lücke zu geschlossenen Modellen der Fable-Klasse schließen wird. Es wird im August erwartet und ist zum Zeitpunkt des Schreibens noch nicht ausgeliefert.
Derselbe Fingerabdruck kann nicht verraten, welcher der beiden das ist — ein vision-tuned 5.3 und ein neues Flaggschiff könnten beide denselben Serving-Stack nutzen. Diese Mehrdeutigkeit ist der ehrliche Zustand des Signals, und die beiden Namen im Beitrag des Analysten spiegeln sie wider, anstatt sie aufzulösen.
img src="2.png" alt="Eine zweispaltige Vergleichstabelle mit dem Titel 'GLM 5.5 vs GLM-5.3 — das Scoreboard'. Linke Spalte GLM 5.5 (geleakt): 'AA-Index ~61 (prognostiziert, unbestätigt)', 'Status: unveröffentlicht', 'Größe >1T Parameter (gemunkelt)', 'Vision: erwartet', 'Kontext: 1M (erwartet)', 'Preis: TBD'. Rechte Spalte GLM-5.3 (veröffentlicht): 'AA-Index 60', 'Status: API live am 19. Aug.', 'Größe 743B MoE / 40B aktiv', 'Vision: nur Text', 'Kontext: 1M', 'Preis: $1,40 / $4,40'. Die Fußzeile lautet: 'Die Zahlen zu GLM 5.5 sind unbestätigte Prognosen; GLM-5.3 laut Artificial Analysis.'" />

Was ein ~61 auf dem AA Intelligence Index bedeuten würde
Der prognostizierte Wert ist der brisanteste Teil des Lecks. Der Artificial Analysis Intelligence Index (v4.1.1) platziert GLM-5.3 derzeit bei 60 — gleichauf mit Kimi K3 für den höchsten Open-Weights-Wert und 7 Punkte vor GLM-5.2 mit 53. Einen Punkt darüber, bei 61, läge das Territorium von GPT-5.6 Sol, wobei Claude Fable 5 bei 62 und Claude Opus 5 bei 63 liegen. Einfach ausgedrückt: Ein Modell der GLM-Familie mit einem Wert von 61 wäre der höchste Open-Weights-Wert im gesamten Index, ganz für sich allein über Kimi K3 und GLM-5.3, und praktisch an der Closed-Frontier-Linie.
Es ist wichtig zu betonen, was 61 nicht ist. Es ist die Erwartung von teortaxesTex daran, was eine unabhängige Bewertung ergeben wird, keine veröffentlichte Artificial-Analysis-Punktzahl und keine Anbieternummer. Eine Prognose kann in beide Richtungen falsch liegen — eine Vision-Variante könnte ein oder zwei Punkte auf dem textlastigen Index einbüßen, und ein >1T-Flaggschiff könnte je nachdem, wie sich sein Post-Training auswirkt, höher oder niedriger ausfallen. Der Wert der Zahl besteht in dem Anspruch, den sie kodiert: Wer auch immer dieses anonyme Modell sein mag, es wird erwartet, dass es den aktuellen Open-Weights-Führenden schlägt, statt lediglich gleichzuziehen.

Was ist bestätigt, und was nicht
Halte das Hauptbuch sauber, denn ein Leak-Stück lebt oder stirbt davon.
• Bestätigt: GLM-5.3 ist echt, wurde am 14. August ausgeliefert, die API ist seit dem 18./19. August live, erreichte 60 Punkte im AA Intelligence Index (unabhängig gemessen von Artificial Analysis), kostet $1.40 / $4.40 pro 1M Tokens, nur Texteingabe, mit offenen Gewichten bestätigt für Freitag, den 28. August. Diese Fakten hängen nicht vom Leak ab.
• Bestätigt: GLM-5.5 ist noch nicht veröffentlicht. Zum Zeitpunkt dieses Schreibens gibt es keine Modellkarte, keine Preisgestaltung und keine Verfügbarkeit; das August-Fenster und die >1T-Parameterzahl sind Analystenangaben, keine Z.ai-Zusagen.
• Unbestätigt: dass das anonyme Modell als eigenständiges Produkt existiert, dass es GLM ist, dass sein Name GLM 5.3-Vision oder 5.5 lauten wird und dass es 61 erreicht. Alle vier beruhen auf einem einzigen, nicht replizierten Beitrag eines Analysten.
• Ebenfalls unbestätigt: ob dieses anonyme Modell überhaupt von GLM-5.3 selbst zu unterscheiden ist. Ein aktiver GLM-5.3-Endpoint unter einem unbeschrifteten Alias würde denselben Serving-Fingerprint erzeugen. Bis ein Name, eine Modellkarte oder eine Gewichtsveröffentlichung das klärt, ist die Deutung „neues Modell“ die starke Annahme, aber keine Tatsache.
Was als Nächstes ansehen
• Freitag, 28. August – die GLM-5.3-Gewichte. Wenn das anonyme Modell tatsächlich ein umbenanntes 5.3 oder ein 5.3-Vision ist, werden die Veröffentlichung der Gewichte und die Modellkarte das schnell klären.
• Eine zweite bestätigende Sichtung. Der Fingerabdruck eines Analysten ist eine Hypothese; eine zweite unabhängige Lesung desselben anonymen Eintrags oder eine Auflistung bei Artificial Analysis, die ihn benennt, wertet sie zu einem Beleg auf.
• Jede Aussage von Z.ai. GLM-5.5 wurde für das August-Fenster gemeldet, und der Monat ist fast vorüber. Eine offizielle Namensgebung, eine Preisseite oder ein API-Changelog-Eintrag ist das Ereignis, das dieses Leak zu einer Launch-Story macht.
• Ob der AA-Score bei 61 zustande kommt. Wenn das anonyme Modell real ist und zur GLM-Familie gehört, wäre ein unabhängiger Indexwert nahe 61 der erste Open-Weights-Wert, der die 60 übersteigt.
• Ob die vLLM-Attention-Arbeit einen Modellnamen erhält. PR #53785 zielt auf die Head-Dimensionen von „GLM-5“ ab, ohne 5.3-Vision oder 5.5 zu nennen; ein Merge, ein Eintrag in der Liste unterstützter Modelle oder eine Model-Card, die diese Geometrie mit einem bestimmten Namen verbindet, wäre das bislang deutlichste Signal.
Wie man auf ein solches Leck reagiert
Ein Leak ist ein Grund, sich vorzubereiten, nicht die Plattform zu wechseln. Wenn das nächste GLM-Familienmodell auf dem Open-Weights-Leaderboard ganz oben oder nahezu ganz oben landet, stellt sich die praktische Frage, ob man echten Datenverkehr dorthin leiten sollte – und ein unerprobtes Modell mit Herstellerangaben und einer Analystenprojektion ist genau der Fall, in dem man ein Sicherheitsnetz statt einer Wette möchte. Das letzte Woche ausgelieferte GLM-5.3 ist bereits auf OrcaRouter live – die Modellseite zeigt es für 1,26 $ / 3,96 $ pro 1M Tokens, mit 10 % Einführungsrabatt gegenüber dem Listenpreis des Anbieters von 1,40 $ / 4,40 $, ohne Aufschlag durchgereicht – und das Routing-Setup ist das, was eine 5.5 oder 5.3-Vision am Tag ihrer Veröffentlichung erben würde. Leiten Sie einen Teil des Datenverkehrs über den Router an das neue Modell mit automatischem Failover zu einem bewährten Modell – GLM-5.3, DeepSeek V4 Pro, GPT-5.6 Sol – und Sie erhalten ein Qualitätssignal für Ihre eigene Workload statt einer Slide-Deck-Präsentation. Wenn die Projektion des Leaks stimmt, erfahren Sie es zuerst; wenn sie falsch ist, fängt das Failover es ab und nichts geht kaputt. Gleicher Schlüssel, kein zweiter Vertrag, und keine Notwendigkeit, sich zwischen den beiden Kandidatennamen zu entscheiden, bis Z.ai es tut.
Das nächste GLM kommt — die einzige offene Frage ist, welchen Namen es trägt. Mit GLM 5.3-Vision würde Z.ai die am meisten kritisierte Lücke des gerade veröffentlichten Modells schließen; GLM 5.5 wäre das Flaggschiff mit einer Billion Parametern, auf das der gesamte Monat hingedeutet hat. Der anonyme Eintrag teortaxesTex, der am 20. August identifiziert wurde, ist das erste konkrete Objekt, das wie eines der beiden aussieht, und seine prognostizierten 61 Punkte im AA Intelligence Index würden ihn vor jedes derzeit gelistete Open-Weights-Modell bringen. Fünf Tage nach der Identifizierung bewegte sich auch der Serving-Stack: vLLMs GLM-5-Attention-Arbeit ist genau die Art von Vorarbeit, die ein neues Modell hinterlässt, auch wenn sie keine Variante nennt. Nichts davon ist bestätigt, und diese Seite wird aktualisiert, sobald der Name, die Modellkarte oder die Gewichte es klären. Bis dahin ist der risikoarme Schritt, das Routing bereitzuhalten — nicht den Stack auf einen Fingerabdruck zu setzen.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
