
Step 5 Preview vs GLM-5.5: Ein Modell erscheint heute, das andere ist noch eine Prognose
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Step 5 Preview hat seine API am 20. September 2026 geöffnet – am selben Tag, an dem StepFun sie angekündigt hat – und Sie können sie noch heute Nachmittag über einen einzigen Endpunkt aufrufen, für 1,00 US-Dollar pro Million Input-Tokens und 2,70 US-Dollar pro Million Output-Tokens. GLM-5.5 existiert nicht. Es gibt keine Modellkarte, keine API-Kennung, keinen Preis, keinen Checkpoint und keine Lizenzdatei, und es gibt nirgends eine Z.ai-Seite, die diesen Namen verwendet – denn GLM-5.5 ist eine inoffizielle Kurzbezeichnung aus der Community, die das Unternehmen nie übernommen hat. Genau diese Asymmetrie ist der Artikel. Was folgt, ist das, was StepFun tatsächlich ausgeliefert hat, was über Z.ais nächstes Flaggschiff tatsächlich gesichert ist, und der direkte Vergleich, den Sie heute anstelle des im Titel genannten durchführen können.
Was GLM-5.5 ist und was es nicht ist
Der Name kam Mitte 2026 in Umlauf, verbunden mit einem Veröffentlichungsfenster, und das Fenster hat einen nachvollziehbaren Ursprung: eine am 25. Juni 2026 weitergeleitete Analystenprognose, die das nächste Flaggschiff von Z.ai für August ansetzte. Es war ein Beobachtungsfenster, keine Zusage des Anbieters, und der August endete, ohne dass es erschien. Was Z.ai stattdessen auslieferte, war GLM-5.3 – am 14. August angekündigt, mit einer API, die um den 18. August live ging, und offenen Gewichten am 28. August, gefolgt von GLM-5.3-Flash am 26. August. Kein GLM-5.5-Checkpoint ist in der eigenen Hugging-Face-Organisation des Anbieters aufgetaucht, wo die neuesten Repositories nach wie vor bei der GLM-5.3-Serie enden.
Auch die Namensgebung ist ungeklärt. GLM-5.3, GLM-5.4, GLM-5.5 und GLM-6 wurden alle im selben Zeitfenster ins Spiel gebracht, und Z.ai hat keines davon bestätigt. Das einzige unternehmensseitige Signal ist die Bemerkung eines Mitgründers über eine „epic plus“-Veröffentlichung, die eher eine Stimmung als eine Spezifikation ist. Analysten, die die Kadenz des Anbieters lesen – ungefähr ein Flaggschiff alle 54 bis 70 Tage –, verlegen das nächste Modell nun in ein Zeitfenster vom 8. Oktober bis 9. November 2026 und erwarten, dass es eher die Nummer GLM-5.4 als GLM-5.5 tragen wird.
Drei Behauptungen werden verbreitet, als wären sie bestätigt, und es lohnt sich, bei allen dreien genau zu sein. Die Parameterzahl ist die schwächste: Nichts Offizielles stützt die Angabe „mehr als 1 Billion", und spätere Social-Media-Beiträge, die sie auf über 3 Billionen hochtreiben, zitieren überhaupt nichts. Der Kontext von 1 Mio. Token ist die sicherste Annahme, denn sowohl GLM-5.2 als auch GLM-5.3 bringt ihn mit. Offene Gewichte sind eher eine Erwartung als ein Versprechen – Z.ai hat für seine letzten mehreren Flaggschiffe Gewichte veröffentlicht, was ein Muster ist, keine Zusage.
Was Step 5 Preview tatsächlich ausliefert
StepFuns Modell ist die konkrete Hälfte dieses Vergleichs, und die Spezifikation ist ungewöhnlich. Es ist ein Sparse-Mixture-of-Experts-Modell mit insgesamt 600B Parametern, bei dem pro Token etwa 27B aktiv sind – ein Aktivierungsanteil von nahezu 4,5 % –, aufgebaut auf einem 92-schichtigen Narrow-and-Deep-Transformer mit Sparse Grouped-Query Attention und blockweiser Token-Zusammenführung. Das Kontextfenster umfasst 1M Token, Eingaben sind Text und Bilder, Ausgaben sind Text, und es schlussfolgert mit Extended Thinking. StepFun übersprang die gesamte Step-4.x-Reihe, um hierher zu gelangen, und ging direkt von Step-3.7-Flash zu Step 5.
• Intelligenz-Index — 44 bei Artificial Analysis, 24. von 200 bewerteten Modellen, gegenüber einem Median von 24
• Ausgabegeschwindigkeit — 99,8 Token pro Sekunde, 45. von 200
• Zeit bis zum ersten Token — 2,96 Sekunden im selben unabhängigen Durchlauf
• Preis — 1,00 $ pro 1 Mio. Input-Tokens, 2,70 $ pro 1 Mio. Output-Tokens, mit 95 % Cache-Rabatt
• Kosten pro Intelligence-Index-Aufgabe — 0,71 $, 27. von 200
• Gewichte — heute keine; ein BF16-Checkpoint ist für den 15. Oktober 2026 geplant
• Lizenz — keine veröffentlicht. Das Modell ist proprietär, ohne Angabe einer Genehmigung zur kommerziellen Nutzung, eines Weiterverbreitungsrechts oder einer Erlaubnis zum Fine-Tuning.
Der Preis ist die auffällige Zeile, und ebenso eine, die für StepFun weniger vorteilhaft ist, als es zunächst scheint: 160 Mio. Ausgabe-Tokens im Intelligence Index gegenüber einem Median von 92 Mio., Platz 64 von 200 bei diesem Maß. Das Modell ist wortreich, und Wortreichtum ist ein Kostenmultiplikator genau in den agentischen Workloads, für die es verkauft wird. Die Kosten-pro-Aufgabe-Zahl von 0,71 $ rechnet das bereits ein, weshalb sie die ehrlichere Zahl zum Nennen ist als der Listenpreis.
StepFuns eigene Bewertungen sind nicht reproduziert und sollten als Herstellermaterial gelesen werden, bis jemand Unabhängiges sie durchführt. Sie setzen das Modell auf 29,5 bei ALE-CLI, 66,4 bei FrontierFinance, 83,3 bei DRACO, 80,5 bei ProgramBench, 67,7 bei DeepSWE v1.1 und 49,0 bei StepCodeBench, mit 33,3 % bei Terminal-Bench 4.0 und 1571 bei GDPval-AA v2. StepFun berichtet außerdem von einer MLA-Spitze von 508 TFLOPS in einer 24-stündigen GPU-Kernel-Optimierungsaufgabe gegenüber 493 für Claude Opus 5. Das sind StepFuns Zahlen zu einem Modell, das StepFun nicht geöffnet hat.

Der Direktvergleich, den Sie anstelle dieses hier durchführen können
Wenn du den Vergleich willst, den der Titel verspricht, ist der ehrliche Ersatz Step 5 Preview gegen GLM-5.3 – das Modell, das Z.ai tatsächlich ausgeliefert hat, immer noch sein aktuelles offenes Flaggschiff und dasjenige, das ein etwaiges GLM-5.5 ersetzen würde. Auf dem unabhängigen Leaderboard liegen die beiden einen Punkt auseinander. In fast allem anderen nicht.
• Intelligenz-Index — Step 5 Preview 44 vs. GLM-5.3 45
• Parameter — 600B gesamt / 27B aktiv vs. 753B gesamt / 40B aktiv
• Ausgabegeschwindigkeit — 99,8 Tokens/Sek. gegenüber 72,1 Tokens/Sek.
• Zeit bis zum ersten Token — 2,96 s vs. 2,99 s
• Preis pro 1 Mio. Tokens — 1,00 $ Eingabe / 2,70 $ Ausgabe vs. 1,40 $ Eingabe / 4,40 $ Ausgabe
• Cache-Rabatt — 95 % vs. 81 %
• Kosten pro Aufgabe im Intelligence Index — 0,71 $ vs. 2,01 $
• Eingabemodalität — Text und Bilder vs. nur Text
• Lizenz — keine veröffentlichte vs. eine benutzerdefinierte Z.ai-Lizenz, die nicht MIT ist
Das Muster wiederholt, was die Einführung von Step 5 Preview gegenüber jedem ausgelieferten Modell festgestellt hat, gegen das es bewertet wurde: ein entscheidender Effizienzvorsprung und ein statistisches Unentschieden bei der Leistungsfähigkeit. Es generiert Tokens etwa 38 % schneller, kostet in beide Richtungen ungefähr halb so viel pro Million Tokens und ist gegenüber GLM-5.3 pro Index-Aufgabe 2,8-mal günstiger – schneidet dabei aber einen Punkt niedriger ab. Auf dem Board bringt diese 44 es zudem auf Augenhöhe mit Kimi K3, was man wissen sollte, bevor man eines von beiden als Spitzenreiter behandelt.
Die eine Zeile, in der Step 5 Preview eindeutig hinterherhinkt, ist diejenige, die man nicht benchmarken kann. GLM-5.3 hat eine Lizenzdatei und herunterladbare Gewichte; Step 5 Preview hat ein Hugging-Face-Repository, das ein einziges .gitattributes sowie ein angegebenes Datum – den 15. Oktober – für den BF16-Checkpoint enthält. Wenn Z.ais nächstes Flaggschiff mit offenen Gewichten unter denselben individuellen Bedingungen erscheint, die es das ganze Jahr über verwendet hat, landet es in der einzigen Kategorie, in der Step 5 Preview derzeit nichts entgegenzusetzen hat – und genau das ist der wahre Grund, warum sich ein Vergleich mit GLM-5.5 eher lohnt, abgewartet statt durchgeführt zu werden.

Warum das Warten auf GLM-5.5 die teure Option ist
Das praktische Problem bei einem Modell, das seit zwei Monaten zwei Monate entfernt ist, ist, dass Ihre Evaluierungsarbeit nicht darauf warten kann. GLM-5.5 hat keinen Endpunkt, daher kann es nicht benchmarkiert, preislich verglichen, lastgetestet oder hinter eine Fallback-Regel gestellt werden. Jede Woche, die damit verbracht wird, um es herum zu planen, ist eine Woche, in der Entscheidungen aufgrund einer Prognose aufgeschoben werden – und die Prognose hat bereits ein Zeitfenster verpasst.
GLM-5.3 dagegen ist live auf OrcaRouter unter z-ai/glm-5.3 zu 1,26 $ Input und 3,96 $ Output gegenüber den 1,40 $ und 4,40 $, die Z.ai auf der eigenen Seite listet. Das wird ohne Aufschlag durchgereicht, was bedeutet, dass die Zahl, die Sie sehen, der aktuelle Tarif des Anbieters ist und nicht einer, den wir festlegen, und eine Preisänderung eines Anbieters ist bei uns noch am selben Tag live statt erst zum nächsten Abrechnungszyklus.
Step 5 Preview ist nicht in unserem Katalog, und wir leiten es nicht weiter. Es läuft über StepFuns eigene API und Studio, und das ist der einzige Ort, an dem es läuft, bis der Checkpoint vom 15. Oktober erscheint. Was OrcaRouter Ihnen in der Zwischenzeit bietet, ist alles auf der anderen Seite dieses Vergleichs hinter einer einzigen API für mehr als 200 Modelle: GLM-5.3 zum oben genannten Tarif, GPT-6 Astra, DeepSeek V4 Pro, Claude Opus 5 und der Rest, mit automatischem Failover über Anbieter hinweg, das einen Produktionspfad stabil hält, während die Kapazitätskurve einer Preview noch unbekannt ist, und der Routing-DSL, der mehrere davon zu einem einzigen Aufruf zusammenfügt statt zu einer zweiten Integration. Benchmarken Sie die Preview mit demselben Schlüssel gegen ein Produktionsmodell; lassen Sie den Produktionspfad, wo er ist.

Was würde die Antwort ändern?
Zwei Termine entscheiden darüber. Der 15. Oktober ist der Termin, an dem laut StepFun der BF16-Checkpoint für Step 5 Preview erscheint, und die Lizenz, die zusammen mit ihm erscheint, ist die mit Abstand folgenreichste Unbekannte im Vergleich – eine permissive Lizenz würde einen 2,8-fachen Kostenvorteil pro Aufgabe zu etwas machen, das man besitzt, statt es zu mieten, und würde die einzige Achse auslöschen, auf der GLM-5.3 klar vorn liegt. Eine restriktive Lizenz lässt GLM-5.3 als das einzige der beiden Modelle übrig, auf dem man ein Produkt aufbauen kann, und macht aus dem Ein-Punkt-Abstand eine Nebensächlichkeit über zwei Modelle, die man ohnehin unterschiedlich einsetzen würde.
Das zweite ist das Analystenfenster, das vom 8. Oktober bis 9. November für das nächste Flaggschiff von Z.ai läuft, das möglicherweise GLM-5.5 genannt wird oder auch nicht und möglicherweise dem Gerücht ähnelt oder auch nicht. Wenn es überhaupt erscheint, erscheint es als Modell mit Lizenz und Checkpoint – die zwei Dinge, die Step 5 Preview fehlen – und der Vergleich wird zu einem echten.
Bis beide geklärt sind, ist die nützliche Frage nicht, welcher der beiden besser ist, denn einer von ihnen lässt sich nicht ausführen. Sondern auf welchem der existierenden Modelle du jetzt aufbauen solltest und ob sich die Antwort ändert, wenn der nächste Checkpoint erscheint. Diese Frage hat diese Woche eine überprüfbare Antwort, und sie erfordert nicht, darauf zu warten, dass aus einem Namen ein Modell wird.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
