
GLM-5.3-Flash enthüllt: Das anonyme „Ox Alpha“ war die ganze Zeit Zhipus offenes multimodales Spitzenmodell
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianNEUQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenNEUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenz77Coding
Das Modell, das eine Woche lang die Spitze der Nutzungsstatistiken von Drittanbieter-Coding-Plattformen belegte, hat endlich einen Namen und einen Preis. Am 26. August 2026 bestätigte Zhipu AI, dass es sich bei dem kostenlosen „Ox Alpha“-Modell, das Entwickler seit dem 20. August stark strapaziert hatten, um GLM-5.3-Flash handelt – ein Mixture-of-Experts-Modell mit insgesamt 320 Milliarden Parametern und 18 Milliarden aktiven Parametern (320B-A18B), die erste nativ multimodale Veröffentlichung der GLM-5-Serie und eines der günstigsten Spitzenklasse-Modelle auf jeder Preisliste bei der Markteinführung. Zhipu bepreist GLM-5.3-Flash mit einem Zehntel des API-Preises seines Flaggschiffs GLM-5.3 – oder einem Zwanzigstel während eines zeitlich begrenzten Rabatts – und die offenen Gewichte (MIT-Lizenz) gingen am selben Tag zu Hugging Face. Anders als GLM-5.3, dessen Gewichte noch für Ende des Monats ausstehen, kann man dieses Modell bereits diese Woche selbst hosten, nicht erst nächste.
Hier ist die Kurzversion: Zhipu hat sein bisher günstigstes großes Modell als Open Source veröffentlicht. Es übertrifft das eigene GLM-5.2 in Benchmarks, obwohl es nur einen Bruchteil der aktiven Parameter verwendet, und der Anbieter gibt seinen Artificial Analysis Intelligence Index Score mit 57 an – was laut Zhipus Launch-Materialien Claude Opus 4.8 entspricht. Alle mit diesem Launch verbundenen Benchmark-Zahlen stammen vom Anbieter und sind zum Zeitpunkt der Erstellung nicht unabhängig reproduziert; die Preise und die Parameterzahlen sind aktuelle Fakten.
Was tatsächlich ausgeliefert wurde
GLM-5.3-Flash ist ein MoE mit insgesamt 320B / 18B aktiven Parametern und 45 Schichten, was seinen aktiven Umfang auf etwas mehr als die Hälfte der ~32B aktiven Parameter von GLM-5.2 bringt. Die wichtigste Fähigkeit ist die Modalität: Es nimmt nativ Text-, Bild- und Videoeingaben entgegen – das erste GLM-5-Modell, das dies tut – anstatt Vision über einen separaten Adapter zu leiten. Der Kontext geht bis zu 1 Million Token, und Zhipu gibt an, dass die Kosten für die Bereitstellung langer Kontexte bei etwa einem Drittel derer von GLM-5.3 liegen.
Was die Architektur betrifft, beschreibt Zhipu es als das erste Open-Source-Frontier-Modell, das ein hybrides Design aus Sparse Attention und Linear Attention verwendet, kombiniert mit Manifold-Constrained Hyper-Connections (mHC) für das Skalieren und einem IndexPool-Mechanismus, der vier Indexer-Key-Vektoren zu einem gewichteten Pool komprimiert, um die Latenz bei langen Kontexten zu reduzieren. Das Pretraining erfolgte an einem multimodalen Korpus mit 30 Billionen Token. Nichts davon ist bisher unabhängig geprüft – es ist Zhipus Beschreibung seines eigenen Modells –, aber die Behauptungen zur Serving-Effizienz sind spezifisch genug, um sie zu testen, sobald die Gewichte im Open-Source-Inferenz-Stack verfügbar sind.
Das Spezifikationsblatt zum Starttag auf einen Blick:
Parameter — insgesamt 320B / 18B aktiv, 45 Schichten, MoE.
• Modalität — native Text-, Bild- und Videoeingabe; Textausgabe.
• Kontextfenster — bis zu 1.000.000 Token.
• Lizenz — MIT, offene Gewichte live auf Hugging Face beim Launch.
• Preis — $0.15 / $0.50 pro Million Tokens (Eingabe / Ausgabe), $0.03 pro Million zwischengespeicherter Eingabe; eine Aktion mit 50 % Rabatt bis zum 9. September 2026 senkt das auf $0.075 / $0.25 / $0.015. Zum Listenpreis ist das ungefähr ein Zehntel des Preises von GLM-5.3 ($1.40 / $4.40).

Die Ochsen-Alpha-Woche
Die Enthüllung beendet eine Woche voller Spekulationen. Am 20. August erschien ein anonymes Modell auf einer Drittanbieter-KI-API-Plattform mit einem Kontextfenster von 1 Million Token, Text-/Bild-/Video-Eingabe und einem Preis von null – und wurde schnell zum am häufigsten aufgerufenen Modell in den Wochencharts der Plattform. Innerhalb von 48 Stunden führte die Community es anhand von Fingerabdrücken auf Zhipus GLM-Familie zurück – dasselbe Muster aus Anonymität und anschließender Bestätigung, mit dem zuvor Modelle anderer chinesischer Labore identifiziert worden waren – und Analysten vermuteten weitgehend eine Flash-Variante des GLM-5.3. Die Ankündigung vom 26. August bestätigte die Vermutung und fügte hinzu, dass die kostenlose Woche ein beabsichtigter Test war: Zhipu zufolge stellte der anonyme Lauf Aufrufrekorde auf den Coding-Plattformen auf, auf denen er angeboten wurde, wobei der gesamte Datenverkehr über einheimische chinesische Chips abgewickelt wurde.
Der Kontext der kostenlosen Woche ist wichtig für die Preiserwartungen. Ein Modell, das eine Woche lang für 0 $ verschenkt wird und dann zu einem Zehntel des Preises des Flaggschiffs auf den Markt kommt, mit einem zeitlich begrenzten Rabatt, der den Preis auf ein Zwanzigstel des Preises des Flaggschiffs senkt, ist ein bewusster marktbildender Schachzug im Budget-Segment – und der Zusatz „zeitlich begrenzt“ ist der Teil, auf den es ankommt. Der Rabatt ist eine Preisentscheidung, die zurückgenommen werden kann; die offenen Gewichte von MIT können das nicht.

Was es kostet, in echten Dollar
Zhipus Preisliste liegt nun in tatsächlichen Dollar vor, nicht nur als Verhältnisse: 0,15 $ pro Million Input-Token, 0,50 $ pro Million Output-Token und 0,03 $ pro Million gecachter Input-Token. Verglichen mit den veröffentlichten Preisen von GLM-5.3 (1,40 $ / 4,40 $) entspricht das etwa einem Zehntel des Listenpreises, und ein Einführungsangebot mit 50 % Rabatt bis zum 9. September 2026 senkt den Preis auf 0,075 $ / 0,25 $ / 0,015 $ — etwa ein Zwanzigstel. Zhipu beziffert die Kosten des Modells pro Aufgabe im AA Intelligence Index auf etwa 0,045 $ (Herstellerangabe) — die Zahl hinter der Darstellung „1/40 von Opus 4.8". Für ein Modell, das in derselben Leistungsbandbreite liegt wie Modelle, die 10–40x höher bepreist sind, sind die Schlagzeilen zu den Kosten real; das Kleingedruckte besagt, dass der Einführungsrabatt vorübergehend ist und die Kosten pro Aufgabe davon abhängen, wie ausführlich das Modell im Produktionsbetrieb ausfällt.
Die Effizienzgeschichte ist der Punkt, auf den Zhipu seinen Kostenvorteil zurückführt. Im Vergleich zu GLM-5.3 berichtet der Anbieter von einer 3,0-fachen Reduzierung des Attention-Computes und einer 4,4-fachen Reduzierung des KV-Caches und beansprucht den niedrigsten Attention-Compute unter den verglichenen Budget-Modellen – GLM-5.3, DeepSeek V4 Flash und Kimi K3 – räumt jedoch ein, dass sein KV-Cache immer noch etwas größer ist als der von DeepSeek V4 Flash und Kimi K3. Auf der Serving-Seite berichtet Zhipu über eine 3-fache Verbesserung der End-to-End-Serving-Leistung gegenüber der Baseline auf einheimischen chinesischen Chips und erreicht damit Kosten pro Token, die es als vergleichbar mit Mainstream-NVIDIA-GPUs bezeichnet. Diese Angaben stammen alle vom Anbieter und wurden noch nicht unabhängig reproduziert; es sind die richtigen Zahlen, um sie mit den offenen Gewichten abzugleichen.
Warum die Enthüllung wichtig ist
Auch ohne die Benchmarks verändert der Launch die Landschaft offener Modelle auf zweierlei Weise. Erstens handelt es sich um ein Open-Weights-Multimodell im Frontier-Band zu einem Budgetpreis — die Kombination aus MIT-Lizenz, 1M-Kontext, nativem Bild-/Videoeingang und Kosten im einstelligen Cent-Bereich pro Aufgabe hat kein direktes Pendant bei den US-Frontier-Labors, deren vergleichbare multimodale Modelle um eine Größenordnung teurer sind und geschlossen ausgeliefert werden. Zweitens unterbietet es Zhipus eigenes Flaggschiff: GLM-5.3 ist das 743B-Modell, das diesen Monat einen unabhängig gemessenen Wert von 60 auf dem AA Intelligence Index erzielte, und GLM-5.3-Flash wird gegen dieselbe Familie als „Frontier-Intelligenz, Flash-Kosten" positioniert. Zhipus Erzählung besagt, dass ein kleineres, günstigeres Modell den Großteil der Leistungsfähigkeit des Flaggschiffs erfassen kann — was, wenn die Coding- und Agentik-Behauptungen des Anbieters Bestand haben, dasselbe Post-Training-Ökonomie-Argument ist, um das die Branche das ganze Jahr kreist.
Eine Einschränkung rückt dies ins rechte Licht. Der AA-Index-Wert von 57 für GLM-5.3-Flash stammt aus Zhipus eigenen Launch-Materialien und nicht vom Artificial-Analysis-Leaderboard; auch der Coding-Vergleich mit Claude Opus 4.8 ist Zhipus interne Z.ai-Code-Bench-Bewertung. Die 57 und die Parität beim Coding sind also als Behauptungen zu werten, bis unabhängige Messungen vorliegen — das Modell wurde umfassend anonym getestet, daher sollten Zahlen von Drittanbietern bald eintreffen.
Probieren Sie es aus, und wie die Routing-Ebene passt.
Der Zugang ab dem ersten Tag erfolgt über Zhipus eigene API, die offenen Gewichte auf Hugging Face (zai-org/GLM-5.3-Flash, MIT) und Zhipus Coding-Produkte – ZCode und den GLM Coding Plan, der eine Reihe täglicher Erfahrungskarten umfasst. Für Selbsthosting bedeutet die MIT-Lizenz zusammen mit vLLM- und SGLang-Unterstützung, dass die oben genannten Aussagen zur Serving-Effizienz direkt überprüfbar sind.
Was das Routing betrifft, ist GLM-5.3-Flash selbst Stand dieses Updates noch nicht im Angebot von OrcaRouter. Der Rest der GLM-Familie sieht so aus: GLM-5.3 ging bei uns am selben Tag live, an dem Zhipus API eröffnet wurde, zu Zhipus Listenpreis, mit 0% Aufschlag, der durchgereicht wird. Dieser Pass-through ist genau der Mechanismus, der bei einem Launch wie diesem zählt — eine Preisänderung des Anbieters, ob der Rabatt bestehen bleibt oder sich die Preistabelle später ändert, taucht bei uns am selben Tag auf, ohne Neuverhandlung. Wenn Sie Flash, sobald es verfügbar ist, zusammen mit dem Rest der GLM-Reihe über einen einzigen API-Schlüssel nutzen möchten, dann ist das das passende Setup; bis dahin sind die Gewichte auf Hugging Face der schnellste Weg, um es selbst zu testen.

Was als Nächstes ansehen
Drei Dinge klären die wahre Geschichte in den nächsten Wochen. Erstens: eine unabhängige Messung des 57 durch Artificial Analysis – das Modell lief bereits als Ox Alpha in freier Wildbahn, also sollte die Rangliste schnell aufholen. Zweitens: ob der 50%-Rabatt-Aktionszeitraum, der derzeit am 9. September 2026 endet, über dieses Datum hinaus verlängert wird, da das die langfristigen Kosten des Flash bestimmt. Drittens: die GLM-5.3-Gewichte, die weiterhin für etwa den 28. August versprochen sind – dieselbe Woche, in der die MIT-Gewichte des Flash veröffentlicht wurden, was der Open-Weights-Community zwei Stufen derselben Familie zum Vergleich geben würde.
In diesem Artikel verglichen3
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
