Eine Hero-Titelkarte für Ox Alpha, das anonyme Frontier-Modell, die einen fragezeichenförmigen Modell-Chip zeigt, mit Text-, Bild- und Videoeingängen, die hineinströmen, und Token-Blöcken, die herausströmen, mit drei Pillen mit der Aufschrift „1M Token-Kontext“, „Eine Woche kostenlos“ und „Hersteller unbekannt“, und dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Ox Alpha enthüllt: Z.AI veröffentlicht es als Open-Weight-Modell GLM-5.3-Flash

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Am Abend des Mittwochs, 26. August, endete das Rätsel so, wie es die Forensik vorhergesagt hatte. Z.AI – das Pekinger Labor hinter der GLM-Serie – veröffentlichte das Modell, das es unter einer Maske getestet hatte, als Open-Weight-Produkt unter dem Namen GLM-5.3-Flash, genau der Untername, auf den sich Tokenizer-Forensik und Vorhersagemärkte geeinigt hatten. Ox Alpha, das anonyme Modell, das seit seinem Auftauchen am 20. August die Nutzungs-Charts anführt, ist nun ein veröffentlichtes, selbst hostbares Modell: MIT-Lizenz, 320B Gesamtparameter mit 18B aktiven pro Token, das 1.048.576-Token-Kontextfenster und der im Listing beworbene Text-/Bild-/Video-Input sowie Gewichte auf Hugging Face. Die Enthüllung beantwortete auch das größte Rätsel der anonymen Woche – wie ein Modell, das niemandem gehörte, 100 Billionen Token pro Tag bewegen konnte: Z.AI gibt an, dass das Serving vollständig auf rund 100.000 einheimischen chinesischen AI-Chips lief – das erste Mal, dass chinesisches Silizium globalen Verkehr auf Frontier-Niveau getragen hat. Die Kapazität hatte auch die beliebteste Fehleinschätzung der Woche hervorgebracht – bei dieser Größenordnung argumentierten viele Beobachter, ermutigt durch kryptische Beiträge von Google-DeepMind-Forschern, Ox Alpha müsse Gemini sein, das auf NVIDIA-Hardware läuft; die Enthüllung korrigierte auch das. In derselben Nacht veröffentlichte Alibaba Qwen3.8-Flash-Next, eine Open-Weight-Vorschau seiner Qwen4-Architektur – ein Abend, zwei Open-Weight-Veröffentlichungen auf Frontier-Niveau aus chinesischen Labors. Die vier anonymen Veröffentlichungen vor Ox Alpha wurden schließlich alle von chinesischen Labors beansprucht: Zhipu AIs GLM-5, Xiaomis MiMo-V2-Pro, Ant Groups Lingxi Ling-2.6-flash und Meituans LongCat-2.0. Ox Alpha ist kein plattformexklusives Experiment mehr; es ist ein Modell, das Entwickler selbst hosten können.

Jede Zahl in diesem Beitrag ist eine eigene Behauptung des Betreibers, Daten aus der eigenen Auflistung der Plattform, eine öffentliche Ankündigung oder Community-Fingerprinting. Die DeepSWE-Zahlen sind die Community-Messungen des unabhängigen Forschers Ben Davis – ein vollständiger Lauf über 113 Aufgaben, kein offizieller Leaderboard-Eintrag, auch wenn die etwa 63-Prozent-Angabe nun eng mit dem von Z.AI selbst gemeldeten DeepSWE-v1.1-Ergebnis von 63,4 übereinstimmt. Die Identitätsfrage ist geklärt: Am 26. August veröffentlichte Z.AI Ox Alpha als Open-Weight-Modell unter dem Namen GLM-5.3-Flash – MIT-Lizenz, 320B Gesamtparameter mit 18B aktiven – und bestätigte damit den Unternamen, auf den die forensischen Untersuchungen von Tokenizer und Video-Encoder konvergiert waren. Architektur, Parameteranzahl und Preise sind nun vom Unternehmen veröffentlicht; was weiterhin nur vom Anbieter angegeben und nicht unabhängig verifiziert ist, sind die Benchmark-Suite und die Behauptung von Z.AI, dass der Betrieb während der anonymen Woche auf etwa 100.000 einheimischen chinesischen KI-Chips bei Kosten pro Token lief, die mit gängiger NVIDIA-Hardware vergleichbar sind – eine Unternehmensangabe, die inzwischen von mehreren Medien wiederholt wurde, keine geprüfte Zahl. Die frühe Gemini-Hypothese – die durch die Kapazität von 100 Billionen Token pro Tag entstanden war und durch kryptische Beiträge von Google-DeepMind-Forschern beflügelt wurde – war falsch, und die Veröffentlichung hat das geklärt. Das Qualitätsurteil, das dem Analysten teortaxesTex zugeschrieben wird – sowie sein Vorschlag, dass ein weiter trainierter Ox Alpha das Arbeitspferd für ein stärkeres GLM 5.5 sein könnte – ist die eigene Einschätzung dieses Analysten aus einem Social-Media-Beitrag, keine unabhängige Messung und keine Aussage von Zhipu. Die unten beschriebene Looping-Animation-Demo ist ebenfalls ein Community-Bericht – ein Beitrag eines Entwicklers auf X, der auf chinesischen Entwicklerforen aufgegriffen wurde – keine Anbieterangabe zu Fähigkeiten, und der Betreiber hat ein solches Feature nicht angekündigt.

Was wir wissen — und was wir nicht wissen

Die schnelle Version:

• Der Betreiber beschreibt Ox Alpha als „ein Frontier-Modell, das für effizientes Programmieren, anhaltende agentische Arbeit und reale Produktionsnutzung entwickelt wurde" — ein Reasoning-Modell, das auf langfristige Softwareentwicklung und Workflows ausgerichtet ist, die Text mit visuellem Kontext kombinieren.

• Es verfügt über ein Kontextfenster von 1.048.576 Token (1M), ein Ausgabelimit von 131.072 Token und akzeptiert Text-, Bild- und Videoeingaben — die erste der anonymen Veröffentlichungen, die Videoeingaben bewirbt, und eine Fähigkeit, die das GLM-5.3-Flash-Release als nativ statt nachgerüstet bestätigt.

• Es war eine Woche lang kostenlos: 0 $ pro Million Tokens ein- und ausgehend, wobei der Betreiber „großzügige Ratenlimits, nahezu unbegrenzte Nutzung“ angab, sowie eine Serving-Kapazität von 100 Billionen Tokens pro Tag – Kapazität, die laut der späteren Enthüllung auf etwa 100.000 einheimischen chinesischen Chips bereitgestellt wurde.

• Bestätigt: Am 26. August veröffentlichte Z.AI Ox Alpha als Open-Weight-Modell unter dem Namen GLM-5.3-Flash — MIT-Lizenz, 320B Gesamtparameter mit 18B aktiven — genau das, worauf Sub-Name-Tokenizer, Video-Encoder und Fehlercode-Forensik plus Prognosemärkte konvergiert hatten. Der unabhängige Analyst teortaxesTex stuft es, abgesehen von der Bildverarbeitung, ungefähr auf dem Niveau von GLM-5.3 ein und vermutet, dass ein weiter trainiertes Ox Alpha das Arbeitspferd hinter einem viel stärkeren GLM 5.5 sein könnte.

• Das Flash-Multimodal-Lesen hat jetzt eine Demo: Auf die Aufforderung, eine Endlosschleifen-Animation eines Pelikans zu erstellen, der Fahrrad fährt und ein Telefon öffnet, das dieselbe Animation abspielt, antwortete Ox Alpha mit einer in sich geschlossenen Endlosschleifen-Animation als einzelne HTML/SVG-Datei – eine Community-Demo, keine Herstellerangabe.

• Erste Aktivitätsdaten auf der Plattform zeigen bereits echten Produktions-Traffic, darunter einen Coding-Agenten von Nous Research und den Zed-Editor.

• Das Unternehmen hat es nun ausgeliefert — am 26. August veröffentlichte Z.AI Ox Alpha als das Open-Weight-Modell GLM-5.3-Flash unter der MIT-Lizenz und beendete damit auf einmal die Fragen zu Identität, Spezifikationen und Preis: 320 Mrd. Parameter insgesamt, davon 18 Mrd. aktiv, nativ multimodal, mit einem Z.AI-Listenpreis von 0,15 $ Eingabe / 0,50 $ Ausgabe pro Million Tokens und einer 50-%-Einführungsaktion, die laut Angabe nur bis zum 9. September laufen sollte — ein Datum, das inzwischen acht Tage zurückliegt, wobei weiterhin der rabattierte Tarif zur Anwendung kommt. Z.AI gab außerdem bekannt, dass die Bereitstellung von 100T Tokens/Tag in der anonymen Woche auf ungefähr 100.000 inländischen chinesischen Chips lief, ein Novum in dieser Größenordnung. Was die Enthüllung nicht enthielt, ist ein unabhängiger Benchmark — die Leistungsübersicht des Modells stammt vom Anbieter —, daher bleibt die repräsentativste unabhängige Zahl weiterhin Ben Davis’ vollständiger DeepSWE-Lauf mit 113 Aufgaben bei ungefähr 63 %, gleichauf mit GPT-5.6 Sol mid.

Was Ox Alpha ist

Die Auflistung der Plattform beschreibt Ox Alpha als „ein Reasoning-Modell, das für Programmierung, langfristige agentische Arbeit und Produktionsworkloads entwickelt wurde – langfristige Softwareentwicklung, komplexes Reasoning und Workflows, die Text mit visuellem Kontext kombinieren“. Das ist eine spezifische Positionierung: Es ist für langlaufende Agentenschleifen und für Code gebaut, nicht für allgemeinen Chat. Der 1M-Kontext ist das verräterische Merkmal – das ist genug Platz für eine mehrstündige Agentensitzung oder ein großes Repository – und das 131K-Ausgabelimit ermöglicht lange einzelne Generierungen. Es unterstützt Tool- und Funktionsaufrufe sowie strukturierte JSON-Ausgaben, was den Rest der agentischen Checkliste abdeckt.

A single-column scoreboard for Ox Alpha listing: context window 1M (1,048,576) tokens, max output 131,072 tokens, input text/image/video, independent benchmarks none yet, price free for one week, throughput 56 tokens/s (P50, platform-measured), with a footer reading 'Operator + platform-reported; no independent scores yet', and the OrcaRouter logo in the bottom-right corner.

Der Videoeingang ist das markanteste Merkmal auf dem Datenblatt. Keines der früheren anonymen Modelle bewarb ihn, und ein Modell, das sowohl Videoframes als auch Text und Bilder verarbeiten kann, ist auf eine andere Art von Arbeitslast ausgerichtet als die zuvor veröffentlichten, auf Chat abgestimmten Releases. Wie die Forensik später zeigen würde, ist er außerdem eines der stärksten Identitätsmerkmale, die ein Modell tragen kann. All dies – die Beschreibung, die Spezifikationen, die Geschwindigkeitswerte – stammt vom Betreiber und aus dem Listing der Plattform. Die GLM-5.3-Flash-Veröffentlichung bestätigte die wichtigsten Spezifikationen (320B-A18B, nativer Multimodus); die Geschwindigkeits- und Kapazitätswerte bleiben Angaben des Anbieters.

Die multimodale Geschichte bekam diese Woche eine konkrete Demo. Entwickler Chetaslua — dessen serverseitige Sonden Teil der Fingerabdruck-Spur sind — veröffentlichte einen Test, in dem er Ox Alpha bat, eine Schleife eines Pelikans zu erstellen, der Fahrrad fährt und ein Telefon öffnet, das dieselbe Animation abspielt: eine selbstreferenzielle Schleife innerhalb der Schleife. Sein Bericht zeigt, wie das Modell eine einzelne HTML/SVG-Animation liefert — einen Pelikan mit zweigliedrigen Beinen, die wirklich in die Pedale treten, Radgeschwindigkeit synchron zur Bodengeschwindigkeit, einen Parallax-Hintergrund und das Telefon-in-der-Schleife-Highlight. Chinesische Entwicklerforen haben separat eigene Pelikan-Fahrrad-Prompts ausgeführt und das Ergebnis diskutiert, die Demo ist also keine einzelne unverifizierbare Behauptung. Da die Ausgabe Code ist, entspricht sie der Nur-Text-Ausgabe-Spezifikation der Plattform: multimodales Verständnis und kreative Codegenerierung arbeiten zusammen, nicht native Videosynthese. Chetasluas Fazit — dass dies der Lohn der Multimodalität ist und dass ein leistungsfähiges Open-Source-Modell damit kommen wird — ist seine eigene Prognose, keine Aussage des Anbieters; der Betreiber hat nichts angekündigt.

Das eine Woche lang kostenlose Angebot

Die Werbung war aggressiv. In der Woche, in der sie lief, war sie kostenlos, mit „großzügigen Rate-Limits, nahezu unbegrenzter Nutzung“ und einer behaupteten Kapazität von 100 Billionen Tokens pro Tag, begleitet von der Anmerkung des Betreibers, die Nutzer einlud, zu „sehen, was man tun kann.“ Wörtlich genommen würde der Betreiber mit 100T Tokens pro Tag zu den größten Inferenzanbietern überhaupt gehören – die Behauptung liest sich weniger wie ein Spezifikationsblatt und mehr wie eine Herausforderung zum Stresstest, was zum Muster passt: Anonyme Veröffentlichungen sind der Weg, wie ein Labor echten Datenverkehr auf Frontier-Niveau bekommt, ohne seinen Namen an die Tür zu hängen. Die bestätigte Lesart machte die Größenskala konkret, statt sie nur plausibler zu machen: Z.AI gab bekannt, dass der Betrieb mit 100T Tokens pro Tag auf etwa 100.000 chinesischen KI-Chips im Inland lief – das erste Mal, dass eine Veröffentlichung auf Frontier-Niveau in diesem Umfang ohne NVIDIA-Hardware betrieben wurde. Diese Offenlegung ist immer noch eine Behauptung des Unternehmens, die inzwischen von mehreren Medien wiederholt, aber nicht unabhängig geprüft wurde, und sie beinhaltet eine zweite, weichere Anbieteraussage: Z.AI sagt, die Kosten pro Token auf dem Inlandscluster seien mit denen gängiger NVIDIA-GPUs vergleichbar.

Die Kehrseite von „eine Woche kostenlos“ war, dass der danach folgende Preis unbekannt war – die Enthüllung beantwortete das. Der von Z.AI veröffentlichte Listenpreis für GLM-5.3-Flash beträgt 0,15 $ pro Million Eingabetokens, 0,50 $ pro Million Ausgabetokens und 0,03 $ pro Million gecachte Eingabe. Eine Startaktion mit 50 % Rabatt sollte bis zum 9. September 2026 laufen und reduzierte dies auf 0,075 $ / 0,25 $. Acht Tage nach diesem Datum ist der rabattierte Tarif immer noch der Tarif, der bereitgestellt wird: Bei erneutem Lesen am 17. September 2026 bepreist die Modellseite z-ai/glm-5.3-flash die Eingabe mit 0,075 $, die Ausgabe mit 0,25 $ und Cache-Lesevorgänge mit 0,0173 $ pro Million Tokens, ohne Hinweis auf eine Aktion. Gegenüber dem Listenpreis von GLM-5.3 von 1,40 $ / 4,40 $ ist das ungefähr ein Zwanzigstel. Die praktische Konsequenz ist, dass das Enddatum 9. September veraltet und nicht bindend ist – ein Entwickler, der mit 0,15 $ / 0,50 $ kalkuliert, kalkuliert mit einem Betrag, der derzeit niemandem berechnet wird. Was die Preisseiten nicht klären, ist das Warum. Die eigene Modellliste von Z.AI führt für GLM-5.3-Flash weiterhin 0,15 $ / 0,50 $, daher lässt sich nicht belegen, ob die Aktion verlängert, dauerhaft gemacht oder einfach weiterlaufen gelassen wurde; der rabattierte Tarif ist der an diesem Datum beobachtete Fakt, und die Ursache bleibt offen.

Der erste vollständige Benchmark — und er landet auf Augenhöhe mit GPT-5.6 Sol mid

Ox Alpha hat weiterhin keinen Eintrag bei unabhängigen Trackern wie Artificial Analysis oder LMArena – das Wort „Frontier“ stammt vom Betreiber selbst, und die Benchmark-Zahlen, die Z.AI mit der GLM-5.3-Flash-Veröffentlichung bekannt gab (DeepSWE v1.1 63,4, AutomationBench 48,8, ein Artificial Analysis Intelligence Index von 57), sind Anbieterangaben, keine unabhängigen Ergebnisse. Was sich seit dem Launch geändert hat, ist, dass von der Community gemessene Zahlen zu kursieren beginnen – und das Bild hat sich verengt. Auf Kingbench liegen frühe Läufe für Ox Alpha bei 87,5, knapp unter den 91,25 von GLM-5.3. Bei DeepSWE hat der unabhängige Forscher Ben Davis zunächst ein Teilset mit 10 Aufgaben ausgeführt und 80 % Pass@1 gemeldet – vor Claude Fable 5 (65 %), GLM-5.3 und Grok 4.6 (62 %) sowie GPT-5.6 Sol (52 %). Inzwischen hat er einen vollständigen Lauf über den gesamten DeepSWE-Satz mit 113 Aufgaben abgeschlossen, und das korrigierte Ergebnis liegt bei etwa 63 % – mehr oder weniger auf Augenhöhe mit GPT-5.6 Sol mid. Das 80-%-Teilset war die auffällige Zahl, aber zehn Aufgaben sind weniger als 9 % des Benchmarks; Davis selbst bezeichnete die Zahl für den vollständigen Satz als diejenige, die „wesentlich mehr Sinn ergibt“. Das sind von der Community gemessene Werte, kein Anbieter-Benchmark und keine offizielle Leaderboard-Punktzahl – aber das Ergebnis des vollständigen Laufs ist die repräsentativste Zahl, die bisher aus dem Modell gewonnen wurde, und sie deckt sich nun eng mit Z.AIs eigenem, vom Anbieter gemeldeten DeepSWE-v1.1-Ergebnis von 63,4 – ein nützlicher Abgleich, auch wenn die Zahl des Unternehmens eher eine Behauptung als eine Messung ist.

Ein Vergleich zählt heute mehr als zum Start. DeepSeek V4 Pro 0813 – der GA-Build des Flaggschiffs von DeepSeek, der am 13. August erschien – meldet einen DeepSWE-Wert von 62,7 auf DeepSeeks eigenem Benchmark-Blatt, gegenüber 12,8 für das frühere DeepSeek V4 Pro Preview. Beide Zahlen stammen vom Hersteller und wurden zum Zeitpunkt dieses Artikels von keinem unabhängigen Labor verifiziert. Liest man sie zusammen mit GLM-5.3-Flashes ~63 % Community-Volllauf und Z.AIs eigenem DeepSWE v1.1 von 63,4, liegt DeepSeeks 62,7 in derselben niedrigen 60er-Bandbreite wie die beiden bekanntesten chinesischen Coding-Agent-Behauptungen. Der Zehn-Punkte-Abstand, der wie Ox Alphas Markenzeichen wirkte, wurde gegen DeepSeek V4 Flash 0731 gemessen, das günstigere kleine Modell; gegen DeepSeeks Flaggschiff liegt GLM-5.3-Flash gleichauf, nicht zehn Punkte vorn.

Die andere Lektion dreht sich um die Zahl selbst. Analyst teortaxesTex — der diese Schätzungen seit der anonymen Woche verfolgt — merkt an, dass der erste Bericht über Ox Alpha ebenfalls 80 % DeepSWE ergab: Das war Davis' auffälliges 10-Aufgaben-Subset, und das Endergebnis bei den vollen 113 Aufgaben lag bei 63 %. Da DeepSeek V4 Pro 0813 offiziell bei 62,7 im selben Bereich liegt, ist seine Beobachtung, dass noch nichts an eine legitim reproduzierte 80 % herangekommen ist — die 80-%-Zahl taucht weiterhin früh im öffentlichen Leben eines Modells auf und pendelt sich in den niedrigen 60ern ein, sobald das volle Set durchlaufen ist. Das ist seine Analystenlesart, keine Messung, aber es ist die richtige Linse für die nächste DeepSWE-Schlagzeile, auch für jede über GLM-5.3-Flash selbst.

A screenshot of the Artificial Analysis models leaderboard as of August 21, 2026, showing the Intelligence section led by Claude Opus 5 and Claude Fable 5, the largest context-window highlights, and the output-speed rankings — a frontier leaderboard Ox Alpha has no independent score on yet.

Was es auch gibt, ist Nutzung. Die Aktivitätsdaten der Plattform zeigen innerhalb der ersten Stunden echten Produktionsverkehr – darunter Hermes Agent, das agentische Codierungsprojekt von Nous Research, und den Zed-Editor. Beide sind genau die Anwendungsfälle „kontinuierliche agentische Arbeit und Codierung", für die das Modell positioniert ist. Es ist keine Punktzahl, aber es ist ein Signal: Entwickler mit echten Arbeitslasten entschieden, dass ein kostenloses, anonymes Wagnis der Spitzenklasse es wert war, angebunden zu werden. Bevor der vollständige DeepSWE-Lauf eintraf, war diese frühe Übernahme der einzige vorhandene Beweis; der ~63-%-Wert für den vollständigen Satz gibt dem Modell nun einen Benchmark-Anker, den es dagegen abwägen kann.

Das Kleingedruckte zur Datenspeicherung

Die Ankündigung der kostenlosen Woche wirbt mit „keiner Datenspeicherung“. Die Auflistung des Modells auf der Plattform erzählt eine qualifiziertere Geschichte: Prompts und Vervollständigungen werden vom Anbieter aufbewahrt, aber nicht für das Training verwendet, gemäß den Bedingungen der Stealth-Modelle der Plattform. Der Unterschied ist von Bedeutung, wenn man dabei ist, proprietären Code in ein 1M-Token-Fenster einzufügen, das einem Anbieter gehört, der anonym war, bis Z.AI am 26. August hervortrat. Behandeln Sie „keine Datenspeicherung“ als Marketing, bis Z.AI Bedingungen veröffentlicht, die genau das ausdrücklich sagen – und leiten Sie alles, was Sie nicht protokolliert haben möchten, über ein separates, zurechenbares Modell.

Das Playbook für das anonyme Modell

Ox Alpha ist die fünfte anonyme Veröffentlichung in sechs Monaten, und die vorherigen vier verliefen auf dieselbe Weise — ein anonymes Debüt, ein Schub an kostenlosem Traffic, dann ein Unternehmen, das sich zu erkennen gibt:

• Pony Alpha (Februar 2026) — von Zhipu AI etwa fünf Tage nach dem Launch als GLM-5 bestätigt, sein 744B-Parameter-MoE-Flaggschiff.

• Hunter Alpha (11. März) — ein kostenloses Modell mit einer Billion Parametern und einem 1M-Kontext, das zur Spekulationsgeschichte des Frühlings wurde und weithin als Deep​Seek V4 vermutet wurde; entpuppte sich als Xiaomis MiMo-V2-Pro, wobei der Begleiter Healer Alpha als MiMo-V2-Omni identifiziert wurde.

• Elephant Alpha (April) — ein kostenloses, auf Effizienz ausgerichtetes Textmodell, das Ant Group etwa zwei Wochen nach seinem Erscheinen als Lingxi Ling-2.6-flash bezeichnete.

• Owl Alpha (Ende April) — ein auf Agenten ausgerichtetes Modell mit nativem Tool-Calling und einem ~1M-Kontext, das Meituan am 30. Juni als LongCat-2.0 bestätigte, das erste Modell mit einer Billion Parametern, das vollständig auf einheimischen chinesischen Chips trainiert und bereitgestellt wurde.

• Ox Alpha (20. August) — am 26. August als GLM-5.3-Flash enthüllt, ein Open-Weight-Modell mit MIT-Lizenz und 320B-A18B-Architektur; Identität, Lizenz und Spezifikationen waren alle an demselben Tag offiziell, an dem die Maske fiel.

A two-column scorecard titled 'The anonymous models — and their reveals', listing Pony Alpha revealed as GLM-5 by Zhipu AI, Hunter Alpha as MiMo-V2-Pro by Xiaomi, Elephant Alpha as Lingxi Ling-2.6-flash by Ant Group, Owl Alpha as LongCat-2.0 by Meituan, and Ox Alpha marked '??? — unclaimed', with a footer noting reveals per each lab's public announcement and Ox Alpha unclaimed as of August 21, 2026, and the OrcaRouter logo in the bottom-right corner.

Warum ein gutes Modell hinter einer Maske launchen? Die gängige Lesart, die der Hunter-Alpha-Zyklus konkretisiert hat, ist, dass Anonymität Markenbias aus Bewertungen entfernt und die kostenlose Nutzung reale Evaluierungsdaten im Frontier-Maßstab per Crowdsourcing sammelt, während alle über den Eigentümer streiten. Wie eine Analyse des Musters es formulierte: „the lack of a brand is the marketing." Der zusätzliche Vorteil ist Geschwindigkeit: Ein anonymes Modell kann ein globales Entwicklerpublikum in Stunden erreichen – ohne Launch-Event – und das Mysterium selbst wird zur Distribution.

Wer ist Ox Alpha?

Bis zur Veröffentlichung am 26. August hatte kein Unternehmen Anspruch darauf erhoben und Zhipu AI hatte nichts gesagt – aber die Lage der handfesten Beweise änderte sich innerhalb von 48 Stunden nach dem Debüt des Modells, und die folgenden forensischen Analysen erklären, warum die Enthüllung – als GLM-5.3-Flash – mit so wenig Überraschung aufgenommen wurde. Die Kapazitätszahl wirkte zunächst gegen die Forensik: 100 Billionen Token pro Tag sahen nach der Signatur eines Spitzenlabors auf NVIDIA-Silizium aus, und die Theorie, dass Ox Alpha ein neues Gemini sei – bestärkt durch kryptische Beiträge von Forschern von Google DeepMind – hatte echte Dynamik, bis die Tokenizer-Beweise und dann Z.AIs eigene Veröffentlichung sie beendeten. Das stärkste Signal ist der Tokenizer. Ein von der Community entwickeltes Fingerprinting-Tool, modelprint, führte neun Infrastruktur-Tests gegen Ox Alpha durch und stellte fest, dass es in sechs Fällen mit Z.AIs GLM-5.3 übereinstimmte, wobei alle vier normalisierten Tokenizer-Zählungen zur GLM-Familie passten, während der beste Nicht-GLM-Kandidat zwei von vier erreichte. Der unabhängige Forscher Ben Davis berichtete, dass Ox Alphais Token-Zählungen bei 25 Test-Prompts exakt mit GLM-5.3 übereinstimmten, mit nur einer konstanten Differenz von +75 Token, die er auf einen versteckten Wrapper zurückführte. Die Übereinstimmung des Tokenizers ist das am schwersten zu fälschende Identitätssignal – ein Modell kann nicht ändern, wie es Text segmentiert, ohne neu trainiert zu werden.

Der Videopfad ist die zweite Signatur. Ox Alphas Video-Token-Verbrauch stimmte bei vier kontrollierten Stichproben exakt mit GLM-5V-Turbo überein — dieselben Frame-Sampling-, Dauer-Skalierungs- und Auflösungsmechanismen — während MiMo v2.5, Qwen 3.8 Max und GLM-4.6V alle abwichen. Das ist ein starkes Indiz: Die Videoverarbeitung sitzt tief im Modell, nicht als nachträgliches Anhängsel. Der Rest des Fingerprint-Stapels deckt sich mit derselben Lesart: Ox Alpha lehnt Audioeingaben ebenso ab wie GLM-5V, teilt GLMs charakteristischen „1301"-Fehlercode, erzeugt einen ähnlichen Ausgabestil (etwa 1,3 Emojis pro 1.000 Zeichen), trägt dieselbe eingeschränkte Parameter- und API-Konfiguration, die zwei Tage vor Ox Alphas Start auf der GLM-5.3-Listung der Plattform erschien, und hat einen Wissensstand nahe November 2025.

Die Identifizierung hat einen Präzedenzfall in Zhipus eigenem Drehbuch: Pony Alpha, die anonyme Februar-Veröffentlichung, entpuppte sich als GLM-5, was etwa fünf Tage nach dem Launch beansprucht wurde. Die diese Woche kursierende Analystenlesart – dass Ox Alpha GLM-5.3 ist, vermutlich das Flash-Modell – wurde von Pliny the Liberator bestätigt, der sagte, sein Agent habe bestätigt, dass „Ox-alpha von Zai stammt, aus der GLM-5.X-Familie.“ Der unabhängige Analyst teortaxesTex kommt in Bezug auf die Qualität zum gleichen Schluss und fügt eine zeitliche Einschätzung hinzu: Er stuft Ox Alpha ungefähr auf dem Niveau von GLM-5.3 ein, abgesehen von der Bildverarbeitung, und hält die schnelle Umsetzung für den bemerkenswertesten Teil – das reine Textmodell GLM-5.3 zu komprimieren und es innerhalb weniger Tage nach dem Launch am 14. August mit funktionierender Bildverarbeitung auszuliefern. Das ist die Einschätzung eines Analysten, keine unabhängige Bewertung, und er argumentiert, dass sie der Erzählung „China veröffentlicht Modelle frisch aus der Presse“ zu denken geben sollte. Sein neuester Beitrag fügt dieser Lesart eine Roadmap-Vermutung hinzu: Der GLM-5-Update-Zyklus könnte kurz sein; Ox Alpha ist GLM-5.3 nahe genug, dass der Einsatz als Subagent kaum Sinn ergibt – „einfach stattdessen ox @4 ausführen“ ist seine Abkürzung für die direkte Ausführung des Modells; und ein weiter trainiertes Ox Alpha würde als Arbeitstier, in seinen Worten ein „Lasttier“, für ein deutlich stärkeres GLM 5.5 sehr viel Sinn ergeben. Das ist die Spekulation eines Analysten über eine Roadmap, keine Aussage von Zhipu. Die Frage des Unternamens ist dagegen geklärt: Am 26. August veröffentlichte Z.AI Ox Alpha als GLM-5.3-Flash. Der Umstand, der das Flash-Label einst auf der Seite der „Vermutungen“ hielt – GLM-5.3 wurde am 14. August als reines Textmodell gelauncht, während Ox Alpha Videoeingabe bewirbt – ist genau das, was die Veröffentlichung geklärt hat: GLM-5.3-Flash ist ein eigenständiges, nativ multimodales Modell und nicht dasselbe reine Textmodell. Alternative Theorien – das MiMo-Team von Xiaomi, DeepSeek – wurden vorgebracht und aufgrund der Tokenizer- und Video-Beweise weitgehend verworfen, und die Veröffentlichung klärt die Familienfrage endgültig.Davis' Argument dafür, dass das Flash-Label relevant ist, erwies sich als das praktische: Da Ox Alpha tatsächlich GLM-5.3-Flash ist, das auf dem mittleren Niveau von GPT-5.6 Sol performt, lässt es sich nun lokal ausführen – die Gewichte liegen auf Hugging Face, und SGLang, vLLM und TokenSpeed servieren es –, was ein mittelklassiges Frontier-Coding-Modell in eine einmalige Hardware-Investition verwandelt, statt in eine Pro-Token-Rechnung für alle, die es selbst hosten möchten.

Das geopolitische Framing stammt von den Analysten, nicht von den Belegen: {{1}} „Das setzt die US-Frontier-Labore unter noch immenseren Druck, und der Abstand zu China schrumpft." {{/1}} Das ist eine Interpretation dessen, was ein frei verfügbares Modell der Zhipu-Klasse, das im Frontier-Maßstab läuft, für die Wettbewerbsordnung bedeutet — und die Hardware-Offenlegung verschafft ihr einen Vorteil, den die Analysten nicht hatten. {{2}} 100 Billionen Token pro Tag auf etwa 100.000 einheimischen Chips zu bedienen, ist die erste groß angelegte Demonstration, dass ein chinesischer Stack ohne NVIDIA-Silizium Frontier-Inferenz-Traffic bewältigen kann — das Szenario, vor dem NVIDIA-CEO Jensen Huang in diesem Frühjahr im Dwarkesh Podcast gewarnt hat, als er argumentierte, dass Exportkontrollen Chinas von NVIDIA unabhängigen Stack vorantreiben würden und dass ein Frontier-Modell, das am besten auf inländischer chinesischer Hardware läuft, ein „schreckliches Ergebnis" für die Vereinigten Staaten wäre. {{/2}} {{3}} Die Kostenparitätsangabe von Z.AI ist weiterhin nur eine Anbieterbehauptung, aber das Ereignis selbst ist real. {{/3}} Derselbe Abend machte den Punkt auch bei den Modellen konkret: {{4}} Während Z.AI GLM-5.3-Flash veröffentlichte, brachte Alibaba Qwen3.8-Flash-Next heraus, seine Open-Weight-Vorschau auf die Qwen4-Architektur. {{/4}} {{5}} Zwei chinesische Open-Weight-Veröffentlichungen der Frontier-Klasse in einer einzigen Nacht sind die konkrete Form dessen, was Beobachter „einen großen Tag für chinesisches Open Source" nannten. {{/5}}

Solltest du diese Woche darauf aufbauen?

Die kostenlose Woche ist vorbei, aber der Test ist noch günstig: Der tatsächlich am 17. September geltende Tarif liegt bei 0,075 $ Eingabe / 0,25 $ Ausgabe pro Million Token, nicht bei den Listenpreisen von 0,15 $ / 0,50 $ – die 50-%-Startaktion, deren Ende für den 9. September angekündigt war, gilt acht Tage später immer noch. Wenn Sie agentische Arbeit mit langem Horizont leisten, mit langen Kontexten programmieren oder videolastige Pipelines betreiben, ist das genau die Schnittstelle, an der Ox Alpha positioniert ist – und da die Gewichte offen sind, können Sie den Test auf Ihrer eigenen Hardware durchführen, statt auf die Duldung einer anonymen Plattform angewiesen zu sein. Zwei Vorsichtsmaßnahmen. Erstens ist das Label „Frontier“ nach wie vor nur eine Behauptung: Die Scorecard von GLM-5.3-Flash stammt vom Anbieter, und die eine belastbare unabhängige Zahl – Davis’ DeepSWE-Lauf mit ~63 % – ist stark, aber weit entfernt von den viralen 80 % des frühen 10-Aufgaben-Subsets. Zweitens war der Preis von 0 $ zeitlich begrenzt, und die Enthüllung hat einen Preis für das festgelegt, was danach kommt – günstig für die Fähigkeit, aber nicht mehr kostenlos. Was das Open-Weight-Release beseitigt, ist die Abhängigkeit: Die Dateien sind veröffentlicht, sodass das Modell selbst gehostet statt gemietet werden kann. Das ist die Form eines Tests, keine Abhängigkeit.

Der produktionssichere Weg, einen solchen Test zu fahren, ist eine Fallback-Kette: Das experimentelle Modell antwortet, solange es gesund ist, und die Anfrage wechselt in dem Moment auf ein bewährtes Modell, in dem es stockt, Fehler wirft oder verschwindet. Dafür ist eine Routing-Schicht da. Die Enthüllung macht die Fallback-Wahl trivial: Ox Alpha ist GLM-5.3-Flash, und das Modell selbst läuft live auf OrcaRouter unter seinem echten Namen zu $0,075 in / $0,25 out pro Million Tokens, mit Cache-Reads zu $0,0173 — der 50 %-Rabatt zum Launch, von dem es hieß, er ende am 9. September und sei, Stand 17. September, immer noch der Preis auf der Seite statt der Listenangabe von $0,15 / $0,50. Es wird mit 0 % Aufschlag durchgereicht, eine API über 200+ Modelle, mit automatischem Failover, damit eine Traffic-Spitze in der Launch-Woche nicht zu deinem Ausfall wird. Teste das neue Modell vorne, mit einem bewährten Fallback dahinter in der Kette; wenn sich ein Preis ändert, ist die Zahl, die du auf OrcaRouter siehst, die Zahl, die du zahlst – am selben Tag. Oder überspringe die API ganz — die Gewichte sind offen, also ist auch Self-Hosting von GLM-5.3-Flash hinter derselben Kette eine Option.

Was zu sehen

Sechs Dinge werden den Rest der Geschichte erzählen. Der unabhängige Benchmark: Die Leistungskarte von GLM-5.3-Flash wird vom Anbieter gemeldet, Davis' DeepSWE-Lauf mit rund 63 % ist die einzige solide unabhängige Zahl bisher, die offiziellen 62,7 von DeepSeek V4 Pro 0813 liegen jetzt im selben Bereich, und ein Eintrag bei Artificial Analysis oder LMArena — oder ein unabhängiger direkter Vergleich — wäre die abschließende Prüfung, ob „frontier“ eine Tatsache oder ein Werbeslogan ist. Die Preisentwicklung: Die Frage nach dem Dauerzustand hat nach der bisherigen Evidenz eine Antwort — die 50-%-Aktion sollte am 9. September enden, doch am 17. September wird noch immer der rabattierte Tarif von $0.075 / $0.25 bereitgestellt, also ist die Aktionszahl und nicht der Listenpreis von $0.15 / $0.50 die Zahl, mit der man kalkulieren sollte; ungeklärt bleibt die Ursache, da der eigene Listenpreis von Z.AI sich nicht bewegt hat. Die Hardware-Behauptung: Z.AI sagt, die anonyme Woche sei auf rund 100.000 inländischen Chips zu Kostenparität mit NVIDIA gelaufen — der erste öffentliche Test dafür in großem Maßstab ist, ob die Behauptung unabhängiger Prüfung standhält und ob der inländische Stack zum Standard für die GLM-Reihe wird. Die Adoptionsrechnung: ob der Traffic, mit dem Ox Alpha unter der Maske die Plattformspitze eroberte, sich in Self-Hosted- und API-Bereitstellungen umwandelt, jetzt da es einen Namen, eine Lizenz und einen Preis hat. Die Fortsetzung: ob GLM-5.3-Flash Ox Alpha als Sprungbrett hinstellt — teortaxesTexs Hinweis ist, dass eine weiter trainierte Version zum Arbeitspferd für ein deutlich stärkeres GLM 5.5 wird, was dieses Release zum Fundament des nächsten GLM machen würde. Und die Reaktion: Da Qwen3.8-Flash-Next in derselben Nacht landet und dahinter eine Enthüllung zu inländischen Chips steht, lastet der Druck auf den US-Frontier-Labors — und auf der Debatte über Exportkontrollen —, eine Antwort zu liefern; beobachten Sie, ob ein schneller Nachzieher, eine Preisbewegung oder eine politische Reaktion auf der anderen Seite der Kluft aufschlägt.

Das ehrliche Fazit: Ox Alpha war ein ungewöhnlich günstiges Experiment in beide Richtungen. Die Plattform testete, ob ein anonymes Modell der Frontier-Klasse für 0 $ in einer Woche echten Produktionsverkehr gewinnen konnte – es tat es, überzeugend genug, dass Z.AI nicht nur am sechsten Tag hervortrat, sondern noch in derselben Nacht die Gewichte als offenes Modell veröffentlichte. Du kannst testen, ob das Modell einen Platz in deinem Stack verdient, jetzt ohne das Anonymitätsrisiko: GLM-5.3-Flash ist ein benanntes, MIT-lizenziertes, selbst hostbares Modell zu einem veröffentlichten Preis, und auch die Hardware-Frage hat eine Antwort bekommen – Z.AI sagt, das Serving von 100T Token/Tag sei auf ungefähr 100.000 heimischen chinesischen Chips gelaufen, vom Unternehmen angegeben, aber inzwischen weithin berichtet. Was noch herauszufinden bleibt, ist, ob „Frontier“ eine unabhängige Messung übersteht, ob Z.AIs Kostenparitätsbehauptung für heimische Chips im großen Maßstab standhält, warum die 50%-Startaktion immer noch der Preis ist, zu dem serviert wird, acht Tage nach ihrem angegebenen Enddatum am 9. September, und ob die Enthüllung GLM-5.3-Flash als das Arbeitstier für ein stärkeres GLM 5.5 darstellt, wie teortaxesTex andeutet. Führe das Experiment durch, aber führe es mit einem Fallback darunter durch.

In diesem Artikel verglichen3

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert