
Ox Alpha: Das komplette Datenblatt für das Stealth-Modell, das jetzt als GLM-5.3-Flash ausgeliefert wird
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 316 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 196 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Ox Alpha ist der anonyme Name, unter dem GLM-5.3-Flash vorab vorgestellt wurde; er wurde am 26. August 2026 enthüllt, und es ist kein Modell, das man heute aufrufen kann. Das Vorschau-Listing, das den Namen Ox Alpha trug, bedient es nicht mehr; das dahinterstehende Modell hat eine Anbieterseite, MIT-lizenzierte Gewichte, eine veröffentlichte Preisliste und eine dokumentierte API-Oberfläche, die alle von Z.ai stammen. Diese Seite ist die Referenz für dieses Modell — der Rahmen, die Modalitäten, die Preisliste, die Endpunkt-Oberfläche, jede veröffentlichte Benchmark-Zahl samt der zugehörigen Revision oder dem Testaufbau, und, weil der Alias nach wie vor ein dürftiges und verwirrendes Suchergebnis liefert, eine klare Aussage darüber, was nirgendwo dokumentiert ist. Alles unten Stehende wurde am 28. September 2026 aus der eigenen Modelldokumentation und Preisseite von Z.ai, aus der Z.ai-Modellkarte auf Hugging Face, von Artificial Analysis und aus unserem eigenen Katalog gelesen; vom Anbieter veröffentlichte Zahlen und von unabhängiger Seite gemessene Zahlen sind getrennt gekennzeichnet, und nichts hier wird aus einer Ähnlichkeit abgeleitet.
Worauf der Name Ox Alpha heute verweist
Der Alias ist zurückgezogen, und der Anbieter ist derjenige, der ihn zurückgezogen hat. Die eigene Dokumentation von Z.ai für GLM-5.3-Flash besagt, dass das Modell vor der Veröffentlichung anonym unter dem Namen ox-alpha getestet wurde, um Nutzerfeedback zu sammeln, und dass der anonyme Lauf zum beliebtesten Modell jener Woche wurde. Die datierbaren Anker sind kurz und spezifisch: Das Stealth-Listing zeigte Ox Alpha mit Veröffentlichung am 20. August 2026, und die Enthüllung erfolgte am 26. August – dasselbe Datum, das die Dokumentationsseite von Z.ai trägt, und dasselbe Veröffentlichungsdatum, das unser eigener Katalog für z-ai/glm-5.3-flash verzeichnet.
Daraus folgen zwei Dinge, und beide sind für einen Leser wichtig, der den Namen gesucht hat.
• Der Alias ist keine Route. Unser Katalog liefert „model not found" für eine Suche nach stealth/ox-alpha, Abruf vom 2026-09-28. Unter diesem Namen gibt es nichts aufzurufen, denn das Produkt des Anbieters trägt den Namen des Anbieters.
• Auch unter dem Alias gibt es kein anbietereigenes Gewichte-Repository. Eine Suche auf Hugging Face nach ox-alpha liefert Community-Uploads, die während des Stealth-Fensters im späten August 2026 erstellt wurden, sowie ein Repository vom 27. September 2026, das nur eine Modellkarte und keine Gewichte enthält und auf die offizielle Veröffentlichung von Z.ai verweist. Ein Repository-Name ist eine Bezeichnung, die der Uploader gewählt hat; er ist kein Beleg für irgendetwas. Die eigene Organisation von Z.ai veröffentlicht das Modell als zai-org/GLM-5.3-Flash, wobei das Repository am 25. August 2026 in UTC erstellt wurde.
Die Anbieterfrage, die die anonyme Woche beherrschte, ist geklärt, und sie wurde auf die gewöhnliche Weise geklärt: Ein Labor trat hervor und setzte seinen Namen auf das Modell. Übrig bleibt eine Spezifikation, und darum geht es auf dieser Seite. Die Entdeckungsgeschichte – das Fingerprinting, das der Enthüllung vorausging, die Abstammungslinie des anonymen Modells, zu der es gehört, und die Offenlegung der Serving-Hardware, die damit einherging – findet sich in unserem früheren Artikel über die Untersuchung von Ox Alpha, und diese Seite rollt nichts davon erneut auf.
Der Umschlag, wie ihn der Anbieter dokumentiert

Dies sind von Z.ai gemeldete Zahlen, die am 28.09.2026 von der eigenen Dokumentationsseite des Anbieters abgerufen wurden, und drei der vier Eckwerte werden unabhängig bestätigt — der Modelleintrag von Artificial Analysis enthält dieselben Angaben: 320B Gesamtparameter, 18B aktive Parameter, 1.000.000-Token-Kontext und MIT-Lizenz, und unsere eigene Katalogkarte enthält die Kontext- und Ausgabelimits.
• Kontextfenster — 1,000,000 Tokens (Z.ai-Dokumentation; Artificial Analysis; unsere eigene Katalogkarte, die 1,000,000 aufführt)
• Maximale Ausgabe — 128K Token (Z.ai-Dokumentation); unsere Karte verzeichnet 128.000
• Eingabe — Text, Bild, Video und Datei (Z.ai-Dokumentation, gelesen am 28.09.2026); unsere Karte führt Text, Bild und Video auf und erhebt keinen Anspruch auf Dateieingabe
• Ausgabe — nur Text, bei jeder Quelle
• Parameter — insgesamt 320 Mrd., davon 18 Mrd. pro Token aktiviert (Z.ai-Dokumentation und Modellkarte; Artificial Analysis verzeichnet unabhängig 320 Mrd. und 18 Mrd.)
• Lizenz — MIT, mit auf Hugging Face veröffentlichten Gewichten (Modellkarte des Anbieters; Artificial Analysis klassifiziert das Modell als offene Gewichte unter einer permissiven Lizenz)
• Architektur — ein Hybrid aus Sparse- und Linear-Attention, den Z.ai als das erste Open-Source-Frontier-Modell beschreibt, das beide kombiniert, wodurch der Attention-Berechnungsaufwand um 3,01× und der KV-Cache um 4,44× gegenüber GLM-5.3 reduziert wird, plus ein IndexPool-Schritt, der bei langem Kontext vier Indexer-Schlüsselvektoren zu einem komprimiert, und Manifold-Constrained Hyper-Connections für Skalierungseffizienz. Alles vom Anbieter angegeben; es gibt kein unabhängiges Architektur-Audit, das zitiert werden kann.
• Pre-Training — ein multimodaler Korpus mit 30 Billionen Token (laut Z.ai). Der Anbieter veröffentlicht keine Gesamtangabe zum Trainings-Compute und keine Parameter-pro-Schicht-Aufschlüsselung über die 320B/18B-Hauptangabe hinaus.
Eine Behauptung zum Leistungsumfang ist seit dem Launch enger gefasst worden, und die aktuelle Dokumentation ist die, die man zitieren sollte. Die im August kursierende Offenlegung zur Serving-Hardware bezifferte die Kapazität der anonymen Woche auf rund 100.000 inländische chinesische Chips. In der heutigen Fassung der Dokumentation von Z.ai heißt es, das Modell sei „über Zehntausende im Inland entwickelte Beschleuniger hinweg“ bereitgestellt worden, mit einer 3-fachen End-to-End-Serving-Verbesserung gegenüber dem eigenen Baseline-Wert des Anbieters auf derselben Hardware und Kosten pro Token, die der Anbieter als vergleichbar mit gängigen NVIDIA-GPUs beschreibt. Zehntausende ist das, was auf der Seite jetzt steht; die größere Zahl stammt aus der Launch-Ära. Beides sind Unternehmensangaben, keine von beiden wurde unabhängig geprüft, und die Richtung der Korrektur zeigt nach unten.
Die Tarifkarte und warum die ausgelieferte Zahl die ist, die zählt
Die Preisseite von Z.ai listet GLM-5.3-Flash mit 0,15 $ pro Million Eingabe-Tokens, 0,03 $ pro Million gecachter Eingabe-Tokens und 0,50 $ pro Million Ausgabe-Tokens sowie die Schwesterstufe FlashX mit 0,37 / 0,075 / 1,25 $. Das ist der Listenpreis des Anbieters, ausgelesen am 28.09.2026 von der Seite des Anbieters selbst.
Der Preis, der heute tatsächlich auf unserer Route gilt, ist niedriger, und das ist der praktische Kern dieses Abschnitts. Stand 2026-09-28 bepreist die OrcaRouter-Karte für z-ai/glm-5.3-flash den Input mit $0.075 pro Million Tokens, den Output mit $0.25 pro Million und Cache-Lesevorgänge mit $0.0173 pro Million. Das ist die Hälfte des Listenpreises des Anbieters, beim selben Modell, am selben Tag — der rabattierte Wert statt des Schlagzeilenpreises, ohne Aktionskennzeichnung auf der Karte. Unsere frühere Berichterstattung zu diesem Modell bemerkte dieselbe Lücke, nachdem das angegebene Aktionsfenster geschlossen war; die Beobachtung gilt auch heute noch, und wir können die Ursache weiterhin nicht ermitteln, daher berichten wir die tatsächlich geltende Zahl und lassen die Ursache offen.
Zwischengespeicherte Eingabe ist der Punkt, an dem die drei Quellen sichtbar voneinander abweichen, was eine nützliche Erinnerung daran ist, dass ein „0,03 $“ in einer Tabelle nicht unbedingt ein Preis ist, den jemand zahlt. Die Seite des Anbieters nennt 0,03 $ pro Million zwischengespeicherter Eingabe-Token; der Modelldatensatz von Artificial Analysis führt einen Cache-Hit-Preis von 0,026 $; unsere Route berechnet Cache-Lesevorgänge mit 0,0173 $. Alle drei wurden am oder kurz vor dem 28.09.2026 abgerufen, alle drei vom Anbieter oder der Plattform gemeldet. Wir geben die Listenangabe des Anbieters als Listenpreis an und den von uns bereitgestellten Wert als das, was einem Aufrufer tatsächlich in Rechnung gestellt wird.
Rechnen wir das an einem repräsentativen Agent-Job durch — 100.000 Eingabe-Tokens und 10.000 Ausgabe-Tokens, keine Cache-Treffer:
• Zum Listenpreis des Anbieters — 100.000 Token × 0,15 $/1 Mio. = 0,015 $, plus 10.000 × 0,50 $/1 Mio. = 0,005 $, also 0,020 $ pro Aufruf
• Zu dem Tarif, den unsere Route heute bedient — 0,0075 $ plus 0,0025 $, also 0,010 $ pro Aufruf, genau die Hälfte
Das ist der ganze Grund, warum man den bereitgestellten Preis statt des Listenpreises prüfen sollte, bevor man eine Workload dimensioniert: Bei einem langfristig laufenden Agenten, der Tausende Aufrufe pro Tag ausführt, ist der Unterschied zwischen diesen beiden Zahlen der Unterschied zwischen zwei Budgets. OrcaRouter gibt den Listenpreis des Anbieters mit 0 % Aufschlag weiter, weshalb der Rabatt, den der Anbieter gerade gewährt, auf unserer Karte auftaucht, anstatt irgendwo dazwischen absorbiert zu werden.
Modalitäten und Endpoint-Oberfläche
Der Anbieter dokumentiert eine Interface-Form und zwei Modellcodes: glm-5.3-flash und glm-5.3-flashx, die beide über die Chat Completion API bereitgestellt werden. Bilder werden als Inhaltsblock mit dem Typ image_url im content-Array der Nachricht übergeben, wobei entweder eine URL – die der Anbieter empfiehlt – oder eine Base64-Daten-URL verwendet wird, und es können mehrere Bildblöcke in einer Nachricht gesendet werden. Streaming wird unterstützt, und Z.ai empfiehlt, bei Streaming-Anfragen stream und tool_stream gemeinsam zu aktivieren. Tool-Aufrufe, Context-Caching und strukturierte JSON-Ausgabe sind allesamt dokumentierte Fähigkeiten; Thinking wird unterstützt, ist aber – wie der nächste Abschnitt erläutert – nicht optional.
FlashX ist eine separate Serving-Stufe desselben Modells und keine eigenständige Fähigkeit: Z.ai dokumentiert es mit 200 Tokens pro Sekunde und gibt an, dass es noch nicht im GLM Coding Plan verfügbar ist. Es ist nicht die Stufe, die unser Katalog führt, und es ist nicht das, was die Zahlen auf dieser Seite beschreiben.
Auf unserer Route ist die Endpunkt-Oberfläche schmaler und sollte genau angegeben werden. Die Karte für z-ai/glm-5.3-flash stellt POST /v1/chat/completions bereit — nur Chat-Completions, ohne zweiten Protokoll-Endpunkt — und akzeptiert reasoning, reasoning_effort, include_reasoning, tools, tool_choice, response_format, stream, temperature, top_p, max_tokens und stop. Die Fähigkeits-Chips auf der Karte sind Vision, Tools, JSON und Reasoning. Der Kontext umfasst 1.000.000 Token und die maximale Ausgabe 128.000 Token, was der Dokumentation des Anbieters entspricht.
Aufwand und Denken: die Einstellungen, die jede Benchmark-Zahl festlegen.
Dies ist der Teil der Spezifikation, der am stärksten beeinflusst, wie Sie die Scores lesen, und der Anbieter dokumentiert ihn präzise. GLM-5.3-Flash akzeptiert einen reasoning_effort-Parameter mit drei Stufen – low, high und max – und er verwendet standardmäßig max, wenn Sie nichts übergeben oder wenn Sie etwas übergeben, das nicht low oder high ist. Das Denken kann nicht abgeschaltet werden: Der Anbieter gibt an, dass thinking.type nur enabled unterstützt. Das clear_thinking-Flag der Chat-Vorlage ist standardmäßig false, und Z.ai empfiehlt, es für Chat-Szenarien explizit als true zu übergeben. Die vom Anbieter empfohlenen Sampling-Einstellungen sind temperature 1 und top_p 0.95, und er sagt unmissverständlich, dass Benchmark- und Leaderboard-Reproduktion den standardmäßigen max effort beibehalten sollten.
Liest man diese beiden Fakten zusammen, ist die Konsequenz für jeden, der Zahlen vergleicht, unausweichlich: Ein Score, der ohne Angabe eines Effort-Levels genannt wird, ist keine vollständige Messung, denn die Einstellungen low, high und max sind verschiedene Betriebspunkte desselben Modells, und die Standardeinstellung ist die teuerste der drei. Unsere Karte gibt reasoning und reasoning_effort unter ihren unterstützten Parametern an, sodass die Einstellung über die Route erreichbar ist, nicht nur über den Anbieter.
Das Benchmark-Blatt, mit der beigefügten Revision
Z.ai veröffentlicht eine Benchmark-Tabelle für GLM-5.3-Flash, und sie ist vollständig vom Anbieter gemeldet – der unabhängige Datensatz von Artificial Analysis reproduziert diese Zeilen nicht. Die wichtigsten Coding- und Agentic-Zahlen des Anbieters sind DeepSWE v1.1 mit 63,4 gegenüber 46,2 von GLM-5.2 und AutomationBench v1.0.6 mit 48,8 gegenüber 26,2 von GLM-5.2. Der Rest der Tabelle, wie ihn unser eigener Katalog mit Z.ai als genannter Quelle führt: Humanity's Last Exam mit Tools 55,3, Agents' Last Exam 26,3, NL2Repo 56,3, Chartography mit Tools 78, CharXiv-Reasoning mit Tools 89,4 und auf der Vision-Seite MMVU 80,5, MVBench 77,8 und BabyVision 53,4.
Zwei Anbieterzeilen verdienen es, dass ihre Fußnoten in den Satz übernommen werden, denn sie sind diejenigen, die ein Leser am ehesten ohne sie zitieren würde. Die interne Coding-Evaluierung von Z.ai, Z.ai Code Bench v1.0, setzt GLM-5.3-Flash bei maximalem Aufwand auf 29,0 gegenüber Claude Opus 4.8 mit 29,5 – ein Beinahe-Gleichstand auf dem eigenen Harness des Anbieters, ausgeführt auf Claude Code 2.1.207, gemeldet vom Anbieter. Das ist kein unabhängiger Vergleich, und es ist kein von einem Dritten durchgeführter Vergleich mit identischem Aufwand; es ist Z.ai, das sein Modell gegen einen Wettbewerber in seiner eigenen Evaluierung benchmarkt. Und der Anbieter zitiert einen Artificial Analysis Intelligence Index von 57 bei 0,045 USD pro Aufgabe und nennt die Revision v4.1.1.
Diese letzte Zahl muss von dem getrennt werden, was Artificial Analysis heute veröffentlicht, weil die beiden nicht als eine Bewegung nebeneinander gestellt werden können. Die eigene Seite von Artificial Analysis für GLM-5.3-Flash, abgerufen am 28.09.2026, meldet einen Intelligence Index von 41.8 auf Index v4.3.2, aufgezeichnet bei maximalem Aufwand. v4.3.2 umfasst zehn Evaluierungen – AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience und AA-LCR v1.1 –, v4.1.1 hingegen nicht. Zwei Index-Revisionen, zwei Aufgabensets, zwei Zahlen. Keine von beiden ist falsch; sie sind nicht dieselbe Messung, und die 57 neben der 41.8 anzuführen, als hätte sich das Modell bewegt, wäre ein Fehler in beide Richtungen.
Was der unabhängige Datensatz tatsächlich bestätigt, ist der Rahmen, nicht die Scores: Artificial Analysis dokumentiert unabhängig 320B Gesamtparameter, 18B aktiviert, ein Kontextfenster von 1.000.000 Token, MIT-Lizenzierung, offene Gewichte und ein Veröffentlichungsdatum vom 2026-08-26 und führt Anbieterpreise von 0,15 $ für Eingabe und 0,50 $ für Ausgabe pro Million Token mit einem Cache-Hit-Preis von 0,026 $ auf. Wo der Anbieter einen Score veröffentlicht und die unabhängige Stelle nicht, sagen wir das; wo die unabhängige Stelle eine Spezifikation bestätigt, ist das die stärkste Faktenkategorie auf dieser Seite.
Hier gibt es keinen direkten Vergleich unter gleichen Bedingungen, und das zu sagen, ist nützlicher, als einen zu erzeugen. Niemand hat einen Durchlauf von GLM-5.3-Flash gegen Claude Opus 4.8, GPT-6 Sol oder Grok 4.7 mit angegebenem Aufwand auf einem gemeinsamen Harness veröffentlicht – der eigene Vergleich von Z.ai erfolgt auf der eigenen Bench, mit maximalem Aufwand, gegen den Standard eines Wettbewerbers. Bis sich das ändert, geht der ehrliche Vergleich zwischen diesem Modell und allem anderen über Preis, Nutzungsrahmen und Endpunkt-Oberfläche – die drei Dinge auf dieser Seite, die jeder anhand derselben Zahlen ablesen kann.
Was nicht dokumentiert ist, klar gesagt
Eine Referenzseite für ein Modell mit dünner Informationslage ist nur dann nützlich, wenn sie ehrlich zu den Lücken ist, und diese hier hat mehrere.
• Kein Wissens-Cutoff des Anbieters. Die Dokumentation von Z.ai und die Modellkarte von Hugging Face nennen keinen, und der Eintrag von Artificial Analysis lässt das Feld null. Schätzungen aus dem Stealth-Fenster sind Community-Arbeit, keine Anbieterangabe, und diese Seite wiederholt keine, als wäre sie eine.
• Keine Harness-Fußnoten für den größten Teil der Benchmark-Tabelle. Die Model Card enthält jedoch Fußnoten für den HLE-With-Tools-Lauf – Temperatur 1,0, top_p 0,95, eine maximale Generierungslänge von 163.840 Token, Evaluierung bei einem Kontext von bis zu 300.000 Token mit einer Kontextmanagement-Strategie und GPT-5.6 Luna mit mittlerem Effort als Judge-Modell – sowie für NL2Repo und DeepSWE, die laut Anbieter mit dem mini-swe-agent-Harness ausgeführt wurden. Die übrigen Zeilen sind reine Prozentwerte ohne zugehörigen Harness oder Effort.
• Keine Erklärung für die Preisspanne bei gecachten Eingaben. Drei Werte für dieselbe Menge beim gleichen Modell, und keine Quelle gibt an, warum sie sich unterscheiden.
• Kein unabhängiger Benchmark für den anonymen Ausspielzeitraum. Das Stealth-Listing ist verschwunden; was auch immer es gemessen hat, lässt sich nicht erneut messen, und kein Dritter hat einen Durchlauf gegen den Alias veröffentlicht, während er live war.
• Kein Drittanbieter-Vergleich bei gleichem Aufwand, aus dem oben genannten Grund.
• Keine Herstellerbestätigung zur Chip-Anzahl zum Zeitpunkt des Marktstarts. Die Dokumentation nennt Zehntausende inländische Beschleuniger; die Zahl 100.000 steht nicht auf der Seite.
Fazit: Was unser Katalog bietet, heute überprüft.

Das Modell hinter Ox Alpha ist in unserem Katalog unter seinem eigenen Namen live, heute überprüft statt angenommen. Ein Abruf der OrcaRouter-Modell-API für z-ai/glm-5.3-flash am 2026-09-28 lieferte die Karte vollständig zurück: 1.000.000 Token Kontext, 128.000 maximale Ausgabe, Text-, Bild- und Videoeingabe mit Textausgabe, die Fähigkeits-Chips Vision, Tools, JSON und Reasoning, ein Veröffentlichungsdatum von 2026-08-26, nicht veraltet und nicht ausgelistet, bepreist mit 0,075 $ pro Million Eingabe-Token, 0,25 $ pro Million Ausgabe-Token und 0,0173 $ pro Million gecachter Eingabe-Token, über den einzigen Endpunkt POST /v1/chat/completions.
Unsere eigene siebentägige Playground-Messung auf dieser Karte ergibt für denselben Zeitraum 61,8 Ausgabe-Token pro Sekunde, eine p50-Zeit bis zum ersten Token von 7,39 Sekunden und eine Fehlerrate von 1,47 %. Das sind Erstanbieter-Zahlen zu unserem Serving, keine Herstellerangaben und keine unabhängigen Benchmarks, und genau deshalb sind sie die einzigen Geschwindigkeitszahlen auf dieser Seite.
Der Alias selbst ist nicht in der Route. Wenn du hier gelandet bist, weil du nach Ox Alpha gesucht hast, ist das Modell, das du aufrufen musst, z-ai/glm-5.3-flash, und die Anfrageform ist die oben beschriebene. Er liegt auf demselben Schlüssel wie alles andere im Katalog — eine API über 200+ Modelle hinweg, der Preis des Anbieters wird ohne Aufschlag weitergegeben, und automatisches Failover, wenn ein Anbieter stockt, sodass ein Modell, das du gerade testest, nicht unbedingt ein Modell sein muss, von dem dein Produktionspfad abhängt.

Eine Klarstellung dazu, was diese Seite ist, denn wer über den Modellnamen selbst hierher kommt, hat sie verdient. Dies ist eine Referenzseite für ein Modell, das bereits im Katalog steht, kein Startbericht: GLM-5.3-Flash stammt vom 26. August 2026, und sein Platz hier beruht darauf, dass der Name Ox Alpha immer wieder gesucht wird, ohne dass es eine eigene Seite gibt, auf der man landen könnte, nicht auf der Aktualität der Veröffentlichung. Das obige Datum dient der Datierung des Modells, nicht als Nachricht. Was diese Seite ändern würde, ist eines von vier Dingen – ein unabhängiger Benchmark-Lauf mit angegebenem Aufwand, ein vom Anbieter angegebener Knowledge-Cutoff, eine Änderung der Serving-Rate oder eine Entscheidung von Z.ai, anzugeben, wie hoch die Chip-Anzahl zum Startzeitpunkt tatsächlich war. Bis eines davon eintritt, ist die obige Spezifikation alles, was der Anbieter dokumentiert, und die im vorigen Abschnitt aufgeführten Lücken sind genauso Teil der Antwort wie die Zahlen.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
