
GLM-5.3-FlashX vs. GLM-5.3-Flash: Gleiche Gewichte, 2,5-facher Preis, eine andere Zahl
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Man kann GLM-5.3-FlashX nicht kaufen und dadurch ein besseres Modell bekommen. Das ist keine Kritik – es ist die gesamte Prämisse. GLM-5.3-FlashX, am 18. September 2026 über die API von Z.ai veröffentlicht, verwendet dieselben Gewichte wie GLM-5.3-Flash: dasselbe Mixture-of-Experts-Backbone mit insgesamt 320B und 18B aktiven Parametern, derselbe Kontext von 1 Mio. Token, dieselbe native Eingabe von Text, Bild, Video und Dateien, dieselbe Obergrenze von 131.072 Token für die Ausgabe. Z.ai hat keinen FlashX-Benchmark veröffentlicht, weil es nichts Neues zu benchmarken gibt. Was sich unterscheidet, ist, wie schnell die Token herauskommen und was sie kosten, und diese beiden Zahlen sind das Einzige, worüber ein Käufer nachdenken muss.
Das ist eine klarere Entscheidung als die meisten Modellvergleiche, und eine schwierigere, weil es keine Fähigkeitsgeschichte gibt, hinter der man sich verstecken kann. Entweder ist dir die Latenz 2,5× wert oder nicht.
Ein Modell, zwei Preisschilder
• Was FlashX ist – eine Serving-Stufe, kein Modell-Release; dieselben Gewichte, dieselben Scores, dieselben Limitsbr> • Eingabepreis – $0.37 pro 1 Mio. Tokens bei FlashX vs. $0.15 pro 1 Mio. bei Flash zum Listenpreisbr> • Ausgabepreis – $1.25 pro 1 Mio. vs. $0.50 pro 1 Mio., der Multiplikator, der sich tatsächlich auf eine Rechnung auswirktbr> • Zwischengespeicherte Eingabe – $0.075 pro 1 Mio. vs. $0.03 pro 1 Mio.br> • Geschwindigkeit – bis zu 200 Ausgabe-Tokens pro Sekunde (vom Anbieter angegebener Spitzenwert) vs. 98 Tok/s unabhängig von Artificial Analysis gemessenbr> • Abo-Zugang – GLM-5.3-Flash ist im GLM Coding Plan von Z.ai mit 3× Kontingent enthalten; FlashX ist nicht enthaltenbr> • Self-Hosting – GLM-5.3-Flash ist MIT-lizenzierte offene Gewichte auf Hugging Face; FlashX hat keine Gewichte zum Herunterladen

Auf dem Heimatmarkt von Z.ai wird dasselbe Verhältnis unverblümt genannt: ¥2 für Input und ¥7 für Output für FlashX gegenüber ¥0,8 und ¥2,8 für Flash. Mehrere chinesische Medien beschreiben den Launch auf dieselbe Weise – 5× die Geschwindigkeit bei 2,5× dem Preis – und alle weisen darauf hin, dass die Intelligenz unverändert ist.
Latenz ist ein eigener Posten und wird nicht pro Token abgerechnet.
Der Grund, warum der Faktor 2,5 nicht automatisch ein schlechtes Geschäft ist, ist, dass Tokenpreis und Aufgabenkosten unterschiedliche Größen sind. Ein Batch-Job, der über Nacht eine Million Ausgabe-Tokens erzeugt, zahlt allein für die Ausgabe 0,50 US-Dollar bei Flash und 1,25 US-Dollar bei FlashX und bekommt für die zusätzlichen 0,75 US-Dollar nichts zurück, weil niemand wartet. Eine Agenten-Schleife, die zehn sequenzielle Aufrufe durchführt, zahlt denselben Aufpreis pro Token, aber jeder Aufruf kommt schneller zurück, und die Einsparungen schlagen sich in der Wanduhrzeit statt in der Rechnung nieder. Wenn FlashX tatsächlich in einem Bruchteil der Zeit zurückkommt, können zehn Turns pro Aufgabe dutzende Sekunden Latenz einsparen – und wenn diese Aufgabe einen Menschen oder einen vorgelagerten Dienst blockiert, sind diese Sekunden mehr wert als die Tokens.
Die eigene Positionierung von Z.ai folgt genau dieser Linie. Sie richtet FlashX auf Programmierung mit hoher Nebenläufigkeit, mehrstufige Agent-Aufrufe, Echtzeitdialoge, Codevervollständigung und multimodale Arbeit mit langem Kontext aus und verweist preisempfindliche, latenzunempfindliche Workloads – Offline-Batch, Massengenerierung, alles Geplante – zurück auf das Basis-Flash. Das ist die richtige Aufteilung, und es ist erwähnenswert, dass der Anbieter derjenige ist, der sie vornimmt.
Wo die Argumentation zusammenbricht, ist beim Durchsatz. Die 200 Token pro Sekunde von FlashX sind ein Spitzenwert, den der Anbieter meldet; die 98 des Basismodells sind ein Median, den ein unabhängiges Labor gemessen hat. Spitzenwerte werden bei kurzen Ausgaben mit warmen Caches und einem im Leerlauf befindlichen Cluster erreicht. Eine multimodale Anfrage mit langem Kontext – genau die Arbeitslast, auf die FlashX abzielt – wird ihn am wenigsten wahrscheinlich erreichen, und niemand außerhalb von Z.ai hat Zahlen veröffentlicht, um die Frage zu klären. Wenn Ihre Arbeitslast durchsatzgebunden statt latenzgebunden ist, verrät Ihnen ein Spitzenwert sehr wenig darüber, was Sie tatsächlich bekommen werden.
Die Notluke, die FlashX nicht hat
Es gibt eine dritte Option in diesem Vergleich, und sie existiert nur, weil das Basismodell offen ist. GLM-5.3-Flash wurde am 26. August 2026 unter der MIT-Lizenz veröffentlicht, mit Gewichten auf Hugging Face und ModelScope, und wird heute von Inferenz-Stacks wie SGLang, vLLM, TokenSpeed und KTransformers bereitgestellt. Wenn Ihr Volumen hoch genug ist, um die Hardware zu rechtfertigen, ist der ehrliche Vergleich nicht Flash gegen FlashX – sondern die 1,25 $ pro Million Output-Tokens von FlashX gegen Ihre eigenen amortisierten Kosten pro Token auf Ihren eigenen Beschleunigern.

Diese Option hat einen echten Einstiegspreis. Das FP8-Release benötigt für das Serving in der Größenordnung von 328 GB GPU-Speicher, was für die meisten Teams ein Multi-Node-Deployment und für den Rest ein absolutes No-Go ist. Doch es ist erwähnenswert, denn genau diese Asymmetrie macht die Preisgestaltung von FlashX zu einem bewussten Test statt zu einer Unvermeidlichkeit: Z.ai verlangt einen Aufpreis für eine Serving-Konfiguration, die Kunden für das Basismodell grundsätzlich selbst aufbauen können. Der Aufpreis gilt dem Komfort, nicht der Leistungsfähigkeit, und Komfort hat einen Marktpreis, der mit der Zeit sinkt.
Worum es bei der Preisänderung wirklich geht
Die Ökonomie hinter der Markteinführung ist ungewöhnlich klar erkennbar. GLM-5.3-Flash wurde zu einem Zehntel des Preises von GLM-5.3 veröffentlicht – die Hälfte davon während einer Startaktion – und wurde stark genutzt, darunter eine Phase anonymer Vorabtests, die Z.ai inzwischen bestätigt hat. FlashX ist das erste Mal, dass diese Familie sich in die andere Richtung bewegt: dasselbe Modell, teurer. In der chinesischen Finanzpresse zitierte Analysten deuten es als bewussten kommerziellen Test, ob Entwickler bereit sind, für Geschwindigkeit allein zu zahlen – nach einem Jahr, in dem Marktanteile mit Near-Frontier-Fähigkeiten zu Massenware-Preisen erkauft wurden.
Zwei Details stützen diese Deutung. FlashX ist vom GLM Coding Plan ausgeschlossen, während das Basis-Flash mit dreifachem Kontingent enthalten ist, sodass Abonnenten die neue Stufe nicht in ein bestehendes Abonnement integrieren können – sie zahlen pro Token. Und der Preis ist pauschal, ohne Off-Peak-Rabatt, anders als die tageszeitabhängige Struktur, mit der einige Wettbewerber ungenutzte Kapazität auslasten. Ein pauschaler Faktor von 2,5× auf eine Geschwindigkeitsstufe ist ein Preis für Leute, die nicht warten können, und Z.ai findet gerade heraus, wie viele es davon gibt.
Zwischen ihnen wählen
Nehmen Sie FlashX, wenn ein Mensch oder ein Dienst auf das nächste Token wartet und das Modell selbst bereits die richtige Wahl ist — Inline-Vervollständigung, interaktive Agenten, Echtzeit-Chat, alles, bei dem die Pause das Produkt ist. Nehmen Sie GLM-5.3-Flash für Batch-, Offline- und Massenarbeit, für alles, was Sie planen können, und für jede Workload, bei der Sie für das Ausgabevolumen statt für die Ausgabelatenz bezahlen. Wenn Ihr Volumen groß ist und Ihr Team Accelerators betreiben kann, kalkulieren Sie die selbst gehosteten Basisgewichte, bevor Sie FlashX kalkulieren; der Vergleich ist günstiger, als die Token-Preise vermuten lassen.
Wie Sie auch vorgehen, behandeln Sie die beiden an der Aufrufstelle als austauschbar. Sie nehmen dieselben Prompts entgegen, liefern dasselbe Format zurück und erzeugen dieselbe Qualität — das Einzige, was sich ändert, ist ein Modell-String, und das ist die günstigste Art von A/B-Test, die man durchführen kann. Bei OrcaRouter wird der Listenpreis des Anbieters mit 0 % Aufschlag durchgereicht, sodass eine Preisänderung von Z.ai oder eine Aktion ab dem Tag gilt, an dem sie upstream live geht, und beide Stufen hinter einem einzigen Endpunkt liegen, über den mehr als 200 Modelle erreichbar sind. Für eine Entscheidung, die vollständig von der gemessenen Latenz abhängt, macht die Möglichkeit, mitten im Experiment zwischen ihnen zu wechseln, ohne Ihre Integration anzufassen, den Großteil der Arbeit aus.
Das Urteil fällt enger aus als bei einem üblichen Modellvergleich, und genau darum geht es. FlashX ist kein besseres Modell und gibt sich auch nicht als solches aus. Es ist dasselbe Modell mit einer kürzeren Warteschlange, verkauft zu einem Preis, der nur Sinn ergibt, wenn die Warteschlange dein Problem war. Miss deine eigene Zeit bis zum ersten Token bei beiden, bevor du dich festlegst — die 200 des Anbieters sind eine Obergrenze, deine Arbeitslast ist der einzige Benchmark, der zählt, und der Unterschied zwischen den beiden Stufen ist nur eine Konfigurationsänderung entfernt.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
