
GLM-5.3-FlashX vs. DeepSeek V4.1 Flash: Die Geschwindigkeitsstufe, die langsamer als das günstige Modell ist
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Z.ai's Premium-Geschwindigkeitsstufe hat ein Problem, und es heißt DeepSeek V4.1 Flash. Als Z.ai am 18. September 2026 GLM-5.3-FlashX auf den Markt brachte, verkaufte es die neue Stufe mit einer einzigen Zahl: bis zu 200 Ausgabe-Token pro Sekunde, etwa das Fünffache des Durchsatzes des GLM-5.3-Flash, auf dem sie aufbaut, für den 2,5-fachen Preis. Unabhängige Messungen setzen DeepSeeks Budget-Modell bereits bei 214,7 Token pro Sekunde mit einer Zeit bis zum ersten Token von 1,15 Sekunden an – in beiden Punkten schneller als die Obergrenze, mit der Z.ai wirbt, und zu einem Preis, an den FlashX nicht heranreicht. Wenn Sie Geschwindigkeit kaufen, hat sich der Markt bewegt, bevor FlashX ankam.
Diese Darstellung ist FlashX gegenüber in genau einer Hinsicht unfair und in jeder anderen gerecht. Beide Modelle sind Open-Weight-Derivate mit 1M-Kontext, die auf Kosteneffizienz hin entwickelt wurden, und beide sind wirklich gut in dem, wofür sie gebaut wurden. Doch sie wurden für unterschiedliche Hälften desselben Problems gebaut, und die Preislücke zwischen ihnen ist inzwischen so groß, dass „Welches ist besser?“ für die meisten Workloads eine Einzeiler-Antwort hat.
Wo jedes einzelne tatsächlich vorne liegt
• Listenpreis — GLM-5.3-FlashX $0,37 / $1,25 pro 1 Mio. Eingabe/Ausgabe vs. DeepSeek V4.1 Flash $0,15 / $0,60 außerhalb der Stoßzeiten, $0,30 / $1,20 zu Spitzenzeitenbr> • Cache-Eingabe — FlashX $0,075 pro 1 Mio. vs. DeepSeek $0,003 außerhalb der Stoßzeiten, eine 25-fache Kluft, die sich in Agent-Loops stark kumuliertbr> • Gemessener Durchsatz — FlashX bis zu 200 Tok/s (Anbieter-Spitzenwert, keine unabhängige Zahl veröffentlicht) vs. DeepSeek 214,7 Tok/s (Artificial Analysis, auf DeepSeeks API)br> • Zeit bis zum ersten Token — für FlashX nicht veröffentlicht vs. 1,15 s gemessen für DeepSeek V4.1 Flashbr> • Unabhängige Intelligenz — FlashX erbt den Wert 42 von GLM-5.3-Flash im Artificial Analysis Intelligence Index vs. DeepSeek V4.1 Flash mit 40br> • Architektur — 320B gesamt / 18B aktiv MoE vs. 552B gesamt mit etwa 8B aktiv beim Prefill und 16B beim Decodebr> • Eingabemodalität — Text, Bild, Video und Dateien vs. Text und Bildbr> • Ausgabegrenze — 131.072 Token vs. etwa 384.000br> • Offene Gewichte — GLM-5.3-Flash steht unter MIT-Lizenz; FlashX ist eine gehostete Tarifstufe ohne eigene Gewichte, und DeepSeek V4.1 Flash steht unter MIT-Lizenz

Lies diese Liste zweimal, denn ihre Form erzählt die Geschichte. FlashX gewinnt genau zwei Zeilen, und beide sind knapp: ein Zwei-Punkte-Vorsprung bei einem unabhängigen Intelligenzindex und Videoeingabe. DeepSeek gewinnt bei Preis, Cache-Preis, gemessener Geschwindigkeit, Ausgabelänge und Modalitätsbreite in dem Sinne, der zählt – es nimmt Bilder entgegen und erzeugt lange Antworten. Die Zwei-Punkte-Lücke im Index liegt innerhalb des Rauschens eines einzelnen Benchmark-Durchlaufs und sollte nicht das sein, was deine Architektur entscheidet.
Die Geschwindigkeitsstufe, die langsamer als das günstige Modell ist
Das ist der Punkt, bei dem es sich lohnt zu verweilen. Z.ai hat FlashX entwickelt, um ein echtes Problem zu lösen: GLM-5.3-Flash ist langsam. Artificial Analysis hat es mit 98 Ausgabe-Token pro Sekunde gemessen, was über dem Median vergleichbarer Open-Weight-Modelle seiner Größe liegt, aber weit von interaktiv entfernt ist. Die Lösung des Unternehmens war ein Neuaufbau des Serving-Stacks – rund 100.000 inländische Beschleuniger, eine SGLang-basierte Engine, W8A8-Quantisierung, ein KV-Cache mit gemischter Präzision und eine disaggregierte Encode-Prefill-Decode-Architektur – und es berichtet von etwa 3× End-to-End-Durchsatz gegenüber seiner Baseline auf derselben Hardware.
DeepSeek löste dasselbe Problem auf der Architekturebene und war damit zuerst da. Der Causal-Encoder-Decoder-Split von V4.1 Flash aktiviert beim Prefill etwa 8B Parameter und beim Decode 16B statt eines pauschalen Werts, und Compressed Sparse Attention 2 mit FP4-KV-Caching reduziert den globalen Cache auf 890 Bytes pro Token – etwa ein Viertel des HBM und ein Achtel des SSD-Speichers, den sein Vorgänger benötigte. Das Ergebnis ist ein Modell, das laut Messung eines neutralen Labors 214,7 Token pro Sekunde über dieselbe First-Party-API läuft, ohne dass eine Premium-Stufe erforderlich ist.
Der Wert 200 von Z.ai ist ein Anbieter-Spitzenwert, und DeepSeeks 214,7 ist ein unabhängiger Median – der ungünstigste denkbare Vergleich für Z.ai und der Grund, ihn nicht überzubewerten. Es ist durchaus möglich, dass FlashX DeepSeek bei einer warmen, nicht überlasteten Anfrage mit kurzer Ausgabe übertrifft. Es ist nicht möglich, das zu wissen, weil niemand außerhalb von Z.ai FlashX-Durchsatzwerte veröffentlicht hat. Was heute feststellbar ist, ist, dass die beiden Modelle im selben Geschwindigkeitsbereich liegen und eines von ihnen nur ein Drittel so viel kostet.

Wo DeepSeeks Preisvorteil strukturell wird
DeepSeek V4.1 Flash berechnet außerhalb der Spitzenzeiten $0,15 pro Million Input-Tokens und $0,60 pro Million Output-Tokens; in zwei Zeitfenstern an Wochentagen (01:00–04:00 und 06:00–10:00 UTC) verdoppeln sich diese auf $0,30 und $1,20. FlashX kostet pauschal $0,37 und $1,25. Stellt man das gegenüber, ist die Pauschalpreisgestaltung, die wie ein Vorteil aussieht, für alle, die ihre Arbeit zeitlich planen können, tatsächlich die teurere Struktur.
Die Position für zwischengespeicherte Eingaben ist diejenige, die über Agent-Workloads entscheidet. DeepSeek berechnet außerhalb der Spitzenzeiten 0,003 $ pro Million zwischengespeicherter Eingabe-Tokens; FlashX berechnet 0,075 $, fünfundzwanzigmal mehr. Ein Agent, der bei jedem Schritt einen langen System-Prompt und ein Tool-Schema erneut sendet, zahlt diese Differenz bei jedem Schritt, und es ist der einzelne Posten, der eine echte Rechnung am wahrscheinlichsten dominieren wird. Z.ai führt Cache-Speicher für begrenzte Zeit als kostenlos auf, was ein Rabatt auf den Speicher und nicht auf die Lesevorgänge ist, die sich tatsächlich ansammeln.
Es gibt ein Gegengewicht, und es ist die Ehrlichkeit darüber, was DeepSeeks eigene Zahlen kosten. Die vom Anbieter durchgeführten Evaluierungen hinter den Schlagzeilen-Scores von V4.1 Flash wurden mit maximalem Reasoning-Aufwand erstellt, und DeepSeek dokumentiert, dass der Wechsel von Aufwand 25 zu Aufwand 100 DeepSWE v1.1 von 66,0 auf 74,2 steigert, während dabei etwa 2,5× so viele Ausgabe-Tokens verbraucht werden. Bei 2,5× so vielen Tokens liegen die effektiven Kosten der Konfiguration mit hohem Aufwand deutlich näher an FlashX, als es das Preisschild vermuten lässt – und das Modell ist als sehr wortreich dokumentiert: Es erzeugt 250 Mio. Ausgabe-Tokens im Intelligence Index gegenüber einem Median von 130 Mio. Ein niedriger Preis pro Token bei einem geschwätzigen Modell ist nicht dasselbe wie eine kostengünstige Aufgabe. Wer diese beiden preislich vergleicht, sollte die Kosten pro abgeschlossener Aufgabe vergleichen, nicht die Kosten pro Million Tokens, und sollte damit rechnen, messen zu müssen statt zu schätzen.
Wie man konkret entscheidet
Wenn Ihre Workload ein Agent mit langer Laufzeit und einem stabilen Präfix ist, ist DeepSeek V4.1 Flash die Wahl, und allein das Verhältnis der gecachten Eingaben entscheidet darüber. Wenn Sie Videoverständnis oder Dateieingabe im selben Aufruf benötigen, ist FlashX der einzige der beiden, der sie entgegennimmt – das ist ein echter Fähigkeitsunterschied, kein Datenblatt-Unterschied. Wenn Sie lange generierte Ausgaben benötigen, ist DeepSeeks Ausgabeobergrenze von rund 384K gegenüber den 131.072 von FlashX entscheidend für die Berichtserstellung, lange Codedateien und alles, was eher synthetisiert als antwortet. Wenn Sie den stärksten unabhängigen Score auf einem einzelnen Benchmark-Index benötigen, ist die 42 von FlashX gegenüber 40 zwar echt, aber zu klein, um darauf aufzubauen.
Beide Modelle sind über einen einzigen Endpoint erreichbar, wenn Ihr Stack bereits geroutet ist, was der günstigste Weg ist, dies zu klären. Auf OrcaRouter wird der Listenpreis des Anbieters mit 0 % Aufschlag weitergegeben, sodass DeepSeeks Off-Peak-Rabatt und jede künftige Preisänderung von Z.ai am selben Tag wirksam werden, an dem sie stattfinden, und der Wechsel zwischen den beiden ist ein Modell-String statt einer Integration. Automatisches Failover ist speziell für FlashX lohnenswert: Es ist eine drei Wochen alte Serving-Tier auf einem neuen Cluster, und der Fehlermodus, gegen den Sie sich absichern, ist eine Kapazitätsobergrenze, nicht ein Modell, das aufhört zu funktionieren.
Die unverblümte Zusammenfassung: DeepSeek V4.1 Flash ist für die meisten Produktionsarbeiten die bessere Standardwahl – günstiger pro Token, günstiger pro gecachtem Token, messbar schneller und zu längeren Ausgaben fähig. GLM-5.3-FlashX ist die richtige Wahl in einem schmaleren Bereich, in dem Sie Video- oder Dateieingabe benötigen und dahinter einen geringfügig höheren unabhängigen Index wünschen. Z.ai hat eine Geschwindigkeitsstufe mit Aufpreis bepreist und sie in einen Markt gebracht, in dem das schnelle, günstige Modell bereits existierte. Das ist der ganze Vergleich.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
