
GLM 5.3 Prime: Dieselben GLM-5.3-Gewichte, zum exakt doppelten Preis laut Preisliste
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 177 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1323 tok/s
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
GLM 5.3 Prime kostet 2,80 US-Dollar pro Million Eingabe-Tokens und 8,80 US-Dollar pro Million Ausgabe-Tokens. GLM-5.3, das Modell, auf dem es läuft, kostet 1,40 US-Dollar und 4,40 US-Dollar. Das ist weder ein Rundungsunterschied noch eine Sonderangebotsdifferenz – es ist exakt 2,0× in beiden Preiszeilen, und es ist das Einzige, worüber die beiden Produkte uneinig sind. GLM 5.3 Prime ist kein neues Modell. Es trägt die eigenen Gewichte von GLM-5.3, dieselben, die Z.ai am 25. August 2026 veröffentlicht hat, hinter einem schnelleren Serving-Stack. GLM-5.3 selbst wurde am 14. August 2026 angekündigt und erreichte die API am 18. August. Am zugrunde liegenden Modell änderte sich nichts, als die Prime-ID Ende September auftauchte. Was sich geändert hat, ist, dass jemand ein zweites Preisschild daran angebracht hat.
Wenn Sie dies lesen, weil eine Modellliste Ihnen neben einem vertrauten Namen einen unbekannten Namen gezeigt hat, lautet die kurze Antwort: Sie sehen eine Serving-Stufe, keine Veröffentlichung. Die längere Antwort ist zwei Minuten wert, denn die Arithmetik ist ungewöhnlich sauber und die Herkunft ungewöhnlich undurchsichtig.
Was eine „Prime“-Stufe ist, in einem Absatz
Ein Serving-Tier ist eine zweite Produkt-ID, die auf dieselben Gewichte zeigt und auf Durchsatz statt auf Kosten optimiert ist. Sie erhalten kein größeres Modell, keinen längeren Kontext, keinen besseren Reasoning-Modus und keine umfangreichere Tool-Oberfläche. Sie bekommen Token schneller ausgeliefert, und Sie zahlen für dieses Privileg bei jedem Token statt über die eingesparte Wall-Clock-Zeit. Dieser Trade-off ist real und manchmal richtig — eine mehrstufige Agent-Schleife, die zehn sequenzielle Aufrufe macht, profitiert tatsächlich davon, dass jeder Aufruf schneller zurückkehrt —, aber es ist ein Latenzkauf, kein Fähigkeitskauf, und er sollte auch so bepreist werden.
Die Herstellerbeschreibung für GLM 5.3 Prime spricht das Unausgesprochene direkt aus: Es sei „die Hochgeschwindigkeitsvariante von Z.ai GLM-5.3, die dessen volle Fähigkeiten erbt und durch Inferenzbeschleunigung den 1,5- bis 2-fachen Ausgabedurchsatz liefert.“ Volle Fähigkeiten. Gleiches Kontextfenster von 1.000.000 Tokens. Gleiche Obergrenze von 131.072 Tokens für die Ausgabe. Text rein, Text raus. Reasoning obligatorisch, mit niedrig, hoch und max Aufwandsstufen und max als Standard — identisch zum Basismodell.
Die Preisliste, Seite an Seite
• Eingabe — GLM 5.3 Prime 2,80 $ pro 1 Mio. vs. GLM-5.3 1,40 $ pro 1 Mio.
• Ausgabe — GLM 5.3 Prime 8,80 $ pro 1 Mio. vs. GLM-5.3 4,40 $ pro 1 Mio.
• Zwischengespeicherte Eingabe — GLM 5.3 Prime 0,56 $ pro 1 Mio. vs. GLM-5.3 0,26 $ pro 1 Mio.
• Multiplikator — 2,0× auf allen drei Zeilen, in beide Richtungen
• Kontext — 1.000.000 Token bei beiden
• Maximale Ausgabe — 131.072 Token bei beiden
• Reasoning — bei beiden verpflichtend, dieselben drei Aufwandsstufen, derselbe Standard
Der Cache-Posten ist der, den die meisten übersehen. Ein Cache-Read ist das günstigste Token, das Sie jemals von einem Frontier-Modell kaufen werden, und genau dort geben Agent-Workloads tatsächlich ihr Budget aus – der System-Prompt, die Tool-Definitionen und das wachsende Transkript werden bei jedem Turn erneut gelesen. Verdoppelt man die Cache-Rate, verdoppelt sich der größte Posten in einer langen Agent-Session, was bedeutet, dass der effektive Aufpreis bei einer realen Workload näher bei 2× liegt, als es die plakative Spanne bei frischen Input-Tokens vermuten lässt. Wenn Sie gehofft hatten, die Schnellspur wäre in der Praxis günstiger, weil Sie aggressiv cachen, dann ist sie es nicht.
Wer verkauft es eigentlich
Hier wird das Angebot interessant, und hier sollte ein aufmerksamer Leser innehalten. Weder in der eigenen Dokumentation von Z.ai noch in der Modellübersicht oder auf der veröffentlichten Preisseite ist eine Prime-SKU aufgeführt. Sucht man in den Modell-IDs des Anbieters nach glm-5.3-prime, findet man nichts. Die eigene Geschwindigkeitsstufe von Z.ai ist ein völlig anderes Produkt auf einer ganz anderen Linie – GLM-5.3-FlashX, das zur günstigeren Flash-Familie gehört, am 18. September 2026 eingeführt wurde und mit 0,37 $ und 1,25 $ pro Million Tokens bepreist ist.
Also ist Prime ein plattformseitiges Produkt, das auf den Gewichten von Z.ai aufbaut. Zwei Details weisen darauf hin, zu welcher Plattform es gehört. Das erste ist die Formulierung „1,5–2× Ausgabedurchsatz“, die dieselbe Wortwahl ist, die ein großer Cloud-Anbieter für seinen eigenen beschleunigten Serving-Modus verwendet – ein Modus, den man durch Wechseln der Modell-ID aktiviert, wobei Funktionen und Nutzungsgrenzen ausdrücklich unverändert bleiben. Das zweite ist, dass das Listing genau einen Upstream-Anbieter hinter dem Endpoint nennt. Ein einzelner Anbieter hinter einer Fast-Tier-SKU ist nicht die Art und Weise, wie ein Open-Weights-Modell bereitgestellt wird; so sieht ein eigenes beschleunigtes Deployment einer Plattform von außen aus.
Nichts davon macht GLM 5.3 Prime zu einem schlechten Produkt. Es macht es zu einem Produkt mit nur einem Anbieter, was eine Frage der Resilienz ist, die Sie stellen sollten, bevor Sie Produktionsverkehr darüber leiten.
Was die Geschwindigkeitsangabe wert ist

Die 1,5–2×-Zahl ist eine Durchsatzbehauptung, die unter den eigenen Bedingungen des Anbieters gemessen wurde, und der Durchsatz ist die Metrik, die am empfindlichsten auf diese Bedingungen reagiert. Ausgabe-Token pro Sekunde bei warmem Cache, kurzem Prompt und untätigem Cluster – das ist nicht die Zahl, die ein Long-Context-Agent sieht. Unabhängige Messung des Basismodells setzt GLM-5.3 auf etwa 61 Ausgabe-Token pro Sekunde und GLM-5.3-Flash auf rund 46, in einem Set, in dem der Klassendurchschnitt 67 beträgt – die günstigere Spur ist also auch die langsamere, was das Gegenteil dessen ist, was die Namen vermuten lassen. Dabei handelt es sich um Mediane über ein standardisiertes Evaluationsset, nicht um Spitzenwerte.
Es gibt außerdem einen subtileren Kostenpunkt. Der Standardwert für den Reasoning-Aufwand ist bei beiden IDs max, die Einstellung, die die längsten Gedankenketten erzeugt. Geschwindigkeit und Ausführlichkeit ziehen hier in entgegengesetzte Richtungen: Eine schnelle Stufe, die auch mit maximaler Länge reasoniert, kann bei einem schwierigen Problem Ende-zu-Ende trotzdem langsam sein, weil der Engpass die Anzahl der Tokens ist, die das Modell zu generieren beschließt, nicht die Rate, mit der es sie generiert. Wenn Ihre Arbeitslast reasoning-intensiv ist, wechseln Sie zu high oder low, bevor Sie 2× für die Beschleunigung bezahlen — die Aufwandsstufe wird Ihre Latenz stärker beeinflussen als die Serving-Stufe.
Drei Möglichkeiten, dasselbe Modell zu kaufen

GLM-5.3 existiert jetzt in drei käuflichen Formen, und es sind nicht drei Modelle:
• GLM-5.3 zu $1.40 / $4.40 — die Basis-Preisliste, voller Funktionsumfang, die Version mit veröffentlichten offenen Gewichten, die Sie selbst hosten können
• GLM 5.3 Prime zu $2.80 / $8.80 — dieselben Gewichte über einen beschleunigten Stack, ein vorgelagerter Anbieter, keine Gewichte im Spiel
• GLM-5.3-FlashX zu $0.37 / $1.25 — überhaupt nicht GLM-5.3, sondern die Geschwindigkeitsstufe der günstigeren Flash-Familie und mit Abstand die günstigste Möglichkeit, Latenz zu kaufen
Diese dritte Zeile ist diejenige, die man sich genauer ansehen sollte. Wenn es dir eigentlich um schnellere Tokens geht und du flexibel darin bist, von welchem GLM du sie beziehst, liefert FlashX Beschleunigung für ein Modell, das bereits ungefähr ein Zehntel des Flaggschiffs kostet – und das für weniger als die Hälfte dessen, was das Flaggschiff unbeschleunigt kostet. Prime ist nur dann sinnvoll, wenn du speziell auf die Reasoning-Qualität von GLM-5.3 angewiesen bist und sie speziell früher brauchst.
Wo das auf unserer Seite steht

Wir sollten eines klarstellen: OrcaRouter hostet GLM 5.3 Prime nicht, und wir hosten auch GLM-5.3-FlashX nicht. Beide Modellseiten liefern auf unserer Website einen 404. Wenn Sie die beschleunigte Stufe möchten, müssen Sie sie von der Plattform kaufen, die sie verkauft, oder über die eigene API des Anbieters für das Basismodell.
Was wir hosten, sind GLM-5.3 und GLM-5.3-Flash, zum Listenpreis des Anbieters ohne jeglichen Aufschlag von unserer Seite — dieselben $1,40 und $4,40, die Sie auf der eigenen Preiskarte von Z.ai sehen, durchgereicht statt neu bepreist. Das ist wichtiger, als es klingt, bei einem Modell, dessen Preis sich innerhalb von sechs Wochen zweimal geändert hat. Weil wir keine Marge aufschlagen, ist eine Preisänderung des Anbieters bei uns am selben Tag live wie bei ihm – ohne Migration oder Support-Ticket. Beide IDs liegen hinter einem einzigen API-Schlüssel, zusammen mit über 200 weiteren Modellen, sodass ein A/B-Vergleich zwischen GLM-5.3 und GLM-5.3-Flash eine einzeilige Änderung des Modellnamens ist statt eines zweiten Vertrags, und automatisches Failover fängt Sie auf, wenn ein einzelner Upstream-Anbieter beeinträchtigt ist — was genau das Risiko ist, das eine schnelle Stufe von einem einzigen Anbieter mit sich bringt.
Solltest du das 2× bezahlen?
Bezahlen Sie dafür, wenn ein Mensch oder ein vorgelagerter Dienst auf die Antwort wartet, die Arbeitslast latenzgebunden statt durchsatzgebunden ist und Sie bereits bestätigt haben, dass der Reasoning-Aufwand der eigentliche Treiber Ihrer Latenz ist. Bezahlen Sie nicht dafür, wenn Sie eine Batch-Generierung über Nacht laufen lassen, wenn Ihr Volumen hoch genug ist, dass ein 2×-Token-Aufpreis die eingesparte Wall-Clock-Zeit übersteigt, oder wenn Sie gehofft haben, die Stufe wäre still und heimlich ein besseres Modell. Ist sie nicht. Sie ist GLM-5.3 mit einer laufenden Stoppuhr, und die Stoppuhr rechnet pro Token ab.
Die ehrliche Einordnung für die gesamte GLM-5.3-Familie ist derzeit, dass Z.ai im August ein Modell veröffentlicht hat und der Markt den September damit verbracht hat, es zu vier verschiedenen Preisen neu zu verpacken. GLM 5.3 Prime ist das teuerste dieser Pakete. Es ist auch das mit der dünnsten Dokumentationslage, weil das Unternehmen, dessen Name auf den Gewichten steht, es nicht aufführt. Das ist kein Grund, es zu meiden. Es ist ein Grund, genau zu wissen, was man kauft, bevor man es auf einen Produktionspfad setzt.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
