
GLM 5.3 Prime vs. GLM-5.3: Doppelter Preis für dieselben Gewichte und eine Stoppuhr
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 177 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1323 tok/s
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
In diesem Vergleich stellt sich keine Qualitätsfrage, und genau das macht ihn ungewöhnlich. GLM 5.3 Prime und GLM-5.3 sind dasselbe Modell — dieselben Gewichte, derselbe Kontext von 1.000.000 Token, dieselbe Obergrenze von 131.072 Token für die Ausgabe, dasselbe obligatorische Reasoning mit denselben drei Aufwandsstufen, dieselben Ergebnisse in jedem veröffentlichten Benchmark. GLM-5.3 wurde am 14. August 2026 angekündigt, erreichte die API am 18. August und seine Gewichte wurden am 25. August geöffnet; die Prime-ID erschien Ende September als zweite Möglichkeit, dasselbe Produkt zu kaufen. Die einzige Zeile im Vergleich, die sich unterscheidet, ist die, die für Ihre Rechnung zählt, und sie unterscheidet sich um genau 2,0×.
Die Frage ist also nicht, welches Modell man verwenden sollte. Sie lautet, ob eine Serving-Lane, die 1,5–2× den Ausgabedurchsatz verspricht, den doppelten Preis wert ist, und das ist eine Rechnung, die man in einem Absatz aufstellen kann. Die meisten Beiträge zu diesem Paar überspringen die Rechnung und streiten über Benchmarks, die konstruktionsbedingt identisch sind. Hier ist die Summe.
Die einzigen Zeilen, die sich unterscheiden

• Preis — GLM 5.3 Prime 2,80 $ / 8,80 $ pro 1 Mio. gegenüber GLM-5.3 1,40 $ / 4,40 $ pro 1 Mio.
• Zwischengespeicherte Eingabe — 0,56 $ pro 1 Mio. gegenüber 0,26 $ pro 1 Mio.
• Multiplikator — 2,0× auf jeder Zeile, in beide Richtungen, ohne Ausnahme
• Durchsatz — vom Anbieter angegeben 1,5–2× auf dem beschleunigten Pfad gegenüber dem Standardpfad; eine unabhängige Messung der Prime-ID existiert nicht
• Intelligence Index — 45 bei beiden, denn es ist ein Modell, das einmal bewertet wurde
• Kontext — 1.000.000 Tokens bei beiden
• Maximale Ausgabe — 131.072 Tokens bei beiden
• Reasoning — bei beiden verpflichtend, niedrig / hoch / max, standardmäßig max bei beiden
• Modalität — Text rein, Text raus, bei beiden
• Gewichte — die von GLM-5.3 sind unter einer maßgeschneiderten Lizenz herunterladbar; Prime hat überhaupt keine Gewichte
• Verfügbarkeit — GLM-5.3 über Z.ais eigene API und jede Plattform, die es führt; Prime auf einer Plattform, hinter einem einzigen namentlich genannten Upstream-Anbieter
Beachten Sie, was die identischen Zeilen mit dem üblichen Vergleichsartikel bewirken. Es gibt hier kein Reasoning-Tiefe-Argument, kein Langkontext-Argument, kein Tool-Calling-Argument, kein Lizenz-zum-Servieren-Argument, das diese beiden Produkte trennt, denn eine Serving-Lane ändert nichts am Verhalten eines Modells. Wenn Sie einen Head-to-Head-Vergleich dieses Paares gelesen haben, bei dem Prime bei einer Aufgabe als „leistungsfähiger“ eingestuft wurde, dann ist dieser Befund Rauschen — dieselben Gewichte erzeugen keine andere Verteilung, und der einzige Unterschied besteht darin, wie schnell die Tokens ankommen und wie viele davon das Modell durch den standardmäßigen Reasoning-Aufwand ausgibt.
Der Break-even, richtig gemacht
Bepreist man die beiden Wege pro Arbeitseinheit, fällt das Ganze auf ein einziges Verhältnis zusammen. Wenn Prime den 2,0-fachen Durchsatz für den 2,0-fachen Preis liefert, kauft man dieselbe Ausgabe zu denselben Kosten und tauscht schlicht Geld gegen Wall-Clock-Zeit – ein reiner Latenzkauf ohne Aufschlag und ohne Rabatt. Wenn Prime den 1,5-fachen Durchsatz für den 2,0-fachen Preis liefert, zahlt man etwa das 1,33-Fache pro Token pro Sekunde, einen Aufschlag von einem Drittel für das Privileg, weniger warten zu müssen. Das sind die beiden Enden der vom Anbieter selbst angegebenen Spanne, und beide Enden sind der Bestfall, denn sie setzen voraus, dass die 1,5–2× auf Ihrer Arbeitslast gelten und nicht unter den Benchmark-Bedingungen des Anbieters.
Der Aufpreis ist in der Praxis aus einem Grund noch schlechter als das: Der Durchsatz wird bei einer warmen, kurzen, konkurrenzfreien Anfrage gemessen, und er ist die Metrik, die am empfindlichsten auf alles andere reagiert. Eine Agentensitzung mit langem Kontext liest bei jeder Runde ein wachsendes Transkript erneut, was die Last eher auf Prefill und Cache-Lesevorgänge als auf das Decoding im stationären Zustand verlagert – und Prime berechnet auch für Cache-Lesevorgänge den doppelten Preis. Unabhängige Messungen des Basismodells setzen GLM-5.3 auf ungefähr 61 Ausgabe-Tokens pro Sekunde gegenüber einem Klassendurchschnitt von 67, aber diese Zahl ist ein Median über einen standardisierten Evaluationsdatensatz, nicht der Tail, den Sie unter Last treffen werden. Die ehrliche Zusammenfassung ist, dass Primes Kosten pro Durchsatzeinheit irgendwo zwischen dem 1,0- und dem 1,33-Fachen der Basis-Lane liegen und dass das 1,0-Fachen-Ende erfordert, dass der Best Case des Anbieters exakt eintritt.
Gleiche Gewichte bedeuten mehr, als es klingt.

Der praktische Vorteil eines gemeinsam genutzten Gewichtssatzes besteht darin, dass alles, was Sie gegen GLM-5.3 entwickelt haben, den Wechsel in beide Richtungen übersteht. Prompt-Formen übertragen sich, Tool-Schemata übertragen sich, Cache-Schlüssel übertragen sich, und die Eval, die Sie ausgeführt haben, um das Flaggschiff überhaupt zu rechtfertigen, bleibt auf beiden IDs gültig. Es gibt kein Re-Tuning, kein Re-Baselining, keine Überraschung bei den Fehlermodi, denn die Fehlermodi gehören zum Modell und nicht zu der Lane, die es bedient.
Das gilt in beide Richtungen, und die zweite Richtung ist die, die man verinnerlichen sollte. Wenn der Reasoning-Standard von GLM-5.3 max es bei Ihrer Aufgabe wortreich macht, erbt Prime den Wortreichtum zusammen mit allem anderen. Eine schnellere Spur, die mehr Tokens generiert als benötigt, ist nicht Ende-zu-Ende schneller. Bevor Sie 2× für Beschleunigung zahlen, senken Sie die Effort-Stufe auf hoch oder niedrig und messen Sie — die Effort-Einstellung beeinflusst die Ende-zu-Ende-Latenz normalerweise stärker als die Serving-Lane, und sie kostet nichts.
Die eine Asymmetrie, die die Preisliste nicht zeigt
Die Gewichte von GLM-5.3 sind offen. Jeder mit der Hardware kann sie herunterladen und das Modell zu Selbstkosten anbieten – ohne Abrechnung pro Token und ohne dass man sich zwischen verschiedenen Serving-Pfaden entscheiden muss. Die kleinste praktikable Quantisierung landet im Bereich von 217 GB Accelerator-Speicher, was für die meisten Teams ein Multi-Node-Deployment und für manche ein Rundungsfehler ist, und die Lizenz sieht eine Umsatzschwelle vor, oberhalb derer große Model-as-a-Service-Betreiber eine Sicherheitsüberprüfung durchlaufen müssen, bevor sie es kommerziell anbieten dürfen.
Prime hat keine Gewichte. Es ist eine gehostete Schiene auf der Bereitstellung eines anderen, und sein Listing nennt genau einen Upstream-Anbieter hinter dem Endpunkt. Das ist die Asymmetrie, die es wert ist, benannt zu werden: Beim Basismodell wählt man zwischen einem Preis pro Token und den eigenen amortisierten Kosten, und bei Prime wählt man zwischen einem Preis pro Token und nichts anderem. Ein Team, das GLM-5.3 bereits auf eigener Hardware betreibt, hat in diesem Vergleich eine dritte Option, die die Preisliste nie zeigt, und sie ist meist die günstigste der drei.
Wo die Stoppuhr wirklich gewinnt
Es gibt Workloads, bei denen ein Aufpreis von 1,33× pro Token offensichtlich richtig ist, und sie haben eine gemeinsame Eigenschaft: Etwas anderes als Ihr Token-Budget ist der Engpass. Ein Mensch, der in einer Chat-Oberfläche auf eine Antwort wartet. Ein synchroner Schritt in einer Pipeline, bei dem die nächste Stufe nicht beginnen kann, bis das Modell ein Ergebnis zurückliefert. Eine Agenten-Schleife, die zehn sequenzielle Aufrufe macht, bei der die Latenz jedes Aufrufs mit der Kettenlänge multipliziert wird und die gesamte Wall-Clock-Zeit das ist, was Ihr Nutzer tatsächlich erlebt. In diesen Fällen kaufen Sie keine Tokens, Sie kaufen die Zeit zurück, die die Tokens gebraucht hätten, und der Faktor 2× auf der Rechnung ist nicht die Zahl, die darüber entscheidet, ob das Feature funktioniert.
Außerhalb dieses Profils wendet sich die Rechnung schnell gegen Prime. Eine Batch-Generierung über Nacht kümmert sich nicht darum, wie schnell eine einzelne Anfrage zurückkommt. Eine Klassifizierung mit hohem Volumen kümmert das ebenso wenig, und in großem Maßstab summiert sich der 2×-Aufschlag auf Cache-Lesevorgänge zu einem echten Kostenposten. Und jede Workload, bei der die eigene Reasoning-Länge des Modells der dominierende Term ist – ein schwieriges Mathematikproblem, eine lange Planungskette –, zahlt für Beschleunigung an dem Teil der Anfrage, der nie der langsame Teil war.
Beide Wege, ein Schlüssel, keine zweite Integration

Die meisten Teams lösen das am Ende nicht, indem sie sich für eine Spur entscheiden, sondern indem sie zwischen ihnen routen, und das ist nur sinnvoll, wenn beide IDs auf dieselbe Weise erreichbar sind. OrcaRouter führt GLM-5.3 zum Listenpreis des Anbieters von 1,40 $ und 4,40 $ pro Million Token, ohne Aufschlag von unserer Seite — der Listenpreis des Anbieters wird durchgereicht statt neu bepreist, sodass eine Tarifänderung des Anbieters bei uns am selben Tag live ist, an dem sie bei ihm eintrifft. GLM-5.3-Flash ist ebenfalls hier, zu 0,07 $ und 0,25 $, was wichtig ist, weil eine Route, die vom günstigen Modell zum Flaggschiff eskaliert, genau die Form ist, die der meiste Produktionsverkehr tatsächlich will.
Beide IDs stehen hinter einem einzigen API-Schlüssel neben über 200 weiteren Modellen, was eine Lane-Entscheidung in eine Änderung des Modellnamens innerhalb eines Aufrufpfads verwandelt statt in einen zweiten Vertrag und eine zweite Integration. Die Routing-DSL ist der Ort, an dem das für genau dieses Paar nützlich wird: latenzempfindliche Aufrufe an die beschleunigte Lane senden und alles andere an die Standard-Lane, oder bei einer fehlgeschlagenen Prüfung eskalieren statt auf eine Vermutung hin. Automatisches Failover deckt den Fall ab, in dem ein einzelner Upstream-Anbieter degradiert, was genau die spezifische Exposition ist, die eine schnelle Stufe mit nur einem Anbieter mit sich bringt.
Eines wollen wir nicht implizieren: OrcaRouter hostet GLM 5.3 Prime nicht, und seine Modellseite liefert hier einen 404 zurück. Wenn Sie die beschleunigte Lane wollen, kaufen Sie sie bei der Plattform, die sie verkauft. Was wir tun können, ist, Ihnen die Basis-Lane, das Flash-Modell und eine Stelle zu geben, an der Sie zwischen ihnen routen können.
Wie man in dreißig Sekunden entscheidet
Fragen Sie sich, ob irgendetwas auf die Antwort wartet. Wenn eine Person oder ein nachgelagerter Dienst blockiert ist, die Arbeitslast latenzgebunden statt durchsatzgebunden ist und Sie bereits bestätigt haben, dass der Reasoning-Aufwand nicht der eigentliche Treiber Ihrer Latenz ist, dann ist Primes Premium der Preis für die Funktion, und Sie sollten ihn zahlen. Wenn nichts wartet – Batch-Jobs, Offline-Evaluierung, Massenextraktion, alles, wo die Warteschlange die Verzögerung auffängt –, zahlen Sie einen Aufpreis von einem Drittel pro Durchsatzeinheit für eine Zahl, die sich niemand jemals ansehen wird, und die Basis-Lane ist die richtige Antwort.
Der allgemeinere Punkt ist, wie diese Familie verkauft wurde. GLM-5.3 wurde einmal veröffentlicht, im August, und der September hat mindestens vier verschiedene Preise dafür hervorgebracht, je nachdem, auf welcher Schiene, welcher Plattform und welchem Schwestermodell man landet. Prime ist das teuerste davon und das am schlechtesten dokumentierte, weil das Unternehmen, dessen Name auf den Gewichten steht, es nicht aufführt. Das ist kein Argument dagegen, es zu kaufen. Es ist ein Argument dafür, zu wissen — bevor man Produktionsverkehr darüber leitet —, dass das Einzige, was man über das Basismodell hinaus kauft, eine Stoppuhr ist, und dass die Stoppuhr pro Token abgerechnet wird.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
