Eine Hero-Titelkarte für GLM 5.3 Prime vs. GLM-5.3 mit dem Titel „GLM 5.3 Prime vs. GLM-5.3: ein Modell, zwei Spuren“, dem Untertitel „Gleiche Gewichte, gleicher Kontext, gleiche Scores – nur ein 2,0-facher Preisunterschied“ und drei Chips mit den Texten „Preis / 1 Mio.: 2,80 $ / 8,80 $ vs. 1,40 $ / 4,40 $“, „Angegebene Geschwindigkeit: 1,5- bis 2-facher Ausgabedurchsatz“ und „Kosten pro Token pro Sekunde: 1,0-fach bis 1,33-fach“ sowie einer Fußzeile „GLM-5.3: angekündigt am 14. August 2026, API am 18. August, offene Gewichte am 25. August.“
Guides & Insights

GLM 5.3 Prime vs. GLM-5.3: Doppelter Preis für dieselben Gewichte und eine Stoppuhr

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

In diesem Vergleich stellt sich keine Qualitätsfrage, und genau das macht ihn ungewöhnlich. GLM 5.3 Prime und GLM-5.3 sind dasselbe Modell — dieselben Gewichte, derselbe Kontext von 1.000.000 Token, dieselbe Obergrenze von 131.072 Token für die Ausgabe, dasselbe obligatorische Reasoning mit denselben drei Aufwandsstufen, dieselben Ergebnisse in jedem veröffentlichten Benchmark. GLM-5.3 wurde am 14. August 2026 angekündigt, erreichte die API am 18. August und seine Gewichte wurden am 25. August geöffnet; die Prime-ID erschien Ende September als zweite Möglichkeit, dasselbe Produkt zu kaufen. Die einzige Zeile im Vergleich, die sich unterscheidet, ist die, die für Ihre Rechnung zählt, und sie unterscheidet sich um genau 2,0×.

Die Frage ist also nicht, welches Modell man verwenden sollte. Sie lautet, ob eine Serving-Lane, die 1,5–2× den Ausgabedurchsatz verspricht, den doppelten Preis wert ist, und das ist eine Rechnung, die man in einem Absatz aufstellen kann. Die meisten Beiträge zu diesem Paar überspringen die Rechnung und streiten über Benchmarks, die konstruktionsbedingt identisch sind. Hier ist die Summe.

Die einzigen Zeilen, die sich unterscheiden

A two-column scoreboard titled 'GLM 5.3 Prime vs GLM-5.3 - the scoreboard'. The GLM 5.3 Prime column reads 'Price / 1M: $2.80 / $8.80', 'Cached input: $0.56', 'Context: 1,000,000 tokens', 'Max output: 131,072 tokens', 'Weights: none, hosted lane', 'Throughput: 1.5-2x, vendor-reported'; the GLM-5.3 column reads 'Price / 1M: $1.40 / $4.40', 'Cached input: $0.26', 'Context: 1,000,000 tokens', 'Max output: 131,072 tokens', 'Weights: open since Aug 25, 2026', 'Throughput: standard lane'; the footer reads 'Same weights, same scores, 2.0x the price. Prime has no independent measurement.'

• Preis — GLM 5.3 Prime 2,80 $ / 8,80 $ pro 1 Mio. gegenüber GLM-5.3 1,40 $ / 4,40 $ pro 1 Mio.
• Zwischengespeicherte Eingabe — 0,56 $ pro 1 Mio. gegenüber 0,26 $ pro 1 Mio.
• Multiplikator — 2,0× auf jeder Zeile, in beide Richtungen, ohne Ausnahme
• Durchsatz — vom Anbieter angegeben 1,5–2× auf dem beschleunigten Pfad gegenüber dem Standardpfad; eine unabhängige Messung der Prime-ID existiert nicht
• Intelligence Index — 45 bei beiden, denn es ist ein Modell, das einmal bewertet wurde
• Kontext — 1.000.000 Tokens bei beiden
• Maximale Ausgabe — 131.072 Tokens bei beiden
• Reasoning — bei beiden verpflichtend, niedrig / hoch / max, standardmäßig max bei beiden
• Modalität — Text rein, Text raus, bei beiden
• Gewichte — die von GLM-5.3 sind unter einer maßgeschneiderten Lizenz herunterladbar; Prime hat überhaupt keine Gewichte
• Verfügbarkeit — GLM-5.3 über Z.ais eigene API und jede Plattform, die es führt; Prime auf einer Plattform, hinter einem einzigen namentlich genannten Upstream-Anbieter

Beachten Sie, was die identischen Zeilen mit dem üblichen Vergleichsartikel bewirken. Es gibt hier kein Reasoning-Tiefe-Argument, kein Langkontext-Argument, kein Tool-Calling-Argument, kein Lizenz-zum-Servieren-Argument, das diese beiden Produkte trennt, denn eine Serving-Lane ändert nichts am Verhalten eines Modells. Wenn Sie einen Head-to-Head-Vergleich dieses Paares gelesen haben, bei dem Prime bei einer Aufgabe als „leistungsfähiger“ eingestuft wurde, dann ist dieser Befund Rauschen — dieselben Gewichte erzeugen keine andere Verteilung, und der einzige Unterschied besteht darin, wie schnell die Tokens ankommen und wie viele davon das Modell durch den standardmäßigen Reasoning-Aufwand ausgibt.

Der Break-even, richtig gemacht

Bepreist man die beiden Wege pro Arbeitseinheit, fällt das Ganze auf ein einziges Verhältnis zusammen. Wenn Prime den 2,0-fachen Durchsatz für den 2,0-fachen Preis liefert, kauft man dieselbe Ausgabe zu denselben Kosten und tauscht schlicht Geld gegen Wall-Clock-Zeit – ein reiner Latenzkauf ohne Aufschlag und ohne Rabatt. Wenn Prime den 1,5-fachen Durchsatz für den 2,0-fachen Preis liefert, zahlt man etwa das 1,33-Fache pro Token pro Sekunde, einen Aufschlag von einem Drittel für das Privileg, weniger warten zu müssen. Das sind die beiden Enden der vom Anbieter selbst angegebenen Spanne, und beide Enden sind der Bestfall, denn sie setzen voraus, dass die 1,5–2× auf Ihrer Arbeitslast gelten und nicht unter den Benchmark-Bedingungen des Anbieters.

Der Aufpreis ist in der Praxis aus einem Grund noch schlechter als das: Der Durchsatz wird bei einer warmen, kurzen, konkurrenzfreien Anfrage gemessen, und er ist die Metrik, die am empfindlichsten auf alles andere reagiert. Eine Agentensitzung mit langem Kontext liest bei jeder Runde ein wachsendes Transkript erneut, was die Last eher auf Prefill und Cache-Lesevorgänge als auf das Decoding im stationären Zustand verlagert – und Prime berechnet auch für Cache-Lesevorgänge den doppelten Preis. Unabhängige Messungen des Basismodells setzen GLM-5.3 auf ungefähr 61 Ausgabe-Tokens pro Sekunde gegenüber einem Klassendurchschnitt von 67, aber diese Zahl ist ein Median über einen standardisierten Evaluationsdatensatz, nicht der Tail, den Sie unter Last treffen werden. Die ehrliche Zusammenfassung ist, dass Primes Kosten pro Durchsatzeinheit irgendwo zwischen dem 1,0- und dem 1,33-Fachen der Basis-Lane liegen und dass das 1,0-Fachen-Ende erfordert, dass der Best Case des Anbieters exakt eintritt.

Gleiche Gewichte bedeuten mehr, als es klingt.

A screenshot of the Artificial Analysis model page for GLM-5.3 (max) (captured September 24, 2026) showing an Intelligence Index score of 45 against a class median of 18, 210M tokens generated during evaluation, a 1M-token context window with 114 models in the class, $1.40 per 1M input and $4.40 per 1M output tokens with an 81% cache discount, a cost of $2.01 per Index task, and the comparison line 'At 61 tokens per second, GLM-5.3 (max) is slower than average (67).'

Der praktische Vorteil eines gemeinsam genutzten Gewichtssatzes besteht darin, dass alles, was Sie gegen GLM-5.3 entwickelt haben, den Wechsel in beide Richtungen übersteht. Prompt-Formen übertragen sich, Tool-Schemata übertragen sich, Cache-Schlüssel übertragen sich, und die Eval, die Sie ausgeführt haben, um das Flaggschiff überhaupt zu rechtfertigen, bleibt auf beiden IDs gültig. Es gibt kein Re-Tuning, kein Re-Baselining, keine Überraschung bei den Fehlermodi, denn die Fehlermodi gehören zum Modell und nicht zu der Lane, die es bedient.

Das gilt in beide Richtungen, und die zweite Richtung ist die, die man verinnerlichen sollte. Wenn der Reasoning-Standard von GLM-5.3 max es bei Ihrer Aufgabe wortreich macht, erbt Prime den Wortreichtum zusammen mit allem anderen. Eine schnellere Spur, die mehr Tokens generiert als benötigt, ist nicht Ende-zu-Ende schneller. Bevor Sie 2× für Beschleunigung zahlen, senken Sie die Effort-Stufe auf hoch oder niedrig und messen Sie — die Effort-Einstellung beeinflusst die Ende-zu-Ende-Latenz normalerweise stärker als die Serving-Lane, und sie kostet nichts.

Die eine Asymmetrie, die die Preisliste nicht zeigt

Die Gewichte von GLM-5.3 sind offen. Jeder mit der Hardware kann sie herunterladen und das Modell zu Selbstkosten anbieten – ohne Abrechnung pro Token und ohne dass man sich zwischen verschiedenen Serving-Pfaden entscheiden muss. Die kleinste praktikable Quantisierung landet im Bereich von 217 GB Accelerator-Speicher, was für die meisten Teams ein Multi-Node-Deployment und für manche ein Rundungsfehler ist, und die Lizenz sieht eine Umsatzschwelle vor, oberhalb derer große Model-as-a-Service-Betreiber eine Sicherheitsüberprüfung durchlaufen müssen, bevor sie es kommerziell anbieten dürfen.

Prime hat keine Gewichte. Es ist eine gehostete Schiene auf der Bereitstellung eines anderen, und sein Listing nennt genau einen Upstream-Anbieter hinter dem Endpunkt. Das ist die Asymmetrie, die es wert ist, benannt zu werden: Beim Basismodell wählt man zwischen einem Preis pro Token und den eigenen amortisierten Kosten, und bei Prime wählt man zwischen einem Preis pro Token und nichts anderem. Ein Team, das GLM-5.3 bereits auf eigener Hardware betreibt, hat in diesem Vergleich eine dritte Option, die die Preisliste nie zeigt, und sie ist meist die günstigste der drei.

Wo die Stoppuhr wirklich gewinnt

Es gibt Workloads, bei denen ein Aufpreis von 1,33× pro Token offensichtlich richtig ist, und sie haben eine gemeinsame Eigenschaft: Etwas anderes als Ihr Token-Budget ist der Engpass. Ein Mensch, der in einer Chat-Oberfläche auf eine Antwort wartet. Ein synchroner Schritt in einer Pipeline, bei dem die nächste Stufe nicht beginnen kann, bis das Modell ein Ergebnis zurückliefert. Eine Agenten-Schleife, die zehn sequenzielle Aufrufe macht, bei der die Latenz jedes Aufrufs mit der Kettenlänge multipliziert wird und die gesamte Wall-Clock-Zeit das ist, was Ihr Nutzer tatsächlich erlebt. In diesen Fällen kaufen Sie keine Tokens, Sie kaufen die Zeit zurück, die die Tokens gebraucht hätten, und der Faktor 2× auf der Rechnung ist nicht die Zahl, die darüber entscheidet, ob das Feature funktioniert.

Außerhalb dieses Profils wendet sich die Rechnung schnell gegen Prime. Eine Batch-Generierung über Nacht kümmert sich nicht darum, wie schnell eine einzelne Anfrage zurückkommt. Eine Klassifizierung mit hohem Volumen kümmert das ebenso wenig, und in großem Maßstab summiert sich der 2×-Aufschlag auf Cache-Lesevorgänge zu einem echten Kostenposten. Und jede Workload, bei der die eigene Reasoning-Länge des Modells der dominierende Term ist – ein schwieriges Mathematikproblem, eine lange Planungskette –, zahlt für Beschleunigung an dem Teil der Anfrage, der nie der langsame Teil war.

Beide Wege, ein Schlüssel, keine zweite Integration

A tall screenshot of the OrcaRouter model page for GLM 5.3 (z-ai/glm-5.3, captured September 24, 2026) showing the model's code samples with model set to z-ai/glm-5.3, the supported-parameter list, a PRICING block reading $1.26 per 1M input tokens, $3.96 per 1M output tokens and $0.234 per 1M cache read in USD, a token and cost estimator, and a PERFORMANCE panel for the last 7 days reading p50 TTFT 3.91 s, output speed 73.6 tokens per second, p95 TTFT 10.00 s and an error rate of 0.128%.

Die meisten Teams lösen das am Ende nicht, indem sie sich für eine Spur entscheiden, sondern indem sie zwischen ihnen routen, und das ist nur sinnvoll, wenn beide IDs auf dieselbe Weise erreichbar sind. OrcaRouter führt GLM-5.3 zum Listenpreis des Anbieters von 1,40 $ und 4,40 $ pro Million Token, ohne Aufschlag von unserer Seite — der Listenpreis des Anbieters wird durchgereicht statt neu bepreist, sodass eine Tarifänderung des Anbieters bei uns am selben Tag live ist, an dem sie bei ihm eintrifft. GLM-5.3-Flash ist ebenfalls hier, zu 0,07 $ und 0,25 $, was wichtig ist, weil eine Route, die vom günstigen Modell zum Flaggschiff eskaliert, genau die Form ist, die der meiste Produktionsverkehr tatsächlich will.

Beide IDs stehen hinter einem einzigen API-Schlüssel neben über 200 weiteren Modellen, was eine Lane-Entscheidung in eine Änderung des Modellnamens innerhalb eines Aufrufpfads verwandelt statt in einen zweiten Vertrag und eine zweite Integration. Die Routing-DSL ist der Ort, an dem das für genau dieses Paar nützlich wird: latenzempfindliche Aufrufe an die beschleunigte Lane senden und alles andere an die Standard-Lane, oder bei einer fehlgeschlagenen Prüfung eskalieren statt auf eine Vermutung hin. Automatisches Failover deckt den Fall ab, in dem ein einzelner Upstream-Anbieter degradiert, was genau die spezifische Exposition ist, die eine schnelle Stufe mit nur einem Anbieter mit sich bringt.

Eines wollen wir nicht implizieren: OrcaRouter hostet GLM 5.3 Prime nicht, und seine Modellseite liefert hier einen 404 zurück. Wenn Sie die beschleunigte Lane wollen, kaufen Sie sie bei der Plattform, die sie verkauft. Was wir tun können, ist, Ihnen die Basis-Lane, das Flash-Modell und eine Stelle zu geben, an der Sie zwischen ihnen routen können.

Wie man in dreißig Sekunden entscheidet

Fragen Sie sich, ob irgendetwas auf die Antwort wartet. Wenn eine Person oder ein nachgelagerter Dienst blockiert ist, die Arbeitslast latenzgebunden statt durchsatzgebunden ist und Sie bereits bestätigt haben, dass der Reasoning-Aufwand nicht der eigentliche Treiber Ihrer Latenz ist, dann ist Primes Premium der Preis für die Funktion, und Sie sollten ihn zahlen. Wenn nichts wartet – Batch-Jobs, Offline-Evaluierung, Massenextraktion, alles, wo die Warteschlange die Verzögerung auffängt –, zahlen Sie einen Aufpreis von einem Drittel pro Durchsatzeinheit für eine Zahl, die sich niemand jemals ansehen wird, und die Basis-Lane ist die richtige Antwort.

Der allgemeinere Punkt ist, wie diese Familie verkauft wurde. GLM-5.3 wurde einmal veröffentlicht, im August, und der September hat mindestens vier verschiedene Preise dafür hervorgebracht, je nachdem, auf welcher Schiene, welcher Plattform und welchem Schwestermodell man landet. Prime ist das teuerste davon und das am schlechtesten dokumentierte, weil das Unternehmen, dessen Name auf den Gewichten steht, es nicht aufführt. Das ist kein Argument dagegen, es zu kaufen. Es ist ein Argument dafür, zu wissen — bevor man Produktionsverkehr darüber leitet —, dass das Einzige, was man über das Basismodell hinaus kauft, eine Stoppuhr ist, und dass die Stoppuhr pro Token abgerechnet wird.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert