Eine Hero-Titelkarte für GLM 5.3 Prime vs. GLM-5.3-Flash mit der Aufschrift „GLM 5.3 Prime vs. GLM-5.3-Flash: eine 18-fache Lücke“, mit dem Untertitel „Das eine ist eine reine Text-Serving-Spur, das andere ein multimodales Modell“, mit drei Chips und der Aufschrift „Preis / 1 Mio.: 2,80 $ / 8,80 $ vs. 0,15 $ / 0,50 $“, „Modalität: nur Text vs. Text, Bild, Video“ und „Lizenz: maßgeschneidert vs. MIT“ sowie einer Fußzeile „GLM-5.3 angekündigt am 14. August 2026; GLM-5.3-Flash veröffentlicht am 26. August 2026.“
Guides & Insights

GLM 5.3 Prime vs. GLM-5.3-Flash: Ein 18-facher Preisunterschied zwischen zwei verschiedenen Modellen

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Hier ist der Vergleich in einer Zeile, für alle, die mit einer bereits halb getroffenen Kaufentscheidung hier angekommen sind: GLM 5.3 Prime ist GLM-5.3s Flaggschiff-Gewichte, verkauft über eine beschleunigte Serving-Stufe zu 2,80 $ und 8,80 $ pro Million Tokens, und GLM-5.3-Flash ist ein separates, nativ multimodales Modell mit eigenen offenen Gewichten zu 0,15 $ und 0,50 $. Der Unterschied zwischen ihnen beträgt etwa das Achtzehnfache, sowohl bei der Eingabe als auch bei der Ausgabe. Das ist kein Stufenunterschied — es ist ein anderes Modell an einer anderen Position innerhalb der Familie, und der einzige Grund, warum die beiden Namen auf einer Modellliste nebeneinander stehen, ist, dass beide im Abstand von sechs Wochen erschienen sind.

Eine falsche Einschätzung ist in beide Richtungen teuer. Wer Flash für eine billige Version von Prime hält, wird überrascht sein, was es nicht kann. Wer Prime für ein schnelleres Flash hält, zahlt für ein Modell, das kein Bild sehen kann, das Achtzehnfache.

Beginne damit, was jedes Einzelne tatsächlich ist

GLM-5.3-Flash ist ein multimodales Mixture-of-Experts-Modell mit 320 Milliarden Parametern, von denen 18 Milliarden aktiv sind. Es wurde am 26. August 2026 unter der MIT-Lizenz veröffentlicht, mit Gewichten auf Hugging Face und ModelScope. Es akzeptiert Text, Bilder, Videos und Dateien nativ in derselben Anfrage, besitzt ein Kontextfenster von 1.000.000 Token und eine Ausgabeobergrenze von 128.000 Token und wurde separat vortrainiert, statt aus dem Flaggschiff destilliert zu werden. Sein hybrides Design aus linearer und sparse Attention reduziert den Aufmerksamkeits-Rechenaufwand um etwa den Faktor drei und verkleinert den KV-Cache gegenüber GLM-5.3 um mehr als das Vierfache – worauf sein Kostenvorteil auf Architekturebene beruht, nicht auf einem Rabatt.

GLM 5.3 Prime ist GLM-5.3 — ein Sparse Mixture-of-Experts mit 40 Milliarden aktiven Parametern, angekündigt am 14. August 2026, in der API ab dem 18. August, mit am 25. August veröffentlichten Gewichten — bereitgestellt über eine High-Speed-Lane. Derselbe Kontext von 1.000.000 Tokens, dieselbe Ausgabegrenze von 131.072 Tokens, Texteingabe und Textausgabe, Reasoning zwingend erforderlich bei niedrigem, hohem oder maximalem Aufwand, wobei max Standard ist. Die eigene Dokumentation von Z.ai führt keine Prime-SKU auf; die Stufe existiert auf einer Drittanbieterplattform, die einen einzigen dahinterstehenden Upstream-Anbieter nennt.

Die Anzeigetafel

A two-column scoreboard titled 'GLM 5.3 Prime vs GLM-5.3-Flash - the scoreboard'. The GLM 5.3 Prime column reads 'Price / 1M: $2.80 / $8.80', 'Cached input: $0.56', 'Modality: text only', 'Weights: none', 'Intelligence Index: 45, same as GLM-5.3', 'Speed: 1.5-2x, vendor-reported'; the GLM-5.3-Flash column reads 'Price / 1M: $0.15 / $0.50', 'Cached input: $0.03', 'Modality: text, image, video, file', 'Weights: open, MIT', 'Intelligence Index: 42', 'Speed: 46 tokens/sec, independently measured'; the footer reads 'Flash figures per Artificial Analysis v4.3.2; Prime speed is vendor-reported with no independent measurement.'

• Preis — GLM 5.3 Prime $2.80 / $8.80 pro 1M vs. GLM-5.3-Flash $0.15 / $0.50 pro 1M
• Zwischengespeicherte Eingabe — $0.56 pro 1M vs. $0.03 pro 1M
• Multiplikator — etwa 18× bei Eingabe und Ausgabe, vor jeglicher Zwischenspeicherung
• Modalität — nur Text vs. Text-, Bild-, Video- und Dateieingabe
• Parameter — 40B aktiv bei einem Flaggschiff-MoE vs. 320B insgesamt / 18B aktiv
• Gewichte — offen, unter einer maßgeschneiderten Lizenz mit Umsatzschwelle vs. MIT, heute herunterladbar
• Maximale Ausgabe — 131.072 Token vs. 128.000 Token
• Kontext — 1.000.000 Token bei beiden
• Intelligenzindex — GLM-5.3 erreicht 45 im Index v4.3.2; GLM-5.3-Flash erreicht 42
• Kosten pro Index-Aufgabe — $2.01 für das Flaggschiff vs. $0.25 für Flash
• Geschwindigkeit — etwa 61 Ausgabe-Token pro Sekunde vs. etwa 46, beides unabhängig gemessene Mediane
• Abonnement-Zugang — Prime ist nicht im Coding Plan von Z.ai enthalten; Flash schon, mit 3×-Kontingent

Zwei Zeilen in dieser Liste verdienen mehr als einen Aufzählungspunkt. Die erste ist die Intelligenzlücke: drei Punkte im Artificial Analysis Intelligence Index, 45 gegen 42, unter der Revision v4.3.2. Eine frühere Revision desselben Index setzte diese Modelle auf 60 und 57, und dieses ältere Paar kursiert weiterhin stark in der Berichterstattung zu Markteinführungen — mischen Sie die beiden nicht, denn die Zahlen sind über Revisionen hinweg nicht vergleichbar. Drei Punkte sind eine schmale Lücke, die sich als etwas mehr Drift bei sehr langen agentischen Ketten und als größere Empfindlichkeit gegenüber mehrdeutigen Anweisungen zeigt – nicht als eine andere Modellklasse.

Der zweite Punkt ist die Geschwindigkeit, und er kehrt die Intuition um, die die Namen erzeugen. Flash ist bei unabhängiger Messung der langsamere der beiden – etwa 46 Ausgabe-Token pro Sekunde gegenüber 61 beim Flaggschiff, in einer Klasse, in der der Durchschnitt bei 67 liegt. Flash verdient seinen Namen beim Preis und bei der Multimodalität, nicht bei der Latenz. Das ist für den Vergleich wichtig, denn der übliche Grund, zu einem kleinen Modell zu greifen, ist, dass es schneller antwortet, und hier tut es das nicht.

Die Entscheidung, die tatsächlich du zu treffen hast

Da sich die beiden Modelle gleichzeitig in drei Dimensionen unterscheiden – Modalität, Lizenz und Preis –, wird die Wahl meist schon anhand der ersten Dimension entschieden, und man kommt nie bis zur Rechnung. Flash liest Bilder und Videos; Prime kann nichts außer Text lesen. Wenn Ihr Workload einen Screenshot, eine gescannte Seite, eine UI-Aufnahme oder ein Videoframe berührt, ist der Vergleich vorbei, bevor der Preis überhaupt ins Spiel kommt, und Sie kaufen Flash.

Wenn Ihre Arbeitslast reiner Text ist und es wirklich um Qualität geht, dann ist die ehrliche Antwort, dass die Drei-Punkte-Indexlücke alles ist, was Sie für den 18-fachen Preis kaufen. Ob sich das lohnt, hängt ganz davon ab, ob Sie die Ausgabe überprüfen können. Wo die Antwort überprüfbar ist – Code, der kompiliert, eine Abfrage, die Zeilen zurückgibt, eine strukturierte Extraktion, die gegen ein Schema validiert –, ist ein gelegentlicher Fehlgriff von Flash billig zu erkennen und billig zu wiederholen, und zum achtzehnten Teil des Preises können Sie sehr oft wiederholen. Wo die Ausgabe Prosa ist, die ein Mensch beurteilen muss, oder ein langer mehrstufiger Plan ohne Zwischenprüfung, ist die Lücke schwerer zu überbrücken und der Aufpreis leichter zu rechtfertigen.

Wo die offenen Gewichte die Mathematik verändern

Flash ist MIT-lizenziert, und seine kleinste nutzbare Quantisierung benötigt in der Größenordnung von 93 GB Accelerator-Speicher – ein einzelner speicherstarker Knoten für viele Teams und für manche ein Rundungsfehler auf der Rechnung. GLM-5.3 verfügt über eine maßgeschneiderte Lizenz, die von großen Betreibern von Model-as-a-Service-Diensten über einer Umsatzschwelle verlangt, eine Sicherheitsüberprüfung zu bestehen, und seine kleinste praktische Quantisierung liegt im Bereich von 217 GB, was für die meisten eine Multi-Node-Bereitstellung ist.

Diese Asymmetrie bedeutet, dass der eigentliche Vergleich für ein Team mit hohem Volumen nicht Primes 8,80 $ gegenüber Flashs 0,50 $ ist. Es sind Primes 8,80 $ gegenüber Ihren eigenen amortisierten Kosten pro Million Ausgabe-Tokens auf Hardware, die Sie bereits besitzen, mit Gewichten, die Sie heute ohne Lizenzgespräch herunterladen können. Für ein Team mit der Hardware und dem Volumen ist diese Zahl häufig die kleinste der drei, und sie ist nur auf der Flash-Seite dieses Vergleichs verfügbar.

Beide kaufen und sie zusammen kaufen

A screenshot of the OrcaRouter model page for GLM 5.3 Flash (z-ai/glm-5.3-flash, captured September 24, 2026) showing the 1M-token context badge, a 128K max output, text, image and video input with text output, a 2026-08-26 date beside 'Public benchmarks by Z.ai', a 320B total / 18B active parameter line, a p50 time to first token of 6.86 seconds, and a stat strip reading $0.07 input, $0.25 output, 6.86 s p50 TTFT, 10.00 s p95 TTFT and 22,120.9M tokens.

Die meisten Produktionssysteme müssen sich nicht entscheiden. Das Muster, das zu diesem Paar passt, ist ein Router: Flash auf dem Standardpfad für Text- und multimodale Arbeit, das Flaggschiff bei der Eskalation, wenn eine Aufgabe langfristig angelegt ist oder der erste Versuch eine Prüfung nicht bestanden hat. Das sind zwei Modell-IDs und eine Entscheidungsfunktion, und die Kosten dafür, die Aufteilung leicht falsch zu wählen, liegen bei ein paar Cent pro tausend Anfragen statt bei einem Architekturproblem.

Wir hosten GLM-5.3-Flash für 0,07 $ und 0,25 $ pro Million Tokens – unter der eigenen Liste des Herstellers von 0,15 $ und 0,50 $ – und GLM-5.3 zum Listenpreis des Anbieters von 1,40 $ und 4,40 $, beide ohne Aufschlag von unserer Seite – der Listenpreis des Anbieters wird durchgereicht statt neu bepreist, sodass eine Preisänderung des Anbieters bei uns am selben Tag ankommt, an dem sie bei ihm ankommt. Beide IDs stehen hinter einem Schlüssel zusammen mit über 200 weiteren Modellen, was die Eskalation von Flash zum Flaggschiff zu einer Änderung des Modellnamens innerhalb eines Aufrufpfads macht statt zu einer zweiten Integration. Automatisches Failover deckt den Fall ab, dass der einzige Upstream-Anbieter hinter einer schnellen Stufe degradiert, und für eine Stufe wie Prime, die genau einen Lieferanten aufführt, ist das kein hypothetisches Problem.

Wir sollten die Grenzen dessen klar benennen: OrcaRouter hostet GLM 5.3 Prime nicht, und wir hosten auch GLM-5.3-FlashX nicht. Beide Modellseiten liefern hier einen 404. Wenn Sie die Beschleunigung von Prime brauchen, werden Sie sie bei der Plattform kaufen, die sie verkauft.

Was wir dir tatsächlich sagen würden

A screenshot of the Artificial Analysis model page for GLM 5.3 Flash (captured September 24, 2026) showing an Intelligence Index score of 42 against a class median of 18, 180M tokens generated during evaluation, a 1M-token context window, $0.15 per 1M input and $0.50 per 1M output tokens with an 83% cache discount, and the comparison line 'At 46 tokens per second, GLM 5.3 Flash is notably slow (67).'

Wenn Sie bis hierher gelesen haben, um einen Sieger zu finden, lautet die Antwort, dass dieses Duo nie ein Wettkampf war. Flash gewinnt bei den Kosten, bei der Modalität, bei der Lizenz und bei der Einsetzbarkeit, und es gewinnt alle vier mit großem Abstand. Der einzige Anspruch des Flaggschiffs sind drei Indexpunkte und etwa 15 Ausgabe-Token pro Sekunde mehr, und dafür verlangt es den achtzehnfachen Preis. Für die große Mehrheit der Text-Workloads ist Flash der richtige Standard, und die Beweislast liegt bei der teuren Option.

Vorsicht ist in der Mitte geboten. Ein Team, das die Reasoning-Qualität eines Flaggschiffs für Text benötigt und außerdem Bilder lesen muss, wird am Ende beide Modelle betreiben, und die Versuchung besteht darin, alles an das Flaggschiff zu routen, weil es das mit dem Ruf ist. Genau dort werden die 18× still und leise zu einem echten Kostenposten. Leite die multimodale Arbeit an Flash weiter, eskaliere bei Fehlschlägen und prüfe, wie hoch deine tatsächliche Eskalationsrate ist, bevor du annimmst, sie sei hoch.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert