Eine generierte Hero-Titelkarte mit der Aufschrift „GPT-6 Luna vs GLM-5.3", untertitelt mit „Acht Indexpunkte für den zehnfachen Preis pro Aufgabe, und die Gewichte sind weiterhin nicht veröffentlicht.", mit Chips, die Luna mit $0,10/$0,50 pro 1M bei Index 37 zeigen, GLM-5.3 mit $1,40/$4,40 pro 1M bei Index 45, und Kosten pro Index-Aufgabe von $0,07 gegenüber $0,68, mit dem OrcaRouter-Logo unten rechts.
Guides & Insights

GPT-6 Luna vs. GLM-5.3: Das Open-Weight-Modell, das du immer noch nicht herunterladen kannst

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

GLM-5.3 ist das bessere Modell. Es erreicht 45 im Artificial Analysis Intelligence Index bei maximalem Aufwand gegenüber GPT-6 Luna mit 37, laut Z.ai hält es bei ausgewählten Cybersicherheitsbewertungen mit Mythos 5 mit, und es ist das führende Open-Weights-Modell auf mehreren der zusammengesetzten Ranglisten. Es ist außerdem derzeit eine API, die man mietet, statt eines Modells, das man besitzt: Z.ai hat die Veröffentlichung der Gewichte wegen Bedenken zur Cybersicherheit um etwa zwei Wochen verzögert, und der Download, der eigentlich der ganze Sinn eines Open-Weights-Flaggschiffs sein soll, ist noch nicht da.

Diese Verzögerung ist die Geschichte dieses Duells, und sie verändert die Rechnung auf eine Weise, die die Preistabellen nicht erfassen. GPT-6 Luna erschien am 22. September 2026 zu 0,10 $ pro Million Eingabe-Tokens und 0,50 $ pro Million Ausgabe-Tokens, allgemein verfügbar, ohne Bedingungen. GLM-5.3 erschien am 18. August 2026 zu 1,40 $ und 4,40 $ — das Vierzehnfache von Lunas Eingabepreis und fast das Neunfache seines Ausgabepreises —, wobei seine Gewichte zurückgehalten wurden. Der Vergleich ist also nicht offen gegen geschlossen. Es ist ein geschlossenes Modell, das man heute zu einem Zehntel der Kosten aufrufen kann, gegen ein offenes Modell, das man heute nur aufrufen kann, bepreist, als würde man das kaufen, was man noch nicht haben kann.

Zwei Modelle, einen Monat auseinander, zwei sehr unterschiedliche Deals

GPT-6 Luna ist die kleine Stufe von OpenAIs GPT-6-Generation und wird zusammen mit GPT-6 Sol zu 2,00 $/10,00 $ angeboten, unterhalb des Flaggschiffs GPT-6 Astra zu 10,00 $/50,00 $. Es verfügt über ein Kontextfenster von 1.050.000 Token, ein Ausgabelimit von 128.000 Token, Text- und Bildeingabe sowie eine Reasoning-Leiter, die von none über low, medium, high, xhigh bis max reicht — wobei medium die Standardeinstellung ist. OpenAI nennt es das effizienteste Modell der Familie für fokussierte Arbeit mit hohem Volumen, und die Preisliste bestätigt das: gecachte Eingabe zu 0,01 $ pro Million ist ein Zehntel eines ohnehin niedrigen ungecachten Tarifs.

GLM-5.3 ist das aktuelle Flaggschiff von Z.ai für komplexes Software-Engineering und agentische Arbeit mit langem Horizont, veröffentlicht am 18. August 2026. Es ist Text-in, Text-out, besitzt ein Kontextfenster von 1 Mio. Token mit einer Obergrenze von 128.000 Token für die Ausgabe und hat das Reasoning immer aktiviert – es gibt keinen Nicht-Reasoning-Modus. Z.ai beschreibt eine Verbesserung der Coding-Erfahrung um rund 50 % gegenüber GLM-5.2 und positioniert es für Coding im Repository-Maßstab sowie autonomes mehrstufiges Engineering. Die Gewichte werden, sobald sie erscheinen, das herausragende Merkmal sein; heute ist die API das, was live ist.

Was die beiden Tarifkarten tatsächlich sagen

Eine Zeile pro Dimension, beide Seiten jeweils aktiviert:

• Eingabe pro 1 Mio. — GPT-6 Luna 0,10 $ vs. GLM-5.3 1,40 $

• Ausgabe pro 1 Mio. — GPT-6 Luna 0,50 $ vs. GLM-5.3 4,40 $

• Zwischengespeicherte Eingabe — GPT-6 Luna 0,01 $ pro 1 Mio. vs. GLM-5.3 0,26 $ pro 1 Mio., ein Rabatt von 81 % auf den eigenen Eingabepreis

• AA-Intelligenzindex — GPT-6 Luna 37 bei maximalem Aufwand vs. GLM-5.3 45 bei maximalem Aufwand

• Standard-Aufwandsbewertung — GPT-6 Luna 29 bei seiner mittleren Standardeinstellung vs. GLM-5.3 mit Always-on-Reasoning, gemessen am Maximum

• Ausgabe-Tokens beim Index-Lauf — GPT-6 Luna 150M vs. GLM-5.3 210M, gegenüber einem Board-Median von 140M

• Kosten für den Betrieb des Index — GPT-6 Luna 122,39 $ vs. GLM-5.3 2.503,48 $

• Kosten pro Index-Aufgabe — GPT-6 Luna etwa 0,07 $ vs. GLM-5.3 etwa 0,68 $

• Kontext und Ausgabe — GPT-6 Luna 1.050.000 Eingabe / 128.000 Ausgabe vs. GLM-5.3 1 Mio. Eingabe / 128.000 Ausgabe

• Langkontext-Klausel — GPT-6 Luna 2x Input und Cache, 1,5x Output oberhalb von 272K Input, gesamte Anfrage vs. GLM-5.3, keine entsprechende Klausel auf der veröffentlichten Karte

• Reasoning-Aus-Schalter — GPT-6 Luna none bis max vs. GLM-5.3 immer an, kein Nicht-Reasoning-Modus

• Gewichte — GPT-6 Luna geschlossen, nur API vs. GLM-5.3 offen laut Zusage, Veröffentlichung verzögert

A generated single-panel scoreboard card headed 'Same suite, ten times the task cost' with six rows: GPT-6 Luna $0.10 in / $0.50 out per 1M with index 37 at max effort; GLM-5.3 $1.40 in / $4.40 out per 1M with index 45 at max effort; cost per completed index task about $0.07 against about $0.68; output tokens on the index run Luna 150M against GLM-5.3's 210M and a board median of 140M; reasoning configuration Luna none through max against GLM-5.3 always on with no off switch; and weights, Luna closed and API-only against GLM-5.3 open by commitment with the release delayed. Footer: 'Index and cost per task per Artificial Analysis; prices per OpenAI and Z.ai.'

Die Verbositätssteuer ist die Zahl, die hierüber entscheidet.

Der Acht-Punkte-Abstand im Index ist real, und der Preisabstand ist größer – und keiner von beiden ist die Zahl, die am wichtigsten ist. Die Zahl, die zählt, sind Output-Tokens pro abgeschlossener Aufgabe, denn genau dort macht sich ein Acht-Punkte-Vorsprung bei den Fähigkeiten entweder bezahlt oder eben nicht.

Der Index-Lauf von Artificial Analysis ist der sauberste verfügbare kontrollierte Vergleich: dieselbe Suite, derselbe Harness, gegen beide Modelle ausgeführt. GLM-5.3 generierte 210 Millionen Ausgabe-Token, um den Lauf abzuschließen. GPT-6 Luna generierte 150 Millionen. Gegenüber einem Median der Bestenliste von 140 Millionen sind beide geschwätzig – GLM-5.3 um die Hälfte über dem Median, GPT-6 Luna um etwa ein Zehntel. Doch die Richtung dieser Differenz wirkt sich beim Preis zulasten von Z.ais Modell aus: Es gibt 40 % mehr Token aus und verlangt für jedes einzelne 8,8-mal so viel.

Zusammengenommen belaufen sich die Kosten pro abgeschlossener Index-Aufgabe auf etwa 0,68 $ für GLM-5.3 gegenüber etwa 0,07 $ für GPT-6 Luna — eine ungefähr zehnfache Lücke, größer als das reine Preislisten-Verhältnis, weil das teurere Modell auch das wortreichere ist. Das ist die ehrliche Gestalt dieser Paarung. GLM-5.3 kauft Ihnen acht Indexpunkte für zehnmal so viel Geld pro erledigter Aufgabe, und ob das ein guter Kauf ist, hängt ganz davon ab, ob Ihr Workload einer ist, bei dem acht Punkte den Unterschied zwischen Funktionieren und Nichtfunktionieren ausmachen.

Für einen Großteil des Produktionsverkehrs ist das nicht der Fall. Für einen Coding-Agenten, der in einem Repository an der Grenze dessen arbeitet, was das Modell leisten kann, ist es häufig doch so, und kein noch so großer Preisvorteil schließt eine Fähigkeitslücke bei einer Aufgabe, die fehlschlägt.

Warum die offenen Gewichte die Antwort ändern und warum die Verzögerung sie wieder zurücksetzt

Das Standardargument für ein Open-Weights-Flaggschiff lautet, dass der Preis pro Token vorübergehend ist. Man mietet, bis das eigene Volumen den Kauf rechtfertigt, dann lädt man das Modell herunter und die Grenzkosten eines Tokens werden zu Strom. Nach dieser Argumentation sind die $1.40/$4.40 von GLM-5.3 nicht wirklich vierzehnmal so viel wie die $0.10 von GPT-6 Luna – es ist ein Brückenpreis auf dem Weg gegen null, und der günstigere Tarif des geschlossenen Modells ist eine Miete ohne Ausstieg.

Dieses Argument ist korrekt, und es ist derzeit ausgesetzt. Z.ai hat die Gewichte wegen Cybersicherheitsbefunden rund zwei Wochen zurückgehalten, was bedeutet, dass die Ausstiegsrampe, die den Aufpreis rechtfertigt, noch nicht existiert. Bis sie existiert, ist GLM-5.3 eine nutzungsabhängig abgerechnete API, die pro Aufgabe zehnmal so viel kostet wie ein Modell, das auf der allgemeinen Rangliste vier Indexpunkte und auf der Coding-Rangliste einen Punkt hinter GLM-5.3 liegt – und der Käufer zahlt Open-Weights-Preise für einen Closed-Weights-Zugang.

Es gibt einen Punkt zweiter Ordnung, den man benennen sollte. Die Verzögerung ist kein Skandal; sie bedeutet, dass ein Anbieter einen Befund zu den Fähigkeiten ernst nimmt, und ein Modell, das Schwachstellen gut findet, ist genau die Art von Modell, die ein Labor nur mit Vorsicht als herunterladbare Datei veröffentlichen sollte. Aber es bedeutet, dass das Veröffentlichungsdatum der Gewichte jetzt das mit Abstand wichtigste Datum in diesem Vergleich ist, und es ist nicht veröffentlicht. Ein Team, das bei einem Horizont von zwölf Monaten zwischen diesen beiden Modellen wählt, wählt zwischen einem Modell, dessen Bedingungen sich nächsten Monat ändern können, und einem Modell, dessen Bedingungen sich nicht ändern können – und nur eines von beiden ist entsprechend bepreist.

Die Migrationsoberfläche ist klein

Beide Modelle bieten eine OpenAI-kompatible Chat-Completions-Oberfläche, beide verfügen über ein Kontextfenster der 1M-Klasse, und beide begrenzen die Ausgabe auf 128.000 Token, sodass eine Portierung zwischen ihnen eher einer Konfigurationsänderung als einer Neuimplementierung gleicht. Die Unterschiede, die tatsächlich zu spüren sein werden, sind verhaltensbezogen, nicht strukturell.

GPT-6 Lunas Long-Context-Klausel ist die teure: Anfragen über 272.000 Input-Tokens werden für die gesamte Anfrage mit dem Doppelten der Input- und Cache-Raten und dem 1,5-Fachen der Output-Rate abgerechnet, sodass ein Aufruf mit 300.000 Tokens doppelt so viel kostet wie dieselbe Arbeit, aufgeteilt auf zwei Anfragen. Die veröffentlichte Karte von GLM-5.3 enthält keine entsprechende Klausel, was bei wirklich großen einzelnen Anfragen die Preislücke erheblich verringert und sie bei einer output-lastigen Aufgabe umkehren kann.

Die Reasoning-Konfiguration wirkt genau andersherum. Bei GLM-5.3 ist Reasoning immer eingeschaltet, und es gibt keine Möglichkeit, es abzuschalten, was eine harte Einschränkung für alles Latenzempfindliche ist – ein Klassifikator oder ein Router kann es nicht verwenden. GPT-6 Luna bietet none, low, medium, high, xhigh und max, und der Standard ist medium, wobei es 29 statt 37 erreicht. Dieser einzelne Parameter macht den Unterschied aus, ob GPT-6 Luna acht Indexpunkte hinter dem Modell von Z.ai liegt oder sechzehn, und ein Team, das migriert, ohne ihn explizit zu setzen, verwendet die zweite Konfiguration, während es glaubt, die erste gekauft zu haben.

GLM-5.3 ist auf OrcaRouter zum Listenpreis von Z.ai verfügbar, und zwar zu Durchlaufpreisen, die eine Änderung der Anbieterkonditionen noch am selben Tag auf unserer Seite abbilden, statt darauf zu warten, dass ein Wiederverkäufer neu verhandelt – was bei einem Modell, dessen Schlagzeilenwert sich voraussichtlich ändert, sobald die Gewichte erscheinen, mehr als sonst zählt. GPT-6 Luna ist zum Zeitpunkt dieses Textes nicht in unserem Katalog und wird über OpenAIs eigene API erreicht. Ein Team, das beide betreibt – was hier angesichts der großen Unterschiede der beiden an den Rändern die rationale Konfiguration ist –, nutzt einen Schlüssel für GLM-5.3 neben dem, was es bereits für OpenAI verwendet, und verlagert Traffic zwischen einem Fünf-Cent-Klassifikator und einem Coding-Agent im Repo-Maßstab, indem es eine Route statt eines Deployments ändert.

A screenshot of the Artificial Analysis page for GPT-6 Luna (max), showing an Intelligence rank of 6th of 183 models, a Speed rank of 35th, a Cost rank of 20th and a Verbosity rank of 36th, input pricing of $0.10 and output of $0.50 per 1M tokens, an Intelligence Index score of 37 against a comparable-model median of 12, 150M output tokens generated during the index run, 153.9 tokens per second, and a total of $122.39 spent evaluating the model.

Der Anruf.

Nehmen Sie GPT-6 Luna für alles, was programmseitig genutzt wird und ein hohes Volumen hat. Klassifizierung, Extraktion, Routing, Massen-Zusammenfassung, die innere Schleife eines Agenten. Bei 0,10 $/0,50 $, mit zwischengespeicherter Eingabe für einen Cent und Batch zum halben Standardtarif, ist es pro abgeschlossener Aufgabe eine Größenordnung günstiger als GLM-5.3, und die Acht-Punkte-Lücke im Index wird in Ihrer Evaluation nicht sichtbar sein. Legen Sie den Effort-Parameter explizit fest und halten Sie Ihre langen Aufrufe unter 272.000 Tokens.

Nimm GLM-5.3, wenn die Aufgabe die schwierige ist und die Antwort mehr zählt als die Rechnung. Software-Engineering im Repo-Maßstab, autonome mehrstufige Arbeit, alles, wo acht Indexpunkte den Unterschied zwischen einer abgeschlossenen und einer gescheiterten Aufgabe ausmachen. Die Ausführlichkeit ist eine echte Belastung, und die zehnfachen Aufgabenkosten sind real, aber ein Modell, das fertig wird, ist billiger als ein Modell, das man wiederholen muss.

Und behalten Sie die Gewichte im Auge. Der Tag, an dem Z.ai den Download von GLM-5.3 veröffentlicht, ist der Tag, an dem sich die zentrale Tatsache dieses Vergleichs ändert, und er ist das einzige Datum auf dieser Seite, das noch nicht im Kalender steht.

A screenshot of the OrcaRouter model page for GLM-5.3 (z-ai/glm-5.3), showing the Tools, JSON and Reasoning badges, a 2026-08-18 catalogue date, 1M-token context with 128K maximum output, list pricing of $1.26 input and $3.96 output per 1M tokens, a p50 time to first token of 3.99s, 1807.1M tokens of traffic, and the description of GLM-5.3 as Z.ai's flagship model for complex software engineering and long-horizon agentic tasks.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert