Generierte Titelkarte mit der Aufschrift „GPT-6 vs GLM 5.3“, mit einem Chip mit der Aufschrift „GLM 5.3: offene Gewichte, veröffentlicht am 2026-08-18“ und einem Chip mit der Aufschrift „GPT-6: geschlossene Gewichte, ausgeliefert am 2026-09-22“, sowie einer Fußzeile mit der Aufschrift „AA-Peergruppen unterscheiden sich: Ergebnisse für offene Gewichte und proprietäre Modelle sind nicht voneinander subtrahierbar.“ Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

GPT-6 vs GLM 5.3: Eines davon kann man herunterladen, und der Preisunterschied ist kleiner als der Indexunterschied.

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Der Grund, GPT-6 mit GLM 5.3 zu vergleichen, ist nicht die Benchmark-Tabelle. Es ist die Tatsache, dass GLM 5.3 das einzige Modell in dieser Preisklasse ist, dessen Gewichte man mit nach Hause nehmen kann, während GPT-6 eine geschlossene Generation ist, deren drei Mitglieder nur über eine API erreichbar sind. Dieser Unterschied entscheidet mehr Beschaffungsfragen als jede Index-Differenz, und er ist auch der Grund, warum die beiden Punktzahlen nicht direkt vergleichbar sind – und genau das ist der Punkt, den die meisten veröffentlichten Vergleiche dieses Paares falsch darstellen.

Die beiden Seiten, genau

GLM 5.3 ist das Flaggschiff von Z.ai, veröffentlicht am 18. August 2026, wobei die Gewichte etwa eine Woche später veröffentlicht wurden. Es ist ein reines Textmodell – keine Bildeingabe – mit einem Kontextfenster von 1.000.000 Token und einer Obergrenze von 128.000 Token für die Ausgabe, von Z.ai gelistet zu 1,40 $ pro Million Eingabe-Token und 4,40 $ pro Million Ausgabe, mit einem Preis für zwischengespeicherte Eingabe von 0,234 $ pro Million. Es wird unter der Modell-ID z-ai/glm-5.3.

GPT-6 ist eher eine Generation als ein Modell. GPT-6 Astra, GPT-6 Sol und GPT-6 Luna sind drei IDs zu drei Preisstufen, alle am 22. September 2026 veröffentlicht, alle multimodal auf der Eingabeseite (Text, Bild und Datei), alle mit einem Kontextfenster von nahezu 1.050.000 Tokens und einer Obergrenze von 128.000 Tokens für die Ausgabe. Es gibt keinen openai/gpt-6-Endpunkt. Wenn jemand in einem Gespräch über Preise „GPT-6“ sagt, meint er fast immer GPT-6 Sol, die mittlere Stufe zu $2.00 / $10.00 – das ist also der Vertreter, den dieser Vergleich verwendet, wann immer eine einzelne ID benötigt wird.

• Gewichte — GLM 5.3 offen, herunterladbar und selbst hostbar; GPT-6 geschlossen, nur API
• Eingabemodalitäten — GLM 5.3 nur Text; alle drei GPT-6-Stufen akzeptieren Text, Bild und Datei
• Eingabepreis — GLM 5.3 1,40 $ pro Million vs. GPT-6 Sol 2,00 $ pro Million
• Ausgabepreis — GLM 5.3 4,40 $ pro Million vs. GPT-6 Sol 10,00 $ pro Million
• Zwischengespeicherte Eingabe — GLM 5.3 0,234 $ pro Million vs. GPT-6 Sol 0,20 $ pro Million
• Kontext — GLM 5.3 1.000.000 Token vs. GPT-6 Sol 1.050.000 Token
• Stufe für lange Anfragen — GLM 5.3 hat keine auf seiner veröffentlichten Karte; GPT-6 Sol berechnet die gesamte Anfrage oberhalb von 272.000 Eingabe-Token mit 4,00 $ / 15,00 $ neu
• Lizenz — GLM 5.3 erscheint unter Z.ais eigener offener Lizenz; GPT-6 hat keine Lizenzdatei, weil es nichts zu lizenzieren gibt

Beachten Sie den Vorbehalt zur Preiszeile, denn er ist berechtigt, und dieser Blog ist schon einmal darauf gestoßen: Eine OrcaRouter-Modellseite ist nicht immer mit der eigenen Preisliste des Anbieters synchron, und speziell bei GLM 5.3 führt unser Katalog 1,26 $ / 3,96 $, während die von Z.ai veröffentlichte Zahl 1,40 $ / 4,40 $ beträgt. Wo die beiden voneinander abweichen, zitieren Sie im Fließtext die Zahl des Anbieters – was die obigen Aufzählungspunkte tun – und betrachten Sie die Angabe auf der Seite als den Wert der Seite selbst. Beide sind legitim; sie sind nur nicht dieselbe Zahl.

Warum der Indexvergleich ein Warnetikett benötigt

Hier liegt die Falle. Im Artificial Analysis Intelligence Index erreicht GLM 5.3 44,8 und GPT-6 Sol erreicht 47,6 – 2,8 Punkte Abstand. Das sieht nach einem Beinahe-Gleichstand zwischen einem geschlossenen und einem offenen Modell bei rund einem Fünftel des Output-Preises aus, und es ist der Satz, bei dem die meisten Vergleiche dieses Paares stehen bleiben.

Das ist keine gültige Subtraktion. Artificial Analysis vergleicht Open-Weights-Modelle nur mit anderen Open-Weights-Modellen derselben Größenklasse und proprietäre Modelle über ein proprietäres Band hinweg, wobei ein gemischtes Preisverhältnis von 3:1 zwischen Eingabe und Ausgabe verwendet wird. Der Wert 44,8 von GLM 5.3 ist ein Open-Weights-Wert. Der Wert 47,6 von GPT-6 Sol ist ein Wert aus dem proprietären Band. Sie liegen auf unterschiedlichen Skalen, und der Abstand zwischen ihnen ist keine Messung der Leistungsfähigkeit. Derselbe Vorbehalt gilt für die beiden Zahlen in den OrcaRouter-Katalogeinträgen, aus denen beide oben genannten Zahlen stammen.

Was Sie über diese Linie hinweg vergleichen können, sind die Kostenrechnung und die Tarifkarten und zweitrangig die Zeilen, bei denen es sich um dieselbe Auswertung handelt, die auf dieselbe Weise abläuft. Lesen Sie auf beiden Seiten weiter:

• AA Coding Index — GLM 5.3 74.8 vs. GPT-6 Sol 60.0
• GPQA Diamond — GLM 5.3 91.7
• Humanity's Last Exam — GLM 5.3 42.3 vs. GPT-6 Sol 47.9
• Terminal-Bench 2.1 — GLM 5.3 83.9
• Terminal-Bench 4.0 — GLM 5.3 41.9 vs. GPT-6 Sol 43.9
• τ-bench banking — GLM 5.3 50.3
• SciCode — GLM 5.3 59.0 vs. GPT-6 Sol 57.6
• Langkontext-Wiedergabe — GLM 5.3 79.7 vs. GPT-6 Sol 83.7

Als Form lesen, nicht als Punkteunterschied: GLM 5.3 ist stark bei den agentischen und Coding-Evaluierungen – τ-bench Banking und SciCode neigen beide zu ihm, und sein Coding Index liegt weit über dem von Sol – während GPT-6 Sol die Zeilen zu Long-Context-Recall und Humanity's Last Exam belegt. Keine dieser Lesarten ist ein Urteil. Es sind zwei verschiedene Stärkenprofile, gemessen von einem Dritten, an einem Modell, das man herunterladen kann, und an einem Modell, das man nicht herunterladen kann.

Was offene Gewichte hier tatsächlich wert sind

Der Grund, sich für die Lizenz von GLM 5.3 zu interessieren, ist nicht ideologisch. Er liegt darin, dass drei konkrete Dinge aufhören, Entscheidungen des Anbieters zu sein, sobald die Gewichte Ihnen gehören.

Das erste ist die Datenresidenz. Ein selbst gehostetes GLM 5.3 läuft dort, wo Sie es platzieren, und keine Datenverarbeitungsvereinbarung regelt, was Ihr Netzwerk verlässt. GPT-6 hat keine äquivalente Option – die einzige Möglichkeit, es aufzurufen, ist über eine API, und die Daten gehen an einen Ort, den Sie nicht kontrollieren. Bei einer regulierten Arbeitslast ist dies oft die ganze Entscheidung, und es ist eine Entscheidung, die der Index nie erfasst.

Der zweite Punkt ist die Preiskurve. Eine API-Preisliste ist eine Zahl des Anbieters, die der Anbieter ändern kann; die veröffentlichten GPT-6-Tarife werden vom Anbieter als dauerhaft statt als Werbeaktion angegeben, aber das ist eine Absichtserklärung, kein Vertrag. Eigene Gewichte haben Fixkosten, die nicht mehr mit Tokens skalieren, und der Übergangspunkt ist eine Funktion Ihres Volumens und nicht der Preisentscheidung irgendjemandes. Deshalb ist die $1.40 / $4.40-Preisliste nicht wirklich der Vergleich – der Vergleich lautet $1.40 / $4.40 gegenüber Ihrer eigenen Hardware, amortisiert über Ihren eigenen Traffic.

Der dritte ist der Ausfallmodus. Ein gehostetes Modell kann abgekündigt, durch Ratenlimits eingeschränkt oder durch eine Änderung am Serving beeinträchtigt werden. GLM 5.3 ist seit dem 18. August aufrufbar, mit einem öffentlichen Checkpoint dahinter; wenn Z.ai etwas ändert, womit Sie nicht einverstanden sind, ist der Checkpoint, gegen den Sie validiert haben, immer noch auf der Festplatte.

Die Kosten dieser Freiheit sind ebenfalls real und es lohnt sich, sie klar zu benennen. GLM 5.3 ist reiner Text, daher hat eine Workload, die Screenshots oder PDFs in das Modell einspeist, auf der Open-Weights-Seite dieses Vergleichs überhaupt keinen Weg. Kontexte mit 1.000.000 Tokens selbst bereitzustellen ist keine Laptop-Übung. Und das Modell, das Sie herunterladen, ist das Modell, für das Sie verantwortlich sind – Evaluierung, Sicherheitsfilterung, Verfügbarkeit und Upgrades liegen alle bei Ihnen, was ein echtes Engineering-Budget ist, das der API-Preis nicht enthält.

Wo GPT-6 den Aufpreis rechtfertigt

Demgegenüber ist das Argument für die geschlossene Seite enger, als ihr Preis vermuten lässt, aber es ist nicht leer.

Multimodale Eingabe ist der konkrete Aspekt. Alle drei GPT-6-Stufen akzeptieren Bilder und Dateien nativ, und GLM 5.3 akzeptiert weder das eine noch das andere. Eine Pipeline, die ein Diagramm, einen Screenshot oder ein gescanntes Dokument liest und im selben Aufruf darüber schlussfolgert, lässt sich nicht auf GLM 5.3 in der veröffentlichten Form aufbauen.

Long-Context-Recall ist der zweite. GPT-6 Sol führt GLM 5.3 in dieser Zeile um vier Punkte an, und es ist die Zeile, die darüber entscheidet, ob ein sehr großer Kontext tatsächlich nutzbar oder nur akzeptiert wird. Ein Fenster mit 1.000.000 Token, das die Mitte des Dokuments verliert, ist ein größeres Fenster als eines mit 100.000 Token, das dies nicht tut.

Und die Generation hat mehr als einen Preispunkt. Die Sol-Karte für 2,00 $ / 10,00 $ ist diejenige, die üblicherweise mit GLM 5.3 verglichen wird, aber GPT-6 Luna liegt bei 0,10 $ / 0,50 $ – um eine Größenordnung unter der Eingaberate von GLM 5.3 und fast neunmal unter dessen Ausgaberate – und GPT-6.1 Sol, ausgeliefert am 29. September, erreicht 51,8 auf demselben Index zum Preis von Sol. Wenn es einzig um den „günstigsten kompetenten Token“ geht, hat die GPT-6-Generation eine Antwort, die GLM 5.3 nicht hat.

A generated two-column comparison scoreboard titled "GPT-6 Sol vs GLM 5.3 — the scoreboard". The left column, GPT-6 Sol, reads Weights closed, Input $2.00, Output $10.00, AA Intelligence 47.6, AA Coding 60.0, Long-context recall 83.7. The right column, GLM 5.3, reads Weights open, Input $1.40, Output $4.40, AA Intelligence 44.8, AA Coding 74.8, Long-context recall 79.7. A footer line reads "AA ranks open-weights and proprietary models on different peer scales; the two Intelligence figures are not subtractable." The OrcaRouter logo is composited in the bottom-right corner.

Sie zusammen laufen zu lassen, ist die Antwort, auf die die meisten Teams kommen.

Die praktische Schlussfolgerung aus diesem Vergleich ist, dass er nicht exklusiv ist. GLM 5.3 hat sehr große Mengen angezogen – der OrcaRouter-Katalog verzeichnete in einem Sieben-Tage-Zeitraum rund 1,9 Milliarden Tokens, die darauf geleitet wurden, gegenüber etwa 2,1 Millionen für GPT-6 Sol – was dem Bild entspricht, das ein Open-Weight-Modell mit niedriger Ausgaberate abgibt, wenn Teams Massenarbeit darauf verlagern. Der Traffic von GPT-6 konzentriert sich im selben Zeitraum auf die höheren Stufen, wo es um Arbeiten geht, die den multimodalen Input oder das Premium-Modell erfordern.

Beide sind Live-Routen im selben Katalog auf OrcaRouter: eine API vor über 200 Modellen, aufgerufen über einen OpenAI-kompatiblen Endpunkt, bei dem der Listenpreis des Anbieters mit 0 % Aufschlag durchgereicht wird, sodass eine Preisänderung eines Anbieters noch am selben Tag auf unserer Seite live ist und nicht erst zu Ihrem nächsten Abrechnungszyklus. Das ist in diesem speziellen Vergleich wichtiger als sonst, denn die ganze Frage nach dem Preis von GLM 5.3 hat eine bewegliche Komponente – die Katalogzahl und die Anbieterzahl weichen bereits um etwa 10 % voneinander ab – und eine Durchreich-Route bedeutet, dass Ihnen die Zahl des Anbieters in Rechnung gestellt wird statt eines Aufschlags, der sie verschleiert.

Die Routing-DSL macht die Aufteilung explizit: Schicke den Großteil des rein textbasierten Klassifizierungs- und Extraktionsverkehrs an GLM 5.3 und die multimodale oder Long-Recall-Arbeit an eine GPT-6-Stufe, pro Anfrage statt pro Quartal, und lass automatisches Failover beide Seiten abdecken. Die Open-Weights-vs-API-Frage ist keine architektonische Alles-oder-nichts-Festlegung mehr, sondern wird zu einer Routing-Regel, die du nächste Woche ändern kannst.

Screenshot of the OrcaRouter model page for z-ai/glm-5.3, showing the Z.ai vendor label, a 2026-08-18 catalogue release date, a context of 1M tokens, a 128K maximum output, text-only input, Tools, JSON and Reasoning badges, and a rate strip reading $1.26 per million input tokens, $3.96 per million output tokens, a 4.54 s median time to first token, a 10.00 s p95, and 1,903.6M tokens routed in seven days.

Das Urteil, bei dem es sich um eine Frage zu deinen Einschränkungen handelt

Wenn Sie selbst hosten können, reinen Textdurchsatz im großen Maßstab benötigen oder eine Vorgabe zur Datenresidenz haben, die eine API nicht erfüllen kann, ist GLM 5.3 die Antwort, und die Preisdifferenz ist groß genug, um den Serving-Aufwand zu finanzieren. Wenn Sie Bild- und Dateieingabe benötigen, wenn Long-Context-Recall tragend ist oder wenn Sie keine Lust haben, ein Modell selbst zu betreiben, ist GPT-6 die Antwort, und der Aufpreis erkauft etwas Konkretes, nicht bloß eine Marke.

Was keine der beiden Antworten ist: „GPT-6 erzielt 2,8 Punkte mehr“. Diese Subtraktion ist nicht möglich, weil die beiden Zahlen aus unterschiedlichen Peer-Gruppen auf demselben Board stammen – und ein darauf aufbauender Vergleich würde eine Zahl anführen, als messe sie etwas, das sie nicht misst. Die Tarifkarten sind vergleichbar. Die Lizenzposition ist vergleichbar, in dem Sinne, dass sie sich stark unterscheidet. Die Indexzeilen sind es nicht.

Screenshot of the OrcaRouter model page for openai/gpt-6-sol, showing the OpenAI vendor label, a 2026-09-22 catalogue release date, a 1,050,000-token context window (shown as 1.05M-token context in the model blurb), a 128K maximum output, text, image and file input, and a rate strip reading $2.00 per million input, $10.00 per million output, a 6.79 s median time to first token, a 10.00 s p95, and 2.1M tokens routed in seven days.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert