
GPT-6.1 Sol vs. GLM-5.3: Die Gewichte wurden ausgeliefert, doch die Rechnung blieb unverändert
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
OpenAI veröffentlichte GPT-6.1 Sol am 29. September 2026 auf seiner DevDay-Keynote, und Z.ai veröffentlichte GLM-5.3 sechs Wochen früher, am 18. August 2026, und hielt den Checkpoint dann eine Woche zurück. Dieses Zurückhalten ist vorbei: zai-org/GLM-5.3 ist seit dem 25. August auf Hugging Face, ein BF16/FP8-Checkpoint mit ungefähr 753 Milliarden Parametern, von denen etwa 40 Milliarden pro Token aktiv sind, und hat seitdem 1,4 Millionen Downloads überschritten. Die Frage, die die meisten Vergleiche seit August gestellt haben – ist das ein offenes Modell oder eine Miete? –, hat eine Antwort, und die Antwort hat die Rechnung nicht verändert. Auf der unabhängigen Rangliste erzielt GPT-6.1 Sol 51,8 Punkte und kostet 0,72 US-Dollar pro abgeschlossener Index-Aufgabe; GLM-5.3 erzielt 44,8 Punkte und kostet 2,01 US-Dollar. Man kann jetzt das pro Token günstigere Modell besitzen und zahlt trotzdem fast dreimal mehr pro erledigter Aufgabe.
Was jedes Modell tatsächlich ist
GPT-6.1 Sol ist OpenAIs GPT-6-Modell der mittleren Leistungsklasse, eine Stufe unter dem Flaggschiff GPT-6 Astra und über dem preisgünstigen GPT-6 Luna. Es bietet ein Kontextfenster von 1.050.000 Token mit einer Obergrenze von 128.000 Token für die Ausgabe sowie einen Wissensstand vom 30. April 2026 und akzeptiert Text, Bilder und Dateien als Eingabe. Das Reasoning reicht von low bis max mit einem Standardwert von medium; die Werte none und minimal, die GPT-6 Sol akzeptierte, führen nun zu einem Fehler, was OpenAIs eigene Migrationsanleitung dadurch auffängt: Sie empfiehlt Entwicklern den Umstieg auf low. Es kostet 2,00 $ pro Million Eingabe-Token und 10,00 $ pro Million Ausgabe-Token, wobei gecachte Eingabe 0,10 $ kostet.
GLM-5.3 ist das aktuelle Flaggschiff von Z.ai für Software-Engineering und langfristig angelegte agentische Arbeit; es basiert auf derselben Mixture-of-Experts-Basis wie GLM-5.2, wobei die Verbesserungen aus dem Post-Training und nicht aus einem größeren Modell stammen. Es ist Text-in, Text-out – keine Vision, zu keinem Preis – mit einem 1-Million-Token-Fenster, einer Ausgabegrenze von 128.000 Token und dauerhaft eingeschaltetem Thinking. Es gibt keinen Nicht-Reasoning-Modus, was für einen latenzempfindlichen Aufruf eine harte Einschränkung ist. Z.ai listet es mit 1,40 $ Eingabe und 4,40 $ Ausgabe pro Million Token, bei gecachtem Input mit 0,26 $; unser eigener Katalog führt es mit 1,26 $ und 3,96 $ bei 0,234 $ für Cache-Reads, sodass die Karte des Anbieters die konservativere Zahl ist und diejenige, von der man ausgehen sollte.
Die Tarifkarte und die Zeile, die sie umkehrt
Eine Zeile pro Dimension, beide Seiten jeweils aktiviert:
• Eingabe — GPT-6.1 Sol 2,00 $ pro 1 Mio. vs. GLM-5.3 1,40 $ pro 1 Mio.; GLM ist 30 % günstiger
• Ausgabe — GPT-6.1 Sol 10,00 $ pro 1 Mio. vs. GLM-5.3 4,40 $ pro 1 Mio.; GLM ist 56 % günstiger
• Zwischengespeicherte Eingabe — GPT-6.1 Sol 0,10 $ pro 1 Mio. vs. GLM-5.3 0,26 $ pro 1 Mio.; die Reihenfolge kehrt sich um, Sol ist 2,6× günstiger
• Langkontext-Klausel — GPT-6.1 Sol berechnet die gesamte Anfrage oberhalb von 272.000 Eingabe-Tokens mit 2× Eingabe und Cache sowie 1,5× Ausgabe neu vs. GLM-5.3 keine entsprechende Klausel auf der veröffentlichten Karte
• Kontext und Ausgabe — 1.050.000 Eingabe / 128.000 Ausgabe vs. 1 Mio. Eingabe / 128.000 Ausgabe; ein Unterschied von 5 %, unerheblich
• Modalität — Text-, Bild- und Dateieingabe, Textausgabe vs. nur Text
• Reasoning-Untergrenze — GPT-6.1 Sol niedrig, mittel (Standard), hoch, xhigh, max vs. GLM-5.3 immer aktiv, keine niedrigere Stufe verfügbar
• Gewichte — geschlossen, nur API vs. offen, herunterladbar, FP8
• Unabhängiger Score, Artificial Analysis v4.3.2 bei maximalem Aufwand — 51,8 vs. 44,8
• Unabhängige Kosten pro Index-Aufgabe — 0,72 $ vs. 2,01 $
• Ausgabe-Tokens für den Index-Lauf — 67 Millionen vs. 210 Millionen
<img src="2.png" alt="Eine generierte zweispaltige Vergleichs-Anzeigetafel mit dem Titel „GPT-6.1 Sol vs. GLM-5.3 – die Anzeigetafel“. Linke Spalte „GPT-6.1 Sol“: Zeilen mit „Intelligenz-Index: 51.8“, „Kosten pro Index-Aufgabe: 0,72 $“, „Eingabepreis: 2,00 $ pro 1 Mio.“, „Ausgabepreis: 10,00 $ pro 1 Mio.“, „Ausgabe-Token beim Index-Durchlauf: 67 Mio.“, „Gewichte: geschlossen“. Rechte Spalte „GLM-5.3“: Zeilen mit „Intelligenz-Index: 44.8“, „Kosten pro Index-Aufgabe: 2,01 $“, „Eingabepreis: 1,40 $ pro 1 Mio.“, „Ausgabepreis: 4,40 $ pro 1 Mio.“, „Ausgabe-Token beim Index-Durchlauf: 210 Mio.“, „Gewichte: offen auf Hugging Face“. Eine Fußzeile lautet: „Unabhängige Zahlen gemäß Artificial Analysis v4.3.2 bei maximalem Aufwand; Listenpreise der Anbieter.“ Das OrcaRouter-Logo befindet sich in der unteren rechten Ecke." /> Genau bei diesem letzten Paar entscheidet sich dieses Duell, und das ist kein subtiler Effekt.

Das 210-Millionen-Token-Problem
Artificial Analysis führt dieselbe Suite aus zehn Evaluierungen für jedes Modell auf dem Board aus und veröffentlicht die Token-Zahlen, die hinter jedem Ergebnis stehen. GLM-5.3 generierte beim Abschluss des Durchlaufs ungefähr 210 Millionen Ausgabe-Tokens. GPT-6.1 Sol generierte 67 Millionen. Verglichen mit der jeweiligen Vergleichsklasse jedes Modells auf dem Board liegt GLM-5.3 mit 210 Millionen über einem Klassenmedian von etwa 140 Millionen, während Sol mit 67 Millionen deutlich unter dem Median von ungefähr 81 Millionen der Flaggschiff-Klasse liegt, in der es bewertet wird. Da die Ausgabe die teure Seite jeder Preisliste ist, hält der plakative Rabatt von 56 % auf die Ausgabezeile bei GLM-5.3 dem Kontakt mit der Messung nicht stand: Es gibt 3,1× so viele Tokens zu 0,44× des Preises aus, und 3,1 × 0,44 ist 1,37 — GLM-5.3 ist bei dieser Workload das teurere Modell, trotz einer deutlich günstigeren Preisliste.
Die eigene Kosten-pro-Aufgabe-Zahl des Boards bestätigt die Richtung und die ungefähre Größenordnung. 2,01 $ gegenüber 0,72 $ sind 2,8×, mehr, als das Token-Verhältnis allein impliziert, weil GLM-5.3 pro Aufgabe auch bei den Input- und Cache-Positionen mehr zahlt. Es lohnt sich, genau zu sein, was dies beweist und was nicht: Der Index-Lauf besteht aus zehn festen Evaluierungen, und die Ausführlichkeit bei ihnen ist nicht dasselbe wie die Ausführlichkeit in Ihrem Traffic. Doch für einen Käufer sind Tokens das, was in Rechnung gestellt wird, und die Form des Unterschieds ist bei jedem Aufgabensatz dieselbe, bei dem das Modell eine lange Antwort erzeugen muss.
Der teilweise Ausgleich ist die Position für zwischengespeicherte Eingaben. Der Cache-Lesepreis von GLM-5.3 beträgt 0,26 $ gegenüber einem Basispreis von 1,40 $, und der von GPT-6.1 Sol liegt bei 0,10 $ gegenüber einem Basispreis von 2,00 $ — Sol gewinnt um den Faktor 2,6 bei einem Satz, der jede Workload mit stabilem Präfix dominiert. Wenn Ihr Traffic ein großes festes Korpus mit einer Antwort aus einem Absatz ist, ist GLM-5.3 schlichtweg die günstigere Option, und Sie sollten sie nehmen. Wenn Ihr Traffic wie der Traffic aussieht, für den beide Modelle gebaut wurden — Agenten-Schleifen, Änderungen im Repo-Maßstab, lange generierte Ausgaben —, verblasst der Vorteil zwischengespeicherter Eingaben neben einem 3-fachen Token-Verhältnis zu Rauschen.
Wo die Lieferantennummern landen
Die Startwerte von Z.ai sind stark und, wie immer, nicht reproduziert. Terminal-Bench 2.1 bei 88,2, DeepSWE v1.1 bei 66,9, CyberGym bei 84,5, ExploitBench bei 54,4, AutomationBench bei 48,2, GDPval-AA v2 bei 1769 Elo. Der eine Wert, den man zweimal lesen sollte, ist Terminal-Bench 3.0 bei 28,3 – der Nachfolge-Benchmark und die Korrektur zu den 88,2 beim älteren. Ein Modell kann bei dem Benchmark, auf den sein Post-Training abzielte, exzellent und bei der nächsten Generation desselben Benchmarks nur durchschnittlich sein.
OpenAIs Startzahlen für GPT-6.1 Sol sind vollständig auf die Kosten pro abgeschlossener Aufgabe statt auf die reine Punktzahl ausgerichtet: DeepSWE v1.1 übertrifft GPT-6 Sols Bestwert um 6,4 Prozentpunkte bei geringerem Reasoning-Aufwand, AutomationBench 1.0.6 liegt 2,2 Punkte über Claude Opus 5.5 bei mittlerem Aufwand, OSWorld 2.0 sieben Punkte über GPT-6 Sol bei maximalem Aufwand, Terminal-Bench Science 0.1 mehr als doppelt so hoch wie GPT-6 Sol bei weniger als der Hälfte der Kosten pro Aufgabe. Zu beachten ist, dass es sich hierbei um OpenAIsHarness mit OpenAIsEinstellungen auf OpenAIsausgewähltem Benchmark-Set handelt und dass keiner davon unabhängig reproduziert wurde.
Die Überschneidung zwischen den veröffentlichten Sets der beiden Anbieter ist gering, und der einzige verfügbare direkte Vergleich bezieht sich auf denselben Benchmark: Z.ai meldet 66,9 auf DeepSWE v1.1, OpenAI meldet 68,8 für GPT-6 Sol — das Modell, das 6.1 ersetzt — und eine Verbesserung um 6,4 Punkte für 6.1 Sol gegenüber seinem eigenen Vorgänger. Beim vom Anbieter gemeldeten Vergleich liegen zwei Punkte dazwischen, und bei OpenAIs eigenem Delta sind es rund sechs. Das kommt einem kontrollierten Vergleich nahe und sagt genau das, was das unabhängige Gremium sagt: nahezu Gleichstand bei der Leistungsfähigkeit, eine große Kluft bei dem, was das Erledigen der Aufgabe kostet.
Eine API oder zwei Verträge
Beide Modelle laufen auf OrcaRouter, was der ungewöhnliche Teil dieser Kombination ist. GPT-6.1 Sol ist am Veröffentlichungstag zum eigenen Listenpreis von OpenAI in den Katalog gekommen — 2,00 $ und 10,00 $ pro Million Token, zwischengespeicherte Eingabe 0,10 $, wobei die 272.000-Token-Stufe zu 4,00 $ und 15,00 $ genau so durchgereicht wird, wie der Anbieter sie ausweist — und GLM-5.3 steht daneben mit 1,26 $ und 3,96 $ bei einem Cache-Lesevorgang von 0,234 $. Auf keinen der beiden wird etwas aufgeschlagen: Die Plattform reicht den Listenpreis des Anbieters unverändert durch, weshalb eine Preissenkung des Anbieters bei uns noch am selben Tag sichtbar wird und nicht erst, nachdem ein Wiederverkäufer neu verhandelt hat.

Das ist bei genau diesem Paar wichtiger als bei den meisten. Die Entscheidung zwischen ihnen lautet nicht „Welcher ist besser“ — sie ist ein Schwellenwert für die eigene Ausgabelänge, und dieser verschiebt sich, sobald Z.ai seine Preisliste nachschärft oder OpenAI die Stufengrenze des 6.1-Tiers ändert. Beide hinter einem einzigen Schlüssel zu halten, mit automatischem Failover zwischen ihnen und einer Routing-Regel, die in der Konfiguration geändert wird statt in einem Deployment, erlaubt es, diesen Schwellenwert an echtem Traffic zu testen, statt über ihn zu streiten. Wenn Sols Cache-Linie die eigene Workload gewinnt, darauf routen; wenn die Antwortlängen kurz bleiben und die Flatrate von GLM-5.3 ohne Kontext-Klippe das Segment gewinnt, stattdessen darauf routen — derselbe Schlüssel, kein zweiter Vertrag, keine zweite Rechnung.

Welches, wenn du dich heute entscheiden müsstest
• Lange generierte Ausgaben, agentische Schleifen, ausgabeintensive Arbeit — GPT-6.1 Sol, und der Vorsprung liegt bei fast dem Dreifachen, sobald die Token-Zahlen herangezogen werden. Hier lügt die Preisliste, und die Messung nicht.
• Stabiler Präfix, kurze Antwort — GLM-5.3. Seine Cached-Input- und Input-Raten sind wirklich besser, und die Wortfülle bekommt nie Gelegenheit, sich bemerkbar zu machen.
• Jede Anfrage über 272.000 Input-Tokens — GLM-5.3, denn GPT-6.1 Sol berechnet an dieser Grenze die gesamte Anfrage neu, und die Preisliste von GLM-5.3 kennt keine entsprechende Stufe.
• Alles mit einem Bild oder einem Dokument als visuellen Input — GPT-6.1 Sol. GLM-5.3 ist reiner Text, und das ist nicht knapp.
• Inferenz innerhalb der eigenen Grenzen oder eine Absicherung dagegen, dass ein Anbieter seine Bedingungen ändert — GLM-5.3, und der Download existiert jetzt, statt nur versprochen zu sein. Planen Sie das Budget für die Hardware ein: Der Checkpoint ist ein großes FP8-Artefakt, und Self-Hosting ist eine Kapitalentscheidung, keine API-Entscheidung.
• Latenzempfindliche Aufrufe — keiner von beiden ohne Vorsicht. GLM-5.3 hat keine Möglichkeit, das Reasoning abzuschalten; GPT-6.1 Sol hat einen Mindestwert bei low, und seine eigene Time-to-First-Token lag auf dem unabhängigen Board bei 332 Sekunden gegenüber einem Board-Median von 3,7.
In diesem Artikel verglichen3
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
