Eine generierte Hero-Karte für einen Vergleich von GPT-6.1 Sol gegen GLM-5.3, mit der Überschrift „Sieben Indexpunkte, 2,8-mal so viel Geld“, mit Badges mit der Aufschrift „GPT-6.1 Sol: 0,72 $ pro Index-Aufgabe“, „GLM-5.3: 2,01 $ pro Index-Aufgabe“ und „GLM-5.3-Gewichte: herunterladbar seit dem 25. August 2026“, einer Fußzeile mit dem Text „Unabhängige Angaben gemäß Artificial Analysis v4.3.2, maximaler Aufwand; KI-generierte Karte“ und dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

GPT-6.1 Sol vs. GLM-5.3: Die Gewichte wurden ausgeliefert, doch die Rechnung blieb unverändert

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

OpenAI veröffentlichte GPT-6.1 Sol am 29. September 2026 auf seiner DevDay-Keynote, und Z.ai veröffentlichte GLM-5.3 sechs Wochen früher, am 18. August 2026, und hielt den Checkpoint dann eine Woche zurück. Dieses Zurückhalten ist vorbei: zai-org/GLM-5.3 ist seit dem 25. August auf Hugging Face, ein BF16/FP8-Checkpoint mit ungefähr 753 Milliarden Parametern, von denen etwa 40 Milliarden pro Token aktiv sind, und hat seitdem 1,4 Millionen Downloads überschritten. Die Frage, die die meisten Vergleiche seit August gestellt haben – ist das ein offenes Modell oder eine Miete? –, hat eine Antwort, und die Antwort hat die Rechnung nicht verändert. Auf der unabhängigen Rangliste erzielt GPT-6.1 Sol 51,8 Punkte und kostet 0,72 US-Dollar pro abgeschlossener Index-Aufgabe; GLM-5.3 erzielt 44,8 Punkte und kostet 2,01 US-Dollar. Man kann jetzt das pro Token günstigere Modell besitzen und zahlt trotzdem fast dreimal mehr pro erledigter Aufgabe.

Was jedes Modell tatsächlich ist

GPT-6.1 Sol ist OpenAIs GPT-6-Modell der mittleren Leistungsklasse, eine Stufe unter dem Flaggschiff GPT-6 Astra und über dem preisgünstigen GPT-6 Luna. Es bietet ein Kontextfenster von 1.050.000 Token mit einer Obergrenze von 128.000 Token für die Ausgabe sowie einen Wissensstand vom 30. April 2026 und akzeptiert Text, Bilder und Dateien als Eingabe. Das Reasoning reicht von low bis max mit einem Standardwert von medium; die Werte none und minimal, die GPT-6 Sol akzeptierte, führen nun zu einem Fehler, was OpenAIs eigene Migrationsanleitung dadurch auffängt: Sie empfiehlt Entwicklern den Umstieg auf low. Es kostet 2,00 $ pro Million Eingabe-Token und 10,00 $ pro Million Ausgabe-Token, wobei gecachte Eingabe 0,10 $ kostet.

GLM-5.3 ist das aktuelle Flaggschiff von Z.ai für Software-Engineering und langfristig angelegte agentische Arbeit; es basiert auf derselben Mixture-of-Experts-Basis wie GLM-5.2, wobei die Verbesserungen aus dem Post-Training und nicht aus einem größeren Modell stammen. Es ist Text-in, Text-out – keine Vision, zu keinem Preis – mit einem 1-Million-Token-Fenster, einer Ausgabegrenze von 128.000 Token und dauerhaft eingeschaltetem Thinking. Es gibt keinen Nicht-Reasoning-Modus, was für einen latenzempfindlichen Aufruf eine harte Einschränkung ist. Z.ai listet es mit 1,40 $ Eingabe und 4,40 $ Ausgabe pro Million Token, bei gecachtem Input mit 0,26 $; unser eigener Katalog führt es mit 1,26 $ und 3,96 $ bei 0,234 $ für Cache-Reads, sodass die Karte des Anbieters die konservativere Zahl ist und diejenige, von der man ausgehen sollte.

Die Tarifkarte und die Zeile, die sie umkehrt

Eine Zeile pro Dimension, beide Seiten jeweils aktiviert:

• Eingabe — GPT-6.1 Sol 2,00 $ pro 1 Mio. vs. GLM-5.3 1,40 $ pro 1 Mio.; GLM ist 30 % günstiger
• Ausgabe — GPT-6.1 Sol 10,00 $ pro 1 Mio. vs. GLM-5.3 4,40 $ pro 1 Mio.; GLM ist 56 % günstiger
• Zwischengespeicherte Eingabe — GPT-6.1 Sol 0,10 $ pro 1 Mio. vs. GLM-5.3 0,26 $ pro 1 Mio.; die Reihenfolge kehrt sich um, Sol ist 2,6× günstiger
• Langkontext-Klausel — GPT-6.1 Sol berechnet die gesamte Anfrage oberhalb von 272.000 Eingabe-Tokens mit 2× Eingabe und Cache sowie 1,5× Ausgabe neu vs. GLM-5.3 keine entsprechende Klausel auf der veröffentlichten Karte
• Kontext und Ausgabe — 1.050.000 Eingabe / 128.000 Ausgabe vs. 1 Mio. Eingabe / 128.000 Ausgabe; ein Unterschied von 5 %, unerheblich
• Modalität — Text-, Bild- und Dateieingabe, Textausgabe vs. nur Text
• Reasoning-Untergrenze — GPT-6.1 Sol niedrig, mittel (Standard), hoch, xhigh, max vs. GLM-5.3 immer aktiv, keine niedrigere Stufe verfügbar
• Gewichte — geschlossen, nur API vs. offen, herunterladbar, FP8
• Unabhängiger Score, Artificial Analysis v4.3.2 bei maximalem Aufwand — 51,8 vs. 44,8
• Unabhängige Kosten pro Index-Aufgabe — 0,72 $ vs. 2,01 $
• Ausgabe-Tokens für den Index-Lauf — 67 Millionen vs. 210 Millionen

<img src="2.png" alt="Eine generierte zweispaltige Vergleichs-Anzeigetafel mit dem Titel „GPT-6.1 Sol vs. GLM-5.3 – die Anzeigetafel“. Linke Spalte „GPT-6.1 Sol“: Zeilen mit „Intelligenz-Index: 51.8“, „Kosten pro Index-Aufgabe: 0,72 $“, „Eingabepreis: 2,00 $ pro 1 Mio.“, „Ausgabepreis: 10,00 $ pro 1 Mio.“, „Ausgabe-Token beim Index-Durchlauf: 67 Mio.“, „Gewichte: geschlossen“. Rechte Spalte „GLM-5.3“: Zeilen mit „Intelligenz-Index: 44.8“, „Kosten pro Index-Aufgabe: 2,01 $“, „Eingabepreis: 1,40 $ pro 1 Mio.“, „Ausgabepreis: 4,40 $ pro 1 Mio.“, „Ausgabe-Token beim Index-Durchlauf: 210 Mio.“, „Gewichte: offen auf Hugging Face“. Eine Fußzeile lautet: „Unabhängige Zahlen gemäß Artificial Analysis v4.3.2 bei maximalem Aufwand; Listenpreise der Anbieter.“ Das OrcaRouter-Logo befindet sich in der unteren rechten Ecke." /> Genau bei diesem letzten Paar entscheidet sich dieses Duell, und das ist kein subtiler Effekt.

A generated two-column comparison scoreboard titled 'GPT-6.1 Sol vs GLM-5.3 - the scoreboard'. Left column 'GPT-6.1 Sol': rows reading 'Intelligence Index: 51.8', 'Cost per index task: $0.72', 'Input price: $2.00 per 1M', 'Output price: $10.00 per 1M', 'Output tokens on index run: 67M', 'Weights: closed'. Right column 'GLM-5.3': rows reading 'Intelligence Index: 44.8', 'Cost per index task: $2.01', 'Input price: $1.40 per 1M', 'Output price: $4.40 per 1M', 'Output tokens on index run: 210M', 'Weights: open on Hugging Face'. A footer reads 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.' The OrcaRouter logo sits in the bottom-right corner.

Das 210-Millionen-Token-Problem

Artificial Analysis führt dieselbe Suite aus zehn Evaluierungen für jedes Modell auf dem Board aus und veröffentlicht die Token-Zahlen, die hinter jedem Ergebnis stehen. GLM-5.3 generierte beim Abschluss des Durchlaufs ungefähr 210 Millionen Ausgabe-Tokens. GPT-6.1 Sol generierte 67 Millionen. Verglichen mit der jeweiligen Vergleichsklasse jedes Modells auf dem Board liegt GLM-5.3 mit 210 Millionen über einem Klassenmedian von etwa 140 Millionen, während Sol mit 67 Millionen deutlich unter dem Median von ungefähr 81 Millionen der Flaggschiff-Klasse liegt, in der es bewertet wird. Da die Ausgabe die teure Seite jeder Preisliste ist, hält der plakative Rabatt von 56 % auf die Ausgabezeile bei GLM-5.3 dem Kontakt mit der Messung nicht stand: Es gibt 3,1× so viele Tokens zu 0,44× des Preises aus, und 3,1 × 0,44 ist 1,37 — GLM-5.3 ist bei dieser Workload das teurere Modell, trotz einer deutlich günstigeren Preisliste.

Die eigene Kosten-pro-Aufgabe-Zahl des Boards bestätigt die Richtung und die ungefähre Größenordnung. 2,01 $ gegenüber 0,72 $ sind 2,8×, mehr, als das Token-Verhältnis allein impliziert, weil GLM-5.3 pro Aufgabe auch bei den Input- und Cache-Positionen mehr zahlt. Es lohnt sich, genau zu sein, was dies beweist und was nicht: Der Index-Lauf besteht aus zehn festen Evaluierungen, und die Ausführlichkeit bei ihnen ist nicht dasselbe wie die Ausführlichkeit in Ihrem Traffic. Doch für einen Käufer sind Tokens das, was in Rechnung gestellt wird, und die Form des Unterschieds ist bei jedem Aufgabensatz dieselbe, bei dem das Modell eine lange Antwort erzeugen muss.

Der teilweise Ausgleich ist die Position für zwischengespeicherte Eingaben. Der Cache-Lesepreis von GLM-5.3 beträgt 0,26 $ gegenüber einem Basispreis von 1,40 $, und der von GPT-6.1 Sol liegt bei 0,10 $ gegenüber einem Basispreis von 2,00 $ — Sol gewinnt um den Faktor 2,6 bei einem Satz, der jede Workload mit stabilem Präfix dominiert. Wenn Ihr Traffic ein großes festes Korpus mit einer Antwort aus einem Absatz ist, ist GLM-5.3 schlichtweg die günstigere Option, und Sie sollten sie nehmen. Wenn Ihr Traffic wie der Traffic aussieht, für den beide Modelle gebaut wurden — Agenten-Schleifen, Änderungen im Repo-Maßstab, lange generierte Ausgaben —, verblasst der Vorteil zwischengespeicherter Eingaben neben einem 3-fachen Token-Verhältnis zu Rauschen.

Wo die Lieferantennummern landen

Die Startwerte von Z.ai sind stark und, wie immer, nicht reproduziert. Terminal-Bench 2.1 bei 88,2, DeepSWE v1.1 bei 66,9, CyberGym bei 84,5, ExploitBench bei 54,4, AutomationBench bei 48,2, GDPval-AA v2 bei 1769 Elo. Der eine Wert, den man zweimal lesen sollte, ist Terminal-Bench 3.0 bei 28,3 – der Nachfolge-Benchmark und die Korrektur zu den 88,2 beim älteren. Ein Modell kann bei dem Benchmark, auf den sein Post-Training abzielte, exzellent und bei der nächsten Generation desselben Benchmarks nur durchschnittlich sein.

OpenAIs Startzahlen für GPT-6.1 Sol sind vollständig auf die Kosten pro abgeschlossener Aufgabe statt auf die reine Punktzahl ausgerichtet: DeepSWE v1.1 übertrifft GPT-6 Sols Bestwert um 6,4 Prozentpunkte bei geringerem Reasoning-Aufwand, AutomationBench 1.0.6 liegt 2,2 Punkte über Claude Opus 5.5 bei mittlerem Aufwand, OSWorld 2.0 sieben Punkte über GPT-6 Sol bei maximalem Aufwand, Terminal-Bench Science 0.1 mehr als doppelt so hoch wie GPT-6 Sol bei weniger als der Hälfte der Kosten pro Aufgabe. Zu beachten ist, dass es sich hierbei um OpenAIsHarness mit OpenAIsEinstellungen auf OpenAIsausgewähltem Benchmark-Set handelt und dass keiner davon unabhängig reproduziert wurde.

Die Überschneidung zwischen den veröffentlichten Sets der beiden Anbieter ist gering, und der einzige verfügbare direkte Vergleich bezieht sich auf denselben Benchmark: Z.ai meldet 66,9 auf DeepSWE v1.1, OpenAI meldet 68,8 für GPT-6 Sol — das Modell, das 6.1 ersetzt — und eine Verbesserung um 6,4 Punkte für 6.1 Sol gegenüber seinem eigenen Vorgänger. Beim vom Anbieter gemeldeten Vergleich liegen zwei Punkte dazwischen, und bei OpenAIs eigenem Delta sind es rund sechs. Das kommt einem kontrollierten Vergleich nahe und sagt genau das, was das unabhängige Gremium sagt: nahezu Gleichstand bei der Leistungsfähigkeit, eine große Kluft bei dem, was das Erledigen der Aufgabe kostet.

Eine API oder zwei Verträge

Beide Modelle laufen auf OrcaRouter, was der ungewöhnliche Teil dieser Kombination ist. GPT-6.1 Sol ist am Veröffentlichungstag zum eigenen Listenpreis von Open​AI in den Katalog gekommen — 2,00 $ und 10,00 $ pro Million Token, zwischengespeicherte Eingabe 0,10 $, wobei die 272.000-Token-Stufe zu 4,00 $ und 15,00 $ genau so durchgereicht wird, wie der Anbieter sie ausweist — und GLM-5.3 steht daneben mit 1,26 $ und 3,96 $ bei einem Cache-Lesevorgang von 0,234 $. Auf keinen der beiden wird etwas aufgeschlagen: Die Plattform reicht den Listenpreis des Anbieters unverändert durch, weshalb eine Preissenkung des Anbieters bei uns noch am selben Tag sichtbar wird und nicht erst, nachdem ein Wiederverkäufer neu verhandelt hat.

A screenshot of the OrcaRouter model page for z-ai/glm-5.3, showing the listing dated 2026-08-18, the model described as Z.ai (Zhipu AI)'s latest flagship for complex software engineering and long-horizon agentic tasks, a 1M-token context with 128K maximum output, text in and text out, and the pass-through list price of $1.26 input and $3.96 output per million tokens, with the page's own pricing tabs and a 4.00 s median time to first token visible.

Das ist bei genau diesem Paar wichtiger als bei den meisten. Die Entscheidung zwischen ihnen lautet nicht „Welcher ist besser“ — sie ist ein Schwellenwert für die eigene Ausgabelänge, und dieser verschiebt sich, sobald Z.ai seine Preisliste nachschärft oder Open​AI die Stufengrenze des 6.1-Tiers ändert. Beide hinter einem einzigen Schlüssel zu halten, mit automatischem Failover zwischen ihnen und einer Routing-Regel, die in der Konfiguration geändert wird statt in einem Deployment, erlaubt es, diesen Schwellenwert an echtem Traffic zu testen, statt über ihn zu streiten. Wenn Sols Cache-Linie die eigene Workload gewinnt, darauf routen; wenn die Antwortlängen kurz bleiben und die Flatrate von GLM-5.3 ohne Kontext-Klippe das Segment gewinnt, stattdessen darauf routen — derselbe Schlüssel, kein zweiter Vertrag, keine zweite Rechnung.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

Welches, wenn du dich heute entscheiden müsstest

• Lange generierte Ausgaben, agentische Schleifen, ausgabeintensive Arbeit — GPT-6.1 Sol, und der Vorsprung liegt bei fast dem Dreifachen, sobald die Token-Zahlen herangezogen werden. Hier lügt die Preisliste, und die Messung nicht.
• Stabiler Präfix, kurze Antwort — GLM-5.3. Seine Cached-Input- und Input-Raten sind wirklich besser, und die Wortfülle bekommt nie Gelegenheit, sich bemerkbar zu machen.
• Jede Anfrage über 272.000 Input-Tokens — GLM-5.3, denn GPT-6.1 Sol berechnet an dieser Grenze die gesamte Anfrage neu, und die Preisliste von GLM-5.3 kennt keine entsprechende Stufe.
• Alles mit einem Bild oder einem Dokument als visuellen Input — GPT-6.1 Sol. GLM-5.3 ist reiner Text, und das ist nicht knapp.
• Inferenz innerhalb der eigenen Grenzen oder eine Absicherung dagegen, dass ein Anbieter seine Bedingungen ändert — GLM-5.3, und der Download existiert jetzt, statt nur versprochen zu sein. Planen Sie das Budget für die Hardware ein: Der Checkpoint ist ein großes FP8-Artefakt, und Self-Hosting ist eine Kapitalentscheidung, keine API-Entscheidung.
• Latenzempfindliche Aufrufe — keiner von beiden ohne Vorsicht. GLM-5.3 hat keine Möglichkeit, das Reasoning abzuschalten; GPT-6.1 Sol hat einen Mindestwert bei low, und seine eigene Time-to-First-Token lag auf dem unabhängigen Board bei 332 Sekunden gegenüber einem Board-Median von 3,7.

In diesem Artikel verglichen3

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert