
LongCat-2.5-Preview vs. GLM-5.2: Zwei 1M-Token-Fenster, eines davon gemessen
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 610 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 189 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
LongCat-2.5-Preview und GLM-5.2 tragen dieselbe Schlagzeilen-Kennzahl: ein Kontextfenster von einer Million Token. Diese einzige Übereinstimmung leistet die ganze Arbeit in den meisten Vergleichen, die diese Woche geschrieben werden, und sie reicht nicht aus, um zwei Modelle darauf zu vergleichen. Für GLM-5.2 liegen seit dem 16. Juni 2026 ein öffentliches Benchmark-Profil, eine veröffentlichte Preisliste und ein Long-Context-Recall-Score eines unabhängigen Evaluators vor. LongCat-2.5-Preview erschien am 25. September 2026 auf Meituans LongCat API Platform mit einer rabattierten Preisliste, einer von chinesischer Fachpresse gemeldeten Parameterzahl und keinerlei veröffentlichtem Benchmark. Ein Fenster ist gemessen. Das andere ist behauptet. Alles Folgende hält diese beiden Kategorien auseinander, denn ein Datenblatt und ein Testergebnis sind nicht dieselbe Art von Tatsache.
Dies ist die ehrliche Version des Vergleichs, und sie ist nützlicher als die schmeichelhafte.
Was jede Seite tatsächlich veröffentlicht hat
Meituans Changelog enthält einen datierten Eintrag – „Version: 2026-09-25, LongCat-2.5-Preview jetzt verfügbar“ –, der drei beanspruchte Fähigkeiten auflistet: Bildverständnis, Coding und Kompatibilität mit „Claude Code und anderen gängigen Entwicklungsumgebungen“, wobei Hermes, OpenClaw, OpenCode und Kilo Code genannt werden. Die Preisseite des Anbieters nennt einen Pay-as-you-go-Tarif von 0,30 $ pro Million ungecachter Eingabe-Token, 0,006 $ pro Million gecachter Eingabe-Token und 1,20 $ pro Million Ausgabe-Token, der auf der Seite selbst als zeitlich begrenzter Rabatt gekennzeichnet ist. Das Kontextfenster umfasst eine Million Token und die maximale Ausgabe beträgt 131.072. Etwa 1,6 Billionen Gesamtparameter bei rund 48 Milliarden aktiven Parametern pro Token auf einem Mixture-of-Experts-Backbone stammen aus Meituans eigenen Website-Metadaten und aus chinesischer Fachberichterstattung über das Listing – nicht aus der API-Dokumentation. Kein technischer Bericht, keine Modellkarte und keine Benchmark-Tabelle begleiteten irgendetwas davon. Es gibt kein Repository für LongCat-2.5-Preview auf HuggingFace und kein Repository mit diesem Namen in Meituans GitHub-Organisation; die Modellkatalog-Metadaten, die mit OpenCode ausgeliefert werden, verzeichnen Open Weights als false.

GLM-5.2 von Z.ai nimmt die entgegengesetzte Position ein. Es ist eine Juni-Veröffentlichung mit einer Preisliste, die wir zu Listenpreisen anbieten: 1,40 US-Dollar pro Million Eingabe-Token, 0,26 US-Dollar pro Million gecachter Eingabe-Token und 4,40 US-Dollar pro Million Ausgabe-Token in unserem Katalog, mit einem Kontextfenster von 1.000.000 Token und einer maximalen Ausgabe von 128.000 Token. Seine veröffentlichten Werte stammen aus zwei verschiedenen Quellen, und die Unterscheidung ist wichtig: Die eigenen Zahlen von Z.ai für AIME 2026, HMMT Februar 2026, GPQA-Diamond und die FrontierSWE-Suite sind vom Anbieter gemeldet; die Coding-Index- und Intelligence-Index-Werte, die unser Katalog führt, stammen von Artificial Analysis, die ihre eigenen Evaluierungen durchführt.
Die eine Dimension, in der sie wirklich gleich sind
Beide Modelle beanspruchen genau 1.000.000 Token Kontext. Nur für eines von ihnen gibt es einen veröffentlichten Wert, der prüft, ob ein Modell noch nutzen kann, was darin steht. Artificial Analysis verzeichnet für GLM-5.2 einen Long-Context-Recall-Wert von 78,33. Für LongCat-2.5-Preview gibt es von niemandem eine entsprechende Zahl. Diese Asymmetrie ist das ganze Duell in einer Zeile: Ein Fenster von einer Million Token ist eine Aussage über die Kapazität der Architektur, nicht darüber, ob das Modell bei Token 900.000 korrekt abruft. Kapazität lässt sich billig drucken und teuer verifizieren, weshalb jeder Anbieter sie druckt und fast keiner von ihnen den Recall-Test veröffentlicht.
Wenn Sie sich also zwischen diesen beiden für Long-Context-Arbeit entscheiden, entscheiden Sie sich zwischen einer Option mit einem veröffentlichten Recall-Score und einer ohne – und die ohne ist zugleich die mit dem ungemessenen Benchmark-Profil. Das ist kein Argument gegen sie. Es ist ein Argument dagegen, die beiden aufgrund einer übereinstimmenden Ganzzahl als austauschbar zu behandeln.

Wie die Preisdifferenz bei einem echten Auftrag aussieht
Die Preistabellen liegen nicht nah beieinander, und die Richtung ist nicht die, die man von einem chinesischen Open-Weights-Herausforderer gegen ein westliches Frontier-Labor erwartet. LongCat-2.5-Preview ist bei ungecachtem Input etwa 4,7-mal günstiger und beim Output 3,7-mal günstiger als GLM-5.2 – ein Verhältnis, das schlicht Arithmetik auf den beiden veröffentlichten Tabellen ist, keine Messung. Bei einem Durchlauf zur Dokumentverarbeitung mit 500.000 Tokens, der 20.000 Tokens zurückschreibt, sind das etwa 17 Cent gegenüber etwa 79 Cent. Beide Modelle müssen dasselbe Dokument lesen. Nur eines von ihnen hat einen veröffentlichten Wert dafür, ob es am Ende noch aufmerksam sein wird.
Es gibt einen zweiten Vorbehalt, der im selben Atemzug genannt werden muss: Meituan bezeichnet seine eigene Preisliste als zeitlich begrenzten Rabatt. Der Betrag von 0,30 US-Dollar ist der Aktionspreis, und der Anbieter sagt nicht, was danach kommt. Ein auf einem Aktionspreis aufgebautes Kostenmodell hat ein Ablaufdatum, das sich nicht ablesen lässt. Das ist ein Grund, den Wechsel zwischen Anbietern günstig zu halten, statt ein Grund, das Modell zu vermeiden.
Bei OrcaRouter liegen die Routen, die wir anbieten, hinter einem einzigen Schlüssel zum Listenpreis des Anbieters, mit null Aufschlag, sodass eine Preisänderung eines Anbieters noch am selben Tag auf Ihrer Rechnung ankommt statt erst bei der nächsten Verlängerung, und automatisches Failover eine beeinträchtigte Anfrage an einen gesunden Anbieter weiterleitet, ohne dass Ihre Anwendung davon erfährt. GLM-5.2 ist eine unserer Routen. LongCat-2.5-Preview nicht – wir bieten es nicht an, und nichts hier sollte so verstanden werden, als würde etwas anderes behauptet. Z.ai hat sich seit Juni ebenfalls weiterentwickelt: GLM-5.3 ist seit dem 18. August 2026 in unserem Katalog live, ein Vergleich im Sinne von „neues Modell versus aktuelles Modell" rahmt GLM-5.2 also bereits als Platzhalter statt als Frontier ein.

Was würde das klären, und was nicht
• Ein Long-Context-Recall-Score für LongCat-2.5-Preview, von Meituan oder von einem unabhängigen Evaluator. Solange es den nicht gibt, ist sein 1M-Fenster eine Behauptung, an die kein Test geknüpft ist, und die 78,33 von GLM-5.2 ist die einzige Zahl im Vergleich, die sich auf dieselbe Frage bezieht.
• Eine Anbieter-Preisliste ohne die Kennzeichnung „zeitlich begrenzt". Der rabattierte Preis sagt Ihnen, was das Modell während einer Aktion kostet – nicht, was es kostet.
• Eine Benchmark-Tabelle jeglicher Art. Keine Leaderboard-Position — nur ein veröffentlichter Evaluierungsdurchlauf, damit der Vergleich aufhört, ein Datenblatt gegen eine Ergebnisseite zu sein.
• Eine Bestätigung der Bildeingabe. Das Changelog führt Bildverständnis als eine Hauptneuerung auf, doch zeigt die Beispielantwort in Meituans eigener „Retrieve Model“-Dokumentation nach wie vor input_modalities als ["text"] mit einem text->text Modalitäts-String. Dieses Beispiel mag schlicht veraltet sein. Es ist nichtsdestoweniger der veröffentlichte Vertrag des Anbieters – behandle Bildeingabe also als behauptet, nicht als verfügbar. GLM-5.2 dagegen ist in unserem Katalog Text-in und Text-out, ganz ohne Bildmodalität – in dieser Hinsicht liefert Ihnen also keines der beiden Modelle eine verifizierte Antwort, und eines von ihnen liefert Ihnen eine Behauptung.
• Ihre eigenen Zahlen. Die Lücke zwischen dem, was veröffentlicht wird, und dem, was Sie brauchen, wird dadurch geschlossen, dass Sie beide Modelle auf Ihren Aufgaben laufen lassen, und das kostenlose Zeitfenster bei LongCat-2.5-Preview macht das gerade jetzt günstig. Ein Reasoning-Trace, der in einem verschachtelten reasoning_content-Feld ankommt, ist das Harness-Detail, das Sie zuerst prüfen sollten, denn Tooling, das ihn stillschweigend verwirft, verliert den größten Teil des Nutzens des Modells, ohne einen Fehler zu melden.
Wo der Vergleich damit steht
Wenn Sie heute eine Entscheidung treffen müssen und dabei langer Kontext eine Rolle spielt, ist GLM-5.2 dasjenige, das Sie tatsächlich bewerten können: Es hat veröffentlichte Recall-Werte, einen unabhängigen Coding-Score von 68,8 und einen Intelligence Index von 33,7 von Artificial Analysis sowie einen Preis, mit dem Sie planen können. Diese Zahlen beschreiben ein Modell, das eher kompetent als führend ist — Z.ais eigener Nachfolger, GLM-5.3, erzielt höhere Werte —, aber sie beschreiben etwas. LongCat-2.5-Preview ist ein günstigeres, kontextreicheres, vollständig unvermessenes Angebot, dessen attraktivste Eigenschaft, sein Preis, ausdrücklich vorübergehend ist. Die richtige Haltung ihm gegenüber ist nicht Skepsis. Sie ist eine zweiwöchige Evaluierung mit Ihrem eigenen Bewertungs-Harness, durchgeführt, bevor der Aktionspreis verschwindet.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
