Een gegenereerde hero-titelkaart met de tekst 'LongCat-2.5-Preview vs GLM-5.2', met daarboven de overline 'Hetzelfde 1M-venster, slechts één van beide gemeten', en twee panelen: 'LongCat-2.5-Preview: 1M context, $0.30 / $1.20 per 1M, geen benchmark gepubliceerd' en 'GLM-5.2: 1M context, AA Long-Context Recall 78.33'. OrcaRouter-logo rechtsonder.
Guides & Insights

LongCat-2.5-Preview vs GLM-5.2: twee vensters van 1M tokens, waarvan er één is gemeten

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

LongCat-2.5-Preview en GLM-5.2 dragen hetzelfde opvallende getal: een contextvenster van één miljoen tokens. Dat ene toeval doet al het werk in de meeste vergelijkingen die deze week worden geschreven, en het is niet genoeg om twee modellen op te vergelijken. GLM-5.2 staat sinds 16 juni 2026 officieel te boek met een openbaar benchmarkprofiel, een gepubliceerde prijslijst en een score voor long-context recall van een onafhankelijke evaluator. LongCat-2.5-Preview verscheen op 25 september 2026 op Meituan's LongCat API Platform met een verlaagde prijslijst, een parameteraantal dat door de Chinese vakpers wordt genoemd, en geen enkele gepubliceerde benchmark. Het ene venster is gemeten. Het andere wordt slechts beweerd. Alles hieronder houdt die twee categorieën uit elkaar, want een specificatieblad en een testresultaat zijn niet hetzelfde soort feit.

Dit is de eerlijke versie van de confrontatie, en die is nuttiger dan de vleiende.

Wat elke partij daadwerkelijk heeft gepubliceerd

De changelog van Meituan bevat een gedateerde vermelding — "Versie: 2026-09-25, LongCat-2.5-Preview Nu beschikbaar" — waarin drie geclaimde mogelijkheden worden opgesomd: beeldbegrip, coderen en compatibiliteit met "Claude Code en andere gangbare ontwikkelomgevingen", waarbij Hermes, OpenClaw, OpenCode en Kilo Code worden genoemd. De prijspagina van de leverancier vermeldt een pay-as-you-go-tarief van $0,30 per miljoen niet-gecachte invoertokens, $0,006 per miljoen gecachte invoertokens en $1,20 per miljoen uitvoertokens, op de pagina zelf aangeduid als een tijdelijke korting. Het contextvenster is een miljoen tokens en de maximale uitvoer is 131.072. Ruwweg 1,6 biljoen totale parameters met ongeveer 48 miljard actieve per token, op een mixture-of-experts-backbone, is afkomstig van de eigen sitemetadata van Meituan en van Chinese vakpersverslaggeving over de vermelding — niet uit de API-documentatie. Er ging geen technisch rapport, geen modelkaart en geen benchmarktabel mee. Er is geen LongCat-2.5-Preview-repository op HuggingFace en geen repository met die naam in de GitHub-organisatie van Meituan; de modelcatalogusmetadata die met OpenCode wordt meegeleverd, registreert open weights als false.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

Z.ai's GLM-5.2 bevindt zich in de tegenovergestelde positie. Het is een release uit juni met een tariefkaart die wij tegen listprijs aanbieden: $1,40 per miljoen inputtokens, $0,26 per miljoen gecachte inputtokens en $4,40 per miljoen outputtokens in onze catalogus, met een contextvenster van 1.000.000 tokens en een maximale output van 128.000 tokens. De gepubliceerde scores komen uit twee verschillende bronnen, en dat onderscheid is belangrijk: Z.ai's eigen cijfers voor AIME 2026, HMMT februari 2026, GPQA-Diamond en de FrontierSWE-suite zijn door de leverancier gerapporteerd; de cijfers voor de Coding Index en Intelligence Index die onze catalogus bevat, zijn afkomstig van Artificial Analysis, dat zijn eigen evaluaties uitvoert.

De enige dimensie waarin ze werkelijk gelijk zijn

Beide modellen claimen precies 1.000.000 tokens context. Slechts één van hen heeft een gepubliceerde score die test of een model nog kan gebruiken wat erin zit. Artificial Analysis noteert een Long-Context Recall-score van 78,33 voor GLM-5.2. Voor LongCat-2.5-Preview bestaat er van niemand een equivalent cijfer. Die asymmetrie is de hele vergelijking in één regel: een venster van één miljoen tokens is een uitspraak over de capaciteit van de architectuur, niet over de vraag of het model bij token 900.000 correct terugvindt. Capaciteit is goedkoop om te vermelden en duur om te verifiëren, daarom vermeldt elke leverancier het en publiceert bijna geen van hen de recalltest.

Dus als werk met een lange context is waarvoor je tussen deze twee kiest, dan kies je tussen één optie met een gepubliceerde recallscore en één zonder — en degene zonder is ook degene met het ongemeten benchmarkprofiel. Dat is geen argument ertegen. Het is een argument ertegen om de twee als uitwisselbaar te beschouwen op grond van een overeenkomend geheel getal.

A screenshot of OrcaRouter's own model page for Z.ai GLM-5.2 at /models/z-ai/glm-5.2, showing the z-ai/glm-5.2 identifier, a 1M-token context window, 128K maximum output, text input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-06-16, a p50 first-token figure of 5.13 s, $1.40 and $4.40 rate tiles, and the OpenAI-compatible code samples.

Hoe het prijsverschil eruitziet bij een echte klus

De tariefkaarten liggen ver uit elkaar, en de richting is niet wat men verwacht van een Chinese open-weights-uitdager tegen een westers frontierlab. LongCat-2.5-Preview is ongeveer 4,7 keer goedkoper voor niet-gecachte input en 3,7 keer goedkoper voor output dan GLM-5.2 — een verhouding die rekenkundig volgt uit de twee gepubliceerde tariefkaarten, niet uit een meting. Bij een documentverwerkingsronde van 500.000 tokens die 20.000 tokens terugschrijft, is dat ongeveer 17 cent tegenover ongeveer 79 cent. Beide modellen moeten hetzelfde document lezen. Slechts één van hen heeft een gepubliceerde score voor de vraag of het aan het einde ervan nog aandacht zal hebben.

Er is een tweede voorbehoud dat in één adem genoemd moet worden: Meituan bestempelt zijn eigen tariefkaart als een tijdelijke korting. Het bedrag van $0,30 is het promotiecijfer, en de leverancier zegt niet wat daarna komt. Een kostenmodel dat op een promotieprijs is gebouwd, heeft een vervaldatum die je niet kunt lezen. Dat is een reden om de migratie tussen aanbieders goedkoop te houden, niet een reden om het model te vermijden.

Op OrcaRouter zitten de routes die wij aanbieden achter één sleutel tegen de lijstprijs van de provider met nul markup, zodat een prijswijziging van een leverancier dezelfde dag op uw factuur terechtkomt in plaats van bij de volgende verlenging, en automatische failover verplaatst een gedegradeerd verzoek naar een gezonde provider zonder dat uw applicatie het merkt. GLM-5.2 is een van onze routes. LongCat-2.5-Preview is dat niet — wij bieden het niet aan, en niets hier mag worden gelezen als een bewering van het tegendeel. Z.ai is sinds juni ook verder gegaan: GLM-5.3 staat sinds 18 augustus 2026 live in onze catalogus, dus een vergelijking die is geformuleerd als "nieuw model versus huidig model" positioneert GLM-5.2 al als de gevestigde partij in plaats van de frontier.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs GLM-5.2' with the subhead 'Six dimensions, and which side of each one has evidence behind it'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, no repo and catalogue open_weights false. Right column 'GLM-5.2' (Z.ai, released 2026-06-16, independently scored): 1,000,000-token context, 128,000 max output, text to text only, $1.40 / $0.26 input, $4.40 output, coding index 68.8 at rank 30, long-context recall 78.33. Footnote credits OrcaRouter's catalogue and Artificial Analysis for the right column and notes LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Wat dit zou oplossen, en wat niet

• Een Long-Context Recall-score voor LongCat-2.5-Preview, van Meituan of van een onafhankelijke evaluator. Zolang die niet bestaat, is het 1M-venster een bewering zonder bijbehorende test, en is de 78,33 van GLM-5.2 het enige getal in de vergelijking dat op dezelfde vraag ingaat.

• Een tariefkaart van een leverancier zonder de markering 'beperkte tijd'. De kortingsprijs vertelt je wat het model tijdens een promotie kost, niet wat het kost.

• Een benchmarktabel van welke aard dan ook. Geen ranglijstpositie — slechts een gepubliceerde evaluatierun, zodat de vergelijking ophoudt een specificatieblad tegenover een resultatenpagina te zijn.

• Een bevestiging van beeldinvoer. De changelog presenteert beeldbegrip als een hoofdpunt, maar het voorbeeldantwoord in Meituan's eigen "Retrieve Model"-documentatie toont nog steeds input_modalities als ["text"] met een text->text modaliteitsstring. Dat voorbeeld is misschien gewoon verouderd. Het is niettemin het gepubliceerde contract van de leverancier, dus behandel beeldinvoer als beweerd in plaats van beschikbaar. GLM-5.2 daarentegen is in onze catalogus tekst-in en tekst-uit, zonder enige beeldmodaliteit — dus op dit vlak geeft geen van beide modellen je een geverifieerd antwoord, en een van hen geeft je een bewering.

• Je eigen cijfers. De kloof tussen wat gepubliceerd is en wat je nodig hebt, wordt gedicht door beide modellen op je taken te draaien, en het gratis venster op LongCat-2.5-Preview maakt dat nu goedkoop. Een redeneerspoor dat binnenkomt in een verweven reasoning_content veld is het harness-detail dat je eerst moet controleren, want tooling die het stilzwijgend laat vallen, verliest het grootste deel van het nut van het model zonder een fout te geven.

Waar dit de vergelijking achterlaat

Als je vandaag een beslissing moet nemen en er komt een lange context bij kijken, dan is GLM-5.2 degene die je daadwerkelijk kunt evalueren: het heeft een gepubliceerde recall, een onafhankelijke coderingsscore van 68,8 en een Intelligence Index van 33,7 van Artificial Analysis, en een prijs waarop je kunt budgetteren. Die cijfers beschrijven een model dat bekwaam is in plaats van grensverleggend — Z.ai's eigen opvolger, GLM-5.3, scoort er hoger dan het — maar ze beschrijven iets. LongCat-2.5-Preview is een goedkopere propositie met een grotere context die volledig ongemeten is, en waarvan de meest aantrekkelijke eigenschap, de prijs, expliciet tijdelijk is. De juiste houding ertegenover is niet scepsis. Het is een evaluatie van twee weken met je eigen scoringskader eraan gekoppeld, uitgevoerd voordat het promotietarief verdwijnt.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt