
LongCat-2.5-Preview vs GLM-5.2: twee vensters van 1M tokens, waarvan er één is gemeten
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 610 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 189 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
LongCat-2.5-Preview en GLM-5.2 dragen hetzelfde opvallende getal: een contextvenster van één miljoen tokens. Dat ene toeval doet al het werk in de meeste vergelijkingen die deze week worden geschreven, en het is niet genoeg om twee modellen op te vergelijken. GLM-5.2 staat sinds 16 juni 2026 officieel te boek met een openbaar benchmarkprofiel, een gepubliceerde prijslijst en een score voor long-context recall van een onafhankelijke evaluator. LongCat-2.5-Preview verscheen op 25 september 2026 op Meituan's LongCat API Platform met een verlaagde prijslijst, een parameteraantal dat door de Chinese vakpers wordt genoemd, en geen enkele gepubliceerde benchmark. Het ene venster is gemeten. Het andere wordt slechts beweerd. Alles hieronder houdt die twee categorieën uit elkaar, want een specificatieblad en een testresultaat zijn niet hetzelfde soort feit.
Dit is de eerlijke versie van de confrontatie, en die is nuttiger dan de vleiende.
Wat elke partij daadwerkelijk heeft gepubliceerd
De changelog van Meituan bevat een gedateerde vermelding — "Versie: 2026-09-25, LongCat-2.5-Preview Nu beschikbaar" — waarin drie geclaimde mogelijkheden worden opgesomd: beeldbegrip, coderen en compatibiliteit met "Claude Code en andere gangbare ontwikkelomgevingen", waarbij Hermes, OpenClaw, OpenCode en Kilo Code worden genoemd. De prijspagina van de leverancier vermeldt een pay-as-you-go-tarief van $0,30 per miljoen niet-gecachte invoertokens, $0,006 per miljoen gecachte invoertokens en $1,20 per miljoen uitvoertokens, op de pagina zelf aangeduid als een tijdelijke korting. Het contextvenster is een miljoen tokens en de maximale uitvoer is 131.072. Ruwweg 1,6 biljoen totale parameters met ongeveer 48 miljard actieve per token, op een mixture-of-experts-backbone, is afkomstig van de eigen sitemetadata van Meituan en van Chinese vakpersverslaggeving over de vermelding — niet uit de API-documentatie. Er ging geen technisch rapport, geen modelkaart en geen benchmarktabel mee. Er is geen LongCat-2.5-Preview-repository op HuggingFace en geen repository met die naam in de GitHub-organisatie van Meituan; de modelcatalogusmetadata die met OpenCode wordt meegeleverd, registreert open weights als false.

Z.ai's GLM-5.2 bevindt zich in de tegenovergestelde positie. Het is een release uit juni met een tariefkaart die wij tegen listprijs aanbieden: $1,40 per miljoen inputtokens, $0,26 per miljoen gecachte inputtokens en $4,40 per miljoen outputtokens in onze catalogus, met een contextvenster van 1.000.000 tokens en een maximale output van 128.000 tokens. De gepubliceerde scores komen uit twee verschillende bronnen, en dat onderscheid is belangrijk: Z.ai's eigen cijfers voor AIME 2026, HMMT februari 2026, GPQA-Diamond en de FrontierSWE-suite zijn door de leverancier gerapporteerd; de cijfers voor de Coding Index en Intelligence Index die onze catalogus bevat, zijn afkomstig van Artificial Analysis, dat zijn eigen evaluaties uitvoert.
De enige dimensie waarin ze werkelijk gelijk zijn
Beide modellen claimen precies 1.000.000 tokens context. Slechts één van hen heeft een gepubliceerde score die test of een model nog kan gebruiken wat erin zit. Artificial Analysis noteert een Long-Context Recall-score van 78,33 voor GLM-5.2. Voor LongCat-2.5-Preview bestaat er van niemand een equivalent cijfer. Die asymmetrie is de hele vergelijking in één regel: een venster van één miljoen tokens is een uitspraak over de capaciteit van de architectuur, niet over de vraag of het model bij token 900.000 correct terugvindt. Capaciteit is goedkoop om te vermelden en duur om te verifiëren, daarom vermeldt elke leverancier het en publiceert bijna geen van hen de recalltest.
Dus als werk met een lange context is waarvoor je tussen deze twee kiest, dan kies je tussen één optie met een gepubliceerde recallscore en één zonder — en degene zonder is ook degene met het ongemeten benchmarkprofiel. Dat is geen argument ertegen. Het is een argument ertegen om de twee als uitwisselbaar te beschouwen op grond van een overeenkomend geheel getal.

Hoe het prijsverschil eruitziet bij een echte klus
De tariefkaarten liggen ver uit elkaar, en de richting is niet wat men verwacht van een Chinese open-weights-uitdager tegen een westers frontierlab. LongCat-2.5-Preview is ongeveer 4,7 keer goedkoper voor niet-gecachte input en 3,7 keer goedkoper voor output dan GLM-5.2 — een verhouding die rekenkundig volgt uit de twee gepubliceerde tariefkaarten, niet uit een meting. Bij een documentverwerkingsronde van 500.000 tokens die 20.000 tokens terugschrijft, is dat ongeveer 17 cent tegenover ongeveer 79 cent. Beide modellen moeten hetzelfde document lezen. Slechts één van hen heeft een gepubliceerde score voor de vraag of het aan het einde ervan nog aandacht zal hebben.
Er is een tweede voorbehoud dat in één adem genoemd moet worden: Meituan bestempelt zijn eigen tariefkaart als een tijdelijke korting. Het bedrag van $0,30 is het promotiecijfer, en de leverancier zegt niet wat daarna komt. Een kostenmodel dat op een promotieprijs is gebouwd, heeft een vervaldatum die je niet kunt lezen. Dat is een reden om de migratie tussen aanbieders goedkoop te houden, niet een reden om het model te vermijden.
Op OrcaRouter zitten de routes die wij aanbieden achter één sleutel tegen de lijstprijs van de provider met nul markup, zodat een prijswijziging van een leverancier dezelfde dag op uw factuur terechtkomt in plaats van bij de volgende verlenging, en automatische failover verplaatst een gedegradeerd verzoek naar een gezonde provider zonder dat uw applicatie het merkt. GLM-5.2 is een van onze routes. LongCat-2.5-Preview is dat niet — wij bieden het niet aan, en niets hier mag worden gelezen als een bewering van het tegendeel. Z.ai is sinds juni ook verder gegaan: GLM-5.3 staat sinds 18 augustus 2026 live in onze catalogus, dus een vergelijking die is geformuleerd als "nieuw model versus huidig model" positioneert GLM-5.2 al als de gevestigde partij in plaats van de frontier.

Wat dit zou oplossen, en wat niet
• Een Long-Context Recall-score voor LongCat-2.5-Preview, van Meituan of van een onafhankelijke evaluator. Zolang die niet bestaat, is het 1M-venster een bewering zonder bijbehorende test, en is de 78,33 van GLM-5.2 het enige getal in de vergelijking dat op dezelfde vraag ingaat.
• Een tariefkaart van een leverancier zonder de markering 'beperkte tijd'. De kortingsprijs vertelt je wat het model tijdens een promotie kost, niet wat het kost.
• Een benchmarktabel van welke aard dan ook. Geen ranglijstpositie — slechts een gepubliceerde evaluatierun, zodat de vergelijking ophoudt een specificatieblad tegenover een resultatenpagina te zijn.
• Een bevestiging van beeldinvoer. De changelog presenteert beeldbegrip als een hoofdpunt, maar het voorbeeldantwoord in Meituan's eigen "Retrieve Model"-documentatie toont nog steeds input_modalities als ["text"] met een text->text modaliteitsstring. Dat voorbeeld is misschien gewoon verouderd. Het is niettemin het gepubliceerde contract van de leverancier, dus behandel beeldinvoer als beweerd in plaats van beschikbaar. GLM-5.2 daarentegen is in onze catalogus tekst-in en tekst-uit, zonder enige beeldmodaliteit — dus op dit vlak geeft geen van beide modellen je een geverifieerd antwoord, en een van hen geeft je een bewering.
• Je eigen cijfers. De kloof tussen wat gepubliceerd is en wat je nodig hebt, wordt gedicht door beide modellen op je taken te draaien, en het gratis venster op LongCat-2.5-Preview maakt dat nu goedkoop. Een redeneerspoor dat binnenkomt in een verweven reasoning_content veld is het harness-detail dat je eerst moet controleren, want tooling die het stilzwijgend laat vallen, verliest het grootste deel van het nut van het model zonder een fout te geven.
Waar dit de vergelijking achterlaat
Als je vandaag een beslissing moet nemen en er komt een lange context bij kijken, dan is GLM-5.2 degene die je daadwerkelijk kunt evalueren: het heeft een gepubliceerde recall, een onafhankelijke coderingsscore van 68,8 en een Intelligence Index van 33,7 van Artificial Analysis, en een prijs waarop je kunt budgetteren. Die cijfers beschrijven een model dat bekwaam is in plaats van grensverleggend — Z.ai's eigen opvolger, GLM-5.3, scoort er hoger dan het — maar ze beschrijven iets. LongCat-2.5-Preview is een goedkopere propositie met een grotere context die volledig ongemeten is, en waarvan de meest aantrekkelijke eigenschap, de prijs, expliciet tijdelijk is. De juiste houding ertegenover is niet scepsis. Het is een evaluatie van twee weken met je eigen scoringskader eraan gekoppeld, uitgevoerd voordat het promotietarief verdwijnt.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
