Ett genererat hero-titelkort med texten ”LongCat-2.5-Preview vs GLM-5.2” och överraden ”Samma 1M-fönster, bara en av dem har uppmätts”, samt två paneler: ”LongCat-2.5-Preview: 1M kontext, $0.30 / $1.20 per 1M, ingen benchmark publicerad” och ”GLM-5.2: 1M kontext, AA Long-Context Recall 78.33”. OrcaRouter-logotyp nere till höger.
Guides & Insights

LongCat-2.5-Preview vs GLM-5.2: Två 1M-tokenfönster, ett av dem uppmätt

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

LongCat-2.5-Preview och GLM-5.2 har samma siffra i rubriken: ett kontextfönster på en miljon tokens. Detta enda sammanträffande gör hela jobbet i de flesta jämförelser som skrivs denna vecka, och det räcker inte som grund för att jämföra två modeller. GLM-5.2 har varit offentligt dokumenterad sedan den 16 juni 2026 med en offentlig benchmarkprofil, en publicerad prislista och en recall-poäng för lång kontext från en oberoende utvärderare. LongCat-2.5-Preview dök upp på Meituans LongCat API Platform den 25 september 2026 med en rabatterad prislista, ett parameterantal som rapporterats av kinesisk branschpress, och ingen publicerad benchmark av något slag. Det ena fönstret är uppmätt. Det andra är påstått. Allt nedan håller de två kategorierna åtskilda, eftersom ett specifikationsblad och ett testresultat inte är samma slags faktum.

Det här är den ärliga versionen av matchningen, och den är mer användbar än den smickrande.

Vad vardera sidan faktiskt har publicerat

Meituans ändringslogg innehåller en daterad post – "Version: 2026-09-25, LongCat-2.5-Preview nu tillgänglig" – där tre påstådda förmågor listas: bildförståelse, kodning och kompatibilitet med "Claude Code och andra vanliga utvecklingsmiljöer", med namn som Hermes, OpenClaw, OpenCode och Kilo Code. Leverantörens prissida anger en betala-vid-användning-taxa på 0,30 USD per miljon icke-cachade indatatoken, 0,006 USD per miljon cachade indatatoken och 1,20 USD per miljon utdatatoken, vilket på själva sidan markeras som en tidsbegränsad rabatt. Kontextfönstret är en miljon token och maximal utdata är 131 072. Uppgiften om ungefär 1,6 biljoner parametrar totalt med omkring 48 miljarder aktiva per token, på en mixture-of-experts-stomme, kommer från Meituans egen webbplatsmetadata och från kinesisk branschbevakning av listningen – inte från API-dokumentationen. Ingen teknisk rapport, inget modellkort och ingen benchmarktabell åtföljde något av detta. Det finns inget LongCat-2.5-Preview-repositorium på HuggingFace och inget repositorium med det namnet i Meituans GitHub-organisation; den modellkatalogmetadata som medföljer OpenCode anger öppna vikter som false.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

Z.ai:s GLM-5.2 befinner sig i motsatt position. Det är en lansering i juni med en prislista som vi erbjuder till listpris: 1,40 USD per miljon indatatoken, 0,26 USD per miljon cachade indatatoken och 4,40 USD per miljon utdatatoken i vår katalog, med ett kontextfönster på 1 000 000 token och 128 000 token som maximal utdata. Dess publicerade poäng kommer från två olika håll, och skillnaden spelar roll: Z.ai:s egna siffror för AIME 2026, HMMT februari 2026, GPQA-Diamond och FrontierSWE-sviten är leverantörsrapporterade; siffrorna för Coding Index och Intelligence Index som vår katalog innehåller har Artificial Analysis som källa, och de kör sina egna utvärderingar.

Den enda dimensionen där de verkligen är jämlika

Båda modellerna uppger exakt 1 000 000 token i kontext. Endast en av dem har en publicerad poäng som testar huruvida en modell fortfarande kan använda det som finns där. Artificial Analysis registrerar en Long-Context Recall-siffra på 78,33 för GLM-5.2. LongCat-2.5-Preview har ingen motsvarande siffra, från någon. Den asymmetrin är hela matchningen i en rad: ett fönster på en miljon token är ett uttalande om arkitekturens kapacitet, inte om huruvida modellen hämtar korrekt vid token 900 000. Kapacitet är billigt att skriva ut och dyrt att verifiera, vilket är varför varje leverantör skriver ut den och nästan ingen av dem publicerar återkallningstestet.

Så om det är arbete med långa kontexter du väljer mellan dessa två för, väljer du mellan ett alternativ med en publicerad recall-poäng och ett utan – och det utan är också det med den omätta benchmarkprofilen. Det är inte ett argument mot det. Det är ett argument mot att behandla de två som utbytbara på grund av ett matchande heltal.

A screenshot of OrcaRouter's own model page for Z.ai GLM-5.2 at /models/z-ai/glm-5.2, showing the z-ai/glm-5.2 identifier, a 1M-token context window, 128K maximum output, text input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-06-16, a p50 first-token figure of 5.13 s, $1.40 and $4.40 rate tiles, and the OpenAI-compatible code samples.

Hur prisskillnaden ser ut i ett verkligt jobb

Prislistorna ligger inte nära varandra, och riktningen är inte den man förväntar sig från en kinesisk utmanare med öppna vikter mot ett västerländskt frontlabb. LongCat-2.5-Preview är ungefär 4,7 gånger billigare för icke-cachad indata och 3,7 gånger billigare för utdata än GLM-5.2 — ett förhållande som är aritmetik på de två publicerade prislistorna, inte en mätning. Vid en dokumentbearbetningskörning på 500 000 token som skriver tillbaka 20 000 token handlar det om cirka 17 cent mot cirka 79 cent. Båda modellerna måste läsa samma dokument. Endast en av dem har en publicerad poäng för huruvida den fortfarande kommer att vara uppmärksam i slutet av det.

Det finns en andra brasklapp som bör nämnas i samma andetag: Meituan kallar sin egen prislista för en tidsbegränsad rabatt. Siffran 0,30 dollar är kampanjpriset, och leverantören säger inte vad som följer efter det. En kostnadsmodell som bygger på ett kampanjpris har ett utgångsdatum du inte kan läsa. Det är ett skäl att hålla migreringen mellan leverantörer billig snarare än ett skäl att undvika modellen.

På OrcaRouter ligger de rutter vi tillhandahåller bakom en enda nyckel till leverantörens listpris med noll påslag, så en leverantörs prisändring når din faktura samma dag i stället för vid nästa förnyelse, och automatisk redundansväxling flyttar en försämrad begäran till en frisk leverantör utan att din applikation märker det. GLM-5.2 är en av våra rutter. LongCat-2.5-Preview är det inte – vi tillhandahåller den inte, och inget här bör tolkas som ett påstående om motsatsen. Z.ai har också gått vidare sedan juni: GLM-5.3 finns i vår katalog sedan den 18 augusti 2026, så en jämförelse formulerad som "ny modell kontra nuvarande modell" ramar redan in GLM-5.2 som den rådande snarare än frontlinjen.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs GLM-5.2' with the subhead 'Six dimensions, and which side of each one has evidence behind it'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, no repo and catalogue open_weights false. Right column 'GLM-5.2' (Z.ai, released 2026-06-16, independently scored): 1,000,000-token context, 128,000 max output, text to text only, $1.40 / $0.26 input, $4.40 output, coding index 68.8 at rank 30, long-context recall 78.33. Footnote credits OrcaRouter's catalogue and Artificial Analysis for the right column and notes LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Vad skulle kunna avgöra detta, och vad kommer inte att göra det

• Ett Long-Context Recall-poäng för LongCat-2.5-Preview, från Meituan eller från en oberoende utvärderare. Tills ett sådant finns är dess 1M-fönster ett påstående utan något test kopplat till sig, och GLM-5.2:s 78,33 är det enda numret i jämförelsen som säger något om samma fråga.

• Ett leverantörspriskort utan flaggan för begränsad tid. Det rabatterade priset anger vad modellen kostar under en kampanj, inte vad den kostar.

• En benchmarktabell av något slag. Inte en placering på en resultattavla – bara en publicerad utvärderingskörning, så att jämförelsen slutar vara ett specifikationsblad mot en resultatsida.

• En bekräftelse av bildinmatning. Ändringsloggen presenterar bildförståelse som ett framträdande tillägg, men exempelsvaret i Meituans egen dokumentation för "Retrieve Model" visar fortfarande input_modalities som ["text"] med en text->text-modalitetssträng. Det exemplet kan helt enkelt vara inaktuellt. Det är ändå leverantörens publicerade kontrakt, så behandla bildinmatning som påstådd snarare än tillgänglig. GLM-5.2 är däremot text-in och text-out i vår katalog utan någon bildmodalitet alls – så i denna dimension ger ingen av modellerna dig ett verifierat svar, och en av dem ger dig ett påstående.

• Dina egna siffror. Gapet mellan det som publiceras och det du behöver sluts genom att köra båda modellerna på dina uppgifter, och det kostnadsfria fönstret på LongCat-2.5-Preview gör det billigt just nu. Ett resonemangsspår som anländer i ett interfolierat reasoning_content-fält är den harness-detalj som bör kontrolleras först, eftersom verktyg som tyst utelämnar det går miste om större delen av modellens användbarhet utan att ge fel.

Vad detta innebär för jämförelsen

Om du behöver fatta ett beslut i dag och det handlar om lång kontext är GLM-5.2 den du faktiskt kan utvärdera: den har offentliggjord recall, en oberoende kodningspoäng på 68,8 och ett Intelligence Index på 33,7 från Artificial Analysis, samt ett pris du kan budgetera mot. Siffrorna beskriver en modell som är kompetent snarare än banbrytande – Z.ai:s egen efterträdare, GLM-5.3, får högre poäng – men de beskriver något. LongCat-2.5-Preview är ett billigare alternativ med större kontext, helt omätt, vars mest attraktiva egenskap – priset – uttryckligen är tillfällig. Det korrekta förhållningssättet till den är inte skepsis. Det är en tvåveckorsutvärdering med din egen poängsättningsram kopplad, genomförd innan kampanjpriset försvinner.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen