
LongCat-2.5-Preview vs GLM-5.2: Två 1M-tokenfönster, ett av dem uppmätt
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 610 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 189 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
LongCat-2.5-Preview och GLM-5.2 har samma siffra i rubriken: ett kontextfönster på en miljon tokens. Detta enda sammanträffande gör hela jobbet i de flesta jämförelser som skrivs denna vecka, och det räcker inte som grund för att jämföra två modeller. GLM-5.2 har varit offentligt dokumenterad sedan den 16 juni 2026 med en offentlig benchmarkprofil, en publicerad prislista och en recall-poäng för lång kontext från en oberoende utvärderare. LongCat-2.5-Preview dök upp på Meituans LongCat API Platform den 25 september 2026 med en rabatterad prislista, ett parameterantal som rapporterats av kinesisk branschpress, och ingen publicerad benchmark av något slag. Det ena fönstret är uppmätt. Det andra är påstått. Allt nedan håller de två kategorierna åtskilda, eftersom ett specifikationsblad och ett testresultat inte är samma slags faktum.
Det här är den ärliga versionen av matchningen, och den är mer användbar än den smickrande.
Vad vardera sidan faktiskt har publicerat
Meituans ändringslogg innehåller en daterad post – "Version: 2026-09-25, LongCat-2.5-Preview nu tillgänglig" – där tre påstådda förmågor listas: bildförståelse, kodning och kompatibilitet med "Claude Code och andra vanliga utvecklingsmiljöer", med namn som Hermes, OpenClaw, OpenCode och Kilo Code. Leverantörens prissida anger en betala-vid-användning-taxa på 0,30 USD per miljon icke-cachade indatatoken, 0,006 USD per miljon cachade indatatoken och 1,20 USD per miljon utdatatoken, vilket på själva sidan markeras som en tidsbegränsad rabatt. Kontextfönstret är en miljon token och maximal utdata är 131 072. Uppgiften om ungefär 1,6 biljoner parametrar totalt med omkring 48 miljarder aktiva per token, på en mixture-of-experts-stomme, kommer från Meituans egen webbplatsmetadata och från kinesisk branschbevakning av listningen – inte från API-dokumentationen. Ingen teknisk rapport, inget modellkort och ingen benchmarktabell åtföljde något av detta. Det finns inget LongCat-2.5-Preview-repositorium på HuggingFace och inget repositorium med det namnet i Meituans GitHub-organisation; den modellkatalogmetadata som medföljer OpenCode anger öppna vikter som false.

Z.ai:s GLM-5.2 befinner sig i motsatt position. Det är en lansering i juni med en prislista som vi erbjuder till listpris: 1,40 USD per miljon indatatoken, 0,26 USD per miljon cachade indatatoken och 4,40 USD per miljon utdatatoken i vår katalog, med ett kontextfönster på 1 000 000 token och 128 000 token som maximal utdata. Dess publicerade poäng kommer från två olika håll, och skillnaden spelar roll: Z.ai:s egna siffror för AIME 2026, HMMT februari 2026, GPQA-Diamond och FrontierSWE-sviten är leverantörsrapporterade; siffrorna för Coding Index och Intelligence Index som vår katalog innehåller har Artificial Analysis som källa, och de kör sina egna utvärderingar.
Den enda dimensionen där de verkligen är jämlika
Båda modellerna uppger exakt 1 000 000 token i kontext. Endast en av dem har en publicerad poäng som testar huruvida en modell fortfarande kan använda det som finns där. Artificial Analysis registrerar en Long-Context Recall-siffra på 78,33 för GLM-5.2. LongCat-2.5-Preview har ingen motsvarande siffra, från någon. Den asymmetrin är hela matchningen i en rad: ett fönster på en miljon token är ett uttalande om arkitekturens kapacitet, inte om huruvida modellen hämtar korrekt vid token 900 000. Kapacitet är billigt att skriva ut och dyrt att verifiera, vilket är varför varje leverantör skriver ut den och nästan ingen av dem publicerar återkallningstestet.
Så om det är arbete med långa kontexter du väljer mellan dessa två för, väljer du mellan ett alternativ med en publicerad recall-poäng och ett utan – och det utan är också det med den omätta benchmarkprofilen. Det är inte ett argument mot det. Det är ett argument mot att behandla de två som utbytbara på grund av ett matchande heltal.

Hur prisskillnaden ser ut i ett verkligt jobb
Prislistorna ligger inte nära varandra, och riktningen är inte den man förväntar sig från en kinesisk utmanare med öppna vikter mot ett västerländskt frontlabb. LongCat-2.5-Preview är ungefär 4,7 gånger billigare för icke-cachad indata och 3,7 gånger billigare för utdata än GLM-5.2 — ett förhållande som är aritmetik på de två publicerade prislistorna, inte en mätning. Vid en dokumentbearbetningskörning på 500 000 token som skriver tillbaka 20 000 token handlar det om cirka 17 cent mot cirka 79 cent. Båda modellerna måste läsa samma dokument. Endast en av dem har en publicerad poäng för huruvida den fortfarande kommer att vara uppmärksam i slutet av det.
Det finns en andra brasklapp som bör nämnas i samma andetag: Meituan kallar sin egen prislista för en tidsbegränsad rabatt. Siffran 0,30 dollar är kampanjpriset, och leverantören säger inte vad som följer efter det. En kostnadsmodell som bygger på ett kampanjpris har ett utgångsdatum du inte kan läsa. Det är ett skäl att hålla migreringen mellan leverantörer billig snarare än ett skäl att undvika modellen.
På OrcaRouter ligger de rutter vi tillhandahåller bakom en enda nyckel till leverantörens listpris med noll påslag, så en leverantörs prisändring når din faktura samma dag i stället för vid nästa förnyelse, och automatisk redundansväxling flyttar en försämrad begäran till en frisk leverantör utan att din applikation märker det. GLM-5.2 är en av våra rutter. LongCat-2.5-Preview är det inte – vi tillhandahåller den inte, och inget här bör tolkas som ett påstående om motsatsen. Z.ai har också gått vidare sedan juni: GLM-5.3 finns i vår katalog sedan den 18 augusti 2026, så en jämförelse formulerad som "ny modell kontra nuvarande modell" ramar redan in GLM-5.2 som den rådande snarare än frontlinjen.

Vad skulle kunna avgöra detta, och vad kommer inte att göra det
• Ett Long-Context Recall-poäng för LongCat-2.5-Preview, från Meituan eller från en oberoende utvärderare. Tills ett sådant finns är dess 1M-fönster ett påstående utan något test kopplat till sig, och GLM-5.2:s 78,33 är det enda numret i jämförelsen som säger något om samma fråga.
• Ett leverantörspriskort utan flaggan för begränsad tid. Det rabatterade priset anger vad modellen kostar under en kampanj, inte vad den kostar.
• En benchmarktabell av något slag. Inte en placering på en resultattavla – bara en publicerad utvärderingskörning, så att jämförelsen slutar vara ett specifikationsblad mot en resultatsida.
• En bekräftelse av bildinmatning. Ändringsloggen presenterar bildförståelse som ett framträdande tillägg, men exempelsvaret i Meituans egen dokumentation för "Retrieve Model" visar fortfarande input_modalities som ["text"] med en text->text-modalitetssträng. Det exemplet kan helt enkelt vara inaktuellt. Det är ändå leverantörens publicerade kontrakt, så behandla bildinmatning som påstådd snarare än tillgänglig. GLM-5.2 är däremot text-in och text-out i vår katalog utan någon bildmodalitet alls – så i denna dimension ger ingen av modellerna dig ett verifierat svar, och en av dem ger dig ett påstående.
• Dina egna siffror. Gapet mellan det som publiceras och det du behöver sluts genom att köra båda modellerna på dina uppgifter, och det kostnadsfria fönstret på LongCat-2.5-Preview gör det billigt just nu. Ett resonemangsspår som anländer i ett interfolierat reasoning_content-fält är den harness-detalj som bör kontrolleras först, eftersom verktyg som tyst utelämnar det går miste om större delen av modellens användbarhet utan att ge fel.
Vad detta innebär för jämförelsen
Om du behöver fatta ett beslut i dag och det handlar om lång kontext är GLM-5.2 den du faktiskt kan utvärdera: den har offentliggjord recall, en oberoende kodningspoäng på 68,8 och ett Intelligence Index på 33,7 från Artificial Analysis, samt ett pris du kan budgetera mot. Siffrorna beskriver en modell som är kompetent snarare än banbrytande – Z.ai:s egen efterträdare, GLM-5.3, får högre poäng – men de beskriver något. LongCat-2.5-Preview är ett billigare alternativ med större kontext, helt omätt, vars mest attraktiva egenskap – priset – uttryckligen är tillfällig. Det korrekta förhållningssättet till den är inte skepsis. Det är en tvåveckorsutvärdering med din egen poängsättningsram kopplad, genomförd innan kampanjpriset försvinner.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
