
LongCat-2.5-Preview vs GLM-5.2: Dwa okna 1M tokenów, jedno z nich zmierzone
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 610 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 189 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
LongCat-2.5-Preview i GLM-5.2 mają tę samą liczbę w nagłówku: okno kontekstu liczące milion tokenów. Ten jeden zbieg okoliczności wykonuje całą pracę w większości porównań pisanych w tym tygodniu, a to nie wystarcza do porównywania dwóch modeli. GLM-5.2 jest publicznie odnotowany od 16 czerwca 2026 r., z publicznym profilem benchmarkowym, opublikowanym cennikiem i wynikiem przywoływania w długim kontekście od niezależnego ewaluatora. LongCat-2.5-Preview pojawił się 25 września 2026 r. na platformie LongCat API Meituana z obniżonym cennikiem, liczbą parametrów podaną przez chińskie media branżowe i bez żadnego opublikowanego benchmarku. Jedno okno jest zmierzone. Drugie jest tylko deklarowane. Wszystko poniżej rozdziela te dwie kategorie, ponieważ specyfikacja i wynik testu nie są faktami tego samego rodzaju.
To uczciwa wersja tego starcia i jest bardziej użyteczna niż ta pochlebna.
Co każda ze stron faktycznie opublikowała
Dziennik zmian Meituan zawiera opatrzony datą wpis — „Wersja: 2026-09-25, LongCat-2.5-Preview już dostępny” — w którym wymieniono trzy deklarowane możliwości: rozumienie obrazu, programowanie oraz zgodność z „Claude Code i innymi głównymi środowiskami programistycznymi”, wskazując Hermes, OpenClaw, OpenCode i Kilo Code. Strona z cennikiem dostawcy podaje stawkę rozliczenia za rzeczywiste zużycie wynoszącą 0,30 USD za milion tokenów wejściowych bez pamięci podręcznej, 0,006 USD za milion tokenów wejściowych z pamięci podręcznej i 1,20 USD za milion tokenów wyjściowych, oznaczoną na samej stronie jako zniżkę ograniczoną czasowo. Okno kontekstowe wynosi milion tokenów, a maksymalna długość wyjścia to 131 072. Około 1,6 biliona parametrów łącznie i około 48 miliardów aktywnych na token, w architekturze mieszanki ekspertów, pochodzi z metadanych własnej witryny Meituan oraz z chińskich relacji branżowych na temat tej pozycji — a nie z dokumentacji API. Do żadnego z tych elementów nie dołączono raportu technicznego, karty modelu ani tabeli wyników benchmarków. W serwisie HuggingFace nie ma repozytorium LongCat-2.5-Preview, a w organizacji Meituan na GitHubie nie ma repozytorium o tej nazwie; metadane katalogu modeli dołączane do OpenCode zapisują otwarte wagi jako false.

Z.ai GLM-5.2 znajduje się w przeciwnej sytuacji. To czerwcowe wydanie z cennikiem, który oferujemy w cenie katalogowej: 1,40 USD za milion tokenów wejściowych, 0,26 USD za milion tokenów wejściowych z pamięci podręcznej i 4,40 USD za milion tokenów wyjściowych w naszym katalogu, z oknem kontekstowym wynoszącym 1 000 000 tokenów i maksymalnym wyjściem 128 000 tokenów. Jego publikowane wyniki pochodzą z dwóch różnych miejsc i to rozróżnienie ma znaczenie: własne liczby Z.ai dla AIME 2026, HMMT February 2026, GPQA-Diamond i zestawu FrontierSWE są raportowane przez dostawcę; natomiast wartości Coding Index i Intelligence Index, które zawiera nasz katalog, pochodzą z Artificial Analysis, który przeprowadza własne oceny.
Jedyny wymiar, w którym są naprawdę równi
Oba modele deklarują dokładnie 1 000 000 tokenów kontekstu. Tylko jeden z nich ma opublikowany wynik, który sprawdza, czy model wciąż potrafi wykorzystać to, co się w nim znajduje. Artificial Analysis odnotowuje dla GLM-5.2 wskaźnik Long-Context Recall na poziomie 78,33. LongCat-2.5-Preview nie ma żadnej równoważnej liczby — od nikogo. Ta asymetria to całe to starcie w jednym zdaniu: okno o długości miliona tokenów to stwierdzenie o pojemności architektury, a nie o tym, czy model poprawnie odzyskuje informacje na tokenie 900 000. Pojemność jest tania do podania i droga do zweryfikowania — dlatego każdy dostawca ją podaje, a prawie żaden nie publikuje testu odzyskiwania.
Więc jeśli praca z długim kontekstem jest tym, między czym wybierasz przy tych dwóch, to wybierasz między jedną opcją z opublikowanym wynikiem recall a drugą bez niego — a ta bez niego to także ta z niezmierzonym profilem benchmarkowym. To nie jest argument przeciwko niej. To argument przeciwko traktowaniu tych dwóch jako wymiennych na podstawie pasującej liczby całkowitej.

Jak wygląda różnica w cenie na rzeczywistym zleceniu
Cenniki nie są zbliżone, a kierunek nie jest tym, jakiego ludzie oczekują od chińskiego pretendenta z otwartymi wagami w starciu z zachodnim laboratorium z czołówki. LongCat-2.5-Preview jest około 4,7 razy tańszy na wejściu bez pamięci podręcznej i 3,7 razy tańszy na wyjściu niż GLM-5.2 — stosunek, który wynika z arytmetyki na dwóch opublikowanych cennikach, a nie z pomiaru. W przebiegu przetwarzania dokumentu o 500 000 tokenów, który zwraca 20 000 tokenów, to około 17 centów wobec około 79 centów. Oba modele muszą przeczytać ten sam dokument. Tylko jeden z nich ma opublikowany wynik dotyczący tego, czy nadal będzie zwracał uwagę pod koniec dokumentu.
Jest jeszcze drugie zastrzeżenie, które należy wspomnieć jednym tchem: Meituan określa własny cennik jako ograniczoną czasowo zniżkę. Kwota 0,30 USD to wartość promocyjna, a dostawca nie mówi, co następuje po niej. Model kosztów oparty na cenie promocyjnej ma datę ważności, której nie da się odczytać. To powód, by migracja między dostawcami pozostała tania, a nie powód, by unikać tego modelu.
W OrcaRouter trasy, które obsługujemy, znajdują się za jednym kluczem w cenie katalogowej dostawcy, z zerową marżą, dzięki czemu zmiana ceny u dostawcy trafia na Twoje rozliczenie tego samego dnia, a nie dopiero przy kolejnym odnowieniu, a automatyczne przełączanie awaryjne przenosi żądanie o obniżonej jakości do zdrowego dostawcy bez wiedzy Twojej aplikacji. GLM-5.2 jest jedną z naszych tras. LongCat-2.5-Preview nie jest — nie obsługujemy go i nic tutaj nie powinno być odczytywane jako twierdzenie przeciwne. Z.ai również poszło naprzód od czerwca: GLM-5.3 jest dostępny w naszym katalogu od 18 sierpnia 2026 r., więc porównanie sformułowane jako „nowy model kontra obecny model” już przedstawia GLM-5.2 jako model dotychczasowy, a nie jako czołówkę.

Co by to rozstrzygnęło, a co nie.
• Wynik Long-Context Recall dla LongCat-2.5-Preview, od Meituan lub od niezależnego ewaluatora. Dopóki taki nie istnieje, jego okno 1M to twierdzenie bez dołączonego testu, a 78,33 GLM-5.2 to jedyna liczba w tym porównaniu, która odnosi się do tego samego pytania.
• Cennik dostawcy bez oznaczenia ograniczonej czasowo oferty. Cena promocyjna mówi, ile model kosztuje w czasie promocji, a nie ile kosztuje.
• Tabela testów porównawczych dowolnego rodzaju. Nie pozycja w rankingu — po prostu opublikowany przebieg ewaluacji, dzięki czemu porównanie przestaje być zestawieniem specyfikacji ze stroną wyników.
• Potwierdzenie wejścia obrazowego. Dziennik zmian przedstawia rozumienie obrazu jako główną nowość, ale przykładowa odpowiedź w opublikowanej przez Meituan dokumentacji „Retrieve Model" nadal pokazuje input_modalities jako ["text"] z ciągiem modalności text->text. Ten przykład może być po prostu nieaktualny. Jest to jednak opublikowany kontrakt dostawcy, więc traktuj wejście obrazowe jako deklarowane, a nie jako dostępne. GLM-5.2 dla odmiany w naszym katalogu przyjmuje tekst i zwraca tekst, bez żadnej modalności obrazowej — więc w tym wymiarze żaden z modeli nie daje zweryfikowanej odpowiedzi, a jeden z nich daje jedynie twierdzenie.
• Twoje własne liczby. Lukę między tym, co jest publikowane, a tym, czego potrzebujesz, zamyka uruchomienie obu modeli na Twoich zadaniach, a darmowe okno w LongCat-2.5-Preview sprawia, że jest to teraz tanie. Ślad rozumowania, który pojawia się w przeplatanym reasoning_content polu, to szczegół harnessu, który trzeba sprawdzić najpierw, ponieważ narzędzia, które po cichu go pomijają, stracą większość użyteczności modelu, nie zgłaszając błędu.
Co to oznacza dla porównania
Jeśli potrzebujesz dziś podjąć decyzję i wiąże się ona z długim kontekstem, GLM-5.2 jest tym, który faktycznie możesz ocenić: ma opublikowany wskaźnik recall, niezależny wynik kodowania 68,8 i Intelligence Index 33,7 od Artificial Analysis oraz cenę, względem której możesz planować budżet. Te liczby opisują model kompetentny, a nie frontierowy — własny następca Z.ai, GLM-5.3, uzyskuje wyższe wyniki niż on — ale jednak coś opisują. LongCat-2.5-Preview to tańsza, o większym kontekście, całkowicie niezmierzona propozycja, której najbardziej atrakcyjna cecha, czyli cena, jest wyraźnie tymczasowa. Właściwą postawą wobec niej nie jest sceptycyzm. To dwutygodniowa ewaluacja z dołączonym własnym zestawem do oceny, przeprowadzona, zanim promocyjna stawka zniknie.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
