Сгенерированная титульная hero-карточка с текстом «LongCat-2.5-Preview vs GLM-5.2», с надзаголовком «Одинаковое окно в 1M, но измерили только один из них», и две панели: «LongCat-2.5-Preview: контекст 1M, $0.30 / $1.20 за 1M, бенчмарк не опубликован» и «GLM-5.2: контекст 1M, AA Long-Context Recall 78.33». Логотип OrcaRouter в правом нижнем углу.
Guides & Insights

LongCat-2.5-Preview против GLM-5.2: два окна по 1M токенов, одно из которых измерено

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

LongCat-2.5-Preview и GLM-5.2 имеют одинаковое главное число: контекстное окно размером в один миллион токенов. Это единственное совпадение делает всю работу в большинстве сравнений, которые пишут на этой неделе, и его недостаточно для сравнения двух моделей. О GLM-5.2 есть публичные данные с 16 июня 2026 года: публичный профиль бенчмарков, опубликованная тарифная сетка и оценка полноты на длинном контексте от независимого оценщика. LongCat-2.5-Preview стал доступен на LongCat API Platform от Meituan 25 сентября 2026 года с дисконтной тарифной сеткой, числом параметров, о котором сообщили китайские отраслевые издания, и без каких-либо опубликованных бенчмарков. Одно окно измерено. Другое — заявлено. Всё нижеследующее разделяет эти две категории, потому что спецификация и результат теста — не факты одного и того же рода.

Это честная версия сравнения, и она полезнее, чем лестная.

Что на самом деле опубликовала каждая сторона

В журнале изменений Meituan есть запись с датой — «Version: 2026-09-25, LongCat-2.5-Preview Now Available» — в которой перечислены три заявленные возможности: понимание изображений, программирование и совместимость с «Claude Code и другими популярными средами разработки», с упоминанием Hermes, OpenClaw, OpenCode и Kilo Code. На странице тарифов поставщика указана ставка оплаты по мере использования: $0,30 за миллион некэшированных входных токенов, $0,006 за миллион кэшированных входных токенов и $1,20 за миллион выходных токенов; на самой странице это отмечено как скидка на ограниченное время. Контекстное окно составляет один миллион токенов, а максимальный объём вывода — 131 072. Примерно 1,6 триллиона общих параметров и около 48 миллиардов активных на токен на архитектуре смеси экспертов — эти данные взяты из метаданных собственного сайта Meituan и из китайских отраслевых публикаций об этом листинге, а не из документации API. Ни технического отчёта, ни карточки модели, ни таблицы бенчмарков ко всему этому не прилагалось. На HuggingFace нет репозитория LongCat-2.5-Preview, и в организации Meituan на GitHub нет репозитория с таким названием; метаданные каталога моделей, поставляемые вместе с OpenCode, указывают открытые веса как false.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

GLM-5.2 от Z.ai находится в противоположной позиции. Это июньский релиз с тарифной сеткой, которую мы предоставляем по прейскурантной цене: 1,40 доллара США за миллион входных токенов, 0,26 доллара США за миллион кэшированных входных токенов и 4,40 доллара США за миллион выходных токенов в нашем каталоге, с контекстным окном 1 000 000 токенов и максимальным объёмом вывода 128 000 токенов. Его опубликованные оценки поступают из двух разных источников, и это различие важно: собственные цифры Z.ai по AIME 2026, HMMT February 2026, GPQA-Diamond и набору FrontierSWE — это данные, заявленные вендором; показатели Coding Index и Intelligence Index, которые содержит наш каталог, указаны со ссылкой на Artificial Analysis, которая проводит собственные оценки.

Единственный аспект, в котором они действительно равны

Обе модели заявляют ровно 1 000 000 токенов контекста. Только у одной из них есть опубликованный результат, проверяющий, способна ли модель по-прежнему использовать то, что находится внутри. Artificial Analysis фиксирует показатель Long-Context Recall 78,33 для GLM-5.2. У LongCat-2.5-Preview нет эквивалентного числа — ни от кого. Эта асимметрия — всё противостояние в одной строке: окно на миллион токенов — это утверждение о ёмкости архитектуры, а не о том, извлекает ли модель нужное корректно на токене 900 000. Заявить ёмкость дёшево, а проверить дорого — вот почему все производители её заявляют, и почти никто из них не публикует тест на извлечение.

Итак, если работа с длинным контекстом — это то, для чего вы выбираете между этими двумя, то вы выбираете между вариантом с опубликованной оценкой recall и вариантом без неё — а тот, что без неё, — это ещё и тот, у которого не измерен профиль по бенчмаркам. Это не аргумент против него. Это аргумент против того, чтобы считать эти два варианта взаимозаменяемыми на основании совпадающего целого числа.

A screenshot of OrcaRouter's own model page for Z.ai GLM-5.2 at /models/z-ai/glm-5.2, showing the z-ai/glm-5.2 identifier, a 1M-token context window, 128K maximum output, text input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-06-16, a p50 first-token figure of 5.13 s, $1.40 and $4.40 rate tiles, and the OpenAI-compatible code samples.

Как выглядит разница в цене на реальном примере

Расценки не близки, и направление не то, которого ожидают от китайского претендента с открытыми весами в противостоянии с западной передовой лабораторией. LongCat-2.5-Preview примерно в 4,7 раза дешевле на некэшированном вводе и в 3,7 раза дешевле на выводе, чем у GLM-5.2 — соотношение, которое является арифметикой по двум опубликованным прайс-листам, а не измерением. При прогоне обработки документа объёмом 500 000 токенов, который записывает обратно 20 000 токенов, это около 17 центов против около 79 центов. Обе модели должны прочитать один и тот же документ. Только у одной из них есть опубликованная оценка того, сохранит ли она внимание к концу.

Есть и вторая оговорка, которую стоит упомянуть в том же дыхании: Meituan называет свою тарифную сетку ограниченной по времени скидкой. Цифра $0.30 — это промо-значение, и поставщик не говорит, что будет дальше. Модель затрат, построенная на промо-цене, имеет срок истечения, который невозможно прочитать. Это довод в пользу того, чтобы сделать миграцию между провайдерами дешёвой, а не довод против использования модели.

В OrcaRouter маршруты, которые мы обслуживаем, доступны через один ключ по прайс-листовой цене провайдера с нулевой наценкой, поэтому изменение цены у поставщика отражается в вашем счёте в тот же день, а не при следующем продлении, и автоматическое переключение при сбое переводит деградировавший запрос к работоспособному провайдеру, при этом ваше приложение об этом не знает. GLM-5.2 — один из наших маршрутов. LongCat-2.5-Preview — нет: мы его не обслуживаем, и ничто здесь не должно восприниматься как утверждение об обратном. Z.ai также не стояла на месте с июня: GLM-5.3 доступна в нашем каталоге с 18 августа 2026 года, поэтому сравнение, сформулированное как «новая модель против текущей модели», уже позиционирует GLM-5.2 как действующую модель, а не как передовую.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs GLM-5.2' with the subhead 'Six dimensions, and which side of each one has evidence behind it'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, no repo and catalogue open_weights false. Right column 'GLM-5.2' (Z.ai, released 2026-06-16, independently scored): 1,000,000-token context, 128,000 max output, text to text only, $1.40 / $0.26 input, $4.40 output, coding index 68.8 at rank 30, long-context recall 78.33. Footnote credits OrcaRouter's catalogue and Artificial Analysis for the right column and notes LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Что могло бы уладить это, а что — нет

• Оценка Long-Context Recall для LongCat-2.5-Preview от Meituan или от независимого оценщика. Пока её нет, его 1M-окно — это утверждение без прикреплённого теста, и 78,33 у GLM-5.2 — единственное число в сравнении, которое относится к тому же вопросу.

• Прайс-лист поставщика без пометки об ограниченном сроке. Цена со скидкой показывает, сколько модель стоит во время акции, а не сколько она стоит на самом деле.

• Таблица с результатами бенчмарка любого рода. Не место в таблице лидеров — просто опубликованный прогон оценки, чтобы сравнение перестало быть сопоставлением спецификации со страницей результатов.

• Подтверждение ввода изображений. В списке изменений понимание изображений представлено как главное нововведение, но пример ответа в собственной документации Meituan по «Retrieve Model» по-прежнему показывает input_modalities как ["text"] со строкой модальности text->text. Этот пример может быть просто устаревшим. Тем не менее это опубликованный контракт поставщика, поэтому считайте ввод изображений заявленным, а не доступным. GLM-5.2, напротив, в нашем каталоге принимает и выдаёт только текст и вовсе не имеет модальности изображений — так что по этому аспекту ни одна из моделей не даёт вам проверенного ответа, а одна из них даёт вам лишь заявление.

• Ваши собственные показатели. Разрыв между тем, что опубликовано, и тем, что нужно вам, закрывается запуском обеих моделей на ваших задачах, а бесплатное окно на LongCat-2.5-Preview делает это дешёвым прямо сейчас. Трассировка рассуждений, которая приходит в чередующемся reasoning_content-поле, — это деталь обвязки, которую следует проверить первой, потому что инструменты, молча отбрасывающие её, потеряют большую часть полезности модели, не выдав ошибки.

В каком положении это оставляет сравнение

Если вам нужно принять решение сегодня и оно связано с длинным контекстом, GLM-5.2 — это тот вариант, который вы действительно можете оценить: у него опубликованные показатели recall, независимый балл за программирование — 68,8, Intelligence Index — 33,7 от Artificial Analysis, а также цена, которую можно заложить в бюджет. Эти цифры описывают модель, которая скорее компетентна, чем передовая, — собственный преемник Z.ai, GLM-5.3, набирает больше баллов, — но они всё же что-то описывают. LongCat-2.5-Preview — это более дешёвый вариант с более длинным контекстом, который вообще никто не измерял, и его самое привлекательное качество — цена — явно временное. Правильная позиция по отношению к нему — не скепсис. Это двухнедельная оценка с вашим собственным стендом для оценки, которую нужно провести до исчезновения промо-тарифа.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно