
LongCat-2.5-Preview против Grok 4.6: у одного есть карточка бенчмарка, у другого — преемник
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 610 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 189 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Сравнивать LongCat-2.5-Preview с Grok 4.6 неловко по причине, не имеющей никакого отношения к качеству ни одной из моделей: у этого вопроса есть срок годности. Grok 4.6 вышел 12 августа 2026 года, а Grok 4.7 вышел 21 сентября 2026 года — за шесть дней до того, как это пишется — по тем же тарифам $2.00 / $6.00 за миллион токенов и с тем же контекстным окном в 500 000 токенов. LongCat-2.5-Preview, тем временем, появился на LongCat API Platform от Meituan 25 сентября 2026 года без какого-либо анонсированного преемника в поле зрения и вообще без опубликованных бенчмарков. Так что настоящий выбор не в том, «какая модель лучше». А в том, хотите ли вы измеренную возможность с уже стоящим за ней измеренным преемником или неизмеренную, которая, по крайней мере, является актуальной.
Такая формулировка менее захватывающая, чем табло, и значительно полезнее.
Начните с того, что у Grok 4.6 на самом деле есть в файлах.
Grok 4.6 — хорошо задокументированная модель. В нашем каталоге она имеет контекстное окно на 500 000 токенов, ввод текста, изображений и файлов, а тарифная сетка составляет $2.00 за миллион входных токенов, $6.00 за миллион выходных токенов и $0.50 за миллион кэшированных входных токенов, повышаясь до $4.00 и $12.00 при превышении 200 000 входных токенов. Её независимый профиль от Artificial Analysis включает Coding Index 76,8 — пятое место среди моделей, отслеживаемых этим индексом, — Intelligence Index 44,3 на восемнадцатом месте, GPQA Diamond на 94,9%, Humanity's Last Exam на 42,9%, SciCode на 56,5%, Terminal-Bench v2.1 на 88,4 и τ²-Bench для банковского дела на 50,7. Её Long-Context Recall составляет 80,3.

У LongCat-2.5-Preview ничего этого нет. Запись в журнале изменений Meituan от 25 сентября 2026 года — это датированное уведомление о доступности, в котором перечислены три заявленные возможности — понимание изображений, программирование и совместимость с «Claude Code и другими основными средами разработки», включая Hermes, OpenClaw, OpenCode и Kilo Code, — и ничего, что хотя бы отдалённо напоминало результат. На странице цен поставщика указано: $0.30 за миллион токенов некэшированного ввода, $0.006 за миллион токенов кэшированного ввода и $1.20 за миллион токенов вывода, причём явно помечено как ограниченная по времени скидка. Контекстное окно — 1 000 000 токенов; максимальный вывод — 131 072. Оценка примерно в 1,6 трлн общих / 48 млрд активных параметров взята из метаданных сайта Meituan и китайских отраслевых публикаций, а не из документации. Для него нет репозитория ни на HuggingFace, ни в организации Meituan на GitHub, а в метаданных каталога, поставляемых OpenCode, открытые веса указаны как false.
Измерение, которое табло полностью упустило бы
Эти две модели различаются в том, что не измеряет ни один бенчмарк, и для многих команд это само по себе решает вопрос: что происходит с промптами, которые вы отправляете.
В собственной документации OpenCode указано, что LongCat 2.5 Preview Free обслуживается провайдером, который придерживается политики нулевого хранения и не использует ваши данные для обучения; таблица конфиденциальности Zen подкрепляет это цифрами — обучение модели «Не используется», хранение данных «0 дней». В той же таблице конфиденциальности для Grok 4.6 и Grok 4.7 указано хранение в течение тридцати дней. Оба этих утверждения принадлежат OpenCode, опубликованы на страницах OpenCode и описывают именно бесплатный листинг и сравнительный листинг. Но если вы направляете агента на приватный репозиторий, это разница между разговором, который вам не нужно вести с юристами, и тем, который нужно, — и это не имеет никакого отношения к тому, какая модель показывает лучшие результаты на SciCode.

Что «измеренное» даёт и чего не даёт
Показатели Grok 4.6 лучше, чем у LongCat-2.5-Preview, в единственном смысле, который здесь важен: они существуют. Это не то же самое, что сказать, будто Grok 4.6 — лучшая модель. Его Coding Index, равный 76.8, ниже, чем у поколения Grok 4.7, а модель, с которой его сравнивали, уже не является фронтиром собственного семейства. У его опубликованного преемника Intelligence Index составляет 46.4 против 44.3 у Grok 4.6, а Long-Context Recall — 76.67 против 80.33 у Grok 4.6, — так что преемник не лучше по всем осям, и это как раз та деталь, которую скрывает номер поколения.
Есть также оговорка о работе с реальным трафиком, которую стоит сформулировать прямо, потому что она противоречит лестной интерпретации для обеих моделей. На нашей собственной семидневной выборке из песочницы у Grok 4.6 не зафиксировано ни измеренной пропускной способности, ни трафика токенов — в этом столбце так выглядит отсутствие данных, а не вердикт о производительности. У LongCat-2.5-Preview вообще нет нашей выборки обслуживания, потому что мы не направляем к нему трафик. Так что любое сравнение задержек между этими двумя оказывается односторонним — в том смысле, который проза обычно сглаживает: нельзя провести бенчмарк для модели, которой вы не отправляете трафик.
Где слой маршрутизации здесь действительно помогает
Три из приведённых выше фактов относятся к тем, для которых роутер создан, а не просто совместим с ними. Тарифная сетка Grok 4.6 повышается после 200 000 входных токенов, поэтому одна и та же логическая задача может тарифицироваться по двум разным ставкам в зависимости от числа, которое ваше приложение уже знает до отправки чего-либо. У Grok 4.6 есть опубликованный преемник с идентичными тарифами, а значит, переход с одного на другой должен быть изменением в одну строку, а не повторной интеграцией. А самое привлекательное свойство LongCat-2.5-Preview — его цена — поставщик явно помечает как временное.
В OrcaRouter мы предоставляем Grok 4.6 по прейскурантной цене xAI с нулевой наценкой, поэтому изменение тарифа поставщика отражается в вашем счёте в тот же день, а не при следующем продлении, и автоматическое переключение при сбое переносит деградировавший запрос к исправному провайдеру, при этом ваш код не знает, кто ответил. DSL маршрутизации покрывает случай многоуровневого ценообразования напрямую, а объединение моделей покрывает случай, когда модель, которую вы хотите использовать для чтения длинных текстов, — не та модель, которую вы хотите использовать для финального синтеза. LongCat-2.5-Preview не входит в число наших маршрутов — мы её не обслуживаем, и ничто здесь не утверждает обратного. Смысл этого упоминания не в том, чтобы перенаправить вас куда-то ещё; он в том, что модель, которую вы оцениваете, а не запускаете, должна находиться за тем же ключом, что и модели, которые вы запускаете, так что её оценка обходится в одну запись конфигурации, а не в целый проект.

Как решить
• Выбирайте Grok 4.6, если вам нужен ответ, который можно защитить. У него есть независимая карточка, документированный профиль входных данных и цена без срока действия. Его главный риск — не качество, а актуальность: Grok 4.7 существует по тем же тарифам, а цена инерционного сохранения на 4.6 — это разница между значениями Intelligence Index 44,3 и 46,4, которой можно было избежать.
• Выбирайте LongCat-2.5-Preview, если решающим фактором является удержание или охват. Доступ с нулевым хранением через OpenCode, окно в один миллион токенов, потолок вывода в 131 072 токена и тарифная сетка примерно в семь раз ниже, чем у Grok 4.6, — это реальные преимущества: первое из них подтверждено политикой конфиденциальности третьей стороны, остальные же заявлены только самим поставщиком.
• Не выбирайте между ними, опираясь на таблицу бенчмарков, потому что она всего одна. Оценка Grok 4.6 в программировании — 76.8, а показатель воспроизведения в длинном контексте — 80.3: эти показатели описывают Grok 4.6. Пока ничто не описывает LongCat-2.5-Preview. Любой, кто на этой неделе публикует оценку LongCat-2.5-Preview рядом с оценкой Grok 4.6, либо цитирует другую модель LongCat, либо выдумывает это число.
• Проверьте входную сторону, прежде чем строить на ней. В журнале изменений Meituan на первом месте стоит понимание изображений, но пример ответа в собственной документации Meituan «Retrieve Model» всё ещё показывает input_modalities как ["text"] с text->text в качестве строки модальности — заявленной вендором вопреки опубликованному контракту, который утверждает обратное. Grok 4.6 принимает текст, изображения и файлы без такой двусмысленности. И проверьте, что ваш харнесс выводит перемежающееся reasoning_content поле, прежде чем делать какие-либо выводы о качестве рассуждений LongCat-2.5-Preview; клиент, который отбрасывает это поле, будет тихо сбоить.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
