Сгенерированная hero-титульная карточка с текстом «LongCat-2.5-Preview vs Grok 4.6», надзаголовком «У одного есть карточка бенчмарка, у другого — преемник» и двумя панелями: «LongCat-2.5-Preview: контекст 1M, нулевое сохранение через OpenCode» и «Grok 4.6: AA Coding 76.8, Grok 4.7 уже выпущен». Логотип OrcaRouter в правом нижнем углу.
Guides & Insights

LongCat-2.5-Preview против Grok 4.6: у одного есть карточка бенчмарка, у другого — преемник

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Сравнивать LongCat-2.5-Preview с Grok 4.6 неловко по причине, не имеющей никакого отношения к качеству ни одной из моделей: у этого вопроса есть срок годности. Grok 4.6 вышел 12 августа 2026 года, а Grok 4.7 вышел 21 сентября 2026 года — за шесть дней до того, как это пишется — по тем же тарифам $2.00 / $6.00 за миллион токенов и с тем же контекстным окном в 500 000 токенов. LongCat-2.5-Preview, тем временем, появился на LongCat API Platform от Meituan 25 сентября 2026 года без какого-либо анонсированного преемника в поле зрения и вообще без опубликованных бенчмарков. Так что настоящий выбор не в том, «какая модель лучше». А в том, хотите ли вы измеренную возможность с уже стоящим за ней измеренным преемником или неизмеренную, которая, по крайней мере, является актуальной.

Такая формулировка менее захватывающая, чем табло, и значительно полезнее.

Начните с того, что у Grok 4.6 на самом деле есть в файлах.

Grok 4.6 — хорошо задокументированная модель. В нашем каталоге она имеет контекстное окно на 500 000 токенов, ввод текста, изображений и файлов, а тарифная сетка составляет $2.00 за миллион входных токенов, $6.00 за миллион выходных токенов и $0.50 за миллион кэшированных входных токенов, повышаясь до $4.00 и $12.00 при превышении 200 000 входных токенов. Её независимый профиль от Artificial Analysis включает Coding Index 76,8 — пятое место среди моделей, отслеживаемых этим индексом, — Intelligence Index 44,3 на восемнадцатом месте, GPQA Diamond на 94,9%, Humanity's Last Exam на 42,9%, SciCode на 56,5%, Terminal-Bench v2.1 на 88,4 и τ²-Bench для банковского дела на 50,7. Её Long-Context Recall составляет 80,3.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

У LongCat-2.5-Preview ничего этого нет. Запись в журнале изменений Meituan от 25 сентября 2026 года — это датированное уведомление о доступности, в котором перечислены три заявленные возможности — понимание изображений, программирование и совместимость с «Claude Code и другими основными средами разработки», включая Hermes, OpenClaw, OpenCode и Kilo Code, — и ничего, что хотя бы отдалённо напоминало результат. На странице цен поставщика указано: $0.30 за миллион токенов некэшированного ввода, $0.006 за миллион токенов кэшированного ввода и $1.20 за миллион токенов вывода, причём явно помечено как ограниченная по времени скидка. Контекстное окно — 1 000 000 токенов; максимальный вывод — 131 072. Оценка примерно в 1,6 трлн общих / 48 млрд активных параметров взята из метаданных сайта Meituan и китайских отраслевых публикаций, а не из документации. Для него нет репозитория ни на HuggingFace, ни в организации Meituan на GitHub, а в метаданных каталога, поставляемых OpenCode, открытые веса указаны как false.

Измерение, которое табло полностью упустило бы

Эти две модели различаются в том, что не измеряет ни один бенчмарк, и для многих команд это само по себе решает вопрос: что происходит с промптами, которые вы отправляете.

В собственной документации OpenCode указано, что LongCat 2.5 Preview Free обслуживается провайдером, который придерживается политики нулевого хранения и не использует ваши данные для обучения; таблица конфиденциальности Zen подкрепляет это цифрами — обучение модели «Не используется», хранение данных «0 дней». В той же таблице конфиденциальности для Grok 4.6 и Grok 4.7 указано хранение в течение тридцати дней. Оба этих утверждения принадлежат OpenCode, опубликованы на страницах OpenCode и описывают именно бесплатный листинг и сравнительный листинг. Но если вы направляете агента на приватный репозиторий, это разница между разговором, который вам не нужно вести с юристами, и тем, который нужно, — и это не имеет никакого отношения к тому, какая модель показывает лучшие результаты на SciCode.

A screenshot of OrcaRouter's own model page for xAI Grok 4.6 at /models/grok/grok-4.6, showing the grok/grok-4.6 identifier, a 500K-token context window, text + image + file input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-08-12, $2.00 and $6.00 rate tiles, and a performance strip whose first-token and token-traffic tiles both read 'Collecting' rather than a figure. The page copy describes Grok 4.6 as the current flagship of the Grok line and cites a headline GPQA Diamond score of 94.9.

Что «измеренное» даёт и чего не даёт

Показатели Grok 4.6 лучше, чем у LongCat-2.5-Preview, в единственном смысле, который здесь важен: они существуют. Это не то же самое, что сказать, будто Grok 4.6 — лучшая модель. Его Coding Index, равный 76.8, ниже, чем у поколения Grok 4.7, а модель, с которой его сравнивали, уже не является фронтиром собственного семейства. У его опубликованного преемника Intelligence Index составляет 46.4 против 44.3 у Grok 4.6, а Long-Context Recall — 76.67 против 80.33 у Grok 4.6, — так что преемник не лучше по всем осям, и это как раз та деталь, которую скрывает номер поколения.

Есть также оговорка о работе с реальным трафиком, которую стоит сформулировать прямо, потому что она противоречит лестной интерпретации для обеих моделей. На нашей собственной семидневной выборке из песочницы у Grok 4.6 не зафиксировано ни измеренной пропускной способности, ни трафика токенов — в этом столбце так выглядит отсутствие данных, а не вердикт о производительности. У LongCat-2.5-Preview вообще нет нашей выборки обслуживания, потому что мы не направляем к нему трафик. Так что любое сравнение задержек между этими двумя оказывается односторонним — в том смысле, который проза обычно сглаживает: нельзя провести бенчмарк для модели, которой вы не отправляете трафик.

Где слой маршрутизации здесь действительно помогает

Три из приведённых выше фактов относятся к тем, для которых роутер создан, а не просто совместим с ними. Тарифная сетка Grok 4.6 повышается после 200 000 входных токенов, поэтому одна и та же логическая задача может тарифицироваться по двум разным ставкам в зависимости от числа, которое ваше приложение уже знает до отправки чего-либо. У Grok 4.6 есть опубликованный преемник с идентичными тарифами, а значит, переход с одного на другой должен быть изменением в одну строку, а не повторной интеграцией. А самое привлекательное свойство LongCat-2.5-Preview — его цена — поставщик явно помечает как временное.

В OrcaRouter мы предоставляем Grok 4.6 по прейскурантной цене xAI с нулевой наценкой, поэтому изменение тарифа поставщика отражается в вашем счёте в тот же день, а не при следующем продлении, и автоматическое переключение при сбое переносит деградировавший запрос к исправному провайдеру, при этом ваш код не знает, кто ответил. DSL маршрутизации покрывает случай многоуровневого ценообразования напрямую, а объединение моделей покрывает случай, когда модель, которую вы хотите использовать для чтения длинных текстов, — не та модель, которую вы хотите использовать для финального синтеза. LongCat-2.5-Preview не входит в число наших маршрутов — мы её не обслуживаем, и ничто здесь не утверждает обратного. Смысл этого упоминания не в том, чтобы перенаправить вас куда-то ещё; он в том, что модель, которую вы оцениваете, а не запускаете, должна находиться за тем же ключом, что и модели, которые вы запускаете, так что её оценка обходится в одну запись конфигурации, а не в целый проект.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Grok 4.6' with the subhead 'One model has a measured card and a measured successor; the other has a rate card'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, data retention 0 days on the free listing per OpenCode. Right column 'Grok 4.6' (xAI, released 2026-08-12, successor shipped 2026-09-21): 500,000-token context, max output not published, text, image and file to text, $2.00 input up to 200K then $4.00, $6.00 output up to 200K then $12.00, coding index 76.8 at rank 5 by Artificial Analysis, long-context recall 80.33, data retention 30 days on the comparison listing per OpenCode. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Как решить

• Выбирайте Grok 4.6, если вам нужен ответ, который можно защитить. У него есть независимая карточка, документированный профиль входных данных и цена без срока действия. Его главный риск — не качество, а актуальность: Grok 4.7 существует по тем же тарифам, а цена инерционного сохранения на 4.6 — это разница между значениями Intelligence Index 44,3 и 46,4, которой можно было избежать.

• Выбирайте LongCat-2.5-Preview, если решающим фактором является удержание или охват. Доступ с нулевым хранением через OpenCode, окно в один миллион токенов, потолок вывода в 131 072 токена и тарифная сетка примерно в семь раз ниже, чем у Grok 4.6, — это реальные преимущества: первое из них подтверждено политикой конфиденциальности третьей стороны, остальные же заявлены только самим поставщиком.

• Не выбирайте между ними, опираясь на таблицу бенчмарков, потому что она всего одна. Оценка Grok 4.6 в программировании — 76.8, а показатель воспроизведения в длинном контексте — 80.3: эти показатели описывают Grok 4.6. Пока ничто не описывает LongCat-2.5-Preview. Любой, кто на этой неделе публикует оценку LongCat-2.5-Preview рядом с оценкой Grok 4.6, либо цитирует другую модель LongCat, либо выдумывает это число.

• Проверьте входную сторону, прежде чем строить на ней. В журнале изменений Meituan на первом месте стоит понимание изображений, но пример ответа в собственной документации Meituan «Retrieve Model» всё ещё показывает input_modalities как ["text"] с text->text в качестве строки модальности — заявленной вендором вопреки опубликованному контракту, который утверждает обратное. Grok 4.6 принимает текст, изображения и файлы без такой двусмысленности. И проверьте, что ваш харнесс выводит перемежающееся reasoning_content поле, прежде чем делать какие-либо выводы о качестве рассуждений LongCat-2.5-Preview; клиент, который отбрасывает это поле, будет тихо сбоить.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно