
LongCat-2.5-Preview против Kimi K3: вопрос о воспроизведении в длинном контексте, на который пока никто не может ответить
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 610 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 189 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Kimi K3 набирает 88,67 балла в тесте Long-Context Recall. Это самый высокий показатель среди всех моделей в нашем каталоге применительно к конкретному вопросу: продолжает ли модель использовать информацию, зарытую глубоко внутри длинного ввода. LongCat-2.5-Preview вообще не имеет оценки Long-Context Recall — ни от Artificial Analysis, ни от Meituan, ни от кого бы то ни было. И при этом именно LongCat-2.5-Preview рекламирует окно в один миллион токенов как свою главную особенность. Это несоответствие — модель, чьё центральное заявление касается длинного контекста, и для которой не существует ни одного измерения длинного контекста, — и составляет всю суть этого сравнения. Всё остальное второстепенно.
Стоит быть точными в том, что отсутствующее число означает и чего оно не означает, потому что легко соскользнуть от «неизмеренного» к «вероятно плохому», и ни одно из этих направлений не подкреплено.
Что каждая из двух моделей официально заявила
Kimi K3 от MoonshotAI вышел 15 июля 2026 года. В нашем каталоге он представлен с контекстным окном 1 048 576 токенов, поддержкой текстового и графического ввода и тарифом: $3.00 за миллион входных токенов, $0.30 за миллион кэшированных входных и $15.00 за миллион выходных. Его независимый профиль от Artificial Analysis: Coding Index 76,2 — девятое место; Intelligence Index 43,6 — девятнадцатое место; GPQA Diamond 93,5%; Humanity's Last Exam 46,9%; SciCode 59,5%; Terminal-Bench v2.1 85,0; τ²-Bench banking 46,0. А Long-Context Recall 88,67 — лучший показатель в нашем каталоге.

LongCat-2.5-Preview от Meituan появилась на платформе LongCat API 25 сентября 2026 года. В записи журнала изменений перечислены три заявленные возможности — понимание изображений, программирование и совместимость с «Claude Code и другими основными средами разработки», с указанием Hermes, OpenClaw, OpenCode и Kilo Code. На странице тарифов указано $0,30 за миллион некэшированных входных токенов, $0,006 за миллион кэшированных входных токенов и $1,20 за миллион выходных токенов; это отмечено как временная скидка. Контекстное окно — 1 000 000; максимальный вывод — 131 072. Показатель ~1,6 трлн общих / ~48 млрд активных параметров взят из метаданных сайта Meituan и материалов китайской отраслевой прессы, а не из документации. Нет таблицы бенчмарков, нет карточки модели, нет технического отчёта, нет репозитория на HuggingFace или в организации Meituan на GitHub, а в метаданных каталога открытые веса отмечены как false.
Почему отсутствующее число значит здесь больше, чем в любом другом противостоянии
Long-Context Recall — не один из многих показателей для этих двух моделей. Это показатель, который проверяет то, что обе они продают. Окно в один миллион токенов — это заявление о ёмкости архитектуры; recall измеряет, может ли модель всё ещё извлекать и использовать факт, расположенный на токене 900 000, а не на токене 900. Производители публикуют первый, потому что это спецификация. Независимые оценщики публикуют второй, потому что это тест, и большинство моделей справляются с ним не так хорошо, как предполагает размер их окна.
Так что честная позиция уже, чем звучит. 88,67 у Kimi K3 не означает, что Kimi K3 — лучшая модель для длинного контекста, чем LongCat-2.5-Preview. Это означает, что Kimi K3 — та, для которой вопрос был задан и на него ответили. LongCat-2.5-Preview могла бы быть лучше. Могла бы быть значительно хуже. Смысл в том, что сейчас никто за пределами Meituan не знает, а окно в 1M, напечатанное на странице с ценами, не является доказательством ни в ту, ни в другую сторону.

Картина затрат, с тем же арифметическим предупреждением
По опубликованным тарифам LongCat-2.5-Preview в 10 раз дешевле на некэшированном вводе и в 12,5 раза дешевле на выводе, чем Kimi K3. Чтение 500 000 токенов, при котором обратно записывается 20 000 токенов, обходится примерно в $1,80 на Kimi K3 и примерно в 17 центов на LongCat-2.5-Preview. В обоих случаях это арифметика по ценам из прайс-листа, а не измерения, и у показателя LongCat есть дополнительная оговорка, которой нет у показателя Kimi: Meituan называет собственный тариф ограниченной по времени скидкой, поэтому неизвестно, какая цифра сохранится после окончания акции.
Сопоставьте это с вопросом покрытия. Если вы обрабатываете вход объёмом 500 000 токенов, а полнота (recall) вашей модели на такой глубине не измерена, разница в стоимости — это не экономия, а цена неизвестной частоты отказов. Запрос за 17 центов, который молча пропускает релевантный фрагмент, обходится дороже, чем запрос за 1,80 доллара, который его находит, потому что в любом случае вы платите за повторный запуск и отладку. Это и есть конкретная форма этого риска, и именно поэтому отсутствующий бенчмарк — проблема затрат, а не только маркетинга.
Что делать, пока номер не существует
Сгенерируйте собственные. Это тот редкий случай, когда бесплатное окно действительно хорошо подходит для этого пробела: LongCat-2.5-Preview ничего не стоит вызывать через OpenCode в течение неопределённого срока, при политике нулевого хранения, которую OpenCode документирует, — обучение модели «Not used», хранение данных «0 days», — а значит, вы можете направить его на приватный репозиторий, не начиная предварительно разговор об обработке данных. Постройте тест «иголка в стоге сена» на той глубине, которую вы реально используете, прогоните его на обеих моделях — и получите число, которое не опубликовал ни один из вендоров. Две вещи стоит проверить, прежде чем доверять результату: что ваш тестовый стенд выводит чередующееся поле reasoning_content, которое возвращает модель, и что ввод изображений вообще работает, поскольку в списке изменений Meituan это заявлено, а его собственный пример «Retrieve Model» по-прежнему показывает input_modalities как ["text"] с text->text строкой.

Роль OrcaRouter в этом
Мы предоставляем Kimi K3 по цене из прайс-листа MoonshotAI с нулевой наценкой. LongCat-2.5-Preview не входит в число наших маршрутов — мы его не предоставляем, и ничто в этом тексте не должно восприниматься как утверждение, что мы это делаем.
В этом конкретном сравнении полезная часть роутера — не цена. Она в том, что модель, которую вы оцениваете, и модель, на которую вы полагаетесь, могут находиться за одним и тем же ключом. Показатель полноты Kimi K3, равный 88,67, делает её моделью, через которую вы бы сегодня направляли прогон по длинному контексту; LongCat-2.5-Preview — это модель, которую вы хотите проверить против неё, потому что если её полнота сохранится при цене вывода в одну двенадцатую, экономика работы с длинными документами меняется. Слияние моделей — это механизм который делает это конкретным, а не теоретическим: проход поиска по длинному контексту и финальный этап синтеза могут быть двумя разными моделями в одном запросе, так что дешёвая неизмеренная модель и дорогая измеренная не обязаны быть взаимоисключающим выбором. Тогда автоматическое переключение при отказе покрывает случай, когда одна из них деградирует, что важнее обычного, когда у одного из двух ваших кандидатов нет истории обслуживания, которую вы можете изучить.
Вердикт, изложенный вместе с присущей ему неопределённостью.
Если на этой неделе вам нужна надёжная работа с длинным контекстом, Kimi K3 — это обоснованный выбор: recall 88,67 — лучший доступный показатель именно для той возможности, о которой идёт речь, а его более широкий профиль — Coding 76,2, Intelligence 43,6, GPQA Diamond 93,5% — солиден, а не блистателен; при этом все эти данные взяты из независимых источников. Если вы готовы потратить полдня на создание собственной оценки, LongCat-2.5-Preview — более интересная ставка: окно в миллион токенов, потолок вывода в 131 072 токена, доступ с нулевым хранением данных и тарифная сетка на порядок ниже, чем у Kimi K3, — и всё это опирается на заявления вендора, которые никто ещё публично не тестировал.
Нельзя оправдать то, что их считают эквивалентными только потому, что у обоих заявлен миллион токенов. У одного из них с этим окном связано число, а у другого — цена. Это разные виды доказательств, и разрыв между ними — единственное, о чём на самом деле это сравнение.
