Сгенерированная hero-карточка с заголовком «LongCat-2.5-Preview против Kimi K3», надзаголовком «Вопрос о recall в длинном контексте» и двумя панелями: «LongCat-2.5-Preview: контекст 1M, оценка recall не опубликована» и «Kimi K3: AA Long-Context Recall 88.67 — самый высокий показатель из тех, что у нас есть». Логотип OrcaRouter в правом нижнем углу.
Engineering & Research

LongCat-2.5-Preview против Kimi K3: вопрос о воспроизведении в длинном контексте, на который пока никто не может ответить

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Kimi K3 набирает 88,67 балла в тесте Long-Context Recall. Это самый высокий показатель среди всех моделей в нашем каталоге применительно к конкретному вопросу: продолжает ли модель использовать информацию, зарытую глубоко внутри длинного ввода. LongCat-2.5-Preview вообще не имеет оценки Long-Context Recall — ни от Artificial Analysis, ни от Meituan, ни от кого бы то ни было. И при этом именно LongCat-2.5-Preview рекламирует окно в один миллион токенов как свою главную особенность. Это несоответствие — модель, чьё центральное заявление касается длинного контекста, и для которой не существует ни одного измерения длинного контекста, — и составляет всю суть этого сравнения. Всё остальное второстепенно.

Стоит быть точными в том, что отсутствующее число означает и чего оно не означает, потому что легко соскользнуть от «неизмеренного» к «вероятно плохому», и ни одно из этих направлений не подкреплено.

Что каждая из двух моделей официально заявила

Kimi K3 от MoonshotAI вышел 15 июля 2026 года. В нашем каталоге он представлен с контекстным окном 1 048 576 токенов, поддержкой текстового и графического ввода и тарифом: $3.00 за миллион входных токенов, $0.30 за миллион кэшированных входных и $15.00 за миллион выходных. Его независимый профиль от Artificial Analysis: Coding Index 76,2 — девятое место; Intelligence Index 43,6 — девятнадцатое место; GPQA Diamond 93,5%; Humanity's Last Exam 46,9%; SciCode 59,5%; Terminal-Bench v2.1 85,0; τ²-Bench banking 46,0. А Long-Context Recall 88,67 — лучший показатель в нашем каталоге.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview от Meituan появилась на платформе LongCat API 25 сентября 2026 года. В записи журнала изменений перечислены три заявленные возможности — понимание изображений, программирование и совместимость с «Claude Code и другими основными средами разработки», с указанием Hermes, OpenClaw, OpenCode и Kilo Code. На странице тарифов указано $0,30 за миллион некэшированных входных токенов, $0,006 за миллион кэшированных входных токенов и $1,20 за миллион выходных токенов; это отмечено как временная скидка. Контекстное окно — 1 000 000; максимальный вывод — 131 072. Показатель ~1,6 трлн общих / ~48 млрд активных параметров взят из метаданных сайта Meituan и материалов китайской отраслевой прессы, а не из документации. Нет таблицы бенчмарков, нет карточки модели, нет технического отчёта, нет репозитория на HuggingFace или в организации Meituan на GitHub, а в метаданных каталога открытые веса отмечены как false.

Почему отсутствующее число значит здесь больше, чем в любом другом противостоянии

Long-Context Recall — не один из многих показателей для этих двух моделей. Это показатель, который проверяет то, что обе они продают. Окно в один миллион токенов — это заявление о ёмкости архитектуры; recall измеряет, может ли модель всё ещё извлекать и использовать факт, расположенный на токене 900 000, а не на токене 900. Производители публикуют первый, потому что это спецификация. Независимые оценщики публикуют второй, потому что это тест, и большинство моделей справляются с ним не так хорошо, как предполагает размер их окна.

Так что честная позиция уже, чем звучит. 88,67 у Kimi K3 не означает, что Kimi K3 — лучшая модель для длинного контекста, чем LongCat-2.5-Preview. Это означает, что Kimi K3 — та, для которой вопрос был задан и на него ответили. LongCat-2.5-Preview могла бы быть лучше. Могла бы быть значительно хуже. Смысл в том, что сейчас никто за пределами Meituan не знает, а окно в 1M, напечатанное на странице с ценами, не является доказательством ни в ту, ни в другую сторону.

A screenshot of OrcaRouter's own model page for MoonshotAI Kimi K3 at /models/kimi/kimi-k3, showing the kimi/kimi-k3 identifier, a 1M-token context window, text + image input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-07-15, a p50 first-token figure of 8.24 s, $3.00 and $15.00 rate tiles, and the OpenAI-compatible code samples.

Картина затрат, с тем же арифметическим предупреждением

По опубликованным тарифам LongCat-2.5-Preview в 10 раз дешевле на некэшированном вводе и в 12,5 раза дешевле на выводе, чем Kimi K3. Чтение 500 000 токенов, при котором обратно записывается 20 000 токенов, обходится примерно в $1,80 на Kimi K3 и примерно в 17 центов на LongCat-2.5-Preview. В обоих случаях это арифметика по ценам из прайс-листа, а не измерения, и у показателя LongCat есть дополнительная оговорка, которой нет у показателя Kimi: Meituan называет собственный тариф ограниченной по времени скидкой, поэтому неизвестно, какая цифра сохранится после окончания акции.

Сопоставьте это с вопросом покрытия. Если вы обрабатываете вход объёмом 500 000 токенов, а полнота (recall) вашей модели на такой глубине не измерена, разница в стоимости — это не экономия, а цена неизвестной частоты отказов. Запрос за 17 центов, который молча пропускает релевантный фрагмент, обходится дороже, чем запрос за 1,80 доллара, который его находит, потому что в любом случае вы платите за повторный запуск и отладку. Это и есть конкретная форма этого риска, и именно поэтому отсутствующий бенчмарк — проблема затрат, а не только маркетинга.

Что делать, пока номер не существует

Сгенерируйте собственные. Это тот редкий случай, когда бесплатное окно действительно хорошо подходит для этого пробела: LongCat-2.5-Preview ничего не стоит вызывать через OpenCode в течение неопределённого срока, при политике нулевого хранения, которую OpenCode документирует, — обучение модели «Not used», хранение данных «0 days», — а значит, вы можете направить его на приватный репозиторий, не начиная предварительно разговор об обработке данных. Постройте тест «иголка в стоге сена» на той глубине, которую вы реально используете, прогоните его на обеих моделях — и получите число, которое не опубликовал ни один из вендоров. Две вещи стоит проверить, прежде чем доверять результату: что ваш тестовый стенд выводит чередующееся поле reasoning_content, которое возвращает модель, и что ввод изображений вообще работает, поскольку в списке изменений Meituan это заявлено, а его собственный пример «Retrieve Model» по-прежнему показывает input_modalities как ["text"] с text->text строкой.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Kimi K3' with the subhead 'The one model advertising a long window is the one with no recall score'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, long-context recall not published by anyone, coding index not published, no repo and catalogue open_weights false. Right column 'Kimi K3' (MoonshotAI, released 2026-07-15, independently scored): 1,048,576-token context, max output not published, text and image to text, $3.00 uncached / $0.30 cached input, $15.00 output, long-context recall 88.67 described as the highest we carry, coding index 76.2 at rank 9 and intelligence index 43.6 at rank 19 by Artificial Analysis. The footnote adds that a 500,000-token read writing 20,000 tokens back is roughly $1.80 on Kimi K3 against roughly 17 cents on LongCat-2.5-Preview at its published promotional rate. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Роль OrcaRouter в этом

Мы предоставляем Kimi K3 по цене из прайс-листа MoonshotAI с нулевой наценкой. LongCat-2.5-Preview не входит в число наших маршрутов — мы его не предоставляем, и ничто в этом тексте не должно восприниматься как утверждение, что мы это делаем.

В этом конкретном сравнении полезная часть роутера — не цена. Она в том, что модель, которую вы оцениваете, и модель, на которую вы полагаетесь, могут находиться за одним и тем же ключом. Показатель полноты Kimi K3, равный 88,67, делает её моделью, через которую вы бы сегодня направляли прогон по длинному контексту; LongCat-2.5-Preview — это модель, которую вы хотите проверить против неё, потому что если её полнота сохранится при цене вывода в одну двенадцатую, экономика работы с длинными документами меняется. Слияние моделей — это механизм который делает это конкретным, а не теоретическим: проход поиска по длинному контексту и финальный этап синтеза могут быть двумя разными моделями в одном запросе, так что дешёвая неизмеренная модель и дорогая измеренная не обязаны быть взаимоисключающим выбором. Тогда автоматическое переключение при отказе покрывает случай, когда одна из них деградирует, что важнее обычного, когда у одного из двух ваших кандидатов нет истории обслуживания, которую вы можете изучить.

Вердикт, изложенный вместе с присущей ему неопределённостью.

Если на этой неделе вам нужна надёжная работа с длинным контекстом, Kimi K3 — это обоснованный выбор: recall 88,67 — лучший доступный показатель именно для той возможности, о которой идёт речь, а его более широкий профиль — Coding 76,2, Intelligence 43,6, GPQA Diamond 93,5% — солиден, а не блистателен; при этом все эти данные взяты из независимых источников. Если вы готовы потратить полдня на создание собственной оценки, LongCat-2.5-Preview — более интересная ставка: окно в миллион токенов, потолок вывода в 131 072 токена, доступ с нулевым хранением данных и тарифная сетка на порядок ниже, чем у Kimi K3, — и всё это опирается на заявления вендора, которые никто ещё публично не тестировал.

Нельзя оправдать то, что их считают эквивалентными только потому, что у обоих заявлен миллион токенов. У одного из них с этим окном связано число, а у другого — цена. Это разные виды доказательств, и разрыв между ними — единственное, о чём на самом деле это сравнение.