
Intern-Decision-4B против ContextPilot-8B: модель, которая сжимает контекст, против модели, которая им управляет
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 592 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 187 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Выбирайте из двух зол: internlm/Intern-Decision-4B отказывается читать более 8 192 токенов, а tencent/ContextPilot-8B существует специально, чтобы выживать в контекстах, которые растут без ограничений. Это модели одного класса по размеру, обе — файн-тюны на базе Qwen, и обе появились на Hub без анонса от вендора и без каких-либо независимых оценок — ContextPilot-8B 27 августа 2026 года, Intern-Decision-4B 26 сентября 2026 года — и они решают противоположные задачи. Intern-Decision-4B — это структурированная модель принятия решений на 4,5 млрд параметров, которая выполняет один прямой проход, считывает логиты и возвращает калиброванную вероятность для каждого заданного вами вопроса; она никогда не порождает ни одного токена. ContextPilot-8B — это генератор текста на 8,19 млрд параметров, обученный планировать, запоминать и выгружать собственный рабочий контекст во время длительного прогона агента. Сравнивать их — это на самом деле не вопрос бенчмарка. Это вопрос о том, какую половину вашей проблемы вы предпочли бы заставить модель проглотить.
Во-первых, то, что их искренне объединяет
Ни у одной из моделей нет ни единой цифры, которую кто-либо за пределами её собственной лаборатории проверил. Это достаточно необычно, чтобы сказать об этом прежде всего, потому что большинство сравнений в этом блоге могут хотя бы опереться на независимый лидерборд для одной из сторон.
Intern-Decision-4B публикует полную таблицу оценок на своей карточке — среднее 90.02 по семи наборам, показатель Брайера 0.347 и ожидаемая ошибка калибровки 0.065 — всё это измерено InternLM на стенде InternLM. ContextPilot-8B вообще не публикует таблицу. В его карточке говорится, что фреймворк «стабильно превосходит существующие базовые решения на различных базовых моделях и бенчмарках», и указывается на статью и конвейер оценки для подробностей. Итак, для этого сравнения честная строка об источниках коротка: одна сторона сообщена производителем и не воспроизведена, другая заявлена производителем и не опубликована, и ничто на этой странице не является независимым.

Две ставки, изложенные простыми словами
Ставка Intern-Decision-4B в том, что трудная часть решения — не рассуждение, а принятие обязательства. Дайте ему состояние, схему именованных вопросов и до восьми изображений, и он вернёт распределение по вашим собственным строкам вариантов. Процедура вывода детерминирована и имеет фиксированную форму: сопоставьте варианты с однотокенными символами, сформируйте скелет JSON ассистента с одним плейсхолдером на поле, выполните один каузальный прямой проход, считайте логиты непосредственно перед каждым плейсхолдером, выполните softmax только по кандидатам этого поля, примените подобранную температуру. Цикла декодирования нет, поэтому нет ни парсера, ни поверхности для галлюцинаций в свободном тексте. Цена этой ставки — жёсткий потолок входных данных: в карточке сказано, что входные данные выше DecisionEngine(max_length=8192) «отклоняются без усечения».
Ставка ContextPilot-8B — зеркальное отражение: сохранить режим, в котором агент пишет токены, но научить его редактировать то, что он несёт. Он добавляет в набор инструментов агента планирование, структурированную долговременную память, поиск и мягкую выгрузку контекста, а затем обучает чекпоинт с помощью рецепта RL, который сэмплирует ветви вокруг значимых решений по редактированию контекста и приписывает заслугу на уровне действий, а не на уровне траектории. В карточке честно сказано о последствии упаковки: загрузка чекпоинта не даёт управления контекстом. Определения инструментов, среда выполнения агента и конвейер оценки находятся в другом месте, и их нужно брать с собой.
Табло, измерение за измерением
• Вывод — Intern-Decision-4B вообще не выдаёт текст, только вероятности по значениям ваших вариантов; ContextPilot-8B генерирует как обычно, а его ответы — это текст на естественном языке и вызовы инструментов, которые вам приходится разбирать.
• Потолок входных данных — Intern-Decision-4B отклоняет всё, что превышает 8 192 токена; ContextPilot-8B наследует ограничение позиции Qwen3-8B в 40 960 токенов и создан для того, чтобы продолжать работу по мере роста эффективного контекста.
• Параметры — 4.54B BF16 для Intern-Decision-4B, распределённые между текстовой башней, визуальной башней и проектором; 8.19B BF16 для ContextPilot-8B, обычной плотной каузальной языковой модели Qwen3.
• Задержка — Intern-Decision-4B, согласно его собственной карточке, показывает среднее время 44,16 мс и 44,60 мс на уровне P95 на одной RTX 4090; ContextPilot-8B не публикует показатель задержки, и его стоимость принципиально иная, поскольку он генерирует токены, а не оценивает их.
• Изображения — Intern-Decision-4B принимает до восьми, и токены изображений учитываются в пределах потолка в 8 192; в карточке ContextPilot-8B описан чекпойнт для генерации текста без мультимодального пути.
• Лицензия — Intern-Decision-4B распространяется под Apache-2.0, а рядом с ней сохранена лицензия исходного Qwen; лицензия ContextPilot-8B начинается с раздела 0: «предоставляется исключительно для целей научных исследований и разработки. Вам запрещается использовать её для любых других целей».
• Опубликованные данные — с одной стороны, таблица из семи наборов с диагностикой калибровки; с другой — аннотация статьи и ссылка на репозиторий оценки.
• Послужной список — оба малозаметны. Intern-Decision-4B показывает один лайк и ноль загрузок с 26 сентября 2026 года; у ContextPilot-8B 11 лайков и примерно тысяча загрузок с 27 августа 2026 года — это больше внимания, но сторонней оценки по-прежнему нет.

Где на самом деле ломается каждый из них
Режим отказа Intern-Decision-4B имеет структурный характер, и стоит сказать об этом конкретно. Если доказательства для решения не умещаются в 8 192 токена, модель не деградирует плавно — она отклоняет запрос. Это оправданный инженерный выбор и ужасно неподходящее решение именно для той рабочей нагрузки, для которой создавался ContextPilot-8B. Конфигурация самой карточки делает это противоречие ещё резче: текстовая башня под обёрткой заявляет ограничение позиции в 262 144 токена. Базовая модель может адресовать четверть миллиона токенов, а выпущенная обёртка не принимает больше восьми тысяч.
Режим отказа ContextPilot-8B состоит в том, что он не является drop-in-решением ни для чего. Это чекпойнт внутри фреймворка, и именно во фреймворке живёт поведение. Извлеките веса без определений инструментов и рантайма агента — и получите дообученную Qwen3-8B, чья отличительная способность окажется инертной. Добавьте к этому раздел 0 лицензии, и практический ответ для коммерческого развёртывания будет таким: в поставляемом виде его нельзя использовать вообще; это также означает, что он не является для нас возможным маршрутом ни сейчас, ни в ближайшем будущем.
Развёртывая каждый, если вы собирались
Intern-Decision-4B требует небольшую GPU и не нуждается в сколь-нибудь серьёзном стеке обслуживания: установите PyTorch 2.9.1 и Transformers 5.14.1 под Python 3.12, один раз загрузите четыре шарда, держите движок резидентным и выполняйте скоринг. Поскольку прямой проход имеет фиксированную форму, P50 и P95 отличаются друг от друга меньше чем на 0,6 миллисекунды, поэтому планирование мощности связано с параллелизмом, а не с хвостовой задержкой. Неудобная часть в том, что он поставляется как импортируемый класс Python, а не как HTTP-сервис, поэтому чтобы им мог воспользоваться продакшен-вызывающий, его придётся обернуть самостоятельно.
ContextPilot-8B требует противоположного подхода: реального пути сервинга, исполнителя инструментов, хранилищ памяти и среды для прогонов с поддержкой ветвления — если вы когда-либо собираетесь переобучать или оценивать её как задумано. Это не модель, которую можно опробовать за один день; это исследовательский фреймворк, который вы внедряете.
Поможет ли здесь роутер?
Отчасти, и честная версия уже, чем обычно. OrcaRouter не включает Intern-Decision-4B, ContextPilot-8B или любой сопоставимый чекпойнт для оценки решений в свой каталог — наши страницы моделей выдают 404 для обоих, и ничто в этом материале не следует воспринимать как заявление о доступности. Что единая точка входа действительно даёт, так это возможность подстраховать неудачный эксперимент фолбэком: один ключ для более чем 200 моделей, прайс-лист провайдера передаётся как есть, с наценкой 0%, и автоматическое переключение при сбое, чтобы оценщик, который вы всё ещё тестируете, никогда не становился единой точкой отказа. Это реальное преимущество для стороны Intern-Decision в данном сравнении, где модель действительно работает дёшево и локально. Для ContextPilot-8B это не имеет значения, поскольку лицензия только для исследований и разработок исключает коммерческий путь, независимо от того, что поддерживает какой-либо роутер.
Так какой же?
Если ваш вопрос имеет закрытый набор ответов, поступает с приложенными доказательствами и требует вероятности, а не объяснения, Intern-Decision-4B — более интересный объект: дешёвый, фиксированной формы, калиброванный по построению и честный в отношении входных данных, которые он не примет. Если ваша проблема в том, что доказательства не перестают поступать, никакой оценщик решений вам не поможет, и ContextPilot-8B нацелен на правильную цель — с той оговоркой, что вы принимаете фреймворк и исследовательскую лицензию, а не модель.
Что могло бы разрешить этот вопрос — это тест, который не провёл ни один из вендоров: дать обоим одну и ту же короткую структурированную задачу на принятие решения, ответ на которую вычислим из состояния, и посмотреть, сохранится ли средний балл оценщика 90.02 за пределами его собственного испытательного стенда. Пока кто-нибудь этого не сделает, правильная интерпретация этого противостояния такова: эти две модели вовсе не конкурируют за один и тот же слот.

