Сгенерированная титульная карточка для Intern-Decision-4B с подзаголовком «структурированная модель принятия решений, которая отвечает, не написав ни одного токена», с тремя чипами с надписями «нет анонса», «три контрольные точки за 40 секунд» и «нет независимых оценок», а в нижнем колонтитуле написано: «Цифры согласно карточке модели InternLM; ничто здесь не воспроизведено независимо». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

Intern-Decision-4B: InternLM выпустила модель принятия решений, которая отвечает, не написав ни одного токена

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Три репозитория моделей появились на странице InternLM на Hugging Face за сорок секунд 26 сентября 2026 года: Intern-Decision-0.8B в 05:35:57 UTC, Intern-Decision-2B в 05:36:19, и internlm/Intern-Decision-4B в 05:36:37. 4B — самый интересный. Это дообученная версия Qwen3.5-4B которая принимает общее состояние, схему именованных вопросов и необязательные изображения и возвращает калиброванное распределение ответов для каждого вопроса за один прямой проход. Она никогда не генерирует текст. В её собственных примечаниях к выпуску прямо сказано: «Этот API выполняет структурированное оценивание кандидатов. Он не вызывает generate() или не сэмплирует свободный текст.» Сорок секунд загрузок — и ни одной строки анонса нигде: ни поста в блоге, ни твита, ни списка изменений, ни страницы запуска. Что есть — это карточка модели, inference.py и четыре шарда safetensors.

A screenshot of the internlm organisation page on Hugging Face, showing the organisation's Recent Activity feed with the Intern-Decision-2B repository listed as published about an hour before the capture, above the organisation's model list and its 18 collections.

Что вошло в релиз, а что нет

Семейство — это первое, что нужно правильно понять, потому что карточка 4B тихо несёт его. В её таблице бенчмарков опубликованы строки для Intern-Decision-0.8B и Intern-Decision-2B наряду с её собственной, и все три чекпоинта появились на хабе в одну и ту же минуту. Репозиторий 2B никогда не связан ссылкой с карточки 4B — его приходится искать через ленту загрузок организации.

Чтоне вышло — это почти всё, что обычно приносит релиз:

• Никакого анонса — ноль упоминаний в сети, ни заявления вендора ни на одном языке, которое мы смогли бы найти.

• Нет демо — карточка ссылается на Space по адресу huggingface.co/spaces/internlm/intern-decision; эта конечная точка отвечает HTTP 401, что означает, что она не является публичной, а не то, что она сломана.

• Нет коллекции — заявленная коллекция моделей по адресу huggingface.co/collections/internlm/intern-decision также возвращает 401.

• Нет репозитория с кодом — ссылка на GitHub в карточке, github.com/internlm/Intern-Decision, возвращает 404, и в списке репозиториев организации InternLM такого проекта нет.

• Нет внедрения — на момент написания у 4B один лайк и ноль скачиваний.

Это вся познаваемая поверхность. Считайте все приведённые ниже числа данными самого вендора, потому что никто другой ещё не запускал эту штуку.

A screenshot of the internlm/Intern-Decision-4B model card on Hugging Face, showing the model title, the Demo, Model Weights and GitHub links, the description naming Qwen3.5-4B as the base model, and the five-step 'How inference works' list describing single-token symbol mapping, the assistant JSON skeleton, one causal forward pass, a softmax over candidate-symbol logits, and probability calibration.

Контракт инференса — это продукт

Большая часть карточки посвящена процедуре из пяти шагов, которая говорит о том, куда ушли инженерные усилия. Вопросы и варианты сохраняют свой порядок. Варианты каждого вопроса отображаются на однотокенные символы — A до Z, затем a до z, затем 0 до 9. Это 62 символа, и именно поэтому карточка ограничивает вопрос 62 вариантами. Промпт формируется из исходного системного промпта, состояния, схемы решения и полного JSON-скелета ассистента с одним <decision> плейсхолдером на каждое поле, сохраняя шаблон чата чекпоинта и пустой блок размышлений. Затем один прямой проход с причинной маской. Логиты считываются в позиции непосредственно перед каждым плейсхолдером, softmax вычисляется только по разрешённым логитам символов-кандидатов этого поля, применяется калибровка, а символы сопоставляются обратно со значениями ваших вариантов.

Следствие — фиксированная форма: никакого цикла декодирования, никакой выборки, никакого парсера, никакой поверхности для галлюцинаций и жёсткий потолок в одно решение на вопрос за проход. Поддерживаются три типа вопросов — choice с упорядоченной картой критериев, score со списком или словарём с числовыми ключами, и noul, бинарный нет/да.

Самая важная деталь в спецификации

В карточке прямо указано, что входные данные «отклоняются без усечения» свыше DecisionEngine(max_length=8192). Если прочитать это вместе с конфигурацией, всплывает кое-что странное: лежащая в основе текстовая башня объявляет max_position_embeddings равным 262,144. Бэкбон может адресовать четверть миллиона токенов; выпущенная обёртка отказывается принимать что-либо свыше 8,192. Это не модель с длинным контекстом и консервативным значением по умолчанию — это модель оценки решений, чья собственная обвязка ограничивает объём свидетельств, который вы можете ей передать. Если ваш вопрос маршрутизации зависит от более чем примерно восьми тысяч токенов состояния, этот чекпойнт в том виде, в каком он выпущен, не ответит на него и откажется, а не урежет ваш ввод.

Разрешено до восьми изображений, и в карточке отмечено, что токены изображений учитываются в пределах того же лимита в 8 192.

A generated timeline card titled 'Three checkpoints, forty seconds', listing Intern-Decision-0.8B at 05:35:57 UTC, Intern-Decision-2B at 05:36:19 UTC and Intern-Decision-4B at 05:36:37 UTC on 26 September 2026, with a footer reading 'Upload timestamps from the InternLM organisation feed on Hugging Face. No announcement accompanied any of the three.' The OrcaRouter logo is composited in the bottom-right corner.

Внутри весов

Четыре шарда, 4,54 млрд параметров BF16 и конфигурация, объясняющая название размера: есть текстовая башня, визуальная башня примерно из двух десятков слоёв с размером патча 16 пикселей и проектор между ними. Текстовая часть — это 32 слоя при размере скрытого слоя 2 560, с 16 головами внимания против 4 голов ключей/значений, словарём на 248 320 токенов и связанными эмбеддингами. Типы слоёв чередуются с фиксированным интервалом — три слоя линейного внимания, затем один слой полного внимания, и так повторяется. Только слои полного внимания реализуют глобальное внимание, а ротационное встраивание является частичным с коэффициентом 0,25. Для его загрузки требуются Python 3.12 или новее, PyTorch 2.9.1 и Transformers 5.14.1, а список файлов всё ещё включает файлы tokenizer, merges и vocabulary, а не полагается на токенизатор на стороне хаба.

Цифры и кто их произвёл

Всё в этом разделе было измерено InternLM и опубликовано в карточке модели. Ничего из этого не было воспроизведено третьей стороной, и нигде нет ни записи в Artificial Analysis, ни рейтинга в арене, ни строки в таблице лидеров для этой модели.

На семи наборах оценки модель 4B в среднем набирает 90.02, при Brier score 0.347 и ожидаемой ошибке калибровки 0.065. В той же таблице Intern-Decision-0.8B указана с 79.38, а Intern-Decision-2B — с 84.68, так что семейство растёт с размером: 4.7 балла от 0.8B до 2B, а затем ещё 5.3 до 4B. В таблице также есть пять строк, которые поставщик не обучал: Jev с 88.74, JevK5 с 85.16, SemIf с 84.23, Kev с 79.56 и Laya с 57.77. Их прогоняла InternLM на собственном стенде против собственного чекпойнта InternLM. Это не собственные числа тех проектов, и воспринимать их как таковые — самая лёгкая ошибка, которую здесь можно допустить.

Задержка измеряется на одной RTX 4090 через локальный путь Hugging Face, и в карточке отмечено, что значения зависят от рабочей нагрузки и аппаратного обеспечения. У 4B среднее — 44,16 мс, медиана — 44,03 мс, а на P95 — 44,60 мс: разброс между медианой и хвостом намного меньше миллисекунды, именно так выглядит прямой проход с фиксированной формой. Оба меньших чекпоинта показывают около 33 мс, при этом 2B немного опережает 0.8B по среднему и медиане, и это стоит отметить, а не сглаживать: эти два настолько близки, что разница между ними находится в пределах шума измерений.

Калибровка и честные оговорки в ней

Чекпоинт поставляется с температурой по умолчанию 1.99241824, подобранной отдельно для этой модели путём минимизации отрицательного логарифмического правдоподобия на 1,728 выделенных калибровочных случаях, при этом 1,693 отложены для валидации. В карточке указано, что метки тестового набора не использовались для её выбора. Реализация представляет собой калибровку вероятностей кандидатов, а не температуру сэмплирования: она изменяет уверенность, бинарную вероятность и ожидаемую оценку, не затрагивая решение argmax.

Отдельная диагностика на 96 случаях затем сообщает об эффекте. В собственных столбцах InternLM «до» и «после» общие показатели Brier и ECE у 4B меняются с 0,628 / 0,213 до 0,550 / 0,089 против 0,595 / 0,130 у Jev. Два честных прочтения этой таблицы: калибровка явно работает, а столбец «до» — это не то, что когда-либо увидел бы любой пользователь, поскольку поставляемое по умолчанию значение — это подобранная температура. Также стоит отметить: две из шести диагностических категорий хуже для 4B, чем для Jev, а худшая из них — «ежедневные свидетельства и предвзятость наблюдения» — улучшается до 0,575 / 0,210, но всё ещё уступает показателю Jev 0,603 / 0,114. На этом срезе калибровка сужает разрыв, но не закрывает его.

Где роутер уместен, а где пока нет

Практическое препятствие к использованию этой модели — не точность, а упаковка. Релиз поставляется в виде класса Python, который вы импортируете после загрузки четырёх шардов, а не HTTP-эндпоинта, который можно вызвать. Именно этот разрыв и призван закрыть слой маршрутизации — один ключ для более чем 200 моделей, цена провайдера по прайс-листу передаётся с наценкой 0% и автоматическое переключение при нестабильной работе провайдера — но будем откровенны: OrcaRouter сейчас не предоставляет Intern-Decision-4B или какую-либо модель такого рода. В нашем каталоге она не указана, и ничто здесь не следует воспринимать как заявление о доступности. Что мы можем предложить — так это более дешёвое решение: если вы хотите попробовать модель оценки решений на 4,5 млрд параметров перед продакшен-путём, вы можете встроить её в маршрутизатор с откатом к универсальной модели, чтобы неудачный день калибровки стоил вам повторной попытки, а не простоя.

Что бы изменило картину?

Три вещи, в порядке важности. Кто-то за пределами InternLM должен воспроизвести среднее 90.02 и ожидаемую ошибку калибровки 0.065 — утверждения о калибровке, которые никогда не проверялись на внешнем тестовом наборе, — это наименее переносимые числа в машинном обучении. Собственный след карточки должен быть виден: Space, коллекция, репозиторий GitHub. И поставщику нужно сказать, является ли это продуктом или артефактом статьи, потому что лицензия только для исследований и лицензия Apache-2.0 — это не одно и то же обязательство, а 4B выбрала Apache-2.0 с сохранённой наряду с ней лицензией Qwen. До тех пор правильная формулировка — та, которую подсказывает сама загрузка: это настоящий чекпойнт с настоящим контрактом инференса и полностью непроверенной оценочной картой, опубликованный так, что никому об этом не сообщили.

Пока что честное резюме таково: оно узкое и полезное. Если ваша задача — «выбрать одну из пяти меток маршрутизации и сказать, насколько вы уверены», то модель на 4,5B, которая выдаёт 62 логита и никакого связного текста, — это оправданный вариант для оценки. Если ваша задача включает длинный документ, больше восьми изображений или любую необходимость объяснить ответ словами, этот чекпойнт в том виде, как он поставляется, — неподходящий инструмент, и никакая полировка вендорских бенчмарков этого не изменит.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube