
Intern-Decision-2B тихо выпущен на Hugging Face. Ссылка на GitHub на его карточке только что перестала выдавать 404.
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 584 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 187 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Ранее сегодня карточка модели для internlm/Intern-Decision-2Bуказывала три места, где можно получить дополнительную информацию, и два из них не работали: демо-Space отвечал HTTP 401, а github.com/internlm/Intern-Decisionвозвращал 404 всем, кто по нему кликал. По состоянию на 08:58 UTC репозиторий по второй ссылке существует — публичный, в три коммита глубиной, содержащий код обучения, два бэкенда для инференса, набор для оценки с 10 751 тестовой строкой, калибровочный бенчмарк из 96 случаев и руководство по воспроизведению. Это единственное, что изменилось в этой модели с момента её появления на Hugging Face в 05:36 UTC 26 сентября 2026 года, и этого достаточно, чтобы перевести Intern-Decision-2B из категории «чекпоинт с недоступным README» в категорию «чекпоинт, который действительно можно изучить, воспроизвести и с которым можно поспорить».
Сами веса не изменены и однозначны. Intern-Decision-2B — это мультимодальная структурированная модель принятия решений с 2 213 241 664 параметрами, дообученная на основе Qwen/Qwen3.5-2B — базовой модели Alibaba от 28 февраля 2026 года — выпущенной под Apache-2.0, с сохранённой рядом лицензией исходного Qwen как LICENSE-QWEN. Это средняя из трёх размеров, выпущенных InternLM за сорок секунд: Intern-Decision-0.8B в 05:35:57, эта — в 05:36:19, и Intern-Decision-4B в 05:36:37. За любым из них по-прежнему не стоит никаких объявлений.
Что делает средний размер достойным отдельного материала — так это то, что именно на нём семейство перестаёт вести себя предсказуемо. По собственным данным InternLM, он самый быстрый из трёх и самый плохо откалиброванный из трёх, и оба этих факта стоит понять, прежде чем скачивать четыре с половиной гигабайта чего угодно.
Что подтверждено, а что — только слова вендора
Две категории, и их нельзя смешивать.
Подтверждено, поскольку это листинг файлов или HTTP-ответ: количество параметров (2 592 F32 плюс 2 213 239 072 веса BF16); карта шардов (языковой шард на 3,76 ГБ, визуальная башня на 612,5 МБ, проектор на 50,3 МБ, около 4,43 ГБ тензоров и примерно 4,46 ГБ репозитория); пара лицензий; базовая модель; архитектура в основе (Qwen3_5ForConditionalGeneration с 24 слоями, размером скрытого состояния 2 048, 8 головами запросов против 2 голов ключей-значений, размерностью головы 256, повторяющимся шаблоном из трёх слоёв линейного внимания на один слой полного внимания, одним сохранённым слоем многоточечного предсказания и пределом встраивания в 262 144 позиции); существование репозитория; и тот факт, что коллекция моделей по адресу huggingface.co/collections/internlm/intern-decision теперь разрешается и перечисляет все три контрольные точки.
Заявлено производителем и не воспроизведено: каждый показатель точности, каждый показатель задержки и температура калибровки. Нет статьи, нет записи на arXiv, нет поста о запуске, нет списка изменений и нет независимой оценки — поиск по строке "Intern-Decision" не выдаёт ничего, что относилось бы к этой модели. Демо Space по-прежнему отвечает 401, а это означает, что он не публичен, а не то, что он сломан. У чекпоинта 2B один лайк и ноль загрузок. Никто за пределами InternLM его не запускал.

Контракт инференса, в порядке, в котором это происходит
Самый информативный файл в репозитории — это не карточка. Это src/inference/engine.py и поставляемый вместе с ним inference.py на Хабе, потому что вместе они описывают контракт, а не промпт.
• Вы предоставляете состояние — оцениваемый материал — вопросную схему и, при необходимости, до восьми изображений. От одного до шестнадцати вопросов, до 62 вариантов ответа в каждом.
• Варианты ответа для каждого вопроса сопоставляются с однотокенными символами: A–Z, затем a–z, затем 0–9. Ограничение в 62 варианта — это не дизайнерское предпочтение, а ровно то число однотокенных символов, которое контракт может адресовать.
• Системный промпт, состояние, схема и полный JSON-скелет ассистента рендерятся с одним <decision> плейсхолдером для каждого поля. Шаблон чата чекпоинта и пустой блок размышлений сохраняются как есть.
• Выполняется один каузальный прямой проход. Логиты считываются в позиции непосредственно перед каждым плейсхолдером — не после и не на сгенерированном токене.
• Softmax вычисляется только по допустимым символам-кандидатам этого поля, применяется калибровка чекпойнта, и символы отображаются обратно в исходные значения ваших вариантов.
Карточка прямо говорит, что это такое: «Этот API выполняет структурированное оценивание кандидатов. Он не вызывает generate() и не сэмплирует свободный текст». DecisionEngine(max_length=8192) отвергает слишком большой ввод, а не усекает его, поэтому запрос, который не помещается, явно завершается с ошибкой, а не тихо теряет свой последний абзац. Список бэкендов тоже честен — backend="hf" — это значение по умолчанию и единственный реализованный в репозитории Hugging Face, и это стоит знать, потому что релиз на GitHub также поставляет бэкенд XTuner, а эти двое численно не идентичны. Само руководство InternLM по оценке говорит об этом: «Различия в ядре и BF16 могут менять вероятности и иногда метки».
Аномалия посередине
Поставьте три чекпоинта рядом в собственной таблице InternLM — и картина окажется настолько странной, что сама станет главной историей.
• Среднее по семи наборам — Intern-Decision-0.8B 79.38, Intern-Decision-2B 84.68, Intern-Decision-4B 90.02. Упорядочены, как и следовало ожидать при увеличении весов.
• Задержка на одной RTX 4090 — в среднем 33.98 мс для 0.8B, 33.28 мс для 2B, 44.16 мс для 4B. Средний размер — самый быстрый из трёх, причём разрыв достаточно мал, чтобы его можно было списать на шум на одной GPU, но стабильно проявляется по среднему, медиане (33.15 мс) и P95 (33.55 мс).
• Оценка Брайера, чем ниже, тем лучше — 0.530, 0.437, 0.347. Монотонно по размеру, как обычно и ведёт себя правильное правило оценки.
• Ожидаемая ошибка калибровки, чем ниже, тем лучше — 0,066 для модели 0,8B, 0,100 для этой 2B, 0,065 для 4B. Средний размер — наихудший, и он хуже модели, которая вдвое меньше.
Эта последняя строка — самая интересная, и подобранные температуры скорее подтверждают её, чем объясняют. У каждого чекпоинта есть своя температура, подобранная по NLL: 2,747760550703 для 0.8B, 2,100509348278 для 2B, 1,992418 для 4B. Каждая подбиралась на 1 728 выделенных калибровочных случаях при 1 693 отложенных, путём минимизации отрицательного логарифмического правдоподобия при поиске по обратной температуре в диапазоне [0,01; 100], причём метки тестового набора намеренно не включались в подгонку. Температура 2B находится между температурами двух его собратьев — чего и следовало бы ожидать, если бы аномалия была артефактом подгонки. Но это не так: подобранное значение монотонно по размеру, а ошибка после калибровки — нет. По собственному измерению InternLM, чекпоинт с 2,2 млрд параметров является наименее надёжным из трёх, когда он сообщает вам, насколько он уверен.
Две оговорки, прежде чем это превратится в вывод. ECE с десятью бинами равной ширины и уверенностью по максимальной вероятности — шумная статистика на небольшом наборе, который использует эта таблица, — Jevbench-Hard, 111 заданий, так что весь столбец ECE опирается на сотню с небольшим вопросов и на выбор разбиения. И internlm/Intern-Decision-2B — единственная из трёх карточек, которая не несёт дополнительный раздел о калибровке, имеющийся у карточки 4B, так что документации здесь меньше, а не больше. Воспринимайте 0.100 как повод подобрать собственную температуру, а не как вердикт о весах.

Что добавляет репозиторий и что он всё ещё скрывает
Релиз на GitHub полнее, чем карточка модели, которая сама по себе информативна — лаборатория, задумывавшая артефакт для статьи, обычно не выпускает детерминированный генератор калибровки и набор для оценки с проверкой хешей вместе с лаунчером обучения.
Что теперь находится в открытом доступе: код обучения и цель masked-next-token (символы правильного ответа появляются только в метках, никогда во входных данных; ответ каждого поля предсказывается логитом непосредственно перед его маркером, и все поля используют один прямой проход); семь наборов для проверки точности с хешами, подтверждёнными по SHA-256, и количеством строк; код подсчёта оценки; скрипты подгонки температуры и воспроизведения, причём утверждается, что воспроизведение изменяет ноль решений; эталонный тест калибровки распределения из 96 случаев с его генератором и офлайн-скорингом; и браузерная демонстрация, обслуживаемая на loopback по POST /v1/decisions (с псевдонимом /v1/jev).
Что явно исключено, по словам самого репозитория: «Обучающие данные, приватные записи калибровки/валидации, изображения, конвейеры подготовки и веса модели не включены». В репозитории вообще нет файла лицензии, поэтому условия использования кода не указаны, хотя веса распространяются под Apache-2.0. А состав калибровочного разбиения — какие именно 1 728 случаев и откуда — остаётся нераскрытым, и это то самое упущение, которое ограничивает, насколько можно проверить числа ECE.
Размеры, которые мы действительно обрабатываем, и тот единственный, который — нет
Intern-Decision-2B отсутствует на OrcaRouter. Наша страница модели для него возвращает 404, размещённого эндпоинта для него мы нигде найти не смогли, и ничто здесь не должно восприниматься как заявление о доступности. Единственный способ вызвать его сегодня — скачать чекпойнт и запустить inference.py рядом с весами.
Это важно для решения, ради которого на самом деле написана эта статья, потому что скоринг, который никто не обслуживает, — это скоринг, который вам приходится эксплуатировать самостоятельно. Если решение с закрытым набором вариантов, которое вы пытаетесь принять, по форме близко к тому, что делает это семейство — состояние, типизированные вопросы, калиброванные вероятности, — то хостинговый вариант для сравнения — это Jev 1.13 от TypeSafe, именно та модель, с которой InternLM целенаправленно сравнивался и которая доступна на OrcaRouter по цене $0,042 за миллион входных токенов при контексте 65K и P50 времени до первого токена 178 мс.

Запуск чекпоинта на 2,2 млрд параметров локально и вызов размещённого классификатора — это не одна и та же покупка, но это одна и та же проблема, и наличие обоих на одном ключе с ценой провайдера из прайс-листа, переданной с наценкой 0% — это причина держать сравнение открытым, а не делать ставку в архитектуре на один из них.
Что изменило бы эту картину?
Три вещи, по порядку.
Кому-то за пределами InternLM нужно воспроизвести средний результат 84,68 и ECE 0,100, и именно репозиторий теперь позволяет это сделать — в этом и заключается настоящая новость. Экзамен открыт и проверен по хешу; не хватает только листа с ответами, а лист с ответами — это чекпоинт, который теперь может скачать любой.
Вендору нужно сказать, для чего это. Модель с работающим стеком обучения, опубликованным набором для оценки и без анонса, без лицензии на её код и без хостируемого эндпоинта выглядит как исследовательский релиз, который ещё не решили превратить в продукт. Веса Apache-2.0 говорят в пользу одного; отсутствующая лицензия на код и Space с ошибкой 401 — в пользу другого.
А среднему размеру нужна причина для существования. Если преимущество 2B в скорости над 0.8B реально, но незначительно, а его калибровка — самая слабая из трёх по каждому показателю, опубликованному InternLM, то честная рекомендация для большинства читателей — заплатить в 2,6 раза больше дискового пространства за 4B или смириться с более низкой точностью меньшей модели. Аргумент в пользу 2B — в том, что он оказывается самым быстрым среди быстрых, — и этот аргумент слабее, чем предполагает маркетинговая подача семейства.
