
Intern-Decision-0.8B появился без анонса: что InternLM тихо выложил на Hugging Face
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 592 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 187 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Ссылка на GitHub в карточке модели возвращает 404. Демо-Space возвращает 401. Нигде нет ни коллекции, ни поста в блоге, ни технического отчёта, ни результата поиска по строке «Intern-Decision», который не был бы объявлением о стажировке, — и всё же Intern-Decision-0.8B прямо сейчас лежит на Hugging Face как полноценный, доступный для скачивания чекпоинт под лицензией Apache-2.0, дообученный на основе Qwen3.5-0.8B и загруженный глубокой ночью 26 сентября 2026 года вместе с двумя более крупными собратьями, появившимися в те же три минуты: Intern-Decision-2B и Intern-Decision-4B. InternLM уже выпускала продукты таким образом и раньше, и именно поэтому всё ниже собрано из самого репозитория, а не из анонса. Это различие здесь важнее, чем обычно: репозиторий говорит, что существует, а только вендор может сказать, для чего это.
То, что репозиторий действительно сообщает, причём подробно, достаточно необычно, чтобы это стоило прочитать. Это не чат-модели и не малые языковые модели в обычном смысле. Intern-Decision-0.8B принимает фрагмент состояния, схему именованных вопросов, которые вы пишете заранее, и, опционально, до восьми изображений, и возвращает распределение ответов для каждого вопроса за один прямой проход. Он никогда не вызывает generate(). Он никогда не выполняет семплирование. Нет текстового вывода, который нужно было бы парсить, нет JSON, который нужно было бы чинить, нет цикла повторных попыток вокруг фигурной скобки, которая так и не закрылась. Узость — это вся архитектура, и она помещает эту модель в ту же небольшую категорию, что и Jev 1.13 от TypeSafe и Laya от Convai — категорию, с которой InternLM, очевидно, намеренно сравнивалась в бенчмарках, потому что Jevbench — это собственный бенчмарк TypeSafe, и он является первым столбцом таблицы.
Вот что можно узнать из чекпоинта, что лишь заявляется чекпоинтом, и что никто за пределами InternLM сейчас вообще не может сказать.
Что на самом деле находится в репозитории
Карточка короткая и откровенная в отношении происхождения. Intern-Decision-0.8B описывается как «мультимодальная структурированная модель принятия решений, дообученная на основе Qwen3.5-0.8B» — базы Qwen, выпущенной 28 февраля 2026 года, — а в репозитории рядом с условиями Apache-2.0 лежит второй файл лицензии, LICENSE-QWEN, что и положено делать производной модели и само по себе является небольшим сигналом честности. Индекс Hugging Face сообщает о 852 985 920 параметрах, распределённых по трём шардам: языковой шард объёмом 1,50 ГБ, визуальный шард объёмом 176 МБ и проектор объёмом 25 МБ. Общий объём репозитория — около 1,73 ГБ, включая файлы токенизатора, что позволяет с комфортом разместить всё это на одной потребительской GPU или на ноутбуке с хорошей конфигурацией.
Конфигурация раскрывает архитектуру, которую Qwen выпускает на протяжении поколения 3.5, а не индивидуально разработанную сеть принятия решений. Это Qwen3_5ForConditionalGeneration с 24 слоями, организованными в повторяющийся шаблон: три слоя линейного внимания на один слой полного внимания, размер скрытого состояния 1,024, 8 голов внимания против 2 голов ключ-значение, размерность головы 256 и максимальное позиционное встраивание на 262,144 токена. Сохраняется один слой предсказания нескольких токенов. Визуальный путь настоящий: текст карточки описывает обработку изображений, процессор принимает изображения, а чекпойнт поставляется с визуальной башней и проектором для его обслуживания — так что мультимодальный тег в репозитории подкреплён весами, а не только тегами.
На семейную картину стоит обратить внимание, потому что она определяет, как читать всё остальное. InternLM загрузил три размера за 40 секунд: 0.8B, затем 2B, затем 4B. Количество параметров — 852 985 920, 2 213 241 664 и 4 539 265 536. Карточка модели 4B содержит дополнительный раздел — пилотную калибровку по известному распределению на 96 примерах с оценками до и после — которого нет в карточке 0.8B. Эта асимметрия не свидетельствует о дефекте в маленькой модели; она свидетельствует о том, что документация маленькой модели была написана при меньшем бюджете, а тихий релиз выглядит именно так.
Как на самом деле работает путь инференса
Входящий в комплект inference.py — самый информативный файл в репозитории, потому что он документирует контракт, а не промпт. Последовательность выглядит так:
Вы предоставляете запрос с состоянием (тем, что оценивается), вопросами (схемой) и, при необходимости, изображениями.
• Варианты каждого вопроса сопоставлены с однотокенными символами — от A до Z, затем строчные буквы, затем цифры, до 62 вариантов на вопрос.
• Системный промпт, состояние, схема и полный JSON-скелет ассистента отображаются с одним плейсхолдером <decision> для каждого поля.
• Выполняется один прямой проход причинной модели. Логиты считываются в позиции непосредственно перед каждым плейсхолдером.
• Softmax вычисляется только по допустимым символам-кандидатам этого поля, применяется калибровка контрольной точки, и символы отображаются обратно в ваши исходные значения опций.
Движок предоставляет три типа вопросов. choice принимает упорядоченный объект, сопоставляющий значения вариантов с описаниями. score принимает список — который становится строкой "0", "1", "2" и так далее — или упорядоченный объект с конечными числовыми строковыми ключами, позволяя модели возвращать вероятностно-взвешенное ожидаемое значение, а не только категорию. noul — это бинарное решение, в котором «нет» стоит перед «да». Ответ возвращает для каждого поля калиброванное распределение вероятностей, уверенность, равную максимальной вероятности кандидата, решение argmax с лексикографическим разрешением ничьей, а для вопросов score — числовое значение и легенду. Ограничения явные: от одного до 62 вопросов на запрос, до 62 вариантов в каждом, предел входных данных по умолчанию в 8 192 токена, который отклоняется, а не усекается, и максимум восемь изображений, токены которых учитываются.
Две детали в этом списке заслуживают внимания, потому что они определяют, можно ли доверять результату. Первая: в промпт не вставляются эталонные ответы — модель оценивает кандидатов, ответ на которых ей не показывали. Вторая: usage.output_tokens — это не подсчёт текстовых токенов; он считает оценённые поля. Любой, кто встроит это в существующий расчёт бюджета токенов, будет этим удивлён, и в карточке об этом сказано, а не оставлено на самостоятельное обнаружение.

Таблица бенчмарков, и насколько ей можно верить
Читатель, будьте начеку в этом разделе: все числа ниже заявлены вендором и не воспроизведены. InternLM выбрала бенчмарки, выбрала модели для сравнения, провела оценки и опубликовала таблицу. Нет ни одного независимого прогона Intern-Decision-0.8B ни в одном публичном лидерборде, а поиск по Artificial Analysis вообще ничего не возвращает по этой модели. Это не делает таблицу ложной. Это делает её непроаудированной, и это означает, что столбцы наиболее полезны для понимания формы результата, а не его уровня.

• Jevbench, три разбиения — Intern-Decision-0.8B набирает 97,92 на Easy, 80,56 на Original и 52,25 на Hard. Jev от TypeSafe достигает 100,00, 98,61 и 72,07 на тех же разбиениях.
• Типизированное решение — модель 0.8B набирает 77,35 против 73,35 у Jev. Это единственная колонка, где самая маленькая модель среди участников превосходит модель, в честь которой назван бенчмарк.
• ToolACE — 94,52 для модели 0,8B против 91,29 у Jev. ToolACE — это бенчмарк на вызов функций, и решающая голова, превосходящая Jev в выборе инструментов, — самое весомое утверждение в таблице.
• AG News — 88,61 против 89,57 у Jev. Практически на уровне переднего края этой категории в четырёхклассовой классификации тем.
• WildJailBreak — 64,48 против 96,29 у Jev. Это и есть обвал. Пожалуй, именно этот столбец важнее всего для модели, которую вы бы направили на недоверенный ввод, и именно в нём модель 0,8B дальше всего от эталона.
• Среднее — 79,38 для 0,8B, 84,68 для его собственного 2B-собрата, 90,02 для 4B. Семейство круто поднимается, что как раз и ожидаешь, и само по себе является слабым аргументом в пользу того, что таблица не была задним числом подогнана, чтобы польстить флагману.
• Калибровка — Brier 0.530 и ожидаемая ошибка калибровки 0.066 для модели 0.8B. Jev сообщает 0.358 и 0.095. Если рассмотреть эти два показателя вместе, возникает более ясная картина, чем даёт любое из чисел по отдельности: модель 0.8B калибрована лучше, чем Jev, в смысле ECE — её заявленные уровни уверенности точнее соответствуют её фактической точности — и при этом она существенно менее точна в целом. Это правдоподобный профиль для небольшой модели с намеренно подобранной температурой, и это не то лестное сочетание, которое можно опубликовать случайно.
Набор для сравнения обладает одной бросающейся в глаза особенностью: в нём доминируют модели принятия решений. Присутствуют все — Jev, Laya, SemIf, Kev и JevK5; собственный бенчмарк в таблице принадлежит TypeSafe. InternLM решила измеряться на поле конкурента, используя инструментарий конкурента, а затем опубликовала столбцы, в которых её самая маленькая модель проигрывает. Это то самое решение, которое принимает команда, когда не планирует маркетинговую кампанию вокруг релиза, — и это согласуется со всем остальным в том, как он вышел.
Температура калибровки — самое интересное число.
Intern-Decision-0.8B подбирает температуру по умолчанию, равную 2.747760550703, путём минимизации NLL на 1 728 выделенных калибровочных примерах и 1 693 отдельных проверочных примерах. В карточке прямо указано, что метки тестового набора не использовались для её выбора. Применяемое преобразование: p = softmax(candidate_logits.float()), затем calibrated_p = softmax(log(p) / T).
Это калибровка вероятностей кандидата, а не температура сэмплирования, и это различие не из области педантизма. Поскольку преобразование применяется после softmax и сохраняет порядок, оно вообще не может изменить решение argmax. Оно сдвигает уверенность, noul-вероятность «да» и ожидаемое значение вопроса с оценкой — и оставляет главное решение неизменным. Если ваш рабочий процесс читает метку, температура не даёт никакого эффекта. Если ваш рабочий процесс читает вероятность — применяет к ней порог, ранжирует по ней или передаёт её в нижестоящий расчёт ожидаемого значения — температура определяет разницу между числом, которое что-то значит, и числом, которое не значит ничего. Передача temperature=1 возвращает некалиброванное распределение, что является полезным обходным путём для всех, кто хочет применить поверх него собственную калибровку.
Температура подбирается отдельно для каждого чекпойнта, а не является общей. Модель 4B использует другое значение — 1.99241824, и карточка предписывает использовать модуль инференса, поставляемый вместе с тем размером модели, который вы скачали, чтобы его калибровка по умолчанию совпадала. Любой, кто скопирует обёртку для инференса с одной родственной модели на другую, незаметно применит неверную температуру.
Тридцать четыре миллисекунды — и результат, который не должен быть возможным.
InternLM измерил сквозную задержку на один запрос на одной RTX 4090, используя локальный путь Hugging Face — это реальное измерение, но также и самая медленная возможная конфигурация обслуживания, поскольку в производственном развёртывании использовалась бы скомпилированная среда выполнения или среда с пакетной обработкой. Jev указан со средним значением 109,70 мс и медианой 106,30 мс при p95 146,70 мс. Intern-Decision-0.8B показывает 33,98 / 33,44 / 37,50 мс.
Число, на котором стоит остановиться, — это 2B-собрат: 33,28 мс в среднем, 33,15 мс по медиане. 2B быстрее чем 0.8B — на величину, достаточно малую, чтобы сойти за шум, но не в том направлении, которое предсказывают значения числа параметров. Это не ошибка в таблице, и дело тут на самом деле не в моделях. Модель принятия решений выполняет ровно один прямой проход по промпту, длина которого задаётся состоянием, схемой и описаниями вариантов — а не тем, что пишет модель, потому что она не пишет ничего. Для промптов в таком режиме доминирует обработка промпта, а число параметров — это стоимость второго порядка. Практическое следствие: обычная причина тянуться к самому маленькому чекпоинту — вы платите за токен — здесь не работает. Настоящая причина выбрать 0.8B вместо 2B — это объём занимаемой памяти и тот факт, что весь его репозиторий укладывается в 1,73 ГБ, а не пропускная способность.
Что пока невозможно установить
Это та часть, на которую ответил бы пост о запуске, а репозиторий — не может.
Не указана дата выпуска, нет анонса и ничего в публичных каналах InternLM, описывающего это семейство. URL GitHub, напечатанный на карточке модели, не открывается. Демо Space, указанное в карточке, недоступно для публичного просмотра. Нет коллекции, объединяющей три чекпоинта, а значит, единственный способ найти 2B или 4B — посмотреть список моделей организации. Нет статьи, поэтому обучающие данные, рецепт тонкой настройки, количество шагов обучения и то, что «decision tuning» изменил в весах, — всё это не указано. Нет независимой оценки, нет стороннего воспроизведения задержки, и пока нет свидетельств того, что кто-либо за пределами InternLM запускал этот чекпоинт.
Есть ещё два вопроса, которые карточка поднимает, но не отвечает на них. Первый — что означает разрыв WildJailBreak на практике: дефицит устойчивости к отказам такого размера является свойством файнтюна, и то, отражает ли он базовую модель, цель decision-tuning или небольшое число параметров, — это не то, что вам сообщит репозиторий. Второй — что происходит на верхнем пределе входа. Запросы длиннее 8 192 токенов отклоняются, а не усекаются, что является правильным поведением для модели оценки, но это означает, что практическое окно контекста — не 262 144, как заявлено в конфигурации, а то, что помещается в 8 192 токена состояния, схемы, опций и фрагментов изображения. Для длинных документов с богатыми схемами этот предел наступает раньше, чем можно предположить по схеме архитектуры.
Где это находится и как попробовать, не делая на это ставку
Честная формулировка такова: Intern-Decision-0.8B — это выпущенный чекпойнт с не подтверждёнными аудитом заявлениями и без сопроводительной документации. Такое сочетание — не причина игнорировать его — релиз весов под Apache-2.0, который можно скачать и измерить за полдня, лучше, чем API с листом ожидания, — но оно означает, что бремя проверки лежит на вас. Движок загружается из локального каталога, работает на GPU класса 4090 или слабее, а карточка содержит готовый запрос, который можно вставить. День оценки на ваших собственных размеченных случаях расскажет вам о столбце WildJailBreak больше, чем таблица поставщика.
Если вы оцениваете именно слой принятия решений, полезный объект для сравнения — это хостинговое решение. Модель Jev 1.13 от TypeSafe — это та модель, с которой InternLM проводила сравнение, и сегодня её можно вызвать через единую OpenAI-совместимую конечную точку по цене $0.042 за миллион входных токенов, при этом вывод тарифицируется по нулевой ставке — по той же цене, которую публикует вендор, потому что OrcaRouter передаёт списочную цену провайдера без наценки, а не добавляет маржу сверху. Разместить собственный 0.8B-блок принятия решений и хостинговый API принятия решений на одном и том же ключе, в тот же день — это значительно более дешёвый эксперимент, чем оформление двух отдельных договоров, чтобы ответить на один и тот же вопрос.

Что изменило бы эту картину — это не бенчмарк. Это появление репозитория на GitHub, или публикация InternLM рецепта тонкой настройки, или первый независимый запуск чекпоинта, попадающий в таблицу лидеров. Пока не произойдёт одно из этого, точное описание Intern-Decision-0.8B — узкое и нелестное и полностью в его пользу: веса настоящие, контракт инференса задокументирован лучше, чем удаётся большинству запущенных моделей, а маркетинг ещё не начался.
