
Intern-Decision-4B против Qwen 3.8: 44-миллисекундный прямой проход против 2,4 триллиона параметров
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 592 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 187 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
InternLM опубликовала Intern-Decision-4B на Hugging Face утром 26 сентября 2026 года — без анонса, без записи в блоге, ссылка на GitHub на самой карточке модели возвращает 404, а демо-Space — 401. Веса настоящие и доступны для скачивания; анонса нет. А модель, лежащая в их основе, — это файнтюн Qwen3.5-4B, и именно поэтому сравнение с размещённым у провайдера флагманом стоит больше, чем спецификация. Эти двое не соперники. Это два конца одного конвейера, и весь вопрос в том, где проходит граница между ними. В основе лежит модель с 2,4 триллиона параметров, которую вендор опубликовал в августе и теперь предоставляет как Qwen3.8-Max, с тарификацией $2.00 и $6.00 за миллион токенов; Intern-Decision-4B — это пересборка той семимесячной базовой модели с 4,54 миллиарда параметров, которая вообще не выдаёт токенов, отвечает до шестнадцати типизированных вопросов за один прямой проход и ничего не стоит за вызов, потому что нет вывода, за который можно выставить счёт.
Однострочный ответ: если ваша задача — это решение с закрытым набором ответов, Intern-Decision-4B примерно в пятьдесят раз быстрее на одно решение и структурно дешевле, и никакая фронтирная модель не превзойдёт её на этой узкой оси. Если ваша задача — что-то другое: рассуждение, длинный контекст, использование инструментов, что угодно, где ответ ещё не перечислен в вашем промпте, — Qwen 3.8 не просто лучше, это единственная из двух, которая вообще способна выполнить задачу. Всё ниже — о том, чтобы точно найти эту границу.
Что действительно подтверждено, а что — нет
Начнём с фактов, потому что важна подача. Для Intern-Decision-4B нет анонса от вендора. Ни пресс-релиза, ни статьи, ни описания репозитория, которое можно было бы прочитать. Что есть сегодня — это репозиторий Hugging Face, опубликованный сегодня утром в организации internlm — Intern Large Models, группа Shanghai AI Laboratory — под лицензией Apache 2.0, рядом с которой сохранена вышестоящая лицензия Qwen в файле LICENSE-QWEN. Два родственных чекпоинта появились с разницей не более сорока секунд друг от друга: Intern-Decision-0.8B на 853 млн параметров и Intern-Decision-2B на 2,21 млрд. Все три несут одни и те же теги — decision-making, multimodal, structured-prediction — и все три входят в одну коллекцию моделей, которая пока не открывается публично.
Что не подтверждено: является ли это финальным релизом или ранним пушем. Репозиторий был создан в 05:36 UTC и снова изменён до 08:00 UTC в тот же день, а дальнейшая публичная активность в соседних чекпоинтах продолжалась и после 09:00. InternLM не сообщила, каким должен быть предполагаемый сценарий развёртывания, не опубликовала репозиторий, на который ссылается, и не сказала, появится ли хостируемый эндпоинт. Считайте все показатели бенчмарков в этой статье заявленными вендором и невоспроизведёнными — потому что на момент написания буквально нигде больше ничего не было написано об этой модели. Три отдельных пути поиска не дают ничего по этому названию.

Архитектурная ставка: оценщик, а не генератор
Самое важное предложение в собственной документации Intern-Decision-4B — отрицательное: путь вывода «не вызывает generate() и не генерирует свободный текст.» Это не деталь реализации, это весь дизайн, и именно это отличает его от вызова Qwen3.8-Max с JSON-схемой и надежды, что скобка закроется.
Вот механизм, как его описывает карточка. Вы передаёте модели общее состояние, схему именованных вопросов и, опционально, до восьми изображений. Каждый вопрос относится к одному из трёх типов: выбор (выбрать один из упорядоченного набора вариантов), оценка (оценить по порядковой шкале, возвращается как вероятностно взвешенное ожидаемое значение) или noul (бинарный нет/да). Системный промпт, состояние, схема и полный JSON-скелет ассистента рендерятся с одним плейсхолдером на каждое поле. Затем — и это трюк — модель выполняет один причинный прямой проход, и логиты считываются в позиции непосредственно перед каждым плейсхолдером. Softmax берётся только по разрешённым символам-кандидатам этого поля, применяется калибровка чекпоинта, и символы отображаются обратно в ваши исходные значения вариантов.
Последствия конкретны. Поскольку пространство ответов каждого поля собирается на каждый запрос, а не зашито в голову словаря, схема, которую вы придумаете сегодня днём, не требует переобучения — добавьте вопрос, и варианты становятся кандидатными символами для этого поля. Поскольку нет цикла декодирования, нет выходного токена, нет скобки, которую можно забыть, и нет логики повторных попыток при некорректном JSON. И поскольку все вопросы оцениваются по одному и тому же чтению состояния, шестнадцать вопросов стоят одного прямого прохода, а не шестнадцати.
Ограничения столь же конкретны, и карточка излагает их без оговорок. От одного до шестнадцати вопросов, до 62 вариантов на вопрос, до восьми изображений. Максимум по умолчанию — 8 192 токена, а входные данные, которые его превышают, отклоняются без усечения. На последней оговорке стоит остановиться: тихое усечение — это способ, которым классификатор незаметно начинает отвечать не на тот вопрос, который вы задали, и InternLM вместо этого выбрал громкий отказ. Это правильное решение, и в то же время операционная ловушка, потому что длинный тред тикета плюс схема плюс изображения перевалят за 8 192 быстрее, чем вы ожидаете, и изящного пути нет — вы получаете ошибку.
Где Intern-Decision-4B побеждает, причём с большим отрывом
Две оси, и обе они носят структурный, а не инкрементальный характер.
• Задержка на одно решение — 44,16 мс в среднем, 44,03 мс медиана, 44,60 мс на p95, измерено на одной RTX 4090 через локальный путь Hugging Face. По сравнению с Qwen3.8-Max, чьё текущее семидневное окно в нашей собственной песочнице показывает p50 в 2 474 мс и p95 в 9 789 мс при 55,4 выходных токена в секунду. Это примерно 56× по медиане, и сравнение не столько несправедливо, сколько представляет собой сравнение между двумя разными операциями: одна модель классифицирует, другая рассуждает, а затем пишет. Разрыв реален, и причина для него тоже.
• Стоимость за решение — и здесь речь об арифметике, а не о мнении. Возьмём реалистичный вызов для триажа обращений в поддержку: 800 входных токенов состояния и схемы и 150 выходных токенов структурированного JSON. На Qwen3.8-Max это 800 × $2,00/M плюс 150 × $6,00/M, или около $0,0025 за решение, ещё до единого токена рассуждения — а Qwen3.8-Max является моделью рассуждений, так что выходная сторона оптимистично мала. Миллион решений стоит примерно $2 500. Те же миллион решений на Intern-Decision-4B стоят ноль токенов и около 12,3 часов времени RTX 4090. У Intern-Decision-4B нет цены за выход, потому что у неё нет выхода.
Компромисс честный и очевидный: 4B-модели нужен GPU, которым вы владеете или который арендуете, она занимает этот GPU и всегда способна делать только одно. Но если это одно — то, что ваш продукт делает миллионы раз в день, вся приведённая выше арифметика и есть всё бизнес-обоснование, и никакие возможности фронтирных моделей этого не меняют.
Число, которое Qwen 3.8 не публикует: калибровка
Это тихий отличительный фактор, и именно его упустит большинство сравнений, потому что он не выглядит как бенчмарк.
Intern-Decision-4B возвращает распределение по значениям ваших вариантов, а не просто метку, — плюс оценку уверенности, а для noulвопросов — калиброванную вероятность ответа «да». InternLM сообщает о Brier score 0,347 и ожидаемой ошибке калибровки 0,065 по собственному набору тестов и поставляет подобранную температуру прямо в чекпоинте: 1.99241824, подобранную отдельно для этого размера путём минимизации отрицательного логарифмического правдоподобия на 1 728 специально выделенных калибровочных случаях при 1 693 отложенных валидационных случаях. Метки тестового набора не использовались при её выборе. В карточке есть также второй, независимый диагностический набор из 96 случаев, использующий точные эталонные распределения, а не выборочные метки; он показывает, что общие показатели Brier/ECE снижаются с 0,628 / 0,213 до калибровки до 0,550 / 0,089 после — этап калибровки сокращает ожидаемую ошибку более чем вдвое.
А теперь поищите тот же показатель на стороне Qwen 3.8. Его там нет. Alibaba публикует оценки Artificial Analysis Index, GPQA Diamond, terminal-bench, SciCode, tau-banking и long-context recall — всё это показатели возможностей. Она не публикует ни одной метрики калибровки ни для одного представителя семейства Qwen 3.8, потому что уверенность генеративной модели — не та величина, которую поставляет вендор. Если вашей системе нужна вероятность, которую можно использовать для порога или маршрутизации, а не ответ, которому она должна доверять, это различие не является различием в степени. Одна модель даёт вам число с документированной частотой ошибок; другая даёт вам текст, и вы строите вокруг него собственную оценку уверенности.
Там, где Qwen 3.8 выигрывает, причём с большим отрывом.
Сопоставьте их по тому, что им можно поручить, — и границы перестанут быть тонкими.
• Контекст — Qwen3.8-Max несёт окно в 1 000 000 токенов. Intern-Decision-4B отклоняет всё, что выходит за пределы 8 192. Это разница в 122 раза, и обходного пути нет, потому что ограничение на вход применяется принудительно, а не усекается.
• Модальность ввода — Qwen3.8-Max принимает текст, изображения и видео. Intern-Decision-4B принимает текст и изображения, до восьми, а токены изображений учитываются в том же бюджете в 8,192.
• Рассуждения и инструменты — Qwen3.8-Max среди заявленных возможностей поддерживает использование инструментов, режим JSON и рассуждения, а также занимает 45,4 в Artificial Analysis Intelligence Index — пятнадцатое место среди 145 проиндексированных моделей, с показателем AA Coding 76,2 на девятом месте из 138. Это независимые данные, опубликованные Artificial Analysis, а не заявления производителя. У Intern-Decision-4B нет записи в Artificial Analysis, нет никаких независимых оценок и нет способности рассуждать, планировать или вызывать что-либо.
• Вывод в свободной форме — пишет Qwen3.8-Max. Intern-Decision-4B не может создать абзац, обоснование или план. Он может только оценивать варианты, которые вы уже догадались перечислить.
Также стоит отметить на стороне открытых весов: если вам нужно само ядро Qwen 3.8, а не хостинговый вариант, Qwen3.8-27B — это его плотный собрат: 27,8 млрд параметров, Apache 2.0, контекст на 262 144 токена и примерно $0,33 / $2,40 за миллион токенов там, где он предоставляется. Он набирает 33,7 балла в AA Intelligence Index. Он всё ещё на порядок крупнее Intern-Decision-4B, всё ещё генеративный и всё ещё неподходящий инструмент для принятия решений по закрытому набору при больших объёмах — но это честный промежуточный вариант и единственный из трёх, который одновременно по-настоящему дёшев и по-настоящему способен.

Честное прочтение собственной таблицы бенчмарков InternLM
Карточка Intern-Decision-4B содержит сравнительную таблицу, и то, что отсутствует в ней, информативнее того, что в ней есть. Строки — Jev, Laya, SemIf, Kev, JevK5, а также собственные 0.8B и 2B от InternLM. Каждая из них — ещё одна запись из числа System One или decision-моделей: Jev от TypeSafe AI, Laya от Convai Innovations и ещё три. Все цифры заявлены вендорами на собственных тестовых стендах InternLM. В таблице вообще нет ни одной фронтирной модели.
Это не недосмотр. Это честные границы заявления. Указанное в заголовке среднее значение Intern-Decision-4B — 90.02 по семи наборам тестов: Jevbench-Easy 100.00, Jevbench-Original 98.61, Jevbench-Hard 73.87, Typed Decision 80.55, ToolACE 96.45, AG News 90.82, WildJailBreak 89.86 — представляет собой заявление о лидерстве в категории моделей принятия решений; на этой таблице она действительно лидирует, превосходя показатели Jev 88.74 и Laya 57.77. Это не заявление о конкуренции с Qwen 3.8, и InternLM нигде такого заявления не делает. Карточка модели ограничена своей собственной категорией, и трактовать победу в категории как победу по способностям — именно та ошибка, которую призван предотвратить этот раздел.
Ещё две оговорки. Показатели задержки — в среднем 44 мс на 4090 — измерены производителем, зависят от рабочей нагрузки и оборудования, и прямой проход на одном GPU — это не то же измерение, что вызов размещённого API, включающий сетевой обмен и очередь. А пилот по калибровке — это 96 случаев: диагностика, а не бенчмарк, и в карточке так и указано.
Вопрос развёртывания — это и есть настоящая развилка.
Забудьте на мгновение о бенчмарках и спросите, что каждый из них требует от вас с операционной точки зрения.
Intern-Decision-4B занимает примерно 9,1 ГБ на диске в bf16 — два языковых шарда по 4,26 ГБ и 4,15 ГБ, визуальный модуль на 612 МБ и проектор на 54 МБ. Он загружается через файл размером 16 КБ inference.py, поставляемый в самом репозитории, с DecisionEngine — классом, который вы создаёте один раз и переиспользуете. На входе один словарь Python, на выходе один словарь ответа, требуется Python 3.12+. Он работает за 44 мс на 4090, а собрат на 0,8B достаточно мал, чтобы рассуждать о нём на куда меньших ресурсах. Но модуль — это и есть интерфейс: здесь нет ни сервера, ни OpenAI-совместимой конечной точки, ни хостингового API. Сервис вокруг него строите вы, и если вам нужно два таких модуля для отказоустойчивости — это тоже строите вы.
Генеративная сторона того же пайплайна — это совершенно иное решение, и именно для этого и нужен роутер. Qwen3.8-Max и Qwen3.8-27B доступны для вызова на OrcaRouter под одним и тем же ключом, совместимым с OpenAI, по прайс-листовой цене провайдера с 0% наценки, передаваемой как есть — так что когда Alibaba меняет цену на Qwen, у нас она становится актуальной в тот же день, а не в следующем расчётном цикле. Intern-Decision-4B не входит в число наших маршрутов и не будет входить, пока InternLM не разместит его где-нибудь; мы не собираемся делать вид, что это не так. Мы покрываем ту половину этого пайплайна, которая представляет собой сетевой вызов: один ключ для 200+ моделей, автоматическое переключение при сбое, если Qwen3.8-Max деградирует — его текущий семидневный уровень ошибок составляет 1,78% — и возможность A/B-сравнения двух уровней Qwen 3.8 друг с другом в одном и том же пути запроса, прежде чем вы остановитесь на каком-то из них.
Вот какой паттерн стоит вынести. Запускайте скорер локально, потому что он дёшев, быстр и хорошо делает одну узкую вещь. Маршрутизируйте этап рассуждения, потому что именно там реально происходят и смены вендоров, и снижения цен, и сбои.

Какой из них вам действительно стоит выбрать
Выбирайте Intern-Decision-4B, если ваше решение относится к закрытому множеству, ответы можно перечислить в промпте, вы выполняете одно и то же решение в больших объёмах и вероятность для вас так же важна, как и метка. Маршрутизация тикетов, модерация контента по фиксированной таксономии, структурированное извлечение в схему, которую вы контролируете, рубрики оценки, бинарные гейты — всё, где человек мог бы заранее составить список вариантов. 4,54 миллиарда параметров честно говорят о потолке: в самой карточке модели указано, что 4B набирает 73,87 на Jevbench-Hard против 100,00 на Easy, так что чем сложнее форма решения, тем больше теряет маленькая модель.
Выбирайте Qwen 3.8 — то есть Qwen3.8-Max, если вам нужно размещённое ядро, Qwen3.8-27B, если вам нужны веса, которые можно держать у себя, — если ответ невозможно перечислить заранее, если вход длиннее 8 192 токенов, если вам нужно обоснование, которое можно показать человеку, если вам нужны вызовы инструментов или если вам нужно видео. Также выбирайте его, если вы просто не хотите эксплуатировать GPU: 12,3 часа работы 4090 на миллион решений — это дёшево только если у вас уже есть 4090 и есть чем ещё заняться с ней в остальные 363 дня.
Выбирайте оба, если ваш пайплайн имеет ту форму, которая на самом деле характерна для большинства пайплайнов, — дешёвый классификатор закрытого набора впереди и фронтирная модель позади него для случаев, в которых классификатор не уверен. Именно для такой конфигурации была создана калиброванная уверенность Intern-Decision-4B, и именно поэтому число ECE выше важнее, чем среднее из заголовка.
Что посмотреть
Три открытых вопроса, на все из которых можно ответить в течение нескольких дней. Публикует ли InternLM репозиторий на GitHub, на который ссылается его собственная карточка — сейчас это 404 — и вместе с ним описание обучения? Следует ли за весами анонс, превращающий тихую публикацию в задокументированный релиз? И воспроизводит ли что-либо независимое среднее 90.02 или Brier 0.347 на оборудовании, не принадлежащем InternLM?
Есть одно небольшое несоответствие, о котором стоит упомянуть, пока вы ждёте, потому что это как раз то, что важно, когда вы определяете размер развёртывания. Модель называется 4B. Число параметров — 4 539 265 536, то есть 4,54 млрд. У родственной модели 0.8B — 853 млн, а у родственной модели 2B — 2,21 млрд; обе округляются вверх или вниз на самую малость. Только 4B округляется вниз более чем на полмиллиарда. Это не проблема. Это напоминание о том, что в неанонсированном релизе документация — единственная спецификация, которая у вас есть, и даже она всё ещё редактируется.
