Титульная карточка для статьи-сравнения с заголовком Intern-Decision-4B vs Qwen 3.8 и подзаголовком «Прямой проход за 44 миллисекунды против 2,4 триллиона параметров», с тремя плоскими линейными иконками, намекающими на небольшую быструю скоринговую модель, большую модель рассуждений и сравнение затрат.
Engineering & Research

Intern-Decision-4B против Qwen 3.8: 44-миллисекундный прямой проход против 2,4 триллиона параметров

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

InternLM опубликовала Intern-Decision-4B на Hugging Face утром 26 сентября 2026 года — без анонса, без записи в блоге, ссылка на GitHub на самой карточке модели возвращает 404, а демо-Space — 401. Веса настоящие и доступны для скачивания; анонса нет. А модель, лежащая в их основе, — это файнтюн Qwen3.5-4B, и именно поэтому сравнение с размещённым у провайдера флагманом стоит больше, чем спецификация. Эти двое не соперники. Это два конца одного конвейера, и весь вопрос в том, где проходит граница между ними. В основе лежит модель с 2,4 триллиона параметров, которую вендор опубликовал в августе и теперь предоставляет как Qwen3.8-Max, с тарификацией $2.00 и $6.00 за миллион токенов; Intern-Decision-4B — это пересборка той семимесячной базовой модели с 4,54 миллиарда параметров, которая вообще не выдаёт токенов, отвечает до шестнадцати типизированных вопросов за один прямой проход и ничего не стоит за вызов, потому что нет вывода, за который можно выставить счёт.

Однострочный ответ: если ваша задача — это решение с закрытым набором ответов, Intern-Decision-4B примерно в пятьдесят раз быстрее на одно решение и структурно дешевле, и никакая фронтирная модель не превзойдёт её на этой узкой оси. Если ваша задача — что-то другое: рассуждение, длинный контекст, использование инструментов, что угодно, где ответ ещё не перечислен в вашем промпте, — Qwen 3.8 не просто лучше, это единственная из двух, которая вообще способна выполнить задачу. Всё ниже — о том, чтобы точно найти эту границу.

Что действительно подтверждено, а что — нет

Начнём с фактов, потому что важна подача. Для Intern-Decision-4B нет анонса от вендора. Ни пресс-релиза, ни статьи, ни описания репозитория, которое можно было бы прочитать. Что есть сегодня — это репозиторий Hugging Face, опубликованный сегодня утром в организации internlm — Intern Large Models, группа Shanghai AI Laboratory — под лицензией Apache 2.0, рядом с которой сохранена вышестоящая лицензия Qwen в файле LICENSE-QWEN. Два родственных чекпоинта появились с разницей не более сорока секунд друг от друга: Intern-Decision-0.8B на 853 млн параметров и Intern-Decision-2B на 2,21 млрд. Все три несут одни и те же теги — decision-making, multimodal, structured-prediction — и все три входят в одну коллекцию моделей, которая пока не открывается публично.

Что не подтверждено: является ли это финальным релизом или ранним пушем. Репозиторий был создан в 05:36 UTC и снова изменён до 08:00 UTC в тот же день, а дальнейшая публичная активность в соседних чекпоинтах продолжалась и после 09:00. InternLM не сообщила, каким должен быть предполагаемый сценарий развёртывания, не опубликовала репозиторий, на который ссылается, и не сказала, появится ли хостируемый эндпоинт. Считайте все показатели бенчмарков в этой статье заявленными вендором и невоспроизведёнными — потому что на момент написания буквально нигде больше ничего не было написано об этой модели. Три отдельных пути поиска не дают ничего по этому названию.

Screenshot of the Hugging Face model card for internlm/Intern-Decision-4B, showing the internlm organization, the image-text-to-text and transformers tags, 5B params, and the model card opening line describing a multimodal structured decision model fine-tuned from Qwen3.5-4B.

Архитектурная ставка: оценщик, а не генератор

Самое важное предложение в собственной документации Intern-Decision-4B — отрицательное: путь вывода «не вызывает generate() и не генерирует свободный текст.» Это не деталь реализации, это весь дизайн, и именно это отличает его от вызова Qwen3.8-Max с JSON-схемой и надежды, что скобка закроется.

Вот механизм, как его описывает карточка. Вы передаёте модели общее состояние, схему именованных вопросов и, опционально, до восьми изображений. Каждый вопрос относится к одному из трёх типов: выбор (выбрать один из упорядоченного набора вариантов), оценка (оценить по порядковой шкале, возвращается как вероятностно взвешенное ожидаемое значение) или noul (бинарный нет/да). Системный промпт, состояние, схема и полный JSON-скелет ассистента рендерятся с одним плейсхолдером на каждое поле. Затем — и это трюк — модель выполняет один причинный прямой проход, и логиты считываются в позиции непосредственно перед каждым плейсхолдером. Softmax берётся только по разрешённым символам-кандидатам этого поля, применяется калибровка чекпоинта, и символы отображаются обратно в ваши исходные значения вариантов.

Последствия конкретны. Поскольку пространство ответов каждого поля собирается на каждый запрос, а не зашито в голову словаря, схема, которую вы придумаете сегодня днём, не требует переобучения — добавьте вопрос, и варианты становятся кандидатными символами для этого поля. Поскольку нет цикла декодирования, нет выходного токена, нет скобки, которую можно забыть, и нет логики повторных попыток при некорректном JSON. И поскольку все вопросы оцениваются по одному и тому же чтению состояния, шестнадцать вопросов стоят одного прямого прохода, а не шестнадцати.

Ограничения столь же конкретны, и карточка излагает их без оговорок. От одного до шестнадцати вопросов, до 62 вариантов на вопрос, до восьми изображений. Максимум по умолчанию — 8 192 токена, а входные данные, которые его превышают, отклоняются без усечения. На последней оговорке стоит остановиться: тихое усечение — это способ, которым классификатор незаметно начинает отвечать не на тот вопрос, который вы задали, и InternLM вместо этого выбрал громкий отказ. Это правильное решение, и в то же время операционная ловушка, потому что длинный тред тикета плюс схема плюс изображения перевалят за 8 192 быстрее, чем вы ожидаете, и изящного пути нет — вы получаете ошибку.

Где Intern-Decision-4B побеждает, причём с большим отрывом

Две оси, и обе они носят структурный, а не инкрементальный характер.

• Задержка на одно решение — 44,16 мс в среднем, 44,03 мс медиана, 44,60 мс на p95, измерено на одной RTX 4090 через локальный путь Hugging Face. По сравнению с Qwen3.8-Max, чьё текущее семидневное окно в нашей собственной песочнице показывает p50 в 2 474 мс и p95 в 9 789 мс при 55,4 выходных токена в секунду. Это примерно 56× по медиане, и сравнение не столько несправедливо, сколько представляет собой сравнение между двумя разными операциями: одна модель классифицирует, другая рассуждает, а затем пишет. Разрыв реален, и причина для него тоже.

• Стоимость за решение — и здесь речь об арифметике, а не о мнении. Возьмём реалистичный вызов для триажа обращений в поддержку: 800 входных токенов состояния и схемы и 150 выходных токенов структурированного JSON. На Qwen3.8-Max это 800 × $2,00/M плюс 150 × $6,00/M, или около $0,0025 за решение, ещё до единого токена рассуждения — а Qwen3.8-Max является моделью рассуждений, так что выходная сторона оптимистично мала. Миллион решений стоит примерно $2 500. Те же миллион решений на Intern-Decision-4B стоят ноль токенов и около 12,3 часов времени RTX 4090. У Intern-Decision-4B нет цены за выход, потому что у неё нет выхода.

Компромисс честный и очевидный: 4B-модели нужен GPU, которым вы владеете или который арендуете, она занимает этот GPU и всегда способна делать только одно. Но если это одно — то, что ваш продукт делает миллионы раз в день, вся приведённая выше арифметика и есть всё бизнес-обоснование, и никакие возможности фронтирных моделей этого не меняют.

Число, которое Qwen 3.8 не публикует: калибровка

Это тихий отличительный фактор, и именно его упустит большинство сравнений, потому что он не выглядит как бенчмарк.

Intern-Decision-4B возвращает распределение по значениям ваших вариантов, а не просто метку, — плюс оценку уверенности, а для noulвопросов — калиброванную вероятность ответа «да». InternLM сообщает о Brier score 0,347 и ожидаемой ошибке калибровки 0,065 по собственному набору тестов и поставляет подобранную температуру прямо в чекпоинте: 1.99241824, подобранную отдельно для этого размера путём минимизации отрицательного логарифмического правдоподобия на 1 728 специально выделенных калибровочных случаях при 1 693 отложенных валидационных случаях. Метки тестового набора не использовались при её выборе. В карточке есть также второй, независимый диагностический набор из 96 случаев, использующий точные эталонные распределения, а не выборочные метки; он показывает, что общие показатели Brier/ECE снижаются с 0,628 / 0,213 до калибровки до 0,550 / 0,089 после — этап калибровки сокращает ожидаемую ошибку более чем вдвое.

А теперь поищите тот же показатель на стороне Qwen 3.8. Его там нет. Alibaba публикует оценки Artificial Analysis Index, GPQA Diamond, terminal-bench, SciCode, tau-banking и long-context recall — всё это показатели возможностей. Она не публикует ни одной метрики калибровки ни для одного представителя семейства Qwen 3.8, потому что уверенность генеративной модели — не та величина, которую поставляет вендор. Если вашей системе нужна вероятность, которую можно использовать для порога или маршрутизации, а не ответ, которому она должна доверять, это различие не является различием в степени. Одна модель даёт вам число с документированной частотой ошибок; другая даёт вам текст, и вы строите вокруг него собственную оценку уверенности.

Там, где Qwen 3.8 выигрывает, причём с большим отрывом.

Сопоставьте их по тому, что им можно поручить, — и границы перестанут быть тонкими.

• Контекст — Qwen3.8-Max несёт окно в 1 000 000 токенов. Intern-Decision-4B отклоняет всё, что выходит за пределы 8 192. Это разница в 122 раза, и обходного пути нет, потому что ограничение на вход применяется принудительно, а не усекается.

• Модальность ввода — Qwen3.8-Max принимает текст, изображения и видео. Intern-Decision-4B принимает текст и изображения, до восьми, а токены изображений учитываются в том же бюджете в 8,192.

• Рассуждения и инструменты — Qwen3.8-Max среди заявленных возможностей поддерживает использование инструментов, режим JSON и рассуждения, а также занимает 45,4 в Artificial Analysis Intelligence Index — пятнадцатое место среди 145 проиндексированных моделей, с показателем AA Coding 76,2 на девятом месте из 138. Это независимые данные, опубликованные Artificial Analysis, а не заявления производителя. У Intern-Decision-4B нет записи в Artificial Analysis, нет никаких независимых оценок и нет способности рассуждать, планировать или вызывать что-либо.

• Вывод в свободной форме — пишет Qwen3.8-Max. Intern-Decision-4B не может создать абзац, обоснование или план. Он может только оценивать варианты, которые вы уже догадались перечислить.

Также стоит отметить на стороне открытых весов: если вам нужно само ядро Qwen 3.8, а не хостинговый вариант, Qwen3.8-27B — это его плотный собрат: 27,8 млрд параметров, Apache 2.0, контекст на 262 144 токена и примерно $0,33 / $2,40 за миллион токенов там, где он предоставляется. Он набирает 33,7 балла в AA Intelligence Index. Он всё ещё на порядок крупнее Intern-Decision-4B, всё ещё генеративный и всё ещё неподходящий инструмент для принятия решений по закрытому набору при больших объёмах — но это честный промежуточный вариант и единственный из трёх, который одновременно по-настоящему дёшев и по-настоящему способен.

Screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the on-page navigation for code samples, pricing, performance, public benchmarks, community buzz, how it compares and FAQ, with the model name and vendor breadcrumb at the top.

Честное прочтение собственной таблицы бенчмарков InternLM

Карточка Intern-Decision-4B содержит сравнительную таблицу, и то, что отсутствует в ней, информативнее того, что в ней есть. Строки — Jev, Laya, SemIf, Kev, JevK5, а также собственные 0.8B и 2B от InternLM. Каждая из них — ещё одна запись из числа System One или decision-моделей: Jev от TypeSafe AI, Laya от Convai Innovations и ещё три. Все цифры заявлены вендорами на собственных тестовых стендах InternLM. В таблице вообще нет ни одной фронтирной модели.

Это не недосмотр. Это честные границы заявления. Указанное в заголовке среднее значение Intern-Decision-4B — 90.02 по семи наборам тестов: Jevbench-Easy 100.00, Jevbench-Original 98.61, Jevbench-Hard 73.87, Typed Decision 80.55, ToolACE 96.45, AG News 90.82, WildJailBreak 89.86 — представляет собой заявление о лидерстве в категории моделей принятия решений; на этой таблице она действительно лидирует, превосходя показатели Jev 88.74 и Laya 57.77. Это не заявление о конкуренции с Qwen 3.8, и InternLM нигде такого заявления не делает. Карточка модели ограничена своей собственной категорией, и трактовать победу в категории как победу по способностям — именно та ошибка, которую призван предотвратить этот раздел.

Ещё две оговорки. Показатели задержки — в среднем 44 мс на 4090 — измерены производителем, зависят от рабочей нагрузки и оборудования, и прямой проход на одном GPU — это не то же измерение, что вызов размещённого API, включающий сетевой обмен и очередь. А пилот по калибровке — это 96 случаев: диагностика, а не бенчмарк, и в карточке так и указано.

Вопрос развёртывания — это и есть настоящая развилка.

Забудьте на мгновение о бенчмарках и спросите, что каждый из них требует от вас с операционной точки зрения.

Intern-Decision-4B занимает примерно 9,1 ГБ на диске в bf16 — два языковых шарда по 4,26 ГБ и 4,15 ГБ, визуальный модуль на 612 МБ и проектор на 54 МБ. Он загружается через файл размером 16 КБ inference.py, поставляемый в самом репозитории, с DecisionEngine — классом, который вы создаёте один раз и переиспользуете. На входе один словарь Python, на выходе один словарь ответа, требуется Python 3.12+. Он работает за 44 мс на 4090, а собрат на 0,8B достаточно мал, чтобы рассуждать о нём на куда меньших ресурсах. Но модуль — это и есть интерфейс: здесь нет ни сервера, ни OpenAI-совместимой конечной точки, ни хостингового API. Сервис вокруг него строите вы, и если вам нужно два таких модуля для отказоустойчивости — это тоже строите вы.

Генеративная сторона того же пайплайна — это совершенно иное решение, и именно для этого и нужен роутер. Qwen3.8-Max и Qwen3.8-27B доступны для вызова на OrcaRouter под одним и тем же ключом, совместимым с OpenAI, по прайс-листовой цене провайдера с 0% наценки, передаваемой как есть — так что когда Alibaba меняет цену на Qwen, у нас она становится актуальной в тот же день, а не в следующем расчётном цикле. Intern-Decision-4B не входит в число наших маршрутов и не будет входить, пока InternLM не разместит его где-нибудь; мы не собираемся делать вид, что это не так. Мы покрываем ту половину этого пайплайна, которая представляет собой сетевой вызов: один ключ для 200+ моделей, автоматическое переключение при сбое, если Qwen3.8-Max деградирует — его текущий семидневный уровень ошибок составляет 1,78% — и возможность A/B-сравнения двух уровней Qwen 3.8 друг с другом в одном и том же пути запроса, прежде чем вы остановитесь на каком-то из них.

Вот какой паттерн стоит вынести. Запускайте скорер локально, потому что он дёшев, быстр и хорошо делает одну узкую вещь. Маршрутизируйте этап рассуждения, потому что именно там реально происходят и смены вендоров, и снижения цен, и сбои.

A two-column comparison scoreboard titled Intern-Decision-4B vs Qwen 3.8 — the scoreboard, contrasting 44 ms per decision, about $0 in tokens per million decisions, an 8,192-token context, text plus 8 images, a published Brier of 0.347 and no open-ended output on the left against 2,474 ms p50 hosted, about $2,500 per million, a 1,000,000-token context, text, image and video, no published calibration and open-ended reasoning on the right.

Какой из них вам действительно стоит выбрать

Выбирайте Intern-Decision-4B, если ваше решение относится к закрытому множеству, ответы можно перечислить в промпте, вы выполняете одно и то же решение в больших объёмах и вероятность для вас так же важна, как и метка. Маршрутизация тикетов, модерация контента по фиксированной таксономии, структурированное извлечение в схему, которую вы контролируете, рубрики оценки, бинарные гейты — всё, где человек мог бы заранее составить список вариантов. 4,54 миллиарда параметров честно говорят о потолке: в самой карточке модели указано, что 4B набирает 73,87 на Jevbench-Hard против 100,00 на Easy, так что чем сложнее форма решения, тем больше теряет маленькая модель.

Выбирайте Qwen 3.8 — то есть Qwen3.8-Max, если вам нужно размещённое ядро, Qwen3.8-27B, если вам нужны веса, которые можно держать у себя, — если ответ невозможно перечислить заранее, если вход длиннее 8 192 токенов, если вам нужно обоснование, которое можно показать человеку, если вам нужны вызовы инструментов или если вам нужно видео. Также выбирайте его, если вы просто не хотите эксплуатировать GPU: 12,3 часа работы 4090 на миллион решений — это дёшево только если у вас уже есть 4090 и есть чем ещё заняться с ней в остальные 363 дня.

Выбирайте оба, если ваш пайплайн имеет ту форму, которая на самом деле характерна для большинства пайплайнов, — дешёвый классификатор закрытого набора впереди и фронтирная модель позади него для случаев, в которых классификатор не уверен. Именно для такой конфигурации была создана калиброванная уверенность Intern-Decision-4B, и именно поэтому число ECE выше важнее, чем среднее из заголовка.

Что посмотреть

Три открытых вопроса, на все из которых можно ответить в течение нескольких дней. Публикует ли InternLM репозиторий на GitHub, на который ссылается его собственная карточка — сейчас это 404 — и вместе с ним описание обучения? Следует ли за весами анонс, превращающий тихую публикацию в задокументированный релиз? И воспроизводит ли что-либо независимое среднее 90.02 или Brier 0.347 на оборудовании, не принадлежащем InternLM?

Есть одно небольшое несоответствие, о котором стоит упомянуть, пока вы ждёте, потому что это как раз то, что важно, когда вы определяете размер развёртывания. Модель называется 4B. Число параметров — 4 539 265 536, то есть 4,54 млрд. У родственной модели 0.8B — 853 млн, а у родственной модели 2B — 2,21 млрд; обе округляются вверх или вниз на самую малость. Только 4B округляется вниз более чем на полмиллиарда. Это не проблема. Это напоминание о том, что в неанонсированном релизе документация — единственная спецификация, которая у вас есть, и даже она всё ещё редактируется.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube