Титульная карточка для статьи-сравнения с надписью «Intern-Decision-0.8B против Qwen 3.8», с подзаголовком: 853 миллиона параметров, 1,71 ГБ и закрытый набор ответов, а также три плоские карточки-строки с надписями: «Субъект: Intern-Decision-0.8B выпущена 26 сентября 2026 года без анонса», «Соперник: Qwen 3.8 — разрежённое ядро на 2,4 трлн с Qwen3.8-Max по цене 2,00 $ и 6,00 $», «Ключевой вывод: 2B-собрат быстрее и точнее, и только занимаемая память говорит в пользу 0.8B».
Engineering & Research

Intern-Decision-0.8B против Qwen 3.8: 853 миллиона параметров и закрытый набор ответов

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Intern-Decision-0.8B — самая маленькая из трёх моделей принятия решений, которые InternLM выложила на Hugging Face утром 26 сентября 2026 года, и она не самая быстрая из них. Это первое, что стоит знать. По собственным измерениям лаборатории, 2B-собрат работает немного быстрее — 33,28 мс против 33,98 мс — и набирает на шесть баллов больше по тому же среднему из семи наборов, так что обычная причина обращаться к чекпоинту с менее чем миллиардом параметров, чистая скорость, здесь не работает. Что здесь применимо, так это размер: 852 985 920 параметров, 1,71 ГБ весов bf16, достаточно маленький, чтобы постоянно находиться на периферии машины, занятой чем-то другим. Сравните это с Qwen3.8-Max — хостинговой версией разреженного ядра mixture-of-experts с 2,4 триллиона параметров, которое производитель опубликовал в августе, по цене $2,00 и $6,00 за миллион токенов — и эти двое не конкурируют за одну и ту же задачу. Одна из них возвращает распределение вероятностей по вариантам, которые вы предоставили заранее. Другая пишет.

Краткий ответ: Intern-Decision-0.8B стоит иметь, если вам нужно решение из закрытого набора, оценённое на оборудовании, которое у вас уже есть, и если 1,71 ГБ вместо 4,43 ГБ — это разница между выпуском и невыпуском. Его не стоит иметь, если вы хотите самую точную небольшую скоринговую модель, выпущенную InternLM на этой неделе — это 4B — или если ваш ответ ещё не перечислен в вашем промпте, и в этом случае ни один из этих двух не является подходящим инструментом, и Qwen 3.8 — единственный из этой пары, который вообще может справиться с задачей.

Что говорит репозиторий, и чего не делает больше ничто

Начнём с доказательств, потому что их очень мало. InternLM не делала никаких объявлений об этой модели. Ни поста о запуске, ни статьи, ни описания репозитория. Карточка на Hugging Face ссылается на демо-Space и репозиторий на GitHub, и на момент написания этого текста Space возвращает 401, а ссылка на GitHub — 404: два места, куда карточка направляет за дополнительной информацией, закрыты. Три чекпоинта появились в течение сорока секунд друг за другом примерно в 05:36 UTC 26 сентября: Intern-Decision-0.8B, Intern-Decision-2B и Intern-Decision-4B — все с одинаковыми тегами — принятие решений, мультимодальность, структурированное предсказание — и все являются файнтюнами чекпоинтов Qwen, в данном случае Qwen3.5-0.8B.

То, что можно узнать из репозитория, на удивление точно для неанонсированного релиза: лаборатория поставила собственный модуль инференса вместе с весами. Модель 0.8B загружается через 16-килобайтный inference.py в каталоге модели, требует Python 3.12 или новее и torch 2.9.1 с transformers 5.14.1 и предоставляет класс DecisionEngine, который вы создаёте один раз и затем переиспользуете. На входе — один словарь Python, на выходе — один словарь ответа. Чего узнать нельзя: это готовый релиз или ранний пуш, появится ли хостируемый эндпоинт и должны ли два чекпоинта, между которыми он находится, быть одним и тем же продуктом разных размеров или тремя разными продуктами, которые просто совпали по названию. Никто за пределами InternLM не запускал ни один из них.

The Hugging Face model card for InternLM's Intern-Decision-0.8B, showing the internlm organisation, a 0.9B params label, tags for image-text-to-text, transformers, safetensors, qwen3_5, decision-making, multimodal, structured-prediction and conversational, an opening line stating the model is a multimodal structured decision model fine-tuned from Qwen3.5-0.8B, and a Checkpoint and docs section that also reports 0.9B params.

Проблема сиблингов: 2B быстрее и лучше

Вот фрагмент собственной опубликованной таблицы InternLM, из-за которого 0.8B трудно определить место. Просматривая три размера по одним и тем же семи наборам тестов:

• Скорость — 0.8B: среднее 33.98 мс, медиана 33.44 мс, 37.50 мс при p95. 2B: 33.28 мс, 33.15 мс, 33.55 мс. 4B: 44.16 мс, 44.03 мс, 44.60 мс. Все измерения выполнялись на один запрос на одном RTX 4090 через локальный путь Hugging Face.

• Среднее по семи наборам — 0,8B: 79,38. 2B: 84,68. 4B: 90,02.

• Калибровка — 0.8B: Brier 0.530, ECE 0.066. 2B: Brier 0.437, ECE 0.100. 4B: Brier 0.347, ECE 0.065.

• Размер на диске в bf16 — 0,8B: 1,71 ГБ. 2B: 4,43 ГБ. 4B: 9,08 ГБ.

2B быстрее в среднем, разительно лучше по хвостовым задержкам и точнее — и всё это одновременно. Так что утверждение «меньше — значит быстрее» неверно для всего этого семейства — причём вдвойне, поскольку 4B медленнее обоих. Единственная ось, по которой 0.8B однозначно выигрывает, — та, которую никто не бенчмаркает: 1,71 ГБ против 4,43 ГБ у 2B и 9,08 ГБ у 4B. Если вы размещаете скоринг-модель в рамках фиксированного бюджета памяти — небольшой постоянно включённый компьютер, GPU, разделяемая с другими арендаторами, периферийный узел, где языковая модель уже занимает большую часть карты, — это и есть весь аргумент, и он вполне весомый.

Остальная часть таблицы — это исследование того, где небольшие модели дают неравномерные сбои. Оценка Typed Decision у 0.8B составляет 77.35 против 80.55 у 4B — разница в три балла при одной пятой от количества параметров. Но Jevbench-Original падает с 98.61 до 80.56, а WildJailBreak обрушивается с 89.86 до 64.48. Что бы ни измеряли эти два набора тестов — в карточке не сказано, и карточка вообще не даёт определений наборов — именно они сильнее всего наказывают маленький чекпоинт. Модель, которая держится на одной оси и срывается в пропасть на двух других, не является равномерно более слабой моделью. Это модель с определённой границей компетенции, и вам захотелось бы знать, где находится ваша рабочая нагрузка, прежде чем передать ей весь флот.

Ещё одно предостережение по строке калибровки. ECE модели 0.8B, равный 0.066, — её лучший показатель: лучше, чем 0.095 у Jev на том же наборе, — тогда как её Brier score 0.530 хуже, чем 0.358 у Jev. Калиброванная ошибка и среднеквадратичная ошибка вероятности — это не одно и то же измерение, и таблица, в которой один показатель выглядит сильным, а другой — слабым, говорит о том, что распределение имеет хорошую форму вблизи своих пиков уверенности и является более «толстым», чем должно быть, между ними. Если ваша система устанавливает порог по уверенности, это различие важнее среднего.

Что на самом деле даёт 1.71 ГБ

Путь вывода в этой модели — это скорер, а не генератор, и разница в стоимости носит структурный, а не инкрементальный характер. Вы передаёте ему общее состояние, схему именованных вопросов и, опционально, до восьми изображений. Каждый вопрос относится к одному из трёх типов: choice (один из упорядоченного набора вариантов), score (порядковая шкала, возвращаемая как взвешенное по вероятностям ожидаемое значение), или noul (бинарное нет/да). Состояние, схема и полный JSON-скелет ответа ассистента рендерятся с одним плейсхолдером на поле, модель выполняет один каузальный прямой проход, и логиты считываются в позиции непосредственно перед каждым плейсхолдером. Softmax берётся только по разрешённым символам-кандидатам для этого поля, применяется подогнанная калибровка чекпоинта, символы отображаются обратно в значения ваших вариантов.

Отсюда вытекают три следствия. Нет выходного токена — а значит, и цены вывода: миллион решений не стоит ни единого токена. Нет цикла декодирования и нет фигурной скобки, которую можно забыть, поэтому некорректный JSON не является режимом отказа. А поскольку пространство ответов каждого поля собирается для каждого запроса, схема, которую вы придумаете сегодня днём, не требует переобучения: добавьте вопрос — и его варианты становятся символами-кандидатами для этого поля.

Ограничения заданы столь же прямо. От одного до шестнадцати вопросов, до 62 вариантов ответа в каждом, до восьми изображений и лимит по умолчанию в 8 192 токена — а входные данные, превышающие его, отклоняются, а не усекаютсяЭту последнюю оговорку стоит обдумать: это проектное решение, ведь тихое усечение — это то, как классификатор незаметно начинает отвечать на другой вопрос, не тот, который вы задали. InternLM вместо этого громко сообщает о сбое, что правильно и одновременно является операционной ловушкой: длинная цепочка тикетов плюс схема плюс изображения превысят 8 192 быстрее, чем вы ожидаете, а когда это произойдёт, изящного пути нет.

И 1,71 ГБ дают экономику времени выполнения, которую можно вычислить умножением. При 33,98 мс на одно решение миллион решений — это 9,44 часа работы одной RTX 4090. Модели 4B нужно 12,3 часа на тот же миллион, и она теряет десять с половиной пунктов точности в обмен на 7,37 ГБ, которых у вас не было. Ни одна из этих цифр не включает стоимость оборудования, и ни одна не включает то, о чём люди забывают: вы эксплуатируете сервис, а в репозитории нет сервера.

The OrcaRouter model page for Qwen3.8 Max, showing the model name, family and tier badges, a 1,000,000-token context window, pricing of $2.00 per million input tokens and $6.00 per million output tokens, an output speed of 63.71 tokens per second, an error rate of 0.69 percent, an Artificial Analysis index of 45.4 at rank 15 of 145, and a side panel listing Qwen 3.8 27B at an Artificial Analysis intelligence index of 33.65 with $0.33 and $2.40 per million tokens.

Qwen 3.8 — это не одна модель, и внимание стоит обратить именно на дешёвый сегмент

Qwen 3.8, если брать его как самостоятельное название, — это Qwen3.8-2.4T-A95B: ядро с разреженной смесью экспертов на 2,4 триллиона параметров, которое Alibaba опубликовала как открытые веса 12 августа 2026 года, с примерно 95 миллиардами активных параметров на токен и собственной лицензией вместо Apache 2.0. Хостинговая поставка того же самого ядра — это Qwen3.8-Max, общедоступная через платный API с 3 августа и обновлённая как датированный снимок от 2 сентября. Это один мозг, продаваемый двумя способами, и вторая поставка — та, которую большинство людей фактически будет вызывать.

Согласно независимым данным, Artificial Analysis оценивает сентябрьский снимок Qwen3.8-Max в Intelligence Index на уровне 45,4 — пятнадцатое место среди 145 проиндексированных моделей — с показателем AA Coding 76,2 на девятом месте из 138, GPQA Diamond — 92,8, Humanity's Last Exam — 43,1 и показателем recall на длинном контексте — 80,3. Открытый чекпойнт уступает API, из которого он был дистиллирован: 39,9. В нашем собственном семидневном окне тестирования в плейграунде Qwen3.8-Max показывает p50 2 578 мс и p95 9 539 мс при 55,5 выходных токенов в секунду и доле ошибок 1,57%. Qwen3.8-Max доступен для вызова на OrcaRouter по прайс-листовой цене провайдера с наценкой 0%, поэтому изменение цены Alibaba вступает в силу на нашей стороне в тот же день, а не в следующем расчётном периоде.

Плотного собрата и стоит сопоставлять с локальным чекпоинтом объёмом 1,71 ГБ, ведь это самый дешёвый способ получить универсальные возможности в этом семействе. Qwen3.8-27B распространяется под лицензией Apache 2.0, имеет собственный контекст на 262 144 токена, а в нашем каталоге Qwen3.8-27B стоит $0,33 и $2,40 за миллион токенов. Индекс интеллекта Artificial Analysis у неё — 33,7. Это примерно в тридцать два раза больше параметров, чем у Intern-Decision-0.8B, она по-прежнему генеративная и по-прежнему неподходящий инструмент для решения задач из закрытого набора при больших объёмах — но это честный промежуточный вариант и единственный участник этого сравнения, который одновременно по-настоящему дёшев и по-настоящему универсален.

Оценщик против генератора, если говорить прямо.

• Контекст — Qwen3.8-Max имеет окно в 1 000 000 токенов. Intern-Decision-0.8B отклоняет всё, что превышает 8 192. Коэффициент 122 применяется принудительно, а не усекается.

• Ввод — Qwen3.8-Max принимает текст, изображения и видео. Intern-Decision-0.8B принимает текст и до восьми изображений, а токены изображений расходуют тот же бюджет в 8 192 токена.

• Вывод — Qwen3.8-Max пишет, рассуждает, вызывает инструменты и выдаёт JSON по запросу. Intern-Decision-0.8B не способна создать абзац, обоснование или план. Она может лишь оценивать варианты, которые вы уже догадались перечислить.

• Стоимость одного вызова — реалистичный вызов для триажа с 800 входными токенами и 150 выходными токенами стоит около $0,0025 на Qwen3.8-Max, не считая токенов рассуждений, а объём выходных токенов здесь оптимистично занижен, потому что это модель рассуждений. Миллион таких вызовов — это примерно $2 500. У Intern-Decision-0.8B вообще нет цены за токены: миллион решений — это 9,44 часа на 4090, которая у вас есть или которую вы арендуете.

• Задержка — 2 578 мс по медиане на Qwen3.8-Max за последние семь дней, включая сеть и время в очереди. 33,98 мс у Intern-Decision-0.8B — это чистый прямой проход на локальной карте, и это не то же самое измерение; честное сравнение — один порядок величины, а не в восемьдесят раз.

• Доказательства — каждый показатель Intern-Decision-0.8B здесь заявлен вендором на собственных тестовых стендах InternLM и никем не воспроизведён, включая задержку. Каждый показатель Qwen 3.8 — это либо собственный результат Alibaba, либо измерение Artificial Analysis, и выше они помечены отдельно.

• Независимая оценка — у Qwen3.8-Max она есть. У Intern-Decision-0.8B нет ни одной, и ни один провайдер инференса её не развёртывает.

A two-column scoreboard comparing Intern-Decision-0.8B and Qwen 3.8. The Intern-Decision-0.8B column reads Parameters 853M, Seven-suite average 79.38, Context 8,192 tokens, Output scores only no text, Cost no token price 1.71 GB local, Latency 33.98 ms local pass. The Qwen 3.8 Max column reads Parameters 2.4T sparse, AA Intelligence Index 45.4, Context 1,000,000 tokens, Output text image video tools, Cost $2.00 and $6.00 per million, Latency 2,578 ms p50 hosted. A footer reads Intern-Decision-0.8B figures are vendor-reported and unreproduced; Qwen3.8-Max figures per Artificial Analysis and our own seven-day window.

Два способа запустить этот пайплайн

Операционная развилка острее, чем развилка бенчмарков. Intern-Decision-0.8B — это модуль, а не сервис. Нет OpenAI-совместимой конечной точки, нет сервера пакетной обработки, нет проверки работоспособности, нет политики повторных попыток и нет второй реплики, если только вы её не создадите. Он загружается в одном процессе и отвечает на один dict за раз, а если вам нужно отказоустойчивое переключение, то вы и есть механизм отказоустойчивости. Это справедливое описание исследовательского чекпойнта на 853 миллиона параметров, опубликованного без заметки о запуске, и это следует соответствующим образом учесть при принятии решения.

Генеративная половина того же конвейера — это сетевой вызов, а сетевой вызов — как раз то, для чего нужен маршрутизатор. И Qwen3.8-Max, и Qwen3.8-27B доступны за одним ключом, совместимым с OpenAI, а автоматическое переключение при сбое означает, что деградировавший вышестоящий сервис не станет вашим инцидентом — об этом стоит упомянуть здесь, потому что фактическая семидневная частота ошибок Qwen3.8-Max на нашей стороне составляет 1,57%, что мало, пока это не ваш запрос. Разумна та схема, которую эта связка тихо описывала всё это время: запускать дешёвый скорер по закрытому набору локально, потому что он быстрый и ничего не стоит за вызов, а этап рассуждений маршрутизировать, потому что именно там на самом деле происходят снижение цен, смена моделей и сбои.

Две вещи, которых мы не станем утверждать. Intern-Decision-0.8B не является одним из наших маршрутов и не будет им, пока InternLM не разместит её где-нибудь — мы не собираемся намекать на обратное. И сегодня мы вообще не хостим ни одной модели InternLM, так что ничто в этой статье не является предложением прогнать этот объект через нас.

Что изменило бы ответ?

Три открытых вопроса, и на все можно ответить в течение нескольких дней. Публикует ли InternLM репозиторий GitHub, на который ссылается его собственная карточка, и вместе с ним описание того, как настраивались эти веса? Следует ли за чекпойнтами пост о запуске, превращающий тихую публикацию в документированный релиз с изложенной историей развёртывания? И воспроизводит ли кто-нибудь независимо среднее 79.38 или ошибку калибровки 0.066 на оборудовании, не принадлежащем InternLM?

Пока что-то из этого не появится, честное прочтение Intern-Decision-0.8B узко и конкретно: это самый дешёвый скоринг для закрытого набора из семейства трёх, с объёмом, который помещается там, где его собственный более быстрый и более точный собрат — нет, опубликованный без анонса и без артефакта, который сказал бы вам, для чего он был настроен. Если ваше решение относится к закрытому набору, ваши ответы перечислимы в промпте, и 1.71 ГБ — это число, от которого зависит ваше развёртывание, то это правильный выбор, и нет ничего другого, подобного ему, при таком размере. Если ваш ответ не перечислим заранее, или ваше состояние превышает 8 192 токена, или вам нужно обоснование, которое можно показать человеку, то сравнение никогда не было близким — и модель, которая вам нужна, — это модель с 853 миллионами параметров.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube