
Intern-Decision-0.8B против Qwen 3.8: 853 миллиона параметров и закрытый набор ответов
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 592 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 187 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Intern-Decision-0.8B — самая маленькая из трёх моделей принятия решений, которые InternLM выложила на Hugging Face утром 26 сентября 2026 года, и она не самая быстрая из них. Это первое, что стоит знать. По собственным измерениям лаборатории, 2B-собрат работает немного быстрее — 33,28 мс против 33,98 мс — и набирает на шесть баллов больше по тому же среднему из семи наборов, так что обычная причина обращаться к чекпоинту с менее чем миллиардом параметров, чистая скорость, здесь не работает. Что здесь применимо, так это размер: 852 985 920 параметров, 1,71 ГБ весов bf16, достаточно маленький, чтобы постоянно находиться на периферии машины, занятой чем-то другим. Сравните это с Qwen3.8-Max — хостинговой версией разреженного ядра mixture-of-experts с 2,4 триллиона параметров, которое производитель опубликовал в августе, по цене $2,00 и $6,00 за миллион токенов — и эти двое не конкурируют за одну и ту же задачу. Одна из них возвращает распределение вероятностей по вариантам, которые вы предоставили заранее. Другая пишет.
Краткий ответ: Intern-Decision-0.8B стоит иметь, если вам нужно решение из закрытого набора, оценённое на оборудовании, которое у вас уже есть, и если 1,71 ГБ вместо 4,43 ГБ — это разница между выпуском и невыпуском. Его не стоит иметь, если вы хотите самую точную небольшую скоринговую модель, выпущенную InternLM на этой неделе — это 4B — или если ваш ответ ещё не перечислен в вашем промпте, и в этом случае ни один из этих двух не является подходящим инструментом, и Qwen 3.8 — единственный из этой пары, который вообще может справиться с задачей.
Что говорит репозиторий, и чего не делает больше ничто
Начнём с доказательств, потому что их очень мало. InternLM не делала никаких объявлений об этой модели. Ни поста о запуске, ни статьи, ни описания репозитория. Карточка на Hugging Face ссылается на демо-Space и репозиторий на GitHub, и на момент написания этого текста Space возвращает 401, а ссылка на GitHub — 404: два места, куда карточка направляет за дополнительной информацией, закрыты. Три чекпоинта появились в течение сорока секунд друг за другом примерно в 05:36 UTC 26 сентября: Intern-Decision-0.8B, Intern-Decision-2B и Intern-Decision-4B — все с одинаковыми тегами — принятие решений, мультимодальность, структурированное предсказание — и все являются файнтюнами чекпоинтов Qwen, в данном случае Qwen3.5-0.8B.
То, что можно узнать из репозитория, на удивление точно для неанонсированного релиза: лаборатория поставила собственный модуль инференса вместе с весами. Модель 0.8B загружается через 16-килобайтный inference.py в каталоге модели, требует Python 3.12 или новее и torch 2.9.1 с transformers 5.14.1 и предоставляет класс DecisionEngine, который вы создаёте один раз и затем переиспользуете. На входе — один словарь Python, на выходе — один словарь ответа. Чего узнать нельзя: это готовый релиз или ранний пуш, появится ли хостируемый эндпоинт и должны ли два чекпоинта, между которыми он находится, быть одним и тем же продуктом разных размеров или тремя разными продуктами, которые просто совпали по названию. Никто за пределами InternLM не запускал ни один из них.

Проблема сиблингов: 2B быстрее и лучше
Вот фрагмент собственной опубликованной таблицы InternLM, из-за которого 0.8B трудно определить место. Просматривая три размера по одним и тем же семи наборам тестов:
• Скорость — 0.8B: среднее 33.98 мс, медиана 33.44 мс, 37.50 мс при p95. 2B: 33.28 мс, 33.15 мс, 33.55 мс. 4B: 44.16 мс, 44.03 мс, 44.60 мс. Все измерения выполнялись на один запрос на одном RTX 4090 через локальный путь Hugging Face.
• Среднее по семи наборам — 0,8B: 79,38. 2B: 84,68. 4B: 90,02.
• Калибровка — 0.8B: Brier 0.530, ECE 0.066. 2B: Brier 0.437, ECE 0.100. 4B: Brier 0.347, ECE 0.065.
• Размер на диске в bf16 — 0,8B: 1,71 ГБ. 2B: 4,43 ГБ. 4B: 9,08 ГБ.
2B быстрее в среднем, разительно лучше по хвостовым задержкам и точнее — и всё это одновременно. Так что утверждение «меньше — значит быстрее» неверно для всего этого семейства — причём вдвойне, поскольку 4B медленнее обоих. Единственная ось, по которой 0.8B однозначно выигрывает, — та, которую никто не бенчмаркает: 1,71 ГБ против 4,43 ГБ у 2B и 9,08 ГБ у 4B. Если вы размещаете скоринг-модель в рамках фиксированного бюджета памяти — небольшой постоянно включённый компьютер, GPU, разделяемая с другими арендаторами, периферийный узел, где языковая модель уже занимает большую часть карты, — это и есть весь аргумент, и он вполне весомый.
Остальная часть таблицы — это исследование того, где небольшие модели дают неравномерные сбои. Оценка Typed Decision у 0.8B составляет 77.35 против 80.55 у 4B — разница в три балла при одной пятой от количества параметров. Но Jevbench-Original падает с 98.61 до 80.56, а WildJailBreak обрушивается с 89.86 до 64.48. Что бы ни измеряли эти два набора тестов — в карточке не сказано, и карточка вообще не даёт определений наборов — именно они сильнее всего наказывают маленький чекпоинт. Модель, которая держится на одной оси и срывается в пропасть на двух других, не является равномерно более слабой моделью. Это модель с определённой границей компетенции, и вам захотелось бы знать, где находится ваша рабочая нагрузка, прежде чем передать ей весь флот.
Ещё одно предостережение по строке калибровки. ECE модели 0.8B, равный 0.066, — её лучший показатель: лучше, чем 0.095 у Jev на том же наборе, — тогда как её Brier score 0.530 хуже, чем 0.358 у Jev. Калиброванная ошибка и среднеквадратичная ошибка вероятности — это не одно и то же измерение, и таблица, в которой один показатель выглядит сильным, а другой — слабым, говорит о том, что распределение имеет хорошую форму вблизи своих пиков уверенности и является более «толстым», чем должно быть, между ними. Если ваша система устанавливает порог по уверенности, это различие важнее среднего.
Что на самом деле даёт 1.71 ГБ
Путь вывода в этой модели — это скорер, а не генератор, и разница в стоимости носит структурный, а не инкрементальный характер. Вы передаёте ему общее состояние, схему именованных вопросов и, опционально, до восьми изображений. Каждый вопрос относится к одному из трёх типов: choice (один из упорядоченного набора вариантов), score (порядковая шкала, возвращаемая как взвешенное по вероятностям ожидаемое значение), или noul (бинарное нет/да). Состояние, схема и полный JSON-скелет ответа ассистента рендерятся с одним плейсхолдером на поле, модель выполняет один каузальный прямой проход, и логиты считываются в позиции непосредственно перед каждым плейсхолдером. Softmax берётся только по разрешённым символам-кандидатам для этого поля, применяется подогнанная калибровка чекпоинта, символы отображаются обратно в значения ваших вариантов.
Отсюда вытекают три следствия. Нет выходного токена — а значит, и цены вывода: миллион решений не стоит ни единого токена. Нет цикла декодирования и нет фигурной скобки, которую можно забыть, поэтому некорректный JSON не является режимом отказа. А поскольку пространство ответов каждого поля собирается для каждого запроса, схема, которую вы придумаете сегодня днём, не требует переобучения: добавьте вопрос — и его варианты становятся символами-кандидатами для этого поля.
Ограничения заданы столь же прямо. От одного до шестнадцати вопросов, до 62 вариантов ответа в каждом, до восьми изображений и лимит по умолчанию в 8 192 токена — а входные данные, превышающие его, отклоняются, а не усекаютсяЭту последнюю оговорку стоит обдумать: это проектное решение, ведь тихое усечение — это то, как классификатор незаметно начинает отвечать на другой вопрос, не тот, который вы задали. InternLM вместо этого громко сообщает о сбое, что правильно и одновременно является операционной ловушкой: длинная цепочка тикетов плюс схема плюс изображения превысят 8 192 быстрее, чем вы ожидаете, а когда это произойдёт, изящного пути нет.
И 1,71 ГБ дают экономику времени выполнения, которую можно вычислить умножением. При 33,98 мс на одно решение миллион решений — это 9,44 часа работы одной RTX 4090. Модели 4B нужно 12,3 часа на тот же миллион, и она теряет десять с половиной пунктов точности в обмен на 7,37 ГБ, которых у вас не было. Ни одна из этих цифр не включает стоимость оборудования, и ни одна не включает то, о чём люди забывают: вы эксплуатируете сервис, а в репозитории нет сервера.

Qwen 3.8 — это не одна модель, и внимание стоит обратить именно на дешёвый сегмент
Qwen 3.8, если брать его как самостоятельное название, — это Qwen3.8-2.4T-A95B: ядро с разреженной смесью экспертов на 2,4 триллиона параметров, которое Alibaba опубликовала как открытые веса 12 августа 2026 года, с примерно 95 миллиардами активных параметров на токен и собственной лицензией вместо Apache 2.0. Хостинговая поставка того же самого ядра — это Qwen3.8-Max, общедоступная через платный API с 3 августа и обновлённая как датированный снимок от 2 сентября. Это один мозг, продаваемый двумя способами, и вторая поставка — та, которую большинство людей фактически будет вызывать.
Согласно независимым данным, Artificial Analysis оценивает сентябрьский снимок Qwen3.8-Max в Intelligence Index на уровне 45,4 — пятнадцатое место среди 145 проиндексированных моделей — с показателем AA Coding 76,2 на девятом месте из 138, GPQA Diamond — 92,8, Humanity's Last Exam — 43,1 и показателем recall на длинном контексте — 80,3. Открытый чекпойнт уступает API, из которого он был дистиллирован: 39,9. В нашем собственном семидневном окне тестирования в плейграунде Qwen3.8-Max показывает p50 2 578 мс и p95 9 539 мс при 55,5 выходных токенов в секунду и доле ошибок 1,57%. Qwen3.8-Max доступен для вызова на OrcaRouter по прайс-листовой цене провайдера с наценкой 0%, поэтому изменение цены Alibaba вступает в силу на нашей стороне в тот же день, а не в следующем расчётном периоде.
Плотного собрата и стоит сопоставлять с локальным чекпоинтом объёмом 1,71 ГБ, ведь это самый дешёвый способ получить универсальные возможности в этом семействе. Qwen3.8-27B распространяется под лицензией Apache 2.0, имеет собственный контекст на 262 144 токена, а в нашем каталоге Qwen3.8-27B стоит $0,33 и $2,40 за миллион токенов. Индекс интеллекта Artificial Analysis у неё — 33,7. Это примерно в тридцать два раза больше параметров, чем у Intern-Decision-0.8B, она по-прежнему генеративная и по-прежнему неподходящий инструмент для решения задач из закрытого набора при больших объёмах — но это честный промежуточный вариант и единственный участник этого сравнения, который одновременно по-настоящему дёшев и по-настоящему универсален.
Оценщик против генератора, если говорить прямо.
• Контекст — Qwen3.8-Max имеет окно в 1 000 000 токенов. Intern-Decision-0.8B отклоняет всё, что превышает 8 192. Коэффициент 122 применяется принудительно, а не усекается.
• Ввод — Qwen3.8-Max принимает текст, изображения и видео. Intern-Decision-0.8B принимает текст и до восьми изображений, а токены изображений расходуют тот же бюджет в 8 192 токена.
• Вывод — Qwen3.8-Max пишет, рассуждает, вызывает инструменты и выдаёт JSON по запросу. Intern-Decision-0.8B не способна создать абзац, обоснование или план. Она может лишь оценивать варианты, которые вы уже догадались перечислить.
• Стоимость одного вызова — реалистичный вызов для триажа с 800 входными токенами и 150 выходными токенами стоит около $0,0025 на Qwen3.8-Max, не считая токенов рассуждений, а объём выходных токенов здесь оптимистично занижен, потому что это модель рассуждений. Миллион таких вызовов — это примерно $2 500. У Intern-Decision-0.8B вообще нет цены за токены: миллион решений — это 9,44 часа на 4090, которая у вас есть или которую вы арендуете.
• Задержка — 2 578 мс по медиане на Qwen3.8-Max за последние семь дней, включая сеть и время в очереди. 33,98 мс у Intern-Decision-0.8B — это чистый прямой проход на локальной карте, и это не то же самое измерение; честное сравнение — один порядок величины, а не в восемьдесят раз.
• Доказательства — каждый показатель Intern-Decision-0.8B здесь заявлен вендором на собственных тестовых стендах InternLM и никем не воспроизведён, включая задержку. Каждый показатель Qwen 3.8 — это либо собственный результат Alibaba, либо измерение Artificial Analysis, и выше они помечены отдельно.
• Независимая оценка — у Qwen3.8-Max она есть. У Intern-Decision-0.8B нет ни одной, и ни один провайдер инференса её не развёртывает.

Два способа запустить этот пайплайн
Операционная развилка острее, чем развилка бенчмарков. Intern-Decision-0.8B — это модуль, а не сервис. Нет OpenAI-совместимой конечной точки, нет сервера пакетной обработки, нет проверки работоспособности, нет политики повторных попыток и нет второй реплики, если только вы её не создадите. Он загружается в одном процессе и отвечает на один dict за раз, а если вам нужно отказоустойчивое переключение, то вы и есть механизм отказоустойчивости. Это справедливое описание исследовательского чекпойнта на 853 миллиона параметров, опубликованного без заметки о запуске, и это следует соответствующим образом учесть при принятии решения.
Генеративная половина того же конвейера — это сетевой вызов, а сетевой вызов — как раз то, для чего нужен маршрутизатор. И Qwen3.8-Max, и Qwen3.8-27B доступны за одним ключом, совместимым с OpenAI, а автоматическое переключение при сбое означает, что деградировавший вышестоящий сервис не станет вашим инцидентом — об этом стоит упомянуть здесь, потому что фактическая семидневная частота ошибок Qwen3.8-Max на нашей стороне составляет 1,57%, что мало, пока это не ваш запрос. Разумна та схема, которую эта связка тихо описывала всё это время: запускать дешёвый скорер по закрытому набору локально, потому что он быстрый и ничего не стоит за вызов, а этап рассуждений маршрутизировать, потому что именно там на самом деле происходят снижение цен, смена моделей и сбои.
Две вещи, которых мы не станем утверждать. Intern-Decision-0.8B не является одним из наших маршрутов и не будет им, пока InternLM не разместит её где-нибудь — мы не собираемся намекать на обратное. И сегодня мы вообще не хостим ни одной модели InternLM, так что ничто в этой статье не является предложением прогнать этот объект через нас.
Что изменило бы ответ?
Три открытых вопроса, и на все можно ответить в течение нескольких дней. Публикует ли InternLM репозиторий GitHub, на который ссылается его собственная карточка, и вместе с ним описание того, как настраивались эти веса? Следует ли за чекпойнтами пост о запуске, превращающий тихую публикацию в документированный релиз с изложенной историей развёртывания? И воспроизводит ли кто-нибудь независимо среднее 79.38 или ошибку калибровки 0.066 на оборудовании, не принадлежащем InternLM?
Пока что-то из этого не появится, честное прочтение Intern-Decision-0.8B узко и конкретно: это самый дешёвый скоринг для закрытого набора из семейства трёх, с объёмом, который помещается там, где его собственный более быстрый и более точный собрат — нет, опубликованный без анонса и без артефакта, который сказал бы вам, для чего он был настроен. Если ваше решение относится к закрытому набору, ваши ответы перечислимы в промпте, и 1.71 ГБ — это число, от которого зависит ваше развёртывание, то это правильный выбор, и нет ничего другого, подобного ему, при таком размере. Если ваш ответ не перечислим заранее, или ваше состояние превышает 8 192 токена, или вам нужно обоснование, которое можно показать человеку, то сравнение никогда не было близким — и модель, которая вам нужна, — это модель с 853 миллионами параметров.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
