
Intern-Decision-2B против Qwen 3.8: один бэкбон, две совершенно разные задачи
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 584 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 187 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Откройте конфигурацию internlm/Intern-Decision-2Bи конфигурацию Qwen/Qwen3.5-2Bрядом друг с другом — и почти ничего не отличается. Те же 24 слоя, тот же размер скрытого состояния 2 048, те же 8 голов запросов против 2 голов ключ-значение, та же размерность головы 256, тот же потолок эмбеддингов в 262 144 позиции, тот же словарь на 248 320 токенов, тот же повторяющийся паттерн из трёх слоёв линейного внимания на один слой полного внимания. Intern-Decision-2B — это не новая архитектура. Это тот же каркас, у которого отняли способность генерировать текст и откалибровали уверенность, — и именно это единственное вычитание делает сравнение с Qwen3.8-Max, флагманом на 2,4 триллиона параметров, на который указывает всё семейство «Qwen 3.8» на верхнем конце, более ценным, чем обратный отсчёт параметров.
Эти двое — не конкуренты, и их противостояние — не состязание. Intern-Decision-2B — это файнтюн Qwen3.5-2B с 2 213 241 664 параметрами, загруженный на Hugging Face в 05:36 UTC 26 сентября 2026 года вместе с тремя неанонсированными родственными моделями, и он не выдаёт токены: он принимает состояние и типизированные вопросы, выполняет один каузальный прямой проход, считывает логиты в фиксированных позициях-заполнителях и возвращает калиброванное распределение по каждому полю. Qwen3.8-Max — флагманская хостируемая модель Alibaba, разреженная модель смеси экспертов с примерно 95 млрд активных параметров на токен, мультимодальным контекстным окном на 1 миллион токенов и прейскурантной ценой $2.00 за миллион входных токенов и $6.00 за миллион выходных. Один — компонент. Другой — сервис. Полезный вопрос: где в пайплайне, за который вы уже платите, должен проходить стык между ними.
Именно вычитание
То, что изменила настройка решений, стоит сформулировать точно, потому что это проясняет, что базовая модель уже несла в себе.
В репозитории задача называется авторегрессивным маскированным языковым моделированием. Вход ассистента содержит полный скелет JSON с одним токеном <decision> на каждое поле; эталонные символы ответов появляются только в метках и никогда во входных данных. Обучение использует обычное причинное выравнивание по следующему токену, где логит непосредственно перед маркером предсказывает ответ этого поля, и все поля используют один общий прямой проход. При инференсе логиты ограничиваются допустимыми однотокенными символами ответов — A–Z, a–z, 0–9, именно отсюда берётся ограничение в 62 варианта — затем пропускаются через softmax и отображаются обратно на ваши метки.
Итак, механизм предсказания следующего токена у базовой модели цел и не модифицирован. Что было натренировано, так это предпочтение занимать одну из нескольких позиций ответа вместо продолжения предложения, плюс специфичная для чекпоинта температура 2,100509348278, подобранная методом отрицательного логарифмического правдоподобия по 1 728 назначенным калибровочным случаям при 1 693 отложенных. В карточке недвусмысленно сказано, что генерация исключена: API «выполняет структурированное оценивание кандидатов. Он не вызывает generate() и не сэмплирует текст в свободной форме».
В репозитории также зафиксировано то, чего тонкая настройка не коснулась: она «тонко настраивает языковой каркас Qwen3.5, при этом замораживая визуальную башню и проектор». Визуальный шард размером 612 517 440 байт в модели 2B имеет такой же размер в байтах, как и у чекпойнта принятия решений 4B, что соответствует унаследованным, а не обученным компонентам. Путь обработки изображений работает; просто не на него проход принятия решений тратил свой бюджет.

Что не могут 2,2 миллиарда параметров и что вместо этого делают 2,4 триллиона
Всё разделяется по одной оси: существует ли ваш ответ уже в виде списка.
Intern-Decision-2B отвечает на закрытый набор. От одного до шестнадцати вопросов, до 62 вариантов ответа в каждом, до восьми изображений — всё в пределах бюджета в 8 192 токена, который движок отклоняет, а не обрезает. Возвращается в виде вероятностей. При среднем времени 33,28 мс на запрос на одной RTX 4090 с P95, равным 33,55 мс, и ничего не тарифицируется за вызов, поскольку нет выходных данных, за которые можно было бы выставить счёт.
Qwen3.8-Max пишет. Контекст в 1 миллион токенов, ввод текста, изображений и видео, рассуждения с режимом размышления, нативный вызов инструментов, структурированные выходные данные, до 131 000 выходных токенов в сборке 0902. Оно также в принципе способно принимать то же решение о маршрутизации, что и Intern-Decision-2B, — можно попросить его выбрать один из вариантов и вернуть JSON. Когда вы так поступаете, возникают три проблемы. Вы платите за токены, которые оно тратит на принятие решения. Вы получаете строку, разбор которой может пройти, а может и не пройти. А число внутри этой строки — это то, что выдал сэмплер, а не значение softmax, которое можно сравнить с порогом 0,8 и на его основе действовать.
Оба объяснения верны, и ни одно не отменяет другое. Флагманская модель с 2,4 трлн параметров существует потому, что большинство задач не являются замкнутыми множествами. Скоринговая модель с 2,2 млрд параметров существует потому, что подмножество, которое является замкнутым, заслуживает более дешёвого инструмента.
Табло

• Параметры — Intern-Decision-2B: 2 213 241 664 в BF16 плюс визуальный энкодер и проектор, около 4,46 ГБ на диске; Qwen3.8-Max — примерно 2,4 трлн всего при около 95 млрд активных на токен, обслуживается, а не скачивается.
• Контекст — 8 192 токена, превышение отклоняется; 1 000 000 токенов с максимальным выводом 131 000 в сборке 0902.
• Вывод — калиброванные вероятности и argmax, без сгенерированного текста; сгенерированный текст, включая трассировку рассуждений.
• Модальности на входе — текст плюс до восьми изображений; текст, изображение и видео.
• Стоимость — нет платы за отдельный вызов, и GPU принадлежит вам; $2.00 за миллион входных токенов, $6.00 за миллион выходных, при этом чтение из кэша — $0.25, а запись в кэш — $2.50.
• Опубликованные доказательства — таблица вендора по семи наборам тестов со средними значениями 84,68, Brier 0,437 и ECE 0,100 по 10 751 тестовой строке, не воспроизведённая никем за пределами InternLM, на чекпоинте с одним лайком и нулём загрузок; Artificial Analysis Intelligence Index — 45,4, 15-е место из 145, и AA Coding index — 76,2, 9-е место из 138, оба измерены независимо.
• Задержка — в среднем 33,28 мс на запрос на одной RTX 4090, снижается по мере добавления батчинга; P50 времени до первого токена — 2,655 секунды, как указано в каталоге, растёт с нагрузкой.
Строки с доказательствами не эквивалентны, и их не следует печатать так, будто они эквивалентны. За флагманом Alibaba стоит независимая оценка по индексу. У чекпойнта InternLM есть таблица, созданная его собственными авторами, и показатель калибровки особенно следует воспринимать как хорошо задокументированное намерение, пока он не столкнётся с данными кого-то ещё — тем более здесь, потому что именно этот размер демонстрирует худшую ожидаемую ошибку калибровки из трёх выпущенных InternLM: 0,100 против 0,066 у модели вдвое меньшего размера и 0,065 у модели почти вдвое большего размера.
Шов и как его проложить
Разумный пайплайн — это не выбор между этими двумя, а разделение: модуль скоринга занимается решениями с перечислимым набором вариантов, а передовая модель — всем, ответ на что не является списком. Триаж обращений в поддержку, который направляет в одну из шести команд и оценивает срочность по трёхбалльной шкале, не нуждается в 95 миллиардах активных параметров; ему нужны вероятность и порог. А путь эскалации, который в конечном итоге пишет клиенту ответ, — нуждается.
У этого разделения есть операционная форма. Intern-Decision-2B отсутствует на OrcaRouter — наша страница модели для него возвращает 404, и мы нигде не смогли найти хостинговый маршрут — поэтому он работает на вашем собственном оборудовании, а значит, это компонент, который вы эксплуатируете и мониторите. Qwen3.8-Max — это маршрут: один ключ для более чем 200 моделей, цена провайдера по прайс-листу передаётся без наценки, а значит, изменение цены вендора на флагманскую модель попадёт в ваш счёт в тот же день, когда оно произойдёт. Размещение хостинговой части пайплайна за этой единой поверхностью — это то, что позволяет более дешёвой части оставаться дешёвой: скорер сдерживает объём вызовов, а к фронтирной модели обращаются только в тех случаях, когда она действительно нужна.

Если вы всё ещё решаете, какой скорер должен занимать этот слот — у этого нет независимой оценки, а его калибровка самая слабая в своём семействе — автоматическое переключение при отказе между провайдерами — это способ опробовать его на пути, где за ним уже стоит работающая альтернатива, а не полностью заменять эту альтернативу.
Честный вердикт
Если ваша задача — принять решение по набору ответов, который можно перечислить, а состояние умещается в восемь тысяч токенов, Intern-Decision-2B сделает это за тридцать три миллисекунды бесплатно за вызов, и никакая передовая модель не превзойдёт её по этой оси, сколько бы параметров вы ни арендовали. Проведите на ней собственную калибровку, прежде чем полагаться на уверенность, которую она сообщает.
Если ваша задача — что-то иное: рассуждения, длинный контекст, использование инструментов, видео, документ на миллион токенов или просто ответ, который ещё не написан, — Qwen3.8-Max не просто лучше. Это единственная из двух моделей, которая вообще способна справиться с задачей.
И если вы пока не можете сказать, какое из этих двух у вас есть, вероятно, ответ таков: у вас есть оба — в одном и том же пайплайне, и это именно та архитектура, о которой вам всё это время тихо говорило количество параметров.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
