Сгенерированная титульная карточка для Microsoft-Decision-1 против Intern-Decision-2B с подзаголовком «промежуточный чекпойнт, который быстрее всех отвечает и хуже всех сообщает, насколько он уверен», с чипами, на которых указано: 2 213 241 664 параметра, температура 2,100509348278, ECE 0,100, 33,28 мс на 4090 и потолок в 8 192 токена.
Engineering & Research

Microsoft-Decision-1 против Intern-Decision-2B: на девять миллисекунд быстрее и измеримо хуже калиброван

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

В собственной таблице InternLM есть число, которого быть не должно, и именно поэтому это сравнение ценнее, чем лист спецификаций. Intern-Decision-2B — 2 213 241 664 параметра, дообученная на базе Qwen/Qwen3.5-2B, загруженная на Hugging Face 26 сентября 2026 года в 05:36:19 UTC без каких-либо анонсов — демонстрирует 33,28 мс средней задержки на запрос на одной RTX 4090, что незначительно быстрее, чем у её собственного собрата с 852 миллионами параметров — 33,98 мс. Она также показывает худшую калибровку в своём семействе: ожидаемую ошибку калибровки 0,100 против 0,066 у 0.8B, при подобранной температуре 2,100509348278 против 2,747760550703 у 0.8B. Тем временем Microsoft-Decision-1, общедоступная на Microsoft Foundry с 8 октября 2026 года, не публикует ни показателя задержки, ни ошибки калибровки вообще — лишь абзац о методологии с описанием того, как измерялось и то, и другое. Так что вопрос, который на самом деле ставит это противостояние, не в том, кто из двух лучше. А в том, что вы покупаете, когда покупаете средний размер чего угодно.

Обе модели — это оценщики решений: состояние на входе, ограниченный набор вопросов на входе, калиброванные вероятности на выходе, без генерируемого текста и без токенов для разбора. Именно этот общий контракт делает различия понятными. Microsoft-Decision-1 — это хостируемый текстовый API Foundry на базе Qwen3.5-9B с окном в 32 768 токенов, без распределённых весов и без пути тонкой настройки. Intern-Decision-2B — это чекпойнт Apache-2.0 с сохранённой лицензией Qwen от upstream под именем LICENSE-QWEN, репозиторий объёмом примерно 4,46 ГБ, собственный код инференса и отсутствие хостингового эндпоинта где бы то ни было.

Для чего на самом деле нужен средний размер

InternLM выпустила три чекпоинта за сорок секунд: 0.8B в 05:35:57, этот — в 05:36:19, 4B — в 05:36:37. По собственному среднему производителя по семи наборам тестов семейство растёт в том порядке, на который можно было надеяться — 79.38, 84.68, 90.02, — и это единственное место, где 2B выглядит разумной покупкой. Во всём остальном он выглядит как размер, который никто не выбрал бы намеренно.

Обработка промпта доминирует в вызове принятия решения, и это механистическое объяснение инверсии задержки, а не загадка. Скорер выполняет ровно один прямой проход по промпту, длина которого задаётся состоянием, схемой и описаниями опций, — а не тем, что пишет модель, потому что она ничего не пишет. В таком режиме количество параметров — стоимость второго порядка, поэтому обычная причина брать самый маленький чекпойнт не работает: вы экономите не время, а память. Весь репозиторий 0.8B — около 1,73 ГБ против 4,46 ГБ у этой модели, и это честная причина предпочесть его. Единственное реальное достоинство 2B — то, что она случайно оказывается самой быстрой из быстрых, с отрывом, достаточно малым, чтобы считаться шумом.

В сравнении с Microsoft-Decision-1 это утверждение почти нерелевантно, потому что эти две модели находятся в разных режимах задержки. Скорость размещённой конечной точки зависит от конфигурации вашего развёртывания — бессерверный режим против выделенной пропускной способности на одном и том же стандартном SKU — прежде чем она зависит от модели, а Microsoft не публикует никаких показателей на один вызов для сравнения. Что Microsoft действительно публикует, так это жёсткое операционное ограничение, которое действует в обратную сторону: пакетный вывод отключён. Нет офлайн-канала, через который можно было бы амортизировать массовый прогон скоринга, поэтому конвейер на Microsoft-Decision-1 платит интерактивную стоимость за каждое решение, тогда как самостоятельно размещённый чекпойнт платит в GPU-часах независимо от того, выполняет он скоринг или нет.

Калибровочная колонка, где середина проигрывает

Прочитайте три карточки Intern-Decision вместе — и семейство перестанет вести себя предсказуемо. Точность монотонна по размеру; калибровка — нет. 2B имеет ECE 0,100 — самый слабый показатель из трёх — и подобранную температуру 2,100509348278, что значительно ниже, чем 2,747760550703 у 0.8B. Карточка предписывает использовать модуль инференса, поставляемый с тем размером, который вы скачали, потому что калибровки по умолчанию заданы для каждого чекпоинта; тот, кто копирует обёртку от одного родственного варианта к другому, незаметно применяет неверную температуру.

Само это преобразование стоит понять, прежде чем считать те 0,100 приговором весам. Это softmax по логитам кандидатов поля, за которым следует второй softmax по логарифму этого распределения, делённому на температуру. Поскольку оно выполняется после первого softmax и сохраняет порядок, оно вообще не может изменить argmax. Оно сдвигает уверенность, вероятность «да» и ожидаемое значение вопроса с оценкой, а метку оставляет неизменной. Если ваш конвейер читает метки, температура — холостая операция, а ECE — диковинка. Если ваш конвейер читает вероятности — применяет к ним пороги, ранжирует по ним, подаёт их в вычисление ожидаемого значения, — то ECE 0,100 — это разница между порогом, который означает то, что вы написали, и порогом, который этого не означает. Правильная реакция — подобрать собственную температуру на собственных размеченных примерах, а не делать вывод, что веса плохи.

Microsoft-Decision-1 требует точно такой же работы, но с меньшим объёмом исходных данных. На его вкладке «Бенчмарки» указано, что точность, ошибка калибровки, полнота по безопасности, доли ложноположительных срабатываний и согласованность справедливости измерялись на публичных и общественных бенчмарках для принятия решений, а также на отложенных внутренних тестовых наборах, что порядок вариантов варьировался, что применялись парные статистические тесты, и что модель «работает наравне с ведущими моделями для принятия решений и опережает другие открытые модели для принятия решений, оценённые по той же методологии». Ни ECE. Ни Brier. Ни температуры. Ни таблицы точности. Модель, всё ценностное предложение которой — заслуживающая доверия вероятность, — это та самая модель в этом сравнении, для которой вообще не опубликовано ни одной цифры калибровки.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Intern-Decision-2B. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; context 32,768 tokens; modalities text only; batch inference disabled; calibration error not published; latency not published. Right column Intern-Decision-2B rows read: availability uploaded September 26, 2026; context 8,192 tokens with oversize input rejected; modalities text plus up to eight images; batch inference not applicable, self-hosted; ECE 0.100, the worst of its three siblings; 33.28 ms mean on a single RTX 4090, the fastest of the three. A footer line reads that the InternLM figures are vendor-reported and the 2B's fitted temperature is 2.100509348278.

Границы контракта: четыре вещи, которые хостируемая модель не будет делать

Две модели получают, казалось бы, один и тот же вызов, а расхождения живут по его краям.

• Модальность — Microsoft-Decision-1 явно работает только с текстом и не принимает изображения, аудио или видео. Intern-Decision-2B принимает до восьми изображений вместе с состоянием, что делает его кандидатом для сортировки скриншотов и проверок макета, которые хостируемый API не способен обслуживать ни с какой точностью.

• Предельный объём входных данных и режим отказа — Microsoft-Decision-1 выполняет один вызов для входных данных объёмом до 32 768 токенов. Intern-Decision-2B объявляет DecisionEngine(max_length=8192) и отклоняет входные данные превышенного размера, а не усекает их, что является правильным поведением для скорера и одновременно жёстким ограничением, поскольку состояние, схема и скелет должны присутствовать все вместе за один проход; ни одна стратегия разбиения на фрагменты не сохраняет контракт.

• Форма вопроса — InternLM описывает от одного до шестнадцати вопросов на вызов, до 62 вариантов в каждом, по трём типам полей (choice, score, noul), где noul — это бинарный да/нет, возвращающий вероятность, а score возвращает взвешенное по вероятности ожидаемое значение по шкале, которую вы задаёте. Microsoft документирует форматы — да/нет, множественный выбор, рейтинг, классификация, рубрика — а также явно поддерживаемый вариант воздержания, например «не могу сказать», когда доказательств недостаточно; это самая полезная строка на странице для любого, кто пишет логику эскалации.

• Цена — на странице модели Microsoft-Decision-1 не указан тариф; ссылки на цены ведут на страницу цен Microsoft, поэтому стоимость за одно решение приходится узнавать в Azure или из счёта, причём 0% из неё приходится на выходные токены, поскольку их нет. Intern-Decision-2B не стоит ничего за вызов, а всё — за время GPU, и у него нет хостинг-провайдера. Его хранилище — примерно 4,46 ГБ, распределённые между 3,76 ГБ языкового шарда, 612,5 МБ визуальной башни и 50,3 МБ проектора.

Что подтверждено, а что — только слова вендора

Разделение этих двух категорий — это вся дисциплина в этом семействе. Подтверждено списком файлов или HTTP-ответом: количество параметров, карта шардов, пара лицензий, базовая модель, архитектура под этим — Qwen3_5ForConditionalGeneration с 24 слоями, размером скрытого состояния 2 048, 8 головами запросов против 2 голов ключ-значение, размерностью головы 256, повторяющимся шаблоном из трёх слоёв линейного внимания на один слой полного внимания, одним сохранённым слоем предсказания нескольких токенов и потолком эмбеддингов в 262 144 позиции, который потолок движка в 8 192 токена делает практически несущественным.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, and the opening description of Intern-Decision-2B as a multimodal structured decision model fine-tuned from Qwen3.5-2B that accepts a shared state, a schema of named questions and optional images.

Заявлено вендором и не воспроизведено: каждая цифра точности, каждый показатель задержки и температура. Нет статьи, нет записи на arXiv, нет поста о запуске, нет списка изменений и нет независимой оценки. Демо-Space отвечает 401, а это значит, что он не публичный, а не сломанный. Репозиторий на GitHub, появившийся после того, как появилась модель, — три коммита, код обучения, два бэкенда для инференса, набор для оценки с 10 751 тестовой строкой, бенчмарк калибровки на 96 случаев и руководство по воспроизведению — это больше документации, чем получает большинство тихих релизов, и в нём нет весов, нет обучающих данных и нет лицензии на код. Microsoft находится в другой, но смежной позиции: её методология реальна, а её заявление носит качественный характер, и ни одна из компаний сейчас не находится в положении, позволяющем кому-либо, кроме вас, проверить её ключевую цифру.

Где OrcaRouter находится в подобном конвейере

Ни одна из этих моделей не входит в наш каталог, и ничто здесь не следует воспринимать как заявление о доступности. Модель, возвращающая вероятности вместо текста, — это не то, куда направляют chat completions, и это верно для обеих. Что у нас действительно есть — так это генеративная половина цикла, которому служат эти скореры: более 200 моделей за одним ключом, совместимым с OpenAI, которые пишут рубрику, составляют черновики ответов-кандидатов и формируют вызов инструмента, который скорер затем оценивает, прежде чем тот выполнится. Каталожная цена провайдера передаётся с нулевой наценкой, так что снижение цены вендором на стороне генерации действует и у нас в тот же день, а если вы предпочитаете не ставить свой порог на одну модель-судью, DSL маршрутизации объединяет несколько моделей в один вызов, а объединение моделей сообщает их согласие как поле, которое можно оценивать. Автоматическое переключение при сбое поддерживает эту сторону работоспособной, когда отдельный провайдер деградирует, — а в цикле, который оценивает всё, что видит, это важнее, чем в том, который отвечает пользователю время от времени.

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

Итог

Microsoft-Decision-1 находится в общем доступе на Microsoft Foundry с 8 октября 2026 года: размещённый, только текстовый, 32 768 токенов, база Qwen3.5-9B, дообученная Microsoft, без распределённых весов и раздел с бенчмарками, который документирует методологию, не приводя цифр — включая отсутствие задержки, с отключённым пакетным выводом. Intern-Decision-2B — это чекпоинт с 2 213 241 664 параметрами под Apache-2.0 от 26 сентября 2026 года, который является самым быстрым из трёх своих собратьев — 33,28 мс на 4090 — и самым плохо откалиброванным при ECE 0,100, с подобранной температурой 2,100509348278, которая не может изменить метку, но изменит каждую уверенность, по которой вы устанавливаете порог. Если вы хотите средний размер, честное обоснование для него слабое: заплатите дополнительные 2,7 ГБ за точность 4B или примите занимаемый объём 0.8B, и в любом случае настройте свою калибровку, прежде чем порог окажется где-либо рядом с продакшеном.

То, что мы действительно предоставляем, — это генеративная половина цикла, которому служат эти оценщики: более 200 моделей за одним ключом, совместимым с OpenAI, которые пишут рубрику, составляют черновики ответов-кандидатов и отправляют вызов инструмента, который затем оценивается оценщиком, прежде чем будет выполнен.