Сгенерированная титульная карточка для Microsoft-Decision-1 vs Intern-Decision-4B с подзаголовком «два оценщика: один с числами, другой без», плашками с надписями 9B vs 4B, хостинговый API vs открытые веса, нет опубликованных бенчмарков vs Brier 0.347 и ECE 0.065, а также футер с указанием источников, отмечающий, что данные Microsoft не воспроизведены, а данные InternLM заявлены поставщиком.
Guides & Insights

Microsoft-Decision-1 против Intern-Decision-4B: один публикует свою калибровку, другой публикует свою методологию

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Поставьте Microsoft-Decision-1 рядом с Intern-Decision-4B — и получится сравнение, в котором всё решает не столько функциональность, сколько то, что каждый вендор был готов опубликовать. Модель Microsoft стала общедоступной в Microsoft Foundry 8 октября 2026 года: база Qwen3.5-9B, дообученная Microsoft, только текст, контекст на 32 768 токенов, веса не распространяются, методология оценки с описанием точности, ошибки калибровки и парных статистических тестов — и ни одного результата. Intern-Decision-4B от InternLM появилась на Hugging Face 26 сентября 2026 года в 05:36:37 UTC без какого-либо анонса, дообучена из Qwen3.5-4B, принимает изображения наравне с текстом, работает за 44 миллисекунды на одной RTX 4090 и выдаёт полную таблицу значений Brier и ожидаемой ошибки калибровки. Обе возвращают распределение вероятностей по заданным вами вариантам. Но только одна из них говорит, насколько хорошо она это делает.

Эта инверсия — когда более крупная и лучше финансируемая модель оказывается непрозрачной — определяет всю суть этого противостояния и для большинства команд решает выбор быстрее, чем любая строка в спецификации.

Единственное число, которое их разделяет

InternLM сообщает Brier 0,347 и ECE 0,065 для Intern-Decision-4B по всему его набору бенчмарков, со средним баллом 90,02 по Jevbench-Easy (100,00), Jevbench-Original (98,61), Jevbench-Hard (73,87), Typed Decision (80,55), ToolACE (96,45), AG News (90,82) и WildJailBreak (89,86). Это цифры, заявленные производителем на его собственном тестовом стенде, а строки Jevbench в особенности относятся к собственному семейству бенчмарков проекта — воспринимайте их как самооценку, а не независимую проверку. Но это числа с указанной шкалой, и именно ECE — тот показатель, который говорит, стоит ли действовать на основе возвращённого значения 0,8.

Microsoft не публикует аналогов. Вкладка Benchmarks на странице каталога Microsoft-Decision-1 описывает, что было измерено, и утверждает, что модель «работает наравне с ведущими моделями принятия решений и опережает другие открытые модели принятия решений, оценённые по той же методологии», при этом сильнейшими областями названы рассуждения, применение правил и устойчивость к формату запросов, а слабейшей — специализированные знания в предметной области. Ни Brier, ни ECE, ни таблицы точности. Если для принятия решения о внедрении вам нужен калибровочный показатель, прежде чем вы сможете определить порог эскалации, одна из этих двух моделей предоставит его вам, а другая попросит вас измерить его самостоятельно.

A generated two-column scoreboard for Microsoft-Decision-1 and Intern-Decision-4B across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus Qwen3.5-4B fine-tuned by InternLM; weights hosted API only versus Apache-2.0 download; modality text only versus text plus up to eight images; context 32,768 tokens versus per-call limits of one to sixteen questions and up to 62 options each; published scores none versus a vendor-reported average of 90.02 with Brier 0.347 and ECE 0.065; and latency not published versus 44.16 ms mean on an RTX 4090. A footer notes Microsoft figures are unreproduced and InternLM figures vendor-reported.

В чём на самом деле различаются два договора

Внешне эти модели принимают один и тот же вызов. Вы передаёте состояние, схему именованных вопросов и фиксированный набор вариантов; в ответ вы получаете вероятность для каждого варианта без единого токена сгенерированного текста. Различия проявляются на границах этого контракта.

• Модальность — Microsoft-Decision-1 является строго текстовой моделью и не принимает и не создаёт изображения, аудио или видео. Intern-Decision-4B принимает необязательные изображения вместе с состоянием, до восьми за вызов, что делает его кандидатом для триажа скриншотов, проверки макета документов и маршрутизации визуального QA.

• Количество вопросов — InternLM описывает от 1 до 16 вопросов на вызов, до 62 вариантов в каждом, по трём типам полей (choice, score, noul). Microsoft описывает форматы — да/нет, множественный выбор, рейтинг, классификация, рубрика — и один вызов объёмом до 32K токенов, но не предельное число вопросов на вызов.

• Контекст — Microsoft заявляет 32 768 токенов. В карточке Intern-Decision-4B ограничения указаны в вопросах, вариантах и изображениях, а не одним числом контекста, поэтому их нельзя сопоставить по одному показателю.

• Распространение — Microsoft-Decision-1 — это хостинговый API Foundry; веса модели не распространяются, и загрузка недоступна. Intern-Decision-4B распространяется под Apache-2.0 на Hugging Face с лицензией Qwen из исходного проекта, сохраняемой в виде LICENSE-QWEN, что означает сохранение этой лицензии и уведомлений исходного проекта, если вы будете распространять его в дальнейшем.

• Структура затрат — Веса InternLM ничего не стоят при запуске и заявлены на уровне 44,16 мс в среднем и 44,60 мс по P95 на одной RTX 4090. Цена Microsoft за токен вообще не указана на странице модели.

• Управление — Microsoft поставляет оценку ответственного ИИ, документированные практики развёртывания и явные исключения (не для генерации текста, открытых вопросов-ответов, диалога, перевода или суммаризации; не должен быть единственным автоматизированным субъектом, принимающим решения в значимых решениях, касающихся людей). InternLM поставляет карточку модели, которая откровенно говорит о происхождении — веса «изменены посредством decision tuning» — и ничего похожего на пакет соответствия требованиям.

A screenshot of the Intern-Decision-4B model card on Hugging Face, read 10 October 2026, showing the internlm organisation, 83 likes, the Image-Text-to-Text pipeline tag, Transformers and Safetensors badges, and qwen3_5 and decision-making as the listed tags alongside the model card heading.

Две совершенно разные причины, по которым значения задержки трудно сравнивать

Microsoft-Decision-1 не публикует показатель задержки, так что рядом со средним значением InternLM в 44,16 мс ставить нечего. Для такой рабочей нагрузки это не мелкое упущение. Эти модели существуют, чтобы их вызывали множество раз внутри конвейера — по одному разу на каждый извлечённый документ, на каждый предложенный вызов инструмента, на каждый оцениваемый ответ, — и разница между четырьмя решениями в секунду и сорока — это разница между оценкой выборки и оценкой всего. Показатель InternLM достижим уже сегодня на оборудовании, которое можно арендовать с почасовой оплатой; показатель Microsoft приходится измерять через собственное развёртывание Foundry, и выбранная вами конфигурация развёртывания (бессерверная с оплатой по мере использования или выделенная пропускная способность) изменит его сильнее, чем сама модель.

Именно здесь становится актуальной та половина паттерна, которая относится к OrcaRouter, — и это только генеративная половина. Мы не размещаем у себя Microsoft-Decision-1 или Intern-Decision-4B: модель, возвращающая вероятности вместо текста, — это не то, куда маршрутизируют запросы chat completions, и ни одна из них не фигурирует в нашем каталоге. За нашим единственным ключом, совместимым с OpenAI, стоит пул из более чем 200 моделей, который и делает всю писательскую работу: промпт для судьи, составленный одной моделью, ответы-кандидаты, сгенерированные двумя другими, вызов инструмента, который оценивается до запуска. Цены из прайс-листа провайдера передаются с наценкой 0 %, поэтому снижение цены на генератор вступает в силу на нашей стороне в тот же день, а автоматическое переключение при сбое поддерживает работоспособность генеративной стороны цикла оценки, когда один из провайдеров начинает работать хуже, — а это здесь важнее, чем обычно, потому что конвейеру, который оценивает всё, что видит, не хватает запаса, чтобы повторить зависший вызов.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

Кто что должен взять?

Выбирайте Intern-Decision-4B, если верно хотя бы одно из следующего: вам нужно оценивать как изображения, так и текст; вам нужно калибровочное число, прежде чем выпускать продукт; вы хотите иметь возможность запускать модель на собственном оборудовании в контролируемом вами контуре; или вы хотите дообучить её. Последний пункт заслуживает особого внимания — 4B-оценщик с открытыми весами и документированной обёрткой — это модель, которую можно адаптировать под собственные метки, а Microsoft-Decision-1 — это хостируемый API без возможности дообучения и без весов для адаптации.

Выбирайте Microsoft-Decision-1, если блокер — это закупка, а не производительность: вам нужны аутентификация Azure, единый биллинг, управление и оценка Responsible AI от поставщика, прежде чем что-либо попадёт в продакшен, а также нужен контекст 32K для длинных документов, работу с которыми усложняют ограничения 4B на один вызов. Отсутствие опубликованных бенчмарков — реальная цена, но эту цену можно закрыть за один день, прогнав собственный размеченный набор через обе модели и сравнив ECE, — что вы в любом случае сделали бы, прежде чем доверять таблице любого из поставщиков.

Неудобный ответ заключается в том, что оба варианта достаточно дешевы для тестирования, так что спорить почти не о чем. Intern-Decision-4B требует GPU, который у вас, вероятно, уже есть. Microsoft-Decision-1 требует развертывания в Foundry и выборки ваших собственных размеченных решений. Прогоните свои данные через оба, вычислите калибровку на подмножестве, которое важно для вас, и пусть решают числа — что, как и подобает, как раз и есть то, для чего эти модели предназначены.