Сгенерированная титульная карточка для Microsoft-Decision-1 с подзаголовком «модель оценки решений, возвращающая вероятность вместо предложения», со значком с надписью Microsoft Foundry, общедоступна с 8 октября 2026 года, и чипами с надписями: базовая модель 9B, контекст 32 768 токенов, веса не распространяются, и только текст без генерации.
Guides & Insights

Microsoft-Decision-1: модель Microsoft, которая отвечает числом, а не предложением

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

В карточке модели Microsoft-Decision-1 есть строка, которой никогда не было ни у одной другой модели Microsoft: не предназначена для генерации текста. Модель стала общедоступной в Microsoft Foundry 8 октября 2026 года, и это намеренное сужение того, для чего предназначена языковая модель. Вы даёте ей ситуацию и вопрос с фиксированным списком ответов — да/нет, набор вариантов ответа, шкала оценок, рубрика — и она возвращает калиброванную вероятность для каждого варианта. Никакой прозы. Никаких объяснений. Ни поля обоснования. На выходе — числа JSON и ничего больше. Она построена на модели с открытыми весами Qwen3.5-9B, дообученной Microsoft, и Microsoft говорит, что позже переведёт модель на другие базовые архитектуры, называя MAI и другие партнёрские модели.

Это более странный продукт, чем кажется на первый взгляд. Конкурентная позиция Microsoft в 2026 году опирается на передовые чат-модели и на Copilot, а Microsoft-Decision-1 — противоположность и тому, и другому: среднеразмерный узкоспециализированный оценщик, вся задача которого — сообщать приложению, какой из ваших собственных вариантов, скорее всего, правильный и насколько он в этом уверен. Интересный вопрос не в том, хорошо ли он пишет — он явно плох в этом и не пытается — а в том, является ли распределение вероятностей по вариантам более полезным примитивом для рабочих нагрузок, которые реально выполняют предприятия, чем ещё одна универсальная модель с режимом JSON.

Что именно оно делает

Контракт таков: один вызов на входе — одно распределение на выходе. Microsoft перечисляет поддерживаемые форматы вопросов: да/нет, с выбором из нескольких вариантов, рейтинговый, классификационный и на основе рубрик. Каждый вариант получает балл. Модель работает за один вызов на входных данных объёмом до 32K токенов — заявленное контекстное окно составляет 32 768 — а практический предел — это входные данные плюс набор вариантов, а не бюджет генерации, потому что генерации нет.

Опубликованные сценарии использования — это те, которые команда платформы сразу узнает:

• Оценка результатов ИИ — оцените сгенерированный ответ по предоставленной рубрике или определите, обоснован ли он имеющимися доказательствами.

• Классификация и маршрутизация — классифицировать запрос, оценить релевантность, рассортировать очередь, выбрать ветвь рабочего процесса.

• Ограничители агента — оцените предлагаемый вызов инструмента или действие агента до того, как интегрирующее приложение разрешит его выполнение.

• Проверка безопасности контента — помечайте контент по пороговым значениям, заданным приложением, а не по фиксированной политике поставщика.

• Релевантность поиска и документа — оцените, отвечает ли найденный документ на поставленный вопрос.

• Автоматизация на основе уровня уверенности — автоматически принимать результаты с высокой уверенностью, а остальные передавать человеку.

Опция отказа от ответа — это деталь, на которую стоит обратить внимание. Microsoft явно поддерживает такие варианты, как «не могу сказать», когда предоставленных доказательств недостаточно; именно это отличает калиброванный оценщик от того, который просто уверен. А поскольку оценки возвращаются в виде чисел, порог эскалации — это решение, которое принимаете вы: вы задаёте, при каком значении 0,7 что-то передаётся человеку, а 0,95 — нет.

Что это не будет делать

Microsoft на удивление прямо говорит об исключениях, и для тех, кто оценивает это для реального пайплайна, они важнее списка функций. Microsoft-Decision-1непредназначен для генерации текста, ответов на открытые вопросы, беседы, перевода или суммирования. Он не предназначен для задач без закрытого вопроса и заданного набора вариантов ответа, а также для задач, требующих знаний, отсутствующих во входных данных. Он работает только с текстом: ни изображений, ни аудио, ни видео на входе и на выходе. Он не даёт пояснений или обоснований.

Прочитайте их вместе — и появится граница, через которую легко переступить. Это не чат-бот, которого можно попросить заодно классифицировать что-либо, и не суммаризатор, к которому можно прикрутить оценку. Это функция скоринга с бюджетом токенов. Собственная формулировка команды — что она не должна быть единственным автоматизированным лицом, принимающим решения, в значимых решениях о людях и не должна быть единственной основой для решений, касающихся кредита, трудоустройства, жилья, страхования, образования, здравоохранения, юридических прав «или аналогичных значимых областей», — указывает в ту же сторону. Она задумана так, чтобы находиться рядом с решением, а не быть им.

A single-column generated scoreboard for Microsoft-Decision-1 with six rows: base model Qwen3.5-9B post-trained by Microsoft; weights hosted API only and not distributed; context window 32,768 tokens; output calibrated JSON probabilities with zero output tokens; published benchmarks none, methodology only; status generally available on Microsoft Foundry on October 8 2026. A footer line reads that all figures are Microsoft-reported and not independently reproduced.

Ситуация с бенчмарками — это история, которую никто не хочет печатать.

Чисел нет. На странице каталога Microsoft Foundry для Microsoft-Decision-1 есть вкладка Benchmarks, и она пуста — в ней нет цифр. Вместо этого она содержит абзац о методологии и качественное утверждение: модель «оценивалась на публичных и сообщественных бенчмарках для принятия решений и на отложенных внутренних тестовых наборах, не использовавшихся при обучении», Microsoft сообщает, что она «показывает результаты на уровне ведущих моделей принятия решений и опережает другие открытые модели принятия решений, оценённые по той же методологии», а использованными метриками были точность, ошибка калибровки, полнота по безопасности, частоты ложноположительных срабатываний и согласованность по справедливости, при этом порядок вариантов варьировался и применялись парные статистические тесты.

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text states that it is a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, that it is built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, that it will also rebase on other models including MAI and OpenAI, and lists quick facts: publisher Microsoft, type Text classification and Zero shot classification, lifecycle Generally available (GA), context window 32768, and a Pricing field that links out rather than printing a rate.

Это серьёзное описание методологии, не подкреплённое ни одним опубликованным результатом. Это означает, что все заявления о производительности Microsoft-Decision-1 на сегодняшний день исходят от вендора и не воспроизведены, а честная позиция для любого, кто его оценивает, такова: калибровка — то единственное свойство, которое вообще делает вероятность полезной, — не проверена за пределами Microsoft. При этом компания всё же указывает, где, по её мнению, модель наиболее сильна, а где наиболее слаба, и это полезнее, чем одна цифра в заголовке: сильнее всего — в рассуждениях, применении правил и устойчивости к форматированию промптов; конкурентоспособна — в классификации, поиске, справедливости, использовании инструментов и большинстве многоязычных задач; слабее — в задачах, требующих узкоспециализированных предметных знаний.

Заявленные самими разработчиками ограничения стоит прочитать до списка возможностей. Оценки могут меняться в зависимости от формулировки и порядка вариантов, а плохо сформулированный вопрос всё равно возвращает оценку. Калибровка наиболее надёжна на знакомых типах задач. Он может опираться на устаревшие знания и не даёт объяснений. Что касается многоязычного покрытия: в качестве поддерживаемых указаны 25 языков, включая японский, корейский, арабский, вьетнамский, тайский, турецкий, хинди, бенгальский, суахили, иврит, персидский и украинский, но Microsoft заявляет, что покрытие, качество и калибровка «могут различаться в зависимости от языка», и относит неанглийские языки — особенно языки с меньшей ресурсной базой — к области недостаточной производительности. Базовая модель Qwen3.5-9B поддерживает более 200 языков; дообученная модель поддерживает четверть этого числа.

Как это получить и сколько это стоит

Microsoft-Decision-1 распространяется как размещённый API в Microsoft Foundry в составе портфеля «Direct from Azure». Веса модели не распространяются — это не выпуск с открытыми весами, и для его загрузки нет репозитория Hugging Face. Любое приложение, способное отправлять HTTPS-запросы, может интегрироваться с помощью конечных точек Foundry и стандартной аутентификации Azure. В перечне развёртываний показаны варианты serverless и unified-endpoint с оплатой по мере использования или зарезервированной подготовленной пропускной способностью, стандартный SKU, с отключённым пакетным выводом, а раскрытие сведений об обучении сообщает, что набор данных для обучения впервые был использован в сентябре 2026 года, при этом его сбор продолжается.

Цены не публикуются на странице модели. Поле с ценой в каталоге ссылается на страницу цен Microsoft на модели, а не указывает тариф за входные и выходные данные, поэтому стоимость одного токена при вызове Decision-1 приходится искать в интерфейсе цен Azure или смотреть в счёте. Это реальный пробел для всех, кто пытается моделировать стоимость одного решения при больших объёмах, и об этом стоит сказать прямо, а не пытаться оценить. Два момента стоит знать, когда вы всё-таки оцениваете цену: 0% стоимости приходится на выходные токены, потому что их нет, а пакетный вывод отключён, поэтому нельзя амортизировать массовый прогон скоринга через пакетный канал так, как это было бы с генеративной моделью.

Роль OrcaRouter в этой схеме — на другой стороне вызова. Мы не хостим Microsoft-Decision-1, и его нет в нашем каталоге — модель, возвращающая вероятности, а не текст, — это не та модель, на которую направляют запросы chat completions. Что мы предоставляем, так это ту половину шаблона, которая генерирует: модели, которые пишут рубрику, составляют черновики ответов-кандидатов или создают вызов инструмента, который затем оценивает Decision-1. Они доступны через один ключ, совместимый с OpenAI, с более чем 200 моделями на нём, по цене провайдера из прайс-листа, передаваемой с наценкой 0%, так что снижение цены от поставщика на модель-судью становится доступным на нашей стороне в тот же день. Если вы строите цикл оценки, где одна модель пишет, а другая оценивает, вызов оценки идёт в Microsoft, а вызов генерации может идти куда угодно — в том числе через DSL маршрутизации, который объединяет несколько моделей в один вызов, когда вы хотите панель, а не одного судью.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filter controls for input modalities, context length, input price, status, series and supported parameters, and a search field. No decision-scoring model appears in the listing.

Почему скорер — это другая ставка, чем более совершенный чат-бот

Схема, которую здесь продаёт Microsoft, уже существует в открытом доступе. Intern-Decision-4B от InternLM, d1-3B от Liquid AI, Laya от Convai Innovations и семейство Kev от Jared Palmer — все они возвращают калиброванные распределения по предоставленным вариантам без генерации текста, и большинство из них — это веса под Apache-2.0, которые можно бесплатно запускать на собственном оборудовании. Предложение Microsoft отличается тремя аспектами, не зависящими от бенчмарков: это управляемый API с привязанными аутентификацией Azure, биллингом и управлением, поэтому он вписывается в корпоративный путь закупок, чего не обеспечивает загрузка с Hugging Face; его основа — модель на 9B, крупнее большинства в этой области; и он поставляется с оценкой Responsible AI и документированной методологией оценки, что часто и является фактическим обязательным требованием для регулируемого развёртывания.

Чего в нём нет — так это числа. На фоне открытых конкурентов, публикующих оценки Брайера и ожидаемую ошибку калибровки — две цифры, которые говорят, означает ли 0,8 именно 0,8, — Microsoft опубликовала методологию и никаких результатов. Пока не появится независимое тестирование калибровки, оправданный способ использовать Microsoft-Decision-1 — тот, который рекомендует его собственная документация: валидировать на данных, репрезентативных для вашего сценария использования, устанавливать пороги исходя из стоимости ваших ошибок, всегда включать вариант воздержания от ответа, рандомизировать порядок вариантов там, где порядок может сместить ответ, и оставлять человека в контуре для всего, что имеет последствия. Это хороший совет для любого скорера. Особенно хороший совет для того, чью калибровку никто за пределами компании не измерял.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube