
Microsoft-Decision-1: модель Microsoft, которая отвечает числом, а не предложением
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 за 1 млн токенов · 79 tok/s
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 355 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
В карточке модели Microsoft-Decision-1 есть строка, которой никогда не было ни у одной другой модели Microsoft: не предназначена для генерации текста. Модель стала общедоступной в Microsoft Foundry 8 октября 2026 года, и это намеренное сужение того, для чего предназначена языковая модель. Вы даёте ей ситуацию и вопрос с фиксированным списком ответов — да/нет, набор вариантов ответа, шкала оценок, рубрика — и она возвращает калиброванную вероятность для каждого варианта. Никакой прозы. Никаких объяснений. Ни поля обоснования. На выходе — числа JSON и ничего больше. Она построена на модели с открытыми весами Qwen3.5-9B, дообученной Microsoft, и Microsoft говорит, что позже переведёт модель на другие базовые архитектуры, называя MAI и другие партнёрские модели.
Это более странный продукт, чем кажется на первый взгляд. Конкурентная позиция Microsoft в 2026 году опирается на передовые чат-модели и на Copilot, а Microsoft-Decision-1 — противоположность и тому, и другому: среднеразмерный узкоспециализированный оценщик, вся задача которого — сообщать приложению, какой из ваших собственных вариантов, скорее всего, правильный и насколько он в этом уверен. Интересный вопрос не в том, хорошо ли он пишет — он явно плох в этом и не пытается — а в том, является ли распределение вероятностей по вариантам более полезным примитивом для рабочих нагрузок, которые реально выполняют предприятия, чем ещё одна универсальная модель с режимом JSON.
Что именно оно делает
Контракт таков: один вызов на входе — одно распределение на выходе. Microsoft перечисляет поддерживаемые форматы вопросов: да/нет, с выбором из нескольких вариантов, рейтинговый, классификационный и на основе рубрик. Каждый вариант получает балл. Модель работает за один вызов на входных данных объёмом до 32K токенов — заявленное контекстное окно составляет 32 768 — а практический предел — это входные данные плюс набор вариантов, а не бюджет генерации, потому что генерации нет.
Опубликованные сценарии использования — это те, которые команда платформы сразу узнает:
• Оценка результатов ИИ — оцените сгенерированный ответ по предоставленной рубрике или определите, обоснован ли он имеющимися доказательствами.
• Классификация и маршрутизация — классифицировать запрос, оценить релевантность, рассортировать очередь, выбрать ветвь рабочего процесса.
• Ограничители агента — оцените предлагаемый вызов инструмента или действие агента до того, как интегрирующее приложение разрешит его выполнение.
• Проверка безопасности контента — помечайте контент по пороговым значениям, заданным приложением, а не по фиксированной политике поставщика.
• Релевантность поиска и документа — оцените, отвечает ли найденный документ на поставленный вопрос.
• Автоматизация на основе уровня уверенности — автоматически принимать результаты с высокой уверенностью, а остальные передавать человеку.
Опция отказа от ответа — это деталь, на которую стоит обратить внимание. Microsoft явно поддерживает такие варианты, как «не могу сказать», когда предоставленных доказательств недостаточно; именно это отличает калиброванный оценщик от того, который просто уверен. А поскольку оценки возвращаются в виде чисел, порог эскалации — это решение, которое принимаете вы: вы задаёте, при каком значении 0,7 что-то передаётся человеку, а 0,95 — нет.
Что это не будет делать
Microsoft на удивление прямо говорит об исключениях, и для тех, кто оценивает это для реального пайплайна, они важнее списка функций. Microsoft-Decision-1непредназначен для генерации текста, ответов на открытые вопросы, беседы, перевода или суммирования. Он не предназначен для задач без закрытого вопроса и заданного набора вариантов ответа, а также для задач, требующих знаний, отсутствующих во входных данных. Он работает только с текстом: ни изображений, ни аудио, ни видео на входе и на выходе. Он не даёт пояснений или обоснований.
Прочитайте их вместе — и появится граница, через которую легко переступить. Это не чат-бот, которого можно попросить заодно классифицировать что-либо, и не суммаризатор, к которому можно прикрутить оценку. Это функция скоринга с бюджетом токенов. Собственная формулировка команды — что она не должна быть единственным автоматизированным лицом, принимающим решения, в значимых решениях о людях и не должна быть единственной основой для решений, касающихся кредита, трудоустройства, жилья, страхования, образования, здравоохранения, юридических прав «или аналогичных значимых областей», — указывает в ту же сторону. Она задумана так, чтобы находиться рядом с решением, а не быть им.

Ситуация с бенчмарками — это история, которую никто не хочет печатать.
Чисел нет. На странице каталога Microsoft Foundry для Microsoft-Decision-1 есть вкладка Benchmarks, и она пуста — в ней нет цифр. Вместо этого она содержит абзац о методологии и качественное утверждение: модель «оценивалась на публичных и сообщественных бенчмарках для принятия решений и на отложенных внутренних тестовых наборах, не использовавшихся при обучении», Microsoft сообщает, что она «показывает результаты на уровне ведущих моделей принятия решений и опережает другие открытые модели принятия решений, оценённые по той же методологии», а использованными метриками были точность, ошибка калибровки, полнота по безопасности, частоты ложноположительных срабатываний и согласованность по справедливости, при этом порядок вариантов варьировался и применялись парные статистические тесты.

Это серьёзное описание методологии, не подкреплённое ни одним опубликованным результатом. Это означает, что все заявления о производительности Microsoft-Decision-1 на сегодняшний день исходят от вендора и не воспроизведены, а честная позиция для любого, кто его оценивает, такова: калибровка — то единственное свойство, которое вообще делает вероятность полезной, — не проверена за пределами Microsoft. При этом компания всё же указывает, где, по её мнению, модель наиболее сильна, а где наиболее слаба, и это полезнее, чем одна цифра в заголовке: сильнее всего — в рассуждениях, применении правил и устойчивости к форматированию промптов; конкурентоспособна — в классификации, поиске, справедливости, использовании инструментов и большинстве многоязычных задач; слабее — в задачах, требующих узкоспециализированных предметных знаний.
Заявленные самими разработчиками ограничения стоит прочитать до списка возможностей. Оценки могут меняться в зависимости от формулировки и порядка вариантов, а плохо сформулированный вопрос всё равно возвращает оценку. Калибровка наиболее надёжна на знакомых типах задач. Он может опираться на устаревшие знания и не даёт объяснений. Что касается многоязычного покрытия: в качестве поддерживаемых указаны 25 языков, включая японский, корейский, арабский, вьетнамский, тайский, турецкий, хинди, бенгальский, суахили, иврит, персидский и украинский, но Microsoft заявляет, что покрытие, качество и калибровка «могут различаться в зависимости от языка», и относит неанглийские языки — особенно языки с меньшей ресурсной базой — к области недостаточной производительности. Базовая модель Qwen3.5-9B поддерживает более 200 языков; дообученная модель поддерживает четверть этого числа.
Как это получить и сколько это стоит
Microsoft-Decision-1 распространяется как размещённый API в Microsoft Foundry в составе портфеля «Direct from Azure». Веса модели не распространяются — это не выпуск с открытыми весами, и для его загрузки нет репозитория Hugging Face. Любое приложение, способное отправлять HTTPS-запросы, может интегрироваться с помощью конечных точек Foundry и стандартной аутентификации Azure. В перечне развёртываний показаны варианты serverless и unified-endpoint с оплатой по мере использования или зарезервированной подготовленной пропускной способностью, стандартный SKU, с отключённым пакетным выводом, а раскрытие сведений об обучении сообщает, что набор данных для обучения впервые был использован в сентябре 2026 года, при этом его сбор продолжается.
Цены не публикуются на странице модели. Поле с ценой в каталоге ссылается на страницу цен Microsoft на модели, а не указывает тариф за входные и выходные данные, поэтому стоимость одного токена при вызове Decision-1 приходится искать в интерфейсе цен Azure или смотреть в счёте. Это реальный пробел для всех, кто пытается моделировать стоимость одного решения при больших объёмах, и об этом стоит сказать прямо, а не пытаться оценить. Два момента стоит знать, когда вы всё-таки оцениваете цену: 0% стоимости приходится на выходные токены, потому что их нет, а пакетный вывод отключён, поэтому нельзя амортизировать массовый прогон скоринга через пакетный канал так, как это было бы с генеративной моделью.
Роль OrcaRouter в этой схеме — на другой стороне вызова. Мы не хостим Microsoft-Decision-1, и его нет в нашем каталоге — модель, возвращающая вероятности, а не текст, — это не та модель, на которую направляют запросы chat completions. Что мы предоставляем, так это ту половину шаблона, которая генерирует: модели, которые пишут рубрику, составляют черновики ответов-кандидатов или создают вызов инструмента, который затем оценивает Decision-1. Они доступны через один ключ, совместимый с OpenAI, с более чем 200 моделями на нём, по цене провайдера из прайс-листа, передаваемой с наценкой 0%, так что снижение цены от поставщика на модель-судью становится доступным на нашей стороне в тот же день. Если вы строите цикл оценки, где одна модель пишет, а другая оценивает, вызов оценки идёт в Microsoft, а вызов генерации может идти куда угодно — в том числе через DSL маршрутизации, который объединяет несколько моделей в один вызов, когда вы хотите панель, а не одного судью.

Почему скорер — это другая ставка, чем более совершенный чат-бот
Схема, которую здесь продаёт Microsoft, уже существует в открытом доступе. Intern-Decision-4B от InternLM, d1-3B от Liquid AI, Laya от Convai Innovations и семейство Kev от Jared Palmer — все они возвращают калиброванные распределения по предоставленным вариантам без генерации текста, и большинство из них — это веса под Apache-2.0, которые можно бесплатно запускать на собственном оборудовании. Предложение Microsoft отличается тремя аспектами, не зависящими от бенчмарков: это управляемый API с привязанными аутентификацией Azure, биллингом и управлением, поэтому он вписывается в корпоративный путь закупок, чего не обеспечивает загрузка с Hugging Face; его основа — модель на 9B, крупнее большинства в этой области; и он поставляется с оценкой Responsible AI и документированной методологией оценки, что часто и является фактическим обязательным требованием для регулируемого развёртывания.
Чего в нём нет — так это числа. На фоне открытых конкурентов, публикующих оценки Брайера и ожидаемую ошибку калибровки — две цифры, которые говорят, означает ли 0,8 именно 0,8, — Microsoft опубликовала методологию и никаких результатов. Пока не появится независимое тестирование калибровки, оправданный способ использовать Microsoft-Decision-1 — тот, который рекомендует его собственная документация: валидировать на данных, репрезентативных для вашего сценария использования, устанавливать пороги исходя из стоимости ваших ошибок, всегда включать вариант воздержания от ответа, рандомизировать порядок вариантов там, где порядок может сместить ответ, и оставлять человека в контуре для всего, что имеет последствия. Это хороший совет для любого скорера. Особенно хороший совет для того, чью калибровку никто за пределами компании не измерял.
