Сгенерированная титульная карточка для сравнения Decision 3.0 и Microsoft-Decision-1 с подзаголовком «тот же бэкбон Qwen3.5-9B, противоположные способы его покупки», плашками с надписями «веса Apache-2.0 против только хостинга», «изображения и видео против только текста», «опубликовано 10 окт. против GA 8 окт.» и нижним колонтитулом с надписью «Показатели Decision 3.0 — собственные данные vLLM-SR; показатели Microsoft-Decision-1 — собственные данные Microsoft; ни те, ни другие не воспроизведены независимо». Логотип OrcaRouter наложен в правом нижнем углу.
Engineering & Research

Decision 3.0 против Microsoft-Decision-1: одно — это загрузка, другое — SKU

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Уровень 9B Decision 3.0 и Microsoft-Decision-1 — на бумаге один и тот же продукт. Оба дообучают Qwen3.5-9B до скоринг-модели, которая отвечает на фиксированный набор вариантов ответа, выдавая по калиброванной вероятности для каждого, вообще не генерируя ни одного токена. Оба нацелены на одни и те же задачи — маршрутизацию запроса, оценку вывода по рубрике, допуск действия агента, сортировку очереди. Оба вышли с разницей в неделю: Microsoft-Decision-1 стал общедоступным в Microsoft Foundry 8 октября 2026 года и был анонсирован на следующий день, а d3-flash был выложен на Hugging Face в 17:23 UTC 10 октября 2026 года.

Разница не в модели. Она в том, что вам разрешено с ней делать. d3-flash — это скачиваемый и запускаемый чекпоинт Apache-2.0 с 8,39 млрд параметров, третий в семействе, которое начинается с 0,59 млрд и заканчивается на 26,09 млрд. Microsoft-Decision-1 — это хостинговый эндпоинт на Foundry, веса которого вообще не распространяются, в линейке, которую Microsoft, по её словам, позже переведёт на свои собственные модели MAI. Один из них — артефакт, другой — сервис. Почти каждый практический вопрос об этой паре вытекает из этого единственного факта, включая те, что выглядят как вопросы о бенчмарках.

Два решения о том, для чего предназначена модель принятия решений

Публикация Microsoft явно определяет область применения так, как это редко делается в карточках моделей. Поддерживаемые типы вопросов — да/нет, с несколькими вариантами ответа, оценка, классификация и оценка по рубрикам. Исключения перечислены столь же прямо: модель не предназначена для генерации текста, ответов на открытые вопросы, ведения диалога, перевода или суммаризации, а также для задач, требующих знаний, отсутствующих во входных данных. Она выполняет один проход по последовательности длиной до 32 768 токенов и выдаёт ноль выходных токенов, поскольку цикла декодирования нет. Microsoft также поддерживает возможность воздержаться от ответа, например «не могу определить», когда предоставленных доказательств недостаточно, и именно эта деталь делает применение порога к выходным данным хоть сколько-нибудь осмысленным.

d3-flash находится в той же концептуальной рамке — вопросы Choice, Noul (да/нет) и Score, один прямой проход на вопрос, вероятность на каждый вариант, без генерации — а затем расширяет входную сторону. Там, где Microsoft-Decision-1 по замыслу работает только с текстом, d3-flash принимает текст или JSON, несколько изображений на запрос размером до 1,6 мегапикселя каждое и несколько видео, считываемых со скоростью 2 кадра в секунду. Каждый вопрос в запросе видит каждое изображение и видео, прикреплённые к нему. Это меньшая модель, которая делает больше с тем входом, который ей дан.

Это первое настоящее разделение, и оно не вопрос вкуса. Если решение, которое вам нужно принять, касается скриншота, чека, графика или фрагмента записи с камеры, Microsoft-Decision-1 не может его принять. Это граница возможностей, а не пробел в качестве, и никакая работа над точностью её не закрывает.

Что каждый из них публикует и как

Здесь два релиза осуществляют действительно разные виды доказательства, и их стоит разделять, а не сопоставлять цифры.

Microsoft провела сравнение по 36 бенчмаркам, охватывающее почти 150 000 вопросов, скрытых от обучения, включая задачи маршрутизации, ранжирования, длинного контекста, многоязычные и выходящие за пределы распределения, а также рассуждения и безопасность, и заявляет, что её модель показала лучшие результаты по всем этим наборам. Задержку она сообщает в виде отношения, а не числа, — p50 примерно в 35 раз быстрее, чем GPT-6 Sol, и в 2,5 раза быстрее, чем H2O-Lightning-4B v1.1, которую называет занявшей второе место. Устойчивость она описывает как процедуру: один и тот же запрос, возмущённый восемью способами, средняя частота изменения решения 1,3% и ноль изменений, когда описания вариантов перефразируются либо варианты меняются местами или перемешиваются. Безопасность она проверяла на 5 250 запросах по 11 бенчмаркам, охватывающим вредоносный контент, джейлбрейкинг и промпт-инъекции. Она указывает стандарт калибровки, которому обязуется соответствовать, — прогноз с уверенностью 90% должен оказываться верным примерно в девяти случаях из десяти на репрезентативных примерах.

vLLM-SR опубликовал индекс. Jev Decision Index 0.3.1 ставит d3 на 64.7, а d3-flash на public-suite 57.79, заявленное преимущество в 11.0 над 9B-моделью Decision 2.0 на 46.76. Также утверждается, что все 140 178 публичных запросов были обработаны, и ни один не остался без поддержки, что является заявлением о покрытии, а не о точности. В карточке раскрывается, что собственная строка d3 — это внутренняя оценка, в то время как строки сравнения рядом с ней — Perplexity Decider v1.1, Fastino GLiDE, Jev, Torchcast Decision 27B — это данные live-борда. И на мультимодальной стороне модели семейства d3 сообщают о результатах Perception Test по всем 19 140 проверочным вопросам, при этом d3-flash имеет 73.3 против случайного уровня в 33.3 для трёх вариантов.

Итак: Microsoft публикует заявление о широте охвата с документированной методикой и показателем робастности — и ни одного значения калибровки по отдельным чекпойнтам. vLLM-SR публикует позицию в лидерборде с заявленным разрывом в происхождении данных между своей строкой и остальными, а также результат на видео — и тоже без показателя калибровки. Ни та, ни другая карточка не содержит Brier score или числа ожидаемой ошибки калибровки для описываемой модели. Для двух продуктов, вся ценность которых в том, что возвращаемое число что-то означает, это и есть общий пробел, и это самое полезное, что любой из вендоров мог бы выпустить следующим.

A generated two-column scoreboard headed 'Decision 3.0 d3-flash vs Microsoft-Decision-1 - the scoreboard'. The left column for d3-flash reads: base model Qwen3.5-9B fine-tuned, 8.39B parameters; distribution Apache-2.0 weights on Hugging Face from 10 October 2026; input text, images and video; context budget not stated on the card; reported accuracy Jev Decision Index 0.3 public suite 57.79, an internal evaluation; latency median 19.1 ms text, 149.4 ms image and 407.6 ms video. The right column for Microsoft-Decision-1 reads: base model Qwen3.5-9B post-trained, weights not distributed; distribution hosted on Microsoft Foundry, generally available 8 October 2026; input text only; context budget 32,768 tokens; reported accuracy best of 36 benchmarks covering nearly 150,000 blind questions; latency p50 around 35 times faster than GPT-6 Sol. A footer reads 'd3-flash figures are vLLM-SR's own internal evaluation; Microsoft-Decision-1 figures are Microsoft's own; neither is independently reproduced.'

Дистрибуция решает больше, чем спецификация.

Именно здесь сравнение перестаёт быть сравнением моделей.

С d3-flash вы получаете веса, decision_config.json, фиксирующий базовую ревизию, манифест SHA-256 для каждого файла, пользовательский код моделирования, голову считывания и документированный набор зависимостей, включающий transformers==5.17.0 и опциональный пакет CUDA-ядер для слоёв линейного внимания. Вы можете запускать это на своём оборудовании, дообучать, квантовать, изолировать в закрытом контуре. Вы также берёте на себя операционную работу: класс Python — это не эндпоинт, и карточка не указывает бюджет токенов для состояния, вопросов и описаний кандидатов — max_length равно null в поставляемой конфигурации, так что этот потолок вам предстоит выяснить.

С Microsoft-Decision-1 вы получаете эндпоинт внутри существующей облачной учетной записи — вместе с аутентификацией, региональной доступностью и элементами управления развертыванием, которые к этому прилагаются, — и при этом не несете никакой операционной работы. Но и контроля вы тоже не получаете. Нет репозитория для скачивания, нет пути для тонкой настройки и нет возможности развернуть модель самостоятельно; жизненным циклом модели управляет Microsoft, а не вы, и уведомление о прекращении поддержки или перенос на другой базовый каркас — это изменение, которое вы вынуждены принять, а не то, которое вы планируете сами. Microsoft заявила, что перенос на собственные модели MAI предстоит, — это разумная дорожная карта для модели, весь смысл которой в быстром однопроходном скоринге, и это также означает, что конкретный чекпойнт, который вы бенчмаркили, не обязательно окажется тем, к которому вы будете обращаться через год.

Историю с задержкой тоже нужно читать внимательно. Заголовок Microsoft — это соотношение с гораздо более крупной моделью общего назначения, и для её аргументации это правильное сравнение: задача модели принятия решений — заменить дорогой генеративный вызов дешёвым скоринговым, и 35x против GPT-6 Sol при p50 — так этот аргумент выглядит, когда он срабатывает. Цифры vLLM-SR абсолютны — одиночный запрос и один GPU — и они наглядно показывают модальный налог: на одном AMD Instinct MI325X текстовый запрос к d3-flash занимает медианные 19,1 мс, тот же запрос с изображением — 149,4 мс, а с десятисекундным видео — 407,6 мс. Оба набора данных заявлены вендорами, на разном оборудовании, и ни один из них не был воспроизведён вне лаборатории, которая их создала.

A screenshot of the vllm-sr/d3 model card on Hugging Face, the flagship checkpoint of the Decision 3.0 family that d3-flash belongs to. The header shows 18 likes, the vLLM Semantic Router organisation, and tags for Transformers, Safetensors, qwen3_5, feature-extraction, decision-model, classification, system-one, multimodal, vision, video, custom_code and an Apache-2.0 licence, with the model size listed as 26B parameters in BF16. The card graphic reads 'Decision 3.0 / d3 27B'. A specification panel gives Parameters as 26.09B including the 0.46B vision encoder, Inputs as 'Text or JSON, plus images and videos (several per request)', Decision types as 'Choice - Yes / No - Score' and License as Apache-2.0. The sidebar shows 130 downloads last month, the model tree pinned to Qwen/Qwen3.8-27B, and a collection entry listing 6 items.

Как выбрать

Правило принятия решения короткое, и это хороший знак того, что два продукта на самом деле не конкурируют за одно и то же место.

Выбирайте Microsoft-Decision-1, если решение только текстовое, если вы уже работаете на Foundry и если главное — это вызов, а не развёртывание: не нужно покупать GPU, не нужно эксплуатировать контейнер, не нужно владеть жизненным циклом модели. Сопроводительные материалы Microsoft к тому же удобнее из двух для команды платформы: возмущения, число проверок безопасности и утверждение о поддержке опции воздержания — это то, что нужно, чтобы написать политику порогов, а ограничение в 32 768 токенов указано явно, а не оставлено пустым.

Выбирайте Decision 3.0 — реалистично d3-flash или d3-mini — если какая-либо часть решения зависит от изображения или клипа, если вам нужно запускать его там, куда не может добраться размещённый API, или если вы хотите дообучить оценщика на собственных размеченных примерах. Лицензия Apache-2.0 и манифест хешей на уровне файлов делают это реальной возможностью, а не теоретической. Взамен вы принимаете необъявленный бюджет входных данных, отсутствие опубликованной калибровки и тот факт, что семейству всего несколько дней и за ним практически нет стороннего использования.

Если вам нужно и то и другое — размещённый оценщик для обычного текстового пути и самостоятельно размещённый для мультимодальных или изолированных случаев, вызываемые через один и тот же интерфейс, — то честная позиция такова: ни один поставщик сейчас не даёт вам этого, а два формата запросов достаточно близки, чтобы их объединить, но не идентичны.

Где место OrcaRouter, а где — нет

typesafe/jev-1.13 — это модель принятия решений в нашем каталоге, доступная через POST /v1/systemone с тем же контрактом состояний и именованных вопросов, который реализуют обе модели, описанные выше: текст на входе, структурированный JSON на выходе, до примерно 64K входных токенов, без потоковой передачи, $0,042 за миллион входных токенов без платы за генерацию ответа, поскольку она её никогда не производит. Примечательно, что вопрос о бюджете токенов в стиле Android, на который ни одна из приведённых выше карточек не отвечает полностью, получает ответ здесь.

В этом сравнении мы не предлагаем ни одну из этих моделей. Чекпоинты Decision 3.0 поставляются как локальный путь инференса в репозитории Hugging Face, а не как маршрутизируемая конечная точка, а Microsoft-Decision-1 распространяется через собственную платформу Microsoft и несколько сторонних платформ — не через нас. Ничто здесь не должно восприниматься как заявление о доступности любой из них.

Настоящая ценность слоя маршрутизации в этом решении проявляется на другой половине цикла. Скорер дёшев по своей природе; модель, которая действует на основе его вывода, — нет, а объединение решающей модели с генеративной обычно означает две интеграции, два биллинговых отношения и два режима отказа. Вызов обеих через один ключ в рамках более чем 200 моделей — с автоматическим переключением при сбое провайдера и передачей прайс-листовой цены провайдера с наценкой 0%, благодаря чему изменение цены вендора отражается в тот же день, — означает, что вы можете поменять скорер, не трогая место вызова. Здесь это важно больше, чем обычно, потому что обе эти модели ещё настолько новые, что решение, принятое на этой неделе, вы должны иметь возможность отменить уже в следующем месяце.

A screenshot of the OrcaRouter models catalogue, headed 'Models - 207 models - 16 providers - one API key, one bill'. Filter tabs read All 207, Text 172, Image 10, Embeddings 5, Video 10 and TTS 10. A panel titled 'How to call any model' lists three steps - copy the model ID from any card, paste it into the model field, POST to our OpenAI-compatible endpoint - beside a code block showing POST https://api.orcarouter.ai/v1/chat/completions. Model cards below include OpenAI: GPT-6.1 Sol and Anthropic: Claude Sonnet 5.5 at $2.00 per million input tokens and $10.00 output, and TypeSafe: Jev 1.13 at 65K context with $0.042 per million input tokens and $0.042 per million output tokens. A credit panel above shows monthly plans from $50 to $1,000.

Вопрос, который решит это через шесть месяцев

Две команды дообучили один и тот же базовый чекпойнт до продукта одинаковой формы на одной и той же неделе и пришли к противоположным выводам о том, как он должен попадать к клиенту. Это не столько совпадение по времени, сколько развилка в том, как продаётся эта категория: как веса или как сервис, как нечто, чем вы владеете, или нечто, к чему вы обращаетесь.

Следите за тремя сигналами. Изменит ли перебазирование Microsoft на MAI или её собственные модели те показатели точности и задержки, которые она сейчас продаёт, — и насколько заблаговременно об этом уведомляют клиентов. Опубликует ли vLLM-SR бюджет входных данных и калибровочный показатель для Decision 3.0, закрыв пробел, из-за которого индекс vLLM-SR невозможно применять на практике. И запустит ли кто-нибудь за пределами обеих лабораторий публичный набор тестов на выпущенных весах d3, потому что сейчас единственное число, которое могло бы разрешить это сравнение, — то, которое не получил ни один из поставщиков.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube