
Decision 3.0 против Microsoft-Decision-1: одно — это загрузка, другое — SKU
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 за 1 млн токенов · 71 tok/s
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
Уровень 9B Decision 3.0 и Microsoft-Decision-1 — на бумаге один и тот же продукт. Оба дообучают Qwen3.5-9B до скоринг-модели, которая отвечает на фиксированный набор вариантов ответа, выдавая по калиброванной вероятности для каждого, вообще не генерируя ни одного токена. Оба нацелены на одни и те же задачи — маршрутизацию запроса, оценку вывода по рубрике, допуск действия агента, сортировку очереди. Оба вышли с разницей в неделю: Microsoft-Decision-1 стал общедоступным в Microsoft Foundry 8 октября 2026 года и был анонсирован на следующий день, а d3-flash был выложен на Hugging Face в 17:23 UTC 10 октября 2026 года.
Разница не в модели. Она в том, что вам разрешено с ней делать. d3-flash — это скачиваемый и запускаемый чекпоинт Apache-2.0 с 8,39 млрд параметров, третий в семействе, которое начинается с 0,59 млрд и заканчивается на 26,09 млрд. Microsoft-Decision-1 — это хостинговый эндпоинт на Foundry, веса которого вообще не распространяются, в линейке, которую Microsoft, по её словам, позже переведёт на свои собственные модели MAI. Один из них — артефакт, другой — сервис. Почти каждый практический вопрос об этой паре вытекает из этого единственного факта, включая те, что выглядят как вопросы о бенчмарках.
Два решения о том, для чего предназначена модель принятия решений
Публикация Microsoft явно определяет область применения так, как это редко делается в карточках моделей. Поддерживаемые типы вопросов — да/нет, с несколькими вариантами ответа, оценка, классификация и оценка по рубрикам. Исключения перечислены столь же прямо: модель не предназначена для генерации текста, ответов на открытые вопросы, ведения диалога, перевода или суммаризации, а также для задач, требующих знаний, отсутствующих во входных данных. Она выполняет один проход по последовательности длиной до 32 768 токенов и выдаёт ноль выходных токенов, поскольку цикла декодирования нет. Microsoft также поддерживает возможность воздержаться от ответа, например «не могу определить», когда предоставленных доказательств недостаточно, и именно эта деталь делает применение порога к выходным данным хоть сколько-нибудь осмысленным.
d3-flash находится в той же концептуальной рамке — вопросы Choice, Noul (да/нет) и Score, один прямой проход на вопрос, вероятность на каждый вариант, без генерации — а затем расширяет входную сторону. Там, где Microsoft-Decision-1 по замыслу работает только с текстом, d3-flash принимает текст или JSON, несколько изображений на запрос размером до 1,6 мегапикселя каждое и несколько видео, считываемых со скоростью 2 кадра в секунду. Каждый вопрос в запросе видит каждое изображение и видео, прикреплённые к нему. Это меньшая модель, которая делает больше с тем входом, который ей дан.
Это первое настоящее разделение, и оно не вопрос вкуса. Если решение, которое вам нужно принять, касается скриншота, чека, графика или фрагмента записи с камеры, Microsoft-Decision-1 не может его принять. Это граница возможностей, а не пробел в качестве, и никакая работа над точностью её не закрывает.
Что каждый из них публикует и как
Здесь два релиза осуществляют действительно разные виды доказательства, и их стоит разделять, а не сопоставлять цифры.
Microsoft провела сравнение по 36 бенчмаркам, охватывающее почти 150 000 вопросов, скрытых от обучения, включая задачи маршрутизации, ранжирования, длинного контекста, многоязычные и выходящие за пределы распределения, а также рассуждения и безопасность, и заявляет, что её модель показала лучшие результаты по всем этим наборам. Задержку она сообщает в виде отношения, а не числа, — p50 примерно в 35 раз быстрее, чем GPT-6 Sol, и в 2,5 раза быстрее, чем H2O-Lightning-4B v1.1, которую называет занявшей второе место. Устойчивость она описывает как процедуру: один и тот же запрос, возмущённый восемью способами, средняя частота изменения решения 1,3% и ноль изменений, когда описания вариантов перефразируются либо варианты меняются местами или перемешиваются. Безопасность она проверяла на 5 250 запросах по 11 бенчмаркам, охватывающим вредоносный контент, джейлбрейкинг и промпт-инъекции. Она указывает стандарт калибровки, которому обязуется соответствовать, — прогноз с уверенностью 90% должен оказываться верным примерно в девяти случаях из десяти на репрезентативных примерах.
vLLM-SR опубликовал индекс. Jev Decision Index 0.3.1 ставит d3 на 64.7, а d3-flash на public-suite 57.79, заявленное преимущество в 11.0 над 9B-моделью Decision 2.0 на 46.76. Также утверждается, что все 140 178 публичных запросов были обработаны, и ни один не остался без поддержки, что является заявлением о покрытии, а не о точности. В карточке раскрывается, что собственная строка d3 — это внутренняя оценка, в то время как строки сравнения рядом с ней — Perplexity Decider v1.1, Fastino GLiDE, Jev, Torchcast Decision 27B — это данные live-борда. И на мультимодальной стороне модели семейства d3 сообщают о результатах Perception Test по всем 19 140 проверочным вопросам, при этом d3-flash имеет 73.3 против случайного уровня в 33.3 для трёх вариантов.
Итак: Microsoft публикует заявление о широте охвата с документированной методикой и показателем робастности — и ни одного значения калибровки по отдельным чекпойнтам. vLLM-SR публикует позицию в лидерборде с заявленным разрывом в происхождении данных между своей строкой и остальными, а также результат на видео — и тоже без показателя калибровки. Ни та, ни другая карточка не содержит Brier score или числа ожидаемой ошибки калибровки для описываемой модели. Для двух продуктов, вся ценность которых в том, что возвращаемое число что-то означает, это и есть общий пробел, и это самое полезное, что любой из вендоров мог бы выпустить следующим.

Дистрибуция решает больше, чем спецификация.
Именно здесь сравнение перестаёт быть сравнением моделей.
С d3-flash вы получаете веса, decision_config.json, фиксирующий базовую ревизию, манифест SHA-256 для каждого файла, пользовательский код моделирования, голову считывания и документированный набор зависимостей, включающий transformers==5.17.0 и опциональный пакет CUDA-ядер для слоёв линейного внимания. Вы можете запускать это на своём оборудовании, дообучать, квантовать, изолировать в закрытом контуре. Вы также берёте на себя операционную работу: класс Python — это не эндпоинт, и карточка не указывает бюджет токенов для состояния, вопросов и описаний кандидатов — max_length равно null в поставляемой конфигурации, так что этот потолок вам предстоит выяснить.
С Microsoft-Decision-1 вы получаете эндпоинт внутри существующей облачной учетной записи — вместе с аутентификацией, региональной доступностью и элементами управления развертыванием, которые к этому прилагаются, — и при этом не несете никакой операционной работы. Но и контроля вы тоже не получаете. Нет репозитория для скачивания, нет пути для тонкой настройки и нет возможности развернуть модель самостоятельно; жизненным циклом модели управляет Microsoft, а не вы, и уведомление о прекращении поддержки или перенос на другой базовый каркас — это изменение, которое вы вынуждены принять, а не то, которое вы планируете сами. Microsoft заявила, что перенос на собственные модели MAI предстоит, — это разумная дорожная карта для модели, весь смысл которой в быстром однопроходном скоринге, и это также означает, что конкретный чекпойнт, который вы бенчмаркили, не обязательно окажется тем, к которому вы будете обращаться через год.
Историю с задержкой тоже нужно читать внимательно. Заголовок Microsoft — это соотношение с гораздо более крупной моделью общего назначения, и для её аргументации это правильное сравнение: задача модели принятия решений — заменить дорогой генеративный вызов дешёвым скоринговым, и 35x против GPT-6 Sol при p50 — так этот аргумент выглядит, когда он срабатывает. Цифры vLLM-SR абсолютны — одиночный запрос и один GPU — и они наглядно показывают модальный налог: на одном AMD Instinct MI325X текстовый запрос к d3-flash занимает медианные 19,1 мс, тот же запрос с изображением — 149,4 мс, а с десятисекундным видео — 407,6 мс. Оба набора данных заявлены вендорами, на разном оборудовании, и ни один из них не был воспроизведён вне лаборатории, которая их создала.

Как выбрать
Правило принятия решения короткое, и это хороший знак того, что два продукта на самом деле не конкурируют за одно и то же место.
Выбирайте Microsoft-Decision-1, если решение только текстовое, если вы уже работаете на Foundry и если главное — это вызов, а не развёртывание: не нужно покупать GPU, не нужно эксплуатировать контейнер, не нужно владеть жизненным циклом модели. Сопроводительные материалы Microsoft к тому же удобнее из двух для команды платформы: возмущения, число проверок безопасности и утверждение о поддержке опции воздержания — это то, что нужно, чтобы написать политику порогов, а ограничение в 32 768 токенов указано явно, а не оставлено пустым.
Выбирайте Decision 3.0 — реалистично d3-flash или d3-mini — если какая-либо часть решения зависит от изображения или клипа, если вам нужно запускать его там, куда не может добраться размещённый API, или если вы хотите дообучить оценщика на собственных размеченных примерах. Лицензия Apache-2.0 и манифест хешей на уровне файлов делают это реальной возможностью, а не теоретической. Взамен вы принимаете необъявленный бюджет входных данных, отсутствие опубликованной калибровки и тот факт, что семейству всего несколько дней и за ним практически нет стороннего использования.
Если вам нужно и то и другое — размещённый оценщик для обычного текстового пути и самостоятельно размещённый для мультимодальных или изолированных случаев, вызываемые через один и тот же интерфейс, — то честная позиция такова: ни один поставщик сейчас не даёт вам этого, а два формата запросов достаточно близки, чтобы их объединить, но не идентичны.
Где место OrcaRouter, а где — нет
typesafe/jev-1.13 — это модель принятия решений в нашем каталоге, доступная через POST /v1/systemone с тем же контрактом состояний и именованных вопросов, который реализуют обе модели, описанные выше: текст на входе, структурированный JSON на выходе, до примерно 64K входных токенов, без потоковой передачи, $0,042 за миллион входных токенов без платы за генерацию ответа, поскольку она её никогда не производит. Примечательно, что вопрос о бюджете токенов в стиле Android, на который ни одна из приведённых выше карточек не отвечает полностью, получает ответ здесь.
В этом сравнении мы не предлагаем ни одну из этих моделей. Чекпоинты Decision 3.0 поставляются как локальный путь инференса в репозитории Hugging Face, а не как маршрутизируемая конечная точка, а Microsoft-Decision-1 распространяется через собственную платформу Microsoft и несколько сторонних платформ — не через нас. Ничто здесь не должно восприниматься как заявление о доступности любой из них.
Настоящая ценность слоя маршрутизации в этом решении проявляется на другой половине цикла. Скорер дёшев по своей природе; модель, которая действует на основе его вывода, — нет, а объединение решающей модели с генеративной обычно означает две интеграции, два биллинговых отношения и два режима отказа. Вызов обеих через один ключ в рамках более чем 200 моделей — с автоматическим переключением при сбое провайдера и передачей прайс-листовой цены провайдера с наценкой 0%, благодаря чему изменение цены вендора отражается в тот же день, — означает, что вы можете поменять скорер, не трогая место вызова. Здесь это важно больше, чем обычно, потому что обе эти модели ещё настолько новые, что решение, принятое на этой неделе, вы должны иметь возможность отменить уже в следующем месяце.

Вопрос, который решит это через шесть месяцев
Две команды дообучили один и тот же базовый чекпойнт до продукта одинаковой формы на одной и той же неделе и пришли к противоположным выводам о том, как он должен попадать к клиенту. Это не столько совпадение по времени, сколько развилка в том, как продаётся эта категория: как веса или как сервис, как нечто, чем вы владеете, или нечто, к чему вы обращаетесь.
Следите за тремя сигналами. Изменит ли перебазирование Microsoft на MAI или её собственные модели те показатели точности и задержки, которые она сейчас продаёт, — и насколько заблаговременно об этом уведомляют клиентов. Опубликует ли vLLM-SR бюджет входных данных и калибровочный показатель для Decision 3.0, закрыв пробел, из-за которого индекс vLLM-SR невозможно применять на практике. И запустит ли кто-нибудь за пределами обеих лабораторий публичный набор тестов на выпущенных весах d3, потому что сейчас единственное число, которое могло бы разрешить это сравнение, — то, которое не получил ни один из поставщиков.
