
Decision 3.0 доступна на Hugging Face: шесть открытых мультимодальных моделей принятия решений, анонсированных только в X
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 за 1 млн токенов · 71 tok/s
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
Decision 3.0 существует в форме, которую можно скачать прямо сейчас, и почти никто не написал об этом. Шесть контрольных точек — d3, d3-flash, d3-mini, d3-nano, d3-lite и d3-edge — появились в vllm-sr, организации на Hugging Face 10 октября 2026 года, сначала самые новые — начиная с 09:38 UTC и заканчивая d3-edge в 23:49 UTC. Они распространяются под лицензией Apache-2.0, они построены на базовых моделях Qwen3.5 и Qwen3.8, они отвечают на вопросы с выбором, да/нет и оценкой, выдавая вероятность для каждого варианта вместо генерации токена, и пять из шести теперь читают изображения и видео. Каждая карточка модели описывает себя как «27B мультимодальная базовая модель принятия решений Decision 3.0, модели принятия решений vLLM Semantic Router», которая является открытым слоем принятия решений проекта vLLM.
Не хватает анонса. Аккаунт проекта vLLM в X поздравил команду vLLM-SR с релизом 11 октября, процитировав собственный вводный тред мейнтейнера — это и есть вся публичная история. Индекс блога проекта по-прежнему заканчивается 10 октября постом о моделях принятия решений маршрутизации, а не об этих. Страница релизов на GitHub для vllm-project/semantic-router по-прежнему ограничивается v0.4.0 от 27 сентября. Веса выпущены; заметки о запуске — нет.
Это различие важно для того, как читать всё ниже. Каждая цифра производительности в этой статье взята из собственных карточек моделей vLLM-SR, измерена их собственным тестовым стендом на их собственном оборудовании. Ничто здесь не было воспроизведено сторонней организацией, а таблица, на которой они публикуют результаты, — это та, которую они сами поддерживают. Это раннее, честное прочтение артефакта, который реален, и утверждения, которое ещё не прошло аудит.
Что на самом деле есть на Hugging Face
Шесть репозиториев просты, полны и согласованы между собой. Каждый содержит веса safetensors, шаблон чата, decision_config.json, который фиксирует ревизию базовой модели, собственный код моделирования (modeling_d3.py, d3_engine.py, d3_server.py), голову вывода в отдельном readout.safetensors, и MODEL_MANIFEST.json с SHA-256 для каждого файла. Седьмой репозиторий, страница коллекции, перечисляет все шесть.
Семья, в порядке размеров:
• d3 — 26,09 млрд параметров, включая визуальный энкодер с 0,46 млрд параметров, на базе Qwen/Qwen3.8-27B. Загружено 10 октября, 09:38 UTC.
• d3-flash — 8,39 млрд, включая визуальный энкодер на 0,46 млрд, построена на Qwen/Qwen3.5-9B.
• d3-mini — 4,54 млрд параметров, включая визуальный энкодер на 0,33 млрд, построена на основе Qwen/Qwen3.5-4B.
• d3-nano — 2,21 млрд, включая визуальный энкодер на 0,33 млрд, создана на основе Qwen/Qwen3.5-2B.
• d3-lite — 0.85B, включая 0.10B визуальный энкодер, построенная на Qwen/Qwen3.5-0.8B.
• d3-edge — 0,59 млрд, включая 0,10 млрд параметров визуального энкодера, также построена на Qwen/Qwen3.5-0.8B. Загружена последней, 23:49 UTC.
Все шесть используют один и тот же контракт запроса: состояние (текст или JSON, опционально с изображениями и видео) плюс словарь именованных вопросов, и ответ в виде типизированных распределений вероятностей. Существуют три типа вопросов — Choice, Noul (да/нет), Score — и модель отвечает на все из них за один вызов, выполняя один прямой проход на вопрос по одному и тому же входу, без цикла декодирования где-либо.

Цифры, и чьи они
vLLM-SR публикует таблицу лидеров, которую называет Jev Decision Index 0.3.1, и ставит d3 на её верхнюю строчку. Основные строки — все предоставлены поставщиками:
• d3 — Индекс 64,7, публичный набор 65,5, тесты того же навыка 62,8, задачи из новой предметной области 56,6.
• Perplexity Decider v1.1 (27B) — 62.8, 62.3, 61.1, 55.6.
• Fastino GLiDE без размышлений (28B) — 60.2, 59.1, 59.5, 52.9.
• Jev — 60,1, 58,0, 58,0, 55,0.
• Torchcast Decision 27B — 59.9, 65.1, 58.1, 50.8.
• Decision 2.0 (27B), предыдущее поколение — 55.9, 57.0, 55.7, 47.9.
В сноске на карточке d3 прямо сказано, что строка самой d3 — это внутренняя оценка, тогда как строки сравнения — это актуальные данные с борда, считанные 10 октября. Это правильное раскрытие информации, и его стоит перечитать дважды: числа конкурентов были взяты с борда, а число объекта оценки было получено командой, создавшей модель. В карточке также утверждается, что все 140 178 публичных запросов были обработаны и ни один не остался без поддержки — это заявление о покрытии, а не о точности, и необычное для публикации.

Меньшие чекпойнты заявляют, что идут в ногу. Каждая карточка приводит показатель на публичном наборе и дельту относительно аналогичного размера в Decision 2.0: d3-flash — 57,79, на 11,0 больше, чем у предыдущей 9B; d3-mini — 54,90, на 10,7 больше; d3-nano — 42,22, на 12,2 больше; d3-lite — 36,93, на 16,4 больше; d3-edge — 28,82, на 12,1 больше. Относительные приросты максимальны в нижней части диапазона — именно этого следовало бы ожидать, если мультимодальный рецепт предобучения даёт больше эффекта маленьким моделям, чем большим, а также то, что получилось бы при наиболее интенсивной настройке маленьких моделей. Снаружи невозможно определить, какой из вариантов верен.
Мультимодальная часть — вот настоящая перемена
Модели Decision 2.0 читают текст. Модели Decision 3.0 читают текст, изображения и видео, и это существенное различие между поколениями — а не изменение индекса. В каждой карточке ввод изображений указан как PNG, JPEG или WebP, передаваемых в виде путей, URL-адресов, изображений PIL или data URL в base64, причём несколько на запрос, каждое — до 1,6 мегапикселя; а видео — как MP4, WebM, MOV или MKV, либо как массивы кадров, считываемое со скоростью 2 кадра в секунду, не более 32 кадров, распределённых по всему видеоклипу, при этом каждый кадр — до 0,2 мегапикселя. Каждый вопрос в запросе видит каждое изображение и каждое видео, прикреплённые к этому запросу.
Подтверждающим доказательством для видео служит результат Perception Test по всем 19 140 вопросам валидации: d3 — 77,4, d3-flash — 73,3, d3-mini — 70,3, d3-nano — 63,5, d3-lite — 59,3, d3-edge — 46,6, при документированном базовом уровне случайного угадывания 33,3 на вопросах с тремя вариантами ответа. vLLM-SR обозначает это как внутреннюю оценку. d3 также присутствует в vision board, где его общий результат — 71,6, впереди Perplexity Decider v1.1 с 70,6 и JEV-27B-VL с 69,6, при этом строки сравнения снова взяты из данных vision board, а не получены авторами.
Показатели пропускной способности приведены для одного запроса на одном GPU и указаны именно так: d3 отвечает на текстовый запрос за медианные 55 мс, на запрос с изображением — за 273 мс, а на запрос с десятисекундным видео — за 553 мс, на одном AMD Instinct MI325X. d3-edge делает то же самое за 6,7 мс, 41,9 мс и 308,3 мс. Это медианные значения на один вопрос для модели, рассчитанной на многократные вызовы в рамках одного рабочего процесса, — именно это число имеет значение для архитектуры, под которую созданы эти модели: двадцать последовательных решений с дополнительными 100 мс каждое обходятся в две секунды, как Microsoft в этом месяце отметила то же самое в отношении своей собственной модели принятия решений.
Что не говорят репозитории
Три пробела стоит назвать, прежде чем кто-либо начнёт планировать с учётом этого.
Первый — это бюджет входных данных. decision_config.json для самой большой модели устанавливает max_length в null, и ни одна карточка не указывает потолок токенов для состояния, вопросов и описаний вариантов. В карточках Decision 1.0 были опубликованы явные бюджеты — 1 024 токена для ветви энкодера, 16 384 для ветви декодера — и эти числа являются реальным ограничением при планировании. Их отсутствие здесь бросается в глаза, и это самое полезное, что мог бы добавить последующий коммит.
Второе — калибровка. Самый важный показатель модели принятия решений — не точность, а означает ли возвращённое значение 0,9, что она права в девяти случаях из десяти. Индексы для изображений и текста ничего об этом не говорят. Ни в одной из шести карточек нет ни оценки Брайера, ни показателя ожидаемой ошибки калибровки, ни температуры. InternLM опубликовала и то, и другое для своей собственной модели принятия решений в сентябре; vLLM-SR не опубликовала их ни для одного представителя этого семейства.
Третье — независимость. Модели Decision 2.0 находятся во внешнем использовании уже две недели; модели Decision 3.0 — всего несколько часов. Число скачиваний на 11 октября — 130 для d3, 83 для d3-lite, 82 для d3-nano — это след загрузки, а не принятия. Считайте каждый показатель индекса выше гипотезой с прикреплённым репозиторием.
Где это находится в стеке, который можно вызвать уже сегодня
Практический вопрос о модели принятия решений заключается в том, встраивается ли она в уже существующий конвейер, и здесь экосистема продвинулась дальше, чем сами модели. Формат запросов System One, который используют эти модели, не является проприетарным для vLLM-SR: это тот же контракт с состоянием и именованными вопросами, с которым вызываются размещённые модели Jev, поэтому «Jev» фигурирует и как название индекса в карточке модели d3, и как строка в её таблице лидеров.
OrcaRouter закрывает эту сторону семейства. typesafe/jev-1.13 есть в нашем каталоге и доступна через POST /v1/systemone — тот же контракт, по цене $0,042 за миллион входных токенов без платы за генерацию ответа, поскольку генерации ответа нет, до примерно 64K входных токенов, текст на входе и структурированный JSON на выходе, без потоковой передачи. Это как раз та модель, которую слой принятия решений вызывает уже сегодня. Два момента, на которые мы не претендуем: d3 и остальная часть Decision 3.0 отсутствуют в нашем каталоге, а путь локального инференса Decision 3.0 — это Python-класс в репозитории Hugging Face, а не эндпоинт, который мы могли бы маршрутизировать, даже если бы захотели. А что роутер здесь действительно даёт — так это то, что находится по другую сторону цикла: генеративная модель, которая действует по решению, маршрутизируемая через один ключ по более чем 200 моделям с автоматическим переключением при сбоях провайдера, так что добавление этапа оценки перед рабочим процессом не означает ещё и появления отношений со вторым поставщиком.
Что изменило бы эту картину?
Четыре вещи, примерно в порядке того, насколько много они вам скажут. Пост в блоге проекта с указанием бюджета входных данных и предполагаемой формы развёртывания, который подтвердил бы, что это релиз, а не пуш. Оценка Бриера или показатель ECE на любом одном чекпоинте. Третья сторона, запускающая публичный набор тестов на выпущенных весах, а не читающая индекс. И среда выполнения — репозиторий semantic-router получил два коммита 11 октября, которые подключают d3 и d3-edge к своей среде выполнения моделей, включая видеовход, что говорит о том, что история обслуживания строится сейчас и станет тем, что сделает эти модели дешёвыми для пробы.
Пока не появится хотя бы первое из них, честное резюме таково: на Hugging Face есть полное, по-настоящему мультимодальное семейство моделей принятия решений с лицензией Apache-2.0 — от 0,6B до 27B, опубликованное с необычно хорошей прослеживаемостью происхождения (хеши файлов, зафиксированные базовые ревизии, указанная целевая аппаратная платформа) и с необычно малым объёмом сопутствующей документации, которая позволила бы решить, стоит ли его использовать. Скачивание ничего не стоит. А вот с доверием к индексу стоит повременить.

Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
