Сгенерированная титульная карточка для Microsoft-Decision-1 vs Liquid AI d1-3B с подзаголовком «единственные две модели принятия решений, которые согласны насчёт контекстного окна», с чипами, показывающими 32 768 токенов у обеих, только текст против текста, изображений и аудио, 25 языков против 16, хостируемый API против весов lfm1.0, и нижним колонтитулом, отмечающим, что показатели обоих поставщиков заявлены самостоятельно и не проверены.
Guides & Insights

Microsoft-Decision-1 против Liquid AI d1-3B: одно и то же окно 32K, два разных смысла

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

На этот раз спецификации совпадают. Microsoft-Decision-1, общедоступная на Microsoft Foundry с 8 октября 2026 года, принимает 32 768 токенов контекста. То же самое и Liquid AI d1-3B, загруженная на Hugging Face 5 октября 2026 года и анонсированная Liquid AI два дня спустя. Обе принимают состояние плюс набор типизированных вопросов — да/нет, выбор среди названных вариантов, позиция на упорядоченной шкале — и обе отвечают за один прямой проход распределением вероятностей вместо сгенерированного текста; Laya, Intern-Decision-4B, Kev и остальные из этой ниши расходятся между собой во мнениях о длине контекста, так что это единственная пара, где данное измерение выпадает и сравнение приходится вести на чём-то другом.

Этим чем-то другим оказывается входной канал. Модель Microsoft работает только с текстом, и это явно указано: она «не принимает и не генерирует изображения, аудио- или видеоконтент». Модель Liquid AI оснащена визуальным энкодером SigLIP2 NaFlex на 400 млн параметров и языковым бэкбоном на 2,6 млрд параметров, а всего достигает 3,12 млрд параметров, и она была создана ровно для того, что Microsoft исключила, — для оценки скриншота, отсканированной формы или кадра с камеры на соответствие заданному вопросу. Это разделение, а также разница в лицензии, не имеющая отношения к возможностям, — вот и всё сравнение.

Там, где они согласны, — а это больше, чем можно было бы ожидать.

• Окно контекста — 32,768 токенов для Microsoft-Decision-1 и 32,768 токенов для Liquid AI d1-3B.

• Форма вывода — калиброванные вероятности по предоставленным вариантам; ни один из них не генерирует текст, и счётчик использования Liquid AI сообщает об этом как output_tokens: 0.

• Типы вопросов — оба поддерживают выбор документа, упорядоченную оценку и бинарный да/нет, и оба позволяют задавать набор вариантов для каждого запроса, а не переобучать словарную голову.

• Воздержание от ответа — Microsoft документирует явные варианты воздержания от ответа, такие как «не могу сказать»; схема Decision Index от Liquid AI поддерживает то же самое через свой набор вариантов.

• Однопроходный инференс — один вызов на каждое решение с обеих сторон, и именно это делает любой из вариантов пригодным при объёмах конвейера.

То, что две модели сходятся по двум самым жёстким ограничениям в этой нише, заслуживает того, чтобы на этом остановиться. Именно 32K-окно делает модуль оценки решений пригодным для полного договора, многостраничной политики или длинной ветки поддержки; чекпойнт English Laya на 512 токенов и ограничения на количество вопросов за вызов в Intern-Decision-4B — нет. Если ваш ввод короткий, большая часть этого поля взаимозаменяема, и решение сводится к хостингу. Если ваш ввод длинный, поле сужается до этих двух.

Чувство, которое есть только у одного из них

Liquid AI d1-3B — мультимодальная модель, и дерево моделей делает её происхождение очевидным: LFM2.5-2.6B-Base, затем LFM2.5-VL-3B, затем d1-3B, дообученная для калиброванных решений за один проход. Изображения поступают через энкодер SigLIP2 NaFlex, и в карточке сообщается среднее значение 74,1 по одиннадцати публичным бенчмаркам для изображений против 73,9 у базовой визуальной модели — то есть настройка на принятие решений не стоила ей качества восприятия изображений. Там же описан обратный эксперимент: если убрать изображения, те же вопросы падают до 45,1 — это самое убедительное свидетельство того, что канал восприятия несущий, а не декоративный.

У Microsoft-Decision-1 нет эквивалента, и это пропуск, а не незавершённость. В карточке Microsoft варианты использования вне области применения перечислены как генерация текста, ответы на открытые вопросы, ведение диалога, перевод и суммирование, и отдельно указано, что модель работает только с текстом. Для конвейера, которому нужно оценить скриншот формы по рубрике или определить, содержит ли кадр с камеры событие, связанное с безопасностью, это жёсткий стоп — никакой промпт-инжиниринг не вернёт модальность, которой у модели никогда не было.

Счёт языков идёт в обратную сторону, и это второй настоящий водораздел. Microsoft-Decision-1 указывает 25 поддерживаемых языков, и компания откровенно признаёт, что охват, качество и калибровка «могут различаться в зависимости от языка», называя неанглоязычные и особенно низкоресурсные языки зоной недостаточной эффективности. Liquid AI d1-3B заявляет о 16 языках. По широте Microsoft формально впереди; в честности относительно того, что означает широта, оба поставщика говорят примерно одно и то же, и ни один из них не опубликовал калибровку по отдельным языкам.

A generated two-column scoreboard for Microsoft-Decision-1 and Liquid AI d1-3B across six shared dimensions: context window 32,768 tokens for both; modality text-only versus text, images and audio through a 400M SigLIP2 NaFlex encoder on a 3.12B model; languages 25 versus 16; published scores none versus a vendor-scored value of 48.57 on Liquid AI's own Decision Index; weights not distributed versus lfm1.0 weights on Hugging Face; and latency not published versus 8 ms per decision on an RTX 4090 and 30 ms on an Apple M5 Pro. A footer notes both vendors' figures are self-reported and unreproduced.

Вкладка бенчмарка, опять

Страница Foundry модели Microsoft-Decision-1 содержит вкладку Benchmarks с разделом методологии и без каких-либо цифр: публичные и общественные бенчмарки для принятия решений, а также отложенные внутренние наборы, метрики, охватывающие точность и ошибку калибровки, варьировавшийся порядок вариантов, парные статистические тесты и утверждение, что модель «работает на уровне ведущих моделей принятия решений и опережает другие открытые модели принятия решений, оценённые по той же методологии». Проверять нечего, воспроизводить нечего.

Liquid AI d1-3B публикует 48.57 в Decision Index 0.2.1 — и уточнение значит больше, чем сама цифра, потому что Decision Index — это собственный индекс Liquid AI, а d1-3B — собственная модель Liquid AI. Это результат, оценённый поставщиком на разработанном поставщиком бенчмарке, который компания позиционирует как лучший среди моделей принятия решений размером менее 10B и опережающий модель 35B по той же шкале. Рассматривайте 48.57 как ориентировочное утверждение, а не как проверенную цифру. Рядом с ним в карточке перечислены внутренние оценки в формате принятия решений со средним значением 77.1, SQuAD 2.0 — 85.3, PAWS-X — 76.9 и DecisionBench — 71.8; все эти показатели — самоотчёты, и формулировка «менее 10B» — это настоящее уточнение, а не уловка, поскольку размер модели — 3.12B.

Итак, вопрос калибровки решается так же, как и во всей этой области: Liquid AI даёт вам число, полученное по собственной шкале, Microsoft даёт методологию и никакого числа, и ни один из них не даёт независимого измерения от третьей стороны. Единственная цифра калибровки, которая будет иметь значение для вашего развёртывания, — это та, которую вы вычислите на собственных размеченных данных.

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text describes a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, with quick facts listing publisher Microsoft, lifecycle Generally available (GA), context window 32768 and a Pricing field that links out rather than printing a rate.

Обслуживание, лицензии и то, что вы на самом деле покупаете

Задержка d1-3B опубликована, и именно она — причина, по которой эта модель существует. Восемь миллисекунд на одно решение на RTX 4090, девять на AMD MI325X, при пакетной пропускной способности 475 и 1 106 в секунду при 64 состояниях. На периферийном оборудовании: 30 мс на Apple M5 Pro, 16 мс на Jetson AGX Thor, 26 мс на Jetson AGX Orin 64 GB, 50 мс на Orin Nano. Microsoft-Decision-1 вообще не публикует данные о задержке, а заложенные в его конструкцию варианты — размещённый API Foundry с оплатой по мере использования или с зарезервированной подготовленной пропускной способностью, при отключённом пакетном выводе — означают, что задержку приходится измерять в собственном развёртывании. Для модели, всё предназначение которой — вызываться один раз на каждый извлечённый документ или предложенное действие, это отнюдь не маленький разрыв.

Лицензия — это как раз то, где эти две модели расходятся так, что это удивляет людей. Liquid AI d1-3B помечена как lfm1.0, а не Apache 2.0 — та же семейная лицензия, что и у остальной линейки LFM от Liquid, а она несёт условия использования, которых нет в разрешительной лицензии. Если ваша юридическая проверка читает это как «совместимо с OpenAI и без каких-либо обязательств», то это не так, и это стоит прочитать до выпуска модели, а не после. У Microsoft-Decision-1 весов нет вообще: это размещённая конечная точка в рамках портфеля Direct from Azure, с аутентификацией Azure, единым биллингом, без скачивания, а вопрос лицензии заменён сервисным соглашением. Ни одну из моделей нельзя дообучить теми путями, которые описывают вендоры, а это самое острое ограничение для модели принятия решений — скоринг, который нельзя адаптировать под собственные метки, это скоринг, чьи режимы ошибок вы не можете исправить, а можете только обойти.

Обход их — вот где OrcaRouter уместен в этой схеме, и только с одной её стороны. Мы не размещаем ни Microsoft-Decision-1, ни Liquid AI d1-3B: ни один из них не возвращает текст, ни один не входит в наш каталог, а эндпоинт для оценки вероятностей не является целью chat-completions. Что мы предоставляем — это генерирующая половина цикла: модель, которая составляет черновик ответа, который будет оценивать ваш scorer, извлекает поля, которые будет оценивать ваш scorer, или предлагает действие, которое утвердит ваш scorer. Это более 200 моделей за одним ключом, совместимым с OpenAI по прайс-листовой цене провайдера, передаваемой с наценкой 0%, поэтому изменение цены поставщика становится актуальным у нас в тот же день, а автоматическое переключение при сбое покрывает вызов генерации в цикле, где нет запаса по задержке, чтобы повторить его.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

Два чистых выбора и один, который совсем не близок.

Берите Liquid AI d1-3B, если что-либо в вашем пайплайне — это картинка. Триаж скриншотов, извлечение данных из форм, маршрутизация визуального контроля качества, модератор, оценивающий кадры с камер, — Microsoft-Decision-1 невозможно заставить делать это, а d1-3B был создан именно для этого, и в подтверждение этого опубликованы результаты vision-бенчмарков. Берите его и в том случае, если вам нужен инференс на периферийных устройствах с задержкой в десятки миллисекунд на Jetson или ноутбуке, если вы хотите разместить модель на собственном железе или если лицензии, которую вы можете прочитать, достаточно для ваших юристов.

Выбирайте Microsoft-Decision-1, если на входе у вас текст, документы длинные, а узкое место — закупки (аутентификация в Azure, единый биллинг, оценка Responsible AI, поставщик, к которому можно эскалировать), или если ваш трафик охватывает больше 16 языков, перечисленных в d1-3B. Примите как данность: отсутствие цифры по задержке и таблицы бенчмарков означает, что первые две недели работы с ним — это измерения, а не интеграция.

Единственный случай, который не является пограничным, — это мультимодальная работа: там выбор был сделан тогда, когда Microsoft вписала «только текст» в карточку модели.