
Microsoft-Decision-1 против Liquid AI d1-3B: одно и то же окно 32K, два разных смысла
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 за 1 млн токенов
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
На этот раз спецификации совпадают. Microsoft-Decision-1, общедоступная на Microsoft Foundry с 8 октября 2026 года, принимает 32 768 токенов контекста. То же самое и Liquid AI d1-3B, загруженная на Hugging Face 5 октября 2026 года и анонсированная Liquid AI два дня спустя. Обе принимают состояние плюс набор типизированных вопросов — да/нет, выбор среди названных вариантов, позиция на упорядоченной шкале — и обе отвечают за один прямой проход распределением вероятностей вместо сгенерированного текста; Laya, Intern-Decision-4B, Kev и остальные из этой ниши расходятся между собой во мнениях о длине контекста, так что это единственная пара, где данное измерение выпадает и сравнение приходится вести на чём-то другом.
Этим чем-то другим оказывается входной канал. Модель Microsoft работает только с текстом, и это явно указано: она «не принимает и не генерирует изображения, аудио- или видеоконтент». Модель Liquid AI оснащена визуальным энкодером SigLIP2 NaFlex на 400 млн параметров и языковым бэкбоном на 2,6 млрд параметров, а всего достигает 3,12 млрд параметров, и она была создана ровно для того, что Microsoft исключила, — для оценки скриншота, отсканированной формы или кадра с камеры на соответствие заданному вопросу. Это разделение, а также разница в лицензии, не имеющая отношения к возможностям, — вот и всё сравнение.
Там, где они согласны, — а это больше, чем можно было бы ожидать.
• Окно контекста — 32,768 токенов для Microsoft-Decision-1 и 32,768 токенов для Liquid AI d1-3B.
• Форма вывода — калиброванные вероятности по предоставленным вариантам; ни один из них не генерирует текст, и счётчик использования Liquid AI сообщает об этом как output_tokens: 0.
• Типы вопросов — оба поддерживают выбор документа, упорядоченную оценку и бинарный да/нет, и оба позволяют задавать набор вариантов для каждого запроса, а не переобучать словарную голову.
• Воздержание от ответа — Microsoft документирует явные варианты воздержания от ответа, такие как «не могу сказать»; схема Decision Index от Liquid AI поддерживает то же самое через свой набор вариантов.
• Однопроходный инференс — один вызов на каждое решение с обеих сторон, и именно это делает любой из вариантов пригодным при объёмах конвейера.
То, что две модели сходятся по двум самым жёстким ограничениям в этой нише, заслуживает того, чтобы на этом остановиться. Именно 32K-окно делает модуль оценки решений пригодным для полного договора, многостраничной политики или длинной ветки поддержки; чекпойнт English Laya на 512 токенов и ограничения на количество вопросов за вызов в Intern-Decision-4B — нет. Если ваш ввод короткий, большая часть этого поля взаимозаменяема, и решение сводится к хостингу. Если ваш ввод длинный, поле сужается до этих двух.
Чувство, которое есть только у одного из них
Liquid AI d1-3B — мультимодальная модель, и дерево моделей делает её происхождение очевидным: LFM2.5-2.6B-Base, затем LFM2.5-VL-3B, затем d1-3B, дообученная для калиброванных решений за один проход. Изображения поступают через энкодер SigLIP2 NaFlex, и в карточке сообщается среднее значение 74,1 по одиннадцати публичным бенчмаркам для изображений против 73,9 у базовой визуальной модели — то есть настройка на принятие решений не стоила ей качества восприятия изображений. Там же описан обратный эксперимент: если убрать изображения, те же вопросы падают до 45,1 — это самое убедительное свидетельство того, что канал восприятия несущий, а не декоративный.
У Microsoft-Decision-1 нет эквивалента, и это пропуск, а не незавершённость. В карточке Microsoft варианты использования вне области применения перечислены как генерация текста, ответы на открытые вопросы, ведение диалога, перевод и суммирование, и отдельно указано, что модель работает только с текстом. Для конвейера, которому нужно оценить скриншот формы по рубрике или определить, содержит ли кадр с камеры событие, связанное с безопасностью, это жёсткий стоп — никакой промпт-инжиниринг не вернёт модальность, которой у модели никогда не было.
Счёт языков идёт в обратную сторону, и это второй настоящий водораздел. Microsoft-Decision-1 указывает 25 поддерживаемых языков, и компания откровенно признаёт, что охват, качество и калибровка «могут различаться в зависимости от языка», называя неанглоязычные и особенно низкоресурсные языки зоной недостаточной эффективности. Liquid AI d1-3B заявляет о 16 языках. По широте Microsoft формально впереди; в честности относительно того, что означает широта, оба поставщика говорят примерно одно и то же, и ни один из них не опубликовал калибровку по отдельным языкам.

Вкладка бенчмарка, опять
Страница Foundry модели Microsoft-Decision-1 содержит вкладку Benchmarks с разделом методологии и без каких-либо цифр: публичные и общественные бенчмарки для принятия решений, а также отложенные внутренние наборы, метрики, охватывающие точность и ошибку калибровки, варьировавшийся порядок вариантов, парные статистические тесты и утверждение, что модель «работает на уровне ведущих моделей принятия решений и опережает другие открытые модели принятия решений, оценённые по той же методологии». Проверять нечего, воспроизводить нечего.
Liquid AI d1-3B публикует 48.57 в Decision Index 0.2.1 — и уточнение значит больше, чем сама цифра, потому что Decision Index — это собственный индекс Liquid AI, а d1-3B — собственная модель Liquid AI. Это результат, оценённый поставщиком на разработанном поставщиком бенчмарке, который компания позиционирует как лучший среди моделей принятия решений размером менее 10B и опережающий модель 35B по той же шкале. Рассматривайте 48.57 как ориентировочное утверждение, а не как проверенную цифру. Рядом с ним в карточке перечислены внутренние оценки в формате принятия решений со средним значением 77.1, SQuAD 2.0 — 85.3, PAWS-X — 76.9 и DecisionBench — 71.8; все эти показатели — самоотчёты, и формулировка «менее 10B» — это настоящее уточнение, а не уловка, поскольку размер модели — 3.12B.
Итак, вопрос калибровки решается так же, как и во всей этой области: Liquid AI даёт вам число, полученное по собственной шкале, Microsoft даёт методологию и никакого числа, и ни один из них не даёт независимого измерения от третьей стороны. Единственная цифра калибровки, которая будет иметь значение для вашего развёртывания, — это та, которую вы вычислите на собственных размеченных данных.

Обслуживание, лицензии и то, что вы на самом деле покупаете
Задержка d1-3B опубликована, и именно она — причина, по которой эта модель существует. Восемь миллисекунд на одно решение на RTX 4090, девять на AMD MI325X, при пакетной пропускной способности 475 и 1 106 в секунду при 64 состояниях. На периферийном оборудовании: 30 мс на Apple M5 Pro, 16 мс на Jetson AGX Thor, 26 мс на Jetson AGX Orin 64 GB, 50 мс на Orin Nano. Microsoft-Decision-1 вообще не публикует данные о задержке, а заложенные в его конструкцию варианты — размещённый API Foundry с оплатой по мере использования или с зарезервированной подготовленной пропускной способностью, при отключённом пакетном выводе — означают, что задержку приходится измерять в собственном развёртывании. Для модели, всё предназначение которой — вызываться один раз на каждый извлечённый документ или предложенное действие, это отнюдь не маленький разрыв.
Лицензия — это как раз то, где эти две модели расходятся так, что это удивляет людей. Liquid AI d1-3B помечена как lfm1.0, а не Apache 2.0 — та же семейная лицензия, что и у остальной линейки LFM от Liquid, а она несёт условия использования, которых нет в разрешительной лицензии. Если ваша юридическая проверка читает это как «совместимо с OpenAI и без каких-либо обязательств», то это не так, и это стоит прочитать до выпуска модели, а не после. У Microsoft-Decision-1 весов нет вообще: это размещённая конечная точка в рамках портфеля Direct from Azure, с аутентификацией Azure, единым биллингом, без скачивания, а вопрос лицензии заменён сервисным соглашением. Ни одну из моделей нельзя дообучить теми путями, которые описывают вендоры, а это самое острое ограничение для модели принятия решений — скоринг, который нельзя адаптировать под собственные метки, это скоринг, чьи режимы ошибок вы не можете исправить, а можете только обойти.
Обход их — вот где OrcaRouter уместен в этой схеме, и только с одной её стороны. Мы не размещаем ни Microsoft-Decision-1, ни Liquid AI d1-3B: ни один из них не возвращает текст, ни один не входит в наш каталог, а эндпоинт для оценки вероятностей не является целью chat-completions. Что мы предоставляем — это генерирующая половина цикла: модель, которая составляет черновик ответа, который будет оценивать ваш scorer, извлекает поля, которые будет оценивать ваш scorer, или предлагает действие, которое утвердит ваш scorer. Это более 200 моделей за одним ключом, совместимым с OpenAI по прайс-листовой цене провайдера, передаваемой с наценкой 0%, поэтому изменение цены поставщика становится актуальным у нас в тот же день, а автоматическое переключение при сбое покрывает вызов генерации в цикле, где нет запаса по задержке, чтобы повторить его.

Два чистых выбора и один, который совсем не близок.
Берите Liquid AI d1-3B, если что-либо в вашем пайплайне — это картинка. Триаж скриншотов, извлечение данных из форм, маршрутизация визуального контроля качества, модератор, оценивающий кадры с камер, — Microsoft-Decision-1 невозможно заставить делать это, а d1-3B был создан именно для этого, и в подтверждение этого опубликованы результаты vision-бенчмарков. Берите его и в том случае, если вам нужен инференс на периферийных устройствах с задержкой в десятки миллисекунд на Jetson или ноутбуке, если вы хотите разместить модель на собственном железе или если лицензии, которую вы можете прочитать, достаточно для ваших юристов.
Выбирайте Microsoft-Decision-1, если на входе у вас текст, документы длинные, а узкое место — закупки (аутентификация в Azure, единый биллинг, оценка Responsible AI, поставщик, к которому можно эскалировать), или если ваш трафик охватывает больше 16 языков, перечисленных в d1-3B. Примите как данность: отсутствие цифры по задержке и таблицы бенчмарков означает, что первые две недели работы с ним — это измерения, а не интеграция.
Единственный случай, который не является пограничным, — это мультимодальная работа: там выбор был сделан тогда, когда Microsoft вписала «только текст» в карточку модели.
