Сгенерированная титульная карточка для Microsoft-Decision-1 vs Liquid AI d1-omni-600M с подзаголовком «самая широкая сенсорная поверхность в категории против самого узкого списка входных данных», с плашками, на которых указано: 587 млн параметров со зрением и аудио; Foundry API только для текста; 30 секунд речи против 32 768 токенов текста; двунаправленный энкодер против декодера, прошедшего постобучение; и отсутствие опубликованной калибровки ни с одной стороны.
Engineering & Research

Microsoft-Decision-1 против Liquid AI d1-omni-600M: скорер, который слушает, против скорера, который только читает

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Вы маршрутизируете страховые требования за стойкой обработки страховых случаев, и файл приходит в виде трёх вещей: PDF-файла, фотографии вмятой двери и девяностасекундного телефонного звонка. Liquid AI d1-omni-600M может прочитать документ, посмотреть на фото и прослушать звонок, а затем ответить на набор вопросов, которые вы составили заранее — покрывается ли это, какая категория, насколько серьёзна ситуация, по шкале от двух до десяти — за один проход, без генерации текста и без необходимости что-либо парсить. Microsoft-Decision-1 может прочитать документ. Он стал общедоступным в Microsoft Foundry 8 октября 2026 г. как размещённый скорер, работающий только с текстом, дообученный на Qwen3.5-9B с окном в 32 768 токенов, и на этом его входные возможности заканчиваются: ни изображений, ни аудио, ни видео. Оба возвращают калиброванные вероятности по предоставленным вами вариантам, оба выдают ноль выходных токенов, и ни один из них не опубликовал показатель калибровки.

Эта последняя общая фраза — самое неудобное место в этом сравнении. Это две модели принятия решений — с самым широким и самым узким сенсором из выпущенных в этом месяце, — и при всей архитектурной пропасти между ними они оказались ровно в одинаковой доказательной позиции: реальные веса или реальная конечная точка, документированные контракты и ни одного числа, на которое кто-либо за пределами вендора мог бы указать, когда спрашивают, заслуживают ли эти вероятности доверия.

Два происхождения, а не два размера

Цифра 587M подталкивает воспринимать Liquid AI d1-omni-600M как уменьшенного родственника моделей, о которых этот блог уже рассказывал. Но это не так. Модель обучена на основе LFM2.5-Encoder-350M, двунаправленного энкодера, с общим стволом и головой принятия решений на 381M, визуальным энкодером на 94M, взятым из линейки LFM2.5-VL-450M, и 17-слойным FastConformer для аудио. Microsoft-Decision-1 — это совершенно иная линия: декодер Qwen3.5-9B, дообученный Microsoft, размещённый на Foundry, веса не распространяются, а возможность тонкой настройки не предлагается.

Двунаправленный энкодер в сравнении с декодером — это архитектурный факт, который определяет, как ведёт себя каждый из них, и именно поэтому количество параметров — это отвлекающий фактор. Двунаправленный энкодер считывает состояние целиком за один раз, и это правильная форма для вынесения суждения по фиксированному входу; декодер, прошедший постобучение, отказывается от пути генерации, но сохраняет токенизатор, окно и корпоративную упаковку, которые поставляются с развёртыванием в Foundry. Ни один из них не является масштабированной версией другого, и их нельзя подменять друг другом, как бы ни читалась таблица бенчмарков.

Что на самом деле даёт вам список входных данных

Именно здесь d1-omni-600M сильнее всего отличается от всего остального в этой категории, и именно здесь к одному утверждению стоит присмотреться внимательнее.

• Речь — Liquid AI d1-omni-600M принимает текст плюс до 30 секунд речи и выдаёт по ним решение, чего ни один текстовый оценщик не может сделать ни при какой точности. Нетекстовые модальности Microsoft-Decision-1 не существуют.

• Взаимное исключение — d1-omni-600M вызывает ValueError, если изображения и аудио поступают в одном запросе. Самая широкая сенсорная поверхность в категории по-прежнему ограничена одной нетекстовой модальностью за раз, а это реальное ограничение для того отдела обработки заявок.

• Trimming — в её карточке указано 16 384 комбинированных позиций текста, изображений и аудио, и добавлено, что при наличии изображений текст состояния и вопроса обрезается до 896 токенов, чтобы соответствовать обучению. Любой документ, к которому вы прикрепляете фото, конкурирует с этой обрезкой. 32 768 токенов Microsoft-Decision-1 — все текстовые, и они не обрезаются.

• Форматы — у d1-omni-600M три типа вопросов: noul для бинарного решения с возвратом P(yes) от 0 до 1, choice для одной метки из заданного вами набора, с указанием уверенности и вероятности по каждому варианту, и score для позиции на упорядоченной шкале от двух до десяти уровней с её распределением. Несколько вопросов привязаны к одному состоянию и считываются за один проход, а счётчик использования сообщает output_tokens: 0. Microsoft документирует формы «да/нет», с множественным выбором, рейтинговые, классификационные и рубрики, а также явно поддерживаемый вариант отказа от ответа, например «cannot tell», когда доказательств недостаточно, — единственная деталь дизайна на странице Microsoft, у которой здесь нет прямого аналога.

• Среда выполнения — d1-omni-600M поставляется с собственным кодом, требует trust_remote_code=True, а в его карточке рекомендуется float16 на GPU с предупреждением, что bfloat16 изменил лучший ответ в некоторых строках. Это чувствительность на этапе обслуживания, задокументированная вендором, а не дефект. Microsoft-Decision-1 — это управляемая конечная точка, где конфигурация развёртывания является единственной переменной среды выполнения, и стоит отметить, что пакетный вывод отключён: нет офлайн-канала, через который можно было бы амортизировать массовый прогон оценки.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Liquid AI d1-omni-600M. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; base post-trained Qwen3.5-9B decoder; inputs text only; context 32,768 tokens of text, untrimmed; weights not distributed; calibration not published. Right column Liquid AI d1-omni-600M rows read: availability uploaded October 7, 2026; base LFM2.5-Encoder-350M bidirectional encoder with 587M total; inputs text, images, or 30 seconds of speech, one non-text modality at a time; context 16,384 positions with text trimmed to 896 tokens when images are present; weights open under lfm1.0; calibration not published. A footer line reads that neither vendor has published an accuracy or calibration benchmark for these models.

Пробел в доказательствах — в обоих направлениях

Liquid AI опубликовала открытое семейство d1, включая d1-omni-600M, 7 октября 2026 года вместе с постом о выпуске и комплектом документации. Не опубликовано число, которое сделало бы заявление о мультимодальности конкретным. Нет бенчмарка точности, специфичного для её собственной главной заявленной возможности — качества решений по зрению и аудио, которое оправдывает энкодеры на 94M и 112M, — а визуальный сплит не включён в опубликованные материалы оценки. Показатель задержки тоже не публикуется, поэтому пропускную способность модели вы выясняете на собственном оборудовании.

Позиция Microsoft структурно идентична и продвинулась на шаг дальше. На её вкладке Benchmarks перечислены метрики — точность, ошибка калибровки, полнота по безопасности, частота ложноположительных срабатываний, согласованность справедливости — и указано, что оценка проводилась на публичных и общественных бенчмарках для принятия решений, а также на отложенных внутренних тестовых наборах, не использовавшихся при обучении, что порядок вариантов варьировался, что применялись парные статистические тесты, и утверждается, что модель «показывает результаты на уровне ведущих моделей для принятия решений и опережает другие открытые модели для принятия решений, оценённые по той же методологии». При этом она не публикует ни одного из результатов. В списке поддерживаемых указано двадцать пять языков, включая японский, корейский, арабский, вьетнамский, тайский, турецкий, хинди, бенгальский, суахили, иврит, персидский и украинский, с откровенным предупреждением, что охват, качество и калибровка «могут различаться в зависимости от языка» и что неанглийские языки, особенно низкоресурсные, являются слабым местом. Цены также нет на странице модели; она ссылается на страницу Microsoft с ценами.

Итак, сравнение этих двух — это не сопоставление доказательств с доказательствами. Это выбор между двумя видами отсутствующего числа. Liquid AI выпустила сенсорную поверхность и публично не измерила точность этой поверхности. Microsoft выпустила путь закупки — аутентификацию Azure, управление, оценку Responsible AI, документированную методологию — и оставила калибровку вероятностного продукта неквантифицированной.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as released that day, d1-3B's 48.57 Decision Index v0.2.1 score, and its 8 ms, 16 ms and 26 ms latencies on an RTX 4090, a Jetson AGX Thor and a Jetson AGX Orin.

Вопрос калибровки, на который не отвечает ни один из них

Для модели принятия решений вероятность — это конечный продукт. Всё, что дальше, — это порог: 0,7 означает эскалацию, 0,95 — автоматическое принятие, а цена неверного проведения этой границы выплачивается плохими автоматизированными решениями, а не токенами. В этой категории есть как минимум одно семейство, которое публикует эти цифры, — чекпоинты Intern-Decision от InternLM печатают показатели Brier и ожидаемой ошибки калибровки на своих карточках моделей, — а ни та, ни другая модель из этой статьи этого не делает. Эта асимметрия — практическая причина сохранять широкое поле, а не полагаться только на архитектуру.

Хорошая новость в том, что этот тест дёшев и не требует сотрудничества со стороны вендора. Соберите пару сотен размеченных случаев, похожих на ваш реальный трафик, напишите схему вопросов, которую ваше приложение действительно отправляло бы, прогоните обе модели по ним и вычислите ожидаемую ошибку калибровки на выходе. Тогда вы узнаете две вещи, о которых сейчас не знает никто за пределами двух вендоров: насколько хорошо вероятности Microsoft-Decision-1 согласуются с его точностью на вашем распределении и стоят ли аудио- и графические пути d1-omni-600M тех энкодеров, которые они содержат. Собственные документированные рекомендации Microsoft указывают в том же направлении — валидируйте на репрезентативных данных, устанавливайте пороги исходя из стоимости ваших ошибок, всегда включайте опцию воздержания, рандомизируйте порядок вариантов, оставляйте человека в контуре для принятия решений с серьёзными последствиями.

Где место каждому, и где — OrcaRouter

Microsoft-Decision-1 подходит везде, где решающий материал — это текст, а препятствие — закупки: длинный документ, извлечённый фрагмент, предлагаемый вызов инструмента, сгенерированный ответ, оцениваемый по рубрике, с аутентификацией Azure, единой системой выставления счетов и оценкой поставщика, необходимыми до того, как что-либо попадёт в производственную среду. Это более узкий инструмент, и его легче согласовать.

Liquid AI d1-omni-600M — там, где решающий материал не текст: фотография, прикреплённая к форме, короткая запись звонка, скриншот, — и там, где вам нужны веса lfm1.0, которые можно запускать и дообучать внутри контролируемых вами границ. Это более широкий инструмент, и его сложнее валидировать, потому что утверждение о мультимодальности — именно та часть, за которой не стоит ни один опубликованный бенчмарк.

A capture of Liquid AI's documentation site showing the left navigation (Liquid Foundation Models with Text, Vision, Audio, Decision Models and Liquid Nanos entries, plus Fine-tuning, Edge Inference and llama.cpp), the 'New: Open d1' banner, and the opening description of Liquid Foundation Models as a class of multimodal architectures built for fast inference and on-device deployment.

Ни того, ни другого нет в нашем каталоге, и ничто здесь не является заявлением о доступности ни для одного из них. Модель, возвращающая вероятности вместо текста, — это не то, куда вы направляете запросы на чат-комплишены, и самоустранение от места арбитра — это и есть весь замысел инструмента. OrcaRouter несёт генеративную сторону того же цикла: более 200 моделей за одним ключом, совместимым с OpenAI, которые пишут рубрику, по которой оценивает ваш скорер, транскрибируют или суммируют материал, прежде чем он станет состоянием, и выдают вызов инструмента, который ваш скорер одобряет перед его выполнением. Прайс-лист провайдера передаётся как есть, с наценкой 0%, так что снижение цены вендором на генеративной стороне действует у нас в тот же день. Автоматическое переключение при сбое поддерживает эту сторону работоспособной, когда отдельный провайдер деградирует, — а пайплайн, оценивающий каждый извлечённый документ, замечает это мгновенно, — и если вы хотите, чтобы оценивались несколько авторов, а не один, DSL маршрутизации объединяет их в один вызов, а слияние моделей сообщает об их согласии как о поле, которое ваш скорер может прочитать, как любое другое.

Итог

Microsoft-Decision-1 стала общедоступной в Microsoft Foundry 8 октября 2026 года: только текст, 32 768 токенов, создана на дообученной Qwen3.5-9B, размещена без весов, на странице модели нет цены, нет показателя задержки, а раздел с бенчмарками описывает её методику, не приводя результат. Liquid AI d1-omni-600M была загружена 7 октября 2026 года как модель принятия решений на 587M с двунаправленным энкодером, которая читает текст, изображения или 30 секунд речи — по одной нетекстовой модальности за раз, при этом текст урезается до 896 токенов, когда присутствуют изображения — по лицензии lfm1.0, без бенчмарка точности для её главной возможности, без разбивки по зрению и без опубликованной задержки. Выбирайте по модальности и контролю, а не по оценкам, потому что оценок не существует: если ваш материал — это фотография или телефонный звонок, ответить сможет только одна из них, а если это документ на сорок страниц с приложенной проверкой закупки, развернуть можно только другую.

То, что несёт OrcaRouter, — это генеративная сторона того же цикла: более 200 моделей за одним OpenAI-совместимым ключом, которые пишут рубрику, по которой оценивает ваш модуль оценки, транскрибируют или резюмируют материал до того, как он станет состоянием, и выдают вызов инструмента, который ваш модуль оценки одобряет перед его запуском.