Титульная карточка главного экрана с заголовком «Какая половина d1 вам нужна?» и подзаголовком «Liquid AI d1-omni-600M vs Liquid AI d1-3B — открытые веса, 7 октября 2026», две метки с надписями «точность» и «модальности», а также каскадная диаграмма, в которой маленькая карточка с меткой d1-omni-600M подаёт данные в более крупную карточку с меткой d1-3B, пока вторая стрелка ответвляется к чипу с надписью «достаточно уверенно — ответ здесь».
Guides & Insights

Liquid AI d1-omni-600M vs Liquid AI d1-3B: какая половина семейства d1 вам действительно нужна?

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Liquid AI d1-omni-600M и Liquid AI d1-3B были загружены на Hugging Face с интервалом менее восьми часов друг от друга 5 октября 2026 года и выпущены вместе в одном анонсе 7 октября, из-за чего обычный вопрос — какая из них новее, какая лучше — оказывается неправильным. Они — две крайности сознательного компромисса. Liquid AI d1-3B — это готовый продукт: 3,12 млрд параметров, 48,57 по Decision Index 0.2.1 в оценке производителя, таблицы бенчмарков, задержка, измеренная вплоть до Jetson Orin Nano, и место, описанное в посте о выпуске как самое высокое качество принятия решений в своём размере. Liquid AI d1-omni-600M — это эксперимент: 587 млн параметров, 15,95 по тому же индексу, аудиовход, которого нет у 3B, и карточка модели, в которой прямо сказано, что это ранний исследовательский релиз без показателей инференса, поскольку модель всё ещё активно разрабатывается. Выбор между ними — не решение о качестве. Это решение о том, нужны ли вам дополнительные модальности в нижней части семейства или дополнительная точность в верхней, и цифры подтверждают это разделение, а не размывают его.

Всё ниже взято из двух карточек моделей и поста о выпуске от 7 октября, при этом соблюдена собственная маркировка поста о выпуске: строки d1 в Decision Index были оценены Liquid AI с помощью официального инструмента оценки, а не отправлены в публичную таблицу лидеров, и ничто здесь не было независимо воспроизведено.

Два стержня, которым не суждено было сойтись

Семейство d1 не стало масштабировать один-единственный рецепт в меньшую сторону. Два чекпоинта стартуют с противоположных концов каталога моделей Liquid и встречаются посередине.

Liquid AI d1-3B построена на основе LFM2.5-VL-3B — декодерной визуально-языковой модели этого производителя, выпущенной в августе 2026 года. Её база была создана путём усреднения весов LFM2.5-2.6B с текстовым бэкбоном LFM2.5-VL-3B, после чего контрольные точки дообучались с разными случайными сидами и на разных смесях данных, а затем снова объединялись. Она оснащена визуальным энкодером SigLIP2 NaFlex на 400M, оптимизированным по форме, контекстом на 32 768 токенов, словарём на 128 000 токенов и шестнадцатью документированными языками.

Liquid AI d1-omni-600M приходит с другой стороны. Его ствол — LFM2.5-Encoder-350M, двунаправленный энкодер, сначала дообученный на задачах принятия решений, а затем поэтапно расширенный — 17-слойный энкодер FastConformer плюс адаптер для аудио, при этом аудиоэнкодер позже дообучен на замороженном текстовом бэкбоне, затем башня SigLIP2, взятая из LFM2.5-VL-450M, с адаптером и LoRA-обновлениями бэкбона для зрения. Итоговая модель была объединена из LoRA-обновлений и усреднена с предыдущим чекпоинтом. В итоге — 587 млн параметров всего: 381 млн — общий ствол и голова принятия решений, 94 млн — визуальный энкодер и 112 млн — аудиоэнкодер.

Decoder-only против двунаправленного — это то, что нужно запомнить: 3B читает состояние так, как языковая модель порождает последовательность токенов, по одному направлению за раз. 600M читает состояние сразу и принимает решение, что и ожидаешь от энкодера, который никогда не был предназначен для генерации. Оба обучены сообщать ответы из распределения модели с нулевым количеством выходных токенов, но лежащий в основе механизм — не тот же класс модели, и разрыв в точности ниже — это видимая цена меньшего, энкодерообразного дизайна.

Разброс значений Decision Index велик, а субпоказатели интереснее общего результата.

В Decision Index 0.2.1 Liquid сообщает 48,57 для Liquid AI d1-3B и 15,95 для Liquid AI d1-omni-600M против 50,02 для Winnow-12B. Это разрыв в 32 пункта между двумя чекпойнтами, выпущенными в один и тот же день одной и той же лабораторией, и чтение пяти суб-оценок объясняет, откуда он берётся.

• Знания — 23,8 у Liquid AI d1-3B против 8,3 у Liquid AI d1-omni-600M

• Язык — 56,4 против 12,9

• Поиск — 52,8 против 35,0

• Инструменты — 74.5 против 15.1

• Искусство — 36,3 против 6,8

Поиск — это единственное место, где небольшая модель удерживает позиции, теряя менее трети результата 3B, тогда как в остальных четырёх категориях она теряет 60–80 процентов. Эта закономерность согласуется с тем, чем является 600M: обученный энкодер с реальной репрезентационной способностью сопоставлять состояние с содержимым и с гораздо меньшей долей той многоуровневой способности, которую 3B наследует от декодера, предобученного на значительно большем объёме языка. Если ваша рабочая нагрузка — это решение поискового характера — отвечает ли этот отрывок на этот вопрос, какой из этих документов релевантен, — профиль 600M не так плох, как можно предположить по его общему показателю. Если ваша рабочая нагрузка — это решение о маршрутизации инструментов, 51-пунктовый разрыв в этом столбце — вот на какое число стоит смотреть.

Таблица текстовых бенчмарков даёт более мягкую картину, чем индекс, и это стоит знать, прежде чем любое из этих чисел будет использовано для аргументации. На семи публичных бенчмарках 3B лидирует со средним значением 82,9, а 600M достигает 78,4. На самом деле 600M незначительно уступает на SQuAD 2.0 (74,0 против 85,3), PubMedQA (61,3 против 66,0), BoolQ (77,7 против 86,7) и XNLI (74,7 против 85,0), но выигрывает в задаче обнаружения токсичности Civil Comments (95,8 против 93,0) и в задаче идентификации перефразировок PAWS-X (79,5 против 76,9). Согласно собственной формулировке Liquid, 600M превосходит средний показатель Decider 2B, равный 77,1, при четверти параметров. Два набора бенчмарков, два разных кажущихся вердикта, оба заявлены производителем — вот что подтверждают доказательства, и не более того.

A two-column scoreboard for Liquid AI d1-omni-600M and Liquid AI d1-3B showing the 600M at Decision Index 0.2.1 of 15.95, 587M parameters, a text benchmark mean of 78.4, text plus image or audio input, a 16,384-token context and no reported latency, against the 3B at 48.57, 3.12B parameters, a mean of 82.9, text plus image input, a 32,768-token context and 8 ms for one question on an RTX 4090, footed 'All figures vendor-reported by Liquid AI, Oct 7 2026; no independent reproduction.'

Что есть у 600M, чего нет у 3B

Причина мириться с разрывом в 32 пункта индекса заключается в том, что Liquid AI d1-omni-600M делает то, что Liquid AI d1-3B не может, и это не разница в точности.

• Аудио — Liquid AI d1-omni-600M принимает до 30 секунд речи на запрос через свой энкодер FastConformer; Liquid AI d1-3B не принимает ничего.

• Модальность — 600M принимает текст с изображениями или текст с аудио и вызывает ValueError, если они поступают вместе; 3B принимает текст и изображения

• Контекстное окно — 16 384 токена для текстовых, графических и аудиопозиций у модели 600M, при этом текст обрезается до 896 токенов при наличии изображений; 32 768 токенов для модели 3B

• Словарь — 65 536 для 600M, 128 000 для 3B

• Точность — карточка 600M рекомендует float16 на GPU и предупреждает, что bfloat16 изменил лучший ответ в некоторых строках; 3B поставляется с 15 квантованиями, включая сборку w8a8

• Языки — 600M перечисляет 16 языков, причём этот набор отличается от 16 языков у 3B, а его аудио описывается как обученное на диалогах между англоязычным говорящим и ассистентом, что является лишь узким срезом того, что содержит аудиопоток в продакшене

Примечание об обучении на аудио легко пропустить, но не стоит. Модель, обученная на англоязычных диалогах «говорящий — ассистент», видела только одну геометрию говорящего, одну структуру реплик и одно распределение акцентов. Развёртывание её на аудиозаписях колл-центров или полевых записях — это требовать поведения, которое карточка модели не заявляет, и в посте о релизе прямо сказано, что не существует аудиобенчмарка для принятия решений, с которым можно было бы его сверить — Liquid называет это «на данный момент открытой проблемой» и приглашает сообщество создать его.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the announcement that d1-3B and d1-omni-600M were released that day, d1-3B's 48.57 Decision Index v0.2.1 score described as ahead of every model under 10B, and its latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Задержка: у одного соседнего элемента есть таблицы, у другого — сноска.

Для моделей принятия решений интересующий показатель — сквозная задержка, ведь там нет декодирования, которое нужно замерять. Liquid публикует полный набор для 3B и никакого для 600M.

• Один вопрос — 8 мс на RTX 4090, 9 мс на MI325X, 16 мс на Jetson AGX Thor, 26 мс на Jetson AGX Orin 64 GB, 50 мс на Orin Nano, 30 мс на Apple M5 Pro

• Три вопроса на одно состояние — 21 мс на RTX 4090 и 20 мс на AGX Thor, примерно в 1,3 раза дороже одного вопроса, а не в 3 раза

• Состояние объёмом 3,4 тыс. токенов — 102 мс на 4090, 220 мс на Thor, 1 640 мс на Orin Nano

• Пропускная способность при пакетной обработке — 475 решений в секунду на RTX 4090, 1 106 в секунду на MI325X

• Изображение 384px — 17 мс на 4090, 18 мс на MI325X

Эти цифры описывают только Liquid AI d1-3B. Для Liquid AI d1-omni-600M в карточке модели указано, что числа инференса не сообщаются, поскольку модель является ранним исследовательским выпуском в активной разработке. Дело не в том, что маленькая модель медленнее — почти наверняка всё наоборот, поскольку пятая часть параметров не становится медленнее при той же точности — дело в том, что не существует никакой цифры, и приводить миллисекунды 3B для 600M было бы фабрикацией с правдоподобным видом. Что можно сказать, ничего не выдумывая, так это то, что при точности float16, которую рекомендует карточка, 587M параметров — это порядка 1,2 ГБ весов до активаций, что является арифметикой по опубликованному количеству параметров, а не измерением.

Каскад — это настоящий ответ для большинства рабочих нагрузок.

Поскольку оба чекпойнта были выпущены вместе и возвращают объект одного и того же типа — вероятность, метку с уверенностью или упорядоченную оценку — они компонуются так, как не компонуются две произвольные модели. 600M может выполнять первичный отбор, а 3B — выносить окончательное решение. Оценивайте входящие элементы с помощью Liquid AI d1-omni-600M и передавайте те, которые он относит ближе к середине своей шкалы, в Liquid AI d1-3B для более точного суждения. Правила эскалации — это уверенность и распределение, которые 600M уже возвращает, поэтому логике маршрутизации не нужна дополнительная модель. При рабочей нагрузке, где подавляющее большинство элементов простые, большая часть трафика вообще не доходит до 3B, и большая часть средств не тратится.

Эта схема — ещё и причина, по которой эти две модели стоит запускать за роутером. Через OrcaRouter обе оказались бы за одним API-ключом по прейскурантной цене каждого провайдера со сквозной передачей и 0% наценки, так что каскад — это правило маршрутизации, а не вторая интеграция, а эскалация, которая срывается на уровне провайдера, повторяется на резервном варианте, вместо того чтобы приводить к отказу запроса. Автоматическое переключение при сбое здесь важнее, чем для устоявшейся модели, потому что одна половина этой пары — это чекпойнт, поведение которого сам вендор описывает как находящееся в активной разработке.

Ничто из этого не является заявлением о доступности, и это различие стоит обозначить прямо: открытые чекпоинты d1 отсутствуют в нашем каталоге. Путь вендора — скачать веса и запустить их локально — поддержка llama.cpp появилась в первый же день на оборудовании Apple, AMD, Qualcomm и NVIDIA — или получить к ним доступ через собственный API вендора и сторонние платформы.

Выбирая за один проход

Если вам нужны текст и изображения и ответ должен быть правильным, берите Liquid AI d1-3B. У него есть бенчмарки, таблицы задержек, более широкий контекст, больший словарный запас и квантования, и это тот представитель пары, который Liquid позиционирует как лидера по качеству среди моделей своего размера.

Если вам нужна речь в цепочке принятия решений, возьмите Liquid AI d1-omni-600M, потому что это единственный вариант с открытыми весами в этом семействе, который вообще принимает аудио, и смиритесь с тем, что вы выбираете его на основе вайбов и демо, пока кто-нибудь не опубликует аудиобенчмарк для принятия решений или тот скрытый бенчмарк по зрению.

Если вы пока не знаете, какое из них описывает вашу рабочую нагрузку, начните с 3B и измеряйте уверенность, которую он возвращает. Субпоказатели — это ключ: задача, которая относится к столбцам Tools или Language, будет плохо обслуживаться моделью 600M, тогда как нечто, имеющее форму поиска/извлечения, — это единственное место, где маленький чекпойнт оказывается ближе, чем позволяет предположить его общий показатель. Это семейство существует, чтобы можно было обменять точность на занимаемый размер, и такой обмен безопасен только если вы знаете, какой столбец занимает ваша задача.

A capture of the Hugging Face model card for LiquidAI/d1-omni-600M showing 76 likes, the image-text-to-text, Transformers and Safetensors tags, the 'd1_omni', 'system-one', 'multimodal', 'vision', 'audio' and 'decision-model' tags, and the opening description of a 600M parameter decision model that takes a state of text or JSON with images or a voice clip and returns typed answers with zero output tokens.

Через OrcaRouter обе модели доступны по одному API-ключу, а не как отдельная интеграция, а эскалация, которая не удалась на уровне провайдера, повторяется на резервном варианте вместо сбоя запроса.