
Liquid AI d1-3B и d1-omni-600M: открытые веса для моделей, которые не пишут ни слова
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Liquid AI d1-3B и Liquid AI d1-omni-600M появились на Hugging Face 7 октября 2026 года, и у этих двух чекпоинтов есть свойство, из-за которого любая сравнительная таблица, которую вы читали в этом году, имеет неправильную форму. Ни одна из моделей не генерирует текст. Вы передаёте Liquid AI d1-3B состояние — обращение в службу поддержки, JSON-полезную нагрузку, фотографию или всё это сразу — и набор именованных вопросов, а она возвращает ответы, взятые прямо из распределения модели по вашим вариантам. Да/нет в виде вероятности. Выбор среди меток с уверенностью и полным вектором вероятностей. Позиция на упорядоченной шкале. Здесь нет шага сэмплирования, нет JSON для разбора, нет неконтролируемой генерации, и собственный счётчик использования вендора сообщает об этом прямо: output_tokens: 0. Модель на 3B — главная новость: она набирает 48,57 в Decision Index 0.2.1 по оценке вендора, опережая всё, что меньше 10B, и опережая решающую модель, которая в двенадцать раз больше неё. Собрат на 600M — тот, за которым стоит следить: он читает изображения и до тридцати секунд речи через одни и те же веса ствола, и он помечен как ранний исследовательский релиз.
Что такое модель принятия решений, в одном абзаце
Эта категория формировалась в течение года под такими названиями, как модели system-one и классификаторы, которые не являются классификаторами, и пара d1 — самое чёткое её изложение на данный момент. Генеративную модель спрашивают, и она пишет ответ; этот ответ нужно разобрать, разбор может не удаться, и каждый токен, который она пишет, стоит вам денег и времени. Модель принятия решений получает вопрос и сообщает то, что уже считает истинным. Вопросы Liquid бывают трёх типов. noul — это вопрос с ответом «да/нет», на который отвечают P(да) в диапазоне от 0 до 1. выбор выбирает одну метку из именованного набора и возвращает метку, уверенность и вероятность каждого варианта. оценка размещает состояние на упорядоченной шкале от двух до десяти уровней и возвращает ожидаемый уровень с его распределением и легендой. Одно состояние может содержать несколько вопросов одновременно, и состояние и его изображения считываются один раз для всех них.
Это последнее свойство — и есть весь бизнес-кейс. Три вопроса по одному тикету занимают в 1,3 раза больше времени, чем один вопрос, а не в 3 раза, потому что модель выполняет один прямой проход по входным данным и извлекает из него несколько ответов. Писать нечего, поэтому нечего написать плохо.
3B и 600M построены с противоположных направлений
Здесь релиз становится технически интересным, и именно эту часть освещение запуска в основном пропустило. Две модели не имеют общей родословной.
Liquid AI d1-3B происходит от LFM2.5-VL-3B — декодерной визуально-языковой модели этого производителя. В ней 3,12 млрд параметров, оптимизированный под форму 400-миллионный визуальный энкодер SigLIP2 NaFlex, контекстное окно на 32 768 токенов, словарь на 128 000 токенов и шестнадцать задокументированных языков. Чтобы её создать, Liquid усреднила веса LFM2.5-2.6B и текстового остова LFM2.5-VL-3B, дообучила контрольные точки из нескольких случайных инициализаций и смесей данных, а затем снова объединила результаты. Собственное резюме производителя о том, что действительно имело значение, освежающе негламурно: обучение на длинных входных данных, перемешивание порядка вариантов ответа и поиск «коротких путей» в обучающих данных дали для итогового показателя больше, чем любые продвинутые методики.
Liquid AI d1-omni-600M происходит от LFM2.5-Encoder-350M — двунаправленного энкодера, совершенно иного вида сети. В общей сложности в нём 587 млн параметров, которые делятся на общий ствол и голову принятия решений (381 млн), визуальный энкодер на 94 млн, заимствованный из LFM2.5-VL-450M, и аудиоэнкодер на 112 млн, построенный на 17-слойном FastConformer. Каждая модальность проходит через одни и те же веса ствола. Его контекст — 16 384 токена, охватывающие вместе позиции текста, изображений и аудио, а при наличии изображений текст состояния и вопроса сокращается до 896 токенов, потому что именно на этом он обучался. Для аудио есть одно предупреждение, которое карточка приводит без обиняков: эта возможность обучалась на запросах между англоговорящим пользователем и ассистентом, а клипы обрезаются на тридцати секундах.
Итак, это семейство — не одна модель в двух размерах. Это декодер и энкодер, дообученные выполнять одну и ту же задачу с помощью двух совершенно разных механизмов, один из которых видит, а другой слышит.

Цифры, и чьи они
Все цифры в этом разделе принадлежат самой Liquid. Строки Decision Index для моделей d1 были оценены производителем с использованием официального средства оценки — они не отправлялись в таблицу лидеров — тогда как каждая конкурирующая строка взята из публичной таблицы лидеров версии v0.2.1. Ни одна независимая лаборатория пока не воспроизвела ни одного из этих результатов, а моделям на момент написания этого текста два дня.
• Decision Index 0.2.1 — Liquid AI d1-3B набирает 48,57 балла, при этом субпоказатели: Знания — 23,8, Язык — 56,4, Поиск — 52,8, Инструменты — 74,5 и Искусство — 36,3. Liquid AI d1-omni-600M набирает 15,95, при этом Инструменты — 15,1.
• Где находится 48,57 — первое место среди всего, что меньше 10B, в таблице, опубликованной производителем, и впереди Decider 35B-A3B с 47,11. В общем зачёте это второе место, после Winnow-12B с 50,02, который в четыре раза больше по размеру.
• Текстовые бенчмарки, по данным производителя — d1-3B в среднем набирает 82,9 по семи публичным бенчмаркам, опережая Decider 4B с 81,1; d1-omni-600M в среднем набирает 78,4, что превосходит Decider 2B с 77,1 при примерно четверти количества параметров. 600M демонстрирует лучший в таблице показатель токсичности (Civil Comments 95,8) и лучший показатель перефразирования (PAWS-X 79,5).
• Зрение, по данным вендора — d1-3B в среднем набирает 74,1 по одиннадцати публичным бенчмаркам для изображений, интерпретируемым как выбор из вариантов ответа, предлагаемых в каждом бенчмарке, против 73,9 у базовой модели LFM2.5-VL-3B. Если убрать изображения, результаты по тем же вопросам падают до 45,1 — так вендор показывает, что ответы берутся из пикселей.
• Задержка, измеренная производителем, — на обработку одного вопроса уходит 8 мс на RTX 4090 и 9 мс на AMD MI325X; 16 мс на Jetson AGX Thor, 26 мс на Jetson AGX Orin 64 GB, 50 мс на самом маленьком Jetson Orin Nano и 30 мс на Apple M5 Pro. Шестьдесят четыре состояния, упакованные в один проход, выполняются со скоростью 475 в секунду на 4090.
• Что отсутствует — у d1-omni-600M вообще нет таблицы инференса. Liquid говорит, что она находится в активной разработке, и просто не сообщает для неё задержку. Также в релизе нигде нет бенчмарка для принятия аудиорешений, потому что, по словам вендора, специализированные бенчмарки для принятия аудиорешений в настоящее время остаются открытой проблемой.
Утверждение, которое на самом деле делает релиз
За два дня до того, как веса были выложены, Liquid опубликовала размещённую версию этой модели и протестировала её против GPT-6.1 Sol и Claude Opus 5.5 на шести приложениях. Её вывод: d1 не уступает или превосходит GPT-6.1 Sol в четырёх из шести, стоит в 19–200 раз меньше и отвечает быстрее в каждой задаче. Опубликованную методологию стоит прочитать, прежде чем повторять что-либо из этого, — каждое приложение запускалось один раз для каждой модели 5 октября 2026 года, чат-модели отвечали в формате JSON при настройке рассуждений по умолчанию, а стоимость d1 рассчитывалась исходя из $0,04 за миллион входных токенов.
Демонстрации — более убедительная половина. Сортировка годных и бракованных деталей с четырёх производственных линий — печатных плат, свечей, кешью, жевательной резинки — с точностью от 85 до 97% на модели, которая никогда не обучалась этой задаче и поняла её из краткого описания. SQL-предикат, который отвечает «да» или «нет» для каждого из 150 тикетов службы поддержки. Цикл сжатия контекста, который читает каждый вывод инструмента в сессии агента-программиста и сохраняет, обрезает или отбрасывает его, удаляя 52% токенов, при этом сохраняя все выводы, необходимые задаче. В «Тетрисе» добавление экрана к полностью описываемой текстом игре подняло счёт с 70 очищенных линий до 81 — результат по зрению, которого невозможно достичь с помощью текстового классификатора, каким бы хорошим он ни был.
Это демонстрации, которые проводят поставщики, с задачами, выбранными поставщиками, и в разделе о методологии так и сказано. И всё же это самая ясная из опубликованных картин того, для чего нужна модель принятия решений.

Где это работает и сколько стоит позвонить
Открытые веса созданы для локального запуска, и вендор заранее проделал всю работу по интеграции: поддержка llama.cpp с первого дня, полный стек NVIDIA — от DGX до Jetson, квантование NVFP4 и 8-битный вариант весов/активаций, опубликованный вместе с базовым чекпоинтом. Конвертации в GGUF уже доступны на Hugging Face. Если вы предпочитаете ничего не хостить самостоятельно, Liquid предоставляет хостинговую d1 через собственный API — оплачиваются только входные токены, выходные отсутствуют; изображения тарифицируются как входные из расчёта 1,5 токена на участок 32×32 пикселя, то есть изображение 1024×1024 — это 1 536 токенов. Доступ только к тексту также возможен через сторонние платформы.
Честное замечание о маршрутизации: ни Liquid AI d1-3B, ни Liquid AI d1-omni-600M нет в нашем каталоге, и эта статья не является заявлением о доступности любого из них. Что пара d1 меняет для маршрутизатора — так это форму пайплайна вокруг него. Модель принятия решений, которая отвечает за миллисекунды и ничего не стоит по выходным токенам, — это фильтр, а не замена: сортировка годных и бракованных и триаж тикетов происходят перед генеративным вызовом, и именно на генеративном вызове единый эндпоинт для 200+ моделей, списочные цены, передаваемые с наценкой 0%, и автоматическое переключение при сбое действительно оправдывают себя. Другой уровень, тот же пайплайн.
Что бы уладило спор
Три вещи остаются нерешёнными, и все три — из тех, что закрывает только время.
Первое — независимое воспроизведение. Числа Decision Index были получены вендором с помощью официального скорера, а строка каждого конкурента была взята из публичного лидерборда; это метод, который можно обосновать, и это не то же самое, что третья сторона, запускающая вашу модель. Второе — аудио. Чекпоинт на 600M, который маршрутизирует голосовую команду за один прямой проход, — это действительно новая возможность, и не существует бенчмарка, который измерял бы, насколько хорошо она с этим справляется. Третье — сама категория: когда ответ считывается с распределения, а не выписывается, обычные режимы отказа небольшой модели — зацикливание, дрейф, отказ, галлюцинирование формата — просто не могут возникнуть, и никто не опубликовал хорошего описания того, что приходит им на смену. Ошибка калибровки — очевидный кандидат, и именно её поле уверенности в каждом ответе предлагает вам измерить самостоятельно.
Десять демо запускают Liquid AI d1-3B в цикле по живому видеопотоку с камеры в публичном пространстве Hugging Face — это самый дешёвый способ составить собственное мнение. Веса бесплатны, а вопросы конкретны. Это лучшая стартовая позиция, чем та, которую предлагает большинство релизов в этом году.

Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
