Титульная карточка в hero-блоке с заголовком «Liquid AI d1-3B vs Granite 4.2 3B» и подзаголовком «один решает, другой пишет», на которой показана левая карточка с надписью d1-3B и значком контрольного списка, подписью «3.12B — 32 768 токенов» и чипами с надписями вероятность, метка и оценка, а также правая карточка с надписью Granite 4.2 3B со значком речевого пузыря, подписью «3B — 128K токенов» и чипом с надписью «письменный ответ».
Guides & Insights

Liquid AI d1-3B против Granite 4.2 3B: две 3B-модели, которые никогда не выполняют одну и ту же работу

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Поставьте Liquid AI d1-3B и Granite 4.2 3B на один и тот же GPU, и обе они спокойно поместятся — 3,12 млрд параметров с одной стороны, 3 млрд — с другой. Они также будут вести себя так, будто пришли из разных дисциплин. Granite 4.2 3B, который, согласно собственной карточке модели IBM, датируется 25 августа 2026 года, — это модель рассуждений: три режима мышления, <think>-блок и ответ, который вы читаете. Liquid AI d1-3B, загруженная на Hugging Face 5 октября 2026 года и анонсированная Liquid двумя днями позже, — это модель принятия решений: она принимает состояние плюс явный набор типизированных вопросов и возвращает вероятность, метку или позицию на шкале за один прямой проход, сообщая output_tokens: 0, потому что она никогда ничего не пишет. Полезный вопрос не в том, какая из них лучше. А в том, какой из ваших вызовов на самом деле является решением, потому что эти два репозитория созданы для противоположных половин этого разделения.

Что на самом деле находится в каждом репозитории

Всё нижеследующее взято из двух карточек моделей и анонсирующей публикации Liquid. Ничто из этого не было независимо воспроизведено, ни одна третья сторона не оценивала ни одну из моделей на одном и том же тестовом стенде, а цифры в карточках принадлежат самим вендорам.

• Размер — Liquid AI d1-3B: всего 3,12 млрд параметров, создана на основе LFM2.5-VL-3B от Liquid; Granite 4.2 3B — это плотный 3B-трансформер, использующий только декодер, созданный на основе granite-4.1-3b-base

• Выход — d1-3B возвращает вероятности, метки и оценки уверенности и вообще не пишет текст; Granite 4.2 3B генерирует токены, включая необязательную цепочку рассуждений внутри <think>-тегов

• Контекст — d1-3B 32 768 токенов; Granite 4.2 3B — 128K нативно, с расширением длинного контекста до 512K на карте

• Ввод — текст d1-3B, JSON, изображения или их комбинация, через визуальный энкодер SigLIP2 NaFlex 400M; Granite 4.2 3B только текст

• Лицензия — d1-3B по Liquid's LFM Open License v1.0; Granite 4.2 3B по Apache 2.0

• Языки — d1-3B указывает 16; Granite 4.2 3B перечисляет двенадцать протестированных, при этом в карточке отмечается, что остальные не тестировались

• Сервинг — d1-3B поставляется с пользовательским кодом (trust_remote_code=True, transformers>=5.14), с репозиториями GGUF и w8a8 в том же семействе и карточками с документацией для llama.cpp, Ollama и LM Studio; Granite 4.2 3B работает под vLLM 0.20+ или SGLang 0.5.18+ с пользовательским парсером рассуждений

Две из этих строк делают больше, чем остальные. Строка вывода — это весь аргумент этой статьи, а строка лицензии — та, которую никто не помещает в сравнительную таблицу.

A two-column scoreboard for Liquid AI d1-3B and Granite 4.2 3B. The d1-3B column reads: job answers a typed question; parameters 3.12B; output tokens billed 0; context 32,768 tokens; image input yes; one question 8 ms on an RTX 4090. The Granite 4.2 3B column reads: job writes a reasoned answer; parameters 3B; output tokens billed every token it writes; context 128K, to 512K extended; image input no; one question a full thinking pass. The footer reads 'Both columns vendor-reported, neither independently scored.'

Один пишет цепочку рассуждений, другой отказывается писать.

Granite 4.2 3B оправдывает себя тем, что думает вслух. В его карточке описаны три режима: мышление включено по умолчанию, без мышления и режим низких усилий, который сохраняет цепочку рассуждений, но сокращает её. Стеки обслуживания отделяют цепочку рассуждений от финального ответа, так что ваше приложение получает чистый контент плюс отдельное поле рассуждений. Это хороший дизайн для вопроса, который нужно проработать, — математической задачи, ветви логики, фрагмента кода, который нужно написать, прежде чем его можно будет оценить.

У модели d1-3B такого режима нет, и в её карточке об этом сказано прямо: «Это не чат-модель, и она не пишет текст». Вызов объявляет вопросы с указанием типа. noul — это вопрос с ответом «да/нет», возвращающий P(yes) в диапазоне от 0 до 1. choice выбирает одну метку из именованного набора вариантов и возвращает метку, уверенность и вероятность по каждому варианту. score помещает состояние на упорядоченную шкалу от двух до десяти и возвращает ожидаемый уровень вместе с его распределением и легендой. Сигнал считывается из логитов в позиции-заполнителе за один проход, а не сэмплируется токен за токеном, — именно поэтому блок usage может сообщать о нуле выходных токенов, не лукавя.

Это различие меняет ваш счёт раньше, чем меняет вашу точность. Вызов классификации Granite, который «думает» 400 токенов, — это вызов, за который вы платите 400 выходных токенов, а нужная вам метка погребена в прозе, которую затем должен извлечь парсер. Вызов d1-3B тарифицирует только вход. Если большая часть вашего трафика — это метка с прикреплённым правилом, вы платили за рассуждение независимо от того, изменило ли оно метку.

Где Granite 4.2 3B — явно лучший выбор

Если принимать эти бенчмарки для рассуждений за чистую монету — они собственные у IBM, прогнаны через внутренний конвейер NeMo Evaluator, и ни одна внешняя сторона их не воспроизвела — то 3B необычно сильна для своего размера: AIME25 78.33, HMMT February 2025 66.67, GPQA 54.80, LiveCodeBench v6 69.71, MMLU-Pro 67.84, IFBench 74.33, BFCL v4 52.41, tau3-bench 45.78, а RULER 64K — 67.52, снижаясь до 55.30 на 128K.

Из этого списка вытекают четыре задачи, и d1-3B не входит ни в одну из них.

• Нативный контекст 128K, расширяемый до 512K, против 32 768 токенов у d1-3B — если ваше состояние — длинный документ, выбор сделан за вас

• Агентный вызов инструментов с документированным парсером и интеграциями с обвязками для OpenCode, Pi и OpenHands, аналога чему у модели принятия решений нет

• Любая задача, ответом на которую является абзац: суммирование, составление черновиков, извлечение в свободную структуру, генерация кода

• Дообучение и распространение без потолка выручки, поскольку в Apache 2.0 нет порогового условия

Обратите внимание на то, чего нет на карточке Granite: строки SWE-Bench и Terminal-Bench отмечены как NA для 3B. Этап агентного обучения с подкреплением от IBM применялся только к моделям семейства 8B и 30B, поэтому самая маленькая модель не несёт агентных оценок, которые есть у её более крупных собратьев. Команда, которая прочитает «Granite 4.2» и решит, что 3B наследует агентный профиль семейства, будет удивлена.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that releases d1-3B and d1-omni-600M as open-weight models, d1-3B's Decision Index score of 48.57 and the claim that it is ahead of every model under 10B, and its latency of 8 ms on an NVIDIA GeForce RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Где d1-3B выигрывает, прежде чем Granite закончит думать

Собственная таблица задержек Liquid, измеренная в прогретом состоянии, по одному запросу за раз, — самая сильная часть их аргументации: один вопрос за 8 мс на RTX 4090 и 9 мс на AMD MI325X, 16 мс на Jetson AGX Thor и 26 мс на Jetson AGX Orin 64GB, при этом 64 состояния упаковываются в один проход со скоростью 475/с на 4090 и 1 106/с на MI325X. Для масштаба это примерно столько времени, сколько Granite 4.2 3B нужно, чтобы выдать несколько токенов своей цепочки рассуждений.

Три типа вопросов по одному состоянию обходятся d1-3B в 21 мс на 4090 вместо трёх отдельных вызовов, потому что состояние и его изображения считываются один раз для всех вопросов. В стеке модерации или маршрутизации, который раньше отправлял по одному HTTP-запросу на правило, это разница между очередью вызовов и одним вызовом.

Она также видит. d1-3B набирает в среднем 74,1 балла по одиннадцати публичным бенчмаркам изображений против 73,9 у базовой модели, и в карточке отмечается, что без изображений те же вопросы набирают 45,1 — ответы берутся из картинки, а не из текстового промпта. Отдельные строки могут быть как лучше, так и хуже (CV-Bench 82,1 против 87,6 у базовой модели, POPE 88,5 против 90,1), так что утверждение о зрении — «на уровне базовой модели», а не «лучше неё».

Честный противовес: показатель 48,57 у d1-3B по Decision Index 0.2.1 был получен благодаря тому, что Liquid сам запустил официальный оценщик, а не благодаря отправке в таблицу лидеров, при этом конкурирующие строки взяты из публичной таблицы лидеров. Его среднее 77,1 по восьми задачам benchmark-as-decision и 71,8 на DecisionBench также получены первой стороной. Всё, что относится к стороне d1 в этом сравнении, не подтверждено.

A capture of the Hugging Face model card for ibm-granite/granite-4.2-3b, showing the Apache 2.0 licence, the 3B parameter count, the decoder-only dense architecture built on Granite-4.1-3B-Base, the 128K native context with long-context extension to 512K, bfloat16 precision, the tested-language list and the built-in chain-of-thought reasoning mode.

Почему 3B-рассуждающая модель — это не 3B-модель принятия решений

Соблазнительный ход — считать Granite 4.2 3B более дешёвой заменой d1-3B или наоборот. Оба варианта не работают, и этот провал носит структурный характер, а не связан с качеством.

Попросите Granite принять решение — и вы получите генерацию, которую придётся разбирать, счёт, который растёт в зависимости от того, насколько сложным модель сочла вопрос, и задержку, зависящую от выбранного вами режима мышления. Попросите d1-3B рассуждать — и не получите вообще ничего: у неё нет потока токенов, в котором можно рассуждать. Эти две модели находятся по разные стороны границы, которую большинство пайплайнов пересекают несколько раз за запрос: что-то должно решать, а что-то — говорить. d1-3B место в начале, где правило триажа выбирает маршрут и возвращает калиброванную уверенность. Granite 4.2 3B место за ней, на ветке, которой нужно написать ответ.

Есть вторая, более тихая ловушка. Ценность модели принятия решений — это калибровка: уверенность 0,9, которая оказывается правильной девять раз из десяти. В карточке Granite 4.2 3B не публикуются ни метрики калибровки, ни вероятности; в ней публикуются показатели точности и рассуждений. Сравнение этих двух моделей в таблице лидеров бенчмарка ничего не говорит о том, какой из них следует доверять при выборе порога.

Строка о лицензии, которую никто не вносит в таблицу

Granite 4.2 3B поставляется под лицензией Apache 2.0. d1-3B поставляется под LFM Open License v1.0, которая выглядит разрешительной вплоть до раздела 5: коммерческое использование предоставляется при условии, что вы или ваше юридическое лицо остаётесь ниже порога, определённого в том же документе как годовая выручка в десять миллионов долларов США или более, а любое коммерческое использование выше этого порога просто не лицензируется. Для некоммерческих организаций и исследовательских пользователей сделано исключение.

Для любителя или стартапа это не проблема. Для компании, которая переступает эту черту в середине года — или которую может поглотить компания, уже переступившая её, — эти два репозитория не являются эквивалентными артефактами, как бы похоже ни выглядело количество их параметров, а проверка лицензии происходит уже после того, как кто-то давно выпустил прототип. Это самое дешёвое, что можно проверить заранее из всего, о чём здесь говорится.

Запуск пары как единого пайплайна

Ни одна из этих моделей сегодня не представлена в нашем каталоге, поэтому это не заявление о доступности: обе являются самостоятельно размещаемыми артефактами, а у Granite 4.2 3B в частности в её карточке вообще не указано ни одного провайдера инференса. Но на практике команда в итоге приходит к схеме, где один вызов решает, а другой говорит, и именно в такой схеме слой маршрутизации оправдывает своё место. OrcaRouter предоставляет более 200 моделей по одному API-ключу с списочными ценами провайдеров, передаваемыми без наценки (0%), так что снижение цены поставщиком отражается в вашем счёте в тот же день, а не при следующем продлении контракта, и автоматическим переключением при сбое между провайдерами — это значит, что общий компонент в середине пайплайна не превращается в единую точку отказа, пока вы его ещё оцениваете. Если вы хотите провести A/B-тестирование d1-3B против размещённой у провайдера модели общего назначения на собственном трафике, прежде чем остановиться на самостоятельном развёртывании, ближайший маршрутизируемый сосед по линии Granite — это Gemma 4 31B по цене $0.13 за миллион входных токенов и $0.38 за миллион выходных — модель куда крупнее, но в пайплайне она играет ту же роль «генералиста, который пишет».

Вердикт, сформулированный в виде правила

Если то, что вам нужно, — это вердикт — спам или нет, в какую очередь, насколько срочно, соответствует ли это изображение тому описанию, — d1-3B — единственная из двух, которая справляется с задачей за один проход, и делает это за единицы миллисекунд. Если то, что вам нужно, — это письменный ответ, чтение длинного документа, вызов инструмента или фрагмент кода, то Granite 4.2 3B — это та, у которой вообще есть поток токенов, а показатели рассуждений у 3B действительно впечатляют для своего размера — на собственных тестах IBM, причём их ещё никто не проверял.

Что изменило бы картину, так это не новая строка в бенчмарке. Это независимая третья сторона, оценивающая обе модели на одном и том же стенде калибровки, потому что свойство, определяющее, можно ли установить порог для модели, — именно то, которое сегодня не позволяет сравнить ни одна из карточек.