Титульная карточка-герой с заголовком «Liquid AI d1-3B против Qwen 3 8B» и подзаголовком «должна ли 8B-нагрузка классификации перейти на меньшую модель?», показывающая конвейер: входящий запрос ветвится на небольшой блок d1-3B с подписью «8 мс» и «0 выходных токенов» и более крупный блок Qwen 3 8B с подписью «пишет ответ», при этом из маленького блока выходят чипы метки и оценки, а из большого — чип с прозаическим текстом.
Guides & Insights

Liquid AI d1-3B против Qwen 3 8B: стоит ли переносить рабочую нагрузку классификации 8B на модель принятия решений?

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Где-то в большинстве продакшен-стеков есть Qwen 3 8B, которому платят за ответы «да» или «нет». Он модерирует комментарий, ставит тег на обращение в поддержку, решает, релевантен ли найденный фрагмент, или оценивает вывод другой модели по рубрике — и делает это, генерируя текст, который затем что-то ниже по цепочке парсит. Liquid AI d1-3B, модель принятия решений на 3,12B параметров, чьи открытые веса Liquid AI опубликовала 7 октября 2026 года, существует, чтобы выполнять именно эту работу, ничего не генерируя: состояние на входе, набор именованных вопросов на входе — и вероятности, метки и уровни уверенности на выходе за один прямой проход при нуле выходных токенов. Qwen 3 8B — это рабочая лошадка вендора с открытыми весами, выпущенная в апреле 2025 года: примерно 8,2B плотных параметров, 119 языков, режим размышления включается или отключается для каждого запроса, и за ней шестнадцать месяцев развёртывания сообществом. Вопрос, который на самом деле ставит это сопоставление, узкий и практичный: для той части вашего трафика, которая представляет собой классификацию, является ли 8B-универсал самым дешёвым способом получить метку в 2026 году, или сама форма этой задачи изменилась под ним?

За что вы на самом деле платите 8B-модели, чтобы она это делала

Поставьте два выходных контракта бок о бок — и неэффективность окажется структурной, а не приростной.

Вызов классификации Qwen 3 8B — это генерация. Вы пишете промпт, описывающий метки, модель опционально рассуждает о входных данных — а на этой модели такие рассуждения можно включать или отключать для каждого запроса, и это самый полезный параметр, который у неё есть для такой работы, — а затем она возвращает ответ. Этот ответ — текст. Если вы попросили JSON, вы обычно получите JSON, а иногда получите JSON внутри предложения, в виде вступления или с ненужным пояснением в конце. Нужная вам метка находится где-то в потоке токенов, и её извлекает парсер. С вас взимают плату за каждый токен, который пишет модель, включая те, что вы отбрасываете.

У Liquid AI d1-3B нет потока токенов. Вопросы объявляются с указанием типа: noul для «да/нет», ответ даётся как P(yes) в диапазоне от 0 до 1; choice для одной метки из именованного набора вариантов, ответ — это метка плюс уверенность плюс вероятность по каждому варианту; score для позиции на упорядоченной шкале от двух до десяти, ответ — это ожидаемый уровень с его распределением и легендой. В ответе присутствует нарастающий итог, который выглядит так: output_tokens: 0. Разбирать нечего, потому что ничего не было записано, и есть прямой аксессор probabilities, когда нужно неокруглённое распределение, а не argmax.

Часть, которая меняет ваш счёт, — это то, что происходит с несколькими вопросами. Одно состояние может включать много: это запрос на возврат, какая команда должна им заниматься, насколько это срочно. Состояние и его изображения читаются один раз, и Liquid сообщает, что три вопроса по одному состоянию занимают в 1,3 раза больше времени, чем один вопрос, а не в 3 раза. Что он не сокращает, так это плату за ввод — в счёте поставщика чётко указано, что каждый вопрос тарифицируется как отдельный промпт, включая его текст и все его изображения. Меньше задержек, те же входные токены. Это честная звёздочка к заголовку, и такое можно найти, только читая абзац о ценах, а не бенчмарк.

A two-column scoreboard for Liquid AI d1-3B and Qwen 3 8B. The d1-3B column reads: job a closed question answered; 3.12B parameters; output tokens billed 0; 32,768-token context; image input yes; one question in 8 ms on an RTX 4090. The Qwen 3 8B column reads: job text in, text out; about 8.2B dense parameters; output tokens billed every one it writes; 32,768 native context extending to 131,072 via YaRN; image input no; one answer as long as the answer is. The footer reads 'd1-3B figures vendor-reported; Qwen 3 8B figures per Alibaba, April 2025.'

Что вам дают шестнадцать месяцев Qwen 3 8B

Прежде чем считать меньшую модель улучшением, уточните, что привносит текущая, ведь дело не только в количестве параметров.

• Контекст — Qwen 3 8B нативно обрабатывает 32 768 токенов и расширяется до 131 072, что подтверждено через YaRN. Liquid AI d1-3B работает ровно с 32 768 токенами, без документированного пути расширения. Для состояния, представляющего собой длинный документ, 8B — единственная из двух, способная его удержать.

• Языки — 119 языков и диалектов для Qwen 3 8B по сравнению с шестнадцатью задокументированными для Liquid AI d1-3B.

• Управление рассуждениями — Qwen 3 8B позволяет включать или отключать размышления для каждого запроса. Liquid AI d1-3B не имеет режима рассуждений, которым можно управлять; это либо упрощение, либо ограничение — в зависимости от того, для чего вы использовали размышления.

• Широта возможностей — модель 8B пишет, объясняет, резюмирует, переводит и программирует. Liquid AI d1-3B не делает ничего из этого. В её карточке прямо сказано: это не чат-модель, и она не пишет текст.

• Доказательство — Qwen 3 8B имеет шестнадцать месяцев публичного бенчмаркинга, квантования, тонкой настройки и производственного использования. Оценка Decision Index модели Liquid AI d1-3B в 48,57 была получена Liquid с использованием официального скорера, а не отправлена в публичный лидерборд, и ей всего несколько дней, без воспроизведения третьими сторонами.

• Зрение — в этой строке всё наоборот. Liquid AI d1-3B принимает изображения: вендор сообщает о 74,1 по одиннадцати публичным бенчмаркам для изображений, интерпретируемым как решения по набору вариантов каждого бенчмарка, и сообщает, что удаление изображений обрушивает те же вопросы до 45,1. Текстовой модели Qwen 3 8B для всего этого нужна отдельная модель компьютерного зрения перед ней.

• Скорость — один вопрос за 8 мс на RTX 4090, 16 мс на Jetson AGX Thor, 50 мс на Jetson Orin Nano и 64 упакованных состояния за проход при 475 в секунду на 4090. У классификатора на основе генерации нет сопоставимого показателя, потому что его задержка зависит от длины ответа.

Честный итог таков: 8B — лучший универсальный инструмент, а 3B-модель принятия решений — лучшая специализированная, и единственный вопрос, который имеет значение, — какую долю вашего трафика составляет специализированный случай.

Арифметика затрат, проделанная тщательно

Именно здесь сравнение либо оправдывает себя, либо нет, поэтому его стоит проводить с настоящей структурой, а не с лозунгом.

Утверждение, которое Liquid опубликовала за два дня до релиза с открытыми весами, состоит в том, что её хостинговая модель принятия решений не уступает GPT-6.1 Sol или превосходит её на четырёх из шести реальных приложений, при затратах в 19–200 раз ниже, и отвечает быстрее в каждой задаче. Прочтите методологию, прежде чем повторять это: каждое приложение было запущено по одному разу для каждой модели 5 октября 2026 года, чат-модели отвечали в формате JSON при настройке рассуждений по умолчанию, а стоимость d1 рассчитывалась исходя из $0,04 за миллион входных токенов. Эта цифра $0,04 — это хостинговая d1 ставка за входные токены, и это единственная существующая ставка — строки для выходных данных, которую нужно было бы добавить, нет.

Теперь постройте такую же форму оценки для классификатора Qwen 3 8B, и асимметрия будет видна без цитирования чьей-либо цены провайдера. У 8B две оплачиваемые строки, тогда как у модели принятия решений — одна, и вторая строка — это та, которая растёт: классификация, которая сначала рассуждает, платит за рассуждение, а классификация, которая дополняет свой JSON, платит за дополнение. Плата за ввод модели принятия решений фиксируется состоянием и вопросами. У 8B она не фиксируется ничем, что можно предсказать, исходя только из состояния.

Два противовеса не дают этому стать разгромом. Во-первых, модель принятия решений тарифицирует каждый вопрос как отдельный промпт, поэтому, задавая пять вопросов по одному длинному документу, вы пятикратно увеличиваете входные данные — 8B задаёт все пять в одном вызове и платит за документ один раз. Во-вторых, и это важнее, модель принятия решений может отвечать только на те вопросы, на которые она была дообучена отвечать в таком виде. Всё, что требует объяснения, резюме или суждения, выраженного словами, возвращает вас к универсальной модели и на практике — к оплате за обе.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, the d1-3B Decision Index score of 48.57, and its latency of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

В чём эти двое действительно хороши

Уберите бенчмаркинг — и разбиение окажется чище, чем можно предположить по числу параметров.

Liquid AI d1-3B предназначена для ответов «да/нет», выбора из списка и оценки — с задержкой на том уровне, которого не достигает ни одна генеративная модель, на оборудовании, включающем Jetson Orin Nano с 50 мс и ноутбук. Все приложения, продемонстрированные Liquid в октябре, были вариациями этой формы — SQL-предикат, отвечающий «да» или «нет» по 150 обращениям в поддержку; цикл уплотнения контекста агента, который сохраняет, обрезает или отбрасывает вывод каждого инструмента и удаляет 52% токенов; приложение для инспекции, сортирующее годные и дефектные детали с четырёх производственных линий с точностью от 85 до 97% на задаче, для которой оно никогда не обучалось и которую поняло из краткого описания. Последнее демо — самое ясное выражение того, для чего нужна эта категория: работа, где ответ — один из нескольких вариантов, состояние — изображение, и никаких объяснений никогда не требовалось.

Qwen 3 8B предназначена для работы, которая должна вернуться в виде языка, или охватывать 119 языков, или вмещать документ длиннее тридцати двух тысяч токенов, или рассуждать вслух, прежде чем принять решение. Это также правильный выбор, когда классификация не относится к трём вышеуказанным формам — когда набор меток открыт, когда критерии настолько тонкие, что вам нужны были рассуждения, когда один и тот же запрос должен обрабатывать и простой, и сложный случай без того, чтобы вы маршрутизировали между двумя моделями. И это безопасный выбор, когда проверяющий спрашивает, какие независимые бенчмарки существуют, потому что ответ: их много, и они появились ещё полтора года назад.

Команды, которые делают это правильно, не выбирают. Они ставят модель принятия решений перед универсальной моделью, на той части трафика, где ответ — число, и оставляют 8B обрабатывать всё, что требует предложения. Фильтр — 3B и 8 мс; 8B остаётся для полезной нагрузки.

Развёртывание пары

Liquid AI d1-3B поставляется в виде весов, когда работа по развёртыванию уже проделана: поддержка llama.cpp с первого дня, полный стек NVIDIA от DGX до Jetson, квантование NVFP4, 8-битный вариант для весов и активаций, а также конвертации GGUF на Hugging Face. Qwen 3 8B обладает самой развитой экосистемой самостоятельного хостинга среди всех моделей этого весового класса. Ни той, ни другой нет в нашем каталоге, и ничто здесь не является заявлением о доступности любой из них — хостинговый маршрут для Liquid AI d1-3B — это собственный API вендора и сторонние платформы, где размещённая d1 тарифицируется только по входным токенам — $0,04 за миллион, а изображения — из расчёта 1,5 токена за фрагмент 32×32 пикселя.

Как только оба оказываются в одном пайплайне, проблема маршрутизации перестаёт быть теоретической. У вас есть небольшая модель, которой вы владеете, 8B, которую вы можете хостить или арендовать, и генеративные вызовы, которые вы точно арендуете, — и решение по каждому запросу о том, куда должен попасть конкретный вход, — это ровно то решение, для принятия которого и существует слой маршрутизации. Один эндпоинт для 200+ моделей, списочные цены провайдеров передаются с наценкой 0%, так что изменение цены вендором становится актуальным на вашей стороне в тот же день, автоматическое переключение при сбое, так что неудачный день у апстрима не превращается в ваш простой. Когда ваш трафик классификации измеряется миллиардами вызовов в год, именно на этом слое фактически собирается экономия от 3B-модели принятия решений.

Вердикт

Если вашей 8B задают закрытые вопросы — токсично ли это, релевантно ли это, в какую очередь это должно попасть, насколько это срочно, — вы расплачиваетесь счётом генералиста за токены и задержкой генерации ради одной метки, а Liquid AI d1-3B — это прямая замена с более слабой доказательной базой и реальной разницей в лицензии, которую стоит взвесить. Примите ограничение в 32K, шестнадцать языков и тот факт, что никто в Liquid ещё не оценивал её.

Если перед вашей 8B ставят задачи объяснять, суммировать, переводить, удерживать длинный документ или рассуждать перед принятием решения, это сравнение к вам не применимо. Оставьте 8B, а модель принятия решений рассматривайте только как предварительный фильтр для трафика, который вы заранее можете отнести к простому типу.

Интересная цифра, за которой стоит следить, — это не показатель бенчмарка ни одной из моделей. Это то, как быстро появится первое независимое воспроизведение d1 Decision Index, потому что именно в этот момент сравнение перестаёт быть заявлением вендора и становится фактом, на который можно опираться при планировании.

A capture of our own catalogue page for Qwen3 VL 8B Instruct, showing the model id qwen/qwen3-vl-8b-instruct, a release date of 2025-10-14, text, image and video input, a 131,072-token context window with 32K max output, a P50 time-to-first-token of 3.59 seconds, and pricing of $0.18 per million input tokens against $0.70 per million output tokens.