
Liquid AI d1-3B vs Gemma 4 12B: модель принятия решений против универсальной модели
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Самый быстрый способ ошибиться в этом сравнении — поставить Liquid AI d1-3B и Gemma 4 12B на один и тот же бенчмарк и ждать победителя. Они отвечают не на один и тот же вопрос. Liquid AI d1-3B — это решающая модель на 3,12B, опубликованная в виде открытых весов 7 октября 2026 года: вы подаёте ей состояние и набор именованных вопросов, а она возвращает вероятности, выбранную метку и уверенность — при нулевом числе выходных токенов и без этапа генерации. Gemma 4 12B — это универсальная модель Google без энкодера, работающая по схеме «любое-в-любое»: чекпойнт на 11,96B, который принимает текст, изображения, аудио и видео и выдаёт ответ в окне на 256 000 токенов более чем на 140 языках. Одна из них говорит, чем из четырёх является печатная плата. Другая говорит, почему. Сравните их только по качеству — и вы не узнаете ничего, потому что их выходные данные несоизмеримы, к тому же производители никогда не сравнивали их друг с другом в бенчмарках. А сравните их по тому, что фактически возвращает вызов, сколько это стоит и где каждая из них упирается в предел, — и это сочетание превратится в по-настоящему полезный тест границ.
Два разных контракта вывода
Различие, которое здесь делает всю работу, — это то, что возвращается по проводу.
Liquid AI d1-3B возвращает объект структурированного ответа. Каждый вопрос в запросе объявляет тип — noul для «да/нет» с P(да), choice для одного из именованного набора вариантов с уверенностью и вероятностью для каждого варианта, или score для позиции на упорядоченной шкале от двух до десяти уровней с ожидаемым уровнем и его распределением. Модель сообщает output_tokens: 0, потому что ничего не записывается. Несколько вопросов об одном состоянии считываются за один прямой проход, а состояние и его изображения кодируются один раз для всех них.
Gemma 4 12Bвозвращает прозу. Иногда она возвращает JSON, который вы запросили, а иногда — не совсем тот JSON, который вы запросили, и перед ответом она может рассуждать. Это в первую очередь языковая модель: всё, что она умеет классифицировать, она выражает текстом. Это сильная сторона, когда ответ нужно объяснить человеку или передать на следующий этап, ожидающий язык, и издержка, когда единственное, что вам было нужно, — это вероятность.
Всё, что идёт дальше, вытекает из этого. Ответ d1-3B не может не распарситься. Он также не может объяснить себя, и карточка модели говорит об этом прямо: это не чат-модель, и она не пишет текст.
Где находятся следы доказательств
Происхождение этих двух наборов чисел не равнозначно, и здесь это важнее, чем сами числа.
• Decision Index 0.2.1 — Liquid AI d1-3B набирает 48,57 балла; оценка выполнена производителем с помощью официального инструмента оценки; первое место среди моделей менее 10B и выше Decider 35B-A3B с 47,11. Gemma 4 12B вообще не оценивается в Decision Index, поэтому у этой строки нет аналога.
• Бенчмарки рассуждений — Gemma 4 12B показывает 77,5 на AIME 2026, 78,8 на GPQA Diamond и 1 659 ELO Codeforces, а также имеет индекс интеллекта Artificial Analysis, равный 22 в режиме рассуждений и 13 при отключённых рассуждениях. У Liquid AI d1-3B нет бенчмарка рассуждений, потому что модель принятия решений не создаёт трассировку рассуждений для оценки.
• Длинный контекст — Gemma 4 12B поддерживает 256 000 токенов и набирает 43,4% на MRCR v2 eight-needle при 128k в собственной карточке Google. Liquid AI d1-3B поддерживает 32 768 токенов. Если ваше «состояние» — это документ на сорок страниц плюс сканы, этот разрыв и есть всё решение, и выбор здесь очевиден.
• Зрение — Liquid AI d1-3B в среднем набирает 74,1 по одиннадцати публичным бенчмаркам для изображений, интерпретируемым как решения по набору вариантов каждого бенчмарка, против 73,9 у базовой модели LFM2.5-VL-3B, взятой за основу, а производитель сообщает, что удаление изображений снижает показатели по тем же вопросам до 45,1. Зрение Gemma 4 12B сильнее и шире, но о нём сообщается как о качестве генерации, а не как о точности решений по заданным вариантам.
• Языки — шестнадцать задокументировано для Liquid AI d1-3B; более 140 — для Gemma 4 12B.
• Скорость — Liquid AI d-3B отвечает на один вопрос за 8 мс на RTX 4090, 16 мс на Jetson AGX Thor, 26 мс на Jetson AGX Orin 64 GB и 50 мс на Jetson AGX Orin, а также упаковывает 64 состояния в один проход со скоростью 475 в секунду на 4090. Gemma 4 12B генерирует, поэтому её задержка зависит от того, сколько токенов она записывает.
• Качество доказательств — результаты Gemma 4 12B принадлежат Google, опубликованы в июне 2026 года, и с тех пор большое сообщество их проверяло, квантовало и перезапускало. Результаты Liquid AI d1-3B принадлежат Liquid, опубликованы два дня назад, никем за пределами лаборатории не воспроизведены. Читайте второй столбец с учётом этого.

Единственное место, где они по-настоящему конкурируют
Есть реальное пересечение, и оно не в таблице лидеров. Это вызов LLM-as-a-judge.
Многие производственные конвейеры уже используют среднеразмерного универсала в качестве слоя оценки: оценить срочность этой заявки, решить, соответствует ли этот вывод рубрике, выбрать, какой инструмент агент должен вызвать следующим, проверить, отвечает ли найденный фрагмент на вопрос. Сегодня большинство таких вызовов выполняет генеративная модель, которую просят выдать число или метку в виде текста, и число, которое она выдаёт, — это то, что произвёл сэмплер, а не softmax по вашему набору вариантов. Именно этот рабочий процесс должна была заменить модель Liquid AI d1-3B, дообученная для этого, и все опубликованные демонстрации — его версии: SQL-предикат, который отвечает «да» или «нет» для 150 заявок в поддержку, цикл сжатия контекста агента, который сохраняет, обрезает или отбрасывает вывод каждого инструмента и удаляет 52% токенов, приложение визуальной инспекции, которое сортировало годные и дефектные детали с четырёх производственных линий с точностью от 85 до 97% в задаче, для которой оно никогда не обучалось.
Gemma 4 12B справляется со всеми этими задачами и умеет даже больше. Он также может написать резюме, удерживать в контексте документ объёмом 256K, принимать на вход запись телефонного разговора и отвечать более чем на 140 языках. Если вашему конвейеру нужна оценка и описание, то 12B выполняет две задачи за один вызов, а модель принятия решений 3B — одну из них.
Граница — это длина контекста и форма вывода. Длинное состояние, голосовой ввод, множество языков или объяснение, которого ожидает читатель — Gemma 4 12B, вне конкуренции. Короткое состояние, фиксированный набор вариантов, бюджет задержки на запрос в однозначных миллисекундах или жёсткая гарантия, что ответ распарсится — это колонка d1-3B, и универсальная модель заставляет платить за возможности, которые вы не будете использовать.
Сколько стоит позвонить каждому из них
Ни одна из этих моделей не представлена в нашем каталоге, поэтому для них нет цены маршрутизации, которую можно было бы назвать, — Gemma 4 12B не входит в число размеров Gemma, которые мы обслуживаем, а Liquid AI d1-3B — это открытые веса, которые вы размещаете у себя самостоятельно или получаете через собственный API поставщика и сторонние платформы. Для контекста о связанной с Gemini стороне этого семейства: два размера Gemma 4, которые мы всё же маршрутизируем, указаны по цене $0,06 за миллион входных токенов и $0,33 за миллион выходных токенов для Gemma 4 26B A4B и $0,13 и $0,38 для Gemma 4 31B, оба с контекстом в 262 144 токена и поддержкой ввода текста, изображений и видео. Медианная цена провайдеров, которую в других местах указывают для Gemma 4 12B, составляет около $0,10 и $0,30.
Хостинговый вариант Liquid d1 тарифицирует только входные токены — $0,04 за миллион, при этом изображения учитываются как входные по 1,5 токена на участок 32×32 пикселя. Поэтому в запросе на принятие решения вообще нет строки выходных токенов; это структурная причина, по которой собственное сравнение затрат вендора с гораздо более крупными моделями даёт именно такой результат. У открытых весов нет цены за вызов; вы платите за оборудование. И то, и другое должно находиться в том же пайплайне, что и всё остальное, что вы вызываете, — именно для этого слоя и существует роутер: один API для 200+ моделей, списочные цены провайдеров, передаваемые с наценкой 0% и автоматическое переключение при сбое, чтобы единичный сбой у вышестоящего провайдера не стал вашим простоем. Это инфраструктурная обвязка вокруг сравнения, а не само сравнение.

Как решить, честно говоря
Начинайте с формата ответа, а не с модели. Если нижележащая система может принимать вероятность, метку и оценку уверенности, а набор ответов мал и известен, то Liquid AI d1-3B — не понижение по сравнению с 12B, а другой инструмент, и показатели задержки делают его категорически иным вариантом развёртывания: 50 мс на Jetson Orin Nano — это устройство, которому вообще нечего делать с запуском 12B.
Если ответ должен быть предложением, или состояние длиннее тридцати двух тысяч токенов, или кто-то собирается произнести его вслух, или язык вывода — бенгальский, то Gemma 4 12B — единственная из двух, способная справиться с задачей, и сравнение заканчивается, не успев начаться.
По-настоящему полезный подход для большинства команд — использовать и то и другое, но в разных местах. Модель принятия решений перед дорогим вызовом выполняет триаж, маршрутизацию и проверки защитных ограничений, которые не требуют языка; универсал позади неё — для работы, которой язык нужен. Это один и тот же пайплайн: один — фильтр, другой — полезная нагрузка. И команды, которые извлекут максимум из релиза d1, — это те, что уже платят 12B за ответ «да» или «нет».

