
Liquid AI d1-omni-600M против LFM2.5-VL-3B: один решает, другой описывает
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Liquid AI d1-omni-600M и LFM2.5-VL-3B — обе небольшие, обе мультимодальные, обе опубликованы одной и той же лабораторией на Hugging Face под одной и той же лицензией lfm1.0, — и их сопоставление представляет собой категориальную ошибку, которая, как выясняется, оказывается полезной. LFM2.5-VL-3B появилась 12 августа 2026 года как edge-модель зрения и языка от Liquid AI: 3,1 млрд параметров, окно в 32 768 токенов и выход, представляющий собой связный текст. Передайте ей отсканированную страницу — и она вернёт транскрипцию вместе с разметкой в виде текста. Liquid AI d1-omni-600M была загружена 7 октября 2026 года вместе с остальным открытым семейством d1 и делает с теми же входными данными противоположную вещь. Это модель принятия решений на 587 млн параметров: вы привязываете к состоянию именованные вопросы, а она сообщает то, что уже считает, — P(yes), выбранную метку с уверенностью, позицию на упорядоченной шкале от двух до десяти — за один прямой проход, с нулём выходных токенов и без чего-либо ниже по потоку, что нужно было бы парсить. Если вы искали «небольшую мультимодальную модель Liquid», теперь перед вами две формы, и выбор формы — это и есть решение.
Эта страница отражает то, что фактически подтверждают две карточки моделей, пост о релизе от 7 октября и сами репозитории. В ней также прямо указано, где они останавливаются. Ничто из этого сравнения не было воспроизведено за пределами Liquid AI, и для одной из двух моделей поставщик вообще не опубликовал никаких показателей точности, относящихся к его собственной главной заявленной возможности.
Две контрольные точки, бок о бок
Спецификации расходятся почти по всем параметрам — чего и следовало ожидать от двух моделей, которым никогда не предназначалось конкурировать за одну и ту же нишу.
• Что это — LFM2.5-VL-3B — это генеративная визуально-языковая модель, которая пишет текст; Liquid AI d1-omni-600M — это модель принятия решений, которая возвращает структурированные ответы и не выдаёт токенов
• Параметры — 3,1 млрд в BF16 для LFM2.5-VL-3B против 587 млн у Liquid AI d1-omni-600M, которая сама представляет собой общий ствол и решающую голову на 381 млн, а также визуальный кодер на 94 млн и аудиокодер на 112 млн
• Основа — LFM2.5-VL-3B объединяет языковую модель LFM2.5-2.6B с оптимизированным по форме 400M визуальным энкодером SigLIP2 NaFlex; Liquid AI d1-omni-600M обучена на основе LFM2.5-Encoder-350M, двунаправленного энкодера, с башней SigLIP2, взятой из LFM2.5-VL-450M, и 17-слойным FastConformer для аудио.
• Входные данные — текст и изображения для LFM2.5-VL-3B; текст плюс изображения или текст плюс до 30 секунд речи для Liquid AI d1-omni-600M, которая вызывает ValueError, если изображения и аудио поступают в одном запросе
• Контекст — 32 768 токенов для LFM2.5-VL-3B против 16 384 объединённых позиций текста, изображения и аудио для Liquid AI d1-omni-600M, в карточке которого добавляется, что при наличии изображений текст состояния и вопроса урезается до 896 токенов, чтобы соответствовать обучению
• Словарь — 128 000 токенов для LFM2.5-VL-3B, 65 536 для Liquid AI d1-omni-600M
• Среда выполнения — LFM2.5-VL-3B работает в transformers и vLLM и имеет отдельную черновую модель DSpark для спекулятивного декодирования; Liquid AI d1-omni-600M поставляется с собственным кодом, требует trust_remote_code=True, а в его карточке рекомендуется float16 на GPU, при этом предупреждается, что bfloat16 изменил лучший ответ в некоторых строках
• Лицензия — lfm1.0 для обоих, что допускает дообучение и развёртывание
Одна строка в этом списке делает больше работы, чем остальные. Liquid AI d1-omni-600M построена на двунаправленном энкодере, а не на декодере. Это не уменьшение размера LFM2.5-VL-3B; это другое происхождение, и именно это архитектурная причина, по которой эти две модели нельзя заменять одна другой, как бы ни читались таблицы бенчмарков.
Контракт вывода решает больше, чем бенчмарки.
Задайте LFM2.5-VL-3B вопрос об изображении — и в ответ получите текст. Это стоит денег, когда ответ должен прочитать человек, быть записан как строка или передан на шаг, который ожидает связный текст. Это также риск, который приходится компенсировать инженерными решениями: сгенерированный вывод может уходить в сторону, запрос в форме JSON может вернуться не в той форме, которую вы запрашивали, а каждый токен оплачивается и требует ожидания. Модель явно предназначена для однооборотной, высокопроизводительной, низколатентной работы со зрением — пакетного OCR сканированных документов, обнаружения в реальном времени в транспортном средстве, перевода вывесок на устройстве — и явно уведена от длинноконтекстных вопросов, требующих интенсивных рассуждений, таких как «что не так с этим чертежом».
Liquid AI d1-omni-600M отвечает на строго более узкий вопрос в строго более надёжной оболочке. Его интерфейс — это состояние: текст, JSON, одно или несколько изображений или до 30 секунд речи — плюс набор именованных вопросов, каждый из которых объявляет свой тип. noul-вопрос — это вопрос с ответом «да/нет», и он возвращает P(да) в диапазоне от 0 до 1. choice-вопрос выбирает одну метку из заданного вами набора и возвращает метку, уверенность и вероятность каждого варианта. score-вопрос помещает состояние на упорядоченную шкалу от двух до десяти уровней и возвращает ожидаемый уровень вместе с его распределением. Несколько вопросов могут быть привязаны к одному состоянию и считываются за один проход, поэтому счётчик использования в карточке модели сообщает output_tokens: 0. Этапа генерации нет, а значит, не существует такого понятия, как вывод, который не удаётся разобрать.
То, от чего вы отказываетесь, — это всё, что несёт сгенерированный ответ, но не несёт метка: рассуждение, оговорку, фразу, которую можно вставить в тикет, возможность задать уточняющий вопрос в том же разговоре. Liquid говорит об этом прямо — эта модель не является чат-моделью и не пишет текст. Если вашему конвейеру нужно объяснение рядом с вердиктом, Liquid AI d1-omni-600M — это не та половина пары, и честный ответ — запускать обе: LFM2.5-VL-3B, чтобы получить прочтение изображения, Liquid AI d1-omni-600M, чтобы получить решение о нём.

Прямого сопоставительного показателя по зрению нет — и в этом и заключается вывод
Инстинктивный следующий шаг — выстроить визуальные бенчмарки в ряд. Не получится. Для LFM2.5-VL-3B вендор публикует полный набор — RefCOCO Macro Precision@1 на уровне 87,9, ScreenSpot-v2 — 80,7, ChartQA — 81,3, POPE — 88,7, MMStar — 63,3, BLINK — 61,5, MuirBench — 58,3, ToolSandBox — 59,5, OCRBench v2 English — 47,5 и RealWorldQA — 73,1, что немного превосходит показатель 71,1 предыдущей LFM2-VL-3B. Все они заявлены вендором, ни один не был независимо перепроверен, и тем не менее это конкретные утверждения о конкретных возможностях, за которые читатель может призвать лабораторию к ответу.
Для Liquid AI d1-omni-600M в релизном посте говорится, что Decision Index v0.3 включает приватный vision-сплит, «по которому мы не отчитываемся в этом релизе», и что вместо этого Liquid подтвердила, что чекпойнт 600M «обрабатывает все три модальности», а доказательства приведены в демо playground. Это и есть вся опубликованная информация о зрении. Для этого чекпойнта нет ни одного показателя бенчмарка по изображениям — ни в его карточке модели, ни в посте о запуске. Тот же пост ещё более прямо подтверждает недостающее на стороне аудио: специализированные аудиобенчмарки решений, по словам самого вендора, «в настоящее время являются открытой проблемой».
Так что правильное прочтение этого противостояния асимметрично, и именно так о нём и следует говорить. LFM2.5-VL-3B продемонстрировала способность к зрению, подкреплённую цифрами. Liquid AI d1-omni-600M — это визуальный энкодер, позаимствованный у родственной модели, адаптер, обученный на замороженном бэкбоне, демо и обещание. Если вашему развёртыванию нужно, чтобы модель была права насчёт изображений уже в этом месяце, то 3B — единственная из двух, у которой есть хоть что-то, на что можно опереться.
Скорость: только одна из них была измерена
Поскольку модель принятия решений ничего не генерирует, главное — латентность, и только одна сторона здесь ошибается. Для LFM2.5-VL-3B заявлены 228 токенов в секунду на Apple M5 Max и 116 токенов в секунду на AMD Ryzen AI Max 395 — причём и то и другое укладывается в 3,3 ГБ памяти, — а также около 20 токенов в секунду на Galaxy S26 Ultra и примерно 11 000 токенов в секунду на одном H100 под управлением vLLM. Эти цифры описывают пропускную способность декодирования, а именно она и есть правильная метрика для модели, которая пишет.
Для Liquid AI d1-omni-600M показатели инференса не публикуются, потому что модель является ранним исследовательским релизом и находится в активной разработке. У родственной d1-3B из того же семейства таблицы задержек есть — 8 мс на один вопрос на RTX 4090, 16 мс на Jetson AGX Thor, 26 мс на Jetson AGX Orin 64 GB, 50 мс на Orin Nano, при этом три вопроса в рамках одного состояния обходятся примерно в 1,3 раза дороже по времени, чем один. Эти числа относятся к 3B-модели для принятия решений, и их нельзя переносить на 600M. Для Liquid AI d1-omni-600M честная позиция состоит в том, что архитектура подразумевает небольшую быструю модель, и никто за пределами лаборатории не публиковал цифру в миллисекундах.
Объем, занимаемый весами, по крайней мере можно оценить. При точности float16, которую рекомендует карточка, 587 млн параметров — это примерно 1,2 ГБ весов до активаций — арифметический расчет на основе опубликованного количества параметров, а не измерение производителя — против менее 3,3 ГБ, которые Liquid указывает для LFM2.5-VL-3B. На устройстве, где ограничивающим фактором являются мегабайты, эта разница и есть аргумент в пользу 600M.

Как выбрать между ними
Выбор решается однозначно, как только контракт вывода рассматривается как фиксированный, а не как предмет обсуждения.
Обращайтесь к LFM2.5-VL-3B, когда результат — текст: полностраничное OCR с аннотацией макета, привязка и обнаружение по запросам на естественном языке, перевод вывесок на устройстве, любой этап, на котором ответ использует человек или нижестоящая языковая модель. У неё также шире контекст — 32 768 токенов — и на практике глубже языковой охват, потому что её ответы — это язык, а не метки.
Выбирайте Liquid AI d1-omni-600M, когда результат — это решение: маршрутизация тикета, триаж кадра, модерация клипа, гейтинг защитного ограничения, оценка ответа по шкале от двух до десяти — и, в отличие от второй модели из этой пары, когда на входе речь. Только она из этой пары вообще принимает аудио, до 30 секунд на запрос, хотя в её карточке отмечено, что аудио обучалось на обменах между носителем английского языка и ассистентом, а это узкое описание мира, из которого будут поступать ваши вызовы.
Не выбирайте ни одну из них и остановитесь на универсальной визуально-языковой модели, если задача требует рассуждений об изображении, а не его прочтения или вынесения о нём вердикта. Обе карточки моделей свидетельствуют не в пользу этого сценария использования, а у Liquid AI d1-omni-600M нет механизма, чтобы попытаться это сделать.
Пробую экспериментальный чекпоинт, не ставя на него весь пайплайн.
Liquid AI d1-omni-600M, по собственному определению вендора, — это ранний исследовательский релиз, а его поведение в части зрения и аудио не проверено бенчмарками. Это ровно тот профиль модели, которую стоит оценивать за резервным маршрутом, а не перед клиентами. OrcaRouter маршрутизирует 200+ моделей через один API-ключ с автоматическим переключением при сбое между провайдерами, а это дешёвый способ вывести такой чекпоинт на боевой путь: если экспериментальный маршрут деградирует или провайдер становится недоступен, запрос уходит на резервный вариант без изменений в коде. Тот же ключ обслуживает все модели, которым передаёт управление пайплайн, по прайс-листовой цене каждого провайдера с наценкой 0%, так что снижение цены вендором — это ваша цена в тот же день.
Одна оговорка, и я привожу её, поскольку она принципиально важна: открытые модели d1 и семейство LFM2.5-VL сегодня отсутствуют в нашем каталоге. Самостоятельный хостинг весов — это путь, который поставщик рекомендует для обоих, с поддержкой llama.cpp с первого дня на оборудовании Apple, AMD, Qualcomm и NVIDIA, а их запуск на размещённом эндпоинте означает использование собственного API поставщика или сторонних платформ. Воспринимать эту страницу как утверждение о доступности было бы ошибкой.

Что посмотреть
Интересный вопрос не в том, победит ли 600M в конце концов 3B хоть в чём-нибудь — не победит, и создавалась она не для этого. Он в том, опубликует ли Liquid AI то приватное разбиение для зрения, которое она придержала, и построит ли кто-нибудь тот аудиобенчмарк для принятия решений, о котором лаборатория говорит, что его пока не существует. Пока не появится что-то из этого, сравнение Liquid AI d1-omni-600M и LFM2.5-VL-3B — это сравнение измеренной модели с правдоподобной. Для неизмеренной работы — речь на входе, вердикт на выходе, достаточно компактной, чтобы уместиться на устройстве, — 600M это единственный чекпойнт с открытыми весами в этом семействе, который это пробует, а быть первым без таблицы результатов — всё равно быть первым.
OrcaRouter направляет более 200 моделей через один API-ключ, при этом цена по прайс-листу каждого провайдера передаётся с наценкой 0%поэтому снижение цены поставщиком — это ваша цена в тот же день.
