Карточка главного заголовка для LFM2.5-VL-3B: название «LFM2.5-VL-3B», подзаголовок «Модель видения и языка Liquid AI с 3B параметрами для периферийных устройств», чип с текстом «Новинка — выпущено 11 августа 2026 года» и три плоских линейных значка (рамка изображения, абзац, глаз).
Guides & Insights

LFM2.5-VL-3B: новая визуально-языковая модель Liquid AI с 3B параметров для Edge

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Первое, что нужно знать о LFM2.5-VL-3B, — это то, что она вышла в два этапа. Веса появились на Hugging Face 11 августа 2026 года — полный чекпойнт в bf16, карточка модели с таблицей бенчмарков и README на шестнадцати языках, и никакого анонса. Карточка показывала ноль загрузок. На следующий день, 12 августа, Liquid AI опубликовала официальный пост «LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge», и тихий релиз стал настоящим. Если вы читаете это на той же неделе, вы читаете один из самых ранних независимых обзоров модели, которую ещё почти никто за пределами лаборатории Liquid не запускал, — так что вот что действительно можно узнать из репозитория, а что нет.

Что такое LFM2.5-VL-3B

LFM2.5-VL-3B — это мультимодальная модель «vision-language» (изображение и текст на входе, текст на выходе), построенная на текстовой основе LFM2.5 от Liquid AI. А именно: языковая модель — LFM2.5-2.6B — работает в паре с зрительным энкодером SigLIP2 NaFlex 400M, что составляет около 3,1 миллиарда параметров. В ней сохранена гибридная архитектура семейства: блоки короткодействующих стробируемых свёрток, перемежающиеся с групповым вниманием по запросам (grouped-query attention), словарь на 128 000 токенов и окно контекста на 32 768 токенов. Модель поддерживает шестнадцать языков (английский, арабский, китайский, французский, немецкий, хинди, индонезийский, итальянский, японский, корейский, польский, португальский, русский, испанский, тайский, вьетнамский), поставляется в формате bfloat16 и распространяется по открытой лицензии lfm1.0 от Liquid.

Это не модель, созданная с нуля. В карточке она описана как мультимодальный вариант LFM2.5, развивающий более раннюю LFM2-VL-3B за счёт дополнительного промежуточного и финального обучения. Эта родословная имеет значение: визуальные навыки наслаиваются на текстовую модель, уже предобученную примерно на 34 триллионах токенов, так что языковая составляющая — не игрушка. Это тот же движок того же семейства, что используют текстовые модели, только с приваренным визуальным энкодером и переобученный под задачи зрения.

Что это умеет

Статья Liquid отмечает четыре улучшения по сравнению с предыдущей моделью LFM2-VL-3B: понимание экрана и пользовательского интерфейса, вызов функций, grounding и ввод нескольких изображений. Простыми словами, это означает:

• Grounding — указывайте на объекты с помощью запросов на естественном языке («знак „Стоп"», «колонка цен») и получайте нормализованное местоположение.

• Понимание экрана — ответы на вопросы о том, что и где находится на экране, проверено на ScreenSpot-v2.

• OCR с разметкой структуры — полностраничное OCR, которое также возвращает структуру документа, с 23 метками структуры (текст, заголовок, список, таблица, подпись к таблице, диаграмма, формула, код, верхние и нижние колонтитулы и другие) в виде нормализованных целочисленных координат.

• Использование инструментов — четырехэтапный поток вызова функций, который принимает определения инструментов в формате JSON, генерирует вызовы в стиле Python между токенами вызова инструментов и возвращает окончательный ответ в виде обычного текста.

• Ввод нескольких изображений — рассуждение по нескольким изображениям за один ход.

Собственные рекомендации Liquid относительно областей, где она не подходит, необычайно конкретны. Карточка рекомендует её для одношаговых задач с высокой пропускной способностью и низкой задержкой — обнаружение объектов в почти реальном времени в автомобильной отрасли, пакетное OCR-распознавание отсканированных документов, перевод меню и дорожных знаков на устройстве — и явно предостерегает от работы с длинным контекстом, требующей интенсивных рассуждений, визуального веб-дизайна и узкоспециализированных вопросов по техническим чертежам.

Цифры — все предоставлены вендором.

Все цифры в этом разделе взяты из собственной карточки модели и блога Liquid AI. Ни одна из них не была независимо воспроизведена, и пока третья сторона не запустит чекпоинт, вам следует считать это заявлениями, а не фактами. Такая пометка здесь не случайна, потому что на бумаге результаты действительно сильны:

• Grounding — RefCOCO macro precision@1 87.9, увеличившись с 57.1 на предыдущей LFM2-VL-3B — скачок примерно на тридцать пунктов, который Liquid приписывает пост-обучению на визуальных данных.

• Понимание экрана — средний результат ScreenSpot-v2 составляет 80,7, что, по данным Liquid, опережает 78,5, которые они приписывают Qwen3.5-4B.

• Использование инструментов — ToolSandbox 59.5, более чем вдвое больше показателя 26.4, полученного Liquid на LFM2-VL-3B; BFCLv4 32.5, по сравнению с 20.5.

• Общее визуальное рассуждение — MME 73.1, MMStar 63.3, RealWorldQA 73.1, MMMB 83.0, ChartQA 81.3, MathVista 68.5, POPE 88.7.

• OCR — OCRBenchv2 (англоязычная часть) 47.5, выросло с 43.9.

• Сложные мультимодальные рассуждения — MMMU Pro 30.5, BLINK 61.5, MuirBench 58.3 — самое слабое место, как и ожидалось для 3B-модели.

• Скорость, по данным производителя — 228 токенов/с на Apple M5 Max, 116 токенов/с на AMD Ryzen AI Max+ 395 и 20 токенов/с на Galaxy S26 Ultra, всё в пределах примерно 3,3 ГБ памяти. На H100 с vLLM Liquid заявляет около 11K выходных токенов/с при высокой степени параллелизма и время до первого токена примерно 34 мс на клипе из пяти кадров, что объясняется тем, что модель отвечает напрямую, а не рассуждает.

Scoreboard for LFM2.5-VL-3B with one column: Params 3.1B (2.6B LM + 400M vision), Context 32,768 tokens, Vision encoder SigLIP2 NaFlex 400M, Grounding RefCOCO 87.9, Screen understanding ScreenSpot-v2 80.7, Status no hosted endpoint yet. Footer: 'All benchmark figures vendor-reported; no independent scores yet.'

Это много заявлений для одной 3B-модели, и стоит повторить оговорку в нижней части карточки самой модели: это цифры Liquid. Разрыв между «хорошо показывает себя в лабораторных тестах» и «справляется с вашими данными» — это именно то место, где такая новая модель обычно спотыкается.

Что ещё неизвестно

Честный список открытых вопросов:

• Независимых бенчмарков нет — на момент написания LFM2.5-VL-3B не фигурирует ни в одном стороннем рейтинге. Все приведённые выше показатели предоставлены вендором.

• Нет размещенного эндпоинта — ни один провайдер инференса пока его не предоставляет. Это история о самохостинге, и точка.

• Нет данных об использовании — ноль загрузок в первый день означает, что нет отзывов сообщества, нет дообучений, нет сообщений вроде «я запустил это на X, и оно сломалось на Y». Первые отчёты из реального мира ещё впереди.

• Экспериментальная функция — вывод аннотации макета помечается самим Liquid как «экспериментальный» и «может измениться, может быть ненадёжным и может оказаться нетривиальным для разбора». Пока не стройте свой парсер на его основе.

• Скудное стороннее освещение — пресса первой недели в основном состоит из коротких новостных обзоров. Никто не провёл глубокого независимого теста.

Screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B, showing Image-Text-to-Text, license lfm1.0, 16 languages, 'This model isn't deployed by any Inference Provider', and 228 tok/s on Apple M5 Max / 116 tok/s on AMD Ryzen AI Max+ 395 in under 3.3 GB of memory.

Ничто из этого не означает, что модель плохая. Это означает лишь, что она непроверенная — как и любая модель в первые дни после выпуска.

Как запустить это самостоятельно

Для такой молодой модели экосистемная история на удивление хорошая. Варианты форматов вышли в тот же день, что и веса: GGUF для llama.cpp, ONNX и пять MLX-квантизаций для Apple Silicon, наряду с нативным bf16-чекпоинтом для Transformers, vLLM и SGLang. Liquid заявляет о поддержке с первого дня в llama.cpp, MLX, vLLM, SGLang и ONNX, плюс WebGPU-демо в браузере. Рекомендуемые параметры сэмплирования: температура 0.2, top_k 50, штраф за повторения 1.0, при этом обработка изображений выполняется через processor config модели. Если хотите опробовать её сегодня вечером на ноутбуке, сборки MLX или GGUF — самый короткий путь.

Что посмотреть

Две вещи определяют, имеет ли значение LFM2.5-VL-3B за пределами хайп-цикла. Во-первых, переживут ли цифры по привязке и пониманию экрана независимое воспроизведение — 80.7 на ScreenSpot-v2 и 87.9 на RefCOCO — это два утверждения, которые стоит проверить в первую очередь, поскольку именно они сделали бы эту модель по-настоящему прорывной для периферийных устройств. Во-вторых, появится ли размещённый эндпоинт, потому что это меняет расклад с «интересного проекта для самостоятельного хостинга» на «готовое к поставке сегодня». И именно тогда слой маршрутизации оправдывает своё существование: один API для 200+ моделей означает, что в тот день, когда Liquid или провайдер развернёт эндпоинт, вы добавляете LFM2.5-VL-3B рядом с моделями, которые уже вызываете, не меняя интеграцию, по прейскурантной цене провайдера без наценки, а автоматическое переключение при сбое позволяет направить на неё реальный трафик, пока проверенная модель покрывает вызовы, с которыми она не справляется. До тех пор это многообещающая история для самостоятельного хостинга — и для модели неделю от роду это уже больше, чем получают большинство релизов.

Screenshot of Liquid AI's announcement blog post 'LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge' dated Aug 12, 2026, showing the opening paragraphs and an evaluations table comparing LFM2.5-VL-3B with Gemma, InternVL, and Qwen models.
© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube