Karta tytułowa hero dla LFM2.5-VL-3B z nagłówkiem „LFM2.5-VL-3B” i podtytułem „Model wizyjno-językowy 3B od Liquid AI dla urządzeń brzegowych”, znacznikiem „Nowość — dostępny od 11 sierpnia 2026” oraz trzema płaskimi ikonami liniowymi (ramka obrazu, akapit, oko).
Guides & Insights

LFM2.5-VL-3B: Nowy model wizyjno-językowy Liquid AI z 3B parametrami dla urządzeń brzegowych

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Pierwszą rzeczą, jaką należy wiedzieć o LFM2.5-VL-3B, jest to, że jego premiera odbyła się w dwóch półkrokach. Wagi pojawiły się na Hugging Face 11 sierpnia 2026 roku — pełny checkpoint w formacie bf16, karta modelu z tabelą benchmarków i README w szesnastu językach, bez żadnego ogłoszenia. Na karcie widniało zero pobrań. Następnego dnia, 12 sierpnia, firma Liquid AI opublikowała oficjalny artykuł „LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge" i cicha premiera stała się oficjalną. Jeśli czytasz to w tym samym tygodniu, czytasz jeden z najwcześniejszych niezależnych opisów modelu, którego poza laboratorium Liquid prawie nikt jeszcze nie uruchomił — więc oto, co faktycznie da się wyczytać z repozytorium, a czego nie.

Czym jest LFM2.5-VL-3B

LFM2.5-VL-3B to model wizyjno-językowy — obraz i tekst na wejściu, tekst na wyjściu — zbudowany na tekście bazowym LFM2.5 firmy Liquid AI. Konkretnie: model językowy to LFM2.5-2.6B, połączony z enkoderem wizyjnym SigLIP2 NaFlex 400M, co daje łącznie około 3,1 miliarda parametrów. Zachowuje hybrydową architekturę rodziny: bloki splotowe z bramkowaniem krótkiego zasięgu przeplatane grouped-query attention, słownik 128 000 tokenów i okno kontekstowe 32 768 tokenów. Obsługuje szesnaście języków (angielski, arabski, chiński, francuski, niemiecki, hindi, indonezyjski, włoski, japoński, koreański, polski, portugalski, rosyjski, hiszpański, tajski, wietnamski), jest udostępniany w formacie bfloat16 i objęty otwartą licencją lfm1.0 firmy Liquid.

To nie jest model stworzony od zera. Karta opisuje go jako multimodalny wariant LFM2.5, który rozwija wcześniejszy LFM2-VL-3B o dalszy trening pośredni i końcowy. Ten rodowód ma znaczenie: umiejętności wizyjne są nałożone na model tekstowy, który został już wstępnie wytrenowany na około 34 bilionach tokenów, więc strona językowa to nie zabawka — to ten sam silnik rodziny, z którego korzystają modele tekstowe, z dobudowanym enkoderem wizyjnym i przetrenowany do pracy wizyjnej.

Co potrafi

Opis Liquid wymienia cztery ulepszenia względem poprzedniego modelu LFM2-VL-3B: rozumienie ekranu i interfejsu użytkownika, wywoływanie funkcji, grounding oraz obsługę wielu obrazów na wejściu. Mówiąc wprost, oznacza to:

• Grounding — wskazywanie obiektów za pomocą zapytań w języku naturalnym („znak stopu", „kolumna ceny") i uzyskiwanie znormalizowanej lokalizacji.

• Rozumienie ekranu — odpowiadanie na pytania o to, co jest na ekranie i gdzie, oceniane na ScreenSpot-v2.

• OCR z adnotacją układu — OCR całej strony, który zwraca również strukturę dokumentu, z 23 etykietami układu (tekst, tytuł, lista, tabela, podpis tabeli, wykres, równanie, kod, nagłówki i stopki stron oraz inne) jako znormalizowane współrzędne całkowite.

Korzystanie z narzędzi — czteroetapowy przepływ wywoływania funkcji, który przyjmuje definicje narzędzi w formacie JSON, emituje wywołania w stylu Pythona między tokenami wywołań narzędzi i zwraca ostateczną odpowiedź w postaci zwykłego tekstu.

• Wejście wieloobrazowe — rozumowanie na podstawie kilku obrazów w jednej turze.

Własne wytyczne Liquid dotyczące tego, gdzie model nie znajduje zastosowania, są niezwykle konkretne. Karta zaleca go do zadań jednoturowych, o wysokiej przepustowości i niskim opóźnieniu — wykrywania obiektów w czasie zbliżonym do rzeczywistego w motoryzacji, wsadowego OCR skanowanych dokumentów, tłumaczenia menu i znaków drogowych na urządzeniu — oraz wyraźnie ostrzega przed pracą wymagającą intensywnego rozumowania w długich kontekstach, wizualnym projektowaniem stron internetowych i wysoce technicznymi pytaniami o plany techniczne.

Liczby — wszystkie raportowane przez producenta

Każda liczba w tej sekcji pochodzi z własnej karty modelu i wpisu na blogu Liquid AI. Żadna z nich nie została niezależnie zweryfikowana, dopóki strona trzecia nie uruchomi punktu kontrolnego, należy traktować je jako twierdzenia, a nie fakty. Ta etykieta robi tu naprawdę dobrą robotę, ponieważ na papierze wyniki są naprawdę mocne:

• Grounding — makro precision@1 w RefCOCO na poziomie 87,9, wobec 57,1 w poprzednim LFM2-VL-3B — skok o około trzydzieści punktów, który Liquid przypisuje post-trainingowi wizyjnemu.

• Rozumienie ekranu — średnia ScreenSpot-v2 wynosząca 80,7, którą Liquid raportuje jako wyższą od 78,5 przypisywanych modelowi Qwen3.5-4B.

• Korzystanie z narzędzi — ToolSandbox 59.5, ponad dwukrotnie więcej niż 26.4 zmierzone przez Liquid na LFM2-VL-3B; BFCLv4 32.5, wzrost z 20.5.

• Ogólne rozumowanie wizualne — MME 73.1, MMStar 63.3, RealWorldQA 73.1, MMMB 83.0, ChartQA 81.3, MathVista 68.5, POPE 88.7.

• OCR — OCRBenchv2 (podzbiór angielski) 47,5, wzrost z 43,9.

• Trudne rozumowanie multimodalne — MMMU Pro 30.5, BLINK 61.5, MuirBench 58.3 — słabszy obszar, co było do przewidzenia dla modelu 3B.

• Szybkość, testowana przez dostawcę — 228 tokenów/s na Apple M5 Max, 116 tokenów/s na AMD Ryzen AI Max+ 395 i 20 tokenów/s na Galaxy S26 Ultra, wszystko w ramach około 3,3 GB pamięci. Na H100 z vLLM, Liquid twierdzi, że osiąga około 11 tys. tokenów wyjściowych/s przy wysokiej współbieżności oraz czas do pierwszego tokenu wynoszący około 34 ms na pięcioklatkowym klipie, co przypisuje temu, że model odpowiada bezpośrednio zamiast rozumować.

Scoreboard for LFM2.5-VL-3B with one column: Params 3.1B (2.6B LM + 400M vision), Context 32,768 tokens, Vision encoder SigLIP2 NaFlex 400M, Grounding RefCOCO 87.9, Screen understanding ScreenSpot-v2 80.7, Status no hosted endpoint yet. Footer: 'All benchmark figures vendor-reported; no independent scores yet.'

To wiele roszczeń jak na jeden model 3B, i warto powtórzyć zastrzeżenie w stopce karty samego modelu: to liczby Liquid. Przepaść między „dobrze wypada w ewaluacji laboratoryjnej” a „sprawdza się na twoich danych” to właśnie miejsce, gdzie tak nowy model zwykle się potyka.

Czego jeszcze nie wiadomo

Uczciwa lista otwartych pytań:

• Brak niezależnego benchmarku — w chwili pisania tego tekstu LFM2.5-VL-3B nie pojawia się na żadnej zewnętrznej liście rankingowej. Każdy powyższy wynik jest raportowany przez dostawcę.

• Brak hostowanego punktu końcowego — żaden dostawca wnioskowania jeszcze go nie udostępnia. To historia self-hostingu, kropka.

• Brak danych o użytkowaniu — zero pobrań w pierwszym dniu oznacza brak feedbacku od społeczności, brak fine-tuningu, brak „uruchomiłem to na X i wyłożyło się na Y”. Pierwsze raporty z rzeczywistego świata są jeszcze przed nami.

• Funkcja eksperymentalna — wynik adnotacji układu jest przez samo Liquid oznaczony jako „eksperymentalny” i „może się zmienić, może być zawodny i może nie być łatwy do sparsowania”. Nie buduj jeszcze na nim swojego parsera.

• Skąpe relacje zewnętrzne — prasa z pierwszego tygodnia to głównie krótkie przeglądy wiadomości. Nikt nie przeprowadził dogłębnego niezależnego testu.

Screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B, showing Image-Text-to-Text, license lfm1.0, 16 languages, 'This model isn't deployed by any Inference Provider', and 228 tok/s on Apple M5 Max / 116 tok/s on AMD Ryzen AI Max+ 395 in under 3.3 GB of memory.

Nic z tego nie oznacza, że model jest zły. Oznacza to, że jest niesprawdzony w taki sposób, w jaki każdy model jest niesprawdzony w dniach po premierze.

Jak uruchomić to samemu

Jak na tak młody model, historia ekosystemu jest wyjątkowo dobra. Warianty formatów pojawiły się tego samego dnia co wagi: GGUF dla llama.cpp, ONNX i pięć kwantyzacji MLX dla Apple Silicon, obok natywnego checkpointu bf16 dla Transformers, vLLM i SGLang. Liquid podaje wsparcie od pierwszego dnia dla llama.cpp, MLX, vLLM, SGLang i ONNX, a także przeglądarkowe demo WebGPU. Zalecane parametry próbkowania to temperatura 0,2, top_k 50, kara powtórzeń 1,0, a obsługą widzenia zajmuje się konfiguracja procesora modelu. Jeśli chcesz wypróbować go dziś wieczorem na laptopie, wersje MLX lub GGUF są najkrótszą drogą.

Co obejrzeć

Dwie rzeczy decydują o tym, czy LFM2.5-VL-3B to coś więcej niż tylko hype. Po pierwsze, czy wyniki w grounding i rozumieniu ekranów przetrwają próbę niezależnego odtworzenia — 80,7 na ScreenSpot-v2 i 87,9 na RefCOCO to dwa wyniki, które najbardziej warto sprawdzić, bo to one czyniłyby go naprawdę przełomowym modelem brzegowym. Po drugie, czy pojawi się hostowany endpoint, bo to zmienia kalkulację z „ciekawego projektu do samodzielnego hostowania" na „gotowy do wdrożenia od ręki". I właśnie wtedy warstwa routingu pokazuje swoją wartość: jedno API dla ponad 200 modeli oznacza, że gdy Liquid lub dostawca uruchomi endpoint, dodajesz LFM2.5-VL-3B obok modeli, które już wywołujesz, bez zmiany integracji, po cenie katalogowej dostawcy i z zerową marżą, a automatyczny failover pozwala skierować na niego prawdziwy ruch, podczas gdy sprawdzony model przejmuje wywołania, z którymi sobie nie radzi. Do tego czasu to obiecująca historia self-hostingu — a jak na model, który ma tydzień, to już więcej, niż dostaje większość wydań.

Screenshot of Liquid AI's announcement blog post 'LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge' dated Aug 12, 2026, showing the opening paragraphs and an evaluations table comparing LFM2.5-VL-3B with Gemma, InternVL, and Qwen models.
© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube