
LFM2.5-VL-3B: Nowy model wizyjno-językowy Liquid AI z 3B parametrami dla urządzeń brzegowych
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianNOWOŚĆQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
Pierwszą rzeczą, jaką należy wiedzieć o LFM2.5-VL-3B, jest to, że jego premiera odbyła się w dwóch półkrokach. Wagi pojawiły się na Hugging Face 11 sierpnia 2026 roku — pełny checkpoint w formacie bf16, karta modelu z tabelą benchmarków i README w szesnastu językach, bez żadnego ogłoszenia. Na karcie widniało zero pobrań. Następnego dnia, 12 sierpnia, firma Liquid AI opublikowała oficjalny artykuł „LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge" i cicha premiera stała się oficjalną. Jeśli czytasz to w tym samym tygodniu, czytasz jeden z najwcześniejszych niezależnych opisów modelu, którego poza laboratorium Liquid prawie nikt jeszcze nie uruchomił — więc oto, co faktycznie da się wyczytać z repozytorium, a czego nie.
Czym jest LFM2.5-VL-3B
LFM2.5-VL-3B to model wizyjno-językowy — obraz i tekst na wejściu, tekst na wyjściu — zbudowany na tekście bazowym LFM2.5 firmy Liquid AI. Konkretnie: model językowy to LFM2.5-2.6B, połączony z enkoderem wizyjnym SigLIP2 NaFlex 400M, co daje łącznie około 3,1 miliarda parametrów. Zachowuje hybrydową architekturę rodziny: bloki splotowe z bramkowaniem krótkiego zasięgu przeplatane grouped-query attention, słownik 128 000 tokenów i okno kontekstowe 32 768 tokenów. Obsługuje szesnaście języków (angielski, arabski, chiński, francuski, niemiecki, hindi, indonezyjski, włoski, japoński, koreański, polski, portugalski, rosyjski, hiszpański, tajski, wietnamski), jest udostępniany w formacie bfloat16 i objęty otwartą licencją lfm1.0 firmy Liquid.
To nie jest model stworzony od zera. Karta opisuje go jako multimodalny wariant LFM2.5, który rozwija wcześniejszy LFM2-VL-3B o dalszy trening pośredni i końcowy. Ten rodowód ma znaczenie: umiejętności wizyjne są nałożone na model tekstowy, który został już wstępnie wytrenowany na około 34 bilionach tokenów, więc strona językowa to nie zabawka — to ten sam silnik rodziny, z którego korzystają modele tekstowe, z dobudowanym enkoderem wizyjnym i przetrenowany do pracy wizyjnej.
Co potrafi
Opis Liquid wymienia cztery ulepszenia względem poprzedniego modelu LFM2-VL-3B: rozumienie ekranu i interfejsu użytkownika, wywoływanie funkcji, grounding oraz obsługę wielu obrazów na wejściu. Mówiąc wprost, oznacza to:
• Grounding — wskazywanie obiektów za pomocą zapytań w języku naturalnym („znak stopu", „kolumna ceny") i uzyskiwanie znormalizowanej lokalizacji.
• Rozumienie ekranu — odpowiadanie na pytania o to, co jest na ekranie i gdzie, oceniane na ScreenSpot-v2.
• OCR z adnotacją układu — OCR całej strony, który zwraca również strukturę dokumentu, z 23 etykietami układu (tekst, tytuł, lista, tabela, podpis tabeli, wykres, równanie, kod, nagłówki i stopki stron oraz inne) jako znormalizowane współrzędne całkowite.
Korzystanie z narzędzi — czteroetapowy przepływ wywoływania funkcji, który przyjmuje definicje narzędzi w formacie JSON, emituje wywołania w stylu Pythona między tokenami wywołań narzędzi i zwraca ostateczną odpowiedź w postaci zwykłego tekstu.
• Wejście wieloobrazowe — rozumowanie na podstawie kilku obrazów w jednej turze.
Własne wytyczne Liquid dotyczące tego, gdzie model nie znajduje zastosowania, są niezwykle konkretne. Karta zaleca go do zadań jednoturowych, o wysokiej przepustowości i niskim opóźnieniu — wykrywania obiektów w czasie zbliżonym do rzeczywistego w motoryzacji, wsadowego OCR skanowanych dokumentów, tłumaczenia menu i znaków drogowych na urządzeniu — oraz wyraźnie ostrzega przed pracą wymagającą intensywnego rozumowania w długich kontekstach, wizualnym projektowaniem stron internetowych i wysoce technicznymi pytaniami o plany techniczne.
Liczby — wszystkie raportowane przez producenta
Każda liczba w tej sekcji pochodzi z własnej karty modelu i wpisu na blogu Liquid AI. Żadna z nich nie została niezależnie zweryfikowana, dopóki strona trzecia nie uruchomi punktu kontrolnego, należy traktować je jako twierdzenia, a nie fakty. Ta etykieta robi tu naprawdę dobrą robotę, ponieważ na papierze wyniki są naprawdę mocne:
• Grounding — makro precision@1 w RefCOCO na poziomie 87,9, wobec 57,1 w poprzednim LFM2-VL-3B — skok o około trzydzieści punktów, który Liquid przypisuje post-trainingowi wizyjnemu.
• Rozumienie ekranu — średnia ScreenSpot-v2 wynosząca 80,7, którą Liquid raportuje jako wyższą od 78,5 przypisywanych modelowi Qwen3.5-4B.
• Korzystanie z narzędzi — ToolSandbox 59.5, ponad dwukrotnie więcej niż 26.4 zmierzone przez Liquid na LFM2-VL-3B; BFCLv4 32.5, wzrost z 20.5.
• Ogólne rozumowanie wizualne — MME 73.1, MMStar 63.3, RealWorldQA 73.1, MMMB 83.0, ChartQA 81.3, MathVista 68.5, POPE 88.7.
• OCR — OCRBenchv2 (podzbiór angielski) 47,5, wzrost z 43,9.
• Trudne rozumowanie multimodalne — MMMU Pro 30.5, BLINK 61.5, MuirBench 58.3 — słabszy obszar, co było do przewidzenia dla modelu 3B.
• Szybkość, testowana przez dostawcę — 228 tokenów/s na Apple M5 Max, 116 tokenów/s na AMD Ryzen AI Max+ 395 i 20 tokenów/s na Galaxy S26 Ultra, wszystko w ramach około 3,3 GB pamięci. Na H100 z vLLM, Liquid twierdzi, że osiąga około 11 tys. tokenów wyjściowych/s przy wysokiej współbieżności oraz czas do pierwszego tokenu wynoszący około 34 ms na pięcioklatkowym klipie, co przypisuje temu, że model odpowiada bezpośrednio zamiast rozumować.

To wiele roszczeń jak na jeden model 3B, i warto powtórzyć zastrzeżenie w stopce karty samego modelu: to liczby Liquid. Przepaść między „dobrze wypada w ewaluacji laboratoryjnej” a „sprawdza się na twoich danych” to właśnie miejsce, gdzie tak nowy model zwykle się potyka.
Czego jeszcze nie wiadomo
Uczciwa lista otwartych pytań:
• Brak niezależnego benchmarku — w chwili pisania tego tekstu LFM2.5-VL-3B nie pojawia się na żadnej zewnętrznej liście rankingowej. Każdy powyższy wynik jest raportowany przez dostawcę.
• Brak hostowanego punktu końcowego — żaden dostawca wnioskowania jeszcze go nie udostępnia. To historia self-hostingu, kropka.
• Brak danych o użytkowaniu — zero pobrań w pierwszym dniu oznacza brak feedbacku od społeczności, brak fine-tuningu, brak „uruchomiłem to na X i wyłożyło się na Y”. Pierwsze raporty z rzeczywistego świata są jeszcze przed nami.
• Funkcja eksperymentalna — wynik adnotacji układu jest przez samo Liquid oznaczony jako „eksperymentalny” i „może się zmienić, może być zawodny i może nie być łatwy do sparsowania”. Nie buduj jeszcze na nim swojego parsera.
• Skąpe relacje zewnętrzne — prasa z pierwszego tygodnia to głównie krótkie przeglądy wiadomości. Nikt nie przeprowadził dogłębnego niezależnego testu.

Nic z tego nie oznacza, że model jest zły. Oznacza to, że jest niesprawdzony w taki sposób, w jaki każdy model jest niesprawdzony w dniach po premierze.
Jak uruchomić to samemu
Jak na tak młody model, historia ekosystemu jest wyjątkowo dobra. Warianty formatów pojawiły się tego samego dnia co wagi: GGUF dla llama.cpp, ONNX i pięć kwantyzacji MLX dla Apple Silicon, obok natywnego checkpointu bf16 dla Transformers, vLLM i SGLang. Liquid podaje wsparcie od pierwszego dnia dla llama.cpp, MLX, vLLM, SGLang i ONNX, a także przeglądarkowe demo WebGPU. Zalecane parametry próbkowania to temperatura 0,2, top_k 50, kara powtórzeń 1,0, a obsługą widzenia zajmuje się konfiguracja procesora modelu. Jeśli chcesz wypróbować go dziś wieczorem na laptopie, wersje MLX lub GGUF są najkrótszą drogą.
Co obejrzeć
Dwie rzeczy decydują o tym, czy LFM2.5-VL-3B to coś więcej niż tylko hype. Po pierwsze, czy wyniki w grounding i rozumieniu ekranów przetrwają próbę niezależnego odtworzenia — 80,7 na ScreenSpot-v2 i 87,9 na RefCOCO to dwa wyniki, które najbardziej warto sprawdzić, bo to one czyniłyby go naprawdę przełomowym modelem brzegowym. Po drugie, czy pojawi się hostowany endpoint, bo to zmienia kalkulację z „ciekawego projektu do samodzielnego hostowania" na „gotowy do wdrożenia od ręki". I właśnie wtedy warstwa routingu pokazuje swoją wartość: jedno API dla ponad 200 modeli oznacza, że gdy Liquid lub dostawca uruchomi endpoint, dodajesz LFM2.5-VL-3B obok modeli, które już wywołujesz, bez zmiany integracji, po cenie katalogowej dostawcy i z zerową marżą, a automatyczny failover pozwala skierować na niego prawdziwy ruch, podczas gdy sprawdzony model przejmuje wywołania, z którymi sobie nie radzi. Do tego czasu to obiecująca historia self-hostingu — a jak na model, który ma tydzień, to już więcej, niż dostaje większość wydań.

