Karta tytułowa hero z nagłówkiem „Jeden decyduje, jeden opisuje” i podtytułem „Liquid AI d1-omni-600M vs LFM2.5-VL-3B – otwarte wagi, październik 2026”, oraz dwie karty: Liquid AI d1-omni-600M o 587M parametrów, zwracający etykietę lub wynik z 0 tokenami wyjściowymi, w przeciwieństwie do LFM2.5-VL-3B o 3,1B parametrów, który pisze tekst i czyta obrazy, aby zwracać tekst.
Guides & Insights

Liquid AI d1-omni-600M vs LFM2.5-VL-3B: Jeden decyduje, jeden opisuje

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Liquid AI d1-omni-600M i LFM2.5-VL-3B to oba małe, oba multimodalne modele, oba opublikowane przez to samo laboratorium na Hugging Face na tej samej licencji lfm1.0 — a zestawianie ich ze sobą to błąd kategorii, który okazuje się użyteczny. LFM2.5-VL-3B pojawił się 12 sierpnia 2026 jako model wizyjno-językowy Liquid AI do pracy na brzegu: 3,1 mld parametrów, okno 32 768 tokenów i wynik, który jest prozą. Podaj mu zeskanowaną stronę, a zwróci transkrypcję wraz z układem jako tekst. Liquid AI d1-omni-600M został przesłany 7 października 2026 wraz z resztą otwartej rodziny d1 i robi coś przeciwnego z tymi samymi danymi wejściowymi. To model decyzyjny o 587 mln parametrów: dołączasz nazwane pytania do stanu, a on raportuje to, co już uważa — P(tak), wybraną etykietę z poziomem ufności, pozycję na uporządkowanej skali od 2 do 10 — w pojedynczym przebiegu do przodu, z zerową liczbą tokenów wyjściowych i bez niczego do parsowania dalej. Jeśli szukałeś „małego multimodalnego modelu Liquid”, masz teraz przed sobą dwa kształty — a kształt to decyzja.

Ta strona przedstawia to, co faktycznie ustalają dwie karty modeli, wpis o wydaniu z 7 października oraz same repozytoria. Wyraźnie wskazuje też, gdzie się one kończą. Nic z tego porównania nie zostało odtworzone poza Liquid AI, a dla jednego z dwóch modeli dostawca nie opublikował w ogóle żadnego benchmarku dokładności dotyczącego konkretnie jego własnej flagowej możliwości.

Dwa punkty kontrolne, obok siebie

Karty specyfikacji różnią się niemal pod każdym względem, czego można by oczekiwać od dwóch modeli, które nigdy nie miały konkurować o to samo miejsce.

• Co to jest — LFM2.5-VL-3B to generatywny model językowo-wizyjny, który pisze tekst; Liquid AI d1-omni-600M to model decyzyjny, który zwraca ustrukturyzowane odpowiedzi i nie emituje żadnych tokenów

• Parametry — 3,1 mld w BF16 dla LFM2.5-VL-3B w porównaniu z 587 mln dla Liquid AI d1-omni-600M, który sam składa się ze współdzielonego trzonu i głowicy decyzyjnej o 381 mln parametrów oraz enkodera wizji o 94 mln i enkodera audio o 112 mln

• Backbone — LFM2.5-VL-3B łączy model językowy LFM2.5-2.6B z 400M enkoderem wizyjnym zoptymalizowanym pod SigLIP2 NaFlex; Liquid AI d1-omni-600M jest trenowany na bazie LFM2.5-Encoder-350M, dwukierunkowego enkodera, z wieżą SigLIP2 zaczerpniętą z LFM2.5-VL-450M oraz 17-warstwowym FastConformerem do audio

• Dane wejściowe — tekst i obrazy dla LFM2.5-VL-3B; tekst plus obrazy lub tekst plus do 30 sekund mowy dla Liquid AI d1-omni-600M, który zgłasza ValueError, jeśli obrazy i audio znajdą się w tym samym żądaniu

• Kontekst — 32 768 tokenów dla LFM2.5-VL-3B; 16 384 połączonych pozycji tekstu, obrazu i audio dla Liquid AI d1-omni-600M, którego karta dodaje, że gdy obecne są obrazy, tekst i pytanie są ograniczane do 896 tokenów, aby dopasować się do treningu

• Słownik — 128 000 tokenów dla LFM2.5-VL-3B, 65 536 dla Liquid AI d1-omni-600M

• Środowisko uruchomieniowe — LFM2.5-VL-3B działa w transformers i vLLM oraz ma oddzielny model roboczy DSpark do dekodowania spekulatywnego; Liquid AI d1-omni-600M dostarcza własny kod, wymaga trust_remote_code=True, a jego karta zaleca float16 na GPU, ostrzegając jednocześnie, że bfloat16 zmienił najlepszą odpowiedź w niektórych wierszach

• Licencja — lfm1.0 dla obu, która pozwala na dostrajanie i wdrażanie

Jeden wiersz na tej liście robi więcej niż cała reszta. Liquid AI d1-omni-600M opiera się na dwukierunkowym enkoderze, a nie na dekoderze. To nie jest zmniejszenie rozmiaru LFM2.5-VL-3B; to zupełnie inny rodowód — i to właśnie architektoniczny powód, dla którego tych dwóch modeli nie można zamieniać jeden na drugi, niezależnie od tego, jak czyta się tabele benchmarków.

Kontrakt wyjściowy rozstrzyga więcej niż benchmarki.

Zadaj modelowi LFM2.5-VL-3B pytanie o obraz, a otrzymasz odpowiedź w języku naturalnym. To jest warte pieniędzy, gdy odpowiedź musi zostać przeczytana przez człowieka, zapisana jako ciąg znaków lub przekazana do kroku, który oczekuje prozy. Jest to również ryzyko, które trzeba obejść inżyniersko: generowane dane wyjściowe mogą zbaczać, żądanie w formacie JSON może wrócić w innym kształcie niż zamówiono, a każdy token jest rozliczany i wymaga oczekiwania. Model jest wyraźnie przeznaczony do pracy wizyjnej w trybie pojedynczej tury, o wysokiej przepustowości i niskich opóźnieniach — wsadowego OCR skanowanych dokumentów, wykrywania w czasie rzeczywistym w pojeździe, tłumaczenia oznakowania na urządzeniu — i wyraźnie ukierunkowany z dala od pytań z długim kontekstem i wymagających intensywnego rozumowania, takich jak „co jest nie tak z tym schematem”.

Liquid AI d1-omni-600M odpowiada na ściśle węższe pytanie w ściśle bardziej niezawodnej otoczce. Jego interfejs to stan — tekst, JSON, jeden lub więcej obrazów albo do 30 sekund mowy — plus zestaw nazwanych pytań, z których każde deklaruje własny typ. Pytanie typu noul to pytanie tak/nie i zwraca P(tak) między 0 a 1. Pytanie typu choice wybiera jedną etykietę ze zbioru, który nazwiesz, i zwraca etykietę, pewność oraz prawdopodobieństwo każdej opcji. Pytanie typu score umieszcza stan na uporządkowanej skali od dwóch do dziesięciu poziomów i zwraca oczekiwany poziom wraz z jego rozkładem. Kilka pytań może być przypisanych do jednego stanu i są odczytywane w jednym przebiegu, więc licznik użycia w karcie modelu raportuje output_tokens: 0. Nie ma kroku generowania, co oznacza, że nie istnieje coś takiego jak wyjście, którego nie da się sparsować.

To, z czego rezygnujesz, to wszystko, co niesie wygenerowana odpowiedź, a czego nie zawiera etykieta: rozumowanie, zastrzeżenie, zdanie, które możesz wkleić do zgłoszenia, możliwość zadania pytania uzupełniającego w tej samej rozmowie. Liquid mówi to wprost — ten model nie jest modelem konwersacyjnym i nie pisze tekstu. Jeśli Twój potok potrzebuje wyjaśnienia obok werdyktu, Liquid AI d1-omni-600M to niewłaściwa połowa tej pary, a uczciwa odpowiedź brzmi: uruchom oba: LFM2.5-VL-3B do wygenerowania odczytu obrazu, Liquid AI d1-omni-600M do podjęcia decyzji na jego temat.

A two-column scoreboard for Liquid AI d1-omni-600M and LFM2.5-VL-3B showing the 600M at 587M parameters, output of label, score and 0 tokens, text plus image or audio input, no published vision benchmark, up to 30 seconds of speech and a 16,384-token context, against the 3B at 3.1B parameters, generated text output, text plus image input, RefCOCO 87.9 and OCRBench v2 47.5 on vision, no audio and a 32,768-token context, footed 'All figures vendor-reported by Liquid AI; none independently reproduced. October 2026.'

Nie ma bezpośredniego wyniku porównania widzenia i właśnie to jest wnioskiem

Instynktownym następnym krokiem jest zestawienie benchmarków wizyjnych. Nie da się. W przypadku LFM2.5-VL-3B dostawca publikuje pełny zestaw — RefCOCO Macro Precision@1 na poziomie 87,9, ScreenSpot-v2 na 80,7, ChartQA na 81,3, POPE na 88,7, MMStar na 63,3, BLINK na 61,5, MuirBench na 58,3, ToolSandBox na 59,5, OCRBench v2 English na 47,5 oraz RealWorldQA wynoszący 73,1, który nieznacznie przewyższa 71,1 poprzedniego LFM2-VL-3B. Wszystkie te wyniki są raportowane przez dostawcę, żadnego nie powtórzono niezależnie, a mimo to są to konkretne twierdzenia o konkretnych możliwościach, z których czytelnik może rozliczyć laboratorium.

W przypadku Liquid AI d1-omni-600M wpis o premierze mówi, że Decision Index v0.3 obejmuje prywatny podział wizyjny „o którym nie raportujemy w tym wydaniu”, a zamiast tego Liquid potwierdził, że checkpoint 600M „obsługuje wszystkie trzy modalności”, a dowody umieszczono w demach playgroundu. To cały opublikowany zapis dotyczący wizji. Nie ma liczby benchmarkowej dla obrazów dla tego checkpointu, ani w jego karcie modelu, ani w poście premierowym. Ten sam post jeszcze bardziej bezpośrednio potwierdza, czego brakuje po stronie audio: dedykowane benchmarki decyzyjne dla audio są, jak mówi sam dostawca, „obecnie otwartym problemem”.

Zatem prawidłowe odczytanie tego starcia jest asymetryczne i tak właśnie należy je przedstawić. LFM2.5-VL-3B wykazał zdolność widzenia popartą liczbami. Liquid AI d1-omni-600M ma enkoder wizyjny zapożyczony z modelu siostrzanego, adapter trenowany przy zamrożonym backbone'ie, demo i obietnicę. Jeśli Twoje wdrożenie wymaga, aby model miał rację co do obrazów w tym miesiącu, 3B jest jedynym z tej dwójki, który ma na czym się oprzeć.

Prędkość: tylko jedna z nich została zmierzona.

Ponieważ model decyzyjny nic nie generuje, liczy się opóźnienie, a tu znowu udokumentowana jest tylko jedna strona. LFM2.5-VL-3B jest podawany jako 228 tokenów na sekundę na Apple M5 Max i 116 tokenów na sekundę na AMD Ryzen AI Max+ 395, przy czym oba mieszczą się w 3,3 GB pamięci, z około 20 tokenami na sekundę na Galaxy S26 Ultra i mniej więcej 11 000 tokenów na sekundę na pojedynczym H100 pod vLLM. Te liczby opisują przepustowość dekodowania, która jest właściwym pomiarem dla modelu, który pisze.

W przypadku Liquid AI d1-omni-600M karta modelu stwierdza, że liczby dotyczące wnioskowania nie są podawane, ponieważ model jest wczesnym wydaniem badawczym i znajduje się w aktywnym rozwoju. Model siostrzany d1-3B w tej samej rodzinie ma tabele opóźnień — 8 ms dla jednego pytania na RTX 4090, 16 ms na Jetson AGX Thor, 26 ms na Jetson AGX Orin 64 GB, 50 ms na Orin Nano, przy czym trzy pytania w ramach jednego stanu zajmują około 1,3 razy tyle czasu co jedno. Te liczby należą do modelu decyzyjnego 3B i nie wolno ich przenosić na model 600M. W przypadku Liquid AI d1-omni-600M uczciwe stanowisko jest takie, że architektura sugeruje mały, szybki model, a nikt spoza laboratorium nie opublikował wartości w milisekundach.

Ślad pamięciowy wag można przynajmniej oszacować. Przy precyzji float16 zalecanej przez kartę modelu 587M parametrów to około 1,2 GB wag przed aktywacjami — wyliczenie na podstawie opublikowanej liczby parametrów, nie zaś pomiar dostawcy — w zestawieniu z poniżej 3,3 GB, które Liquid podaje dla LFM2.5-VL-3B. Na urządzeniu, gdzie ograniczeniem są megabajty, ta różnica jest argumentem za 600M.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as released that day, d1-3B's 48.57 Decision Index v0.2.1 score, and its 8 ms, 16 ms and 26 ms latencies on an RTX 4090, a Jetson AGX Thor and a Jetson AGX Orin.

Jak wybrać między nimi

Wybór ten rozstrzyga się bezproblemowo, gdy kontrakt wyjściowy uzna się za stały, a nie za podlegający negocjacjom.

Sięgaj po LFM2.5-VL-3B, gdy wynikiem ma być tekst: OCR całej strony z adnotacją układu, grounding i detekcja na podstawie zapytań w języku naturalnym, tłumaczenie oznaczeń na urządzeniu — każdy krok, w którym człowiek lub dalszy model językowy wykorzystuje odpowiedź. Ma także szerszy kontekst wynoszący 32 768 tokenów oraz w praktyce głębszy język, ponieważ jego odpowiedzi to język, a nie etykiety.

Sięgnij po Liquid AI d1-omni-600M gdy rezultatem jest decyzja: kierowanie zgłoszenia, segregowanie klatki, moderowanie klipu, bramkowanie zabezpieczenia, ocenianie odpowiedzi w skali od dwóch do dziesięciu — i, co wyróżnia go spośród tych dwóch, gdy dane wejściowe to mowa. Jest jedynym z tej pary, który w ogóle przyjmuje audio, do 30 sekund na żądanie, choć jego karta zauważa, że audio było trenowane na wymianach między osobą mówiącą po angielsku a asystentem, co jest wąskim opisem świata, z którego będą pochodzić twoje wywołania.

Nie sięgaj po żaden z nich i pozostań przy ogólnym modelu językowo-wizualnym, jeśli zadanie wymaga rozumowania na temat obrazu, a nie tylko jego odczytania lub wydania o nim werdyktu. Karty obu modeli wskazują, że nie są przeznaczone do tego zastosowania, a Liquid AI d1-omni-600M nie ma mechanizmu, by tego spróbować.

Próbowanie eksperymentalnego checkpointu bez stawiania na nim całego pipeline’u

Liquid AI d1-omni-600M to, zgodnie z etykietą samego dostawcy, wczesne wydanie badawcze, a jego zachowanie w zakresie wizji i dźwięku nie zostało poddane benchmarkom. To dokładnie profil modelu, który chcesz oceniać za mechanizmem awaryjnym, a nie przed klientami. OrcaRouter kieruje ponad 200 modeli przez jeden klucz API z automatycznym przełączaniem awaryjnym między dostawcami, co jest tanim sposobem umieszczenia takiego checkpointu na ścieżce produkcyjnej: jeśli eksperymentalna trasa ulegnie degradacji lub dostawca przestanie działać, żądanie trafi do mechanizmu awaryjnego bez zmiany kodu. Ten sam klucz obsługuje każdy model, któremu pipeline przekazuje zadania, w cenie katalogowej każdego dostawcy przekazanej z 0% marży, więc obniżka ceny przez dostawcę to twoja cena jeszcze tego samego dnia.

Jedno zastrzeżenie — podaję je, bo ma istotne znaczenie: otwarte modele d1 i rodzina LFM2.5-VL nie znajdują się dziś w naszym katalogu. Samodzielne hostowanie wag to droga, którą dostawca zaleca w obu przypadkach, ze wsparciem llama.cpp od pierwszego dnia na sprzęcie Apple, AMD, Qualcomm i NVIDIA, a uruchamianie ich na hostowanym punkcie końcowym oznacza własne API dostawcy lub platformy firm trzecich. Odczytanie tej strony jako zapewnienia o dostępności byłoby błędem.

A capture of Liquid AI's documentation site showing the left navigation (Liquid Foundation Models with Text, Vision, Audio, Decision Models and Liquid Nanos entries, plus Fine-tuning, Edge Inference and llama.cpp), the 'New: Open d1' banner, and the opening description of Liquid Foundation Models as a class of multimodal architectures built for fast inference and on-device deployment.

Co obejrzeć

Ciekawe pytanie nie dotyczy tego, czy 600M ostatecznie pokona 3B w czymkolwiek — nie pokona i nie został do tego stworzony. Chodzi o to, czy Liquid AI opublikuje prywatny podział wizyjny, który zatrzymała, i czy ktokolwiek zbuduje benchmark podejmowania decyzji na podstawie dźwięku, o którym laboratorium mówi, że jeszcze nie istnieje. Dopóki któreś z nich nie nastąpi, porównanie między Liquid AI d1-omni-600M a LFM2.5-VL-3B jest porównaniem między modelem zmierzonym a modelem wiarygodnym. W przypadku niezmierzonego zadania — mowa na wejściu, werdykt na wyjściu — 600M, wystarczająco mały, by zmieścić się na urządzeniu, jest jedynym checkpointem z otwartymi wagami w tej rodzinie, który tego próbuje, a bycie pierwszym bez tablicy wyników to wciąż bycie pierwszym.

OrcaRouter kieruje ponad 200 modelami przez jeden klucz API, a cena katalogowa każdego dostawcy jest przekazywana dalej z 0% marży, więc obniżka ceny u dostawcy staje się Twoją ceną jeszcze tego samego dnia.