Karta tytułowa hero dla modeli decyzyjnych Liquid AI o otwartych wagach, z nagłówkiem „Dwa modele, które nigdy nie zapisują ani słowa” i podtytułem „Liquid AI d1-3B i d1-omni-600M, otwarte wagi, 7 października 2026”, trzy chipy oznaczone tak/nie, wybierz etykietę i oceń w skali, oraz diagram jednego stanu wchodzącego w pojedynczy forward pass, który zwraca prawdopodobieństwo, etykietę i wynik.
Guides & Insights

Liquid AI d1-3B i d1-omni-600M: otwarte wagi dla modeli, które nigdy nie napiszą ani słowa

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Liquid AI d1-3B i Liquid AI d1-omni-600M pojawiły się na Hugging Face 7 października 2026, a oba checkpointy mają właściwość, która sprawia, że każda tabela porównawcza, jaką przeczytałeś w tym roku, ma niewłaściwy kształt. Żaden z nich nie generuje tekstu. Podajesz Liquid AI d1-3B stan — zgłoszenie do wsparcia, dane JSON, zdjęcie albo wszystkie trzy naraz — oraz zestaw nazwanych pytań, a on zwraca odpowiedzi wzięte wprost z rozkładu modelu dla twoich opcji. Tak/nie jako prawdopodobieństwo. Wybór spośród etykiet z pewnością i pełnym wektorem prawdopodobieństw. Pozycję na uporządkowanej skali. Nie ma etapu próbkowania, nie ma JSON-a do parsowania, nie ma niekontrolowanego generowania, a własny licznik użycia dostawcy podaje to wprost: output_tokens: 0. Model 3B to gwiazda — uzyskuje 48,57 w Decision Index 0.2.1 ocenianym przez dostawcę, wyprzedzając wszystko poniżej 10B i model decyzyjny dwunastokrotnie większy od siebie. To bliźniak 600M jest tym, którego warto obserwować: odczytuje obrazy i do trzydziestu sekund mowy za pomocą tych samych wag trzonu, i jest oznaczony jako wczesne wydanie badawcze.

Czym jest model decyzyjny, w jednym akapicie

Ta kategoria buduje się od roku pod nazwami takimi jak modele systemu pierwszego i klasyfikatory, które nie są klasyfikatorami, a para d1 jest jak dotąd jej najczystszym sformułowaniem. Model generatywny dostaje pytanie i pisze odpowiedź; odpowiedź trzeba sparsować, parsowanie może się nie udać, a każdy zapisany token kosztuje cię pieniądze i czas. Model decyzyjny dostaje pytanie i podaje to, co już uważa za prawdę. Pytania Liquid dzielą się na trzy typy. noul to pytanie tak/nie, na które odpowiada się wartością P(tak) z przedziału od 0 do 1. choice wybiera jedną etykietę z nazwanego zbioru i zwraca etykietę, poziom pewności oraz prawdopodobieństwo każdej opcji. score umieszcza stan na uporządkowanej skali od dwóch do dziesięciu poziomów i zwraca oczekiwany poziom wraz z jego rozkładem i legendą. Jeden stan może zawierać kilka pytań jednocześnie, a stan i jego obrazy są odczytywane raz dla wszystkich tych pytań.

Ta ostatnia właściwość to całe uzasadnienie biznesowe. Trzy pytania dotyczące jednego zgłoszenia kosztują 1,3× czasu jednego pytania, a nie 3×, ponieważ model wykonuje jedno przejście w przód przez dane wejściowe i odczytuje z niego kilka odpowiedzi. Nie ma nic do napisania, więc nie ma nic do napisania źle.

3B i 600M są budowane z przeciwnych kierunków

To jest miejsce, w którym to wydanie staje się technicznie interesujące — i to część, którą relacje z premiery w większości pominęły. Te dwa modele nie mają wspólnego rodowodu.

Liquid AI d1-3B wywodzi się z LFM2.5-VL-3B, modelu wizyjno-językowego producenta opartego wyłącznie na dekoderze. Ma 3,12 mld parametrów, 400-milionowy enkoder wizyjny SigLIP2 NaFlex zoptymalizowany pod kątem kształtu, okno kontekstowe o rozmiarze 32 768 tokenów, słownik o rozmiarze 128 000 tokenów oraz szesnaście udokumentowanych języków. Aby go zbudować, Liquid uśredniła wagi LFM2.5-2.6B i tekstowego szkieletu LFM2.5-VL-3B — dostrojonych checkpointów z kilku losowych ziaren i mieszanek danych — a następnie ponownie scaliła wyniki. Własne podsumowanie producenta na temat tego, co miało znaczenie, jest orzeźwiająco pozbawione poloru: trening na długich danych wejściowych, tasowanie kolejności opcji odpowiedzi i tropienie skrótów w danych treningowych zrobiły więcej dla końcowego wyniku niż jakakolwiek zaawansowana technika.

Liquid AI d1-omni-600M wywodzi się z LFM2.5-Encoder-350M, dwukierunkowego enkodera — zupełnie innego gatunku sieci. Liczy łącznie 587 mln parametrów podzielonych na 381-milionowy wspólny trzon i głowicę decyzyjną, 94-milionowy enkoder wizyjny zapożyczony z LFM2.5-VL-450M oraz 112-milionowy enkoder audio zbudowany z 17-warstwowego FastConformer. Każda modalność przechodzi przez te same wagi trzonu. Jego kontekst to 16 384 tokeny obejmujące łącznie pozycje tekstu, obrazu i dźwięku, a gdy dołączone są obrazy, tekst stanu i pytania jest skracany do 896 tokenów, ponieważ właśnie na tym został wytrenowany. W przypadku dźwięku karta podaje jedno ostrzeżenie bez ogródek: funkcję wytrenowano na żądaniach między osobą mówiącą po angielsku a asystentem, a klipy są przycinane do trzydziestu sekund.

Ta rodzina to więc nie jeden model w dwóch rozmiarach. To dekoder i enkoder, dotrenowane do wykonywania tej samej pracy za pomocą dwóch całkowicie różnych mechanizmów, z których jeden widzi, a drugi słyszy.

A two-column scoreboard for Liquid AI d1-3B and d1-omni-600M showing d1-3B at Decision Index 48.57 with 3.12B parameters, text and image input and 8 ms per question on an RTX 4090, against d1-omni-600M at 15.95 with 587M parameters, text, image and audio input and no reported latency, footed 'All figures vendor-reported by Liquid AI, Oct 7 2026; no independent reproduction.'

Liczby i do kogo należą

Każda liczba w tej sekcji pochodzi od samego Liquid. Wiersze Decision Index dla modeli d1 zostały ocenione przez dostawcę przy użyciu oficjalnego skorera — nie zgłoszono ich do rankingu — natomiast każdy konkurencyjny wiersz pochodzi z publicznego rankingu w wersji v0.2.1. Żadne niezależne laboratorium nie odtworzyło jeszcze żadnego z tych wyników, a w chwili pisania tego tekstu modele mają dwa dni.

• Decision Index 0.2.1 — Liquid AI d1-3B uzyskuje wynik 48,57, z wynikami cząstkowymi: Wiedza 23,8, Język 56,4, Wyszukiwanie 52,8, Narzędzia 74,5 i Sztuka 36,3. Liquid AI d1-omni-600M uzyskuje wynik 15,95, przy czym Narzędzia wynoszą 15,1.

• Gdzie plasuje się 48,57 — pierwsze wśród wszystkiego poniżej 10B w tabeli opublikowanej przez dostawcę i przed Decider 35B-A3B z 47,11. W ogólnym zestawieniu jest drugie, za Winnow-12B z 50,02, który jest czterokrotnie większy.

• Benchmarki tekstowe, według danych dostawcy — d1-3B osiąga średnio 82,9 w siedmiu publicznych benchmarkach, wyprzedzając Decider 4B z wynikiem 81,1; d1-omni-600M osiąga średnio 78,4, co przewyższa Decider 2B z wynikiem 77,1 przy mniej więcej jednej czwartej liczby parametrów. Model 600M uzyskuje najlepszy w tabeli wynik toksyczności (Civil Comments 95,8) oraz najlepszy wynik parafrazy (PAWS-X 79,5).

• Wizja, według dostawcy — d1-3B osiąga średnio 74,1 w jedenastu publicznych benchmarkach obrazowych, interpretowanych jako decyzje spośród opcji każdego benchmarku, wobec 73,9 dla jego backbone'u LFM2.5-VL-3B. Usunięcie obrazów obniża wynik dla tych samych pytań do 45,1, co jest sposobem, w jaki dostawca pokazuje, że odpowiedzi pochodzą z pikseli.

• Opóźnienie, mierzone przez producenta — jedno pytanie zajmuje 8 ms na RTX 4090 i 9 ms na AMD MI325X; 16 ms na Jetson AGX Thor, 26 ms na Jetson AGX Orin 64 GB, 50 ms na najmniejszym Jetson Orin Nano i 30 ms na Apple M5 Pro. Sześćdziesiąt cztery stany upakowane w pojedynczym przebiegu osiągają 475 na sekundę na 4090.

• Czego brakuje — d1-omni-600M nie ma w ogóle tabeli wnioskowania. Liquid twierdzi, że jest w aktywnym rozwoju i po prostu nie podaje opóźnienia dla niego. W wydaniu nie ma również nigdzie testu porównawczego decyzji audio, ponieważ, jak mówi dostawca, dedykowane testy porównawcze decyzji audio są obecnie otwartym problemem.

Twierdzenie, które tak naprawdę wysuwa ten komunikat

Dwa dni przed udostępnieniem wag Liquid opublikował hostowaną wersję tego modelu i przetestował ją przeciwko GPT-6.1 Sol oraz Claude Opus 5.5 na sześciu aplikacjach. Podsumowanie: d1 dorównuje GPT-6.1 Sol lub przewyższa go w czterech z sześciu przypadków, kosztuje od 19 do 200 razy mniej i odpowiada szybciej w każdym zadaniu. Warto przeczytać opublikowaną metodologię, zanim powtórzy się którąkolwiek z tych informacji — każda aplikacja została uruchomiona raz dla każdego modelu 5 października 2026 r., modele czatowe odpowiadały w JSON przy domyślnym ustawieniu rozumowania, a koszt d1 obliczono przy stawce 0,04 USD za milion tokenów wejściowych.

To dema są bardziej przekonującą połową. Sortowanie dobrych i wadliwych części z czterech linii produkcyjnych — płytki drukowane, świece, orzechy nerkowca, guma do żucia — z dokładnością od 85 do 97%, na modelu, który nigdy nie był trenowany do tego zadania i zrozumiał je na podstawie krótkiego opisu. Predykat SQL, który dla każdego ze 150 zgłoszeń do wsparcia odpowiada tak lub nie. Pętla kompaktowania kontekstu, która odczytuje każde wyjście narzędzia w sesji agenta kodującego i zachowuje, przycina lub odrzuca je, usuwając 52% tokenów, zachowując przy tym każde wyjście potrzebne do zadania. W Tetrisie dodanie ekranu do w pełni opisywalnej tekstowo gry podniosło wynik z 70 wyczyszczonych linii do 81 — wynik oparty na wizji, którego nie da się uzyskać za pomocą klasyfikatora wyłącznie tekstowego, niezależnie od tego, jak dobry by był.

To demonstracje prowadzone przez dostawców, z zadaniami wybranymi przez dostawców, i sekcja metodologiczna tak stwierdza. Wciąż są najwyraźniejszym obrazem tego, do czego służy model decyzyjny, jaki ktokolwiek opublikował.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as open-weight models, d1-3B's Decision Index score of 48.57, and its latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Gdzie to działa i ile kosztuje wywołanie

Otwarte wagi są stworzone do lokalnego uruchamiania, a dostawca wykonał pracę integracyjną z wyprzedzeniem: wsparcie dla llama.cpp od pierwszego dnia, pełny stos NVIDIA od DGX aż po Jetson, kwantyzacja NVFP4 oraz wariant 8-bitowych wag/aktywacji opublikowany wraz z bazowym checkpointem. Konwersje GGUF są już dostępne na Hugging Face. Jeśli wolisz nic nie hostować, Liquid udostępnia hostowany d1 ze swojego API — tylko tokeny wejściowe, bez tokenów wyjściowych, przy czym obrazy są rozliczane jako dane wejściowe po 1,5 tokena na fragment 32×32 piksele, co daje 1536 tokenów dla obrazu 1024×1024. Dostęp wyłącznie tekstowy jest również możliwy za pośrednictwem platform firm trzecich.

Szczera uwaga o routingu: ani Liquid AI d1-3B, ani Liquid AI d1-omni-600M nie znajdują się w naszym katalogu, a ten artykuł nie jest deklaracją dostępności żadnego z nich. To, co para d1 zmienia dla routera, to kształt potoku wokół niego. Model decyzyjny, który odpowiada w milisekundach i nie kosztuje nic w tokenach wyjściowych, jest filtrem, a nie zamiennikiem — sortowanie dobrych i wadliwych oraz triage zgłoszeń odbywają się przed wywołaniem generatywnym, a wywołanie generatywne to miejsce, w którym pojedynczy endpoint obsługujący ponad 200 modeli, ceny katalogowe przekazywane dalej z narzutem 0%, i automatyczne przełączanie awaryjne naprawdę się opłacają. Inna warstwa, ten sam potok.

Co rozstrzygnęłoby spór

Trzy sprawy pozostają nierozwiązane i wszystkie trzy są tego rodzaju, że tylko czas je zamyka.

Pierwsza to niezależna reprodukcja. Liczby Decision Index zostały wygenerowane przez dostawcę za pomocą oficjalnego skryptu oceniającego, a każdy wiersz konkurenta zaczerpnięto z publicznego rankingu — to metoda, której można bronić, i nie jest tym samym, co uruchomienie twojego modelu przez osobę trzecią. Druga to dźwięk. Checkpoint o 600M, który kieruje poleceniem głosowym w jednym przejściu w przód, to naprawdę nowa możliwość, a nie istnieje żaden benchmark, który mierzyłby, czy robi to dobrze. Trzecia to sama kategoria: gdy odpowiedź jest odczytywana z rozkładu, a nie wypisywana, typowe tryby awarii małego modelu — zapętlanie się, dryfowanie, odmawianie, halucynowanie formatu — po prostu nie mogą wystąpić, a nikt nie opublikował dobrego opisu tego, co je zastępuje. Błąd kalibracji jest oczywistym kandydatem i to dokładnie to, do czego pole pewności przy każdej odpowiedzi zachęca cię, byś sam je zmierzył.

Te dema uruchamiają Liquid AI d1-3B w pętli na żywym wejściu z kamery w publicznym Space Hugging Face, co jest najtańszym sposobem na wyrobienie sobie własnego zdania. Wagi są darmowe, a pytania są konkretne. To lepsza pozycja startowa niż większość tegorocznych wydań.

A capture of Liquid AI's documentation page for its decision models, showing the left-hand navigation including Decision Models and Liquid Nanos, the 'Open d1' banner announcing that visitors can now run d1-3B and d1-omni-600M locally, and the page's opening description of purpose-built models for structured decisions such as classification, routing and scoring in a single call with zero generation.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie