
Liquid AI d1-3B vs LFM2.5-2.6B-Base: Model decyzyjny i jego własny przodek
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
To nie jest starcie dwóch rywali. Liquid AI d1-3B, model decyzyjny z otwartymi wagami, który Liquid AI opublikował 7 października 2026 r., powstał na bazie, którą dostawca zbudował, uśredniając wagi LFM2.5-2.6B z tekstowym szkieletem LFM2.5-VL-3B. LFM2.5-2.6B-Base jest tym pierwszym rodzicem — surowym, wstępnie wytrenowanym checkpointem, który Liquid udostępnił 1 sierpnia 2026 r.: 2,69 mld parametrów, 34 biliony tokenów treningowych, kontekst 131 072 tokenów, bez dostrajania do instrukcji i bez szablonu czatu. Uczciwym ujęciem tego porównania jest więc potomek przeciw przodkowi: model dotrenowany do bardzo konkretnego zadania stojący obok nieuformowanego substratu, z którego został uformowany. Jeden z nich odpowiada dziś wieczorem na pytania. Drugi jest punktem wyjścia, jeśli pytanie, na które potrzebujesz odpowiedzi, nie jest tym, które ktokolwiek już zadał.
Czym każdy z nich właściwie jest
Te dwie karty modeli czyta się jak dokumenty z różnych etapów linii produkcyjnej, a różnice nie mają charakteru stylistycznego.
Liquid AI d1-3B ma 3,12 mld parametrów, enkoder wizyjny SigLIP2 NaFlex o rozmiarze 400M, okno kontekstowe 32 768 tokenów, słownik 128 000 tokenów i szesnaście udokumentowanych języków. To model decyzyjny: podajesz mu stan i nazwane pytania, a on zwraca prawdopodobieństwo tak/nie, wybraną etykietę z poziomem pewności i pełny rozkład opcji albo uporządkowany wynik — w pojedynczym przebiegu w przód, bez generowania tokenów wyjściowych. Oferuje wywołanie system_one dla jednego stanu z kilkoma pytaniami, wariant wsadowy, który upakowuje wiele żądań bez dopełniania, oraz surowy probabilities akcesor dla bazowych rozkładów. To nie jest model czatu i nie pisze tekstu, a karta mówi to tymi słowami.
LFM2.5-2.6B-Basezawiera 2,69 mld parametrów w 30 warstwach — 22 bloki krótkiej konwolucji z podwójnym bramkowaniem i 8 bloków uwagi z grupowanymi zapytaniami — wytrenowany na 34 bilionach tokenów i rozszerzony do kontekstu 131 072 tokenów na etapie treningu pośredniego, z tym samym słownikiem liczącym 128 000 tokenów i tymi samymi szesnastoma językami. To wstępnie wytrenowany, wyłącznie tekstowy punkt kontrolny, bez dostrajania do instrukcji, bez żadnych benchmarków na swojej karcie i z zaleceniem, które brzmi jak ostrzeżenie: używaj go tylko do zadań wymagających intensywnego dostrajania. Uzupełnia tekst. Nie wykonuje instrukcji.
Oba są pobraniami bez bramki w ramach własnej otwartej licencji Liquid. Oba są przede wszystkim tekstowe. Żadnego z nich nie ma w naszym katalogu, a nic tutaj nie stanowi oświadczenia o dostępności któregokolwiek z nich.

Najciekawszy jest rodowód.
Liquid nie dostroiło świeżego modelu, aby stworzyć wydanie d1. Uśredniło dwa checkpointy — LFM2.5-2.6B i wieżę tekstową LFM2.5-VL-3B — aby uzyskać lepszy punkt startowy, a następnie dostroiło kilka przebiegów z różnymi losowymi ziarnami i mieszankami danych, po czym scaliło je z powrotem. Relacja dostawcy na temat tego, co poprawiło wynik, jest uderzająco pozbawiona egzotycznych technik: trenowanie na długich danych wejściowych, tasowanie kolejności, w jakiej pojawiają się opcje odpowiedzi, oraz usuwanie skrótów z danych treningowych dały więcej niż jakakolwiek zaawansowana metoda, której próbowali.
Warto zatrzymać się na chwilę przy tym szczególe dotyczącym usuwania skrótów, ponieważ nazywa on ten rodzaj błędu, którego ta kategoria ma unikać. Model wytrenowany do odpowiadania na pytania wielokrotnego wyboru chętnie nauczy się, że opcja B jest zwykle poprawna albo że wygrywa najdłuższa opcja. Tasowanie kolejności opcji podczas treningu jest tym, co temu zapobiega. Model decyzyjny, który nauczył się prioru pozycyjnego zamiast odczytywać stan, jest gorszy niż bezużyteczny — myli się z pełnym przekonaniem na dużą skalę — i to właśnie on odróżnia prawdziwy model decyzyjny od klasyfikatora z promptem.
Jest też regresja, którą warto nazwać wprost, bo dostawca tego nie robi: bazowy checkpoint ma okno kontekstu 131 072 tokenów, a Liquid AI d1-3B ma 32 768. Dostrojenie do modelu decyzyjnego kosztowało trzy czwarte użytecznego kontekstu. Jeśli wyobrażałeś sobie, że potomek ściśle dominuje nad swoim przodkiem na każdej osi, to nie — a decyzje dotyczące długich dokumentów są osią, na której starszy checkpoint ma więcej miejsca — w zasadzie, choć nie ma głowicy decyzyjnej, żeby je wykorzystać.
Tablica wyników, z dołączoną asymetrią
Porównywanie tych dwóch modeli na benchmarkach to błąd kategorii, ale to błąd kategorii o pouczającym kształcie, więc oto on, z zastrzeżeniami na miejscu. Każda wartość dla d1-3B pochodzi od samego Liquid, oceniona przez dostawcę za pomocą oficjalnego narzędzia do oceny, a nie zgłoszona do publicznego rankingu, i niepowtórzona przez żadną stronę trzecią. Każda wartość dla LFM2.5-2.6B-Base jest nieobecna, ponieważ model bazowy nie ma czego mierzyć.
• Decision Index 0.2.1 — Liquid AI d1-3B 48.57, pierwszy wśród wszystkiego, co poniżej 10B w tabeli dostawcy i wyprzedza model decyzyjny dwanaście razy większy od niego. LFM2.5-2.6B-Base — nie został oceniony, nie da się go ocenić bez głowy decyzyjnej.
• Testy tekstowe — Liquid AI d1-3B osiąga średnio 82,9 w siedmiu publicznych benchmarkach obejmujących rozumienie, toksyczność, intencje, medyczne pytania i odpowiedzi oraz rozumienie międzyjęzykowe. LFM2.5-2.6B-Base nie publikuje żadnej tabeli z wynikami benchmarków.
• Wizja — Liquid AI d1-3B osiąga średnio 74,1 w jedenastu benchmarkach obrazowych odczytywanych jako decyzje; usunięcie obrazów obniża te same pytania do 45,1. LFM2-2.6B-Base jest wyłącznie tekstowy, z wieżą wizyjną.
• Parametry — 3.12B wobec 2.69B. Model decyzyjny jest większy z tych dwóch, co jest odwrotnością typowej narracji po treningu.
• Kontekst — 32 768 tokenów wobec 131 072. Przodek wygrywa ten wiersz i jest to jedyny wiersz, który wygrywa.
• Opóźnienie — Liquid AI d1-3B odpowiada na pojedyncze pytanie w 8 ms na RTX 4090 i w 50 ms na Jetson Orin Nano, a na 4090 wykonuje 64 spakowane stany z szybkością 475 na sekundę. LFM2.5-2.6B-Base nie ma opóźnienia, które można by podać, dopóki nie dostroisz go do czegoś, co odpowiada na pytanie; wtedy ta liczba jest już liczbą twojego dostrojonego modelu.

To, między czym w praktyce wybierasz
Reguła decyzyjna jest tu wyjątkowo przejrzysta, ponieważ te dwa punkty kontrolne nie konkurują o tę samą pozycję budżetową.
Wybierz Liquid AI d1-3B, gdy pytanie już istnieje i ma jeden z trzech kształtów, z którymi radzi sobie model decyzyjny: tak lub nie, wybór z nazwanego zbioru albo ocena na uporządkowanej skali. Opublikowane zastosowania to same rozpoznawalne produkcyjne zadania — triage i routing, moderacja, klasyfikacja intencji i tematów, kontrole ekstrakcji, reranking, guardrails agentów i inspekcja wizualna. Liczby z dema, które dostawca przeprowadził 5 października, zestawiły d1 z GPT-6.1 Sol i Claude Opus 5.5 w sześciu takich zadaniach i twierdzą, że dorównuje on lub przewyższa GPT-6.1 Sol w czterech, kosztując przy tym od 19 do 200 razy mniej; strona metodologii stwierdza wprost, że każde zastosowanie uruchomiono raz na model, więc traktuj kształt tego twierdzenia jako ustalenie, a nie miejsca po przecinku. Naprawdę uderzające jest demo inspekcji: sortowanie dobrych i wadliwych elementów na czterech liniach produkcyjnych z dokładnością od 85 do 97% w zadaniu, do którego model nigdy nie był trenowany, zrozumianym z krótkiego opisu.
Wybierz LFM2.5-2.6B-Base, gdy pytanie jeszcze nie istnieje. To tańszy punkt wyjścia dla dostrajania, które zamierzasz mieć — głowica decyzyjna dla domeny, klasyfikator szyty na miarę, zadanie, dla którego nikt nie ma checkpointu. Dziedziczysz architekturę, tokenizer i długi kontekst, a płacisz obliczeniami, danymi i ewaluacją. Dwa z czterech zastosowań, które dostawca zbudował wokół d1, zaczęły się od projektów open source, a nie od zera, co jest uczciwym obrazem tego, co faktycznie daje bazowy checkpoint plus dyscyplina.
Praktyczną pułapką jest traktowanie bazowego checkpointu jako rozwiązania „drop-in”. To nie jest asystent, nie będzie podążać za promptem, a oceniany jako model czatu uzyskuje wynik blisko zera — co nie jest faktem o jego jakości, lecz faktem o tym, co oznacza „base”.
Self-hosting jednego lub drugiego oraz warstwa powyżej
Oba są dostarczane jako wagi, a dostawca wykonał prace wdrożeniowe po stronie d1: wsparcie llama.cpp od pierwszego dnia, pełny stos NVIDIA od DGX po Jetson, kwantyzacja NVFP4, 8-bitowy wariant wag i aktywacji oraz konwersje GGUF na Hugging Face. Bazowy checkpoint ma własne warianty GGUF, ONNX i MLX w ramach szerszej rodziny LFM2.5. Jeśli wolisz niczego nie hostować, Liquid udostępnia hostowane d1 ze swojego API, którego cena obejmuje wyłącznie tokeny wejściowe, przy czym obrazy są rozliczane po 1,5 tokena za fragment 32×32 pikseli; dostęp wyłącznie tekstowy jest również możliwy za pośrednictwem platform innych firm.
To, czego nie zmienia żadna z tych dwóch ścieżek, to reszta stosu. Model, który hostujesz, to model, który musisz utrzymywać przy życiu, wersjonować i przełączać awaryjnie — a decyzje, które on zasila, i tak lądują obok wywołań generatywnych, których nie hostujesz. Ta mieszanka to warstwa, którą router spina w jedno: jeden punkt końcowy dla ponad 200 modeli, ceny katalogowe dostawców przekazywane z 0% marżą, więc zmiana ceny u dostawcy jest u Ciebie widoczna tego samego dnia, oraz automatyczne przełączanie awaryjne, dzięki któremu zły dzień jednego dostawcy nie staje się Twoją awarią. Hostowanie obok tego własnego modelu decyzyjnego 3B wyostrza pytanie o routing, a nie je łagodzi, bo teraz połowę potoku masz na własność, a połowę wynajmujesz.
Który, dla kogo
Jeśli pytanie, na które potrzebujesz odpowiedzi w tym tygodniu, jest jednym z trzech kształtów, jakie przyjmuje model decyzyjny, i jest to pytanie, które ktoś inny już sobie wyobraził, potomek jest gotowy i darmowy, i działa w 50 ms na urządzeniu bez GPU — weź Liquid AI d1-3B i po sprawie.
Jeśli budujesz coś, co odpowiada na pytanie, którego nikt jeszcze nie zadał, i masz dane oraz moc obliczeniową, by to opanować, LFM2.5-2.6B-Base jest uczciwym punktem wyjścia — i warto wiedzieć, że potomek opisany w tym artykule powstał z niego dokładnie tą samą drogą, którą właśnie zamierzasz obrać.
A jeśli nie masz pewności, w której z tych dwóch sytuacji się znajdujesz, odpowiedź brzmi: prawie zawsze ta pierwsza. Dostrajanie po treningu do głowy decyzyjnej to kosztowne posunięcie; uruchamianie cudzej jest darmowe.

Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
