Karta tytułowa hero z nagłówkiem „Liquid AI d1-3B vs Granite 4.2 3B” i podnagłówkiem „jeden decyduje, drugi pisze”, pokazująca kartę po lewej z etykietą d1-3B i ikoną listy kontrolnej, podpis „3,12B – 32 768 tokenów” oraz chipy z napisami: prawdopodobieństwo, etykieta i wynik, a także kartę po prawej z etykietą Granite 4.2 3B i ikoną dymka wypowiedzi, podpis „3B – 128K tokenów” i chip z napisem „pisemna odpowiedź”.
Guides & Insights

Liquid AI d1-3B kontra Granite 4.2 3B: Dwa modele 3B, które nigdy nie wykonują tego samego zadania

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Umieść Liquid AI d1-3B i Granite 4.2 3B na tym samym pojedynczym GPU, a oba zmieszczą się bez problemu — 3,12 mld parametrów po jednej stronie, 3 mld po drugiej. Będą się też zachowywać, jakby pochodziły z różnych dziedzin. Granite 4.2 3B, którego własna karta modelu IBM datuje na 25 sierpnia 2026 r., jest modelem rozumowania: trzy tryby myślenia, <think> blok i odpowiedź, którą czytasz. Liquid AI d1-3B, przesłany do Hugging Face 5 października 2026 r. i ogłoszony przez Liquid dwa dni później, jest modelem decyzyjnym: przyjmuje stan oraz jawny zestaw typowanych pytań i zwraca prawdopodobieństwo, etykietę lub pozycję na skali w jednym przebiegu do przodu, raportując output_tokens: 0, ponieważ nigdy nic nie zapisuje. Przydatne pytanie nie brzmi, który z nich jest lepszy. Brzmi: które z twoich wywołań jest faktycznie decyzją, ponieważ oba repozytoria są zbudowane dla przeciwnych połówek tego podziału.

Co tak naprawdę znajduje się w każdym repozytorium?

Wszystko poniżej pochodzi z dwóch kart modeli oraz wpisu ogłoszeniowego Liquid. Nic tutaj nie zostało niezależnie odtworzone, żadna strona trzecia nie oceniła żadnego z tych modeli na tym samym zestawie testowym, a liczby w kartach pochodzą od samych dostawców.

• Rozmiar — Liquid AI d1-3B: łącznie 3,12 mld parametrów, oparty na LFM2.5-VL-3B firmy Liquid; Granite 4.2 3B to gęsty transformer typu decoder-only o 3 mld parametrów, zbudowany na granite-4.1-3b-base

• Dane wyjściowe — d1-3B zwraca prawdopodobieństwa, etykiety i poziomy ufności i nie zapisuje żadnego tekstu; Granite 4.2 3B generuje tokeny, w tym opcjonalny łańcuch myśli wewnątrz <think>tagów

• Kontekst — d1-3B 32 768 tokenów; Granite 4.2 3B natywnie 128K, z rozszerzeniem długiego kontekstu do 512K na karcie

• Wejście — d1-3B tekst, JSON, obrazy lub ich mieszanka, przez enkoder wizyjny SigLIP2 NaFlex 400M; Granite 4.2 3B tylko tekst

• Licencja — d1-3B na licencji Liquid's LFM Open License v1.0; Granite 4.2 3B na licencji Apache 2.0

• Języki — d1-3B wymienia 16; Granite 4.2 3B wymienia dwanaście przetestowanych, a karta odnotowuje, że pozostałe nie zostały przetestowane

• Serwowanie — d1-3B dostarcza własny kod (trust_remote_code=True, transformers>=5.14), z repozytoriami GGUF i w8a8 w tej samej rodzinie oraz kartami udokumentowanymi dla llama.cpp, Ollama i LM Studio; Granite 4.2 3B działa w środowisku vLLM 0.20+ lub SGLang 0.5.18+ z własnym parserem rozumowania

Dwa z tych wierszy robią więcej niż pozostałe. Wiersz z wynikiem to cały argument tego artykułu, a wiersz z licencją to ten, którego nikt nie umieszcza w tabeli porównawczej.

A two-column scoreboard for Liquid AI d1-3B and Granite 4.2 3B. The d1-3B column reads: job answers a typed question; parameters 3.12B; output tokens billed 0; context 32,768 tokens; image input yes; one question 8 ms on an RTX 4090. The Granite 4.2 3B column reads: job writes a reasoned answer; parameters 3B; output tokens billed every token it writes; context 128K, to 512K extended; image input no; one question a full thinking pass. The footer reads 'Both columns vendor-reported, neither independently scored.'

Jeden pisze łańcuch myśli, drugi odmawia pisania.

Granite 4.2 3B zarabia na siebie, myśląc na głos. Jego karta dokumentuje trzy tryby: myślenie domyślnie włączone, bez myślenia oraz tryb niskiego wysiłku, który zachowuje ślad rozumowania, ale go skraca. Stosy serwowania oddzielają ślad od ostatecznej odpowiedzi, dzięki czemu aplikacja otrzymuje czystą treść oraz osobne pole rozumowania. To dobre rozwiązanie w przypadku pytania, które trzeba rozpracować — problemu matematycznego, gałęzi logiki, fragmentu kodu, który trzeba napisać, zanim można go ocenić.

d1-3B nie ma takiego trybu, a jego karta mówi to bez ogródek: „To nie jest model czatu i nie pisze tekstu”. Wywołanie deklaruje pytania z typem. noul to pytanie typu tak/nie, zwracające P(tak) między 0 a 1. choice wybiera jedną etykietę z nazwanego zestawu opcji i zwraca etykietę, pewność oraz prawdopodobieństwo dla każdej opcji. score umieszcza stan na uporządkowanej skali od dwóch do dziesięciu i zwraca oczekiwany poziom wraz z jego rozkładem i legendą. Sygnał jest odczytywany z logitów w pozycji zastępczej w jednym przebiegu, a nie próbkowany token po tokenie, dlatego blok użycia może zgłosić zero tokenów wyjściowych, nie kłamiąc.

Ta różnica zmienia Twój rachunek, zanim zmieni Twoją dokładność. Wywołanie klasyfikacji Granite, które „myśli” przez 400 tokenów, to wywołanie, za które płacisz 400 tokenów wyjściowych, a etykieta, której chciałeś, jest zakopana w prozie, którą parser musi następnie wydobyć. Wywołanie d1-3B rozlicza wyłącznie tokeny wejściowe. Jeśli większość Twojego ruchu to etykieta z dołączoną regułą, płaciłeś za rozumowanie niezależnie od tego, czy zmieniło ono etykietę.

Gdzie Granite 4.2 3B jest wyraźnie lepszym wyborem

Przyjmij benchmarki rozumowania za dobrą monetę — są to własne benchmarki IBM, uruchomione przez wewnętrzny potok NeMo Evaluator, i żaden podmiot zewnętrzny ich nie odtworzył — a model 3B jest wyjątkowo mocny jak na swój rozmiar: AIME25 78,33, HMMT February 2025 66,67, GPQA 54,80, LiveCodeBench v6 69,71, MMLU-Pro 67,84, IFBench 74,33, BFCL v4 52,41, tau3-bench 45,78 oraz RULER 64K 67,52 spadające do 55,30 przy 128K.

Z tej listy wynikają cztery zadania, a d1-3B nie ma w żadnym z nich.

• Natywny kontekst 128K, rozszerzalny do 512K, w porównaniu z 32 768 tokenami w d1-3B — jeśli Twoim stanem jest długi dokument, wybór został dokonany za Ciebie

• Wywoływanie narzędzi w trybie agentowym z udokumentowanym parserem i integracjami z harnessem dla OpenCode, Pi i OpenHands, czego model decyzyjny nie ma odpowiednika

• Każde zadanie, którego odpowiedzią jest akapit: streszczanie, tworzenie tekstów, ekstrakcja do dowolnej struktury, generowanie kodu

• Fine-tuning i redystrybucja bez pułapu przychodów, ponieważ Apache 2.0 nie zawiera klauzuli progowej

Zwróć uwagę na to, co nie znajduje się na karcie Granite: wiersze SWE-Bench i Terminal-Bench są oznaczone jako NA dla modelu 3B. Etap uczenia ze wzmocnieniem agentowym IBM zastosowano wyłącznie w modelach 8B i 30B z tej rodziny, więc najmniejszy model nie ma wyników agentowych, które mają jego więksi krewni. Zespół, który czyta „Granite 4.2” i zakłada, że model 3B dziedziczy agentowy profil tej rodziny, będzie zaskoczony.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that releases d1-3B and d1-omni-600M as open-weight models, d1-3B's Decision Index score of 48.57 and the claim that it is ahead of every model under 10B, and its latency of 8 ms on an NVIDIA GeForce RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Gdzie {{1}}d1-3B{{/1}} wygrywa, zanim {{2}}Granite{{/2}} skończy myśleć

Tabela opóźnień samego Liquid, mierzona w stanie rozgrzanym, przy jednym żądaniu na raz, jest najmocniejszym elementem jego argumentacji: pojedyncze pytanie w 8 ms na RTX 4090 i 9 ms na AMD MI325X, 16 ms na Jetson AGX Thor i 26 ms na Jetson AGX Orin 64GB, z 64 stanami upakowanymi w jednym przebiegu z szybkością 475/s na 4090 i 1106/s na MI325X. Dla porównania: to mniej więcej czas, jakiego Granite 4.2 3B potrzebuje, aby wygenerować kilka tokenów swojego śladu rozumowania.

Trzy typy pytań na jednym stanie kosztują d1-3B 21 ms na 4090 zamiast trzech osobnych wywołań, ponieważ stan i jego obrazy są odczytywane raz dla wszystkich pytań. W stosie moderacji lub routingu, który kiedyś wysyłał jedno żądanie HTTP na regułę, to różnica między kolejką wywołań a jednym wywołaniem.

To także widzi. d1-3B osiąga średnią 74,1 w jedenastu publicznych benchmarkach obrazowych wobec 73,9 uzyskanych przez jego model bazowy, a karta odnotowuje, że po usunięciu obrazów te same pytania uzyskują wynik 45,1 — odpowiedzi pochodzą z obrazu, a nie z promptu tekstowego. Poszczególne wiersze wypadają raz lepiej, raz gorzej (CV-Bench 82,1 wobec 87,6 modelu bazowego, POPE 88,5 wobec 90,1), więc twierdzenie o widzeniu brzmi „na poziomie modelu bazowego”, a nie „lepsze od niego”.

Uczciwa przeciwwaga: wynik 48,57 modelu d1-3B w Decision Index 0.2.1 powstał, gdy Liquid sam uruchomił oficjalny skrypt oceniający, a nie w wyniku zgłoszenia do rankingu, natomiast konkurencyjne wiersze pochodzą z publicznego rankingu. Jego średnia 77,1 w ośmiu zadaniach typu benchmark-jako-decyzja oraz 71,8 w DecisionBench również pochodzą z testów własnych. Wszystko po stronie d1 w tym porównaniu jest niezweryfikowane.

A capture of the Hugging Face model card for ibm-granite/granite-4.2-3b, showing the Apache 2.0 licence, the 3B parameter count, the decoder-only dense architecture built on Granite-4.1-3B-Base, the 128K native context with long-context extension to 512K, bfloat16 precision, the tested-language list and the built-in chain-of-thought reasoning mode.

Dlaczego model rozumujący 3B nie jest modelem decyzyjnym 3B

Kuszącym posunięciem jest traktowanie Granite 4.2 3B jako tańszego zamiennika dla d1-3B, albo odwrotnie. Obie te strategie zawodzą, a niepowodzenie ma charakter strukturalny, a nie dotyczy jakości.

Poproś Granite, aby zdecydował, a otrzymasz generację, którą musisz przeanalizować, rachunek, który rośnie wraz z tym, jak trudne model uznał pytanie, oraz opóźnienie zależne od wybranego trybu myślenia. Poproś d1-3B o rozumowanie, a nie otrzymasz zupełnie nic — nie ma strumienia tokenów, w którym mógłby rozumować. Te dwa modele znajdują się po przeciwnych stronach linii, którą większość potoków przekracza kilka razy na żądanie: coś musi decydować, a coś musi mówić. d1-3B należy umieścić na początku, gdzie reguła triage wybiera trasę i zwraca skalibrowany poziom pewności. Granite 4.2 3B należy umieścić za nim, w gałęzi, w której trzeba napisać odpowiedź.

Jest jeszcze druga, cichsza pułapka. Wartością modelu decyzyjnego jest kalibracja — pewność 0,9, która sprawdza się dziewięć razy na dziesięć. Karta modelu Granite 4.2 3B nie publikuje żadnych metryk kalibracji ani prawdopodobieństw; publikuje wyniki dokładności i rozumowania. Porównywanie ich obu w rankingu benchmarków nie mówi nic o tym, któremu z nich należy zaufać przy ustalaniu progu.

Wiersz o licencji, którego nikt nie umieszcza w tabeli

Granite 4.2 3B jest udostępniany na licencji Apache 2.0. d1-3B jest udostępniany na licencji LFM Open License v1.0, która sprawia wrażenie permisywnej aż do Sekcji 5: użycie komercyjne jest dozwolone pod warunkiem, że Ty lub Twój podmiot prawny nie przekraczacie progu określonego w tym samym dokumencie jako roczny przychód wynoszący dziesięć milionów dolarów amerykańskich lub więcej, a jakiekolwiek użycie komercyjne powyżej tej granicy po prostu nie jest objęte licencją. Organizacje non-profit i użytkownicy badawczy są wyłączeni.

Dla hobbysty lub start-upu to nie problem. Dla firmy, która przekracza tę granicę w połowie roku — albo która może zostać przejęta przez taką firmę — te dwa repozytoria nie są równoważnymi artefaktami, niezależnie od tego, jak podobne wydają się ich liczby parametrów, a przegląd licencji następuje długo po tym, jak ktoś już wypuścił prototyp. To najtańsza rzecz na tej stronie do sprawdzenia na wczesnym etapie.

Uruchamianie pary jako jeden potok

Żaden z tych modeli nie znajduje się dziś w naszym katalogu, więc nie jest to twierdzenie o dostępności: oba są artefaktami hostowanymi samodzielnie, a Granite 4.2 3B w szczególności nie ma w ogóle na swojej karcie wymienionych dostawców wnioskowania. Jednak wzorzec, do którego zespół w praktyce dochodzi, to jedno wywołanie, które decyduje, i drugie, które mówi, i to właśnie w tym wzorcu warstwa routingu zasługuje na swoje miejsce. OrcaRouter umieszcza ponad 200 modeli za jednym kluczem API z cenami katalogowymi dostawców przekazywanymi przy 0% marży, dzięki czemu obniżka ceny od dostawcy trafia na Twój rachunek tego samego dnia, a nie dopiero przy kolejnym odnowieniu umowy, a automatyczne przełączanie awaryjne między dostawcami oznacza, że współdzielony komponent w środku potoku nie staje się pojedynczym punktem awarii, podczas gdy wciąż go oceniasz. Jeśli chcesz przeprowadzić test A/B modelu d1-3B przeciwko hostowanemu generaliście na własnym ruchu, zanim zdecydujesz się na wdrożenie samodzielnie hostowane, najbliższym trasowanym sąsiadem linii rozwojowej Granite jest Gemma 4 31B w cenie 0,13 USD za milion tokenów wejściowych i 0,38 USD za milion tokenów wyjściowych — model znacznie większy, ale pełniący tę samą rolę „generalisty, który pisze” w potoku.

Werdykt, ujęty jako reguła

Jeśli potrzebujesz osądu — spam czy nie, do której kolejki, jak pilne, czy ten obraz pasuje do tego opisu — d1-3B jest jedynym z tych dwóch, który robi to za jednym przejściem, i robi to w jednocyfrowych milisekundach. Jeśli potrzebujesz pisemnej odpowiedzi, odczytu długiego dokumentu, wywołania narzędzia albo fragmentu kodu, Granite 4.2 3B jest tym, który w ogóle ma strumień tokenów, a wyniki rozumowania 3B są naprawdę imponujące jak na swój rozmiar — na własnych ewaluacjach IBM, których jeszcze nikt nie sprawdził.

Tym, co zmieniłoby obraz, nie jest nowy wiersz w benchmarku. Jest nim ocena obu modeli przez stronę trzecią na tym samym stanowisku kalibracyjnym, ponieważ właściwość decydująca o tym, czy można nałożyć próg na model, to ta, której żadna z kart nie pozwala dziś porównać.