Karta tytułowa hero z nagłówkiem 'Liquid AI d1-3B vs Gemma 4 12B' i podtytułem 'model decyzyjny kontra generalista', przedstawiająca małą kartę listy kontrolnej 3,12B z chipem prawdopodobieństwa obok większej karty 11,96B zawierającej ikony dokumentu, przebiegu fali i klatki filmowej oraz chip z odpowiedzią pisemną.
Guides & Insights

Liquid AI d1-3B vs Gemma 4 12B: model decyzyjny kontra generalista

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Najszybszym sposobem, by to porównanie wypadło źle, jest umieszczenie Liquid AI d1-3B i Gemma 4 12B na tym samym benchmarku i czekanie na zwycięzcę. One nie odpowiadają na to samo pytanie. Liquid AI d1-3B to model decyzyjny o 3,12B udostępniony jako otwarte wagi 7 października 2026 r.: podajesz mu stan i zestaw nazwanych pytań, a on zwraca prawdopodobieństwa, wybraną etykietę i poziom ufności, bez tokenów wyjściowych i bez kroku generowania. Gemma 4 12B to pozbawiony enkodera generalista any-to-any od Google'a, checkpoint o 11,96B, który przyjmuje tekst, obraz, dźwięk i wideo oraz pisze odpowiedź w oknie 256 000 tokenów w ponad 140 językach. Jeden z nich mówi ci, którą z czterech rzeczy jest płytka drukowana. Drugi mówi ci dlaczego. Porównaj je wyłącznie pod względem jakości, a nie dowiesz się niczego, ponieważ ich wyniki nie są współmierne — a dostawcy nigdy nie porównywali ich ze sobą w benchmarkach. Porównaj je pod kątem tego, co faktycznie zwraca wywołanie, ile kosztuje, i gdzie każdemu z nich kończy się droga, a ta para stanie się naprawdę użytecznym testem granicznym.

Dwa różne kontrakty wyjściowe

Rozróżnienie, które tu robi całą robotę, jest tym, co wraca po drucie.

Liquid AI d1-3B zwraca ustrukturyzowany obiekt odpowiedzi. Każde pytanie w żądaniu deklaruje typ — noul dla tak/nie z P(yes), choice dla jednej opcji z nazwanego zestawu opcji z pewnością i prawdopodobieństwem dla każdej opcji, lub score dla pozycji na uporządkowanej skali od dwóch do dziesięciu poziomów z oczekiwanym poziomem i jego rozkładem. Model podaje output_tokens: 0 ponieważ nic nie jest zapisywane. Kilka pytań dotyczących jednego stanu jest odczytywanych z pojedynczego przebiegu w przód, a stan i jego obrazy są kodowane raz dla wszystkich z nich.

Ge​mma 4 12B zwraca prozę. Czasami zwraca JSON, o który prosiłeś, czasami zwraca JSON, o który dokładnie nie prosiłeś, a przed udzieleniem odpowiedzi potrafi rozumować. Jest przede wszystkim modelem językowym: wszystko, co potrafi sklasyfikować, wyraża jako tekst. To zaleta, gdy odpowiedź trzeba wyjaśnić człowiekowi lub przekazać do dalszego kroku, który oczekuje języka, a koszt, gdy jedyną rzeczą, której potrzebowałeś, było prawdopodobieństwo.

Wszystko, co następuje dalej, wynika z tego. Nie może się zdarzyć, że odpowiedź d1-3B nie da się sparsować. Nie potrafi też sama siebie wyjaśnić, a karta modelu mówi o tym wprost: to nie jest model czatu i nie pisze tekstu.

Gdzie znajdują się tropy dowodowe

Pochodzenie obu tych zbiorów liczb nie jest równoważne, a ma to tutaj większe znaczenie niż same liczby.

• Decision Index 0.2.1 — Liquid AI d1-3B, oceniony przez dostawcę przy użyciu oficjalnego narzędzia oceniającego, uzyskuje wynik 48,57, plasując się na pierwszym miejscu wśród modeli poniżej 10B, przed Decider 35B-A3B z wynikiem 47,11. Ge​mma 4 12B nie ma w ogóle wyniku w Decision Index, więc ten wiersz nie ma odpowiednika.

• Benchmarki rozumowania — Gemma 4 12B osiąga 77,5 w AIME 2026, 78,8 w GPQA Diamond i 1 659 ELO w Codeforces, a także ma wskaźnik Artificial Analysis Intelligence Index na poziomie 22 w trybie rozumowania i 13 przy wyłączonym rozumowaniu. Liquid AI d1-3B nie ma benchmarku rozumowania, ponieważ model decyzyjny nie generuje śladu rozumowania, który można by ocenić.

• Długi kontekst — Ge​mma 4 12B obsługuje 256 000 tokenów i uzyskuje 43,4% w MRCR v2 eight-needle przy 128k na własnej karcie Goo​gle'a. Liquid AI d1-3B obsługuje 32 768 tokenów. Jeśli twoim „stanem” jest czterdziestostronicowy dokument plus skany, ta różnica rozstrzyga o całej decyzji i nie ma tu nawet porównania.

• Wizja — Liquid AI d1-3B osiąga średnio 74,1 w jedenastu publicznych benchmarkach obrazowych, odczytywanych jako decyzje na zestawie opcji każdego benchmarku, wobec 73,9 dla modelu bazowego LFM2.5-VL-3B, z którego powstał, a producent podaje, że usunięcie obrazów obniża wyniki dla tych samych pytań do 45,1. Wizja Ge​mma 4 12B jest silniejsza i szersza, ale jest raportowana jako jakość generowania, a nie jako dokładność podejmowania decyzji w odniesieniu do nazwanych opcji.

Języki — szesnaście udokumentowanych dla Liquid AI d1-3B; ponad 140 dla Ge​mma 4 12B.

• Szybkość — Liquid AI d1-3B odpowiada na jedno pytanie w 8 ms na RTX 4090, 16 ms na Jetson AGX Thor, 26 ms na Jetson AGX Orin 64 GB i 50 ms na Jetson Orin Nano, a na 4090 pakuje 64 stany w jednym przebiegu z szybkością 475 na sekundę. Ge​mma 4 12B generuje, więc jej opóźnienie jest funkcją tego, ile tokenów zapisuje.

• Jakość dowodów — wyniki Ge​mma 4 12B należą do Goo​gle, opublikowano je w czerwcu 2026 r. i od tego czasu były poddawane próbom, kwantyzowane i ponownie uruchamiane przez dużą społeczność. Wyniki Liquid AI d1-3B należą do Liquid, opublikowano je dwa dni temu, a nikt spoza laboratorium ich nie odtworzył. Drugą kolumnę czytaj odpowiednio.

A two-column scoreboard for Liquid AI d1-3B and Gemma 4 12B. The d1-3B column reads: output a label, a confidence, zero tokens; 3.12B parameters; 32,768-token context; text and image input; 8 ms per question; Decision Index 48.57 (vendor). The Gemma 4 12B column reads: output generated text; 11.96B parameters; 256,000-token context; text, image, audio and video input; latency that scales with output length; Decision Index not scored. The footer reads 'd1-3B figures vendor-reported and unreproduced; Gemma 4 12B figures per Google, June 2026.'

Jedyne miejsce, w którym naprawdę ze sobą konkurują

Istnieje rzeczywiste nakładanie się i nie ma go na żadnej liście rankingowej. To wywołanie LLM-as-a-judge.

Wiele potoków produkcyjnych już używa średniej wielkości modelu ogólnego przeznaczenia jako warstwy oceny: ocenić pilność tego zgłoszenia, zdecydować, czy dane wyjście przechodzi ocenę według rubryki, wybrać, które narzędzie agent powinien wywołać jako następne, sprawdzić, czy pobrany fragment odpowiada na pytanie. Dziś większość z tych wywołań trafia do modelu generatywnego, od którego oczekuje się, że wyemituje liczbę lub etykietę jako tekst, a liczba, którą emituje, jest tym, co wyprodukował sampler, a nie softmaxem po twoim zestawie opcji. To jest workflow, do zastąpienia którego poddano post-trainingowi Liquid AI d1-3B, a wszystkie opublikowane dema to jego warianty — predykat SQL, który odpowiada tak lub nie dla 150 zgłoszeń do wsparcia, pętla kompaktowania kontekstu agenta, która zachowuje, przycina lub odrzuca dane wyjściowe każdego narzędzia i usuwa 52% tokenów, oraz aplikacja do inspekcji wizualnej, która sortowała dobre i wadliwe części z czterech linii produkcyjnych z dokładnością od 85 do 97% w zadaniu, do którego nigdy nie była trenowana.

Gemma 4 12B wykonuje wszystkie te zadania, a nawet więcej niż te zadania. Potrafi też napisać podsumowanie, utrzymać w kontekście 256K, przyjąć nagrane połączenie telefoniczne jako dane wejściowe i odpowiedzieć w jednym z ponad 140 języków. Jeśli Twój potok wymaga oceny narracji, 12B wykonuje dwa zadania za jednym wywołaniem, a model decyzyjny 3B wykonuje jedno z nich.

Granica to długość kontekstu i kształt wyjścia. Długi stan, wejście głosowe, wiele języków albo wyjaśnienie, którego oczekuje czytelnik — Ge​mma 4 12B, bezapelacyjnie. Krótki stan, stały zestaw opcji, budżet opóźnienia na żądanie w jednocyfrowych milisekundach albo twarda gwarancja, że odpowiedź zostanie sparsowana — to kolumna d1-3B, a generalista płaci za możliwości, z których nie skorzystasz.

Ile kosztuje połączenie z każdym z nich

Żaden z tych modeli nie znajduje się w naszym katalogu, więc nie mamy ceny routingowej do podania dla żadnego z nich — Ge​mma 4 12B nie należy do rozmiarów Ge​mma, które obsługujemy, a Liquid AI d1-3B to otwarte wagi, które hostujesz samodzielnie lub do których uzyskujesz dostęp przez własne API dostawcy i platformy zewnętrzne. Dla kontekstu, po stronie tej rodziny sąsiadującej z Gemini, dwa rozmiary Ge​mma 4, które obsługujemy w ramach routingu, są wycenione na 0,06 USD za milion tokenów wejściowych i 0,33 USD za milion tokenów wyjściowych dla Ge​mma 4 26B A4B oraz 0,13 USD i 0,38 USD dla Ge​mma 4 31B, oba z kontekstem 262 144 tokenów oraz obsługą tekstu, obrazu i wideo. Mediana cen dostawców podawanych dla Ge​mma 4 12B gdzie indziej wynosi około 0,10 USD i 0,30 USD.

Hostowany przez Liquid d1 rozlicza wyłącznie tokeny wejściowe, po 0,04 USD za milion, a obrazy są liczone jako dane wejściowe po 1,5 tokena na fragment 32×32 pikseli. Żądanie decyzyjne nie ma zatem w ogóle pozycji tokenów wyjściowych, co jest strukturalnym powodem, dla którego własne porównanie kosztów dostawcy z dużo większymi modelami wypada tak, jak wypada. Otwarte wagi nie mają ceny za wywołanie; płacisz sprzętem. Oba muszą znajdować się w tym samym potoku co wszystko inne, co wywołujesz, a to warstwa, dla której istnieje router — jedno API dla ponad 200 modeli, ceny katalogowe dostawców przekazywane dalej z 0% marży, i automatyczne przełączanie awaryjne, aby pojedyncza usterka po stronie upstream nie stała się twoją awarią. To infrastruktura wokół porównania, a nie samo porównanie.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, the d1-3B Decision Index score of 48.57, and the latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

Jak zdecydować, szczerze mówiąc

Zacznij od formatu odpowiedzi, a nie od modelu. Jeśli system dalszego przetwarzania może przyjmować prawdopodobieństwo, etykietę i poziom ufności, a zbiór odpowiedzi jest mały i znany, Liquid AI d1-3B nie jest degradacją względem modelu 12B — to inne narzędzie, a liczby dotyczące opóźnień czynią go wdrożeniem należącym do zupełnie innej kategorii: 50 ms na Jetson Orin Nano to urządzenie, które w ogóle nie powinno uruchamiać modelu 12B.

Jeśli odpowiedź musi być zdaniem, albo stan jest dłuższy niż trzydzieści dwa tysiące tokenów, albo ktoś zamierza ją wypowiedzieć, albo językiem wyjściowym jest bengalski, to Ge​mma 4 12B jest jedynym z tych dwóch, który może wykonać to zadanie, a porównanie kończy się, zanim się zacznie.

Naprawdę użyteczne stanowisko dla większości zespołów brzmi: oba, w różnych miejscach. Model decyzyjny przed kosztownym wywołaniem, wykonujący triaż, routing i kontrole guardrail, które nie wymagają języka; generalista za nim do pracy, która wymaga. To ten sam potok, jeden jest filtrem, a drugi ładunkiem — a zespoły, które najbardziej skorzystają na wydaniu d1, to te, które już płacą 12B za odpowiedź tak lub nie.

A capture of our own catalogue page for Google Gemma 4 31B, showing the model id google/gemma-4-31b-it, a release date of 2026-04-02, a 30.7B dense multimodal description with a 256K token context window, and headline pricing of $0.13 per million input tokens and $0.38 per million output tokens.