
Liquid AI d1-3B vs Qwen 3 8B: Czy obciążenie klasyfikacyjne 8B powinno zostać przeniesione do modelu decyzyjnego?
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Somewhere in most production stacks there is a Qwen 3 8B being paid to answer yes or no. It moderates a comment, tags a support ticket, decides whether a retrieved passage is relevant, or scores another model's output against a rubric — and it does that by generating text which something downstream then parses. Liquid AI d1-3B, the 3.12B decision model Liquid AI open-weighted on October 7, 2026, exists to do exactly that job without generating anything: a state in, a set of named questions in, and probabilities, labels and confidences out in a single forward pass with zero output tokens. Qwen 3 8B is the vendor's April 2025 open-weights workhorse — roughly 8.2B dense parameters, 119 languages, thinking on or off per request, and sixteen months of community deployment behind it. The question this pairing actually asks is narrow and practical: for the slice of your traffic that is a classification, is an 8B generalist the cheapest way to get a label in 2026, or has the shape of that job changed underneath it?
Co tak naprawdę każesz robić modelowi 8B, płacąc za to
Zestaw oba kontrakty wyjściowe obok siebie, a nieefektywność okaże się strukturalna, a nie przyrostowa.
Wywołanie klasyfikacji w Qwen 3 8B to generacja. Piszesz prompt opisujący etykiety, model opcjonalnie rozumuje na temat danych wejściowych — a w tym modelu możesz włączyć lub wyłączyć to rozumowanie dla każdego żądania, co jest najprzydatniejszym z pokręteł, jakie ma do tego rodzaju pracy — a następnie zwraca odpowiedź. Ta odpowiedź to tekst. Jeśli poprosiłeś o JSON, zwykle otrzymasz JSON, a czasem dostaniesz JSON wewnątrz zdania albo w preambule, albo w niechcianym wyjaśnieniu na końcu. Etykieta, na której ci zależy, jest gdzieś w strumieniu tokenów, a parser ją wydobywa. Płacisz za każdy token, który model zapisze, w tym za te, które wyrzucasz.
Liquid AI d1-3B nie ma strumienia tokenów. Pytania deklaruje się z typem: noul dla tak/nie, z odpowiedzią jako P(tak) pomiędzy 0 a 1; choice dla jednej etykiety z nazwanego zestawu opcji, z odpowiedzią jako etykieta plus pewność plus prawdopodobieństwo dla każdej opcji; score dla pozycji w uporządkowanej skali od dwóch do dziesięciu, z odpowiedzią jako oczekiwany poziom wraz z jego rozkładem i legendą. Odpowiedź zawiera bieżącą sumę, która wskazuje output_tokens: 0. Nie ma nic do parsowania, ponieważ nic nie zostało zapisane, i istnieje surowy probabilities akcesor, gdy chcesz niezaokrąglony rozkład zamiast argmax.
To, co zmienia twój rachunek, to to, co dzieje się przy kilku pytaniach. Jeden stan może nieść ich wiele: czy to prośba o zwrot, który zespół powinien się nim zająć, jak pilne to jest. Stan i jego obrazy są odczytywane raz, a Liquid podaje, że trzy pytania na jednym stanie kosztują 1,3× czasu jednego, a nie 3×. To, czego nie redukuje, to opłata za dane wejściowe — nota rozliczeniowa dostawcy wyraźnie mówi, że każde pytanie jest rozliczane jako osobny prompt, wraz z jego tekstem i wszystkimi jego obrazami. Mniejsze opóźnienie, te same tokeny wejściowe. To uczciwa gwiazdka przy nagłówku i coś, co znajdujesz tylko czytając akapit o cenniku, a nie benchmark.

Co daje ci szesnaście miesięcy z Qwen 3 8B
Zanim uznasz mniejszy model za ulepszenie, określ precyzyjnie, co wnosi dotychczasowy model, bo to więcej niż liczba parametrów.
• Kontekst — Qwen 3 8B natywnie obsługuje 32 768 tokenów i rozszerza się do 131 072, co zostało zweryfikowane przez YaRN. Liquid AI d1-3B obsługuje 32 768 tokenów na stałym poziomie, bez udokumentowanej ścieżki rozszerzenia. W przypadku stanu będącego długim dokumentem 8B jest jedynym z tych dwóch, który może go pomieścić.
• Języki — 119 języków i dialektów dla Qwen 3 8B w porównaniu z szesnastoma udokumentowanymi dla Liquid AI d1-3B.
• Kontrola rozumowania — Qwen 3 8B pozwala włączać lub wyłączać myślenie dla każdego żądania. Liquid AI d1-3B nie ma trybu rozumowania, którym można by sterować, co jest albo uproszczeniem, albo ograniczeniem — w zależności od tego, do czego używałeś myślenia.
• Szerokość — 8B pisze, wyjaśnia, streszcza, tłumaczy i koduje. Liquid AI d1-3B nie robi nic z tych rzeczy. Jego karta mówi to wprost: to nie jest model czatowy i nie pisze tekstu.
• Dowody — Qwen 3 8B ma za sobą szesnaście miesięcy publicznego benchmarkingu, kwantyzacji, dostrajania i użycia produkcyjnego. Wynik Decision Index modelu Liquid AI d1-3B wynoszący 48,57 został uzyskany przez Liquid przy użyciu oficjalnego narzędzia oceniającego, a nie przesłany do publicznego rankingu, i ma zaledwie kilka dni, bez reprodukcji przez strony trzecie.
• Wizja — ten wiersz działa w drugą stronę. Liquid AI d1-3B przyjmuje obrazy, a dostawca raportuje 74,1 w jedenastu publicznych benchmarkach obrazowych odczytywanych jako decyzje w obrębie zestawu opcji każdego benchmarku i raportuje, że usunięcie obrazów powoduje spadek tych samych pytań do 45,1. Tekstowy Qwen 3 8B potrzebuje osobnego modelu wizyjnego przed sobą, aby móc robić cokolwiek z tych rzeczy.
• Szybkość — jedno pytanie w 8 ms na RTX 4090, 16 ms na Jetson AGX Thor, 50 ms na Jetson Orin Nano oraz 64 spakowane stany na przebieg przy 475 na sekundę na 4090. Klasyfikator oparty na generowaniu nie ma porównywalnej liczby, ponieważ jego opóźnienie zależy od tego, jak długa jest odpowiedź.
Uczciwe podsumowanie jest takie, że 8B jest lepszym narzędziem ogólnym, a model decyzyjny 3B jest lepszym narzędziem specjalistycznym, a jedyne pytanie, które się liczy, to jak duża część Twojego ruchu dotyczy tego specjalistycznego przypadku.
Arytmetyka kosztów, wykonana starannie
To jest punkt, w którym porównanie albo zwraca się, albo nie, więc warto je zrobić z prawdziwą strukturą, a nie sloganem.
Twierdzenie, które Liquid opublikował dwa dni przed wydaniem otwartych wag, jest takie, że jego hostowany model decyzyjny dorównuje GPT-6.1 Sol lub przewyższa go w czterech z sześciu rzeczywistych zastosowań, przy koszcie od 19 do 200 razy niższym, i odpowiada szybciej w każdym zadaniu. Zanim je powtórzysz, zapoznaj się z metodologią: każde zastosowanie uruchomiono raz na model 5 października 2026 r., modele czatowe odpowiadały w JSON przy domyślnym ustawieniu rozumowania, a koszt d1 obliczono przy $0,04 za milion tokenów wejściowych. Ta kwota $0,04 to stawka za wejście w hostowanym d1, i jest to jedyna istniejąca stawka — nie ma żadnej pozycji wyjściowej, którą trzeba by doliczyć.
Teraz zbuduj oszacowanie o tym samym kształcie dla klasyfikatora Qwen 3 8B, a asymetria jest widoczna bez podawania ceny jakiegokolwiek dostawcy. Model 8B ma dwie rozliczane pozycje tam, gdzie model decyzyjny ma jedną, a druga pozycja to ta, która rośnie: klasyfikacja, która najpierw rozumuje, płaci za rozumowanie, a klasyfikacja, która dopełnia swój JSON, płaci za dopełnienie. Opłata za wejście w modelu decyzyjnym jest określona przez stan i pytania. W przypadku 8B nie jest ona określona przez nic, co można przewidzieć na podstawie samego stanu.
Dwie przeciwwagi sprawiają, że nie kończy się to pogromem. Po pierwsze, model decyzyjny rozlicza każde pytanie jako osobny prompt, więc zadanie pięciu pytań o jeden długi dokument pięciokrotnie zwiększa wejście — 8B zadaje wszystkie pięć w jednym wywołaniu i płaci za dokument tylko raz. Po drugie, i co ważniejsze, model decyzyjny potrafi odpowiedzieć tylko na pytania, do których odpowiadania w takiej formie został dostrojony po treningu. Cokolwiek wymaga wyjaśnienia, podsumowania lub osądu wyrażonego słowami, sprowadza cię z powrotem do generalisty i w praktyce z powrotem do płacenia za oba.

W czym ta dwójka jest naprawdę dobra
Odrzuć benchmarking, a podział jest czystszy, niż sugerują liczby parametrów.
Liquid AI d1-3B służy do zadań typu tak/nie, wyboru z listy i oceny, przy minimalnym poziomie opóźnienia nieosiągalnym dla niczego generatywnego, na sprzęcie obejmującym Jetson Orin Nano osiągający 50 ms oraz laptopa. Aplikacje, które Liquid zaprezentował w październiku, były wariantami tego samego schematu — predykat SQL odpowiadający tak lub nie na 150 zgłoszeń do pomocy technicznej, pętla kompaktowania kontekstu agenta, która zachowuje, przycina lub odrzuca dane wyjściowe każdego narzędzia i usuwa 52% tokenów, aplikacja inspekcyjna sortująca dobre i wadliwe części z czterech linii produkcyjnych z dokładnością od 85 do 97% w zadaniu, do którego nigdy nie była trenowana, a które zrozumiała z krótkiego opisu. To ostatnie demo jest najjaśniejszym wyrazem tego, do czego służy ta kategoria: zadanie, w którym odpowiedź jest jedną z kilku możliwości, stan jest obrazem, a o żadne wyjaśnienie nigdy nie proszono.
Qwen 3 8B jest przeznaczony do zadań, których wynikiem musi być język, do obsługi 119 języków, do pomieszczenia dokumentu dłuższego niż trzydzieści dwa tysiące tokenów albo do rozumowania na głos przed podjęciem decyzji. Jest również właściwym wyborem, gdy klasyfikacja nie jest jednym z trzech powyższych wariantów — gdy zbiór etykiet jest otwarty, gdy kryteria są wystarczająco subtelne, że zależało ci na rozumowaniu, gdy to samo wywołanie musi obsłużyć zarówno łatwy, jak i trudny przypadek, bez konieczności rozdzielania zadań między dwa modele. A gdy recenzent pyta, jakie istnieją niezależne benchmarki, jest bezpiecznym wyborem, bo odpowiedź brzmi: jest ich dużo — sięgają półtora roku wstecz.
Zespoły, które robią to dobrze, nie wybierają. Stawiają model decyzyjny przed generalistą, na tej części ruchu, w której odpowiedzią jest liczba, a modelowi 8B zostawiają obsługę wszystkiego, co wymaga zdania. Filtr to 3B i 8 ms; 8B zostaje do payloadu.
Wdrażanie pary
Liquid AI d1-3B pojawia się jako wagi z już wykonaną pracą wdrożeniową: wsparcie dla llama.cpp od pierwszego dnia, pełny stos NVIDIA od DGX aż po Jetson, kwantyzacja NVFP4, wariant 8-bitowy wag i aktywacji oraz konwersje GGUF na Hugging Face. Qwen 3 8B ma najgłębszy ekosystem self-hostingu spośród wszystkich modeli w tej klasie wagowej. Żaden z nich nie znajduje się w naszym katalogu i nic tutaj nie stanowi deklaracji dostępności któregokolwiek z nich — hostowana ścieżka dla Liquid AI d1-3B to własne API dostawcy oraz platformy zewnętrzne, gdzie hostowany d1 jest rozliczany wyłącznie na podstawie tokenów wejściowych, po 0,04 USD za milion, a obrazy są rozliczane po 1,5 tokena na fragment 32×32 piksele.
Gdy oba znajdą się w tym samym potoku, problem routingu przestaje być teoretyczny. Masz mały model, który należy do Ciebie, model 8B, który możesz hostować lub wynajmować, oraz wywołania generatywne, które z pewnością wynajmujesz — a decydowanie przy każdym żądaniu, do którego z nich powinno trafić dane wejście, to dokładnie ta decyzja, do której podejmowania istnieje warstwa routingu. Jeden punkt końcowy dla ponad 200 modeli, ceny katalogowe dostawców przekazywane bez marży (0% marży), więc zmiana ceny u dostawcy jest widoczna po Twojej stronie tego samego dnia, automatyczne przełączanie awaryjne, dzięki czemu zły dzień dostawcy upstream nie staje się Twoją awarią. Gdy Twój ruch klasyfikacyjny liczy się w miliardach wywołań rocznie, to właśnie w tej warstwie oszczędności z modelu decyzyjnego 3B faktycznie się materializują.
Werdykt
Jeśli twojemu 8B zadaje się pytania zamknięte — czy to jest toksyczne, czy to jest istotne, do której kolejki to należy, jak pilne to jest — płacisz rachunek generalisty za dwie linijki i opóźnienie generowania za etykietę, a Liquid AI d1-3B jest bezpośrednim zamiennikiem ze słabszym śladem dowodowym i realną różnicą w licencji do rozważenia. Zaakceptuj limit kontekstu 32K, szesnaście języków i fakt, że nikt poza Liquid jeszcze go nie ocenił.
Jeśli Twoje 8B jest proszone o wyjaśnianie, streszczanie, tłumaczenie, utrzymanie długiego dokumentu lub rozumowanie przed podjęciem decyzji, to porównanie Cię nie dotyczy. Zachowaj 8B i rozważ model decyzyjny wyłącznie jako wstępny filtr dla ruchu, który z góry możesz zidentyfikować jako łatwy rodzaj.
Ciekawą liczbą, na którą warto zwrócić uwagę, nie jest wynik benchmarku któregokolwiek z modeli. Jest nią to, jak szybko pojawi się pierwsze niezależne odtworzenie d1 Decision Index — bo to właśnie w tym momencie porównanie przestaje być twierdzeniem dostawcy, a staje się faktem, na którym można oprzeć planowanie.

