
Liquid AI d1-3B vs MiniCPM5-2B: Prawdopodobieństwa czy proza, w skali laptopa
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Dwa modele z otwartymi wagami, oba wystarczająco małe, by działać na maszynie przed tobą, i nie zgadzają się co do tego, co model powinien zwracać. Liquid AI d1-3B to model decyzyjny Liquid AI o 3,12 mld parametrów, udostępniony na otwartych wagach 7 października 2026 r.: odczytuje stan i zestaw nazwanych pytań, po czym zwraca etykietę, prawdopodobieństwo dla każdej opcji oraz poziom pewności, w jednym przebiegu w przód, nie generując niczego. MiniCPM5-2B to gęsty model ModelBest i OpenBMB o 2,52 mld parametrów, zaprezentowany na World Artificial Intelligence Conference 19 lipca i po cichu opublikowany na Hugging Face na początku września 2026 r. na licencji Apache-2.0 — asystent do rozumowania, kodowania i wywoływania narzędzi, który pisze odpowiedzi, wywołuje funkcje w XML i ma już ponad milion pobrań. Mniejszy ma czterokrotnie większe okno kontekstowe i znacznie bardziej permisywną licencję; większy nie potrafi wygenerować tokenu, nawet jeśli tego chcesz. To, który z tych dwóch kształtów pasuje do twojego potoku, zależy wyłącznie od tego, czy to, co znajduje się dalej po wywołaniu, chce liczby czy zdania.
Odwrócenie warte zauważenia w pierwszej kolejności
Niemal każde intuicyjne oczekiwanie dotyczące tego zestawienia jest odwrotne, więc zacznij od tego.
MiniCPM5-2B to mniejszy model, a przy tym obsługuje dłuższy kontekst: 131 072 tokeny w porównaniu z 32 768 tokenami w Liquid AI d1-3B. Z tych dwóch ma także bardziej liberalną licencję — Apache-2.0, bez ograniczeń dostępu, a zbiory danych treningowych udostępniono wraz z wagami w ramach rodziny UltraData. Liquid AI d1-3B jest dostarczany na własnej licencji Liquid lfm1.0; można go pobrać i dostrajać, ale jest to licencja dostawcy, a nie standardowa licencja permisywna.
Liquid AI d1-3B to większy model — 3,12B w porównaniu do 2,52B łącznie, choć porównanie znów się odwraca w przypadku parametrów niebędących embeddingami — i to ten, który nie potrafi pisać. Ma zdolność widzenia; MiniCPM obsługuje tylko tekst. Jest dostrajany po treningu dokładnie do jednej rzeczy; MiniCPM jest dostrajany do wielu. A podczas gdy MiniCPM5-2B pojawia się z wykresem porównawczym umieszczającym go na szczycie jego klasy rozmiarowej, Liquid AI d1-3B pojawia się z pojedynczym wynikiem indeksu i zestawem tabel opóźnień.
Nic z tego nie sprawia, że jedno jest lepsze. Oznacza to, że te dwa są przeznaczone do różnych zadań, a zdradza to kształt odpowiedzi, jaką zwraca każde z nich.
Co wraca na łączu
MiniCPM5-2B to generatywny model językowy. Rozumuje, odpowiada prozą i emituje wywołania narzędzi w stylu XML, które wbudowany w SGLang minicpm5 parser przekształca w zgodne z OpenAI tool_calls bez własnego adaptera. Jego trening po wstępnym szkoleniu to najciekawsza część tej historii: 400 miliardów tokenów nadzorowanego dostrajania w trybie głębokiego myślenia, następnie uczenie ze wzmocnieniem z algorytmem opartym na krytyku zapożyczonym z JustRL II, a potem destylacja on-policy, która scala szesnastu wyspecjalizowanych nauczycieli RL — pięciu z nich to agenci — z powrotem w jedną gęstą sieć. Karta przypisuje RL-owi i destylacji średni przyrost 10,96 punktu w zadaniach rozumowania i ogólnych oraz 6,96 w zadaniach agentowych, a także podaje średnią 53,9 w swoim własnym zestawie porównawczym, powyżej największego modelu uwzględnionego w tym zestawie. To liczby firmy ModelBest, uzyskane wewnętrznie, bez opublikowanej dotąd niezależnej reprodukcji.
Liquid AI d1-3B zwraca strukturę. Nowe pytanie wraca jako P(tak) między 0 a 1. Pytanie wyboru wraca jako etykieta, pewność i prawdopodobieństwo dla każdej opcji. Pytanie oceniające wraca jako oczekiwany poziom na uporządkowanej skali od dwóch do dziesięciu wraz z jego rozkładem i legendą. Obiekt usage raportuje output_tokens: 0, a do tego jest surowy akcesor probabilities, jeśli chcesz nieprzetworzone wektory. Jego post-training był odwrotnym rodzajem pracy: uśrednić dwa checkpointy, dostroić kilka ziaren na różnych mieszankach danych, scalić je, a następnie poświęcić wysiłek na trening na długich wejściach, tasowanie kolejności opcji odpowiedzi i usuwanie skrótów z danych treningowych — ponieważ model decyzyjny, który uczy się „opcja B jest zwykle poprawna”, zamiast czytać stan, jest gorszy niż bezużyteczny.
Jeden prosi model, aby pomyślał, a potem coś powiedział. Drugi pyta model, w co już wierzy.

Obok siebie, z oznaczonymi etykietami
Każda liczba poniżej pochodzi od dostawcy. Liczby MiniCPM5-2B pochodzą z własnej karty modelu ModelBest i jej własnego zestawu porównawczego; liczby Liquid AI d1-3B pochodzą z samodzielnego uruchomienia przez Liquid oficjalnego oceniającego Decision Index, a nie ze zgłoszenia do publicznego rankingu. Żaden z modeli nie został niezależnie zbenchmarkowany przez stronę trzecią w momencie wydania otwartych wag.
• Parametry — Liquid AI d1-3B łącznie 3,12 mld, z 400-milionowym enkoderem wizyjnym SigLIP2 i słownikiem 128 000 tokenów; MiniCPM5-2B łącznie 2 516 756 480, 1 981 982 720 bez embeddingów, 42, 16 głowic zapytań do 2 głowic KV, słownik 130 560.
• Kontekst — 32 768 tokenów dla Liquid AI d1-3B; 131 072 dla MiniCPM5-2B.
• Modalności wejściowe — tekst i obrazy dla Liquid AI d1-3B; tylko tekst dla MiniCPM5-2B.
• Wyjście — prawdopodobieństwa, etykiety, poziomy ufności i uporządkowane wyniki, z zerową liczbą tokenów wyjściowych, dla Liquid AI d1-3B; wygenerowany tekst, rozumowanie i wywołania narzędzi XML dla MiniCPM5-2B.
• Wynik główny — Liquid AI d1-3B 48,57 w Decision Index 0.2.1, pierwszy wśród modeli poniżej 10B w tabeli dostawcy; MiniCPM5-2B osiąga średnio 53,9 w swoim własnym zestawie porównawczym, który jest innym zestawem mierzącym inne rzeczy.
• Szybkość — 8 ms na pytanie na RTX 4090, 26 ms na Jetson AGX Orin 64 GB, 50 ms na Jetson Orin Nano oraz 64 spakowane stany na przebieg przy 475 na sekundę dla Liquid AI d1-3B. Szybkość MiniCPM5-2B jest funkcją tego, ile tokenów generuje, więc nie ma jednej liczby, którą można by jej przeciwstawić.
• Licencja — Apache-2.0, bez ograniczeń, dane treningowe udostępnione, dla MiniCPM5-2B; lfm1.0 od Liquid dla Liquid AI d1-3B.
• Dowody — ponad milion pobrań z Hugging Face i miesiąc kwantyzacji społecznościowej dla MiniCPM5-2B; dwa dni istnienia i brak uruchomienia przez podmiot trzeci dla Liquid AI d1-3B.
Zadanie, w którym każde z nich jest naprawdę dobre
Istnieje workflow, który oba modele potrafią wykonać, a różnica w sposobie, w jaki to robią, stanowi cały argument.
Załóżmy, że triażujesz zgłoszenia do wsparcia, albo decydujesz, czy pobrany fragment odpowiada na pytanie, albo oceniasz wynik LLM względem rubryki. MiniCPM5-2B potrafi robić wszystkie trzy rzeczy — to zdolny mały model rozumujący z wywoływaniem narzędzi i długim kontekstem, a uruchamiałbyś go jak każdego innego asystenta, prosząc o etykietę, a następnie parsując to, co wróci. Czasami zwraca czysty JSON. Czasami zwraca JSON z wyjaśnieniem wokół niego. Czasami zwraca poprawną odpowiedź w niewłaściwym kształcie, a to chybienie to błąd w twoim parserze, a nie w modelu.
Liquid AI d1-3B nie potrafi niczego innego i dokładnie o to chodzi. Na tych samych trzech zadaniach zwraca prawdopodobieństwo i etykietę, i nic do parsowania, trzy pytania o jednym stanie kosztują 1,3× czasu jednego, a tryb awarii przesuwa się z „format się zepsuł” na „pewność była źle skalibrowana” — co przynajmniej da się zmierzyć, bo pewność jest tuż w odpowiedzi.
To, gdzie MiniCPM5-2B wygrywa bezapelacyjnie, to wszystko, co następuje po podjęciu decyzji. Obsługuje 131K tokenów, więc stan może obejmować całe drzewo plików repozytorium albo długi dokument, a nie tylko jego pierwszą stronę. Natywnie zapisuje wywołania narzędzi. To model, na którym można zbudować małego agenta, i został wyraźnie dotrenowany do pracy agentowej. A jego licencja Apache-2.0 sprawia, że typowa rozmowa z prawnikiem od spraw komercyjnych nie ma miejsca.
Tam, gdzie Liquid AI d1-3B wygrywa bezdyskusyjnie, chodzi o minimalny poziom opóźnienia i modalność. Urządzenie podejmujące decyzję w 50 ms bez GPU to nie urządzenie uruchamiające MiniCPM5-2B; te dwa modele należą do różnych klas sprzętowych, mimo podobnej liczby parametrów. A model 3B widzi — producent podaje 74,1 w jedenastu publicznych benchmarkach obrazowych odczytywanych jako decyzje, wobec 73,9 dla modelu wizyjno-językowego, na którym go zbudowano, i podaje, że usunięcie obrazów powoduje spadek wyników dla tych samych pytań do 45,1, co jest ich sposobem pokazania, że odpowiedzi pochodzą z pikseli. Kontrola wizualna linii produkcyjnej to zadanie, którego nie można w ogóle powierzyć modelowi 2B obsługującemu wyłącznie tekst.

Uruchamianie ich oraz warstwa wokół nich
Oba to historie self-host i w obu przypadkach wykonano prace wdrożeniowe. Liquid AI d1-3B jest dostarczany z wsparciem dla llama.cpp od pierwszego dnia, pełnym stosem NVIDIA od DGX do Jetson, kwantyzacją NVFP4, kompilacją 8-bitowych wag i aktywacji oraz już opublikowanymi konwersjami GGUF. MiniCPM5-2B to prosta architektura LlamaForCausalLM, niewymagająca niestandardowych jąder, jeden shard safetensors BF16, kompilacje GGUF i MLX w szerszej rodzinie oraz udokumentowana preferencja dla SGLang, gdy potrzebny jest parser wywołań narzędzi. Żaden z nich nie znajduje się w naszym katalogu, a ten artykuł nie jest oświadczeniem o dostępności któregokolwiek z nich.
Alternatywy hostowane to własne API dostawcy oraz platformy firm trzecich. Liquid udostępnia hostowaną wersję d1, której cena opiera się wyłącznie na tokenach wejściowych i wynosi 0,04 USD za milion, przy czym obrazy są rozliczane jako dane wejściowe po 1,5 tokena na fragment 32×32 pikseli i nie ma żadnej pozycji wyjściowej; MiniCPM5-2B nie ma oficjalnego API, co jest normalne w przypadku wydania otwartych wag na licencji Apache-2.0.
To, do czego oba prowadzą, to ten sam problem architektoniczny. Lokalny model 2B lub 3B obsługujący klasyfikację, routing lub kontrole zabezpieczeń stoi przed wywołaniami generatywnymi, których nie hostujesz, a ta mieszanka — własna inferencja obok wynajmowanej — jest tym, co warstwa routingu ma za zadanie absorbować. Jeden punkt końcowy dla ponad 200 modeli, ceny katalogowe dostawców przekazywane dalej z 0% marży więc zmiana ceny u dostawcy obowiązuje tego samego dnia, automatyczne przełączanie awaryjne gdy jeden z upstreamów ulegnie degradacji. Posiadanie małego modelu sprawia, że kwestia routingu staje się trudniejsza, a nie łatwiejsza, ponieważ teraz granica między twoim sprzętem a sprzętem kogoś innego jest decyzją, którą musisz podejmować przy każdym żądaniu.
Wybierz według typu odpowiedzi
Jeśli potrzebujesz etykiety, prawdopodobieństwa lub oceny, a zbiór opcji jest znany z góry, Liquid AI d1-3B jest uczciwszym narzędziem — powstało do tego zadania, a odpowiedź nie przyjdzie zniekształcona. Zaakceptuj licencję dostawcy, kontekst 32K i dwudniowy ślad dowodowy jako cenę.
Jeśli tym, czego potrzebujesz, jest mały model, który potrafi rozumować, wywoływać narzędzia, utrzymać długi dokument i odpowiadać słowami, MiniCPM5-2B jest znacznie bardziej zdolną maszyną, a ponadto stoi za nią licencja Apache-2.0 i testy innych osób z miliona pobrań.
Zespoły, które najbardziej skorzystają z któregokolwiek z tych wydań, to te, które używają obu naraz: modelu decyzyjnego z przodu, tam gdzie odpowiedzią jest liczba i liczą się milisekundy, oraz małego modelu generatywnego za nim, do tych części zadania, które wymagają języka. Nie są konkurencją. Są filtrem i mówcą.

