
Liquid AI d1-3B vs Intern-Decision-4B: Którego skalibrowanego decydenta naprawdę potrzebujesz?
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Dwa modele z otwartymi wagami odpowiadają teraz na pytania, nie pisząc zupełnie niczego, a dopóki nie postawisz ich schematów wejścia/wyjścia obok siebie, wyglądają jak ten sam pomysł powtórzony dwa razy. Liquid AI d1-3B, wgrany do Hugging Face 5 października 2026 i ogłoszony przez Liquid dwa dni później, to 3,12B multimodalny model decyzyjny, którego karta mówi wprost, że „nie jest modelem konwersacyjnym i nie pisze tekstu”. Intern-Decision-4B od InternLM, po cichu wgrany do organizacji InternLM 26 września 2026, bez wpisu na blogu, tweeta i strony premierowej za nim, to 4B model decyzyjny dostrojony z Qwen3.5-4B, który również zwraca rozkład odpowiedzi dla każdego pytania w jednym przebiegu w przód. Ten sam kontrakt na powierzchni. Różnice pod spodem — licencja, która przysporzy ci komplikacji, kontrakt, który może przypadkiem napisać tekst, i maszyny, których nikt nie porównał — decydują o tym, który z nich należy do twojego stosu.
Jak blisko siebie tak naprawdę jest ta dwójka
Pierwszą rzeczą, którą trzeba ustalić, jest to, jak duża część tego porównania to remis. Oba modele przyjmują stan i schemat nazwanych pytań, oba odczytują sygnał z logitów na pozycji zastępczej, zamiast próbkować, oba są multimodalne i oba podają, że nic nie napisały. Pod względem kształtu wywołania są niemal identyczne, a ciekawe różnice tkwią w szczegółach na obrzeżach.
• Rozmiar — Liquid AI d1-3B: łącznie 3,12B, zbudowany na LFM2.5-VL-3B firmy Liquid; Intern-Decision-4B 4B (około 4,54B według liczby tensorów podanej na karcie), dostrojony na podstawie Qwen3.5-4B
• Typy pytań — d1-3B i Intern-Decision-4B używają tych samych trzech: noul dla tak/nie, choice dla jednego z nazwanego zestawu, score dla punktu na uporządkowanej skali
• Pola odpowiedzi — d1-3B zwraca odpowiedź wraz z pewnością i prawdopodobieństwami; schemat InternLM zwraca rozkłady oraz wartość pewności, o której karta modelu ostrzega, że nie jest skalibrowanym prawdopodobieństwem
• Limit danych wejściowych — d1-3B: 32 768 tokenów kontekstu; Intern-Decision-4B: pułap 8 192 tokenów, który kategorycznie odrzuca dłuższe żądania, zamiast je obcinać, przy czym obrazy wliczają się do tego limitu
• Licencja — d1-3B na licencji Liquid's LFM Open License v1.0, Apache 2.0 po stronie InternLM
• Języki — d1-3B wymienia 16; karta Intern-Decision-4B nie podaje żadnych
• Interfejs — d1-3B jest dostarczany jako model, który ładujesz i wywołujesz z trust_remote_code=True; Intern-Decision-4B jest dostarczany jako biblioteka Pythona, którą instalujesz przez pip install, z jednym zaimplementowanym backendem, przy czym pole model w żądaniu wprost nie może przełączać checkpointów
• Własny wynik dostawców — d1-3B 48,57 w publicznym podziale Decision Index 0.2.1; Intern-Decision-4B 90,02 uśrednione po własnej tabeli siedmiu zestawów, z wynikiem Brier'a 0,347 i oczekiwanym błędem kalibracji 0,065
Te dwie ostatnie liczby nie są porównywalne, a potraktowanie ich jako tablicy wyników byłoby najłatwiejszym błędem, jaki można popełnić na tej stronie. Pochodzą z różnych środowisk testowych, różnych zestawów pytań i różnych oceniających.

Kalibracja to cały produkt, a tylko jeden z nich podpisuje się pod nią w druku.
Model decyzyjny jest wart swojego opóźnienia tylko wtedy, gdy liczba, którą zwraca obok odpowiedzi, coś znaczy. Na tym polega kalibracja: zadeklarowana pewność 0,9 powinna być słuszna mniej więcej w dziewięciu przypadkach na dziesięć, a model, który jest pewny i się myli, jest gorszy od takiego, który mówi, że nie wie.
To właśnie InternLM się tym zajmuje. Jego karta dokumentuje dopasowaną temperaturę 1,99241824, wyznaczoną w drodze minimalizacji ujemnej logarytmicznej funkcji wiarygodności na 1728 wyznaczonych przypadkach kalibracyjnych, z 1693 odłożonymi do walidacji, i podaną z dokładnością do ośmiu miejsc po przecinku, aby można było ją odtworzyć. Publikuje też badanie pilotażowe przed i po na 96 przypadkach, które pokazuje, że mechanizm działa, zamiast tylko to twierdzić: Brier 0,628 i ECE 0,213 przed kalibracją wobec 0,550 i 0,089 po. Brier i ECE to dwa standardowe wskaźniki tego, czy podawane prawdopodobieństwa są rzetelne, a kierunek zmian jest znaczący.
Liquid nie publikuje odpowiednika. Karta samego modelu d1-3B zawiera benchmarki w stylu dokładności — SQuAD 2.0 85,0, Civil Comments 93,0, MASSIVE intent 87,3, PubMedQA 66,0, BoolQ 86,7, XNLI 85,0, PAWS-X 76,9, średnia 77,1 — obok swojego wyniku 48,57 w Decision Index, a deklarowanym punktem sprzedażowym modelu są odpowiedzi typowane. Ale nie ma wiersza ECE, nie ma wiersza Brier i nie ma opublikowanej temperatury.
Ta asymetria nie oznacza, że potomek Qwen3.5-4B jest lepiej skalibrowany niż 3B zbudowany na LFM2.5-VL-3B; oznacza to, że między tymi dwiema kartami jedna z nich daje arytmetykę pozwalającą to udowodnić, a druga nie.
To zastrzeżenie działa w obie strony. Oba zestawy liczb są danymi własnymi. Żaden z modeli nie został oceniony przez niezależny podmiot, a twierdzenia InternLM dotyczące kalibracji opierają się na własnym badaniu pilotażowym InternLM obejmującym 96 przypadków, w zestawieniu z własnym dopasowaniem InternLM.
Licencja, która prosi o podanie numeru
Intern-Decision-4B jest objęty licencją Apache 2.0, odziedziczoną po Qwen3.5-4B, z zachowanymi powiadomieniami upstream — użycie komercyjne, redystrybucja, dostrajanie, bez żadnej kwestii przychodów.
d1-3B jest objęty licencją LFM Open License v1.0 firmy Liquid, a Sekcja 5 to ta część, której nikt nie czyta, dopóki nie zrobi tego dział zakupów. Użytkowanie komercyjne jest dozwolone wyłącznie pod warunkiem, że Ty lub Twój podmiot prawny pozostajecie poniżej Progu zdefiniowanego w tym samym dokumencie jako roczny przychód w wysokości dziesięciu milionów dolarów amerykańskich lub więcej; użytkowanie powyżej tego progu po prostu nie jest objęte licencją. Organizacje non-profit i użytkownicy prowadzący badania są wyłączeni.
Dla osoby prywatnej lub małego zespołu oba są darmowe. Dla czegokolwiek, co ma dział finansowy, te dwa repozytoria to różne produkty, a różnica to liczba, powyżej której albo jesteś, albo nie.
Końcówka tabeli benchmarków d1-3B to jej rzeczywista teza.
Główna liczba na karcie Liquid to 48,57 w Decision Index 0.2.1, wyprzedzając pozostałe wiersze dla modeli poniżej 10B w tabeli, która rozciąga się od Winnow-12B z 50,02 do Decider 2B z 28,97. To, co czyni tę liczbę wartą przytoczenia, to wskaźnik dyskryminacji, który znajduje się pod nią. W podwynikach samego Decision Index d1-3B uzyskuje 74,5 w Narzędziach i 36,3 w Sztuce, osiągając jedynie 23,8 w Wiedzy — w porównaniu z Decider 35B-A3B, modelem mieszaniny ekspertów 36B, 12 razy większym, który uzyskuje 56,5 w Narzędziach, 32,6 w Sztuce i 31,8 w Wiedzy.

Innymi słowy, 3B to nie jest mały model, który jest jednolicie nieco gorszy. To mały model, który jest wyjątkowo mocny w ustrukturyzowanych decyzjach w stylu narzędziowym i wyjątkowo słaby w pytaniach wymagających wiedzy o świecie, i pokonuje 36B w dwóch kategoriach, które najbardziej przypominają zadanie, do którego został stworzony. Jeśli twoje decyzje to „które z tych pięciu nazwanych działań” i „czy jest to ugruntowane w odnalezionym fragmencie”, luka rozmiarowa odgrywa mniejszą rolę, niż można by się spodziewać. Jeśli twoje decyzje opierają się na faktach, które model musi już posiadać, spodziewaj się, że pojawi się 23.8.
Po stronie wizyjnej istnieje druga wersja tego argumentu. d1-3B osiąga średnio 74,1 w jedenastu publicznych benchmarkach obrazowych wobec 73,9 dla własnego modelu bazowego, a po usunięciu obrazów te same pytania uzyskują 45,1 — więc w pytaniach obrazowych odpowiedzi naprawdę pochodzą z obrazu. Jest na poziomie swojego modelu bazowego, a nie lepszy od niego, a wiersze dla poszczególnych benchmarków wypadają w obie strony: CV-Bench 82,1 wobec 87,6, POPE 88,5 wobec 90,1, BLINK 59,2 wobec 58,7.
Warto również zauważyć pauzę w karcie InternLM: jej wysoki wynik zbiorczy pochodzi z zadań opartych na pytaniach, takich jak Typed Decision 80.55 i ToolACE 96.45, podczas gdy Jevbench-Hard plasuje się na 73.87. Tam, gdzie schemat staje się trudny, wynik spada.
Szybkość: luka nie jest tam, gdzie się jej spodziewasz
d1-3B deklaruje 8 ms dla pojedynczego pytania na RTX 4090 i 9 ms na MI325X, 21 ms dla trzech pytań współdzielących jeden stan, 16 ms na Jetson AGX Thor oraz przepustowość w trybie packed na poziomie 475 decyzji na sekundę na 4090 i 1 106 na MI325X.
Karta Intern-Decision-4B osiąga średnio 44,16 ms end-to-end na tym samym RTX 4090, z medianą 44,03 ms oraz 44,60 ms przy P95.
To wygląda na 5-krotną wygraną, ale nią nie jest, bo oba pomiary mierzą coś innego. Liczby Liquid dotyczą rozgrzanych wywołań modelu, po jednym żądaniu na raz, z wyborem kerneli i kompilacją opłaconymi z góry — tag mówi wprost, że pojedyncze pytanie kosztuje 16 ms na 4090 bez kompilacji grafu CUDA, a pierwsze wywołanie z nowym kształtem płaci za kompilację. 44 ms InternLM to pomiar end-to-end na zapytanie przez bibliotekę Pythona, której jedynym zaimplementowanym backendem jest inferencja Hugging Face, więc ciągnie ze sobą całą otaczającą maszynerię. Żadna z tych liczb nie jest błędna. Umieść obie w jednym środowisku testowym, na jednej maszynie, przy takim samym kształcie żądania, a różnica zmaleje do czegoś, co chciałoby się zmierzyć, a nie zakładać.
Nie podlega dyskusji limit. 8,192 tokenów to twarda odmowa po stronie InternLM, a tokeny obrazów korzystają z tego samego budżetu, więc długi dokument plus zrzut ekranu to żądanie, które wraca odrzucone, a nie obcięte. d1-3B daje ci 32,768 tokenów do dyspozycji. Jeśli twoje stany to zgłoszenia i krótkie wymiany, ta luka nigdy nie daje się we znaki. Jeśli mają rozmiar strony, rozstrzyga to kwestię, zanim zrobi to jakikolwiek benchmark.
Uruchom je jako panel, a nie zamianę
Odpowiadanie na konkretne pytanie tak/nie a odpowiadanie na „która z sześciu nazwanych rzeczy to jest i jak bardzo jesteś pewien” to różne zadania, a obie karty są ukształtowane na tyle odmiennie — jedna z twardym pułapem danych wejściowych i opublikowanym dopasowaniem kalibracyjnym, druga z 32K kontekstu i lepszym ogonem oceniania — że użytecznym wdrożeniem dla zespołu oceniającego obie jest często nie zamiennik, lecz panel: ten sam stan przedstawiony obu modelom, a rozbieżności kierowane do człowieka albo do większego modelu.
Żaden z tych modeli nie znajduje się w naszym katalogu i nie jest to deklaracja dostępności; oba są artefaktami hostowanymi samodzielnie. Ale panel to dokładnie ten przypadek, w którym pracę wykonuje warstwa routingu, a nie papierologia. OrcaRouter udostępnia ponad 200 modeli za jednym kluczem API, z cenami katalogowymi dostawców przekazywanymi bez marży (0% narzutu) — więc gdy dostawca, za pośrednictwem którego kierujesz ruch u nas, obniży cenę, Twój rachunek zmienia się tego samego dnia — a automatyczne przełączanie awaryjne między dostawcami nie pozwala, by panel dwóch modeli stał się dwoma pojedynczymi punktami awarii. Modele, które kierujesz dziś, to nie te dwa; to hostowane modele ogólnego przeznaczenia, które zastępujesz, takie jak Qwen3.5-27B w cenie 0,086 USD za milion tokenów wejściowych i 0,688 USD za milion tokenów wyjściowych — a to liczba, którą samodzielnie hostowany model 3B musi pobić, gdy doliczysz koszt GPU.
Co robić w tym tygodniu
Jeśli Twoje decyzje to krótkie stany, licencja musi przejść przegląd w Twojej firmie, a Ty chcesz najszerszy zakres celów budowania — llama.cpp, Ollama, LM Studio, spakowana ścieżka wsadowa, która przepuszcza 64 stany w jednym przebiegu — d1-3B jest bardziej produktowo dopracowany spośród tych dwóch, a jego rozróżnianie narzędzi i sztuk jest najsilniejszą cechą, jaką pokazuje którakolwiek z kart. Jeśli Twoje decyzje przebiegają przez długie stany, albo potrzebujesz licencji bez klauzuli przychodowej, albo chcesz dopasowania kalibracyjnego, które możesz odtworzyć, i harnessu, w którym koszt towarzyszący jest już uwzględniony, Intern-Decision-4B jest tym, którego dokumentację możesz faktycznie sprawdzić.

Niewygodny aspekt jest w obu przypadkach taki sam: żadna niezależna strona nie uruchomiła żadnego z tych modeli i nie istnieje żadne porównanie kalibracji, które nie zostałoby zlecone przez dostawcę, który napisał kartę. W przypadku klasy modeli, których cała wartość polega na znaczeniu liczby obok odpowiedzi, to właśnie tę lukę warto zamknąć, zanim zastosujesz próg do czegokolwiek.
