Wygenerowana karta tytułowa dla Microsoft-Decision-1 vs Liquid AI d1-3B z podtytułem „jedyne dwa modele decyzyjne, które zgadzają się co do okna kontekstowego”, z plakietkami wskazującymi 32 768 tokenów w obu przypadkach, tylko tekst vs tekst, obrazy i dźwięk, 25 języków vs 16, hostowane API vs wagi lfm1.0 oraz stopka informująca, że dane liczbowe obu dostawców są samodzielnie zgłaszane i niezweryfikowane.
Guides & Insights

Microsoft-Decision-1 kontra Liquid AI d1-3B: To samo okno 32K, dwa różne sensy

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Tym razem specyfikacja się zgadza. Microsoft-Decision-1, ogólnie dostępny w Microsoft Foundry od 8 października 2026 r., przyjmuje 32 768 tokenów kontekstu. To samo dotyczy Liquid AI d1-3B, wgranego do Hugging Face 5 października 2026 r. i ogłoszonego przez Liquid AI dwa dni później. Oba przyjmują stan oraz zestaw pytań określonego rodzaju — tak/nie, wybór spośród nazwanych opcji, pozycję na uporządkowanej skali — i oba odpowiadają w jednym przebiegu w przód, zwracając rozkład prawdopodobieństwa zamiast wygenerowanego tekstu; Laya, Intern-Decision-4B, Kev i reszta tej niszy nie zgadzają się ze sobą co do długości kontekstu, więc to jedyna para, w której ten wymiar odpada, a porównanie trzeba uzasadniać na innej podstawie.

Tym czymś innym okazuje się kanał wejściowy. Model Microsoftu jest wyłącznie tekstowy, i to wprost: „nie przyjmuje ani nie generuje treści obrazowych, dźwiękowych ani wideo”. Model Liquid AI ma enkoder wizyjny SigLIP2 NaFlex z 400 mln parametrów na szkielecie językowym z 2,6 mld parametrów i osiąga łącznie 3,12 mld parametrów, a powstał dokładnie z myślą o tym, co Microsoft wykluczył — o ocenianiu zrzutu ekranu, zeskanowanego formularza lub klatki z kamery pod kątem z góry określonego pytania. Ten podział, w połączeniu z różnicą w licencji, która nie ma nic wspólnego z możliwościami, to cały ten pojedynek.

Tam, gdzie oba się zgadzają, co jest więcej, niż można by się spodziewać.

• Okno kontekstowe — 32 768 tokenów dla Microsoft-Decision-1 i 32 768 tokenów dla Liquid AI d1-3B.

• Kształt wyjścia — skalibrowane prawdopodobieństwa dla dostarczonych opcji; żaden nie generuje tekstu, a licznik użycia Liquid AI podaje ten fakt jako output_tokens: 0.

• Typy pytań — oba obsługują wybór dokumentu, uporządkowaną ocenę i binarne tak/nie, a także pozwalają zdefiniować zestaw opcji dla każdego żądania, zamiast ponownego trenowania głowicy słownictwa.

• Wstrzymanie się od odpowiedzi — Microsoft dokumentuje jawne opcje wstrzymania się, takie jak „nie potrafię powiedzieć”; schemat Decision Index firmy Liquid AI obsługuje to samo poprzez swój zestaw opcji.

• Wnioskowanie jednoprzebiegowe — jedno wywołanie na decyzję po obu stronach, co sprawia, że każde z nich jest wykonalne przy wolumenie potoku.

To, że dwa modele zgadzają się co do dwóch najtrudniejszych ograniczeń w tej niszy, zasługuje na chwilę zastanowienia. Okno 32K sprawia, że scorer decyzji nadaje się do użycia w przypadku pełnej umowy, wielostronicowej polityki lub długiego wątku wsparcia; angielski checkpoint Laya o rozmiarze 512 tokenów i limity pytań na wywołanie w Intern-Decision-4B już nie. Jeśli twoje dane wejściowe są krótkie, większość rozwiązań w tej dziedzinie jest wymienna, a decyzja sprowadza się do hostingu. Jeśli twoje dane wejściowe są długie, pole zawęża się do tych dwóch.

Poczucie, że tylko jedno z nich ma

Liquid AI d1-3B jest multimodalny, a drzewo modeli jasno ukazuje rodowód: LFM2.5-2.6B-Base, następnie LFM2.5-VL-3B, a potem d1-3B dotrenowany do skalibrowanych decyzji w jednym przebiegu. Obrazy wchodzą przez enkoder SigLIP2 NaFlex, a karta podaje średnią 74,1 w jedenastu publicznych benchmarkach obrazowych wobec 73,9 dla bazowego modelu wizyjnego — więc dostrajanie do decyzji nie odbyło się kosztem jakości wizyjnej. Podaje też odwrotny eksperyment: po usunięciu obrazów te same pytania spadają do 45,1, co jest najczystszym dowodem, jaki można uzyskać, że kanał percepcji pełni funkcję nośną, a nie dekoracyjną.

Microsoft-Decision-1 nie ma odpowiednika, a to pominięcie jest zamierzone, a nie niedokończone. Karta Microsoftu wymienia wśród obszarów poza zakresem: generowanie tekstu, odpowiadanie na pytania otwarte, konwersację, tłumaczenie i streszczanie, a osobno podaje, że model obsługuje wyłącznie tekst. Dla potoku, który musi ocenić zrzut ekranu formularza według rubryki albo zdecydować, czy klatka z kamery zawiera zdarzenie bezpieczeństwa, jest to twarda bariera — żadna inżynieria promptów nie odzyska modalności, której model nigdy nie otrzymał.

Jeśli chodzi o liczbę języków, jest odwrotnie, i to jest drugi prawdziwy podział. Microsoft-Decision-1 wymienia 25 obsługiwanych języków, a firma szczerze przyznaje, że pokrycie, jakość i kalibracja „mogą się różnić w zależności od języka”, wskazując języki inne niż angielski, a zwłaszcza języki o mniejszych zasobach, jako obszar słabszych wyników. Liquid AI d1-3B podaje 16 języków. Pod względem szerokości Microsoft jest na papierze z przodu; jeśli chodzi o szczerość co do tego, co oznacza szerokość, obaj dostawcy mówią coś podobnego i żaden nie opublikował kalibracji dla poszczególnych języków.

A generated two-column scoreboard for Microsoft-Decision-1 and Liquid AI d1-3B across six shared dimensions: context window 32,768 tokens for both; modality text-only versus text, images and audio through a 400M SigLIP2 NaFlex encoder on a 3.12B model; languages 25 versus 16; published scores none versus a vendor-scored value of 48.57 on Liquid AI's own Decision Index; weights not distributed versus lfm1.0 weights on Hugging Face; and latency not published versus 8 ms per decision on an RTX 4090 and 30 ms on an Apple M5 Pro. A footer notes both vendors' figures are self-reported and unreproduced.

Znowu zakładka benchmarku

Strona Foundry modelu Microsoft-Decision-1 zawiera zakładkę Benchmarks z sekcją metodologii i bez danych liczbowych: publiczne i społecznościowe benchmarki decyzyjne oraz odłożone zbiory wewnętrzne, metryki obejmujące dokładność i błąd kalibracji, zmieniany porządek opcji, sparowane testy statystyczne oraz twierdzenie, że model „osiąga wyniki na równi z wiodącymi modelami decyzyjnymi i wyprzedza inne otwarte modele decyzyjne oceniane według tej samej metodologii”. Nie ma czego sprawdzać, nie ma czego odtwarzać.

Liquid AI d1-3B publikuje 48,57 w Decision Index 0.2.1 — a kwalifikator ma większe znaczenie niż liczba, ponieważ Decision Index jest własnym indeksem Liquid AI, a d1-3B jest własnym modelem Liquid AI. Jest to wynik oceniony przez dostawcę na napisanym przez dostawcę benchmarku, pozycjonowany przez firmę jako najlepszy wśród modeli decyzyjnych poniżej 10B i wyprzedzający model 35B w tej samej skali. Traktuj 48,57 jako twierdzenie kierunkowe, a nie audytowaną liczbę. Obok tego karta wymienia wewnętrzne ewaluacje formatu decyzyjnego ze średnią 77,1, SQuAD 2.0 na 85,3, PAWS-X na 76,9 i DecisionBench 71,8 — wszystkie samodzielnie zgłoszone, a sformułowanie „poniżej 10B” jest prawdziwym kwalifikatorem, a nie wybiegiem, ponieważ model ma 3,12B.

Zatem kwestia kalibracji rozstrzyga się tak samo, jak w całej tej dziedzinie: Liquid AI podaje liczbę uzyskaną według własnej skali, Microsoft podaje metodologię i żadnej liczby, a żadne z nich nie dostarcza niezależnego pomiaru wykonanego przez podmiot trzeci. Jedyną wartością kalibracji, która będzie miała znaczenie dla twojego wdrożenia, jest ta, którą obliczysz na własnych oznaczonych danych.

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text describes a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, with quick facts listing publisher Microsoft, lifecycle Generally available (GA), context window 32768 and a Pricing field that links out rather than printing a rate.

Serwowanie, licencje i co tak naprawdę kupujesz

Opóźnienie d1-3B jest publikowane i to jest powód, dla którego ten model istnieje. Osiem milisekund na decyzję na RTX 4090, dziewięć na AMD MI325X, przy przepustowości packed wynoszącej 475 i 1106 na sekundę przy 64 stanach. Na sprzęcie brzegowym: 30 ms na Apple M5 Pro, 16 ms na Jetson AGX Thor, 26 ms na Jetson AGX Orin 64 GB, 50 ms na Orin Nano. Microsoft-Decision-1 nie publikuje żadnej wartości opóźnienia, a jego wbudowane opcje — hostowane API Foundry w modelu pay-as-you-go lub zarezerwowanej aprowizowanej przepustowości, z wyłączonym wnioskowaniem wsadowym — oznaczają, że mierzy się je poprzez własne wdrożenie. To nie jest mała różnica dla modelu, którego całym celem jest bycie wywoływanym raz na pobrany dokument lub proponowaną akcję.

Licencja to punkt, w którym te dwa modele rozchodzą się w sposób, który ludzi zaskakuje. Liquid AI d1-3B ma przypisaną licencję lfm1.0, a nie Apache 2.0 — tę samą licencję rodziny co reszta linii LFM firmy Liquid, która nakłada warunki użytkowania, jakich nie ma licencja permisywna. Jeśli twój dział prawny odczytuje to jako „zgodne z OpenAI i bez żadnych haczyków”, to nie jest ten przypadek, a warto to przeczytać, zanim model trafi na rynek, a nie po fakcie. Microsoft-Decision-1 nie ma w ogóle wag: to hostowany punkt końcowy z portfolio Direct from Azure, z uwierzytelnianiem Azure, ujednoliconym rozliczaniem, bez pobierania, a kwestię licencji zastępuje umowa o świadczenie usług. Żadnego z tych modeli nie można dostroić ścieżkami, które dokumentują dostawcy, co jest najostrzejszym ograniczeniem w przypadku modelu decyzyjnego — scorer, którego nie możesz dostosować do własnych etykiet, to scorer, którego trybów błędów nie naprawisz, możesz je tylko obejść.

Routing wokół nich to miejsce, w którym OrcaRouter należy w tym wzorcu, i to tylko po jednej jego stronie. Nie hostujemy ani Microsoft-Decision-1, ani Liquid AI d1-3B: żaden nie zwraca tekstu, żadnego nie ma w naszym katalogu, a endpoint do oceny prawdopodobieństwa nie jest celem chat-completions. To, co oferujemy, to generująca połowa pętli — model, który tworzy wersję roboczą odpowiedzi, którą oceni twój scorer, wyodrębnia pola, które osądzi twój scorer, lub proponuje działanie, które zatwierdzi twój scorer. To ponad 200 modeli za jednym kluczem kompatybilnym z OpenAI w cenie katalogowej dostawcy przekazywanej dalej z 0% marży, więc zmiana ceny przez dostawcę jest u nas widoczna tego samego dnia, a automatyczne przełączanie awaryjne obejmuje wywołanie generowania w pętli, która nie ma zapasu latencji na ponowienie.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

Dwa pewne typy i jeden, który nie jest nawet blisko

Wybierz Liquid AI d1-3B, jeśli cokolwiek w Twoim pipeline jest obrazem. Triaż zrzutów ekranu, ekstrakcja formularzy, routing QA wizualnego, moderator oceniający klatki z kamery — nie da się zmusić Microsoft-Decision-1 do zrobienia tego, a d1-3B został do tego stworzony, a opublikowane benchmarki wizyjne potwierdzają to twierdzenie. Wybierz go również, jeśli potrzebujesz wnioskowania brzegowego mierzonego w dziesiątkach milisekund na urządzeniu Jetson albo laptopie, jeśli chcesz mieć model na własnym sprzęcie, albo jeśli licencja, którą możesz przeczytać, wystarczy Twojemu zespołowi prawnemu.

Wybierz Microsoft-Decision-1 jeśli Twoje dane wejściowe to tekst, Twoje dokumenty są długie, Twoją bramką są zakupy — uwierzytelnianie w Azure, ujednolicone rozliczenia, ocena Responsible AI, dostawca, do którego można eskalować — lub Twój ruch obejmuje więcej niż 16 języków wymienionych przez d1-3B. Zaakceptuj, że brakująca wartość opóźnienia i brakująca tabela benchmarków oznaczają, że Twoje pierwsze dwa tygodnie z nim to pomiary, a nie integracja.

Jedyny przypadek, w którym nie ma wątpliwości, to praca multimodalna: tam wybór został dokonany, gdy Microsoft wpisał „text-only” do karty modelu.