
Microsoft-Decision-1 kontra Liquid AI d1-3B: To samo okno 32K, dwa różne sensy
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 za 1 mln tokenów
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
Tym razem specyfikacja się zgadza. Microsoft-Decision-1, ogólnie dostępny w Microsoft Foundry od 8 października 2026 r., przyjmuje 32 768 tokenów kontekstu. To samo dotyczy Liquid AI d1-3B, wgranego do Hugging Face 5 października 2026 r. i ogłoszonego przez Liquid AI dwa dni później. Oba przyjmują stan oraz zestaw pytań określonego rodzaju — tak/nie, wybór spośród nazwanych opcji, pozycję na uporządkowanej skali — i oba odpowiadają w jednym przebiegu w przód, zwracając rozkład prawdopodobieństwa zamiast wygenerowanego tekstu; Laya, Intern-Decision-4B, Kev i reszta tej niszy nie zgadzają się ze sobą co do długości kontekstu, więc to jedyna para, w której ten wymiar odpada, a porównanie trzeba uzasadniać na innej podstawie.
Tym czymś innym okazuje się kanał wejściowy. Model Microsoftu jest wyłącznie tekstowy, i to wprost: „nie przyjmuje ani nie generuje treści obrazowych, dźwiękowych ani wideo”. Model Liquid AI ma enkoder wizyjny SigLIP2 NaFlex z 400 mln parametrów na szkielecie językowym z 2,6 mld parametrów i osiąga łącznie 3,12 mld parametrów, a powstał dokładnie z myślą o tym, co Microsoft wykluczył — o ocenianiu zrzutu ekranu, zeskanowanego formularza lub klatki z kamery pod kątem z góry określonego pytania. Ten podział, w połączeniu z różnicą w licencji, która nie ma nic wspólnego z możliwościami, to cały ten pojedynek.
Tam, gdzie oba się zgadzają, co jest więcej, niż można by się spodziewać.
• Okno kontekstowe — 32 768 tokenów dla Microsoft-Decision-1 i 32 768 tokenów dla Liquid AI d1-3B.
• Kształt wyjścia — skalibrowane prawdopodobieństwa dla dostarczonych opcji; żaden nie generuje tekstu, a licznik użycia Liquid AI podaje ten fakt jako output_tokens: 0.
• Typy pytań — oba obsługują wybór dokumentu, uporządkowaną ocenę i binarne tak/nie, a także pozwalają zdefiniować zestaw opcji dla każdego żądania, zamiast ponownego trenowania głowicy słownictwa.
• Wstrzymanie się od odpowiedzi — Microsoft dokumentuje jawne opcje wstrzymania się, takie jak „nie potrafię powiedzieć”; schemat Decision Index firmy Liquid AI obsługuje to samo poprzez swój zestaw opcji.
• Wnioskowanie jednoprzebiegowe — jedno wywołanie na decyzję po obu stronach, co sprawia, że każde z nich jest wykonalne przy wolumenie potoku.
To, że dwa modele zgadzają się co do dwóch najtrudniejszych ograniczeń w tej niszy, zasługuje na chwilę zastanowienia. Okno 32K sprawia, że scorer decyzji nadaje się do użycia w przypadku pełnej umowy, wielostronicowej polityki lub długiego wątku wsparcia; angielski checkpoint Laya o rozmiarze 512 tokenów i limity pytań na wywołanie w Intern-Decision-4B już nie. Jeśli twoje dane wejściowe są krótkie, większość rozwiązań w tej dziedzinie jest wymienna, a decyzja sprowadza się do hostingu. Jeśli twoje dane wejściowe są długie, pole zawęża się do tych dwóch.
Poczucie, że tylko jedno z nich ma
Liquid AI d1-3B jest multimodalny, a drzewo modeli jasno ukazuje rodowód: LFM2.5-2.6B-Base, następnie LFM2.5-VL-3B, a potem d1-3B dotrenowany do skalibrowanych decyzji w jednym przebiegu. Obrazy wchodzą przez enkoder SigLIP2 NaFlex, a karta podaje średnią 74,1 w jedenastu publicznych benchmarkach obrazowych wobec 73,9 dla bazowego modelu wizyjnego — więc dostrajanie do decyzji nie odbyło się kosztem jakości wizyjnej. Podaje też odwrotny eksperyment: po usunięciu obrazów te same pytania spadają do 45,1, co jest najczystszym dowodem, jaki można uzyskać, że kanał percepcji pełni funkcję nośną, a nie dekoracyjną.
Microsoft-Decision-1 nie ma odpowiednika, a to pominięcie jest zamierzone, a nie niedokończone. Karta Microsoftu wymienia wśród obszarów poza zakresem: generowanie tekstu, odpowiadanie na pytania otwarte, konwersację, tłumaczenie i streszczanie, a osobno podaje, że model obsługuje wyłącznie tekst. Dla potoku, który musi ocenić zrzut ekranu formularza według rubryki albo zdecydować, czy klatka z kamery zawiera zdarzenie bezpieczeństwa, jest to twarda bariera — żadna inżynieria promptów nie odzyska modalności, której model nigdy nie otrzymał.
Jeśli chodzi o liczbę języków, jest odwrotnie, i to jest drugi prawdziwy podział. Microsoft-Decision-1 wymienia 25 obsługiwanych języków, a firma szczerze przyznaje, że pokrycie, jakość i kalibracja „mogą się różnić w zależności od języka”, wskazując języki inne niż angielski, a zwłaszcza języki o mniejszych zasobach, jako obszar słabszych wyników. Liquid AI d1-3B podaje 16 języków. Pod względem szerokości Microsoft jest na papierze z przodu; jeśli chodzi o szczerość co do tego, co oznacza szerokość, obaj dostawcy mówią coś podobnego i żaden nie opublikował kalibracji dla poszczególnych języków.

Znowu zakładka benchmarku
Strona Foundry modelu Microsoft-Decision-1 zawiera zakładkę Benchmarks z sekcją metodologii i bez danych liczbowych: publiczne i społecznościowe benchmarki decyzyjne oraz odłożone zbiory wewnętrzne, metryki obejmujące dokładność i błąd kalibracji, zmieniany porządek opcji, sparowane testy statystyczne oraz twierdzenie, że model „osiąga wyniki na równi z wiodącymi modelami decyzyjnymi i wyprzedza inne otwarte modele decyzyjne oceniane według tej samej metodologii”. Nie ma czego sprawdzać, nie ma czego odtwarzać.
Liquid AI d1-3B publikuje 48,57 w Decision Index 0.2.1 — a kwalifikator ma większe znaczenie niż liczba, ponieważ Decision Index jest własnym indeksem Liquid AI, a d1-3B jest własnym modelem Liquid AI. Jest to wynik oceniony przez dostawcę na napisanym przez dostawcę benchmarku, pozycjonowany przez firmę jako najlepszy wśród modeli decyzyjnych poniżej 10B i wyprzedzający model 35B w tej samej skali. Traktuj 48,57 jako twierdzenie kierunkowe, a nie audytowaną liczbę. Obok tego karta wymienia wewnętrzne ewaluacje formatu decyzyjnego ze średnią 77,1, SQuAD 2.0 na 85,3, PAWS-X na 76,9 i DecisionBench 71,8 — wszystkie samodzielnie zgłoszone, a sformułowanie „poniżej 10B” jest prawdziwym kwalifikatorem, a nie wybiegiem, ponieważ model ma 3,12B.
Zatem kwestia kalibracji rozstrzyga się tak samo, jak w całej tej dziedzinie: Liquid AI podaje liczbę uzyskaną według własnej skali, Microsoft podaje metodologię i żadnej liczby, a żadne z nich nie dostarcza niezależnego pomiaru wykonanego przez podmiot trzeci. Jedyną wartością kalibracji, która będzie miała znaczenie dla twojego wdrożenia, jest ta, którą obliczysz na własnych oznaczonych danych.

Serwowanie, licencje i co tak naprawdę kupujesz
Opóźnienie d1-3B jest publikowane i to jest powód, dla którego ten model istnieje. Osiem milisekund na decyzję na RTX 4090, dziewięć na AMD MI325X, przy przepustowości packed wynoszącej 475 i 1106 na sekundę przy 64 stanach. Na sprzęcie brzegowym: 30 ms na Apple M5 Pro, 16 ms na Jetson AGX Thor, 26 ms na Jetson AGX Orin 64 GB, 50 ms na Orin Nano. Microsoft-Decision-1 nie publikuje żadnej wartości opóźnienia, a jego wbudowane opcje — hostowane API Foundry w modelu pay-as-you-go lub zarezerwowanej aprowizowanej przepustowości, z wyłączonym wnioskowaniem wsadowym — oznaczają, że mierzy się je poprzez własne wdrożenie. To nie jest mała różnica dla modelu, którego całym celem jest bycie wywoływanym raz na pobrany dokument lub proponowaną akcję.
Licencja to punkt, w którym te dwa modele rozchodzą się w sposób, który ludzi zaskakuje. Liquid AI d1-3B ma przypisaną licencję lfm1.0, a nie Apache 2.0 — tę samą licencję rodziny co reszta linii LFM firmy Liquid, która nakłada warunki użytkowania, jakich nie ma licencja permisywna. Jeśli twój dział prawny odczytuje to jako „zgodne z OpenAI i bez żadnych haczyków”, to nie jest ten przypadek, a warto to przeczytać, zanim model trafi na rynek, a nie po fakcie. Microsoft-Decision-1 nie ma w ogóle wag: to hostowany punkt końcowy z portfolio Direct from Azure, z uwierzytelnianiem Azure, ujednoliconym rozliczaniem, bez pobierania, a kwestię licencji zastępuje umowa o świadczenie usług. Żadnego z tych modeli nie można dostroić ścieżkami, które dokumentują dostawcy, co jest najostrzejszym ograniczeniem w przypadku modelu decyzyjnego — scorer, którego nie możesz dostosować do własnych etykiet, to scorer, którego trybów błędów nie naprawisz, możesz je tylko obejść.
Routing wokół nich to miejsce, w którym OrcaRouter należy w tym wzorcu, i to tylko po jednej jego stronie. Nie hostujemy ani Microsoft-Decision-1, ani Liquid AI d1-3B: żaden nie zwraca tekstu, żadnego nie ma w naszym katalogu, a endpoint do oceny prawdopodobieństwa nie jest celem chat-completions. To, co oferujemy, to generująca połowa pętli — model, który tworzy wersję roboczą odpowiedzi, którą oceni twój scorer, wyodrębnia pola, które osądzi twój scorer, lub proponuje działanie, które zatwierdzi twój scorer. To ponad 200 modeli za jednym kluczem kompatybilnym z OpenAI w cenie katalogowej dostawcy przekazywanej dalej z 0% marży, więc zmiana ceny przez dostawcę jest u nas widoczna tego samego dnia, a automatyczne przełączanie awaryjne obejmuje wywołanie generowania w pętli, która nie ma zapasu latencji na ponowienie.

Dwa pewne typy i jeden, który nie jest nawet blisko
Wybierz Liquid AI d1-3B, jeśli cokolwiek w Twoim pipeline jest obrazem. Triaż zrzutów ekranu, ekstrakcja formularzy, routing QA wizualnego, moderator oceniający klatki z kamery — nie da się zmusić Microsoft-Decision-1 do zrobienia tego, a d1-3B został do tego stworzony, a opublikowane benchmarki wizyjne potwierdzają to twierdzenie. Wybierz go również, jeśli potrzebujesz wnioskowania brzegowego mierzonego w dziesiątkach milisekund na urządzeniu Jetson albo laptopie, jeśli chcesz mieć model na własnym sprzęcie, albo jeśli licencja, którą możesz przeczytać, wystarczy Twojemu zespołowi prawnemu.
Wybierz Microsoft-Decision-1 jeśli Twoje dane wejściowe to tekst, Twoje dokumenty są długie, Twoją bramką są zakupy — uwierzytelnianie w Azure, ujednolicone rozliczenia, ocena Responsible AI, dostawca, do którego można eskalować — lub Twój ruch obejmuje więcej niż 16 języków wymienionych przez d1-3B. Zaakceptuj, że brakująca wartość opóźnienia i brakująca tabela benchmarków oznaczają, że Twoje pierwsze dwa tygodnie z nim to pomiary, a nie integracja.
Jedyny przypadek, w którym nie ma wątpliwości, to praca multimodalna: tam wybór został dokonany, gdy Microsoft wpisał „text-only” do karty modelu.
