
Microsoft-Decision-1 kontra Liquid AI d1-omni-600M: Oceniający, który słucha, kontra oceniający, który tylko czyta
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 za 1 mln tokenów · 55 tok/s
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
Kierujesz roszczeniami przy stanowisku ubezpieczeniowym, a akta przychodzą jako trzy rzeczy: plik PDF, zdjęcie wgniecionych drzwi i dziewięćdziesięciosekundowa rozmowa telefoniczna. Liquid AI d1-omni-600M potrafi odczytać dokument, obejrzeć zdjęcie i wysłuchać rozmowy, a następnie odpowiedzieć na zestaw pytań, które wcześniej napisałeś — czy to jest objęte ochroną, jaka kategoria, jak poważne, w skali od dwóch do dziesięciu — w jednym przebiegu, bez generowania tekstu i bez potrzeby parsowania czegokolwiek. Microsoft-Decision-1 potrafi odczytać dokument. Stał się ogólnie dostępny w Microsoft Foundry w dniu 8 października 2026 jako hostowany scorer wyłącznie tekstowy poddany treningowi końcowemu na Qwen3.5-9B z oknem 32 768 tokenów, a jego obsługa wejścia na tym się kończy: brak obrazu, brak dźwięku, brak wideo. Oba zwracają skalibrowane prawdopodobieństwa dla opcji, które podasz, oba emitują zero tokenów wyjściowych i żaden nie opublikował wartości kalibracyjnej.
To ostatnie wspólne zdanie jest niewygodną częścią tego porównania. Te dwa modele decyzyjne — z najszerszym i najwęższym czujnikiem, jakie w tym miesiącu trafiły na rynek — mimo całego dystansu architektonicznego między nimi znalazły się dokładnie w tej samej sytuacji dowodowej: prawdziwe wagi lub prawdziwy punkt końcowy, udokumentowane kontrakty i żadna liczba, na którą ktokolwiek spoza dostawcy mógłby wskazać, gdy ktoś zapyta, czy prawdopodobieństwa są godne zaufania.
Dwa pochodzenia, nie dwa rozmiary
Liczba 587M zachęca, by odczytywać Liquid AI d1-omni-600M jako pomniejszonego krewnego modeli, które ten blog już wcześniej omawiał. Tak jednak nie jest. Model jest trenowany na bazie LFM2.5-Encoder-350M, dwukierunkowego enkodera, ze wspólnym trzonem i głowicą decyzyjną o rozmiarze 381M, enkodera wizyjnego o rozmiarze 94M zaczerpniętego z linii LFM2.5-VL-450M oraz 17-warstwowego FastConformer do obsługi dźwięku. Microsoft-Decision-1 należy do zupełnie innej linii: to dekoder Qwen3.5-9B, poddany post-trainingowi przez Microsoft, hostowany w Foundry, o wagach, które nie są udostępniane, i bez oferowanej ścieżki dostrajania.
Dwukierunkowy kontra dekoder to fakt architektoniczny, który decyduje o tym, jak każde z nich się zachowuje, i to również wyjaśnia, dlaczego liczby parametrów są tylko rozproszeniem uwagi. Dwukierunkowy enkoder odczytuje cały stan naraz, co jest właściwym kształtem do wydawania osądu na podstawie ustalonego wejścia; dekoder po dodatkowym treningu rezygnuje ze ścieżki generowania, ale zachowuje tokenizer, okno oraz korporacyjne opakowanie, które wiążą się z wdrożeniem w foundry. Żadne z nich nie jest przeskalowaną wersją drugiego i nie można ich zamieniać jedno na drugie, niezależnie od tego, jak czyta się tabelę benchmarków.
Co lista wejściowa faktycznie ci daje
To tutaj d1-omni-600M najmocniej odbiega od wszystkiego innego w tej kategorii i tutaj pewne twierdzenie trzeba czytać bardzo uważnie.
• Mowa — Liquid AI d1-omni-600M przyjmuje tekst oraz do 30 sekund mowy i wydaje na tej podstawie decyzję, czego żaden oceniający oparty wyłącznie na tekście nie jest w stanie zrobić przy żadnej dokładności. Modalności inne niż tekstowe w Microsoft-Decision-1 nie istnieją.
• Wzajemne wykluczanie — d1-omni-600M zgłasza ValueError, jeśli obrazy i dźwięk pojawią się w tym samym żądaniu. Najszersza powierzchnia czujników w tej kategorii to wciąż jedna modalność nietekstowa naraz, co stanowi realne ograniczenie dla tego stanowiska ds. roszczeń.
• Przycinanie — jej karta podaje 16 384 łącznych pozycji tekstu, obrazu i dźwięku oraz dodaje, że gdy obecne są obrazy, tekst stanu i pytania jest przycinany do 896 tokenów, aby dopasować się do treningu. Dokument, do którego dołączasz zdjęcie, konkuruje z tym przycinaniem. Wszystkie 32 768 tokenów Microsoft-Decision-1 to tekst i nie są przycinane.
• Formaty — d1-omni-600M ma trzy typy pytań: noul do decyzji binarnej zwracającej P(tak) między 0 a 1, choice dla jednej etykiety z zestawu, który nazwiesz, z ufnością i prawdopodobieństwem dla każdej opcji, oraz score dla pozycji na uporządkowanej skali od dwóch do dziesięciu poziomów wraz z jego rozkładem. Kilka pytań zależy od jednego stanu i jest odczytywane w jednym przebiegu, a licznik użycia raportuje output_tokens: 0. Microsoft opisuje formy tak/nie, wielokrotnego wyboru, oceny, klasyfikacji i rubryk, a także jawnie obsługiwaną opcję wstrzymania się, taką jak „nie można stwierdzić”, gdy dowody są niewystarczające — jedyny szczegół projektowy na stronie Microsoft, który nie ma tutaj bezpośredniego odpowiednika.
• Środowisko uruchomieniowe — d1-omni-600M dostarcza własny kod, wymaga trust_remote_code=True, a jego karta zaleca float16 na GPU, ostrzegając jednocześnie, że bfloat16 zmienił najlepszą odpowiedź w niektórych wierszach. To wrażliwość w czasie obsługi udokumentowana przez dostawcę, a nie defekt. Microsoft-Decision-1 to zarządzany punkt końcowy, w którym kształt wdrożenia jest jedyną zmienną środowiska uruchomieniowego, i warto zauważyć, że wnioskowanie wsadowe jest wyłączone: nie ma kanału offline, przez który można by amortyzować zbiorcze uruchomienie oceniania.

Luka dowodowa, w obu kierunkach
Liquid AI opublikowało otwartą rodzinę d1, w tym d1-omni-600M, 7 października 2026 r. wraz z wpisem zapowiadającym wydanie i zestawem dokumentacji. Nie opublikowano natomiast liczby, która uczyniłaby twierdzenie o multimodalności konkretnym. Nie istnieje żaden benchmark dokładności odnoszący się do jej własnej flagowej możliwości — jakości decyzji opartych na obrazie i dźwięku, która uzasadnia kodery 94M i 112M — a część wizyjna została wstrzymana w udostępnionych materiałach ewaluacyjnych. Nie opublikowano też żadnej wartości opóźnienia, więc wydajność modelu to coś, co odkrywa się na własnym sprzęcie.
Pozycja Microsoftu jest strukturalnie identyczna i o krok dalej. Jego zakładka Benchmarki wymienia metryki — dokładność, błąd kalibracji, czułość bezpieczeństwa, wskaźniki fałszywie dodatnich, spójność sprawiedliwości — stwierdza, że ocena została przeprowadzona na publicznych i społecznościowych benchmarkach decyzyjnych oraz na wydzielonych wewnętrznych zestawach testowych nieużywanych w treningu, że kolejność opcji była zmieniana i że zastosowano sparowane testy statystyczne, a także twierdzi, że model „osiąga wyniki na poziomie wiodących modeli decyzyjnych i wyprzedza inne otwarte modele decyzyjne oceniane według tej samej metodologii”. Nie publikuje żadnych wyników. Wymieniono dwadzieścia pięć obsługiwanych języków, w tym japoński, koreański, arabski, wietnamski, tajski, turecki, hindi, bengalski, suahili, hebrajski, perski i ukraiński, ze szczerym ostrzeżeniem, że zasięg, jakość i kalibracja „mogą się różnić w zależności od języka”, a języki inne niż angielski, zwłaszcza te o mniejszych zasobach, stanowią słaby punkt. Cennik również nie znajduje się na stronie modelu; zamiast tego zamieszczono link do strony cennika Microsoftu.
Zatem porównanie tych dwóch nie polega na zestawieniu dowodów z dowodami. To wybór między dwoma rodzajami brakującej liczby. Liquid AI dostarczyło powierzchnię sensoryczną i pozostawiło dokładność tej powierzchni niezmierzoną publicznie. Microsoft dostarczył ścieżkę zakupową — uwierzytelnianie Azure, zarządzanie, ocenę Responsible AI, udokumentowaną metodologię — a kalibrację produktu probabilistycznego pozostawił nieokreśloną ilościowo.

Pytanie kalibracyjne, na które żadne z nich nie odpowiada.
Dla modelu decyzyjnego prawdopodobieństwo jest produktem. Wszystko, co następuje dalej, to próg: 0,7 eskaluje, 0,95 automatycznie akceptuje, a koszt błędnego wyznaczenia tej granicy ponosi się w postaci złych automatycznych decyzji, a nie w tokenach. W tej kategorii istnieje co najmniej jedna rodzina, która publikuje te dane — punkty kontrolne Intern-Decision od InternLM podają na swoich kartach modeli wartości Brier i oczekiwanego błędu kalibracji — a żaden z modeli w tym artykule tego nie robi. Ta asymetria jest praktycznym powodem, by utrzymywać szerokie pole, zamiast decydować wyłącznie na podstawie architektury.
Dobra wiadomość jest taka, że ten test jest tani i nie wymaga współpracy dostawcy. Zbierz kilkaset oznaczonych przypadków, które wyglądają jak Twój rzeczywisty ruch, napisz schemat pytań, który Twoja aplikacja faktycznie wysyłałaby, przepuść przez nie oba modele i oblicz oczekiwany błąd kalibracji na wynikach. Dowiesz się wtedy dwóch rzeczy, których obecnie nie zna nikt poza tymi dwoma dostawcami: jak dobrze prawdopodobieństwa Microsoft-Decision-1 pokrywają się z jego dokładnością na Twoim rozkładzie oraz czy ścieżki audio i obrazu modelu d1-omni-600M są warte enkoderów, które ze sobą niosą. Własne udokumentowane wytyczne Microsoftu wskazują ten sam kierunek — waliduj na reprezentatywnych danych, ustalaj progi na podstawie kosztu swoich błędów, zawsze uwzględniaj opcję wstrzymania się, losowo zmieniaj kolejność opcji, utrzymuj człowieka w pętli przy decyzjach o istotnych konsekwencjach.
Gdzie każde z nich należy, a gdzie OrcaRouter
Microsoft-Decision-1 należy stosować wszędzie tam, gdzie materiał decydujący ma postać tekstu, a przeszkodą jest zaopatrzenie: długi dokument, wyszukany fragment, proponowane wywołanie narzędzia, wygenerowana odpowiedź oceniana według rubryki, z uwierzytelnianiem Azure, ujednoliconym rozliczaniem i oceną dostawcy wymaganymi, zanim cokolwiek trafi do produkcji. To węższe narzędzie i łatwiejsze do zatwierdzenia.
Liquid AI d1-omni-600M należy wszędzie tam, gdzie decydujący materiał nie jest tekstem — zdjęcie załączone do formularza, krótkie nagranie rozmowy, zrzut ekranu — i wszędzie tam, gdzie chcesz mieć wagi lfm1.0, które możesz uruchamiać i dostrajać w granicach, które kontrolujesz. To szersze narzędzie i trudniejsze do zwalidowania, ponieważ twierdzenie o multimodalności to dokładnie ta część, za którą nie stoi żaden opublikowany benchmark.

Żaden z nich nie znajduje się w naszym katalogu i nic tutaj nie stanowi zapewnienia o dostępności któregokolwiek z nich. Model, który zwraca prawdopodobieństwa zamiast tekstu, nie jest czymś, do czego kierujesz uzupełnienia czatu, a pozostawanie poza fotelem oceniającego to cały zamysł tego instrumentu. To, co oferuje OrcaRouter, to generatywna strona tej samej pętli: ponad 200 modeli stojących za jednym kluczem zgodnym z OpenAI, które piszą rubrykę, według której ocenia Twój scorer, transkrybują lub streszczają materiał, zanim stanie się on stanem, i emitują wywołanie narzędzia, które Twój scorer zatwierdza, zanim zostanie ono wykonane. Cena katalogowa dostawcy jest przekazywana przy 0% marży, więc obniżka ceny dostawcy po stronie generatywnej obowiązuje u nas tego samego dnia. Automatyczne przełączanie awaryjne utrzymuje tę stronę przy życiu, gdy pojedynczy dostawca ulega degradacji — co od razu zauważa potok oceniający każdy pobrany dokument — a jeśli chcesz, aby oceniano kilku autorów zamiast jednego, routing DSL składa ich w jedno wywołanie, a model fusion raportuje ich zgodność jako pole, które Twój scorer może odczytać jak każde inne.
Konkluzja
Microsoft-Decision-1 osiągnął ogólną dostępność na Microsoft Foundry 8 października 2026 r.: tylko tekst, 32 768 tokenów, zbudowany na dotrenowanym Qwen3.5-9B, hostowany bez wag, bez ceny na stronie modelu, bez danych o opóźnieniu i z sekcją benchmarków, która opisuje jego metodologię, nie podając wyniku. Liquid AI d1-omni-600M został wgrany 7 października 2026 r. jako 587M model decyzyjny z dwukierunkowym enkoderem, który odczytuje tekst, obrazy lub 30 sekund mowy — jedną modalność nietekstową naraz, przy czym tekst jest przycinany do 896 tokenów, gdy obecne są obrazy — na licencji lfm1.0, bez benchmarku dokładności dla swojej głównej możliwości, bez podziału na wizję i bez publikowanego opóźnienia. Wybieraj na podstawie modalności i kontroli, a nie wyników, ponieważ wyniki nie istnieją: jeśli twoim materiałem jest fotografia lub rozmowa telefoniczna, tylko jeden z nich może odpowiedzieć, a jeśli jest to czterdziestostronicowy dokument z dołączonym przeglądem zakupowym, można wdrożyć tylko drugi.
To, co niesie OrcaRouter, to generatywna strona tej samej pętli: ponad 200 modeli za jednym kluczem zgodnym z OpenAI, które piszą rubrykę, według której ocenia twój scorer, transkrybują lub streszczają materiał, zanim ten stanie się stanem, i emitują wywołanie narzędzia, które twój scorer zatwierdza, zanim zostanie ono wykonane.
