
Microsoft-Decision-1: Model Microsoftu, który odpowiada liczbą zamiast zdania
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 za 1 mln tokenów · 79 tok/s
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 355 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
Microsoft-Decision-1 ma w swojej karcie modelu zapis, którego nie miał nigdy żaden inny model Microsoftu: nie jest przeznaczony do generowania tekstu. Model stał się ogólnie dostępny w Microsoft Foundry 8 października 2026 r., i jest to celowe zawężenie tego, do czego służy model językowy. Przekazujesz mu sytuację i pytanie z ustaloną listą odpowiedzi — tak/nie, zestaw wielokrotnego wyboru, skalę ocen, rubrykę — a on zwraca skalibrowane prawdopodobieństwo dla każdej opcji. Bez prozy. Bez wyjaśnień. Bez pola na uzasadnienie. Dane wyjściowe to liczby JSON i nic więcej. Jest zbudowany na modelu o otwartych wagach Qwen3.5-9B, dostrojonym przez Microsoft, a Microsoft twierdzi, że później przeniesie model na inne szkielety, wymieniając MAI i inne modele partnerskie.
To dziwniejszy produkt, niż się z początku wydaje. Pozycja konkurencyjna Microsoftu w 2026 r. opiera się na najnowocześniejszych modelach czatu i na Copilocie, a Microsoft-Decision-1 jest przeciwieństwem obu: to średniej wielkości, jednozadaniowy model oceniający, którego całym zadaniem jest powiedzenie aplikacji, która z twoich własnych opcji jest najprawdopodobniej poprawna i jak bardzo jest tego pewien. Ciekawe pytanie nie dotyczy tego, czy jest dobry w pisaniu — jest w tym wyraźnie zły i nawet nie próbuje — lecz tego, czy rozkład prawdopodobieństwa na opcjach jest bardziej użytecznym prymitywem dla obciążeń, które przedsiębiorstwa faktycznie uruchamiają, niż kolejny model ogólnego przeznaczenia z trybem JSON.
Co dokładnie robi
Kontrakt jest następujący: jedno wywołanie na wejściu, jeden rozkład na wyjściu. Microsoft wymienia obsługiwane formaty pytań jako tak/nie, wielokrotny wybór, ocenę, klasyfikację i oparte na rubrykach. Każda opcja otrzymuje wynik. Model działa w ramach pojedynczego wywołania na danych wejściowych o rozmiarze do 32 tys. tokenów — podane okno kontekstu to 32 768 — a praktycznym ograniczeniem jest rozmiar danych wejściowych plus zestaw opcji, a nie budżet generowania, ponieważ generowanie nie występuje.
Opublikowane przypadki użycia to te, które zespół rozpoznałby:
• Ocena danych wyjściowych AI — oceń wygenerowaną odpowiedź według dostarczonej rubryki albo zdecyduj, czy jest oparta na przekazanych jej dowodach.
• Klasyfikacja i routing — sklasyfikuj żądanie, oceń istotność, przeprowadź triage kolejki, wybierz gałąź przepływu pracy.
• Zabezpieczenia agenta — oceń proponowane wywołanie narzędzia lub działanie agenta, zanim aplikacja integrująca pozwoli na jego wykonanie.
• Kontrola bezpieczeństwa treści — oznaczaj treści względem progów zdefiniowanych przez aplikację, a nie stałej polityki dostawcy.
• Trafność wyszukiwania i dokumentów — oceń, czy wyszukany dokument odpowiada na zadane pytanie.
• Automatyzacja oparta na poziomie pewności — automatycznie akceptuj wyniki o wysokim poziomie pewności, a pozostałe przekazuj do obsługi przez człowieka.
Warto zwrócić uwagę na opcję wstrzymania się od odpowiedzi. Microsoft wyraźnie obsługuje opcje takie jak „nie można stwierdzić”, gdy dostarczone dowody są niewystarczające — to różnica między oceniającym, który jest skalibrowany, a takim, który jest jedynie pewny siebie. A ponieważ wyniki wracają jako liczby, próg eskalacji jest decyzją, która należy do ciebie — to ty ustalasz, kiedy 0,7 wysyła coś do człowieka, a 0,95 już nie.
Czego nie zrobi
Microsoft jest wyjątkowo jednoznaczny, jeśli chodzi o wyłączenia, i mają one większe znaczenie niż lista funkcji dla każdego, kto ocenia to pod kątem rzeczywistego potoku przetwarzania. Microsoft-Decision-1 nie jest przeznaczony do generowania tekstu, odpowiadania na pytania otwarte, prowadzenia rozmów, tłumaczenia ani streszczania. Nie jest przeznaczony do zadań bez zamkniętego pytania i zdefiniowanego zestawu opcji odpowiedzi ani do zadań wymagających wiedzy nieobecnej w danych wejściowych. Obsługuje wyłącznie tekst: brak obrazów, dźwięku i wideo na wejściu, brak na wyjściu. Nie dostarcza żadnych wyjaśnień ani uzasadnień.
Przeczytaj je razem, a pojawi się granica, o którą łatwo się potknąć. To nie chatbot, którego można poprosić, żeby dodatkowo klasyfikował rzeczy, i nie sumaryzator, do którego można dokręcić ocenę. To funkcja oceniająca z budżetem tokenów. Sposób, w jaki ujmuje to sam zespół — że nie powinna być jedynym automatycznym decydentem w doniosłych decyzjach dotyczących ludzi i nie powinna stanowić jedynej podstawy decyzji dotyczących kredytu, zatrudnienia, mieszkalnictwa, ubezpieczeń, edukacji, opieki zdrowotnej, praw prawnych „lub podobnie doniosłych dziedzin" — wskazuje w tym samym kierunku. Została zaprojektowana, by stać obok decyzji, a nie nią być.

Sytuacja z benchmarkami to historia, której nikt nie chce drukować
Nie ma tam żadnych liczb. Strona katalogowa Microsoft Foundry dla modelu Microsoft-Decision-1 ma zakładkę Benchmarks i jest pusta, jeśli chodzi o dane liczbowe. Zamiast tego zawiera akapit metodologiczny oraz twierdzenie jakościowe: model został „oceniony na publicznych i społecznościowych benchmarkach decyzyjnych oraz na odłożonych wewnętrznych zestawach testowych niewykorzystanych w treningu”, Microsoft podaje, że „osiąga wyniki na równi z wiodącymi modelami decyzyjnymi i wyprzedza inne otwarte modele decyzyjne oceniane tą samą metodologią”, a stosowane metryki to dokładność, błąd kalibracji, czułość w zakresie bezpieczeństwa, odsetki wyników fałszywie dodatnich i spójność pod względem sprawiedliwości, przy czym zmieniano kolejność opcji i stosowano sparowane testy statystyczne.

To jest poważny opis metodologii dołączony do zera opublikowanych wyników. Oznacza to, że każde twierdzenie o wydajności Microsoft-Decision-1 jest dziś raportowane przez dostawcę i nieodtworzone, a uczciwym stanowiskiem dla każdego, kto go ocenia, jest to, że kalibracja — jedyna właściwość, która w ogóle czyni prawdopodobieństwo użytecznym — jest niezweryfikowana poza Microsoftem. Firma wskazuje jednak, gdzie jej zdaniem model jest najsilniejszy i najsłabszy, co jest bardziej użyteczne niż wynik z nagłówka: najsilniejszy w rozumowaniu, stosowaniu reguł i odporności na formatowanie podpowiedzi; konkurencyjny w klasyfikacji, wyszukiwaniu, sprawiedliwości, użyciu narzędzi i większości zadań wielojęzycznych; słabszy w zadaniach wymagających specjalistycznej wiedzy dziedzinowej.
Ograniczenia podane przez producenta warto przeczytać przed listą funkcji. Wyniki mogą się zmieniać w zależności od sformułowania i kolejności opcji, a źle sformułowane pytanie nadal zwraca wynik. Kalibracja jest najlepsza w przypadku znanych typów zadań. Model może opierać się na nieaktualnej wiedzy i nie podaje żadnych wyjaśnień. Jeśli chodzi o obsługę wielu języków: jako obsługiwane wymieniono 25 języków, w tym japoński, koreański, arabski, wietnamski, tajski, turecki, hindi, bengalski, suahili, hebrajski, perski i ukraiński, ale Microsoft twierdzi, że pokrycie, jakość i kalibracja „mogą się różnić w zależności od języka”, i wymienia języki inne niż angielski — zwłaszcza te o mniejszych zasobach — jako obszar słabszych wyników. Bazowy Qwen3.5-9B obsługuje ponad 200 języków; model poddany treningowi końcowemu obsługuje jedną czwartą tej liczby.
Jak to zdobyć i ile to kosztuje
Microsoft-Decision-1 jest dystrybuowany jako hostowane API w Microsoft Foundry w ramach portfolio „Direct from Azure”. Wagi modelu nie są dystrybuowane — to nie jest wydanie z otwartymi wagami i nie ma repozytorium Hugging Face, z którego można by go pobrać. Każda aplikacja, która może wysyłać żądania HTTPS, może integrować się za pomocą punktów końcowych Foundry i standardowego uwierzytelniania Azure. Lista wdrożeń pokazuje opcje bezserwerowe i ujednoliconego punktu końcowego w modelu płatności za użycie lub zarezerwowanej aprowizowanej przepustowości, standardowa jednostka SKU, z wyłączonym wnioskowaniem wsadowym, a ujawnienie dotyczące trenowania podaje, że zbiór danych treningowych został po raz pierwszy użyty we wrześniu 2026 r., a jego zbieranie trwa.
Ceny nie są publikowane na stronie modelu. Pole cenowe w katalogu prowadzi do strony cennika modeli Microsoft, zamiast podawać stawkę za tokeny wejściowe i wyjściowe, więc koszt za token wywołania Decision-1 trzeba sprawdzić w obszarze cennika Azure albo odczytać z faktury. To realna luka dla każdego, kto próbuje modelować koszt na decyzję przy dużej skali, i warto powiedzieć to wprost, zamiast szacować. Gdy już to wyceniasz, warto wiedzieć dwie rzeczy: 0% kosztu stanowią tokeny wyjściowe, bo ich nie ma, a wnioskowanie wsadowe jest wyłączone, więc nie można amortyzować masowego przebiegu scoringu przez kanał wsadowy tak, jak zrobiłoby się to w przypadku modelu generatywnego.
Miejsce OrcaRouter w tym wszystkim jest po drugiej stronie wywołania. Nie hostujemy Microsoft-Decision-1 i nie ma go w naszym katalogu — model, który zwraca prawdopodobieństwa, a nie model, do którego kierujesz uzupełnienia czatu. To, co mamy, to ta połowa wzorca, która generuje: modele, które piszą rubrykę, tworzą wstępne wersje odpowiedzi kandydatów albo wykonują wywołanie narzędzia, które Decision-1 ocenia. Te modele są dostępne za jednym kluczem zgodnym z OpenAI, obejmującym ponad 200 modeli, po cenie katalogowej dostawcy przekazywanej z marżą 0%, więc obniżka ceny od dostawcy dla modelu sędziego obowiązuje u nas tego samego dnia. Jeśli budujesz pętlę ewaluacyjną, w której jeden model pisze, a drugi ocenia, wywołanie oceniające trafia do Microsoftu, a wywołanie generujące może trafić gdziekolwiek — w tym przez DSL routingu, który łączy kilka modeli w jedno wywołanie, gdy chcesz panel, a nie pojedynczego sędziego.

Dlaczego scorer to inny zakład niż lepszy chatbot
Wzorzec, który Microsoft tu sprzedaje, już istnieje w otwartym dostępie. Intern-Decision-4B od InternLM, d1-3B od Liquid AI, Laya od Convai Innovations oraz rodzina Kev od Jareda Palmera — wszystkie zwracają skalibrowane rozkłady dla dostarczonych opcji bez generowania tekstu, a większość z nich to wagi Apache-2.0, które można uruchomić na własnym sprzęcie za darmo. Oferta Microsoftu różni się pod trzema względami, które nie zależą od benchmarków: to zarządzane API z dołączonym uwierzytelnianiem Azure, rozliczaniem i nadzorem, więc pasuje do korporacyjnej ścieżki zakupowej, do której nie pasuje pobranie z Hugging Face; jego podstawą jest model 9B, większy niż większość w tej dziedzinie; oraz zawiera ocenę odpowiedzialnej AI i udokumentowaną metodologię ewaluacji, co często jest faktycznym wymogiem warunkującym wdrożenie w środowisku regulowanym.
To, czego mu brakuje, to liczba. W przeciwieństwie do otwartych konkurentów, którzy publikują wyniki Brier'a i oczekiwany błąd kalibracji — dwie wartości, które mówią, czy 0,8 oznacza 0,8 — Microsoft opublikował metodykę, ale nie wyniki. Dopóki nie istnieją niezależne testy kalibracji, sposób korzystania z Microsoft-Decision-1, który da się obronić, to ten, który zaleca jego własna dokumentacja: waliduj na danych reprezentatywnych dla swojego przypadku użycia, ustalaj progi na podstawie kosztu swoich błędów, zawsze uwzględniaj opcję wstrzymania się, losowo zmieniaj kolejność opcji, gdy kolejność mogłaby wpływać na odpowiedź, i utrzymuj człowieka w pętli w przypadku wszystkiego, co istotne. To dobra rada dla każdego systemu oceniającego. Jest szczególnie dobra dla takiego, którego kalibracji nikt poza firmą nie zmierzył.
