Wygenerowana karta tytułowa dla Microsoft-Decision-1 z podtytułem „model oceny decyzji, który zwraca prawdopodobieństwo zamiast zdania”, z plakietką o treści „Microsoft Foundry, ogólnie dostępny od 8 października 2026 r.” oraz chipami o treści: model bazowy 9B, kontekst 32 768 tokenów, wagi niedystrybuowane i tylko tekst, bez generowania.
Guides & Insights

Microsoft-Decision-1: Model Microsoftu, który odpowiada liczbą zamiast zdania

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Microsoft-Decision-1 ma w swojej karcie modelu zapis, którego nie miał nigdy żaden inny model Microsoftu: nie jest przeznaczony do generowania tekstu. Model stał się ogólnie dostępny w Microsoft Foundry 8 października 2026 r., i jest to celowe zawężenie tego, do czego służy model językowy. Przekazujesz mu sytuację i pytanie z ustaloną listą odpowiedzi — tak/nie, zestaw wielokrotnego wyboru, skalę ocen, rubrykę — a on zwraca skalibrowane prawdopodobieństwo dla każdej opcji. Bez prozy. Bez wyjaśnień. Bez pola na uzasadnienie. Dane wyjściowe to liczby JSON i nic więcej. Jest zbudowany na modelu o otwartych wagach Qwen3.5-9B, dostrojonym przez Microsoft, a Microsoft twierdzi, że później przeniesie model na inne szkielety, wymieniając MAI i inne modele partnerskie.

To dziwniejszy produkt, niż się z początku wydaje. Pozycja konkurencyjna Microsoftu w 2026 r. opiera się na najnowocześniejszych modelach czatu i na Copilocie, a Microsoft-Decision-1 jest przeciwieństwem obu: to średniej wielkości, jednozadaniowy model oceniający, którego całym zadaniem jest powiedzenie aplikacji, która z twoich własnych opcji jest najprawdopodobniej poprawna i jak bardzo jest tego pewien. Ciekawe pytanie nie dotyczy tego, czy jest dobry w pisaniu — jest w tym wyraźnie zły i nawet nie próbuje — lecz tego, czy rozkład prawdopodobieństwa na opcjach jest bardziej użytecznym prymitywem dla obciążeń, które przedsiębiorstwa faktycznie uruchamiają, niż kolejny model ogólnego przeznaczenia z trybem JSON.

Co dokładnie robi

Kontrakt jest następujący: jedno wywołanie na wejściu, jeden rozkład na wyjściu. Microsoft wymienia obsługiwane formaty pytań jako tak/nie, wielokrotny wybór, ocenę, klasyfikację i oparte na rubrykach. Każda opcja otrzymuje wynik. Model działa w ramach pojedynczego wywołania na danych wejściowych o rozmiarze do 32 tys. tokenów — podane okno kontekstu to 32 768 — a praktycznym ograniczeniem jest rozmiar danych wejściowych plus zestaw opcji, a nie budżet generowania, ponieważ generowanie nie występuje.

Opublikowane przypadki użycia to te, które zespół rozpoznałby:

• Ocena danych wyjściowych AI — oceń wygenerowaną odpowiedź według dostarczonej rubryki albo zdecyduj, czy jest oparta na przekazanych jej dowodach.

• Klasyfikacja i routing — sklasyfikuj żądanie, oceń istotność, przeprowadź triage kolejki, wybierz gałąź przepływu pracy.

• Zabezpieczenia agenta — oceń proponowane wywołanie narzędzia lub działanie agenta, zanim aplikacja integrująca pozwoli na jego wykonanie.

• Kontrola bezpieczeństwa treści — oznaczaj treści względem progów zdefiniowanych przez aplikację, a nie stałej polityki dostawcy.

• Trafność wyszukiwania i dokumentów — oceń, czy wyszukany dokument odpowiada na zadane pytanie.

• Automatyzacja oparta na poziomie pewności — automatycznie akceptuj wyniki o wysokim poziomie pewności, a pozostałe przekazuj do obsługi przez człowieka.

Warto zwrócić uwagę na opcję wstrzymania się od odpowiedzi. Microsoft wyraźnie obsługuje opcje takie jak „nie można stwierdzić”, gdy dostarczone dowody są niewystarczające — to różnica między oceniającym, który jest skalibrowany, a takim, który jest jedynie pewny siebie. A ponieważ wyniki wracają jako liczby, próg eskalacji jest decyzją, która należy do ciebie — to ty ustalasz, kiedy 0,7 wysyła coś do człowieka, a 0,95 już nie.

Czego nie zrobi

Microsoft jest wyjątkowo jednoznaczny, jeśli chodzi o wyłączenia, i mają one większe znaczenie niż lista funkcji dla każdego, kto ocenia to pod kątem rzeczywistego potoku przetwarzania. Microsoft-Decision-1 nie jest przeznaczony do generowania tekstu, odpowiadania na pytania otwarte, prowadzenia rozmów, tłumaczenia ani streszczania. Nie jest przeznaczony do zadań bez zamkniętego pytania i zdefiniowanego zestawu opcji odpowiedzi ani do zadań wymagających wiedzy nieobecnej w danych wejściowych. Obsługuje wyłącznie tekst: brak obrazów, dźwięku i wideo na wejściu, brak na wyjściu. Nie dostarcza żadnych wyjaśnień ani uzasadnień.

Przeczytaj je razem, a pojawi się granica, o którą łatwo się potknąć. To nie chatbot, którego można poprosić, żeby dodatkowo klasyfikował rzeczy, i nie sumaryzator, do którego można dokręcić ocenę. To funkcja oceniająca z budżetem tokenów. Sposób, w jaki ujmuje to sam zespół — że nie powinna być jedynym automatycznym decydentem w doniosłych decyzjach dotyczących ludzi i nie powinna stanowić jedynej podstawy decyzji dotyczących kredytu, zatrudnienia, mieszkalnictwa, ubezpieczeń, edukacji, opieki zdrowotnej, praw prawnych „lub podobnie doniosłych dziedzin" — wskazuje w tym samym kierunku. Została zaprojektowana, by stać obok decyzji, a nie nią być.

A single-column generated scoreboard for Microsoft-Decision-1 with six rows: base model Qwen3.5-9B post-trained by Microsoft; weights hosted API only and not distributed; context window 32,768 tokens; output calibrated JSON probabilities with zero output tokens; published benchmarks none, methodology only; status generally available on Microsoft Foundry on October 8 2026. A footer line reads that all figures are Microsoft-reported and not independently reproduced.

Sytuacja z benchmarkami to historia, której nikt nie chce drukować

Nie ma tam żadnych liczb. Strona katalogowa Microsoft Foundry dla modelu Microsoft-Decision-1 ma zakładkę Benchmarks i jest pusta, jeśli chodzi o dane liczbowe. Zamiast tego zawiera akapit metodologiczny oraz twierdzenie jakościowe: model został „oceniony na publicznych i społecznościowych benchmarkach decyzyjnych oraz na odłożonych wewnętrznych zestawach testowych niewykorzystanych w treningu”, Microsoft podaje, że „osiąga wyniki na równi z wiodącymi modelami decyzyjnymi i wyprzedza inne otwarte modele decyzyjne oceniane tą samą metodologią”, a stosowane metryki to dokładność, błąd kalibracji, czułość w zakresie bezpieczeństwa, odsetki wyników fałszywie dodatnich i spójność pod względem sprawiedliwości, przy czym zmieniano kolejność opcji i stosowano sparowane testy statystyczne.

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text states that it is a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, that it is built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, that it will also rebase on other models including MAI and OpenAI, and lists quick facts: publisher Microsoft, type Text classification and Zero shot classification, lifecycle Generally available (GA), context window 32768, and a Pricing field that links out rather than printing a rate.

To jest poważny opis metodologii dołączony do zera opublikowanych wyników. Oznacza to, że każde twierdzenie o wydajności Microsoft-Decision-1 jest dziś raportowane przez dostawcę i nieodtworzone, a uczciwym stanowiskiem dla każdego, kto go ocenia, jest to, że kalibracja — jedyna właściwość, która w ogóle czyni prawdopodobieństwo użytecznym — jest niezweryfikowana poza Microsoftem. Firma wskazuje jednak, gdzie jej zdaniem model jest najsilniejszy i najsłabszy, co jest bardziej użyteczne niż wynik z nagłówka: najsilniejszy w rozumowaniu, stosowaniu reguł i odporności na formatowanie podpowiedzi; konkurencyjny w klasyfikacji, wyszukiwaniu, sprawiedliwości, użyciu narzędzi i większości zadań wielojęzycznych; słabszy w zadaniach wymagających specjalistycznej wiedzy dziedzinowej.

Ograniczenia podane przez producenta warto przeczytać przed listą funkcji. Wyniki mogą się zmieniać w zależności od sformułowania i kolejności opcji, a źle sformułowane pytanie nadal zwraca wynik. Kalibracja jest najlepsza w przypadku znanych typów zadań. Model może opierać się na nieaktualnej wiedzy i nie podaje żadnych wyjaśnień. Jeśli chodzi o obsługę wielu języków: jako obsługiwane wymieniono 25 języków, w tym japoński, koreański, arabski, wietnamski, tajski, turecki, hindi, bengalski, suahili, hebrajski, perski i ukraiński, ale Microsoft twierdzi, że pokrycie, jakość i kalibracja „mogą się różnić w zależności od języka”, i wymienia języki inne niż angielski — zwłaszcza te o mniejszych zasobach — jako obszar słabszych wyników. Bazowy Qwen3.5-9B obsługuje ponad 200 języków; model poddany treningowi końcowemu obsługuje jedną czwartą tej liczby.

Jak to zdobyć i ile to kosztuje

Microsoft-Decision-1 jest dystrybuowany jako hostowane API w Microsoft Foundry w ramach portfolio „Direct from Azure”. Wagi modelu nie są dystrybuowane — to nie jest wydanie z otwartymi wagami i nie ma repozytorium Hugging Face, z którego można by go pobrać. Każda aplikacja, która może wysyłać żądania HTTPS, może integrować się za pomocą punktów końcowych Foundry i standardowego uwierzytelniania Azure. Lista wdrożeń pokazuje opcje bezserwerowe i ujednoliconego punktu końcowego w modelu płatności za użycie lub zarezerwowanej aprowizowanej przepustowości, standardowa jednostka SKU, z wyłączonym wnioskowaniem wsadowym, a ujawnienie dotyczące trenowania podaje, że zbiór danych treningowych został po raz pierwszy użyty we wrześniu 2026 r., a jego zbieranie trwa.

Ceny nie są publikowane na stronie modelu. Pole cenowe w katalogu prowadzi do strony cennika modeli Microsoft, zamiast podawać stawkę za tokeny wejściowe i wyjściowe, więc koszt za token wywołania Decision-1 trzeba sprawdzić w obszarze cennika Azure albo odczytać z faktury. To realna luka dla każdego, kto próbuje modelować koszt na decyzję przy dużej skali, i warto powiedzieć to wprost, zamiast szacować. Gdy już to wyceniasz, warto wiedzieć dwie rzeczy: 0% kosztu stanowią tokeny wyjściowe, bo ich nie ma, a wnioskowanie wsadowe jest wyłączone, więc nie można amortyzować masowego przebiegu scoringu przez kanał wsadowy tak, jak zrobiłoby się to w przypadku modelu generatywnego.

Miejsce OrcaRouter w tym wszystkim jest po drugiej stronie wywołania. Nie hostujemy Microsoft-Decision-1 i nie ma go w naszym katalogu — model, który zwraca prawdopodobieństwa, a nie model, do którego kierujesz uzupełnienia czatu. To, co mamy, to ta połowa wzorca, która generuje: modele, które piszą rubrykę, tworzą wstępne wersje odpowiedzi kandydatów albo wykonują wywołanie narzędzia, które Decision-1 ocenia. Te modele są dostępne za jednym kluczem zgodnym z OpenAI, obejmującym ponad 200 modeli, po cenie katalogowej dostawcy przekazywanej z marżą 0%, więc obniżka ceny od dostawcy dla modelu sędziego obowiązuje u nas tego samego dnia. Jeśli budujesz pętlę ewaluacyjną, w której jeden model pisze, a drugi ocenia, wywołanie oceniające trafia do Microsoftu, a wywołanie generujące może trafić gdziekolwiek — w tym przez DSL routingu, który łączy kilka modeli w jedno wywołanie, gdy chcesz panel, a nie pojedynczego sędziego.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filter controls for input modalities, context length, input price, status, series and supported parameters, and a search field. No decision-scoring model appears in the listing.

Dlaczego scorer to inny zakład niż lepszy chatbot

Wzorzec, który Microsoft tu sprzedaje, już istnieje w otwartym dostępie. Intern-Decision-4B od InternLM, d1-3B od Liquid AI, Laya od Convai Innovations oraz rodzina Kev od Jareda Palmera — wszystkie zwracają skalibrowane rozkłady dla dostarczonych opcji bez generowania tekstu, a większość z nich to wagi Apache-2.0, które można uruchomić na własnym sprzęcie za darmo. Oferta Microsoftu różni się pod trzema względami, które nie zależą od benchmarków: to zarządzane API z dołączonym uwierzytelnianiem Azure, rozliczaniem i nadzorem, więc pasuje do korporacyjnej ścieżki zakupowej, do której nie pasuje pobranie z Hugging Face; jego podstawą jest model 9B, większy niż większość w tej dziedzinie; oraz zawiera ocenę odpowiedzialnej AI i udokumentowaną metodologię ewaluacji, co często jest faktycznym wymogiem warunkującym wdrożenie w środowisku regulowanym.

To, czego mu brakuje, to liczba. W przeciwieństwie do otwartych konkurentów, którzy publikują wyniki Brier'a i oczekiwany błąd kalibracji — dwie wartości, które mówią, czy 0,8 oznacza 0,8 — Microsoft opublikował metodykę, ale nie wyniki. Dopóki nie istnieją niezależne testy kalibracji, sposób korzystania z Microsoft-Decision-1, który da się obronić, to ten, który zaleca jego własna dokumentacja: waliduj na danych reprezentatywnych dla swojego przypadku użycia, ustalaj progi na podstawie kosztu swoich błędów, zawsze uwzględniaj opcję wstrzymania się, losowo zmieniaj kolejność opcji, gdy kolejność mogłaby wpływać na odpowiedź, i utrzymuj człowieka w pętli w przypadku wszystkiego, co istotne. To dobra rada dla każdego systemu oceniającego. Jest szczególnie dobra dla takiego, którego kalibracji nikt poza firmą nie zmierzył.