
Decision 3.0 vs Microsoft-Decision-1: Jeden jest do pobrania, drugi to SKU
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 za 1 mln tokenów · 71 tok/s
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
Poziom 9B Decision 3.0 i Microsoft-Decision-1 to, na papierze, ten sam produkt. Oba dostrajają Qwen3.5-9B do scorera, który dla stałego zestawu odpowiedzi kandydujących zwraca skalibrowane prawdopodobieństwo dla każdej z nich, nigdy nie generując tokena. Oba są przeznaczone do tych samych zadań — kierowania żądaniami, oceniania wyników na podstawie rubryki, bramkowania akcji agenta, segregowania kolejki. Oba ukazały się w odstępie tygodnia od siebie: Microsoft-Decision-1 stał się ogólnodostępny w Microsoft Foundry 8 października 2026 r. i został ogłoszony następnego dnia, a d3-flash został wypchnięty na Hugging Face o 17:23 UTC 10 października 2026 r.
Różnica nie polega na modelu. Polega na tym, co wolno ci z nim zrobić. d3-flash to checkpoint Apache-2.0 o 8,39 miliarda parametrów, który pobierasz i uruchamiasz, zajmujący trzecie miejsce w rodzinie, która zaczyna się od 0,59B, a kończy na 26,09B. Microsoft-Decision-1 to hostowany endpoint na Foundry, z wagami, które nie są w ogóle dystrybuowane, w linii, którą — jak mówi Microsoft — później oprze na własnych modelach MAI. Jedno z nich to artefakt, drugie to usługa. Niemal każde praktyczne pytanie dotyczące tej pary wynika z tego jednego faktu — w tym te, które wyglądają, jakby dotyczyły benchmarków.
Dwie decyzje o tym, do czego służy model decyzyjny
Post Microsoftu jest wyraźny co do zakresu, co rzadko zdarza się w kartach modeli. Obsługiwane formy pytań to: tak/nie, wielokrotny wybór, ocena, klasyfikacja oraz ocenianie oparte na rubrykach. Wykluczenia są wymienione równie jasno: nie jest przeznaczony do generowania tekstu, odpowiadania na pytania otwarte, konwersacji, tłumaczenia czy streszczania, i nie jest przeznaczony do zadań wymagających wiedzy nieobecnej w danych wejściowych. Wykonuje jedno przejście przez maksymalnie 32 768 tokenów i emituje zero tokenów wyjściowych, ponieważ nie ma pętli dekodowania. Microsoft obsługuje również opcję abstynencji, taką jak „nie można stwierdzić”, gdy dostarczone dowody są niewystarczające, co jest tym szczegółem, który sprawia, że progowanie na wyjściu ma w ogóle sens.
d3-flash mieści się w tym samym pojęciowym pudełku — pytania Choice, Noul (tak/nie) i Score, jedno przejście w przód na pytanie, prawdopodobieństwo dla każdej opcji, bez generowania — a następnie rozszerza stronę wejściową. Podczas gdy Microsoft-Decision-1 jest z założenia wyłącznie tekstowy, d3-flash przyjmuje tekst lub JSON, wiele obrazów na żądanie, każdy o rozdzielczości do 1,6 megapiksela, oraz wiele filmów odczytywanych z szybkością 2 klatek na sekundę. Każde pytanie w żądaniu widzi każdy obraz i film dołączony do tego żądania. To mniejszy model, który robi więcej z otrzymywanych danych wejściowych.
To pierwszy prawdziwy podział i nie jest to kwestia gustu. Jeśli decyzja, którą trzeba podjąć, dotyczy zrzutu ekranu, paragonu, wykresu lub klipu z kamery, Microsoft-Decision-1 nie może jej podjąć. To granica możliwości, a nie luka jakościowa, i żadna ilość pracy nad dokładnością jej nie usunie.
Co każdy z nich publikuje i w jaki sposób
Tutaj te dwa wydania dostarczają naprawdę różnych rodzajów dowodów i warto je rozdzielić, zamiast zestawiać liczby.
Microsoft przeprowadził porównanie 36 benchmarków obejmujące prawie 150 000 pytań utrzymywanych w tajemnicy przed treningiem, obejmujących routing, ranking, długi kontekst, zadania wielojęzyczne i poza rozkładem, rozumowanie i bezpieczeństwo, i twierdzi, że jego model wypadł najlepiej we wszystkich tych zestawach. Podaje opóźnienie jako stosunek, a nie liczbę — p50 około 35 razy szybsze niż GPT-6 Sol i 2,5 razy szybsze niż H2O-Lightning-4B v1.1, który wskazuje jako drugiego w rankingu. Dokumentuje odporność jako procedurę: to samo zapytanie zakłócone na osiem sposobów, średni wskaźnik zmiany decyzji na poziomie 1,3% i zero zmian, gdy opisy opcji są parafrazowane lub opcje są odwracane albo tasowane. Przetestował bezpieczeństwo na 5 250 żądań w 11 benchmarkach obejmujących szkodliwe treści, jailbreaking i wstrzykiwanie promptów. Określa standard kalibracji, którego się trzyma — predykcja z 90% pewnością powinna być trafna mniej więcej dziewięć razy na dziesięć w reprezentatywnych przypadkach.
vLLM-SR opublikował indeks. Indeks Jev Decision 0.3.1 plasuje d3 na 64,7, a d3-flash w public-suite na 57,79 — deklarowany wzrost o 11,0 względem modelu 9B z Decision 2.0 na poziomie 46,76. Twierdzi również, że udzielono odpowiedzi na wszystkie 140 178 publicznych zapytań, a żadne nie pozostało nieobsłużone, co jest stwierdzeniem o pokryciu, a nie o dokładności. Karta ujawnia, że sam wiersz d3 to ocena wewnętrzna, podczas gdy towarzyszące mu wiersze porównawcze — Perplexity Decider v1.1, Fastino GLiDE, Jev, Torchcast Decision 27B — to dane z bieżącej tablicy wyników. A po stronie multimodalnej modele z rodziny d3 podają wyniki Perception Test na wszystkich 19 140 pytaniach walidacyjnych, przy czym d3-flash osiąga 73,3 wobec trzyopcyjnego progu losowego na poziomie 33,3.
A więc: Microsoft publikuje twierdzenie o szerokim zakresie wraz z udokumentowaną metodą i liczbą odporności, ale bez współczynnika kalibracji dla poszczególnych checkpointów. vLLM-SR publikuje pozycję w rankingu ze wskazaną luką w pochodzeniu między własnym wierszem a pozostałymi, a także wynik wideo, i również bez współczynnika kalibracji. Żadna z kart nie zawiera wyniku Brier'a ani liczby oczekiwanego błędu kalibracji dla opisywanego przez nią modelu. W przypadku dwóch produktów, których cała propozycja wartości polega na tym, że zwracana liczba coś znaczy, to jest ta wspólna luka i jest to najbardziej użyteczna rzecz, jaką którykolwiek z dostawców mógłby dostarczyć w następnej kolejności.

Dystrybucja decyduje o więcej niż specyfikacja.
I tu porównanie przestaje dotyczyć modeli.
Dzięki d3-flash otrzymujesz wagi, plik decision_config.json przypinający rewizję bazową, manifest SHA-256 dla każdego pliku, własny kod modelowania, głowicę odczytu oraz udokumentowany zestaw zależności obejmujący transformers==5.17.0 i opcjonalny pakiet jąder CUDA dla warstw uwagi liniowej. Możesz go uruchomić na własnym sprzęcie, dostroić, skwantyzować, odizolować od sieci. Bierzesz też na siebie pracę operacyjną: klasa Pythona nie jest endpointem, a karta nie podaje budżetu tokenów na stan plus pytania plus opisy kandydatów — max_length wynosi null w dostarczonej konfiguracji, więc ten pułap musisz odkryć samodzielnie.
Z Microsoft-Decision-1 otrzymujesz punkt końcowy w ramach istniejącego konta chmurowego, wraz z uwierzytelnianiem, dostępnością regionalną i mechanizmami kontroli aprowizacji, które są z tym związane — i nie masz przy tym żadnej pracy operacyjnej. Nie masz też żadnej kontroli. Nie ma repozytorium do pobrania, ścieżki dostrajania ani możliwości samodzielnego hostowania; cykl życia modelu należy do Microsoftu, a nie do ciebie, a komunikat o wycofaniu lub przeniesienie na inny szkielet to zmiana, którą przyjmujesz, a nie taka, którą planujesz. Microsoft zapowiedział, że nadchodzi przeniesienie na jego własne modele MAI, co jest rozsądnym planem dla modelu, którego cały sens polega na szybkim ocenianiu w jednym przebiegu, a także oznacza, że konkretny checkpoint, który testowałeś, niekoniecznie będzie tym, który będziesz wywoływać za rok.
Historia z opóźnieniami również wymaga uważnego czytania. Główna liczba Microsoftu to stosunek względem znacznie większego modelu ogólnego przeznaczenia, co jest właściwym porównaniem dla jego argumentacji — zadaniem modelu decyzyjnego jest zastąpienie kosztownego wywołania generatywnego tanim wywołaniem oceniającym, a 35x względem GPT-6 Sol przy p50 to właśnie obraz tej argumentacji, gdy trafia ona do przekonania. Liczby vLLM-SR są bezwzględne, dotyczą pojedynczego żądania i pojedynczego GPU, i jasno pokazują podatek od modalności: na jednym AMD Instinct MI325X żądanie tekstowe do d3-flash zajmuje medianę 19,1 ms, to samo żądanie z obrazem — 149,4 ms, a z dziesięciosekundowym wideo — 407,6 ms. Oba zestawy pochodzą z raportów dostawców, dotyczą różnego sprzętu i żadnego z nich nie odtworzono poza laboratorium, które go wytworzyło.

Jak wybrać
Reguła decyzyjna jest krótka, co jest dobrym znakiem, że oba produkty w rzeczywistości nie konkurują o to samo miejsce.
Wybierz Microsoft-Decision-1, jeśli decyzja jest wyłącznie tekstowa, jeśli już działasz na Foundry i jeśli bycie wywołaniem, a nie wdrożeniem, jest całym sensem — nie trzeba kupować GPU, obsługiwać kontenera ani zarządzać cyklem życia modelu. Materiały pomocnicze Microsoftu są też bardziej użyteczne z tych dwóch dla zespołu platformowego: perturbacje, liczby testów bezpieczeństwa i stwierdzenie, że opcja wstrzymania się jest obsługiwana, to rzeczy potrzebne do napisania polityki progowej, a limit 32 768 tokenów jest podany, a nie pozostawiony pusty.
Wybierz Decision 3.0 — realistycznie d3-flash lub d3-mini — jeśli jakakolwiek część decyzji zależy od obrazu lub klipu, jeśli musisz uruchomić go tam, gdzie hostowane API nie może dotrzeć, albo jeśli chcesz dostroić scorer na własnych oznaczonych przypadkach. Licencja Apache-2.0 i manifest skrótów na poziomie plików sprawiają, że to realna opcja, a nie teoretyczna. W zamian akceptujesz nieokreślony budżet wejściowy, brak opublikowanej kalibracji oraz fakt, że ta rodzina ma zaledwie kilka dni i praktycznie nie ma za sobą żadnego zewnętrznego użycia.
Jeśli potrzebujesz obu — hostowanego scorera do rutynowej ścieżki tekstowej i self-hostowanego do przypadków multimodalnych lub air-gapped, wywoływanych przez ten sam interfejs — to uczciwe stanowisko jest takie, że żaden dostawca obecnie ci tego nie oferuje, a te dwa formaty żądań są wystarczająco bliskie, by je ujednolicić, ale nie identyczne.
Gdzie znajduje się OrcaRouter, a gdzie nie
typesafe/jev-1.13 jest modelem decyzyjnym w naszym katalogu, udostępnianym przez POST /v1/systemone z tym samym kontraktem stanu i nazwanych pytań, który implementują oba powyższe modele: tekst na wejściu, ustrukturyzowany JSON na wyjściu, do około 64 tys. tokenów wejściowych, bez strumieniowania, 0,042 USD za milion tokenów wejściowych bez opłaty za generowanie odpowiedzi, ponieważ nigdy jej nie generuje. Co istotne, pytanie o budżet tokenów w stylu Androida, na które żadna z powyższych kart nie odpowiada w pełni, znajduje tu odpowiedź.
Nie oferujemy żadnego z tych modeli w tym porównaniu. Punkty kontrolne Decision 3.0 są dostarczane jako lokalna ścieżka inferencji w repozytorium Hugging Face, a nie jako endpoint, do którego można kierować ruch, a Microsoft-Decision-1 jest dystrybuowany przez własną platformę Microsoftu i kilka platform innych firm — nie przez nas. Niczego tutaj nie należy odczytywać jako twierdzenia o dostępności któregokolwiek z nich.
To, ile warstwa routingu jest faktycznie warta w tej decyzji, rozstrzyga się w drugiej połowie pętli. Scorer jest z założenia tani; model, który działa na podstawie jego wyników, już nie, a połączenie modelu decyzyjnego z generatywnym zwykle oznacza dwie integracje, dwie relacje rozliczeniowe i dwa tryby awarii. Wywoływanie obu przez jeden klucz w ponad 200 modelach — z automatycznym przełączaniem awaryjnym, gdy dostawca zaczyna szwankować, oraz ceną katalogową dostawcy przekazywaną przy 0% marży, dzięki czemu zmiana ceny u dostawcy obowiązuje tego samego dnia — sprawia, że możesz wymienić scorer bez dotykania miejsca wywołania. Ma to tu większe znaczenie niż zwykle, bo oba te modele są na tyle wczesne, że decyzję podjętą w tym tygodniu powinieneś móc odwrócić w przyszłym miesiącu.

Pytanie, które rozstrzygnie to w ciągu sześciu miesięcy
Dwa zespoły w tym samym tygodniu dotrenowały ten sam bazowy checkpoint do produktu o tym samym kształcie i wyciągnęły przeciwne wnioski co do tego, jak powinien trafić do klienta. To nie tyle zbieg okoliczności w czasie, ile rozwidlenie w tym, jak sprzedaje się tę kategorię: jako wagi albo jako usługę, jako coś, co się posiada, albo coś, co się wywołuje.
Obserwuj trzy sygnały. Czy przejście Microsoftu na MAI lub na jego własne modele zmieni zachowanie w zakresie dokładności i opóźnień, które obecnie sprzedaje — i jak dużo wyprzedzenia otrzymają klienci. Czy vLLM-SR opublikuje budżet wejściowy i wartość kalibracyjną dla Decision 3.0, zamykając lukę, która sprawia, że jego indeks nie nadaje się do praktycznego wykorzystania. Oraz czy ktokolwiek spoza obu laboratoriów uruchomi publiczny zestaw testów na wydanych wagach d3, ponieważ w tej chwili jedyna liczba, która rozstrzygnęłaby to porównanie, to ta, której nie przedstawił żaden z dostawców.
