Wygenerowana karta tytułowa do porównania Decision 3.0 i Microsoft-Decision-1, z podtytułem „ten sam szkielet Qwen3.5-9B, przeciwne sposoby jego zakupu”, z etykietami o treści „wagi Apache-2.0 vs tylko hostowane”, „obrazy i wideo vs tylko tekst”, „opublikowano 10 paź vs GA 8 paź” oraz ze stopką o treści „Dane Decision 3.0 pochodzą od samego vLLM-SR; dane Microsoft-Decision-1 pochodzą od samego Microsoftu; żadne z nich nie zostały niezależnie odtworzone.” Logo OrcaRouter jest nałożone w prawym dolnym narożniku.
Engineering & Research

Decision 3.0 vs Microsoft-Decision-1: Jeden jest do pobrania, drugi to SKU

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Poziom 9B Decision 3.0 i Microsoft-Decision-1 to, na papierze, ten sam produkt. Oba dostrajają Qwen3.5-9B do scorera, który dla stałego zestawu odpowiedzi kandydujących zwraca skalibrowane prawdopodobieństwo dla każdej z nich, nigdy nie generując tokena. Oba są przeznaczone do tych samych zadań — kierowania żądaniami, oceniania wyników na podstawie rubryki, bramkowania akcji agenta, segregowania kolejki. Oba ukazały się w odstępie tygodnia od siebie: Microsoft-Decision-1 stał się ogólnodostępny w Microsoft Foundry 8 października 2026 r. i został ogłoszony następnego dnia, a d3-flash został wypchnięty na Hugging Face o 17:23 UTC 10 października 2026 r.

Różnica nie polega na modelu. Polega na tym, co wolno ci z nim zrobić. d3-flash to checkpoint Apache-2.0 o 8,39 miliarda parametrów, który pobierasz i uruchamiasz, zajmujący trzecie miejsce w rodzinie, która zaczyna się od 0,59B, a kończy na 26,09B. Microsoft-Decision-1 to hostowany endpoint na Foundry, z wagami, które nie są w ogóle dystrybuowane, w linii, którą — jak mówi Microsoft — później oprze na własnych modelach MAI. Jedno z nich to artefakt, drugie to usługa. Niemal każde praktyczne pytanie dotyczące tej pary wynika z tego jednego faktu — w tym te, które wyglądają, jakby dotyczyły benchmarków.

Dwie decyzje o tym, do czego służy model decyzyjny

Post Microsoftu jest wyraźny co do zakresu, co rzadko zdarza się w kartach modeli. Obsługiwane formy pytań to: tak/nie, wielokrotny wybór, ocena, klasyfikacja oraz ocenianie oparte na rubrykach. Wykluczenia są wymienione równie jasno: nie jest przeznaczony do generowania tekstu, odpowiadania na pytania otwarte, konwersacji, tłumaczenia czy streszczania, i nie jest przeznaczony do zadań wymagających wiedzy nieobecnej w danych wejściowych. Wykonuje jedno przejście przez maksymalnie 32 768 tokenów i emituje zero tokenów wyjściowych, ponieważ nie ma pętli dekodowania. Microsoft obsługuje również opcję abstynencji, taką jak „nie można stwierdzić”, gdy dostarczone dowody są niewystarczające, co jest tym szczegółem, który sprawia, że progowanie na wyjściu ma w ogóle sens.

d3-flash mieści się w tym samym pojęciowym pudełku — pytania Choice, Noul (tak/nie) i Score, jedno przejście w przód na pytanie, prawdopodobieństwo dla każdej opcji, bez generowania — a następnie rozszerza stronę wejściową. Podczas gdy Microsoft-Decision-1 jest z założenia wyłącznie tekstowy, d3-flash przyjmuje tekst lub JSON, wiele obrazów na żądanie, każdy o rozdzielczości do 1,6 megapiksela, oraz wiele filmów odczytywanych z szybkością 2 klatek na sekundę. Każde pytanie w żądaniu widzi każdy obraz i film dołączony do tego żądania. To mniejszy model, który robi więcej z otrzymywanych danych wejściowych.

To pierwszy prawdziwy podział i nie jest to kwestia gustu. Jeśli decyzja, którą trzeba podjąć, dotyczy zrzutu ekranu, paragonu, wykresu lub klipu z kamery, Microsoft-Decision-1 nie może jej podjąć. To granica możliwości, a nie luka jakościowa, i żadna ilość pracy nad dokładnością jej nie usunie.

Co każdy z nich publikuje i w jaki sposób

Tutaj te dwa wydania dostarczają naprawdę różnych rodzajów dowodów i warto je rozdzielić, zamiast zestawiać liczby.

Microsoft przeprowadził porównanie 36 benchmarków obejmujące prawie 150 000 pytań utrzymywanych w tajemnicy przed treningiem, obejmujących routing, ranking, długi kontekst, zadania wielojęzyczne i poza rozkładem, rozumowanie i bezpieczeństwo, i twierdzi, że jego model wypadł najlepiej we wszystkich tych zestawach. Podaje opóźnienie jako stosunek, a nie liczbę — p50 około 35 razy szybsze niż GPT-6 Sol i 2,5 razy szybsze niż H2O-Lightning-4B v1.1, który wskazuje jako drugiego w rankingu. Dokumentuje odporność jako procedurę: to samo zapytanie zakłócone na osiem sposobów, średni wskaźnik zmiany decyzji na poziomie 1,3% i zero zmian, gdy opisy opcji są parafrazowane lub opcje są odwracane albo tasowane. Przetestował bezpieczeństwo na 5 250 żądań w 11 benchmarkach obejmujących szkodliwe treści, jailbreaking i wstrzykiwanie promptów. Określa standard kalibracji, którego się trzyma — predykcja z 90% pewnością powinna być trafna mniej więcej dziewięć razy na dziesięć w reprezentatywnych przypadkach.

vLLM-SR opublikował indeks. Indeks Jev Decision 0.3.1 plasuje d3 na 64,7, a d3-flash w public-suite na 57,79 — deklarowany wzrost o 11,0 względem modelu 9B z Decision 2.0 na poziomie 46,76. Twierdzi również, że udzielono odpowiedzi na wszystkie 140 178 publicznych zapytań, a żadne nie pozostało nieobsłużone, co jest stwierdzeniem o pokryciu, a nie o dokładności. Karta ujawnia, że sam wiersz d3 to ocena wewnętrzna, podczas gdy towarzyszące mu wiersze porównawcze — Perplexity Decider v1.1, Fastino GLiDE, Jev, Torchcast Decision 27B — to dane z bieżącej tablicy wyników. A po stronie multimodalnej modele z rodziny d3 podają wyniki Perception Test na wszystkich 19 140 pytaniach walidacyjnych, przy czym d3-flash osiąga 73,3 wobec trzyopcyjnego progu losowego na poziomie 33,3.

A więc: Microsoft publikuje twierdzenie o szerokim zakresie wraz z udokumentowaną metodą i liczbą odporności, ale bez współczynnika kalibracji dla poszczególnych checkpointów. vLLM-SR publikuje pozycję w rankingu ze wskazaną luką w pochodzeniu między własnym wierszem a pozostałymi, a także wynik wideo, i również bez współczynnika kalibracji. Żadna z kart nie zawiera wyniku Brier'a ani liczby oczekiwanego błędu kalibracji dla opisywanego przez nią modelu. W przypadku dwóch produktów, których cała propozycja wartości polega na tym, że zwracana liczba coś znaczy, to jest ta wspólna luka i jest to najbardziej użyteczna rzecz, jaką którykolwiek z dostawców mógłby dostarczyć w następnej kolejności.

A generated two-column scoreboard headed 'Decision 3.0 d3-flash vs Microsoft-Decision-1 - the scoreboard'. The left column for d3-flash reads: base model Qwen3.5-9B fine-tuned, 8.39B parameters; distribution Apache-2.0 weights on Hugging Face from 10 October 2026; input text, images and video; context budget not stated on the card; reported accuracy Jev Decision Index 0.3 public suite 57.79, an internal evaluation; latency median 19.1 ms text, 149.4 ms image and 407.6 ms video. The right column for Microsoft-Decision-1 reads: base model Qwen3.5-9B post-trained, weights not distributed; distribution hosted on Microsoft Foundry, generally available 8 October 2026; input text only; context budget 32,768 tokens; reported accuracy best of 36 benchmarks covering nearly 150,000 blind questions; latency p50 around 35 times faster than GPT-6 Sol. A footer reads 'd3-flash figures are vLLM-SR's own internal evaluation; Microsoft-Decision-1 figures are Microsoft's own; neither is independently reproduced.'

Dystrybucja decyduje o więcej niż specyfikacja.

I tu porównanie przestaje dotyczyć modeli.

Dzięki d3-flash otrzymujesz wagi, plik decision_config.json przypinający rewizję bazową, manifest SHA-256 dla każdego pliku, własny kod modelowania, głowicę odczytu oraz udokumentowany zestaw zależności obejmujący transformers==5.17.0 i opcjonalny pakiet jąder CUDA dla warstw uwagi liniowej. Możesz go uruchomić na własnym sprzęcie, dostroić, skwantyzować, odizolować od sieci. Bierzesz też na siebie pracę operacyjną: klasa Pythona nie jest endpointem, a karta nie podaje budżetu tokenów na stan plus pytania plus opisy kandydatów — max_length wynosi null w dostarczonej konfiguracji, więc ten pułap musisz odkryć samodzielnie.

Z Microsoft-Decision-1 otrzymujesz punkt końcowy w ramach istniejącego konta chmurowego, wraz z uwierzytelnianiem, dostępnością regionalną i mechanizmami kontroli aprowizacji, które są z tym związane — i nie masz przy tym żadnej pracy operacyjnej. Nie masz też żadnej kontroli. Nie ma repozytorium do pobrania, ścieżki dostrajania ani możliwości samodzielnego hostowania; cykl życia modelu należy do Microsoftu, a nie do ciebie, a komunikat o wycofaniu lub przeniesienie na inny szkielet to zmiana, którą przyjmujesz, a nie taka, którą planujesz. Microsoft zapowiedział, że nadchodzi przeniesienie na jego własne modele MAI, co jest rozsądnym planem dla modelu, którego cały sens polega na szybkim ocenianiu w jednym przebiegu, a także oznacza, że konkretny checkpoint, który testowałeś, niekoniecznie będzie tym, który będziesz wywoływać za rok.

Historia z opóźnieniami również wymaga uważnego czytania. Główna liczba Microsoftu to stosunek względem znacznie większego modelu ogólnego przeznaczenia, co jest właściwym porównaniem dla jego argumentacji — zadaniem modelu decyzyjnego jest zastąpienie kosztownego wywołania generatywnego tanim wywołaniem oceniającym, a 35x względem GPT-6 Sol przy p50 to właśnie obraz tej argumentacji, gdy trafia ona do przekonania. Liczby vLLM-SR są bezwzględne, dotyczą pojedynczego żądania i pojedynczego GPU, i jasno pokazują podatek od modalności: na jednym AMD Instinct MI325X żądanie tekstowe do d3-flash zajmuje medianę 19,1 ms, to samo żądanie z obrazem — 149,4 ms, a z dziesięciosekundowym wideo — 407,6 ms. Oba zestawy pochodzą z raportów dostawców, dotyczą różnego sprzętu i żadnego z nich nie odtworzono poza laboratorium, które go wytworzyło.

A screenshot of the vllm-sr/d3 model card on Hugging Face, the flagship checkpoint of the Decision 3.0 family that d3-flash belongs to. The header shows 18 likes, the vLLM Semantic Router organisation, and tags for Transformers, Safetensors, qwen3_5, feature-extraction, decision-model, classification, system-one, multimodal, vision, video, custom_code and an Apache-2.0 licence, with the model size listed as 26B parameters in BF16. The card graphic reads 'Decision 3.0 / d3 27B'. A specification panel gives Parameters as 26.09B including the 0.46B vision encoder, Inputs as 'Text or JSON, plus images and videos (several per request)', Decision types as 'Choice - Yes / No - Score' and License as Apache-2.0. The sidebar shows 130 downloads last month, the model tree pinned to Qwen/Qwen3.8-27B, and a collection entry listing 6 items.

Jak wybrać

Reguła decyzyjna jest krótka, co jest dobrym znakiem, że oba produkty w rzeczywistości nie konkurują o to samo miejsce.

Wybierz Microsoft-Decision-1, jeśli decyzja jest wyłącznie tekstowa, jeśli już działasz na Foundry i jeśli bycie wywołaniem, a nie wdrożeniem, jest całym sensem — nie trzeba kupować GPU, obsługiwać kontenera ani zarządzać cyklem życia modelu. Materiały pomocnicze Microsoftu są też bardziej użyteczne z tych dwóch dla zespołu platformowego: perturbacje, liczby testów bezpieczeństwa i stwierdzenie, że opcja wstrzymania się jest obsługiwana, to rzeczy potrzebne do napisania polityki progowej, a limit 32 768 tokenów jest podany, a nie pozostawiony pusty.

Wybierz Decision 3.0 — realistycznie d3-flash lub d3-mini — jeśli jakakolwiek część decyzji zależy od obrazu lub klipu, jeśli musisz uruchomić go tam, gdzie hostowane API nie może dotrzeć, albo jeśli chcesz dostroić scorer na własnych oznaczonych przypadkach. Licencja Apache-2.0 i manifest skrótów na poziomie plików sprawiają, że to realna opcja, a nie teoretyczna. W zamian akceptujesz nieokreślony budżet wejściowy, brak opublikowanej kalibracji oraz fakt, że ta rodzina ma zaledwie kilka dni i praktycznie nie ma za sobą żadnego zewnętrznego użycia.

Jeśli potrzebujesz obu — hostowanego scorera do rutynowej ścieżki tekstowej i self-hostowanego do przypadków multimodalnych lub air-gapped, wywoływanych przez ten sam interfejs — to uczciwe stanowisko jest takie, że żaden dostawca obecnie ci tego nie oferuje, a te dwa formaty żądań są wystarczająco bliskie, by je ujednolicić, ale nie identyczne.

Gdzie znajduje się OrcaRouter, a gdzie nie

typesafe/jev-1.13 jest modelem decyzyjnym w naszym katalogu, udostępnianym przez POST /v1/systemone z tym samym kontraktem stanu i nazwanych pytań, który implementują oba powyższe modele: tekst na wejściu, ustrukturyzowany JSON na wyjściu, do około 64 tys. tokenów wejściowych, bez strumieniowania, 0,042 USD za milion tokenów wejściowych bez opłaty za generowanie odpowiedzi, ponieważ nigdy jej nie generuje. Co istotne, pytanie o budżet tokenów w stylu Androida, na które żadna z powyższych kart nie odpowiada w pełni, znajduje tu odpowiedź.

Nie oferujemy żadnego z tych modeli w tym porównaniu. Punkty kontrolne Decision 3.0 są dostarczane jako lokalna ścieżka inferencji w repozytorium Hugging Face, a nie jako endpoint, do którego można kierować ruch, a Microsoft-Decision-1 jest dystrybuowany przez własną platformę Microsoftu i kilka platform innych firm — nie przez nas. Niczego tutaj nie należy odczytywać jako twierdzenia o dostępności któregokolwiek z nich.

To, ile warstwa routingu jest faktycznie warta w tej decyzji, rozstrzyga się w drugiej połowie pętli. Scorer jest z założenia tani; model, który działa na podstawie jego wyników, już nie, a połączenie modelu decyzyjnego z generatywnym zwykle oznacza dwie integracje, dwie relacje rozliczeniowe i dwa tryby awarii. Wywoływanie obu przez jeden klucz w ponad 200 modelach — z automatycznym przełączaniem awaryjnym, gdy dostawca zaczyna szwankować, oraz ceną katalogową dostawcy przekazywaną przy 0% marży, dzięki czemu zmiana ceny u dostawcy obowiązuje tego samego dnia — sprawia, że możesz wymienić scorer bez dotykania miejsca wywołania. Ma to tu większe znaczenie niż zwykle, bo oba te modele są na tyle wczesne, że decyzję podjętą w tym tygodniu powinieneś móc odwrócić w przyszłym miesiącu.

A screenshot of the OrcaRouter models catalogue, headed 'Models - 207 models - 16 providers - one API key, one bill'. Filter tabs read All 207, Text 172, Image 10, Embeddings 5, Video 10 and TTS 10. A panel titled 'How to call any model' lists three steps - copy the model ID from any card, paste it into the model field, POST to our OpenAI-compatible endpoint - beside a code block showing POST https://api.orcarouter.ai/v1/chat/completions. Model cards below include OpenAI: GPT-6.1 Sol and Anthropic: Claude Sonnet 5.5 at $2.00 per million input tokens and $10.00 output, and TypeSafe: Jev 1.13 at 65K context with $0.042 per million input tokens and $0.042 per million output tokens. A credit panel above shows monthly plans from $50 to $1,000.

Pytanie, które rozstrzygnie to w ciągu sześciu miesięcy

Dwa zespoły w tym samym tygodniu dotrenowały ten sam bazowy checkpoint do produktu o tym samym kształcie i wyciągnęły przeciwne wnioski co do tego, jak powinien trafić do klienta. To nie tyle zbieg okoliczności w czasie, ile rozwidlenie w tym, jak sprzedaje się tę kategorię: jako wagi albo jako usługę, jako coś, co się posiada, albo coś, co się wywołuje.

Obserwuj trzy sygnały. Czy przejście Microsoftu na MAI lub na jego własne modele zmieni zachowanie w zakresie dokładności i opóźnień, które obecnie sprzedaje — i jak dużo wyprzedzenia otrzymają klienci. Czy vLLM-SR opublikuje budżet wejściowy i wartość kalibracyjną dla Decision 3.0, zamykając lukę, która sprawia, że jego indeks nie nadaje się do praktycznego wykorzystania. Oraz czy ktokolwiek spoza obu laboratoriów uruchomi publiczny zestaw testów na wydanych wagach d3, ponieważ w tej chwili jedyna liczba, która rozstrzygnęłaby to porównanie, to ta, której nie przedstawił żaden z dostawców.