
Microsoft-Decision-1 vs Kev: Kupowanie wyniku czy posiadanie przepisu, który go tworzy
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 za 1 mln tokenów
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
Jared Palmer położył paragon obok swojego modelu. Rodzina Kev — Kev-0.8B, Kev-4B i Kev-9B, zbudowana na zamrożonych bazowych checkpointach o otwartych wagach z adapterem LoRA o randze 16 i małą głowicą wskaźnikową — została wydana 24 września 2026 r. wraz z przepisem treningowym, etapowymi liczbami danych i wynikami ewaluacji — wszystko opublikowane, a uczciwa konkluzja dla każdego, kto porównuje ją z Microsoft-Decision-1, jest taka, że Kev mówi ci znacznie więcej o tym, jak odtworzyć samego siebie. System oceniający firmy Microsoft stał się ogólnie dostępny w Microsoft Foundry 8 października 2026 r.: bazowy Qwen3.5-9B dotrenowany przez Microsoft, kontekst 32 768 tokenów, tylko tekst, wagi niedystrybuowane, opublikowana metodologia ewaluacji i brak opublikowanych wyników. Oba przyjmują stan i zestaw typowanych pytań i zwracają skalibrowany rozkład zamiast wygenerowanego tekstu. Jeden jest usługą, drugi metodą, którą możesz uruchomić w notatniku jeszcze dziś wieczorem.
Powód, dla którego o tym starciu decyduje ta różnica, a nie zdolności: Kev-4B podaje ECE 0,017 w swoim zamkniętym teście poza domeną, a Microsoft-Decision-1 nie podaje niczego, więc argument kalibracyjny, który zwykle rozstrzyga porównanie oceniającego z oceniającym, ma tylko jedną stronę przedstawiającą swoje stanowisko.
Co Kev faktycznie publikuje
Karta Kev-4B jest nietypowo konkretna, a ta konkretność jest sednem. Trzonem jest Qwen3.5-4B-Base, zamrożony na nazwanej rewizji, z 24 warstwami liniowej uwagi Gated DeltaNet i 8 pełnymi warstwami uwagi przy rozmiarze ukrytym 2 560. Na tym osadzono adapter LoRA rangi 16 — 33,8 miliona trenowalnych parametrów, stosowany do projekcji uwagi, MLP i DeltaNet — oraz głowicę wskaźnikową, która ocenia token zamykający każdej opcji względem końcowego tokenu pytania i stosuje softmax. Jedna temperatura, T = 2,41, jest zapisana w pliku głowicy i stosowana przy wczytywaniu, a karta podaje dopasowaną wartość i hash pliku. Trening przebiegał etapami z publikowanymi liczbami rekordów: podstawowa receptura 12 576 rekordów, 1 425 dla dat i brakujących dowodów, 5 219 prawdziwych narracji skarg CFPB, 6 000 rekordów umiejętności i 5 320 rekordów narzędzi deweloperskich, przy czym późniejsze etapy odtwarzały wcześniejsze. Karta stwierdza również, czego nie użyto: „Nie wykorzystano żadnych wyników Jev (hostowanego modelu decyzyjnego TypeSafe).”
Tabela wyników porównawczych jest podana na tej samej stronie i dołączono do niej przypadki niepowodzeń, co zdarza się rzadziej niż sukcesy. Transfer-v4 zablokowany test poza domeną: dokładność 0,838, Brier 0,224, ECE 0,017. Breadth-v1 na 14 odłożonych zbiorach danych i 3 089 pytaniach: dokładność 0,690, ECE 0,029. Test Hard-v1: 0,803. Test Documents-v1: 0,903. MMLU-Pro z dziesięcioma opcjami: 0,565. Arytmetyka na datach: 0,65, nazwana przez autora najsłabszym obszarem, z flagą preprocesora oferowaną jako częściowa poprawka i wyraźną uwagą, że nie została ponownie zmierzona. Sekcja ograniczeń dodaje, że kalibracja to pojedyncza temperatura w rozkładzie, więc pokrycie pogarsza się poza domeną, że kolejność opcji może odwrócić odpowiedź oraz że długości powyżej 8 192 tokenów są obsługiwane, ale niezwalidowane. Opublikowano również dane dotyczące obsługi: 18,1 ms dla sześciu pytań przy krótkim stanie na H100, 12,9 ms z pamięcią podręczną, 14,3 GB rezydentnej pamięci GPU.

Co zamiast tego publikuje Microsoft
Microsoft-Decision-1 obejmuje większość tych samych zagadnień, ale z innym nastawieniem. Ocenia pytania typu tak/nie, wielokrotnego wyboru, oceniające, klasyfikacyjne i z rubrykami, obsługuje jawne opcje wstrzymania się od odpowiedzi, takie jak „nie można stwierdzić”, zwraca prawdopodobieństwa w formacie JSON i działa w ramach jednego wywołania na maksymalnie 32 tys. tokenów — czterokrotnie większym niż kontekst weryfikowany przez Kev. Jest dystrybuowany jako hostowane API w Microsoft Foundry w ramach portfolio Direct from Azure, z wdrożeniem bezserwerowym i wdrożeniem z ujednoliconym punktem końcowym, standardowym SKU, uwierzytelnianiem w Azure i ujednoliconą ścieżką rozliczeń. Wnioskowanie wsadowe jest wyłączone, a pobieranie wag i dostrajanie nie są możliwe.
Sekcja oceny opisuje publiczne i społecznościowe benchmarki decyzyjne oraz wydzielone wewnętrzne zbiory testowe, metryki obejmujące dokładność i błąd kalibracji, zmienianą kolejność opcji, sparowane testy statystyczne oraz twierdzenie, że model „osiąga wyniki porównywalne z wiodącymi modelami decyzyjnymi i wyprzedza inne otwarte modele decyzyjne oceniane przy użyciu tej samej metodologii”. Nie ma żadnej tabeli. Karta modelu uczciwie wymienia jego własne ograniczenia — wyniki zmieniają się w zależności od sformułowania i kolejności opcji, kalibracja jest najlepsza w przypadku znanych typów zadań, nie są generowane żadne wyjaśnienia, a pokrycie języków innych niż angielski jest najsłabsze — ale lista ograniczeń to nie pomiar kalibracji. Każdy, kto ustawia próg automatycznej akceptacji 0,9 dla Microsoft-Decision-1, ustala go na wiarę i dostraja go w środowisku produkcyjnym.

Część porównania, która kosztuje pieniądze
Ekonomia Kev'a jest powodem, dla którego to starcie jest naprawdę wyrównane. Przepis to zamrożona baza plus adapter 33,8M, co oznacza, że krańcowy model, który trenujesz, kosztuje obliczenia rozmiaru adaptera, a nie rozmiaru modelu bazowego. Bazę możesz raz trzymać w pamięci i wczytywać kilka adapterów — po jednym na domenę decyzyjną — co jest kształtem wdrożenia, którego hostowane API Microsoftu nie potrafi w ogóle wyrazić. Jeśli twoje reguły routingu różnią się od reguł generycznego sędziego, Kev pozwala ci wytrenować tę różnicę; Microsoft-Decision-1 pozwala ci napisać lepszy prompt i mieć nadzieję.
W przeciwieństwie do tego hostowane API nie ma żadnej powierzchni operacyjnej. Nie ma adaptera, który trzeba by śledzić, stosu serwującego, który trzeba utrzymywać w gotowości, luki między kontekstem zwalidowanym a serwowanym, nad którą trzeba by się zastanawiać, ani ryzyka, że temperatura dopasowana na jednym zbiorze danych zachowa się inaczej na twoim. Dla zespołu o umiarkowanej liczbie decyzji usługa jest tańszym artefaktem w przeliczeniu na godziny inżynierskie, nawet jeśli tokeny kosztują; dla zespołu oceniającego miliony elementów dziennie samodzielnie hostowany adapter wygrywa pod względem kosztu jednostkowego w momencie, gdy koszt GPU się zwróci.
Istnieje trzecia ścieżka, która nie używa żadnego z tych modeli do tego, w czym są najsłabsze, i właśnie tam znajduje się OrcaRouter. Nie hostujemy Microsoft-Decision-1 ani Kev — scorer zwracający prawdopodobieństwa nie jest celem chat-completions, a żadnego z tych modeli nie ma w naszym katalogu. To, co udostępniamy, to generatywna połowa pipeline'u decyzyjnego: model, który szkicuje odpowiedź kandydującą, tworzy kryteria oceny albo emituje wywołanie narzędzia, które zostaje ocenione. To wszystko stoi za jednym kluczem zgodnym z OpenAI, z ponad 200 modelami w cenach katalogowych dostawcy przekazywanych dalej z 0% marży, więc zmiana ceny u dostawcy jest widoczna po naszej stronie tego samego dnia. Jeśli budujesz pętlę oceniania lub triażu, wywołanie piszące można routować, a wywołania oceniającego już nie — i to właśnie utrzymanie tej granicy w jasności powstrzymuje pipeline oceniający przed cichym staniem się pipeline'em czatowym.

Jak podjąć decyzję
Wybierz Kev, gdy potrzebujesz liczb, zanim coś wdrożysz, gdy chcesz dostroić model na własnych etykietach decyzyjnych, gdy chcesz prowadzić scoring w obrębie własnych granic przy zerowym koszcie krańcowym, albo gdy chcesz, aby kilka domen decyzyjnych współdzieliło jeden rezydentny model bazowy. Jego publikowane wartości ECE to wciąż pomiary samego autora na jego własnym stanowisku ewaluacyjnym — traktuj je jako wiarygodną samoocenę, a nie jako audytowany wynik strony trzeciej — ale są przynajmniej podaną skalą, którą możesz spróbować odtworzyć, a przepis jest tuż obok, by je odtworzyć.
Wybierz Microsoft-Decision-1, gdy kryterium decyzyjnym są zamówienia lub długość kontekstu: zarządzany punkt końcowy Azure z ujednoliconym rozliczaniem i pakietem Responsible AI, 32K danych wejściowych dla długich dokumentów oraz dostawca, do którego można eskalować. Brak tabeli wyników benchmarków nie jest skandalem — wiele hostowanych modeli debiutuje bez niej — ale oznacza, że pierwsza krzywa kalibracji dla tego modelu zostanie wykreślona przez jego użytkowników, a Ty powinieneś zaplanować, że będziesz jednym z nich, na własnych oznaczonych danych, zanim ustawisz dla niego próg produkcyjny.
