
Microsoft-Decision-1 kontra Intern-Decision-0.8B: Pół uncji kłopotów z jailbreakiem w starciu z hostowanym blankiem
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 za 1 mln tokenów · 55 tok/s
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
Zacznij od kolumny, którą wpis o premierze by pominął. Intern-Decision-0.8B — model decyzyjny InternLM o 852 985 920 parametrach, dostrojony na bazie Qwen3.5-0.8B i przesłany do Hugging Face 26 września 2026 bez ogłoszenia, bez artykułu, z linkiem do GitHuba, który wciąż zwraca 404 — został zmierzony na poziomie 64,48 w WildJailBreak względem referencyjnego wyniku 96,29 dla Jev 1.13 firmy TypeSafe. To nie jest różnica zaokrągleń. To załamanie odporności na odmowy w modelu, którego całym zadaniem jest ocenianie danych wejściowych, opublikowanym na własnej karcie dostawcy, w tabeli, której benchmark należy do kogoś innego. Postaw to obok Microsoft-Decision-1, który stał się ogólnie dostępny w Microsoft Foundry w dniu 8 października 2026 jako wyłącznie tekstowy scorer postawiony na Qwen3.5-9B, z udokumentowaną metodyką ewaluacji i ani jednym wynikiem wydrukowanym pod nią, a zobaczysz prawdziwy kształt tego starcia. Jeden z tych modeli powie ci liczbę, przez którą wygląda źle. Drugi mówi, jakich metryk by użył.
Ta inwersja jest warta więcej niż karta specyfikacji. Oba modele przyjmują stan i ograniczony zbiór pytań, a zwracają prawdopodobieństwa dla twoich opcji — żaden nie generuje tekstu i pod tym względem są tym samym rodzajem narzędzia. Różnice, które mają znaczenie, to kto nim zarządza, jak duży jest, ile możesz zweryfikować, oraz jedna kolumna dotycząca bezpieczeństwa, którą mniejszy, cichszy, w pełni pobieralny model zdecydował się mimo wszystko opublikować.
Co tak naprawdę zwraca każde z nich
Microsoft-Decision-1 to hostowane API i to jest pierwsza różnica strukturalna. Wagi nie są dystrybuowane — brak pobierania, brak repozytorium, brak ścieżki dostrajania — a integracja oznacza wdrożenie w Foundry z uwierzytelnianiem, rozliczaniem i zarządzaniem Azure. Wykonuje jedno przejście przez maksymalnie 32 768 tokenów, obsługuje pytania typu tak/nie, wielokrotnego wyboru, oceny, klasyfikacji i w formie rubryk, a na wejściu przyjmuje tylko tekst, a na wyjściu zwraca wartości liczbowe. W sposób jawny obsługuje opcję wstrzymania się, taką jak „nie można stwierdzić”, gdy dowody są niewystarczające, co sprawia, że próg ma znaczenie.
Intern-Decision-0.8B to odwrotne rozwiązanie. To wagi Apache 2.0 z zachowaną obok nich licencją Qwen od upstreamu jako LICENSE-QWEN, około 1,73 GB repozytorium w trzech shardach — 1,50 GB shard językowy, 176 MB shard wizyjny i 25 MB projektor — co mieści się na jednym konsumenckim GPU albo dobrze wyposażonym laptopie. Przyjmuje stan, schemat od jednego do szesnastu nazwanych pytań, z których każde ma maksymalnie 62 opcje, oraz opcjonalnie do ośmiu obrazów, a dołączony do niego inference.py dokumentuje kontrakt bardziej szczegółowo, niż większość modeli wprowadzonych na rynek zadaje sobie trud: opcje są mapowane na symbole jednotokenowe A–Z, następnie a–z, następnie 0–9; logity są odczytywane na pozycji bezpośrednio przed każdym <decision> placeholderem we wstępnie wyrenderowanym szkielecie; softmax jest obliczany wyłącznie na dozwolonych kandydatach tego pola; stosowana jest dopasowana temperatura.
Te dwie licencje to nie ten sam zakup. Microsoft-Decision-1 daje ci zarządzany endpoint i nie daje ci artefaktu, który byłby twoją własnością. Intern-Decision-0.8B daje ci artefakt, który jest twoją własnością, bez endpointu, bez umowy wsparcia i bez dokumentacji poza samym repozytorium.

Pułap i kalibracja, którą możesz audytować
O większości rzeczywistych integracji decydują dwie liczby, a obie należą do małego modelu.
Pierwszy to 8 192 tokeny. Silnik wnioskowania Intern-Decision-0.8B odrzuca zbyt duże wejście, zamiast je obcinać, co jest prawidłowym zachowaniem w przypadku skorera, a także twardą barierą: nie istnieje żadna strategia dzielenia na fragmenty, która zachowuje kontrakt, ponieważ stan, schemat i szkielet muszą znaleźć się w jednym przebiegu. Pułap Microsoft-Decision-1 jest czterokrotnie wyższy i wynosi 32 768, a jest to limit hostowany, który można podnieść, zmieniając sposób aprowizacji, a nie stała w pliku Pythona.
Drugi element to kalibracja i tutaj kierunek się odwraca. InternLM publikuje dopasowaną temperaturę 2.747760550703 dla modelu 0.8B, wybraną przez minimalizację NLL na 1 728 wyznaczonych przypadkach kalibracyjnych, z 1 693 odłożonymi do walidacji, przy czym karta wyraźnie stwierdza, że etykiety zestawu testowego nie zostały użyte do jej wyboru. Stosowana transformacja to softmax na logitach kandydatów pola, a następnie drugi softmax na logarytmie tego rozkładu podzielonym przez temperaturę. Ponieważ transformacja działa po pierwszym softmaxie i zachowuje kolejność, nie może w ogóle zmienić argmax — przesuwa pewność, prawdopodobieństwo odpowiedzi „tak” oraz wartość oczekiwaną pytania punktowego, a etykietę pozostawia identyczną. Jeśli Twój potok odczytuje etykietę, temperatura nic nie zmienia. Jeśli odczytuje prawdopodobieństwo, stosuje do niego próg lub wykorzystuje je w obliczeniu wartości oczekiwanej, temperatura decyduje o różnicy między liczbą, która coś znaczy, a taką, która nie znaczy nic. Przekazanie temperature=1 zwraca rozkład nieskalibrowany, jeśli wolisz dopasować własny.
Microsoft-Decision-1 nie ma równoważnego artefaktu. Jego zakładka Benchmarks stwierdza, że dokładność, błąd kalibracji, czułość bezpieczeństwa, wskaźniki fałszywie dodatnie i spójność sprawiedliwości zostały zmierzone na publicznych i społecznościowych benchmarkach decyzyjnych oraz odłożonych wewnętrznych zestawach testowych, że kolejność opcji była zmieniana, że zastosowano sparowane testy statystyczne oraz że model „osiąga wyniki na poziomie wiodących modeli decyzyjnych i wyprzedza inne otwarte modele decyzyjne oceniane przy użyciu tej samej metodologii”. Nie ma wydrukowanego błędu kalibracji, nie ma temperatury do sprawdzenia ani opisanego podziału walidacyjnego. Jedyna właściwość, która czyni prawdopodobieństwo użytecznym — czy 0,8 oznacza 0,8 — jest twierdzona i nieokreślona ilościowo.
Przeczytaj te dwa akapity w zestawieniu ze sobą, a porównanie przestaje dotyczyć rozmiaru. Checkpoint o 0,8 mld parametrów, którego kalibrację można przejrzeć i którego oprogramowanie można uruchomić, jest dla zespołu oceniającego obiektem łatwiejszym do opanowania niż hostowane API, którego kalibracja to jedno zdanie. Mały model ma też odnotowaną wartość opóźnienia — średnio 33,98 ms, mediana 33,44 ms, p95 37,50 ms na RTX 4090 przez lokalną ścieżkę Hugging Face, w pomiarze samego InternLM — podczas gdy wartość Microsoftu mierzy się we własnym wdrożeniu, gdzie wybór między trybem bezserwerowym a aprowizowaną przepustowością przesunie tę liczbę bardziej niż sam model.

Gdzie mały model przegrywa
Żadne z powyższych nie czyni Intern-Decision-0.8B bezpiecznym wyborem, a ta sama opublikowana tabela mówi dlaczego. WildJailBreak na poziomie 64.48 wobec 96.29 Jev's to luka w odporności na odmowy wynosząca trzydzieści punktów w dokładnie tej kategorii, w której oceniający ma do czynienia z niezaufanymi danymi wejściowymi. Model decyzyjny jest często komponentem, który decyduje, czy proponowane działanie jest bezpieczne, a taki, którego łatwo zagadać, jest obciążeniem w tej roli. Czy deficyt wynika z bazy Qwen3.5-0.8B, z celu dostrajania decyzyjnego czy z małej liczby parametrów, tego repozytorium ci nie mówi, i nie ma artykułu, przepisu treningowego ani ujawnienia danych, które by to wyjaśniły.
Pozostała część własnej tabeli InternLM jest bardziej pochlebna niż tamta kolumna, a mimo to wciąż skromna. Średnia z siedmiu zestawów wynosi 79,38 dla modelu 0,8B wobec 84,68 dla jego własnego odpowiednika 2B i 90,02 dla 4B — rodzina stromo pnie się wraz z rozmiarem, co jest łagodnym sygnałem, że tabeli nie skonstruowano wstecznie, by schlebić flagowcowi. AG News wypada na 88,61 wobec 89,57 Jev, praktycznie remis w czteroklasowej klasyfikacji tematycznej. W zakresie kalibracji model 0,8B podaje Brier równy 0,530 i oczekiwany błąd kalibracji 0,066, wobec 0,358 i 0,095 Jev — lepszy ECE, znacząco gorsza dokładność. To wiarygodny profil małego modelu z celowo dopasowaną temperaturą i nie jest to kombinacja, którą zespół marketingowy wybrałby do publikacji przez przypadek.
Nie ma też daty wydania, żadnego ogłoszenia, żadnej kolekcji gromadzącej trzy checkpointy, nigdzie hostowanego endpointu ani jakiejkolwiek niezależnej oceny. Demo Space zwraca 401. Prawidłowy opis Intern-Decision-0.8B to udostępniony checkpoint z niezweryfikowanymi twierdzeniami — co jest lepszą sytuacją niż API z listą oczekujących, ponieważ można je zmierzyć w jedno popołudnie, ale oznacza to, że ciężar walidacji spoczywa w całości na Tobie.
Wybór, i gdzie plasuje się OrcaRouter
Wybierz Microsoft-Decision-1, jeśli blokadą są zakupy lub skalowanie: potrzebujesz uwierzytelniania w Azure, ujednoliconego rozliczania i oceny Responsible AI, zanim cokolwiek trafi do produkcji; potrzebujesz kontekstu 32K; potrzebujesz punktu końcowego, którego nie obsługujesz; albo potrzebujesz ścieżki abstencji zaprojektowanej od początku, a nie sklejonej ręcznie. W zamian zaakceptuj, że nie możesz go uruchomić, nie możesz go dostroić, nie możesz sprawdzić jego kalibracji i sam będziesz mierzyć jego główne twierdzenie.
Wybierz Intern-Decision-0.8B, jeśli przeszkodą jest koszt, pamięć lub kontrola: chcesz scorer na licencji Apache-2.0, który mieści się w 1,73 GB, działa na sprzęcie, który już masz, za każdym razem zwraca tę samą etykietę i można go wymienić na jego wersję 2B lub 4B, zmieniając ścieżkę checkpointu. W zamian zaakceptuj ścianę 8192 tokenów, kolumnę WildJailBreak oraz fakt, że nikt poza InternLM nie odtworzył niczego na karcie.
Szczera rekomendacja jest taka, żeby zrobić jedno i drugie, bo są wystarczająco tanie, że nie warto się o to spierać. Samo wywołanie oceniające nie jest czymś, co routujemy — model, który zwraca prawdopodobieństwa zamiast tekstu, nie jest uzupełnieniem czatu, a żadne z tych rozwiązań nie znajduje się w naszym katalogu. To, co oferuje OrcaRouter, to druga połowa pętli: ponad 200 modeli za jednym kluczem zgodnym z OpenAI, które przygotowują rubrykę, generują odpowiedzi kandydujące lub wysyłają wywołanie narzędzia, które twój oceniający ma właśnie ocenić, w cenie katalogowej dostawcy przekazywanej z 0% marży, więc obniżka ceny przez dostawcę generatora jest u nas widoczna tego samego dnia. Automatyczne przełączanie awaryjne ma tu większe znaczenie niż zwykle, ponieważ potok, który ocenia wszystko, co widzi, nie ma zapasu na ponowienie zawieszonego wywołania, a DSL routingu pozwala wysłać jedno polecenie sędziemu do kilku autorów i połączyć ich zgodność, zamiast ufać tylko jednemu.

Konkluzja
Microsoft-Decision-1 osiągnął ogólną dostępność w Microsoft Foundry 8 października 2026: hostowany, tylko tekstowy, 32 768 tokenów, oparty na Qwen3.5-9B, z akapitem metodologicznym zamiast tabeli benchmarków. Intern-Decision-0.8B to checkpoint Apache-2.0 o rozmiarze 1,73 GB przesłany 26 września 2026, który publikuje Brier 0,530, ECE 0,066, dopasowaną temperaturę 2,747760550703, 33,98 ms na 4090 — oraz wynik WildJailBreak 64,48, którego nikt nie prosił, żeby go wypisywał. Jeśli możesz zweryfikować tylko jedną rzecz przed przyjęciem któregokolwiek z nich, zweryfikuj kalibrację na własnych oznaczonych przypadkach; to jest liczba, którą obaj dostawcy pozostawili tobie do znalezienia.
