Wygenerowana karta tytułowa dla Microsoft-Decision-1 vs Intern-Decision-0.8B z podtytułem „hostowany scorer bez liczb kontra checkpoint o rozmiarze 1,73 GB z niepochlebną liczbą”, zawierająca plakietki o treści „punkt końcowy Foundry” kontra „852 985 920 parametrów”, akapit metodologii wobec wyniku WildJailBreak 64,48 oraz 32 768 tokenów kontra pułap 8 192.
Guides & Insights

Microsoft-Decision-1 kontra Intern-Decision-0.8B: Pół uncji kłopotów z jailbreakiem w starciu z hostowanym blankiem

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Zacznij od kolumny, którą wpis o premierze by pominął. Intern-Decision-0.8B — model decyzyjny InternLM o 852 985 920 parametrach, dostrojony na bazie Qwen3.5-0.8B i przesłany do Hugging Face 26 września 2026 bez ogłoszenia, bez artykułu, z linkiem do GitHuba, który wciąż zwraca 404 — został zmierzony na poziomie 64,48 w WildJailBreak względem referencyjnego wyniku 96,29 dla Jev 1.13 firmy TypeSafe. To nie jest różnica zaokrągleń. To załamanie odporności na odmowy w modelu, którego całym zadaniem jest ocenianie danych wejściowych, opublikowanym na własnej karcie dostawcy, w tabeli, której benchmark należy do kogoś innego. Postaw to obok Microsoft-Decision-1, który stał się ogólnie dostępny w Microsoft Foundry w dniu 8 października 2026 jako wyłącznie tekstowy scorer postawiony na Qwen3.5-9B, z udokumentowaną metodyką ewaluacji i ani jednym wynikiem wydrukowanym pod nią, a zobaczysz prawdziwy kształt tego starcia. Jeden z tych modeli powie ci liczbę, przez którą wygląda źle. Drugi mówi, jakich metryk by użył.

Ta inwersja jest warta więcej niż karta specyfikacji. Oba modele przyjmują stan i ograniczony zbiór pytań, a zwracają prawdopodobieństwa dla twoich opcji — żaden nie generuje tekstu i pod tym względem są tym samym rodzajem narzędzia. Różnice, które mają znaczenie, to kto nim zarządza, jak duży jest, ile możesz zweryfikować, oraz jedna kolumna dotycząca bezpieczeństwa, którą mniejszy, cichszy, w pełni pobieralny model zdecydował się mimo wszystko opublikować.

Co tak naprawdę zwraca każde z nich

Microsoft-Decision-1 to hostowane API i to jest pierwsza różnica strukturalna. Wagi nie są dystrybuowane — brak pobierania, brak repozytorium, brak ścieżki dostrajania — a integracja oznacza wdrożenie w Foundry z uwierzytelnianiem, rozliczaniem i zarządzaniem Azure. Wykonuje jedno przejście przez maksymalnie 32 768 tokenów, obsługuje pytania typu tak/nie, wielokrotnego wyboru, oceny, klasyfikacji i w formie rubryk, a na wejściu przyjmuje tylko tekst, a na wyjściu zwraca wartości liczbowe. W sposób jawny obsługuje opcję wstrzymania się, taką jak „nie można stwierdzić”, gdy dowody są niewystarczające, co sprawia, że próg ma znaczenie.

Intern-Decision-0.8B to odwrotne rozwiązanie. To wagi Apache 2.0 z zachowaną obok nich licencją Qwen od upstreamu jako LICENSE-QWEN, około 1,73 GB repozytorium w trzech shardach — 1,50 GB shard językowy, 176 MB shard wizyjny i 25 MB projektor — co mieści się na jednym konsumenckim GPU albo dobrze wyposażonym laptopie. Przyjmuje stan, schemat od jednego do szesnastu nazwanych pytań, z których każde ma maksymalnie 62 opcje, oraz opcjonalnie do ośmiu obrazów, a dołączony do niego inference.py dokumentuje kontrakt bardziej szczegółowo, niż większość modeli wprowadzonych na rynek zadaje sobie trud: opcje są mapowane na symbole jednotokenowe A–Z, następnie a–z, następnie 0–9; logity są odczytywane na pozycji bezpośrednio przed każdym <decision> placeholderem we wstępnie wyrenderowanym szkielecie; softmax jest obliczany wyłącznie na dozwolonych kandydatach tego pola; stosowana jest dopasowana temperatura.

Te dwie licencje to nie ten sam zakup. Microsoft-Decision-1 daje ci zarządzany endpoint i nie daje ci artefaktu, który byłby twoją własnością. Intern-Decision-0.8B daje ci artefakt, który jest twoją własnością, bez endpointu, bez umowy wsparcia i bez dokumentacji poza samym repozytorium.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Pułap i kalibracja, którą możesz audytować

O większości rzeczywistych integracji decydują dwie liczby, a obie należą do małego modelu.

Pierwszy to 8 192 tokeny. Silnik wnioskowania Intern-Decision-0.8B odrzuca zbyt duże wejście, zamiast je obcinać, co jest prawidłowym zachowaniem w przypadku skorera, a także twardą barierą: nie istnieje żadna strategia dzielenia na fragmenty, która zachowuje kontrakt, ponieważ stan, schemat i szkielet muszą znaleźć się w jednym przebiegu. Pułap Microsoft-Decision-1 jest czterokrotnie wyższy i wynosi 32 768, a jest to limit hostowany, który można podnieść, zmieniając sposób aprowizacji, a nie stała w pliku Pythona.

Drugi element to kalibracja i tutaj kierunek się odwraca. InternLM publikuje dopasowaną temperaturę 2.747760550703 dla modelu 0.8B, wybraną przez minimalizację NLL na 1 728 wyznaczonych przypadkach kalibracyjnych, z 1 693 odłożonymi do walidacji, przy czym karta wyraźnie stwierdza, że etykiety zestawu testowego nie zostały użyte do jej wyboru. Stosowana transformacja to softmax na logitach kandydatów pola, a następnie drugi softmax na logarytmie tego rozkładu podzielonym przez temperaturę. Ponieważ transformacja działa po pierwszym softmaxie i zachowuje kolejność, nie może w ogóle zmienić argmax — przesuwa pewność, prawdopodobieństwo odpowiedzi „tak” oraz wartość oczekiwaną pytania punktowego, a etykietę pozostawia identyczną. Jeśli Twój potok odczytuje etykietę, temperatura nic nie zmienia. Jeśli odczytuje prawdopodobieństwo, stosuje do niego próg lub wykorzystuje je w obliczeniu wartości oczekiwanej, temperatura decyduje o różnicy między liczbą, która coś znaczy, a taką, która nie znaczy nic. Przekazanie temperature=1 zwraca rozkład nieskalibrowany, jeśli wolisz dopasować własny.

Microsoft-Decision-1 nie ma równoważnego artefaktu. Jego zakładka Benchmarks stwierdza, że dokładność, błąd kalibracji, czułość bezpieczeństwa, wskaźniki fałszywie dodatnie i spójność sprawiedliwości zostały zmierzone na publicznych i społecznościowych benchmarkach decyzyjnych oraz odłożonych wewnętrznych zestawach testowych, że kolejność opcji była zmieniana, że zastosowano sparowane testy statystyczne oraz że model „osiąga wyniki na poziomie wiodących modeli decyzyjnych i wyprzedza inne otwarte modele decyzyjne oceniane przy użyciu tej samej metodologii”. Nie ma wydrukowanego błędu kalibracji, nie ma temperatury do sprawdzenia ani opisanego podziału walidacyjnego. Jedyna właściwość, która czyni prawdopodobieństwo użytecznym — czy 0,8 oznacza 0,8 — jest twierdzona i nieokreślona ilościowo.

Przeczytaj te dwa akapity w zestawieniu ze sobą, a porównanie przestaje dotyczyć rozmiaru. Checkpoint o 0,8 mld parametrów, którego kalibrację można przejrzeć i którego oprogramowanie można uruchomić, jest dla zespołu oceniającego obiektem łatwiejszym do opanowania niż hostowane API, którego kalibracja to jedno zdanie. Mały model ma też odnotowaną wartość opóźnienia — średnio 33,98 ms, mediana 33,44 ms, p95 37,50 ms na RTX 4090 przez lokalną ścieżkę Hugging Face, w pomiarze samego InternLM — podczas gdy wartość Microsoftu mierzy się we własnym wdrożeniu, gdzie wybór między trybem bezserwerowym a aprowizowaną przepustowością przesunie tę liczbę bardziej niż sam model.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Intern-Decision-0.8B. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; weights not distributed; calibration error not published; latency not published. Right column Intern-Decision-0.8B rows read: availability uploaded September 26, 2026; parameters 852,985,920 in 1.73 GB; input ceiling 8,192 tokens with oversize input rejected; weights Apache 2.0 and self-serve; Brier 0.530 and ECE 0.066; 33.98 ms mean on a single RTX 4090. A footer line reads that the InternLM figures are vendor-reported on InternLM's own harness with no independent reproduction.

Gdzie mały model przegrywa

Żadne z powyższych nie czyni Intern-Decision-0.8B bezpiecznym wyborem, a ta sama opublikowana tabela mówi dlaczego. WildJailBreak na poziomie 64.48 wobec 96.29 Jev's to luka w odporności na odmowy wynosząca trzydzieści punktów w dokładnie tej kategorii, w której oceniający ma do czynienia z niezaufanymi danymi wejściowymi. Model decyzyjny jest często komponentem, który decyduje, czy proponowane działanie jest bezpieczne, a taki, którego łatwo zagadać, jest obciążeniem w tej roli. Czy deficyt wynika z bazy Qwen3.5-0.8B, z celu dostrajania decyzyjnego czy z małej liczby parametrów, tego repozytorium ci nie mówi, i nie ma artykułu, przepisu treningowego ani ujawnienia danych, które by to wyjaśniły.

Pozostała część własnej tabeli InternLM jest bardziej pochlebna niż tamta kolumna, a mimo to wciąż skromna. Średnia z siedmiu zestawów wynosi 79,38 dla modelu 0,8B wobec 84,68 dla jego własnego odpowiednika 2B i 90,02 dla 4B — rodzina stromo pnie się wraz z rozmiarem, co jest łagodnym sygnałem, że tabeli nie skonstruowano wstecznie, by schlebić flagowcowi. AG News wypada na 88,61 wobec 89,57 Jev, praktycznie remis w czteroklasowej klasyfikacji tematycznej. W zakresie kalibracji model 0,8B podaje Brier równy 0,530 i oczekiwany błąd kalibracji 0,066, wobec 0,358 i 0,095 Jev — lepszy ECE, znacząco gorsza dokładność. To wiarygodny profil małego modelu z celowo dopasowaną temperaturą i nie jest to kombinacja, którą zespół marketingowy wybrałby do publikacji przez przypadek.

Nie ma też daty wydania, żadnego ogłoszenia, żadnej kolekcji gromadzącej trzy checkpointy, nigdzie hostowanego endpointu ani jakiejkolwiek niezależnej oceny. Demo Space zwraca 401. Prawidłowy opis Intern-Decision-0.8B to udostępniony checkpoint z niezweryfikowanymi twierdzeniami — co jest lepszą sytuacją niż API z listą oczekujących, ponieważ można je zmierzyć w jedno popołudnie, ale oznacza to, że ciężar walidacji spoczywa w całości na Tobie.

Wybór, i gdzie plasuje się OrcaRouter

Wybierz Microsoft-Decision-1, jeśli blokadą są zakupy lub skalowanie: potrzebujesz uwierzytelniania w Azure, ujednoliconego rozliczania i oceny Responsible AI, zanim cokolwiek trafi do produkcji; potrzebujesz kontekstu 32K; potrzebujesz punktu końcowego, którego nie obsługujesz; albo potrzebujesz ścieżki abstencji zaprojektowanej od początku, a nie sklejonej ręcznie. W zamian zaakceptuj, że nie możesz go uruchomić, nie możesz go dostroić, nie możesz sprawdzić jego kalibracji i sam będziesz mierzyć jego główne twierdzenie.

Wybierz Intern-Decision-0.8B, jeśli przeszkodą jest koszt, pamięć lub kontrola: chcesz scorer na licencji Apache-2.0, który mieści się w 1,73 GB, działa na sprzęcie, który już masz, za każdym razem zwraca tę samą etykietę i można go wymienić na jego wersję 2B lub 4B, zmieniając ścieżkę checkpointu. W zamian zaakceptuj ścianę 8192 tokenów, kolumnę WildJailBreak oraz fakt, że nikt poza InternLM nie odtworzył niczego na karcie.

Szczera rekomendacja jest taka, żeby zrobić jedno i drugie, bo są wystarczająco tanie, że nie warto się o to spierać. Samo wywołanie oceniające nie jest czymś, co routujemy — model, który zwraca prawdopodobieństwa zamiast tekstu, nie jest uzupełnieniem czatu, a żadne z tych rozwiązań nie znajduje się w naszym katalogu. To, co oferuje OrcaRouter, to druga połowa pętli: ponad 200 modeli za jednym kluczem zgodnym z OpenAI, które przygotowują rubrykę, generują odpowiedzi kandydujące lub wysyłają wywołanie narzędzia, które twój oceniający ma właśnie ocenić, w cenie katalogowej dostawcy przekazywanej z 0% marży, więc obniżka ceny przez dostawcę generatora jest u nas widoczna tego samego dnia. Automatyczne przełączanie awaryjne ma tu większe znaczenie niż zwykle, ponieważ potok, który ocenia wszystko, co widzi, nie ma zapasu na ponowienie zawieszonego wywołania, a DSL routingu pozwala wysłać jedno polecenie sędziemu do kilku autorów i połączyć ich zgodność, zamiast ufać tylko jednemu.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filter controls for input modalities, context length, input price, status, series and supported parameters, and a search field. No decision-scoring model appears in the listing.

Konkluzja

Microsoft-Decision-1 osiągnął ogólną dostępność w Microsoft Foundry 8 października 2026: hostowany, tylko tekstowy, 32 768 tokenów, oparty na Qwen3.5-9B, z akapitem metodologicznym zamiast tabeli benchmarków. Intern-Decision-0.8B to checkpoint Apache-2.0 o rozmiarze 1,73 GB przesłany 26 września 2026, który publikuje Brier 0,530, ECE 0,066, dopasowaną temperaturę 2,747760550703, 33,98 ms na 4090 — oraz wynik WildJailBreak 64,48, którego nikt nie prosił, żeby go wypisywał. Jeśli możesz zweryfikować tylko jedną rzecz przed przyjęciem któregokolwiek z nich, zweryfikuj kalibrację na własnych oznaczonych przypadkach; to jest liczba, którą obaj dostawcy pozostawili tobie do znalezienia.