Wygenerowana karta tytułowa dla Microsoft-Decision-1 vs Intern-Decision-4B z podtytułem „dwa modele oceniające, jeden z liczbami, a drugi bez”, z żetonami o treści: 9B vs 4B, hostowane API vs otwarte wagi, brak opublikowanych benchmarków vs Brier 0.347 i ECE 0.065, oraz stopka ze źródłami wskazująca, że dane Microsoftu są nieodtworzone, a dane InternLM są raportowane przez dostawcę.
Guides & Insights

Microsoft-Decision-1 vs Intern-Decision-4B: Jeden publikuje swoją kalibrację, drugi publikuje swoją metodologię

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Postaw Microsoft-Decision-1 obok Intern-Decision-4B, a otrzymasz porównanie rozstrzygane mniej przez możliwości niż przez to, co każdy dostawca był gotów opublikować. Model Microsoftu osiągnął ogólną dostępność na Microsoft Foundry 8 października 2026 r.: model bazowy Qwen3.5-9B, dotrenowany przez Microsoft, tylko tekst, kontekst 32 768 tokenów, wagi niedystrybuowane, metodologia ewaluacji opisująca dokładność, błąd kalibracji i sparowane testy statystyczne — i ani jednego wyniku. Intern-Decision-4B od InternLM pojawił się na Hugging Face 26 września 2026 r. o 05:36:37 UTC bez żadnej towarzyszącej zapowiedzi, jest dostrojony na bazie Qwen3.5-4B, przyjmuje zarówno obrazy, jak i tekst, działa w 44 milisekundach na pojedynczym RTX 4090 i wyświetla pełną tabelę wartości Brier oraz oczekiwanego błędu kalibracji. Oba zwracają rozkład prawdopodobieństwa dla opcji, które podasz. Tylko jeden z nich mówi, jak dobrze to robi.

To odwrócenie — większy, lepiej finansowany model jest tym nieprzejrzystym — stanowi o całym charakterze tego starcia i rozstrzyga o wyborze w przypadku większości zespołów szybciej niż jakakolwiek pozycja w specyfikacji.

Jedna liczba, która ich dzieli

InternLM podaje Brier 0.347 i ECE 0.065 dla Intern-Decision-4B w całym swoim zestawie testów, ze średnim wynikiem 90,02 w Jevbench-Easy (100,00), Jevbench-Original (98,61), Jevbench-Hard (73,87), Typed Decision (80,55), ToolACE (96,45), AG News (90,82) i WildJailBreak (89,86). Są to wartości podane przez dostawcę, uzyskane na jego własnym stanowisku testowym, a wiersze Jevbench to w szczególności własna rodzina testów tego projektu — należy je czytać jako samoocenę, a nie niezależną weryfikację. Są to jednak liczby o podanej skali, a zwłaszcza ECE to wartość, która mówi, czy zwrócone 0,8 jest warte działania.

Microsoft nie publikuje niczego równoważnego. Zakładka Benchmarks na stronie katalogowej Microsoft-Decision-1 opisuje, co zmierzono, i twierdzi, że model „dorównuje wiodącym modelom decyzyjnym i wyprzedza inne otwarte modele decyzyjne oceniane tą samą metodologią”, przy czym jako najsilniejsze obszary wskazano rozumowanie, stosowanie reguł i odporność na format promptu, a jako najsłabszy – specjalistyczną wiedzę dziedzinową. Brak Brier, brak ECE, brak tabeli dokładności. Jeśli twoja decyzja o wdrożeniu wymaga wartości kalibracji, zanim będziesz mógł ustalić próg eskalacji, jeden z tych dwóch modeli podaje ją wprost, a drugi każe ci ją zmierzyć samodzielnie.

A generated two-column scoreboard for Microsoft-Decision-1 and Intern-Decision-4B across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus Qwen3.5-4B fine-tuned by InternLM; weights hosted API only versus Apache-2.0 download; modality text only versus text plus up to eight images; context 32,768 tokens versus per-call limits of one to sixteen questions and up to 62 options each; published scores none versus a vendor-reported average of 90.02 with Brier 0.347 and ECE 0.065; and latency not published versus 44.16 ms mean on an RTX 4090. A footer notes Microsoft figures are unreproduced and InternLM figures vendor-reported.

Gdzie te dwie umowy faktycznie się różnią

Na pierwszy rzut oka te modele przyjmują to samo wywołanie. Dostarczasz stan, schemat nazwanych pytań i ustalony zestaw opcji; w zamian otrzymujesz prawdopodobieństwo dla każdej opcji, bez ani jednego tokenu wygenerowanego tekstu. Różnice ujawniają się na granicach tego kontraktu.

• Modalność — Microsoft-Decision-1 jest wyraźnie tekstowy i nie przyjmuje ani nie generuje treści graficznych, dźwiękowych ani wideo. Intern-Decision-4B przyjmuje opcjonalne obrazy wraz ze stanem, maksymalnie osiem na jedno wywołanie, co czyni go kandydatem do triażu zrzutów ekranu, sprawdzania układu dokumentów i kierowania zadań QA wizualnego.

• Liczba pytań — InternLM dokumentuje od 1 do 16 pytań na wywołanie, maksymalnie 62 opcje na pytanie, w trzech typach pól (choice, score, noul). Microsoft dokumentuje formaty — tak/nie, wielokrotny wybór, ocena, klasyfikacja, rubryka — oraz pojedyncze wywołanie obejmujące do 32 tys. tokenów, ale nie podaje górnego limitu liczby pytań na wywołanie.

• Kontekst — Microsoft podaje 32 768 tokenów. Karta Intern-Decision-4B podaje swoje limity w pytaniach, opcjach i obrazach, a nie jako jedną liczbę kontekstu, więc nie można zestawić tych dwóch na podstawie jednej wartości.

• Dystrybucja — Microsoft-Decision-1 to hostowane API Foundry; wagi modelu nie są dystrybuowane i nie można ich pobrać. Intern-Decision-4B jest dostępny na licencji Apache-2.0 na Hugging Face, z zachowaniem licencji Qwen upstream jako LICENSE-QWEN, co oznacza, że w przypadku redystrybucji należy zachować tę licencję oraz informacje o projekcie źródłowym.

• Profil kosztów — Wagi InternLM nic nie kosztują w uruchomieniu i są podawane jako 44,16 ms średnio i 44,60 ms dla P95 na jednym RTX 4090. Cena za token u Microsoftu nie jest w ogóle podana na stronie modelu.

• Zarządzanie — Microsoft dostarcza ocenę odpowiedzialnej AI, udokumentowane praktyki wdrożeniowe i wyraźne wyłączenia (nie do generowania tekstu, otwartego odpowiadania na pytania, konwersacji, tłumaczenia ani streszczania; nie może być jedynym zautomatyzowanym decydentem w decyzjach niosących istotne konsekwencje dla ludzi). InternLM dostarcza kartę modelu, która szczerze przedstawia pochodzenie — wagi „zmodyfikowane przez dostrajanie decyzyjne” — i nic, co przypominałoby pakiet zgodności.

A screenshot of the Intern-Decision-4B model card on Hugging Face, read 10 October 2026, showing the internlm organisation, 83 likes, the Image-Text-to-Text pipeline tag, Transformers and Safetensors badges, and qwen3_5 and decision-making as the listed tags alongside the model card heading.

Dwa bardzo różne powody, dla których liczby dotyczące opóźnień trudno porównać

Microsoft-Decision-1 nie publikuje wartości opóźnienia, więc nie ma czego postawić obok średniej InternLM wynoszącej 44,16 ms. To nie jest drobne przeoczenie w przypadku tego obciążenia. Te modele istnieją po to, by być wywoływane wielokrotnie w potoku — raz na każdy pobrany dokument, raz na każde proponowane wywołanie narzędzia, raz na każdą ocenianą odpowiedź — a różnica między czterema decyzjami na sekundę a czterdziestoma to różnica między ocenianiem próbki a ocenianiem wszystkiego. Liczba InternLM jest osiągalna już dziś na sprzęcie, który można wynająć na godziny; liczbę Microsoftu trzeba zmierzyć we własnym wdrożeniu Foundry, a kształt wdrożenia, który wybierzesz (serverless w modelu pay-as-you-go kontra aprowizowana przepustowość), zmieni ją bardziej niż sam model.

To tutaj również połowa wzorca należąca do OrcaRouter staje się istotna — i jest to wyłącznie połowa generatywna. Nie hostujemy Microsoft-Decision-1 ani Intern-Decision-4B — model, który zwraca prawdopodobieństwa zamiast tekstu, nie jest czymś, do czego kieruje się chat completions, i żaden z nich nie występuje w naszym katalogu. Za naszym jednym kluczem zgodnym z OpenAI stoi pula ponad 200 modeli, która zajmuje się pisaniem: prompt sędziego przygotowany przez jeden model, odpowiedzi kandydujące tworzone przez dwa inne, wywołanie narzędzia, które jest oceniane, zanim zostanie wykonane. Cena katalogowa dostawcy jest przekazywana z marżą 0%, więc obniżka ceny generatora obowiązuje po naszej stronie tego samego dnia, a automatyczne przełączanie awaryjne utrzymuje przy życiu stronę generującą pętli oceniającej, gdy pojedynczy dostawca zawodzi — co ma tu większe znaczenie niż zwykle, ponieważ potok, który ocenia wszystko, co widzi, nie ma zapasu na ponowienie zablokowanego wywołania.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

Kto powinien co wziąć?

Wybierz Intern-Decision-4B, jeśli którykolwiek z tych warunków jest spełniony: musisz oceniać obrazy oraz tekst, potrzebujesz wartości kalibracyjnej, zanim będziesz mógł wdrożyć rozwiązanie, chcesz mieć możliwość uruchamiania modelu na własnym sprzęcie w granicach, które kontrolujesz, albo chcesz go dostroić. Ostatni punkt zasługuje na podkreślenie — skorer 4B o otwartych wagach z udokumentowanym wrapperem to model, który możesz dostosować do własnych etykiet, a Microsoft-Decision-1 to hostowane API bez ścieżki dostrajania i bez wag, które można dostosować.

Wybierz Microsoft-Decision-1, jeśli przeszkodą jest proces zakupowy, a nie wydajność: potrzebujesz uwierzytelniania Azure, ujednoliconego rozliczania, ładu i oceny dostawcy pod kątem odpowiedzialnej AI, zanim cokolwiek trafi do produkcji, a także potrzebujesz kontekstu 32K dla długich dokumentów, które komplikują limity na wywołanie w modelu 4B. Brak publikowanych benchmarków to rzeczywisty koszt, ale to koszt, który możesz zlikwidować w jedno popołudnie, przepuszczając własny oznaczony zbiór przez oba modele i porównując ECE — co i tak byś zrobił, zanim zaufałbyś tabeli któregokolwiek dostawcy.

Niewygodna odpowiedź brzmi: oba są wystarczająco tanie w testowaniu, że spór o to prawie nie ma sensu. Intern-Decision-4B potrzebuje GPU, które prawdopodobnie już masz. Microsoft-Decision-1 wymaga wdrożenia w Foundry i próbki własnych oznaczonych decyzji. Przepuść swoje dane przez oba, oblicz kalibrację na podzbiorze, który ma dla ciebie znaczenie, i pozwól, by liczby zdecydowały — co jest, całkiem stosownie, dokładnie tym, do czego te modele służą.