
Microsoft-Decision-1 vs Intern-Decision-4B: Jeden publikuje swoją kalibrację, drugi publikuje swoją metodologię
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 za 1 mln tokenów
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
Postaw Microsoft-Decision-1 obok Intern-Decision-4B, a otrzymasz porównanie rozstrzygane mniej przez możliwości niż przez to, co każdy dostawca był gotów opublikować. Model Microsoftu osiągnął ogólną dostępność na Microsoft Foundry 8 października 2026 r.: model bazowy Qwen3.5-9B, dotrenowany przez Microsoft, tylko tekst, kontekst 32 768 tokenów, wagi niedystrybuowane, metodologia ewaluacji opisująca dokładność, błąd kalibracji i sparowane testy statystyczne — i ani jednego wyniku. Intern-Decision-4B od InternLM pojawił się na Hugging Face 26 września 2026 r. o 05:36:37 UTC bez żadnej towarzyszącej zapowiedzi, jest dostrojony na bazie Qwen3.5-4B, przyjmuje zarówno obrazy, jak i tekst, działa w 44 milisekundach na pojedynczym RTX 4090 i wyświetla pełną tabelę wartości Brier oraz oczekiwanego błędu kalibracji. Oba zwracają rozkład prawdopodobieństwa dla opcji, które podasz. Tylko jeden z nich mówi, jak dobrze to robi.
To odwrócenie — większy, lepiej finansowany model jest tym nieprzejrzystym — stanowi o całym charakterze tego starcia i rozstrzyga o wyborze w przypadku większości zespołów szybciej niż jakakolwiek pozycja w specyfikacji.
Jedna liczba, która ich dzieli
InternLM podaje Brier 0.347 i ECE 0.065 dla Intern-Decision-4B w całym swoim zestawie testów, ze średnim wynikiem 90,02 w Jevbench-Easy (100,00), Jevbench-Original (98,61), Jevbench-Hard (73,87), Typed Decision (80,55), ToolACE (96,45), AG News (90,82) i WildJailBreak (89,86). Są to wartości podane przez dostawcę, uzyskane na jego własnym stanowisku testowym, a wiersze Jevbench to w szczególności własna rodzina testów tego projektu — należy je czytać jako samoocenę, a nie niezależną weryfikację. Są to jednak liczby o podanej skali, a zwłaszcza ECE to wartość, która mówi, czy zwrócone 0,8 jest warte działania.
Microsoft nie publikuje niczego równoważnego. Zakładka Benchmarks na stronie katalogowej Microsoft-Decision-1 opisuje, co zmierzono, i twierdzi, że model „dorównuje wiodącym modelom decyzyjnym i wyprzedza inne otwarte modele decyzyjne oceniane tą samą metodologią”, przy czym jako najsilniejsze obszary wskazano rozumowanie, stosowanie reguł i odporność na format promptu, a jako najsłabszy – specjalistyczną wiedzę dziedzinową. Brak Brier, brak ECE, brak tabeli dokładności. Jeśli twoja decyzja o wdrożeniu wymaga wartości kalibracji, zanim będziesz mógł ustalić próg eskalacji, jeden z tych dwóch modeli podaje ją wprost, a drugi każe ci ją zmierzyć samodzielnie.

Gdzie te dwie umowy faktycznie się różnią
Na pierwszy rzut oka te modele przyjmują to samo wywołanie. Dostarczasz stan, schemat nazwanych pytań i ustalony zestaw opcji; w zamian otrzymujesz prawdopodobieństwo dla każdej opcji, bez ani jednego tokenu wygenerowanego tekstu. Różnice ujawniają się na granicach tego kontraktu.
• Modalność — Microsoft-Decision-1 jest wyraźnie tekstowy i nie przyjmuje ani nie generuje treści graficznych, dźwiękowych ani wideo. Intern-Decision-4B przyjmuje opcjonalne obrazy wraz ze stanem, maksymalnie osiem na jedno wywołanie, co czyni go kandydatem do triażu zrzutów ekranu, sprawdzania układu dokumentów i kierowania zadań QA wizualnego.
• Liczba pytań — InternLM dokumentuje od 1 do 16 pytań na wywołanie, maksymalnie 62 opcje na pytanie, w trzech typach pól (choice, score, noul). Microsoft dokumentuje formaty — tak/nie, wielokrotny wybór, ocena, klasyfikacja, rubryka — oraz pojedyncze wywołanie obejmujące do 32 tys. tokenów, ale nie podaje górnego limitu liczby pytań na wywołanie.
• Kontekst — Microsoft podaje 32 768 tokenów. Karta Intern-Decision-4B podaje swoje limity w pytaniach, opcjach i obrazach, a nie jako jedną liczbę kontekstu, więc nie można zestawić tych dwóch na podstawie jednej wartości.
• Dystrybucja — Microsoft-Decision-1 to hostowane API Foundry; wagi modelu nie są dystrybuowane i nie można ich pobrać. Intern-Decision-4B jest dostępny na licencji Apache-2.0 na Hugging Face, z zachowaniem licencji Qwen upstream jako LICENSE-QWEN, co oznacza, że w przypadku redystrybucji należy zachować tę licencję oraz informacje o projekcie źródłowym.
• Profil kosztów — Wagi InternLM nic nie kosztują w uruchomieniu i są podawane jako 44,16 ms średnio i 44,60 ms dla P95 na jednym RTX 4090. Cena za token u Microsoftu nie jest w ogóle podana na stronie modelu.
• Zarządzanie — Microsoft dostarcza ocenę odpowiedzialnej AI, udokumentowane praktyki wdrożeniowe i wyraźne wyłączenia (nie do generowania tekstu, otwartego odpowiadania na pytania, konwersacji, tłumaczenia ani streszczania; nie może być jedynym zautomatyzowanym decydentem w decyzjach niosących istotne konsekwencje dla ludzi). InternLM dostarcza kartę modelu, która szczerze przedstawia pochodzenie — wagi „zmodyfikowane przez dostrajanie decyzyjne” — i nic, co przypominałoby pakiet zgodności.

Dwa bardzo różne powody, dla których liczby dotyczące opóźnień trudno porównać
Microsoft-Decision-1 nie publikuje wartości opóźnienia, więc nie ma czego postawić obok średniej InternLM wynoszącej 44,16 ms. To nie jest drobne przeoczenie w przypadku tego obciążenia. Te modele istnieją po to, by być wywoływane wielokrotnie w potoku — raz na każdy pobrany dokument, raz na każde proponowane wywołanie narzędzia, raz na każdą ocenianą odpowiedź — a różnica między czterema decyzjami na sekundę a czterdziestoma to różnica między ocenianiem próbki a ocenianiem wszystkiego. Liczba InternLM jest osiągalna już dziś na sprzęcie, który można wynająć na godziny; liczbę Microsoftu trzeba zmierzyć we własnym wdrożeniu Foundry, a kształt wdrożenia, który wybierzesz (serverless w modelu pay-as-you-go kontra aprowizowana przepustowość), zmieni ją bardziej niż sam model.
To tutaj również połowa wzorca należąca do OrcaRouter staje się istotna — i jest to wyłącznie połowa generatywna. Nie hostujemy Microsoft-Decision-1 ani Intern-Decision-4B — model, który zwraca prawdopodobieństwa zamiast tekstu, nie jest czymś, do czego kieruje się chat completions, i żaden z nich nie występuje w naszym katalogu. Za naszym jednym kluczem zgodnym z OpenAI stoi pula ponad 200 modeli, która zajmuje się pisaniem: prompt sędziego przygotowany przez jeden model, odpowiedzi kandydujące tworzone przez dwa inne, wywołanie narzędzia, które jest oceniane, zanim zostanie wykonane. Cena katalogowa dostawcy jest przekazywana z marżą 0%, więc obniżka ceny generatora obowiązuje po naszej stronie tego samego dnia, a automatyczne przełączanie awaryjne utrzymuje przy życiu stronę generującą pętli oceniającej, gdy pojedynczy dostawca zawodzi — co ma tu większe znaczenie niż zwykle, ponieważ potok, który ocenia wszystko, co widzi, nie ma zapasu na ponowienie zablokowanego wywołania.

Kto powinien co wziąć?
Wybierz Intern-Decision-4B, jeśli którykolwiek z tych warunków jest spełniony: musisz oceniać obrazy oraz tekst, potrzebujesz wartości kalibracyjnej, zanim będziesz mógł wdrożyć rozwiązanie, chcesz mieć możliwość uruchamiania modelu na własnym sprzęcie w granicach, które kontrolujesz, albo chcesz go dostroić. Ostatni punkt zasługuje na podkreślenie — skorer 4B o otwartych wagach z udokumentowanym wrapperem to model, który możesz dostosować do własnych etykiet, a Microsoft-Decision-1 to hostowane API bez ścieżki dostrajania i bez wag, które można dostosować.
Wybierz Microsoft-Decision-1, jeśli przeszkodą jest proces zakupowy, a nie wydajność: potrzebujesz uwierzytelniania Azure, ujednoliconego rozliczania, ładu i oceny dostawcy pod kątem odpowiedzialnej AI, zanim cokolwiek trafi do produkcji, a także potrzebujesz kontekstu 32K dla długich dokumentów, które komplikują limity na wywołanie w modelu 4B. Brak publikowanych benchmarków to rzeczywisty koszt, ale to koszt, który możesz zlikwidować w jedno popołudnie, przepuszczając własny oznaczony zbiór przez oba modele i porównując ECE — co i tak byś zrobił, zanim zaufałbyś tabeli któregokolwiek dostawcy.
Niewygodna odpowiedź brzmi: oba są wystarczająco tanie w testowaniu, że spór o to prawie nie ma sensu. Intern-Decision-4B potrzebuje GPU, które prawdopodobnie już masz. Microsoft-Decision-1 wymaga wdrożenia w Foundry i próbki własnych oznaczonych decyzji. Przepuść swoje dane przez oba, oblicz kalibrację na podzbiorze, który ma dla ciebie znaczenie, i pozwól, by liczby zdecydowały — co jest, całkiem stosownie, dokładnie tym, do czego te modele służą.
