
Intern-Decision-4B: InternLM wypuścił model decyzyjny, który odpowiada bez zapisywania choćby jednego tokena
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 592 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 187 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Trzy repozytoria modeli pojawiły się na stronie InternLM na Hugging Face w ciągu czterdziestu sekund 26 września 2026 r.: Intern-Decision-0.8B o 05:35:57 UTC, Intern-Decision-2B o 05:36:19 i internlm/Intern-Decision-4B o 05:36:37. Model 4B jest tym interesującym. Jest to dostrojona wersja modelu Qwen3.5-4B, który przyjmuje wspólny stan, schemat nazwanych pytań i opcjonalne obrazy oraz zwraca skalibrowany rozkład odpowiedzi dla każdego pytania w jednym przejściu do przodu. Nigdy nie generuje tekstu. Jego własne notatki o wydaniu mówią to wprost: "To API wykonuje ustrukturyzowane ocenianie kandydatów. Nie wywołuje generate() ani nie próbkuje tekstu swobodnego." Czterdzieści sekund przesyłania i ani jednej linijki ogłoszenia nigdzie — żadnego wpisu na blogu, tweeta, changelogu, strony premiery. Co istnieje, to karta modelu, inference.py, i cztery shardy safetensors.

Co zostało wydane, a co nie
Rodzina to pierwsza rzecz, którą trzeba poprawnie ustawić, bo karta 4B po cichu ją zawiera. Jej tabela benchmarków publikuje wiersze dla Intern-Decision-0.8B i Intern-Decision-2B obok własnego, a wszystkie trzy checkpointy trafiły do huba w tej samej minucie. Do repozytorium 2B nigdy nie prowadzi link z karty 4B — trzeba je znaleźć przez kanał przesłanych plików organizacji.
To, czego niedostarczono, to niemal wszystko, co zwykle przynosi wydanie:
• Brak ogłoszenia — zero wzmianek w sieci, żadnego oświadczenia dostawcy w jakimkolwiek języku, jaki udało nam się znaleźć.
• Brak demo — karta prowadzi do Space pod adresem huggingface.co/spaces/internlm/intern-decision; ten endpoint zwraca HTTP 401, co oznacza, że nie jest publiczny, a nie że jest zepsuty.
• Brak kolekcji — reklamowana kolekcja modeli pod adresem huggingface.co/collections/internlm/intern-decision również zwraca 401.
• Brak repozytorium kodu — link GitHub na karcie, github.com/internlm/Intern-Decision, zwraca błąd 404, a lista repozytoriów organizacji InternLM nie zawiera takiego projektu.
• Brak adopcji — w chwili pisania 4B ma jedno polubienie i zero pobrań.
To cała poznawalna powierzchnia. Traktuj każdą liczbę poniżej jako własną liczbę dostawcy, bo nikt inny jeszcze tego nie uruchamiał.

Kontrakt wnioskowania to produkt
Większość karty zajmuje pięcioetapowa procedura, która pokazuje, gdzie poszła inżynieria. Pytania i opcje zachowują swoją kolejność. Opcje każdego pytania są mapowane na symbole pojedynczych tokenów — od A do Z, potem od a do z, potem od 0 do 9. To daje 62 symbole i właśnie dlatego karta ogranicza pytanie do 62 opcji. Prompt jest renderowany na podstawie oryginalnego promptu systemowego, stanu, schematu decyzji i kompletnego szkieletu JSON asystenta z jednym <decision> placeholderem na pole, zachowując szablon czatu checkpointu i pusty blok myślenia. Następnie jeden przyczynowy przebieg w przód. Logity są odczytywane na pozycji bezpośrednio przed każdym placeholderem, softmax działa tylko na dozwolonych logitach symboli-kandydatów danego pola, stosuje się kalibrację, a symbole są mapowane z powrotem na wartości twoich opcji.
Konsekwencją jest stały kształt: brak pętli dekodowania, brak próbkowania, brak parsera, brak powierzchni halucynacji i twardy limit jednej decyzji na pytanie na przebieg. Obsługiwane są trzy typy pytań — wybór z uporządkowaną mapą kryteriów, ocena z listą lub mapą z kluczami numerycznymi, oraz noul, binarne nie/tak.
Najważniejszy szczegół karty specyfikacji
Karta jednoznacznie stwierdza, że dane wejściowe są „odrzucane bez obcinania” powyżej DecisionEngine(max_length=8192). Zestaw to z konfiguracją, a ujawnia się coś dziwnego: podstawowa wieża tekstowa deklaruje max_position_embeddings wynoszące 262 144. Szkielet może zaadresować ćwierć miliona tokenów; udostępniona otoczka odrzuca wszystko powyżej 8 192. To nie jest model długiego kontekstu z konserwatywnym ustawieniem domyślnym — to model oceniający decyzje, którego własny harness ogranicza dowody, jakie możesz mu przekazać. Jeśli Twoje pytanie o routing zależy od więcej niż około ośmiu tysięcy tokenów stanu, ten checkpoint w dostarczonej postaci nie odpowie na nie i odmówi, zamiast obciąć dane wejściowe.
Dozwolonych jest maksymalnie osiem obrazów, a karta informuje, że tokeny obrazów wliczają się do tego samego limitu 8 192.

Wewnątrz wag
Cztery shardy, 4,54 miliarda parametrów BF16 i konfiguracja, która wyjaśnia nazwę rozmiaru: jest wieża tekstowa, wieża wizyjna licząca około dwóch tuzinów warstw z rozmiarem patcha 16 pikseli oraz projektor pomiędzy nimi. Strona tekstowa to 32 warstwy przy wymiarze ukrytym 2 560, z 16 głowicami uwagi wobec 4 głowic klucz/wartość, słownikiem 248 320 tokenów i powiązanymi osadzeniami. Typy warstw zmieniają się naprzemiennie w stałym interwale — trzy warstwy uwagi liniowej, potem jedna warstwa pełnej uwagi, i tak w kółko. Tylko warstwy pełnej uwagi mają uwagę globalną, a osadzenie obrotowe jest częściowe ze współczynnikiem 0,25. Do jej wczytania potrzebny jest Python 3.12 lub nowszy, PyTorch 2.9.1 i Transformers 5.14.1, a lista plików wciąż zawiera pliki tokenizera, merges i słownika, zamiast opierać się na tokenizerze po stronie huba.
Liczby i to, kto je wygenerował
Wszystko w tej sekcji zostało zmierzone przez InternLM i opublikowane na karcie modelu. Żadna z tych rzeczy nie została odtworzona przez stronę trzecią, a dla tego modelu nigdzie nie ma wpisu Artificial Analysis, oceny w arenie ani wiersza w rankingu.
W siedmiu zestawach ewaluacyjnych model 4B osiąga średnio 90,02, z wynikiem Brier score 0,347 i oczekiwanym błędem kalibracji 0,065. Ta sama tabela podaje Intern-Decision-0.8B na poziomie 79,38 i Intern-Decision-2B na poziomie 84,68, więc rodzina rośnie wraz z rozmiarem — o 4,7 punktu od 0.8B do 2B, a potem o kolejne 5,3 do 4B. Tabela zawiera też pięć wierszy, których producent nie trenował: Jev z 88,74, JevK5 z 85,16, SemIf z 84,23, Kev z 79,56 i Laya z 57,77. Zostały one uruchomione przez InternLM przy użyciu środowiska testowego InternLM, na checkpoincie InternLM. Nie są to własne wyniki tych projektów, a odczytywanie ich jako takie to najłatwiejszy błąd, jaki można tu popełnić.
Opóźnienie jest mierzone na pojedynczym RTX 4090 przez lokalną ścieżkę Hugging Face, a karta oznacza wartości jako zależne od obciążenia i sprzętu. Model 4B osiąga średnio 44,16 ms, medianę 44,03 ms i 44,60 ms przy P95 — rozrzut znacznie poniżej milisekundy między medianą a ogonem, co jest typowe dla przejścia w przód o stałym kształcie. Dwa mniejsze checkpointy mają oba około 33 ms, przy czym 2B wypada nieznacznie lepiej niż 0.8B pod względem średniej i mediany, co warto zauważyć, a nie wygładzać: te dwa są wystarczająco blisko siebie, by mieścić się w szumie pomiarowym.
Kalibracja i uczciwe zastrzeżenia w niej zawarte
Checkpoint domyślnie zawiera temperaturę 1,99241824, dopasowaną osobno dla tego modelu poprzez minimalizację ujemnego logarytmu wiarygodności na 1 728 wyznaczonych przypadkach kalibracyjnych, z 1 693 wydzielonymi do walidacji. Karta podaje, że etykiety zestawu testowego nie zostały użyte do jej wyboru. Implementacja to kalibracja prawdopodobieństw kandydatów, a nie temperatura próbkowania: zmienia pewność, prawdopodobieństwo binarne i oczekiwany wynik, pozostawiając decyzję argmax bez zmian.
Osobny test diagnostyczny obejmujący 96 przypadków raportuje następnie ten efekt. W kolumnach „przed” i „po” samego InternLM ogólne wskaźniki Brier i ECE modelu 4B przesuwają się z 0,628 / 0,213 na 0,550 / 0,089, wobec 0,595 / 0,130 dla Jev. Dwie uczciwe interpretacje tej tabeli: kalibracja najwyraźniej działa, a kolumna „przed” nie przedstawia tego, co kiedykolwiek zobaczyłby jakikolwiek użytkownik, ponieważ domyślnie dostarczanym ustawieniem jest dopasowana temperatura. Warto też zaznaczyć — dwie z sześciu kategorii diagnostycznych wypadają dla 4B gorzej niż dla Jev, a najgorsza z nich, codzienne dowody i obciążenie obserwacyjne, poprawia się do 0,575 / 0,210, wciąż ustępując wynikowi Jev 0,603 / 0,114. Na tym wycinku kalibracja zawęża lukę, ale jej nie zamyka.
Gdzie router pasuje, a gdzie jeszcze nie
Praktyczną przeszkodą w korzystaniu z tego modelu nie jest dokładność, lecz sposób dystrybucji. W wydaniu dostarczana jest klasa języka Python, którą importujesz po pobraniu czterech shardów, a nie punkt końcowy HTTP, który możesz wywołać. Dokładnie tę lukę ma wypełniać warstwa routingu — jeden klucz do ponad 200 modeli, cena katalogowa dostawcy przekazywana bez narzutu (0% marży) oraz automatyczne przełączanie awaryjne, gdy dostawca szwankuje — ale powiedzmy wprost, że OrcaRouter obecnie nie oferuje Intern-Decision-4B ani żadnego modelu tego rodzaju. Nasz katalog go nie zawiera i nic tutaj nie powinno być odczytywane jako deklaracja dostępności. Możemy zaproponować tańszą decyzję: jeśli chcesz wypróbować model oceniający decyzje o 4,5 miliarda parametrów przed ścieżką produkcyjną, możesz wbudować go w router z fallbackiem do modelu ogólnego, tak aby zły dzień kalibracji kosztował cię ponowną próbę, a nie awarię.
Co zmieniłoby obraz sytuacji
Trzy rzeczy, w kolejności ważności. Ktoś spoza InternLM musi odtworzyć średnią 90,02 oraz oczekiwany błąd kalibracji 0,065 — twierdzenia o kalibracji, które nigdy nie trafiły na obcy zbiór testowy, są najmniej przenośnymi liczbami w uczeniu maszynowym. Musi pojawić się własny ślad karty: Space, kolekcja, repozytorium GitHub. A dostawca musi powiedzieć, czy to produkt, czy artefakt publikacyjny, ponieważ licencja wyłącznie badawcza i licencja Apache-2.0 to nie to samo zobowiązanie, a 4B wybrał Apache-2.0, zachowując obok niej licencję Qwen. Do tego czasu właściwe ujęcie jest takie, jakie sugeruje samo przesłanie: to prawdziwy checkpoint z prawdziwym kontraktem wnioskowania i całkowicie niezweryfikowaną kartą wyników, opublikowany bez poinformowania kogokolwiek.
Na razie uczciwe podsumowanie jest wąskie i użyteczne. Jeśli twoim problemem jest „wybierz jedną z pięciu etykiet routingu i powiedz mi, jak bardzo jesteś pewien”, to model 4,5B, który emituje 62 logity i nie generuje żadnej prozy, jest kształtem, którego można bronić w ocenie. Jeśli twój problem obejmuje długi dokument, więcej niż osiem obrazów albo jakąkolwiek potrzebę wyjaśnienia odpowiedzi słowami, ten checkpoint w takiej postaci, w jakiej został dostarczony, jest niewłaściwym narzędziem, a żadne szlifowanie benchmarków dostawcy tego nie zmieni.
