Wygenerowana karta tytułowa dla Intern-Decision-4B z podtytułem 'ustrukturyzowany model decyzyjny, który odpowiada, nie zapisując ani jednego tokenu', zawierająca trzy plakietki o treści 'brak ogłoszenia', 'trzy punkty kontrolne w 40 sekund' i 'brak niezależnych ewaluacji', ze stopką o treści 'Dane liczbowe zgodnie z kartą modelu InternLM; nic tutaj nie zostało niezależnie odtworzone'. Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Guides & Insights

Intern-Decision-4B: InternLM wypuścił model decyzyjny, który odpowiada bez zapisywania choćby jednego tokena

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Trzy repozytoria modeli pojawiły się na stronie InternLM na Hugging Face w ciągu czterdziestu sekund 26 września 2026 r.: Intern-Decision-0.8B o 05:35:57 UTC, Intern-Decision-2B o 05:36:19 i internlm/Intern-Decision-4B o 05:36:37. Model 4B jest tym interesującym. Jest to dostrojona wersja modelu Qwen3.5-4B, który przyjmuje wspólny stan, schemat nazwanych pytań i opcjonalne obrazy oraz zwraca skalibrowany rozkład odpowiedzi dla każdego pytania w jednym przejściu do przodu. Nigdy nie generuje tekstu. Jego własne notatki o wydaniu mówią to wprost: "To API wykonuje ustrukturyzowane ocenianie kandydatów. Nie wywołuje generate() ani nie próbkuje tekstu swobodnego." Czterdzieści sekund przesyłania i ani jednej linijki ogłoszenia nigdzie — żadnego wpisu na blogu, tweeta, changelogu, strony premiery. Co istnieje, to karta modelu, inference.py, i cztery shardy safetensors.

A screenshot of the internlm organisation page on Hugging Face, showing the organisation's Recent Activity feed with the Intern-Decision-2B repository listed as published about an hour before the capture, above the organisation's model list and its 18 collections.

Co zostało wydane, a co nie

Rodzina to pierwsza rzecz, którą trzeba poprawnie ustawić, bo karta 4B po cichu ją zawiera. Jej tabela benchmarków publikuje wiersze dla Intern-Decision-0.8B i Intern-Decision-2B obok własnego, a wszystkie trzy checkpointy trafiły do huba w tej samej minucie. Do repozytorium 2B nigdy nie prowadzi link z karty 4B — trzeba je znaleźć przez kanał przesłanych plików organizacji.

To, czego niedostarczono, to niemal wszystko, co zwykle przynosi wydanie:

• Brak ogłoszenia — zero wzmianek w sieci, żadnego oświadczenia dostawcy w jakimkolwiek języku, jaki udało nam się znaleźć.

• Brak demo — karta prowadzi do Space pod adresem huggingface.co/spaces/internlm/intern-decision; ten endpoint zwraca HTTP 401, co oznacza, że nie jest publiczny, a nie że jest zepsuty.

• Brak kolekcji — reklamowana kolekcja modeli pod adresem huggingface.co/collections/internlm/intern-decision również zwraca 401.

• Brak repozytorium kodu — link GitHub na karcie, github.com/internlm/Intern-Decision, zwraca błąd 404, a lista repozytoriów organizacji InternLM nie zawiera takiego projektu.

• Brak adopcji — w chwili pisania 4B ma jedno polubienie i zero pobrań.

To cała poznawalna powierzchnia. Traktuj każdą liczbę poniżej jako własną liczbę dostawcy, bo nikt inny jeszcze tego nie uruchamiał.

A screenshot of the internlm/Intern-Decision-4B model card on Hugging Face, showing the model title, the Demo, Model Weights and GitHub links, the description naming Qwen3.5-4B as the base model, and the five-step 'How inference works' list describing single-token symbol mapping, the assistant JSON skeleton, one causal forward pass, a softmax over candidate-symbol logits, and probability calibration.

Kontrakt wnioskowania to produkt

Większość karty zajmuje pięcioetapowa procedura, która pokazuje, gdzie poszła inżynieria. Pytania i opcje zachowują swoją kolejność. Opcje każdego pytania są mapowane na symbole pojedynczych tokenów — od A do Z, potem od a do z, potem od 0 do 9. To daje 62 symbole i właśnie dlatego karta ogranicza pytanie do 62 opcji. Prompt jest renderowany na podstawie oryginalnego promptu systemowego, stanu, schematu decyzji i kompletnego szkieletu JSON asystenta z jednym <decision> placeholderem na pole, zachowując szablon czatu checkpointu i pusty blok myślenia. Następnie jeden przyczynowy przebieg w przód. Logity są odczytywane na pozycji bezpośrednio przed każdym placeholderem, softmax działa tylko na dozwolonych logitach symboli-kandydatów danego pola, stosuje się kalibrację, a symbole są mapowane z powrotem na wartości twoich opcji.

Konsekwencją jest stały kształt: brak pętli dekodowania, brak próbkowania, brak parsera, brak powierzchni halucynacji i twardy limit jednej decyzji na pytanie na przebieg. Obsługiwane są trzy typy pytań — wybór z uporządkowaną mapą kryteriów, ocena z listą lub mapą z kluczami numerycznymi, oraz noul, binarne nie/tak.

Najważniejszy szczegół karty specyfikacji

Karta jednoznacznie stwierdza, że dane wejściowe są „odrzucane bez obcinania” powyżej DecisionEngine(max_length=8192). Zestaw to z konfiguracją, a ujawnia się coś dziwnego: podstawowa wieża tekstowa deklaruje max_position_embeddings wynoszące 262 144. Szkielet może zaadresować ćwierć miliona tokenów; udostępniona otoczka odrzuca wszystko powyżej 8 192. To nie jest model długiego kontekstu z konserwatywnym ustawieniem domyślnym — to model oceniający decyzje, którego własny harness ogranicza dowody, jakie możesz mu przekazać. Jeśli Twoje pytanie o routing zależy od więcej niż około ośmiu tysięcy tokenów stanu, ten checkpoint w dostarczonej postaci nie odpowie na nie i odmówi, zamiast obciąć dane wejściowe.

Dozwolonych jest maksymalnie osiem obrazów, a karta informuje, że tokeny obrazów wliczają się do tego samego limitu 8 192.

A generated timeline card titled 'Three checkpoints, forty seconds', listing Intern-Decision-0.8B at 05:35:57 UTC, Intern-Decision-2B at 05:36:19 UTC and Intern-Decision-4B at 05:36:37 UTC on 26 September 2026, with a footer reading 'Upload timestamps from the InternLM organisation feed on Hugging Face. No announcement accompanied any of the three.' The OrcaRouter logo is composited in the bottom-right corner.

Wewnątrz wag

Cztery shardy, 4,54 miliarda parametrów BF16 i konfiguracja, która wyjaśnia nazwę rozmiaru: jest wieża tekstowa, wieża wizyjna licząca około dwóch tuzinów warstw z rozmiarem patcha 16 pikseli oraz projektor pomiędzy nimi. Strona tekstowa to 32 warstwy przy wymiarze ukrytym 2 560, z 16 głowicami uwagi wobec 4 głowic klucz/wartość, słownikiem 248 320 tokenów i powiązanymi osadzeniami. Typy warstw zmieniają się naprzemiennie w stałym interwale — trzy warstwy uwagi liniowej, potem jedna warstwa pełnej uwagi, i tak w kółko. Tylko warstwy pełnej uwagi mają uwagę globalną, a osadzenie obrotowe jest częściowe ze współczynnikiem 0,25. Do jej wczytania potrzebny jest Python 3.12 lub nowszy, PyTorch 2.9.1 i Transformers 5.14.1, a lista plików wciąż zawiera pliki tokenizera, merges i słownika, zamiast opierać się na tokenizerze po stronie huba.

Liczby i to, kto je wygenerował

Wszystko w tej sekcji zostało zmierzone przez InternLM i opublikowane na karcie modelu. Żadna z tych rzeczy nie została odtworzona przez stronę trzecią, a dla tego modelu nigdzie nie ma wpisu Artificial Analysis, oceny w arenie ani wiersza w rankingu.

W siedmiu zestawach ewaluacyjnych model 4B osiąga średnio 90,02, z wynikiem Brier score 0,347 i oczekiwanym błędem kalibracji 0,065. Ta sama tabela podaje Intern-Decision-0.8B na poziomie 79,38 i Intern-Decision-2B na poziomie 84,68, więc rodzina rośnie wraz z rozmiarem — o 4,7 punktu od 0.8B do 2B, a potem o kolejne 5,3 do 4B. Tabela zawiera też pięć wierszy, których producent nie trenował: Jev z 88,74, JevK5 z 85,16, SemIf z 84,23, Kev z 79,56 i Laya z 57,77. Zostały one uruchomione przez InternLM przy użyciu środowiska testowego InternLM, na checkpoincie InternLM. Nie są to własne wyniki tych projektów, a odczytywanie ich jako takie to najłatwiejszy błąd, jaki można tu popełnić.

Opóźnienie jest mierzone na pojedynczym RTX 4090 przez lokalną ścieżkę Hugging Face, a karta oznacza wartości jako zależne od obciążenia i sprzętu. Model 4B osiąga średnio 44,16 ms, medianę 44,03 ms i 44,60 ms przy P95 — rozrzut znacznie poniżej milisekundy między medianą a ogonem, co jest typowe dla przejścia w przód o stałym kształcie. Dwa mniejsze checkpointy mają oba około 33 ms, przy czym 2B wypada nieznacznie lepiej niż 0.8B pod względem średniej i mediany, co warto zauważyć, a nie wygładzać: te dwa są wystarczająco blisko siebie, by mieścić się w szumie pomiarowym.

Kalibracja i uczciwe zastrzeżenia w niej zawarte

Checkpoint domyślnie zawiera temperaturę 1,99241824, dopasowaną osobno dla tego modelu poprzez minimalizację ujemnego logarytmu wiarygodności na 1 728 wyznaczonych przypadkach kalibracyjnych, z 1 693 wydzielonymi do walidacji. Karta podaje, że etykiety zestawu testowego nie zostały użyte do jej wyboru. Implementacja to kalibracja prawdopodobieństw kandydatów, a nie temperatura próbkowania: zmienia pewność, prawdopodobieństwo binarne i oczekiwany wynik, pozostawiając decyzję argmax bez zmian.

Osobny test diagnostyczny obejmujący 96 przypadków raportuje następnie ten efekt. W kolumnach „przed” i „po” samego InternLM ogólne wskaźniki Brier i ECE modelu 4B przesuwają się z 0,628 / 0,213 na 0,550 / 0,089, wobec 0,595 / 0,130 dla Jev. Dwie uczciwe interpretacje tej tabeli: kalibracja najwyraźniej działa, a kolumna „przed” nie przedstawia tego, co kiedykolwiek zobaczyłby jakikolwiek użytkownik, ponieważ domyślnie dostarczanym ustawieniem jest dopasowana temperatura. Warto też zaznaczyć — dwie z sześciu kategorii diagnostycznych wypadają dla 4B gorzej niż dla Jev, a najgorsza z nich, codzienne dowody i obciążenie obserwacyjne, poprawia się do 0,575 / 0,210, wciąż ustępując wynikowi Jev 0,603 / 0,114. Na tym wycinku kalibracja zawęża lukę, ale jej nie zamyka.

Gdzie router pasuje, a gdzie jeszcze nie

Praktyczną przeszkodą w korzystaniu z tego modelu nie jest dokładność, lecz sposób dystrybucji. W wydaniu dostarczana jest klasa języka Python, którą importujesz po pobraniu czterech shardów, a nie punkt końcowy HTTP, który możesz wywołać. Dokładnie tę lukę ma wypełniać warstwa routingu — jeden klucz do ponad 200 modeli, cena katalogowa dostawcy przekazywana bez narzutu (0% marży) oraz automatyczne przełączanie awaryjne, gdy dostawca szwankuje — ale powiedzmy wprost, że OrcaRouter obecnie nie oferuje Intern-Decision-4B ani żadnego modelu tego rodzaju. Nasz katalog go nie zawiera i nic tutaj nie powinno być odczytywane jako deklaracja dostępności. Możemy zaproponować tańszą decyzję: jeśli chcesz wypróbować model oceniający decyzje o 4,5 miliarda parametrów przed ścieżką produkcyjną, możesz wbudować go w router z fallbackiem do modelu ogólnego, tak aby zły dzień kalibracji kosztował cię ponowną próbę, a nie awarię.

Co zmieniłoby obraz sytuacji

Trzy rzeczy, w kolejności ważności. Ktoś spoza InternLM musi odtworzyć średnią 90,02 oraz oczekiwany błąd kalibracji 0,065 — twierdzenia o kalibracji, które nigdy nie trafiły na obcy zbiór testowy, są najmniej przenośnymi liczbami w uczeniu maszynowym. Musi pojawić się własny ślad karty: Space, kolekcja, repozytorium GitHub. A dostawca musi powiedzieć, czy to produkt, czy artefakt publikacyjny, ponieważ licencja wyłącznie badawcza i licencja Apache-2.0 to nie to samo zobowiązanie, a 4B wybrał Apache-2.0, zachowując obok niej licencję Qwen. Do tego czasu właściwe ujęcie jest takie, jakie sugeruje samo przesłanie: to prawdziwy checkpoint z prawdziwym kontraktem wnioskowania i całkowicie niezweryfikowaną kartą wyników, opublikowany bez poinformowania kogokolwiek.

Na razie uczciwe podsumowanie jest wąskie i użyteczne. Jeśli twoim problemem jest „wybierz jedną z pięciu etykiet routingu i powiedz mi, jak bardzo jesteś pewien”, to model 4,5B, który emituje 62 logity i nie generuje żadnej prozy, jest kształtem, którego można bronić w ocenie. Jeśli twój problem obejmuje długi dokument, więcej niż osiem obrazów albo jakąkolwiek potrzebę wyjaśnienia odpowiedzi słowami, ten checkpoint w takiej postaci, w jakiej został dostarczony, jest niewłaściwym narzędziem, a żadne szlifowanie benchmarków dostawcy tego nie zmieni.