Wygenerowana karta tytułowa dla Intern-Decision-2B z napisem „Wydano po cichu, nie ogłoszono” oraz plakietkami „link do GitHuba został dziś opublikowany” i „2 213 241 664 parametry”, z logo OrcaRouter nałożonym w rogu.
Engineering & Research

Intern-Decision-2B po cichu trafił na Hugging Face. Link do GitHuba na jego karcie właśnie przestał zwracać 404.

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Wcześniej dziś karta modelu dla internlm/Intern-Decision-2B wskazywała trzy miejsca z dodatkowymi informacjami, a dwa z nich były martwe: demo Space odpowiadało kodem HTTP 401, a github.com/internlm/Intern-Decision zwracało 404 każdemu, kto w nie kliknął. Od 08:58 UTC repozytorium stojące za tym drugim linkiem istnieje — publiczne, z trzema commitami, zawierające kod treningowy, dwa backendy inferencyjne, pakiet ewaluacyjny z 10 751 wierszami testowymi, benchmark kalibracyjny obejmujący 96 przypadków i przewodnik reprodukcji. To jedyna rzecz, która zmieniła się w tym modelu od czasu, gdy pojawił się na Hugging Face 26 września 2026 roku o 05:36 UTC, i to wystarczy, by przenieść Intern-Decision-2B z „checkpointu z niedostępnym README” do „checkpointu, który można faktycznie przejrzeć, odtworzyć i przedyskutować”.

Same wagi pozostają niezmienione i jednoznaczne. Intern-Decision-2B to multimodalny model ustrukturyzowanego podejmowania decyzji o 2 213 241 664 parametrach, dostrojony na podstawie Qwen/Qwen3.5-2B — bazowego modelu Alibaba z 28 lutego 2026 r. — wydanego na licencji Apache-2.0, obok którego zachowano licencję upstream Qwen jako LICENSE-QWEN. To środkowy z trzech rozmiarów wypuszczonych przez InternLM w ciągu czterdziestu sekund: Intern-Decision-0.8B o 05:35:57, ten o 05:36:19 i Intern-Decision-4B o 05:36:37. Wciąż nie ma za żadnym z nich jakiegokolwiek ogłoszenia.

Średni rozmiar zasługuje na osobne omówienie, bo właśnie w nim rodzina przestaje zachowywać się przewidywalnie. Według liczb samego InternLM jest najszybszy z trzech i najgorzej skalibrowany z trzech, a oba te fakty warto zrozumieć, zanim pobierzesz cztery i pół gigabajta czegokolwiek.

Co zostało potwierdzone, a co to tylko słowa dostawcy?

Dwie kategorie i trzeba je trzymać osobno.

Potwierdzono, ponieważ jest to lista plików lub odpowiedź HTTP: liczba parametrów (2592 F32 plus 2 213 239 072 wagi BF16); mapa fragmentów (3,76 GB fragment językowy, 612,5 MB wieża wizyjna, 50,3 MB projektor, około 4,43 GB tensorów i mniej więcej 4,46 GB repozytorium); para licencji; model bazowy; architektura poniżej (Qwen3_5ForConditionalGeneration z 24 warstwami, rozmiarem ukrytym 2048, 8 głów zapytań wobec 2 głów klucz-wartość, wymiarem głowy 256, powtarzającym się wzorcem trzech warstw uwagi liniowej na jedną warstwę pełnej uwagi, jedną zachowaną warstwą przewidywania wielu tokenów i pułapem osadzania na 262 144 pozycje); istnienie repozytorium; oraz fakt, że kolekcja modeli pod huggingface.co/collections/internlm/intern-decision teraz się rozwiązuje i wyświetla wszystkie trzy checkpointy.

Zgłoszone przez dostawcę i nieodtworzone: wszystkie liczby dotyczące dokładności, wszystkie wartości opóźnień i temperatura kalibracji. Nie ma artykułu, wpisu na arXiv, posta premierowego, changelogu ani niezależnej oceny — wyszukanie ciągu „Intern-Decision” nie zwraca niczego, co dotyczyłoby tego modelu. Demo Space nadal zwraca 401, co oznacza, że nie jest publiczne, a nie że jest zepsute. Checkpoint 2B ma jedno polubienie i zero pobrań. Nikt spoza InternLM go nie uruchomił.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal, the Demo, Model Weights and GitHub links, and the card text stating the model is 'a multimodal structured decision model fine-tuned from Qwen3.5-2B' that 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by the five-step 'How inference works' list.

Kontrakt wnioskowania, w kolejności, w jakiej następuje

Plikiem, który w repozytorium dostarcza najwięcej informacji, nie jest karta. Jest nim src/inference/engine.py oraz dołączony inference.py na Hubie, ponieważ razem dokumentują kontrakt, a nie prompt.

• Dostarczasz stan — materiał podlegający ocenie — pytań, oraz opcjonalnie do ośmiu obrazów. Od jednego do szesnastu pytań, do 62 opcji każde.

• Opcje każdego pytania są mapowane na symbole składające się z jednego tokenu: A–Z, następnie a–z, następnie 0–9. Limit 62 opcji nie jest preferencją projektową, to dokładnie liczba symboli składających się z jednego tokenu, które kontrakt może zaadresować.

• Prompt systemowy, stan, schemat oraz kompletny szkielet JSON asystenta są renderowane z jednym <decision> placeholderem na pole. Szablon czatu punktu kontrolnego i pusty blok myślenia są zachowywane bez zmian.

• Wykonywany jest jeden przyczynowy przebieg w przód. Logity są odczytywane na pozycji bezpośrednio przed każdym symbolem zastępczym — nie po nim, nie na wygenerowanym tokenie.

• Softmax jest obliczany wyłącznie na dozwolonych symbolach-kandydatach tego pola, stosowana jest kalibracja checkpointu, a symbole są mapowane z powrotem na oryginalne wartości Twoich opcji.

Karta mówi bez ogródek, czym to jest: „To API wykonuje ustrukturyzowane ocenianie kandydatów. Nie wywołuje generate() ani nie próbkuje dowolnego tekstu”. Model(max_length=8192) odrzuca zbyt duże dane wejściowe, zamiast je obcinać; żądanie, które się nie mieści, kończy się głośnym błędem, zamiast po cichu tracić ostatni akapit. Lista backendów też jest uczciwa — backend="..." jest domyślnym i jedynym zaimplementowanym w repozytorium Hugging Face, co ma sens, ponieważ wydanie na GitHubie zawiera również backend XunTuner, a oba nie są numerycznie identyczne. Sam przewodnik ewaluacyjny InternLM mówi tak: „Różnice w kernelach i BF16 mogą zmieniać prawdopodobieństwa, a czasami etykiety”.

Anomalia pośrodku

Zestaw trzy checkpointy obok siebie w tabeli samego InternLM, a kształt jest na tyle dziwny, że stanowi całą historię.

• Średnia z siedmiu zestawów — Intern-Decision-0.8B 79,38, Intern-Decision-2B 84,68, Intern-Decision-4B 90,02. Uporządkowane, jak można by oczekiwać wraz ze wzrostem wag.

• Opóźnienie na jednym RTX 4090 — średnio 33,98 ms dla 0,8B, 33,28 ms dla 2B, 44,16 ms dla 4B. Środkowy rozmiar jest najszybszy z całej trójki, a przewaga jest wystarczająco mała, by na pojedynczym GPU uznać ją za szum, ale spójna w przypadku średniej, mediany (33,15 ms) i P95 (33,55 ms).

• Brier score, im niższy, tym lepiej — 0,530, 0,437, 0,347. Monotoniczny względem rozmiaru, jak zwykle bywa w przypadku właściwej reguły oceny.

Oczekiwany błąd kalibracji, im niższy, tym lepiej — 0,066 dla modelu 0.8B, 0,100 dla tego 2B, 0,065 dla 4B. Średni rozmiar jest najgorszy i jest gorszy niż model o połowę mniejszy.

Ta ostatnia linia jest tą interesującą, a dopasowane temperatury raczej ją potwierdzają, niż wyjaśniają. Każdy checkpoint ma własną temperaturę dopasowaną metodą NLL: 2,747760550703 dla modelu 0.8B, 2,100509348278 dla 2B, 1,992418 dla 4B. Wszystkie dopasowano na 1728 wyznaczonych przypadkach kalibracyjnych, z 1693 odłożonymi, minimalizując ujemny logarytm wiarygodności podczas przeszukiwania odwrotności temperatury w przedziale od 0,01 do 100, przy czym etykiety zestawu testowego celowo pozostawiono poza dopasowaniem. Temperatura modelu 2B plasuje się między temperaturami dwóch pozostałych modeli z tej samej rodziny, czego można by oczekiwać, gdyby anomalia była artefaktem dopasowania. Nie jest: dopasowana wartość jest monotoniczna względem rozmiaru, podczas gdy błąd po kalibracji nie jest. Według własnego pomiaru InternLM checkpoint o 2,2 miliarda parametrów jest najmniej wiarygodny z całej trójki, gdy mówi, jak bardzo jest pewny.

Dwa zastrzeżenia, zanim to stanie się wnioskiem. ECE z dziesięcioma przedziałami o równej szerokości i ufnością opartą na maksymalnym prawdopodobieństwie to zaszumiona statystyka w małym zestawie, którego używa ta tabela — Jevbench-Hard, 111 pozycji, więc cała kolumna ECE opiera się na około stu pytaniach i wyborze podziału na przedziały. A internlm/Intern-Decision-2B to jedyna karta z trzech, która nie zawiera dodatkowej sekcji kalibracji, którą ma karta 4B, więc dokumentacji jest tu mniej, a nie więcej. Wartość 0,100 należy odczytywać jako powód, by dopasować własną temperaturę, a nie jako werdykt dotyczący wag.

A rendered comparison card titled 'Three checkpoints, forty seconds' listing the Intern-Decision 0.8B, 2B and 4B columns against seven rows: upload timestamps 05:35:57 / 05:36:19 / 05:36:37 UTC; parameters 852,985,920 / 2,213,241,664 / 4,539,265,536; seven-suite average 79.38 / 84.68 / 90.02; Brier 0.530 / 0.437 / 0.347; ECE 0.066 / 0.100 / 0.065; fitted temperature 2.747761 / 2.100509 / 1.992418; and RTX 4090 mean latency 33.98 ms / 33.28 ms / 44.16 ms, with a footer noting every figure is vendor-reported and unreproduced.

Co repozytorium dodaje, a czego wciąż nie ujawnia

Wydanie na GitHubie jest pełniejsze niż karta modelu, która sama w sobie jest pouczająca — laboratorium, które zamierzało stworzyć artefakt publikacyjny, zwykle nie dostarcza deterministycznego generatora kalibracji i pakietu ewaluacyjnego weryfikującego hashe wraz z launcherem treningowym.

Co jest teraz publiczne: kod treningowy i cel zamaskowanego następnego tokenu (symbole odpowiedzi będące wartościami referencyjnymi pojawiają się wyłącznie w etykietach, nigdy na wejściu; odpowiedź każdego pola jest przewidywana przez logit bezpośrednio przed jego znacznikiem, a wszystkie pola współdzielą jeden przebieg w przód); siedem zestawów testów dokładności z hashami weryfikowanymi przez SHA-256 i liczbami wierszy; kod oceniania; skrypty dopasowywania temperatury i odtwarzania, przy czym twierdzi się, że odtwarzanie zmienia zero decyzji; benchmark kalibracji rozkładu obejmujący 96 przypadków wraz z generatorem i skryptem oceniającym offline; oraz demonstrację przeglądarkową serwowaną na loopbacku z POST /v1/decisions (z aliasem /v1/jev).

Co jest wyraźnie wykluczone, według słów samego repozytorium: „Dane treningowe, prywatne rekordy kalibracyjne/walidacyjne, obrazy, potoki przygotowania danych i wagi modelu nie są uwzględnione”. Repozytorium w ogóle nie zawiera pliku licencji, więc warunki kodu nie są podane, mimo że wagi są objęte licencją Apache-2.0. A skład podziału kalibracyjnego — które 1728 przypadków, skąd — pozostaje nieujawniony; to jedyne pominięcie, które ogranicza zakres, w jakim można zweryfikować liczby ECE.

Rozmiary, które faktycznie kierujemy, oraz ten, którego nie kierujemy.

Intern-Decision-2B nie znajduje się na OrcaRouter. Nasza strona modelu dla niego zwraca 404, nie ma nigdzie hostowanego punktu końcowego dla niego, który moglibyśmy znaleźć, a nic tutaj nie powinno być odczytywane jako deklaracja dostępności. Jedynym sposobem, aby wywołać go dzisiaj, jest pobranie checkpointu i uruchomienie inference.py obok wag.

To ma znaczenie dla decyzji, której tak naprawdę dotyczy ten artykuł, ponieważ scorer, którego nikt nie serwuje, to scorer, który musisz obsługiwać. Jeśli decyzja w zamkniętym zbiorze, którą próbujesz podjąć, ma kształt zbliżony do tego, co robi ta rodzina — stan, typowane pytania, skalibrowane prawdopodobieństwa — hostowanym porównaniem jest Jev 1.13 firmy TypeSafe, który jest modelem, względem którego InternLM celowo przeprowadzał testy porównawcze i który jest dostępny w OrcaRouter za 0,042 USD za milion tokenów wejściowych, z kontekstem 65K i P50 czasu do pierwszego tokenu na poziomie 178 ms.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing the TypeSafe breadcrumb, the model name Jev 1.13, text input, and the description that Jev is a structured decision and evaluation model taking a state and named questions (noul / choice / score) and returning a structured answer for each, served non-streaming via POST /v1/systemone with up to about 64K input tokens.

Uruchamianie lokalnie checkpointu o 2,2 miliarda parametrów i wywoływanie hostowanego klasyfikatora to nie ten sam zakup, ale to ten sam problem, a dostępność obu na jednym kluczu z ceną katalogową dostawcy przekazywaną przy 0% marży jest powodem, by pozostawić porównanie otwarte, zamiast stawiać architekturę na jednym z nich.

Co zmieniłoby ten obraz

Trzy rzeczy, po kolei.

Ktoś spoza InternLM musi odtworzyć średnią 84,68 i ECE na poziomie 0,100, a repozytorium jest teraz tym, co to umożliwia — i to jest tu właściwa wiadomość. Egzamin jest publiczny i weryfikowany hashem; brakuje tylko arkusza odpowiedzi, a arkusz odpowiedzi to checkpoint, który każdy może teraz pobrać.

Dostawca musi powiedzieć, do czego to służy. Model z działającym stosem treningowym, opublikowanym pakietem ewaluacyjnym, ale bez ogłoszenia, bez licencji na kod i bez hostowanego endpointu jawi się jako wydanie badawcze, co do którego nie podjęto jeszcze decyzji o przekształceniu w produkt. Wagi na licencji Apache-2.0 przemawiają za jednym; brak licencji na kod i Space z błędem 401 — za drugim.

A środkowy rozmiar potrzebuje powodu, by istnieć. Jeśli przewaga 2B w szybkości nad 0.8B jest realna, ale marginalna, a jego kalibracja jest najsłabsza z całej trójki w każdym pomiarze opublikowanym przez InternLM, to uczciwa rekomendacja dla większości czytelników brzmi: zapłacić 2,6 razy więcej miejsca na dysku za 4B albo zaakceptować słabszą dokładność mniejszego modelu. Argument za 2B jest taki, że akurat jest najszybszym z szybkich — a to argument wątlejszy, niż sugeruje marketingowe ujęcie tej rodziny.