
Intern-Decision-0.8B pojawił się bez zapowiedzi: co InternLM po cichu umieścił na Hugging Face
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 592 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 187 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Link do GitHub na karcie modelu zwraca 404. Demo Space zwraca 401. Nie ma żadnej kolekcji, wpisu na blogu, raportu technicznego ani wyniku wyszukiwania nigdzie dla ciągu „Intern-Decision”, który nie byłby ogłoszeniem o stażu — a jednak Intern-Decision-0.8B znajduje się teraz na Hugging Face jako kompletny, możliwy do pobrania checkpoint na licencji Apache-2.0, dostrojony z Qwen3.5-0.8B, wgrany nad ranem 26 września 2026 r. wraz z dwoma większymi modelami z tej samej rodziny, które pojawiły się w ciągu tych samych trzech minut: Intern-Decision-2B i Intern-Decision-4B. InternLM już wcześniej wypuszczał modele w ten sposób i dlatego wszystko poniżej zostało zebrane z samego repozytorium, a nie z wpisu o premierze. To rozróżnienie ma tutaj większe znaczenie niż zwykle: repozytorium mówi, co istnieje, a tylko dostawca może powiedzieć, do czego to służy.
To, co repozytorium rzeczywiście mówi w szczegółach, jest na tyle nietypowe, że warto to przeczytać. To nie są modele czatowe ani małe modele językowe w zwykłym sensie. Intern-Decision-0.8B przyjmuje fragment stanu, schemat nazwanych pytań, które piszesz z góry, oraz opcjonalnie do ośmiu obrazów, i zwraca rozkład odpowiedzi dla każdego pytania w jednym przebiegu w przód. Nigdy nie wywołuje generate(). Nigdy nie próbkuje. Nie ma tekstu wyjściowego do parsowania, nie ma JSON-a do naprawienia, nie ma pętli ponawiania wokół nawiasu klamrowego, który nigdy się nie zamknął. Ta wąskość to cała architektura i plasuje ten model w tej samej niewielkiej kategorii co Jev 1.13 od TypeSafe i Laya od Convai — kategorii, względem której InternLM najwyraźniej celowo przeprowadzał testy porównawcze, ponieważ Jevbench to własny benchmark TypeSafe i stanowi pierwszą kolumnę tabeli.
Oto, co da się poznać z checkpointu, co jest jedynie twierdzone przez checkpoint, a czego nikt spoza InternLM nie może obecnie w ogóle powiedzieć.
Co tak naprawdę znajduje się w repozytorium
Karta jest krótka i szczerze mówi o pochodzeniu. Intern-Decision-0.8B opisano jako „multimodalny ustrukturyzowany model decyzyjny dostrojony z Qwen3.5-0.8B” — bazowy model Qwen wydany 28 lutego 2026 r. — a repozytorium zawiera drugi plik licencji, LICENSE-QWEN, obok warunków Apache-2.0, co jest tym, co powinien robić model pochodny, i samo w sobie stanowi drobny sygnał uczciwości. Indeks Hugging Face podaje 852 985 920 parametrów w trzech shardach: shard językowy o rozmiarze 1,50 GB, shard wizyjny 176 MB i projektor 25 MB. Całkowity rozmiar repozytorium to około 1,73 GB wraz z plikami tokenizera, co sprawia, że całość bez problemu zmieści się na pojedynczym konsumenckim GPU albo dobrze wyposażonym laptopie.
Konfiguracja ujawnia architekturę, którą Qwen wdraża w całej generacji 3.5, a nie specjalnie zaprojektowaną sieć decyzyjną. Jest to Qwen3_5ForConditionalGeneration z 24 warstwami ułożonymi w powtarzający się wzorzec trzech warstw uwagi liniowej na jedną warstwę pełnej uwagi, rozmiarem ukrytym 1 024, 8 głowicami uwagi w stosunku do 2 głowic klucz-wartość, wymiarem głowicy 256 i maksymalnym osadzeniem pozycji wynoszącym 262 144 tokeny. Zachowano pojedynczą warstwę wielotokenowej predykcji. Ścieżka wizyjna jest prawdziwa: tekst karty opisuje obsługę obrazów, procesor przyjmuje obrazy, a checkpoint zawiera wieżę wizyjną i projektor, aby ją obsługiwać — więc multimodalny tag w repozytorium jest poparty wagami, a nie tylko tagami.
Obraz całej rodziny jest wart odnotowania, ponieważ kształtuje sposób odczytywania wszystkiego innego. InternLM wgrał trzy rozmiary w ciągu 40 sekund: 0.8B, potem 2B, a następnie 4B. Liczby parametrów to 852 985 920, 2 213 241 664 i 4 539 265 536. Karta modelu 4B zawiera dodatkową sekcję — pilotaż kalibracyjny na 96 przypadkach znanego rozkładu z wynikami przed i po — której nie ma karta 0.8B. Ta asymetria nie jest dowodem na wadę małego modelu; jest dowodem na to, że dokumentacja małego modelu została napisana z myślą o krótszym budżecie, co jest dokładnie tym, jak wygląda cicha premiera.
Jak faktycznie działa ścieżka wnioskowania
Dołączony plik inference.py jest najbardziej informatywnym plikiem w repozytorium, ponieważ dokumentuje kontrakt, a nie prompt. Sekwencja przebiega tak:
• Podajesz żądanie ze stanem (obiektem oceny), pytaniami (schematem) i opcjonalnie obrazami.
• Opcje każdego pytania są mapowane na symbole jednego tokenu — od A do Z, następnie małe litery, potem cyfry, maksymalnie 62 opcje na pytanie.
• Prompt systemowy, stan, schemat i kompletny szkielet JSON asystenta są renderowane z jednym znacznikiem zastępczym <decision> na pole.
• Wykonywany jest jeden przyczynowy przebieg w przód. Logity są odczytywane na pozycji bezpośrednio przed każdym symbolem zastępczym.
• Operację softmax wykonuje się wyłącznie na dozwolonych symbolach kandydujących tego pola, stosowana jest kalibracja punktu kontrolnego, a symbole są mapowane z powrotem na oryginalne wartości Twoich opcji.
Silnik udostępnia trzy typy pytań. choice przyjmuje uporządkowany obiekt mapujący wartości opcji na opisy. score przyjmuje listę — która staje się wartościami tekstowymi „0”, „1”, „2” i tak dalej — albo uporządkowany obiekt ze skończonymi liczbowymi kluczami tekstowymi, co pozwala modelowi zwrócić oczekiwaną wartość ważoną prawdopodobieństwem, a nie tylko kategorię. noul to decyzja binarna, w której „nie” występuje przed „tak”. Odpowiedź zwraca, dla każdego pola, skalibrowany rozkład prawdopodobieństwa, pewność równą maksymalnemu prawdopodobieństwu kandydata, decyzję argmax z leksykalnym rozstrzyganiem remisów, a w przypadku pytań typu score — oczekiwaną wartość liczbową i legendę. Limity są jawne: od jednego do szesnastu pytań na żądanie, do 62 opcji w każdym, domyślny limit danych wejściowych wynoszący 8,192 tokeny, który powoduje odrzucenie, a nie obcięcie, oraz maksymalnie osiem obrazów, których tokeny wliczają się do tego limitu.
Dwa szczegóły na tej liście zasługują na uwagę, ponieważ decydują o tym, czy można zaufać wynikowi. Pierwszy to fakt, że do promptu nie wstawia się żadnych odpowiedzi wzorcowych — model ocenia kandydatów, którym nie pokazano odpowiedzi. Drugi to fakt, że usage.output_tokens nie jest liczbą tokenów tekstowych; zlicza oceniane pola. Każdy, kto wepnie to do istniejącego obliczania budżetu tokenów, będzie tym zaskoczony, a karta mówi o tym wprost, zamiast pozostawiać to do odkrycia.

Tabela benchmarków — i na ile jej wierzyć
Uwaga dla czytelnika w tej sekcji: każda liczba poniżej pochodzi od dostawcy i nie została odtworzona. InternLM wybrał benchmarki, wybrał modele porównawcze, przeprowadził ewaluacje i opublikował tabelę. Nie istnieje żadne niezależne uruchomienie Intern-Decision-0.8B na żadnej publicznej liście rankingowej, a wyszukanie w Artificial Analysis nie zwraca w ogóle niczego dla tego modelu. To nie znaczy, że tabela jest fałszywa. To znaczy, że nie poddano jej audytowi, i oznacza, że kolumny są najbardziej przydatne do odczytania kształtu wyniku, a nie jego poziomu.

• Jevbench, trzy podziały — Intern-Decision-0.8B osiąga 97,92 w Easy, 80,56 w Original i 52,25 w Hard. Jev firmy TypeSafe ma 100,00, 98,61 i 72,07 w tych samych podziałach.
• Decyzja typowana — model 0.8B uzyskuje wynik 77,35 w porównaniu z 73,35 modelu Jev. To jedyna kolumna, w której najmniejszy model w zestawieniu pokonuje model, od którego pochodzi nazwa benchmarku.
• ToolACE — 94,52 dla modelu 0.8B wobec 91,29 dla Jev. ToolACE to benchmark wywoływania funkcji, a head decyzyjny, który przewyższa Jev w wyborze narzędzi, to najbardziej znaczące twierdzenie w tabeli.
• AG News — 88,61 wobec 89,57 Jev'a. W praktyce na równi z czołówką tej kategorii w czteroklasowej klasyfikacji tematycznej.
• WildJailBreak — 64,48 wobec 96,29 u Jeva. To jest załamanie. Prawdopodobnie kolumna, która ma największe znaczenie w przypadku modelu, jaki wystawiłbyś na niezaufane dane wejściowe, i ta, w której 0,8B najbardziej odbiega od wzorca.
• Średnia — 79,38 dla 0.8B, 84,68 dla jego własnego bliźniaka 2B, 90,02 dla 4B. Rodzina wspina się stromo, co jest dokładnie tym, czego można by oczekiwać, i samo w sobie stanowi łagodny argument, że tabeli nie spreparowano metodą inżynierii odwrotnej, by schlebić flagowcowi.
• Kalibracja — Brier 0,530 i oczekiwany błąd kalibracji 0,066 dla modelu 0.8B. Jev podaje 0,358 i 0,095. Zestaw te dwie liczby razem, a wyłoni się wyraźniejszy obraz niż ten, który daje każda z nich osobno: model 0.8B jest lepiej skalibrowany niż Jev w sensie ECE — jego deklarowane poziomy pewności ściślej odpowiadają jego dokładności — a jednocześnie jest istotnie mniej dokładny ogólnie. To wiarygodny profil małego modelu z celowo dopasowaną temperaturą i nie jest to pochlebna kombinacja, którą publikuje się przez przypadek.
Zestaw porównawczy ma jedną rzucającą się w oczy cechę: dominują w nim modele decyzyjne. Występują Jev, Laya, SemIf, Kev i JevK5; własny benchmark tabeli pochodzi od TypeSafe. InternLM zdecydował się być mierzony na terenie konkurenta, przy użyciu narzędzi testowych konkurenta, a następnie opublikował kolumny, w których jego najmniejszy model przegrywa. To rodzaj decyzji, jaką podejmuje zespół, gdy nie planuje kampanii marketingowej wokół wydania — co jest spójne ze wszystkim innym w tym, jak to zostało wypuszczone.
Temperatura kalibracji jest najbardziej interesującą liczbą
Intern-Decision-0.8B dopasowuje domyślną temperaturę 2.747760550703, poprzez minimalizację NLL na 1 728 wyznaczonych przypadkach kalibracyjnych z 1 693 oddzielnymi przypadkami walidacyjnymi. Karta wyraźnie stwierdza, że etykiety zestawu testowego nie zostały użyte do jej wyboru. Stosowana transformacja to p = softmax(candidate_logits.float()), a następnie calibrated_p = softmax(log(p) / T).
To jest kalibracja prawdopodobieństw kandydatów, a nie temperatura próbkowania, i ta różnica nie jest pedanterią. Ponieważ przekształcenie jest stosowane po softmaxie i zachowuje uporządkowanie, nie może w ogóle zmienić decyzji argmax. Przesuwa pewność, noul prawdopodobieństwo „tak” oraz oczekiwaną wartość pytania punktowanego — a decyzja główna pozostaje identyczna. Jeśli Twój przepływ pracy odczytuje etykietę, temperatura jest operacją pustą. Jeśli Twój przepływ pracy odczytuje prawdopodobieństwo — ustawia na nim progi, szereguje według niego lub podaje je do dalszego obliczenia oczekiwanej wartości — temperatura jest różnicą między liczbą, która coś znaczy, a liczbą, która nie znaczy nic. Przekazanie temperature=1 zwraca nieskalibrowany rozkład, co jest użyteczną furtką dla każdego, kto chce nałożyć własną kalibrację.
Temperatura jest dopasowywana osobno dla każdego checkpointu, a nie współdzielona. Model 4B używa innej wartości, 1.99241824, a karta instruuje, aby użyć modułu wnioskowania dołączonego do pobranego rozmiaru, tak aby jego domyślna kalibracja się zgadzała. Każdy, kto skopiuje otoczkę wnioskowania z jednego modelu bliźniaczego do drugiego, po cichu zastosuje niewłaściwą temperaturę.
Trzydzieści cztery milisekundy i wynik, który nie powinien być możliwy
InternLM zmierzył opóźnienie end-to-end na zapytanie na pojedynczym RTX 4090, korzystając z lokalnej ścieżki Hugging Face — to rzeczywisty pomiar, ale także najwolniejsza możliwa konfiguracja serwowania, ponieważ wdrożenie produkcyjne używałoby skompilowanego środowiska uruchomieniowego lub środowiska z przetwarzaniem wsadowym. Jev jest podany na poziomie 109,70 ms średniej i 106,30 ms mediany, przy p95 wynoszącym 146,70 ms. Intern-Decision-0.8B osiąga 33,98 / 33,44 / 37,50 ms.
Liczba, na której warto się zatrzymać, to wariant 2B: średnia 33,28 ms, mediana 33,15 ms. Model 2B jest szybszy niż 0.8B, o marginesie tak małym, że można go uznać za szum, ale nie w kierunku, który przewidują liczby parametrów. To nie jest błąd w tabeli i tak naprawdę nie chodzi tu o modele. Model decyzyjny wykonuje dokładnie jeden przebieg w przód przez prompt, którego długość jest ustalana przez stan, schemat i opisy opcji — nie przez cokolwiek, co model pisze, ponieważ nie pisze nic. Dla promptów w tym reżimie dominuje przetwarzanie promptu, a liczba parametrów jest kosztem drugorzędnym. Praktyczna konsekwencja jest taka, że typowy powód, by sięgać po najmniejszy checkpoint — płacisz za token — tutaj nie ma zastosowania. Prawdziwym powodem, by wybrać 0.8B zamiast 2B, jest zajętość pamięci i fakt, że całe jego repozytorium mieści się w 1,73 GB, a nie przepustowość.
Co nie może być jeszcze ustalone
To jest ta część, na którą odpowiedziałby wpis o premierze, a repozytorium nie może.
Nie podano daty wydania, nie ma ogłoszenia ani niczego na publicznych kanałach InternLM, co opisywałoby tę rodzinę. Adres URL GitHub wydrukowany na karcie modelu nie prowadzi do działającej strony. Demo Space, do którego odwołuje się karta, nie jest publicznie dostępne. Nie ma kolekcji gromadzącej trzy checkpointy, co oznacza, że jedynym sposobem na znalezienie 2B lub 4B jest zajrzenie do listy modeli organizacji. Nie ma publikacji, więc dane treningowe, przepis dostrajania, liczba kroków treningowych oraz to, co „decision tuning” zmodyfikowało w wagach, pozostają niepodane. Nie ma niezależnej ewaluacji, nie ma replikacji opóźnień przez podmioty trzecie ani dowodów, że ktokolwiek spoza InternLM uruchomił ten checkpoint.
Karta modelu rodzi także dwa pytania, na które nie odpowiada. Pierwsze dotyczy tego, co luka WildJailBreak oznacza w praktyce: deficyt odporności mechanizmu odmów tej wielkości jest właściwością dostrojenia, a to, czy odzwierciedla on model bazowy, cel dostrajania decyzyjnego czy małą liczbę parametrów, nie jest czymś, co ujawnia repozytorium. Drugie dotyczy tego, co dzieje się na limicie wejściowym. Żądania przekraczające 8 192 tokeny są odrzucane, a nie obcinane, co jest właściwym zachowaniem w przypadku modelu oceniającego, ale oznacza to, że praktyczne okno kontekstowe to nie 262 144, które reklamuje konfiguracja — to wszystko, co mieści się w 8 192 tokenach stanu, schematu, opcji i wycinków obrazu. W przypadku długich dokumentów z rozbudowanymi schematami ten limit pojawia się szybciej, niż sugeruje diagram architektury.
Gdzie to się plasuje i jak tego spróbować, nie stawiając na to
Uczciwie rzecz ujmując, Intern-Decision-0.8B to wydany checkpoint z niezweryfikowanymi twierdzeniami i bez dokumentacji potwierdzającej. Ta kombinacja nie jest powodem, by go ignorować — wydanie wag na licencji Apache-2.0, które można pobrać i zmierzyć w jedno popołudnie, to lepsza sytuacja niż API z listą oczekujących — ale oznacza, że ciężar walidacji spoczywa na Tobie. Silnik ładuje się z lokalnego katalogu, działa na GPU klasy 4090 lub słabszym, a karta zawiera gotowe zapytanie, które można wkleić. Dzień oceny na własnych oznaczonych przypadkach powie Ci więcej o kolumnie WildJailBreak niż tabela dostawcy.
Jeśli warstwa decyzyjna jest częścią, którą oceniasz, użytecznym celem porównania jest hostowany. Jev 1.13 firmy TypeSafe to model, względem którego benchmarkowano InternLM, a można go wywołać już dziś przez pojedynczy endpoint kompatybilny z OpenAI w cenie 0,042 USD za milion tokenów wejściowych, przy czym wyjście jest rozliczane jako zero — to ta sama cena, którą publikuje dostawca, ponieważ OrcaRouter przekazuje cenę katalogową dostawcy bez narzutu zamiast doliczać marżę. Umieszczenie samodzielnie hostowanej głowy decyzyjnej 0.8B i hostowanego API decyzyjnego na tym samym kluczu, tego samego popołudnia, jest znacznie tańszym eksperymentem niż podłączanie dwóch oddzielnych umów, aby odpowiedzieć na to samo pytanie.

Tym, co zmieniłoby ten obraz, nie jest benchmark. Jest nim pojawienie się repozytorium GitHub, opublikowanie przez InternLM przepisu na dostrajanie albo pierwsze niezależne uruchomienie checkpointu, które trafi na ranking. Dopóki jedno z nich nie nastąpi, dokładny opis Intern-Decision-0.8B jest wąski i niepochlebny, a przy tym całkowicie na jego korzyść: wagi są prawdziwe, kontrakt wnioskowania jest udokumentowany lepiej, niż udaje się to większości wypuszczonych modeli, a marketing jeszcze się nie zaczął.
