
Intern-Decision-4B vs Qwen 3.8: 44-milisekundowy przebieg w przód w starciu z 2,4 biliona parametrów
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 592 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 187 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
InternLM opublikował Intern-Decision-4B na Hugging Face rankiem 26 września 2026 r. — żadnego posta o premierze, żadnego wpisu na blogu, link do GitHuba na własnej karcie modelu, zwracający 404, i demo Space, które zwraca 401. Wagi są prawdziwe i można je pobrać; ogłoszenia tam nie ma. A model, który się pod nimi kryje, to dostrojona wersja Qwen3.5-4B, i to właśnie sprawia, że porównanie z hostowanym flagowcem jest warte więcej niż karta specyfikacji. Te dwa modele nie są rywalami. To dwa końce jednego potoku, a cała kwestia sprowadza się do tego, gdzie przebiega między nimi granica. Leżący u podstaw rdzeń to model o 2,4 biliona parametrów, który dostawca opublikował w sierpniu, a obecnie udostępnia jako Qwen3.8-Max, rozliczany po 2,00 i 6,00 USD za milion tokenów; Intern-Decision-4B to przebudowa tego siedmiomiesięcznego modelu bazowego o 4,54 miliarda parametrów — ten model w ogóle nie emituje tokenów, odpowiada na maksymalnie szesnaście pytań z określonym typem w jednym przebiegu w przód i nic nie kosztuje za wywołanie, ponieważ nie ma danych wyjściowych, za które trzeba by rozliczać.
Odpowiedź w jednym zdaniu: jeśli twoim zadaniem jest decyzja z zamkniętym zbiorem odpowiedzi, Intern-Decision-4B jest około pięćdziesiąt razy szybszy na decyzję i strukturalnie tańszy, a żaden model czołowy nie pokona go na tej wąskiej płaszczyźnie. Jeśli twoim zadaniem jest cokolwiek innego — rozumowanie, długi kontekst, korzystanie z narzędzi, cokolwiek, gdzie odpowiedź nie jest już wyliczona w twoim prompcie — Qwen 3.8 jest nie tylko lepszy — jest jedynym z tych dwóch, który w ogóle może wykonać to zadanie. Wszystko poniżej dotyczy precyzyjnego znalezienia tej granicy.
Co jest faktycznie potwierdzone, a co nie
Zacznijmy od dowodów, bo sposób ujęcia ma znaczenie. Nie ma żadnego ogłoszenia producenta o Intern-Decision-4B. Żadnego komunikatu prasowego, żadnej publikacji, żadnego opisu repozytorium do przeczytania. To, co istnieje dziś, to opublikowane dziś rano repozytorium Hugging Face w ramach organizacji internlm — Intern Large Models, grupy z Shanghai AI Laboratory — z licencją Apache 2.0, obok której zachowano licencję upstream Qwen jako LICENSE-QWEN. Dwa siostrzane checkpointy pojawiły się w odstępie czterdziestu sekund od siebie: Intern-Decision-0.8B z 853 milionami parametrów i Intern-Decision-2B z 2,21 miliarda. Wszystkie trzy mają te same tagi — decision-making, multimodal, structured-prediction — a wszystkie trzy należą do jednej kolekcji modeli, która nie jest jeszcze publicznie dostępna.
Czego nie potwierdzono: czy to jest ukończone wydanie, czy wczesny push. Repozytorium utworzono o 05:36 UTC i zmodyfikowano ponownie przed 08:00 UTC tego samego dnia, a dalsza publiczna aktywność wokół pokrewnych checkpointów trwała po 09:00. InternLM nie powiedział, jaki jest zamierzony scenariusz wdrożenia, nie opublikował repozytorium, do którego linkuje, i nie powiedział, czy pojawi się hostowany endpoint. Wszystkie wyniki benchmarków w tym artykule traktuj jako raportowane przez dostawcę i nieodtworzone — ponieważ w chwili pisania tego tekstu dosłownie nigdzie nie napisano nic więcej o tym modelu. Trzy oddzielne ścieżki wyszukiwania nie zwracają żadnych wyników dla tej nazwy.

Zakład architektoniczny: scorer, a nie generator
Najważniejsze zdanie w dokumentacji samego Intern-Decision-4B jest przeczące: ścieżka wnioskowania „nie wywołuje generate() ani nie próbkuje swobodnego tekstu”. To nie jest szczegół implementacyjny, to cała konstrukcja, i to właśnie odróżnia to od wywoływania Qwen3.8-Max ze schematem JSON i liczenia na to, że nawias się zamknie.
Oto mechanizm, tak jak opisuje go karta. Przekazujesz modelowi wspólny stan, schemat nazwanych pytań i opcjonalnie do ośmiu obrazów. Każde pytanie jest jednego z trzech typów: choice (wybierz jedną z uporządkowanego zestawu opcji), score (oceń w skali porządkowej, zwracany jako wartość oczekiwana ważona prawdopodobieństwem) lub noul (binarne nie/tak). Prompt systemowy, stan, schemat oraz kompletny szkielet JSON odpowiedzi asystenta są renderowane z jednym placeholderem na pole. Następnie — i na tym polega trik — model wykonuje jeden przyczynowy przebieg w przód, a logity są odczytywane na pozycji bezpośrednio przed każdym placeholderem. Softmax jest liczony wyłącznie po dozwolonych symbolach-kandydatach danego pola, stosowana jest kalibracja checkpointu, a symbole są mapowane z powrotem na Twoje pierwotne wartości opcji.
Konsekwencje są konkretne. Ponieważ przestrzeń odpowiedzi każdego pola jest składana na żądanie, a nie na stałe wpisana w głowicę słownikową, schemat wymyślony dziś po południu nie wymaga ponownego trenowania — dodaj pytanie, a opcje stają się kandydatami na symbole dla tego pola. Ponieważ nie ma pętli dekodowania, nie ma tokenu wyjściowego, nie ma nawiasu klamrowego do zapomnienia ani logiki ponawiania wokół błędnie sformowanego JSON. A ponieważ wszystkie pytania są oceniane na podstawie tego samego odczytu stanu, szesnaście pytań kosztuje jedno przejście w przód, a nie szesnaście.
Limity są równie konkretne, a karta podaje je bez ogródek. Od jednego do szesnastu pytań, do 62 opcji na pytanie, do ośmiu obrazów. Domyślny limit maksymalny wynosi 8 192 tokenów — a dane wejściowe, które go przekraczają, są odrzucane bez obcinania. Ta ostatnia klauzula to decyzja projektowa, nad którą warto się zatrzymać: ciche obcinanie to sposób, w jaki klasyfikator po cichu zaczyna odpowiadać na inne pytanie niż to, które zadałeś, a InternLM zdecydował się zamiast tego głośno zgłaszać błąd. To słuszna decyzja, ale też pułapka operacyjna, bo długi wątek zgłoszenia plus schemat plus obrazy przekroczą 8 192 znacznie szybciej, niż się spodziewasz, i nie ma łagodnej ścieżki — dostajesz błąd.
Gdzie Intern-Decision-4B wygrywa, i to z dużą przewagą
Dwie osie, i obie są strukturalne, a nie inkrementalne.
• Opóźnienie na decyzję — średnia 44,16 ms, mediana 44,03 ms, 44,60 ms przy p95, mierzone na pojedynczym RTX 4090 przez lokalną ścieżkę Hugging Face. W porównaniu z Qwen3.8-Max, którego bieżące siedmiodniowe okno w naszym własnym playgroundzie pokazuje p50 na poziomie 2 474 ms i p95 na poziomie 9 789 ms przy 55,4 tokena wyjściowego na sekundę. To około 56× w przypadku mediany, a porównanie nie tyle jest nieuczciwe, ile dotyczy dwóch różnych operacji: jeden model klasyfikuje, drugi rozumuje, a następnie pisze. Ta różnica jest realna — podobnie jak powód, dla którego istnieje.
• Koszt na decyzję — a to jest arytmetyka, nie opinia. Weźmy realistyczne wywołanie triażu wsparcia: 800 tokenów wejściowych stanu i schematu oraz 150 tokenów wyjściowych strukturalnego JSON. W Qwen3.8-Max to 800 × 2,00 USD/M plus 150 × 6,00 USD/M, czyli około 0,0025 USD na decyzję, jeszcze przed pojedynczym tokenem rozumowania — a Qwen3.8-Max to model rozumujący, więc strona wyjściowa jest optymistycznie mała. Milion decyzji kosztuje około 2 500 USD. Ten sam milion decyzji na Intern-Decision-4B kosztuje zero w tokenach i około 12,3 godziny czasu RTX 4090. Intern-Decision-4B nie ma ceny za wyjście, ponieważ nie ma wyjścia.
Transakcja jest uczciwa i oczywista: model 4B potrzebuje GPU, które posiadasz lub wynajmujesz, zajmuje to GPU i zawsze potrafi robić tylko jedną rzecz. Ale jeśli ta jedna rzecz to coś, co twój produkt robi miliony razy dziennie, powyższa arytmetyka jest całym uzasadnieniem biznesowym i nie zmieni tego żadna ilość możliwości modeli frontier.
Liczba, której Qwen 3.8 nie publikuje: kalibracja
To cichy wyróżnik i właśnie ten, który umknie większości porównań, ponieważ nie wygląda jak benchmark.
Intern-Decision-4B zwraca rozkład na wartościach twoich opcji, a nie tylko etykietę — plus pewność, a dla nowych pytań skalibrowane prawdopodobieństwo odpowiedzi „tak”. InternLM podaje wynik Brier 0,347 i oczekiwany błąd kalibracji 0,065 w swoim zestawie oraz udostępnia dopasowaną temperaturę w punkcie kontrolnym: 1,99241824, dopasowana osobno dla tego rozmiaru przez minimalizację ujemnego logarytmu wiarygodności na 1 728 wyznaczonych przypadkach kalibracyjnych z 1 693 odłożonymi przypadkami walidacyjnymi. Etykiety zestawu testowego nie zostały użyte do jej wyboru. W karcie znajduje się drugi, niezależny test diagnostyczny na 96 przypadkach wykorzystujący dokładne rozkłady referencyjne, a nie próbkowane etykiety, i pokazuje, że ogólny Brier/ECE zmienia się z 0,628 / 0,213 przed kalibracją na 0,550 / 0,089 po niej — krok kalibracji zmniejsza oczekiwany błąd o znacznie więcej niż połowę.
Teraz poszukaj tego samego wskaźnika po stronie Qwen 3.8. Nie ma go tam. Alibaba publikuje wyniki Artificial Analysis Index, GPQA Diamond, terminal-bench, SciCode, tau-banking oraz long-context recall — wszystko to miary możliwości. Nie publikuje żadnej metryki kalibracji dla żadnego członka rodziny Qwen 3.8, ponieważ pewność modelu generatywnego nie jest wielkością, którą dostawca udostępnia. Jeśli twój system potrzebuje prawdopodobieństwa, na którym może ustawić próg lub na którego podstawie może kierować zapytania, a nie odpowiedzi, której musi zaufać, ta różnica nie jest kwestią stopnia. Jeden model daje ci liczbę z udokumentowanym współczynnikiem błędów; drugi daje ci tekst, a ty budujesz wokół niego własne oszacowanie pewności.
W czym Qwen 3.8 wygrywa, i to wcale nie jest blisko
Zestaw oba obok siebie pod względem tego, co można im zlecić, a granice przestają być subtelne.
• Kontekst — Qwen3.8-Max ma okno o rozmiarze 1 000 000 tokenów. Intern-Decision-4B odrzuca wszystko powyżej 8 192. To współczynnik 122 i nie ma na to obejścia, ponieważ limit danych wejściowych jest wymuszany, a nie obcinany.
• Modalność wejściowa — Qwen3.8-Max przyjmuje tekst, obraz i wideo. Intern-Decision-4B przyjmuje tekst i obrazy, maksymalnie osiem, a tokeny obrazów wliczają się do tego samego budżetu 8 192.
• Rozumowanie i narzędzia — Qwen3.8-Max ma wśród swoich deklarowanych możliwości korzystanie z narzędzi, tryb JSON i rozumowanie, a osiąga wskaźnik Artificial Analysis Intelligence Index wynoszący 45,4, co daje mu piętnaste miejsce wśród 145 indeksowanych modeli, oraz wynik AA Coding 76,2 i dziewiąte miejsce spośród 138. Są to niezależne dane opublikowane przez Artificial Analysis, a nie twierdzenia dostawcy. Intern-Decision-4B nie ma wpisu w Artificial Analysis, żadnego niezależnego wyniku jakiegokolwiek rodzaju ani możliwości rozumowania, planowania czy wywoływania czegokolwiek.
• Otwarte generowanie — Qwen3.8-Max pisze. Intern-Decision-4B nie potrafi wygenerować akapitu, uzasadnienia ani planu. Potrafi jedynie ocenić opcje, które już uznałeś za warte wymienienia.
Warto też zauważyć po stronie otwartych wag: jeśli chcesz sam rdzeń Qwen 3.8, a nie hostowaną ścieżkę, Qwen3.8-27B jest gęstym odpowiednikiem — 27,8 miliarda parametrów, Apache 2.0, kontekst 262 144 tokenów i około 0,33 / 2,40 USD za milion tokenów tam, gdzie jest udostępniany. Uzyskuje 33,7 w AA Intelligence Index. Nadal jest o rząd wielkości większy niż Intern-Decision-4B, nadal generatywny i nadal jest złym narzędziem do decyzji o zamkniętym zbiorze na dużą skalę — ale jest uczciwą opcją pośrednią i jedynym z trzech, który jest jednocześnie naprawdę tani i naprawdę zdolny.

Uczciwe czytanie własnej tabeli benchmarków InternLM
Karta modelu Intern-Decision-4B zawiera tabelę porównawczą, a to, co jest nieobecne w niej, mówi więcej niż to, co się w niej znajduje. Wiersze to Jev, Laya, SemIf, Kev, JevK5 oraz własne modele InternLM 0.8B i 2B. Każdy z nich to kolejny wpis System One lub modelu decyzyjnego — Jev od TypeSafe AI, Laya od Convai Innovations i trzy inne. Każda liczba jest raportowana przez dostawcę na własnych harnessach InternLM. W tabeli nie ma w ogóle żadnego modelu frontier.
To nie jest przeoczenie. To uczciwy zakres tego twierdzenia. Główna średnia Intern-Decision-4B wynosząca 90,02 w siedmiu zestawach — Jevbench-Easy 100,00, Jevbench-Original 98,61, Jevbench-Hard 73,87, Typed Decision 80,55, ToolACE 96,45, AG News 90,82, WildJailBreak 89,86 — to twierdzenie o prowadzeniu w kategorii modeli decyzyjnych, co potwierdza w tej tabeli, bijąc wynik 88,74 modelu Jev i 57,77 modelu Laya. Nie jest to twierdzenie o konkurowaniu z Qwen 3.8 i InternLM nigdzie nie wysuwa takiego twierdzenia. Karta modelu jest ograniczona do własnej kategorii, a odczytywanie zwycięstwa w kategorii jako zwycięstwa w zakresie możliwości to błąd, któremu ma zapobiegać ta sekcja.
Jeszcze dwa zastrzeżenia. Wartości opóźnienia — średnio 44 ms na 4090 — są mierzone przez dostawcę, zależą od obciążenia i sprzętu, a przejście w przód na pojedynczym GPU to nie ten sam pomiar co wywołanie hostowanego API obejmujące rundę sieciową i kolejkowanie. A pilotaż kalibracyjny to 96 przypadków: diagnostyka, a nie benchmark — i karta tak mówi.
Pytanie o wdrożenie, które jest prawdziwym rozgałęzieniem
Zapomnij na chwilę o benchmarkach i zapytaj, czego każdy z nich wymaga od ciebie operacyjnie.
Intern-Decision-4B zajmuje na dysku około 9,1 GB w bf16 — dwa shardy językowe po 4,26 GB i 4,15 GB, wieżę wizyjną o rozmiarze 612 MB oraz projektor 54 MB. Ładuje się przez plik o rozmiarze 16 KB, inference.py dostarczany w samym repozytorium, z klasą DecisionEngine, którą tworzysz raz i używasz ponownie. Jeden słownik Pythona na wejściu, jeden słownik odpowiedzi na wyjściu, z wymogiem Pythona 3.12+. Działa w 44 ms na 4090, a bliźniaczy model 0,8B jest wystarczająco mały, by analizować go przy znacznie skromniejszych zasobach. Ale to moduł jest interfejsem — nie ma serwera, nie ma endpointu zgodnego z OpenAI ani hostowanego API. Usługę budujesz wokół niego, a jeśli potrzebujesz dwóch takich modułów do przełączania awaryjnego, to również musisz je zbudować.
Generatywna strona tego samego potoku to zupełnie inna decyzja — i to właśnie do niej służy router. Qwen3.8-Max i Qwen3.8-27B można wywoływać w OrcaRouter za tym samym kluczem zgodnym z OpenAI, w cenie katalogowej dostawcy z 0% narzutu przekazywanego dalej — więc gdy Alibaba zmienia cenę Qwen, u nas obowiązuje ona tego samego dnia, a nie dopiero w następnym cyklu rozliczeniowym. Intern-Decision-4B nie jest jedną z naszych tras i nie będzie, dopóki InternLM nie zacznie go gdzieś hostować; nie zamierzamy udawać inaczej. To, co obejmujemy, to połowa tego potoku, która jest wywołaniem sieciowym: jeden klucz dla ponad 200 modeli, automatyczne przełączanie awaryjne, jeśli Qwen3.8-Max pogorszy się — jego bieżący siedmiodniowy wskaźnik błędów wynosi 1,78% — oraz możliwość porównania A/B dwóch poziomów Qwen 3.8 w tej samej ścieżce żądania, zanim zdecydujesz się na którykolwiek z nich.
To jest wzorzec, który warto zapamiętać. Uruchamiaj scorer lokalnie, bo jest tani i szybki i dobrze robi jedną wąską rzecz. Krok rozumowania kieruj do zewnętrznego dostawcy, bo to tam naprawdę mają miejsce zmiany dostawców, obniżki cen i awarie.

Który właściwie powinieneś wybrać
Wybierz Intern-Decision-4B, jeśli Twoja decyzja ma zamknięty zbiór opcji, odpowiedzi da się wyliczyć w prompcie, wykonujesz tę samą decyzję masowo i zależy Ci na prawdopodobieństwie tak samo jak na etykiecie. Przydzielanie zgłoszeń, moderacja treści według stałej taksonomii, ekstrakcja strukturalna do schematu, który kontrolujesz, rubryki oceniania, bramki binarne — wszystko, gdzie człowiek mógłby z góry zapisać listę opcji. 4,54 miliarda parametrów uczciwie mówi o suficie: sama karta pokazuje 4B na poziomie 73,87 w Jevbench-Hard wobec 100,00 w Easy, więc im trudniejszy kształt decyzji, tym więcej mały model oddaje.
Wybierz Qwen 3.8 — czyli Qwen3.8-Max, jeśli chcesz hostowany rdzeń, Qwen3.8-27B, jeśli chcesz wagi, które możesz trzymać — jeśli odpowiedzi nie da się wyliczyć z góry, jeśli dane wejściowe są dłuższe niż 8192 tokeny, jeśli potrzebujesz uzasadnienia, które możesz pokazać człowiekowi, jeśli potrzebujesz wywołań narzędzi lub jeśli potrzebujesz wideo. Wybierz go też, jeśli po prostu nie chcesz obsługiwać GPU: 12,3 godziny czasu 4090 na milion decyzji jest tanie tylko wtedy, gdy już masz 4090 i coś innego do zrobienia z nim przez pozostałe 363 dni.
Wybierz oba, jeśli Twój pipeline ma taki kształt, jaki w rzeczywistości ma większość pipeline'ów — z tanim klasyfikatorem zamkniętego zbioru z przodu i modelem typu frontier za nim na przypadki, co do których klasyfikator nie ma pewności. To konfiguracja, dla której powstała kalibracja Intern-Decision-4B, i to jest powód, dla którego liczba ECE powyżej ma większe znaczenie niż nagłówek.
Co obejrzeć
Trzy otwarte pytania, na wszystkie można odpowiedzieć w ciągu kilku dni. Czy InternLM publikuje repozytorium GitHub, do którego prowadzi jego własna karta — obecnie zwracające 404 — a wraz z nim opis treningu? Czy po wagach następuje ogłoszenie, zamieniając cichy push w udokumentowane wydanie? I czy cokolwiek niezależnego odtworzy średnią 90,02 albo wskaźnik Brier 0,347 na sprzęcie, który nie należy do InternLM?
Jest jedna drobna niespójność, którą warto odnotować, gdy czekasz, bo to właśnie ten rodzaj rzeczy, który ma znaczenie, gdy określasz rozmiar wdrożenia. Model nazywa się 4B. Liczba parametrów wynosi 4 539 265 536 — 4,54 miliarda. Model siostrzany 0.8B ma 853 miliony, a model siostrzany 2B — 2,21 miliarda; oba zaokrąglają się w górę lub w dół o włos. Tylko 4B zaokrągla się w dół o ponad pół miliarda. To nie problem. To przypomnienie, że w przypadku niezapowiedzianego wydania dokumentacja jest jedyną specyfikacją, jaką masz, a nawet ona wciąż jest edytowana.
