
Intern-Decision-0.8B vs Qwen 3.8: 853 miliony parametrów i zamknięty zestaw odpowiedzi
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 592 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 187 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Intern-Decision-0.8B to najmniejszy z trzech modeli decyzyjnych, które InternLM udostępnił na Hugging Face rano 26 września 2026 r., i nie jest najszybszy z nich. To pierwsza rzecz, którą warto wiedzieć. Według pomiarów samego laboratorium bliźniaczy model 2B działa nieco szybciej — 33,28 ms wobec 33,98 ms — i uzyskuje o sześć punktów wyższy wynik na tej samej średniej z siedmiu zestawów, więc zwykły powód, dla którego sięga się po checkpoint poniżej miliarda parametrów, czyli surowa szybkość, tutaj nie ma zastosowania. Ma natomiast znaczenie rozmiar: 852 985 920 parametrów, 1,71 GB wag bf16 — dość mało, by na stałe zmieścić się na marginesie maszyny, która ma coś innego do roboty. Zestaw to z Qwen3.8-Max — hostowaną wersją opublikowanego przez dostawcę w sierpniu rzadkiego rdzenia mixture-of-experts o 2,4 biliona parametrów, wycenioną na 2,00 i 6,00 USD za milion tokenów — a te dwa modele nie konkurują o to samo zadanie. Jeden zwraca rozkład prawdopodobieństwa na wcześniej podane opcje. Drugi pisze.
Krótka odpowiedź: Intern-Decision-0.8B warto mieć, jeśli potrzebujesz decyzji z zamkniętego zbioru ocenianej na sprzęcie, który już posiadasz, i jeśli 1,71 GB zamiast 4,43 GB to różnica między wypuszczeniem a niewypuszczeniem. Nie warto go mieć, jeśli chcesz najdokładniejszy mały model oceniający, jaki InternLM wydał w tym tygodniu — czyli 4B — albo jeśli twoja odpowiedź nie jest już wyliczona w twoim promptcie, w takim przypadku żadne z tych dwóch narzędzi nie jest właściwe, a Qwen 3.8 jest jedynym z tej pary, które w ogóle może wykonać to zadanie.
Co mówi repozytorium, a czego nie mówi nic innego
Zacznijmy od dowodów, bo jest ich bardzo mało. InternLM nie ogłosił żadnego komunikatu o tym modelu. Brak wpisu o premierze, brak artykułu, brak opisu repozytorium. Karta na Hugging Face linkuje do demo Space i repozytorium GitHub, a w chwili pisania tego tekstu Space zwraca 401, a link do GitHub zwraca 404 — dwa miejsca, do których karta odsyła po więcej informacji, są zamknięte. Trzy checkpointy pojawiły się w ciągu czterdziestu sekund od siebie około 05:36 UTC 26 września: Intern-Decision-0.8B, Intern-Decision-2B i Intern-Decision-4B, wszystkie z tymi samymi tagami — podejmowanie decyzji, multimodalny, predykcja strukturalna — i wszystkie są fine-tuningami checkpointów Qwen, w tym przypadku Qwen3.5-0.8B.
To, co można wywnioskować z repozytorium, jest nietypowo precyzyjne jak na nieogłoszoną premierę, ponieważ laboratorium dostarczyło własny moduł wnioskowania razem z wagami. Model 0.8B ładuje się przez 16 KB inference.py w katalogu modelu, wymaga Pythona 3.12 lub nowszego oraz torch 2.9.1 z transformers 5.14.1 i udostępnia klasę DecisionEngine, której instancję tworzysz raz i używasz ponownie. Jeden słownik Pythona na wejściu, jeden słownik odpowiedzi na wyjściu. Czego nie można wywnioskować: czy to ukończona premiera, czy wczesny push, czy pojawi się hostowany endpoint, oraz czy dwa checkpointy, między którymi się znajduje, mają być tym samym produktem w różnych rozmiarach, czy trzema różnymi produktami, które przypadkiem dzielą nazwę. Nikt spoza InternLM nie uruchomił żadnego z nich.

Problem siostrzany: 2B jest szybszy i lepszy
Oto część opublikowanej przez sam InternLM tabeli, która sprawia, że 0.8B trudno umiejscowić. Odczytując trzy rozmiary w tych samych siedmiu zestawach:
• Szybkość — 0,8B: 33,98 ms średnia, 33,44 ms mediana, 37,50 ms przy p95. 2B: 33,28 ms, 33,15 ms, 33,55 ms. 4B: 44,16 ms, 44,03 ms, 44,60 ms. Wszystkie mierzone na zapytanie na pojedynczym RTX 4090 przez lokalną ścieżkę Hugging Face.
• Średnia z siedmiu zestawów — 0,8B: 79,38. 2B: 84,68. 4B: 90,02.
• Kalibracja — 0,8B: Brier 0,530, ECE 0,066. 2B: Brier 0,437, ECE 0,100. 4B: Brier 0,347, ECE 0,065.
• Zajętość na dysku przy bf16 — 0,8B: 1,71 GB. 2B: 4,43 GB. 4B: 9,08 GB.
2B jest szybszy średnio, ma dramatycznie ciaśniejszy ogon i jest dokładniejszy — wszystko jednocześnie. Zatem „mniejszy znaczy szybszy” jest fałszywe w całej tej rodzinie — podwójnie, ponieważ 4B jest wolniejszy od obu. Jedyną osią, na której 0.8B wygrywa bezapelacyjnie, jest ta, której nikt nie benchmarkuje: 1,71 GB wobec 4,43 GB dla 2B i 9,08 GB dla 4B. Jeśli umieszczasz scorer w ramach stałego budżetu pamięci — małe, stale włączone urządzenie, GPU współdzielone z innymi, węzeł brzegowy z modelem językowym zajmującym już większość karty — to cały ten argument i jest to argument jak najbardziej realny.
Reszta tabeli to studium tego, gdzie małe modele zawodzą nierównomiernie. Wynik Typed Decision dla 0.8B to 77,35 wobec 80,55 dla 4B — różnica trzech punktów przy jednej piątej liczby parametrów. Ale Jevbench-Original spada z 98,61 do 80,56, a WildJailBreak załamuje się z 89,86 do 64,48. Cokolwiek te dwa zestawy mierzą — karta tego nie mówi i nie podaje żadnych definicji zestawów — to one najmocniej karzą mały checkpoint. Model, który trzyma się na jednej osi, a na dwóch innych spada z urwiska, nie jest jednolicie słabszym modelem. To model o określonej granicy kompetencji i chciałoby się wiedzieć, gdzie lokuje się twoje obciążenie, zanim powierzy się mu całą flotę.
Jeszcze jedno zastrzeżenie dotyczące wiersza kalibracji. ECE modelu 0.8B wynoszące 0,066 to jego najlepszy wynik — lepszy niż wynik 0,095 Jev na tym samym zestawie — podczas gdy jego wynik Brier'a wynoszący 0,530 jest gorszy niż wynik 0,358 Jev. Błąd skalibrowany i średni kwadratowy błąd prawdopodobieństwa to nie są te same pomiary, a tabela, która pokazuje, że jeden wygląda mocno, a drugi słabo, mówi ci, że rozkład jest dobrze ukształtowany w pobliżu swoich szczytów ufności i grubszy, niż powinien być, pomiędzy nimi. Jeśli twój system ustawia progi na podstawie ufności, ta różnica ma większe znaczenie niż średnia.
Co tak naprawdę daje 1,71 GB
Ścieżka wnioskowania w tym modelu to skorer, a nie generator, a różnica w koszcie jest strukturalna, a nie inkrementalna. Przekazujesz mu współdzielony stan, schemat nazwanych pytań i opcjonalnie do ośmiu obrazów. Każde pytanie należy do jednego z trzech typów: choice (jeden z uporządkowanego zestawu opcji), score (skala porządkowa, zwracana jako oczekiwana wartość ważona prawdopodobieństwem) lub noul (binarne nie/tak). Stan, schemat i kompletny szkielet JSON asystenta są renderowane z jednym symbolem zastępczym na pole, model wykonuje pojedynczy przyczynowy przebieg w przód, a logity są odczytywane na pozycji bezpośrednio przed każdym symbolem zastępczym. Softmax jest obliczany tylko na dozwolonych symbolach-kandydatach tego pola, stosowana jest dopasowana kalibracja checkpointu, a symbole są mapowane z powrotem na wartości twoich opcji.
Wynikają z tego trzy konsekwencje. Nie ma tokenu wyjściowego, a zatem nie ma ceny wyjściowej — milion decyzji nie pociąga za sobą żadnych kosztów tokenów. Nie ma pętli dekodowania ani nawiasu klamrowego, o którym można by zapomnieć, więc niepoprawnie sformatowany JSON nie jest trybem awarii. A ponieważ przestrzeń odpowiedzi każdego pola jest budowana na potrzeby każdego żądania, schemat, który wymyślisz dziś po południu, nie wymaga ponownego trenowania: dodaj pytanie, a jego opcje stają się kandydatami na symbole dla tego pola.
Limity są podane równie jasno. Od jednego do szesnastu pytań, każde z maksymalnie 62 opcjami, do ośmiu obrazów i domyślny limit 8,192 tokenów — a dane wejściowe przekraczające go są odrzucane, a nie obcinane. Ta ostatnia klauzula to decyzja projektowa, nad którą warto się pochylić, ponieważ ciche obcinanie sprawia, że klasyfikator po cichu zaczyna odpowiadać na inne pytanie niż to, które zadałeś. InternLM zamiast tego głośno zgłasza błąd, co jest słuszne, a zarazem stanowi pułapkę operacyjną: długi wątek zgłoszenia plus schemat plus obrazy przekroczą 8,192 szybciej, niż się spodziewasz, i nie ma łagodnej ścieżki, gdy to nastąpi.
A te 1,71 GB daje ekonomię czasu wykonania, którą można wymnożyć. Przy 33,98 ms na decyzję milion decyzji to 9,44 godziny jednego RTX 4090. Model 4B potrzebuje 12,3 godziny na ten sam milion i oddaje dziesięć i pół punktu dokładności w zamian za 7,37 GB, których nie miałeś. Żadna z tych liczb nie obejmuje kosztu maszyny, a żadna nie obejmuje tego, o czym ludzie zapominają: prowadzisz usługę, a w repozytorium nie ma serwera.

Qwen 3.8 to nie jeden model, a na uwagę zasługuje ten z tańszej półki.
Qwen 3.8, traktowany jako samodzielna nazwa, to Qwen3.8-2.4T-A95B: rzadki rdzeń typu mixture-of-experts z 2,4 biliona parametrów, który Alibaba opublikowała jako otwarte wagi 12 sierpnia 2026 roku, z około 95 miliardami parametrów aktywnych na token i niestandardową licencją zamiast Apache 2.0. Hostowana wersja tego samego rdzenia to Qwen3.8-Max, ogólnie dostępna w płatnym API od 3 sierpnia i odświeżona jako datowana migawka z 2 września. To jeden mózg sprzedawany na dwa sposoby, a druga wersja jest tą, którą większość ludzi faktycznie wywoła.
Według niezależnych danych Artificial Analysis mierzy wrześniowy snapshot Qwen3.8-Max na poziomie Intelligence Index 45,4 — piętnaste miejsce wśród 145 indeksowanych modeli — z wynikiem AA Coding 76,2 na dziewiątym miejscu wśród 138, GPQA Diamond 92,8, Humanity's Last Exam 43,1 oraz wynikiem długokontekstowego przywoływania na poziomie 80,3. Otwarty checkpoint ustępuje API, z którego został zdystylowany, osiągając 39,9. W naszym własnym siedmiodniowym oknie playground Qwen3.8-Max plasuje się na p50 wynoszącym 2 578 ms i p95 wynoszącym 9 539 ms przy 55,5 tokenów wyjściowych na sekundę, ze wskaźnikiem błędów 1,57%. Qwen3.8-Max można wywoływać w OrcaRouter w cenie katalogowej dostawcy bez doliczania marży 0%, więc zmiana ceny Alibaba jest u nas widoczna tego samego dnia, a nie dopiero w kolejnym cyklu rozliczeniowym.
Gęsty wariant bliźniaczy jest tym, który należy zestawić z lokalnym checkpointem o rozmiarze 1,71 GB, ponieważ jest najtańszym sposobem na uzyskanie ogólnych możliwości w tej rodzinie. Qwen3.8-27B jest na licencji Apache 2.0, ma natywny kontekst 262 144 tokenów, a Qwen3.8-27B kosztuje 0,33 USD i 2,40 USD za milion tokenów w naszym katalogu. Jego Artificial Analysis Intelligence Index wynosi 33,7. Jego liczba parametrów jest około trzydzieści dwa razy większa niż w Intern-Decision-0.8B, wciąż jest generatywny i wciąż jest niewłaściwym narzędziem do podejmowania decyzji w zamkniętym zbiorze przy dużej skali — ale jest uczciwą opcją pośrednią i jedynym elementem tego porównania, który jest naprawdę tani i naprawdę ogólny jednocześnie.
Oceniający kontra generator, mówiąc wprost
• Kontekst — Qwen3.8-Max ma okno 1 000 000 tokenów. Intern-Decision-0.8B odrzuca wszystko powyżej 8 192. Współczynnik 122 — wymuszany, a nie obcinany.
• Wejście — Qwen3.8-Max przyjmuje tekst, obraz i wideo. Intern-Decision-0.8B przyjmuje tekst oraz maksymalnie osiem obrazów, a tokeny obrazów wliczają się do tego samego budżetu wynoszącego 8,192.
• Wynik — Qwen3.8-Max pisze, rozumuje, wywołuje narzędzia i wysyła JSON na żądanie. Intern-Decision-0.8 nie potrafi wygenerować akapitu, uzasadnienia, czy wręcz żadnego uzasadnienia; potrafi jedynie ocenić opcje, które przyszły ci do głowy.
• Koszt na wywołanie — realistyczne wywołanie triage obejmujące 800 tokenów wejściowych i 150 tokenów wyjściowych kosztuje około 0,0025 USD w modelu Qwen3.8-Max, jeszcze przed uwzględnieniem jakichkolwiek tokenów rozumowania, a liczba tokenów wyjściowych jest optymistycznie mała, ponieważ to model rozumujący. Milion takich wywołań to około 2500 USD. Intern-Decision-0.8B nie ma w ogóle ceny za token: milion decyzji to 9,44 godziny pracy karty 4090, którą posiadasz lub wynajmujesz.
• Opóźnienie — mediana 2 578 ms w Qwen3.8-Max w ciągu ostatnich siedmiu dni, z uwzględnieniem sieci i kolejkowania. 33,98 ms w Intern-Decision-0.8B to samo przejście w przód na lokalnej karcie i nie jest to ten sam pomiar; uczciwe porównanie to jeden rząd wielkości, a nie osiemdziesiąt razy.
• Dowody — każda liczba dotycząca Intern-Decision-0.8B podana tutaj jest raportowana przez dostawcę na własnych zestawach testowych InternLM i nieodtworzona przez nikogo, w tym opóźnienie. Każda liczba dotycząca Qwen 3.8 pochodzi albo z własnego pomiaru Alibaby, albo z pomiaru Artificial Analysis, i są one oznaczone oddzielnie powyżej.
• Niezależny wynik — Qwen3.8-Max ma go. Intern-Decision-0.8B nie ma żadnego — w jakimkolwiek rodzaju, a żaden dostawca inferencji go nie wdraża.

Dwa sposoby uruchomienia tego potoku
Rozwidlenie operacyjne jest ostrzejsze niż rozwidlenie benchmarkowe. Intern-Decision-0.8B to moduł, a nie usługa. Nie ma punktu końcowego zgodnego z OpenAI, serwera wsadowego, kontroli stanu, polityki ponawiania ani drugiej repliki, chyba że sam ją zbudujesz. Ładuje się w jednym procesie i odpowiada na jeden słownik naraz, a jeśli potrzebujesz failoveru, to ty jesteś failoverem. To uczciwy opis badawczego checkpointu z 853 milionami parametrów, opublikowanego bez noty startowej, i należy to odpowiednio wkalkulować w decyzję.
Generatywna połowa tego samego potoku to wywołanie sieciowe, a router właśnie do tego służy. Zarówno Qwen3.8-Max, jak i Qwen3.8-27B są dostępne za jednym kluczem zgodnym z OpenAI, a automatyczne przełączanie awaryjne sprawia, że zdegradowany upstream nie staje się twoim incydentem — warto o tym wspomnieć, ponieważ bieżący siedmiodniowy wskaźnik błędów Qwen3.8-Max po naszej stronie wynosi 1,57%, co jest niskie, dopóki nie chodzi o twoje żądanie. Wzorzec, który ma sens, to ten, który ta para po cichu opisuje: uruchamiaj tani klasyfikator zamkniętego zbioru lokalnie, bo jest szybki i nie kosztuje nic za wywołanie, a krok rozumowania kieruj przez router, ponieważ to tam naprawdę dochodzi do obniżek cen, rotacji modeli i awarii.
Dwie rzeczy, których nie będziemy twierdzić. Intern-Decision-0.8B nie jest jedną z naszych tras i nie będzie nią, dopóki InternLM nie zacznie go gdzieś hostować — nie zamierzamy sugerować, że jest inaczej. A dziś nie hostujemy w ogóle żadnego modelu InternLM, więc nic w tym artykule nie jest zachętą do uruchamiania tego modelu za naszym pośrednictwem.
Co zmieniłoby odpowiedź
Trzy otwarte pytania, na wszystkie można odpowiedzieć w ciągu kilku dni. Czy InternLM publikuje repozytorium GitHub, do którego linkuje jego własna karta, a wraz z nim opis tego, jak te wagi zostały dostrojone? Czy po checkpointach pojawia się wpis o premierze, zamieniając cichy push w udokumentowane wydanie z przedstawioną historią wdrożenia? I czy ktokolwiek niezależny odtwarza średnią 79,38 lub błąd kalibracji 0,066 na sprzęcie, który nie należy do InternLM?
Dopóki któreś z nich się nie pojawi, uczciwa interpretacja Intern-Decision-0.8B jest wąska i konkretna: to najtańszy scorer zbioru zamkniętego w rodzinie trzech modeli, o rozmiarze, który mieści się tam, gdzie jego własny szybszy i dokładniejszy model pokrewny już się nie mieści, opublikowany bez ogłoszenia i bez tego jednego artefaktu, który powiedziałby ci, do czego został dostrojony. Jeśli twoja decyzja dotyczy zbioru zamkniętego, twoje odpowiedzi da się wyliczyć w prompcie, a 1,71 GB to liczba, na której faktycznie opiera się twoje wdrożenie, to właściwy wybór i nie ma nic podobnego w tym rozmiarze. Jeśli twojej odpowiedzi nie da się wyliczyć z góry, twój stan przekracza 8 192 tokeny albo potrzebujesz uzasadnienia, które możesz pokazać człowiekowi, to porównanie nigdy nie było bliskie — a model, którego chcesz, nigdy nie był modelem o 853 milionach parametrów.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
