Wygenerowana karta tytułowa z napisem „Intern-Decision-2B vs Qwen 3.8”, z podtytułem „Jeden backbone, dwa bardzo różne zadania”, z plakietkami „2,2B scorer, 33 ms” i „flagowiec 2,4T, kontekst 1M”, z logo OrcaRouter nałożonym w rogu.
Guides & Insights

Intern-Decision-2B vs Qwen 3.8: Jeden szkielet, dwa bardzo różne zadania

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Otwórz konfigurację dla internlm/Intern-Decision-2B i konfigurację dla Qwen/Qwen3.5-2B obok siebie, a niemal niczym się nie różnią. Te same 24 warstwy, ten sam rozmiar ukryty 2048, te same 8 głów zapytań wobec 2 głów klucz-wartość, ten sam wymiar głowy 256, ten sam pułap osadzania 262 144 pozycji, ten sam słownik 248 320 tokenów, ten sam powtarzający się wzór trzech warstw uwagi liniowej na jedną warstwę uwagi pełnej. Intern-Decision-2B nie jest nową architekturą. To ten szkielet z usuniętą zdolnością generowania tekstu i skalibrowaną pewnością siebie — i to właśnie to jedno odejmowanie sprawia, że porównanie z Qwen3.8-Max, flagowym modelem o 2,4 biliona parametrów, do którego na szczycie gamy odnosi się cała nazwa rodziny „Qwen 3.8", jest warte więcej niż odliczanie parametrów.

Te dwa rozwiązania nie są konkurentami, a ich zestawienie nie jest rywalizacją. Intern-Decision-2B to dostrojona wersja Qwen3.5-2B o 2 213 241 664 parametrach, wgrana do Hugging Face o 05:36 UTC 26 września 2026 r. wśród trzech nieogłoszonych modeli siostrzanych, i nie emituje tokenów: przyjmuje stan i pytania z typami, wykonuje jeden przyczynowy przebieg w przód, odczytuje logity w ustalonych pozycjach zastępczych i zwraca skalibrowany rozkład dla każdego pola. Qwen3.8-Max to hostowany flagowy model Alibaby, rzadki model mieszaniny ekspertów z około 95 miliardami parametrów aktywnych na token, multimodalnym oknem kontekstowym o długości 1 miliona tokenów i cennikiem katalogowym wynoszącym 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych. Jeden jest komponentem. Drugi jest usługą. Użyteczne pytanie brzmi: gdzie w potoku, za który już płacisz, powinien przebiegać styk między nimi.

Odejmowanie, dokładnie

Warto dokładnie powiedzieć, co zmieniło dostrajanie decyzyjne, ponieważ wyjaśnia to, co model bazowy już niósł.

W repozytorium zadanie to nazywa się autoregresyjnym modelowaniem języka z maskowaniem. Dane wejściowe asystenta zawierają kompletny szkielet JSON z jednym tokenem <decision> na pole; symbole odpowiedzi wzorcowych pojawiają się wyłącznie w etykietach, nigdy w danych wejściowych. Trening wykorzystuje zwykłe przyczynowe wyrównanie następnego tokenu, w którym logit bezpośrednio przed znacznikiem przewiduje odpowiedź tego pola, a wszystkie pola współdzielą jeden przebieg w przód. Podczas wnioskowania logity są ograniczane do dozwolonych jednotokenowych symboli odpowiedzi — A–Z, a–z, 0–9, stąd bierze się limit 62 opcji — a następnie poddawane operacji softmax i mapowane z powrotem na Twoje etykiety.

Zatem mechanizm przewidywania następnego tokenu modelu bazowego pozostaje nienaruszony i niezmodyfikowany. Wytrenowano natomiast preferencję do zajmowania jednej z kilku pozycji odpowiedzi zamiast kontynuowania zdania, a także specyficzną dla checkpointu temperaturę 2,100509348278 dopasowaną metodą ujemnej logarytmicznej wiarygodności na 1728 wyznaczonych przypadkach kalibracyjnych, przy 1693 odłożonych. Karta jednoznacznie stwierdza, że generowanie nie wchodzi w grę: API „wykonuje strukturalne ocenianie kandydatów. Nie wywołuje generate() ani nie próbkuje tekstu swobodnego”.

Repozytorium odnotowuje również to, czego dostrajanie nie objęło: „dostraja szkielet językowy Qwen3.5, jednocześnie zamrażając wieżę wizyjną i projektor”. 612 517 440-bajtowy shard wizyjny w modelu 2B ma tę samą liczbę bajtów co w 4B checkpoincie decyzyjnym, co pasuje do komponentów odziedziczonych, a nie wytrenowanych. Ścieżka obrazu działa; po prostu nie było to tym, na co przebieg decyzyjny przeznaczył swój budżet.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, the opening description of the model as a multimodal structured decision model fine-tuned from Qwen3.5-2B, and the start of the five-step 'How inference works' list.

Czego nie może zrobić 2,2 miliarda parametrów, a co zamiast tego robi 2,4 biliona

Wszystko rozstrzyga się na jednej osi: czy twoja odpowiedź już istnieje jako lista.

Intern-Decision-2B udziela odpowiedzi z zamkniętego zbioru. Od jednego do szesnastu pytań, do 62 opcji w każdym, do ośmiu obrazów, wszystko w budżecie 8 192 tokenów, który silnik odrzuca, zamiast obcinać. Zwracane jako prawdopodobieństwa. Przy średnim czasie 33,28 ms na żądanie na pojedynczym RTX 4090, z P95 wynoszącym 33,55 ms, i nic nie jest rozliczane za wywołanie, ponieważ nie ma wyników, za które można by rozliczać.

Qwen3.8-Max pisze. Kontekst o długości miliona tokenów, wejście tekstowe, obrazowe i wideo, rozumowanie w trybie myślenia, natywne wywoływanie narzędzi, ustrukturyzowane dane wyjściowe, do 131 000 tokenów wyjściowych w oznaczonej datą 0902 kompilacji. Może też, w zasadzie, podejmować taką samą decyzję routingu, jaką podejmuje Intern-Decision-2B — możesz poprosić go, aby wybrał spośród opcji i zwrócił JSON. Kiedy to robisz, trzy rzeczy idą nie tak. Płacisz za tokeny, które zużywa na podejmowanie decyzji. Otrzymujesz ciąg znaków, którego parsowanie może się udać albo nie. A liczba wewnątrz tego ciągu jest tym, co wygenerował sampler, a nie softmaxem, na którym możesz ustawić próg 0,8 i na jego podstawie działać.

Oba opisy są prawdziwe i żaden nie unieważnia drugiego. Flagowy model o 2,4 biliona parametrów istnieje, ponieważ większość problemów nie stanowi zbiorów zamkniętych. Model oceniający o 2,2 miliarda parametrów istnieje, ponieważ podzbiór, który jest zamknięty, zasługuje na tańsze narzędzie.

Tablica wyników

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Qwen 3.8'. The left column reads: Parameters 2,213,241,664 in BF16; Context 8,192 tokens, refused above; Output probabilities and an argmax; Modality text plus up to 8 images; Cost no per-call charge, you own the GPU; Published evidence vendor table, unreproduced. The right column reads: Parameters about 2.4T total, 95B active; Context 1,000,000 tokens; Output generated text with a reasoning trace; Modality text, image and video; Cost $2.00 in / $6.00 out per million; Published evidence AA Index 45.4, rank 15 of 145. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Qwen3.8-Max figures are per Artificial Analysis and the vendor's public rate card.

• Parametry —-Decision-2 2 213 241 664 w BF oraz wieża wizyjna i projektor, około 4,46 GB na dysku; Q3.8-Max ma łącznie około 2,4 biliona, przy około 95 miliardach aktywnych parametrów na token, udostępniany, a nie pobierany.

• Kontekst — 8,192 tokeny, powyżej odrzucane; 1,000,000 tokenów przy maksymalnej liczbie tokenów wyjściowych 131,000 w kompilacji 0902.

• Wyjście — skalibrowane prawdopodobieństwa i argmax, bez generowanego tekstu; wygenerowany tekst zawierający ślad rozumowania.

• Modalności wejściowe — tekst oraz do ośmiu obrazów; tekst, obraz i wideo.

• Koszt — brak opłaty za wywołanie, a GPU należy do Ciebie; 2,00 USD za milion tokenów wejściowych, 6,00 USD za milion tokenów wyjściowych, przy czym odczyt z pamięci podręcznej po 0,25 USD, a zapis do pamięci podręcznej po 2,50 USD.

• Opublikowane dowody — tabela dostawcy obejmująca siedem zestawów, ze średnią 84,68, Brier 0,437 i ECE 0,100 w 10 751 wierszach testowych, nieodtworzona przez nikogo spoza InternLM, na checkpointcie z jednym polubieniem i zerem pobrań; Artificial Analysis Intelligence Index wynoszący 45,4 na pozycji 15 z 145 oraz AA Coding index wynoszący 76,2 na pozycji 9 z 138, oba niezależnie zmierzone.

• Opóźnienie — średnio 33,28 ms na żądanie na jednym RTX 4090, malejące w miarę dodawania batchowania; 2,655 sekundy P50, jak podaje katalog, rosnące wraz z obciążeniem.

Wiersze dowodowe nie są równoważne i nie należy ich drukować tak, jakby były. Za flagowym modelem Alibaby stoi niezależny wynik indeksu. Checkpoint InternLM ma tabelę, którą stworzyli jego własni autorzy, a zwłaszcza wartość kalibracji należy czytać jako dobrze udokumentowany zamiar, dopóki nie zetknie się z danymi kogoś innego — tym bardziej tutaj, ponieważ ten konkretny rozmiar osiąga najgorszy oczekiwany błąd kalibracji spośród trzech wydanych przez InternLM: 0,100 wobec 0,066 dla modelu o połowę mniejszego i 0,065 dla modelu prawie dwukrotnie większego.

Szew i jak go uruchomić

Sensowny potok to nie wybór między tymi dwoma, lecz podział: model scoringowy obsługuje decyzje z listy, a model frontierowy obsługuje wszystko, czego odpowiedź nie jest listą. Segregacja zgłoszeń wsparcia, która kieruje zgłoszenie do jednego z sześciu zespołów i ocenia pilność w trzystopniowej skali, nie potrzebuje 95 miliardów aktywnych parametrów; potrzebuje prawdopodobieństwa i progu. Ścieżka eskalacji, która ostatecznie pisze klientowi odpowiedź, już tak.

Ten podział ma wymiar operacyjny. Intern-Decision-2B nie jest dostępny w OrcaRouter — nasza strona z tym modelem zwraca 404 i nigdzie nie udało się znaleźć hostowanej trasy — więc działa na twoim własnym sprzęcie, co oznacza, że jest komponentem, który obsługujesz i monitorujesz. Qwen3.8-Max to trasa: jeden klucz do ponad 200 modeli, cena katalogowa dostawcy przekazywana bez marży, co oznacza, że zmiana ceny u dostawcy flagowego modelu trafia na twoje rozliczenie tego samego dnia, w którym zostaje wprowadzona. Umieszczenie hostowanej części potoku za tą jedną powierzchnią sprawia, że ta tańsza część pozostaje tania: scorer utrzymuje niski wolumen wywołań, a do modelu frontier sięgamy tylko w przypadkach, które naprawdę go wymagają.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen breadcrumb, the model name Qwen3.8 Max, the routing line reading qwen/qwen3.8-max with text, image and video input and text output, the Vision, Tools, JSON and Reasoning capability badges, a release line reading by Qwen - 2026-08-03, a P50 time to first token of 2.655 seconds, on-page navigation for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ, and the opening of the vendor description naming it Alibaba's newest flagship model.

Jeśli wciąż oceniasz, który moduł oceniający należy umieścić w tym slocie — ten nie ma niezależnej ewaluacji, a jego kalibracja jest najsłabsza w swojej własnej rodzinie — automatyczne przełączanie awaryjne między dostawcami to sposób, aby wypróbować go na ścieżce, za którą stoi już działająca alternatywa, zamiast od razu zastępować tę alternatywę.

Uczciwy werdykt

Jeśli twój problem polega na podjęciu decyzji w oparciu o zbiór odpowiedzi, które możesz wyliczyć, a stan mieści się w ośmiu tysiącach tokenów, Intern-Decision-2B zrobi to w trzydzieści trzy milisekundy za darmo za każde wywołanie, a żaden model czołowy nie pobije go w tym wymiarze, niezależnie od tego, ile parametrów wynajmiesz. Przeprowadź na nim własną kalibrację, zanim zaczniesz polegać na pewności, którą raportuje.

Jeśli Twój problem dotyczy czegokolwiek innego — rozumowania, długiego kontekstu, korzystania z narzędzi, wideo, dokumentu o milionie tokenów albo po prostu odpowiedzi, która jeszcze nie została napisana — Qwen3.8-Max jest nie tylko lepszy. Jest jedynym z tych dwóch, który w ogóle jest w stanie wykonać to zadanie.

A jeśli nie potrafisz jeszcze powiedzieć, który z tych dwóch masz, odpowiedź prawdopodobnie brzmi: masz oba, w tym samym potoku — a to właśnie architektura, o której liczby parametrów po cichu mówiły ci przez cały czas.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie