
Intern-Decision-0.8B vs Gemma 4 12B: głowica oceniająca kontra multimodalny generalista
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 592 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 187 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Najtańszym sposobem, by zobaczyć, czym jest Intern-Decision-0.8B — a czym nie jest — jest postawienie go obok modelu Gemma 4 12B, a następnie zauważenie, że porównanie dotyczy niemal wyłącznie tego, co każdy z modeli robi ze swoją warstwą wyjściową. Gemma 4 12B, multimodalny model DeepMind bez enkodera o 11,95 miliarda parametrów, wydany 3 czerwca 2026 r. na licencji Apache 2.0, jest generatywnym generalistą: podajesz mu tekst, obrazy, dźwięk lub wideo, a on pisze odpowiedź. Intern-Decision-0.8B, po cichu przesłany przez InternLM do Hugging Face 26 września 2026 r. bez żadnej zapowiedzi, to dostrojenie znacznie mniejszego Qwen3.5-0.8B, które nie generuje żadnego tekstu — przyjmuje stan, schemat nazwanych pytań i maksymalnie osiem obrazów, a po pojedynczym przebiegu w przód zwraca skalibrowany rozkład prawdopodobieństwa dla każdego pytania. Jeden pisze. Drugi punktuje. Wszystko poniżej wynika z tego.
To dziwne zestawienie, by przedstawiać je jako rywalizację, i warto powiedzieć to wprost, zanim przejdziemy do wierszy specyfikacji: te dwa modele nie są substytutami, a każdy, kto wybiera między nimi, już źle sformułował problem. Gemma 4 12B odpowiada na pytanie „jaka powinna być odpowiedź”. Intern-Decision-0 odpowiada na pytanie „która z tych opcji to jest i jak bardzo jesteś pewien” — i odpowiada bez pętli dekodera, stąd wynikają różnice w opóźnieniu i koszcie. Przydatne porównanie dotyczy zatem tego, jak wpiąłbyś każdy z nich w jeden przepływ pracy, a nie tego, który wygrywa.
Największa pojedyncza różnica to strona wyjściowa rachunku
Gemma 4 12B jest rozliczany jak każdy model generatywny: tokeny wejściowe i tokeny wyjściowe, jedne i drugie. Kiedy prosisz go o ustrukturyzowany JSON, każdy z tych tokenów jest generowany, próbkowany i rozliczany, a im dłuższy i bardziej zagnieżdżony jest twój schemat, tym jest ich więcej. To nie krytyka modelu — tak po prostu działa dekoder — ale to właśnie ta pozycja kosztowa, którą głowy decyzyjne mają za zadanie wyeliminować. Intern-Decision-0.8B nie ma tokenów wyjściowych. Jego karta mówi wprost, dlaczego: ścieżka wnioskowania nigdy nie wywołuje generate()/, odczytując logity na pozycjach bezpośrednio poprzedzających każdy <decision>/ symbol zastępczy w wstępnie wyrenderowanym szkielecie i biorąc softmax wyłącznie po dozwolonych symbolach kandydujących dla danego pola. Licznik użycia o nazwie output_tokens/ zlicza ocenione pola, a nie tekst.
Konsekwencja kumuluje się wraz ze skalą. Pipeline, który etykietuje dziesięć tysięcy rekordów za pomocą Gemma 4 12B, płaci za dziesięć tysięcy dokumentów JSON; ten sam pipeline z Intern-Decision-0.8B płaci za prompty i nic więcej. To, czy liczba bezwzględna jest duża, zależy wyłącznie od Twojego wolumenu i schematu, a każdy, kto ma budżet na token, może to obliczyć w arkuszu kalkulacyjnym w dziesięć minut. Ale kierunek nie podlega dyskusji i to właśnie dlatego w ogóle pojawiła się kategoria małych modeli decyzyjnych.
Opóźnienie, i dlaczego różnica parametrów jest myląca
• Model przepustowości — Intern-Decision-0.8B: jedno przejście w przód, brak pętli dekodowania. Gemma 4 12B: generowanie autoregresyjne, po jednym tokenie na raz.
• Zmierzona latencja — Intern-Decision-0.8B: średnio 33,98 ms / 37,50 ms p95 na pojedynczym RTX 4090 przez lokalną ścieżkę Hugging Face, zgodnie z własnym pomiarem InternLM. Gemma 4 12B: nie istnieje porównywalna wartość dla pojedynczego przebiegu, ponieważ nie ma pojedynczego przebiegu do zmierzenia.
• Ślad — Intern-Decision-0.8B: około 1,73 GB miejsca w repozytorium, 852 985 920 parametrów rozłożonych na shard językowy o rozmiarze 1,50 GB, shard wizyjny o rozmiarze 176 MB i projektor o rozmiarze 25 MB. Gemma 4 12B: materiały premierowe Google'a wskazują na 16 GB VRAM lub pamięci zunifikowanej.
• Deterministyczność wyjścia — Intern-Decision-0.8B: argmax po logitach kandydatów, więc to samo wejście za każdym razem daje tę samą etykietę. Gemma 4 12B: próbkowanie, chyba że ustawisz temperaturę na zero, a nawet wtedy etykieta przychodzi jako tekst, który musisz przeanalizować.
Czternastokrotna różnica w liczbie parametrów między tymi dwoma modelami nie przekłada się na nic choćby zbliżonego do 14-krotnej różnicy w czasie działania w zadaniu decyzyjnym, ponieważ charakter pracy jest inny. Intern-Decision-0.8B poświęca swój jedyny przebieg na odczyt promptu — stanu, schematu, opisów opcji — a potem się zatrzymuje. Gemma 4 12B wykonuje ten sam odczyt promptu, a następnie dokłada na to każdy token odpowiedzi. W przypadku schematu z szesnastoma polami i opisowymi etykietami opcji etap generowania nie jest błędem zaokrąglenia; to większość czasu zegarowego. Tabela samego InternLM przypadkiem to potwierdza: jego brat 2B osiąga średnią 33,28 ms, nieznacznie szybciej niż 33,98 ms modelu 0,8B. Gdy przetwarzanie promptu dominuje, liczba parametrów przestaje być dźwignią.img src="2.png">

Gdzie Gemma 4 12B jest po prostu w innej kategorii
Byłoby nieuczciwe pozostawiać kartę specyfikacji na etapie ujęcia zadaniowo-decyzyjnego, ponieważ poza tym ujęciem Gemma 4 12B nie tylko jest z przodu — ona gra w inną grę.
Intern-Decision-0.8B przyjmuje tekst oraz do ośmiu obrazów i to wyczerpuje całą jego powierzchnię wejściową. Jego domyślny pułap wejściowy wynosi 8 192 tokenów, a przekroczenie jest odrzucane, a nie obcinane, co jest znacznie poniżej 262 144 maksymalnego osadzania pozycji, które reklamuje jego konfiguracja — praktycznym oknem jest pułap, a nie architektura. Gemma 4 12B natywnie przyjmuje tekst, obraz, dźwięk i wideo dzięki projektowi bez enkodera, który rzutuje surowe fragmenty i przebiegi fal bezpośrednio w przestrzeń osadzeń, utrzymuje okno kontekstu 256K i zwraca tekst. Opublikowana karta Google ocenia ją na 77,2% w MMLU Pro, 77,5% w AIME 2026 bez narzędzi, 72,0% w LiveCodeBench v6, 78,8% w GPQA Diamond, 69,1% w MMMU Pro i 79,7% w MATH-Vision. To liczby dostawcy z własnej karty ewaluacyjnej Google i, w przeciwieństwie do tabeli Intern-Decision-0.8B, mają za sobą rok użytkowania przez strony trzecie, ponieważ Gemma 4 trafiła do ekosystemu — LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, Unsloth — już pierwszego dnia.
Wydania również nie są do siebie podobne, a kontrast jest pouczający. Gemma 4 12B w dniu premiery miała blog premierowy, raport techniczny na arXiv, stronę rodziny pięciu modeli, kartę ewaluacji i link do pobrania. Intern-Decision-0.8B miała kartę modelu z adresem URL GitHub zwracającym 404 oraz demo Space zwracającym 401 i pojawiła się w ciągu czterdziestu sekund od dwóch większych modeli-sióstr, które są równie nieudokumentowane. Jedno z nich to produkt. Drugie to checkpoint, który ktoś postanowił umieścić w internecie.
Oba są Apache 2.0, a to nie jest błahy wspólny wiersz.
Jedyny wymiar, w którym te dwa modele faktycznie się spotykają, to licencjonowanie, i warto poświęcić mu akapit, bo właśnie tutaj decyzja zmienia się dla użytkowników komercyjnych. Oba są na licencji Apache 2.0. Gemma 4 12B jest udostępniana na warunkach licencji Gemma 4 hostowanej w Google, którą karta modelu określa jako Apache 2.0; Intern-Decision-0.8B zawiera Apache-2.0 obok drugiego LICENSE-QWEN/ pliku, co jest właściwym postępowaniem w przypadku modelu wywodzącego się z wag Qwen i sygnałem, że InternLM dopełniło formalności nawet dla wydania, którego nie ogłosiło.
To odróżnia oba od rodziny LFM2.5 firmy Liquid AI, której LFM Open License v1.0 uzależnia prawa komercyjne od tego, czy roczny przychód Twojego podmiotu prawnego pozostaje poniżej progu 10 milionów dolarów — realne ograniczenie, o którym nabywca modelu decyzyjnego porównujący opcje powinien przeczytać, zanim założy, że „open weights” oznacza wszędzie to samo. Jeśli Twój przypadek użycia jest komercyjny, a Twój przychód przekracza ten próg, Apache 2.0 i licencja LFM nie są wymienne, a ani Gemma 4 12B, ani Intern-Decision-0.8B nie są objęte tym ograniczeniem.
Uczciwy bilans liczb Intern-Decision-0.8B
Każda wartość wydajności modelu Intern-Decision-0.8B pochodzi od dostawcy i nie została odtworzona. To nie jest formalność — to obecny stan dowodów i powinien decydować o tym, jaką wagę przypisuje się tej tabeli. InternLM wybrał testy porównawcze, wybrał konkurentów, przeprowadził oceny i opublikował wyniki, a na żadnym publicznym rankingu nie istnieje niezależne badanie. Wyszukanie tego modelu w Artificial Analysis nie zwraca zupełnie nic. img src="3.png">

Z taką etykietą kształt wyniku wciąż jest pouczający. Model 0,8B osiąga 77,35 w benchmarku Typed Decision firmy TypeSafe wobec 73,35 dla Jev 1.13 — modelu, od którego benchmark wziął nazwę — oraz 94,52 w ToolACE wobec 91,29. Średnio uzyskuje 79,38 w całym zestawie, a jego własne bliźniacze modele 2B i 4B osiągają 84,68 i 90,02. Kolumną, która powinna skłonić kupującego do zastanowienia, jest WildJailBreak, gdzie uzyskuje 64,48 wobec 96,29 Jev: luka w odporności na odmowy tej wielkości jest właściwością tego fine-tuningu, a to, czy bierze się z bazy Qwen3.5-0.8B, celu dostrajania decyzyjnego czy liczby parametrów, nie jest nigdzie udokumentowane. Ciekawszą lekturą jest jego profil kalibracji — Brier 0,530 i oczekiwany błąd kalibracji 0,066 wobec 0,358 i 0,095 Jev — co oznacza, że jest ogólnie mniej dokładny, ale podawane przez niego poziomy pewności ściślej odpowiadają jego dokładności. W przypadku przepływu pracy opartego na progach ta różnica ma większe znaczenie niż surowa dokładność, a to jest właśnie coś, co InternLM nie miał żadnej zachęty publikować.
Dla kontrastu, karta ewaluacyjna modelu Gemma 4 12B również jest raportem dostawcy — te benchmarki także przeprowadził Google — ale istnieje na świecie od czerwca, została wdrożona we wszystkich głównych lokalnych środowiskach uruchomieniowych, a jakakolwiek rozbieżność wyszłaby na jaw. Prawdziwą różnicą między tymi dwiema kolumnami jest luka dowodowa między „nieodtworzone przez tydzień” a „nieodtworzone przez cztery miesiące i nikt temu nie zaprzeczył”.
Jak faktycznie byś je połączył
Wzorzec, który ma sens, nie jest wyborem. Głowa decyzyjna obsługuje wywołania strukturalne — routing, triage, klasyfikację, punktowanie według rubryki — gdzie zbiór odpowiedzi jest zamknięty, opóźnienie ma znaczenie, a tokeny wyjściowe są czystym narzutem. Generalista obsługuje wszystko, co wymaga prozy, kodu, syntezy lub długiego kontekstu: podsumowanie eskalacji, wyjaśnienie, dlaczego zgłoszenie trafiło do rozliczeń, szkic, który edytuje człowiek.
Jeśli ustalasz, gdzie przebiega granica, najtańszym eksperymentem jest umieszczenie obu połówek za jednym punktem końcowym. OrcaRouter kieruje ponad 200 modeli przez jedno API zgodne z OpenAI, z automatycznym przełączaniem awaryjnym i ceną listową dostawcy przekazywaną z zerową marżą, co oznacza, że przetestowanie hostowanego modelu decyzyjnego i hostowanego modelu ogólnego przeznaczenia w tym samym skrypcie kosztuje jeden klucz i jedno popołudnie. Warto doprecyzować jedną granicę: Intern-Decision-0.8B nie jest naszym modelem — to checkpoint Apache-2.0, który pobierasz i uruchamiasz samodzielnie, a cały powód, by wybrać model o rozmiarze 1,73 GB, jest taki, że znajduje się tam, gdzie są już Twoje dane. Generatywna połowa tego wzorca to ta część, która jest już tylko o jedną linijkę kodu dalej. Jeśli chodzi konkretnie o Gemma 4 12B, również nie ma go w naszym katalogu; rozmiary Gemma 4, które obsługujemy, to 31B i 26B A4B, a 12B to lokalne pobranie. img src="4.png">

Werdykt zatem nie wskazuje zwycięzcy. Intern-Decision-0.8B to tania, szybka, deterministyczna głowa punktująca z laboratorium, które jeszcze jej nie wyjaśniło, z tabelą benchmarków, której nikt nie odtworzył, i kolumną dotyczącą odporności odmów, którą należy przetestować, zanim trafi w pobliże niezaufanych danych wejściowych. Gemma 4 12B to dojrzały multimodalny generalista o otwartych wagach, z opublikowaną kartą, raportem technicznym i czternaście razy większą liczbą parametrów, i jest to niewłaściwe narzędzie do szesnastopolowego wywołania klasyfikacji — nie dlatego, że jest gorszy, ale dlatego, że generowanie odpowiedzi na pytanie, którego zbiór odpowiedzi już zapisano, jest kosztownym sposobem uzyskania etykiety.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
