Wygenerowana karta tytułowa z napisem „Intern-Decision-2B vs Gemma 4 12B”, z podtytułem „8,192 tokenów przeciw 256,000”, z odznakami „oceniający, który odmawia” i „generalista, który pisze”, z logo OrcaRouter nałożonym w rogu.
Guides & Insights

Intern-Decision-2B vs Gemma 4 12B: limit 8 192 tokenów wobec okna 256K

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Załóżmy, że rzeczą, którą trzeba ocenić, jest czterdziestostronicowa dokumentacja roszczenia ubezpieczeniowego. internlm/Intern-Decision-2B odrzuci go. Nie obetnie go, nie streści go — odrzuci go, ponieważ dołączony silnik wnioskowania deklaruje DecisionEngine(max_length=8192), a karta modelu mówi wprost, że zbyt duże dane wejściowe są „odrzucane bez obcinania”. google/gemma-4-12B-it — Gemma 4 12B Unified — weźmie ten sam dokument, plus zeskanowane zdjęcia przypięte do niego, plus nagraną rozmowę telefoniczną, i napisze ci odpowiedź. Ten kontrast to całe porównanie i prawie nie ma nic wspólnego z liczbami parametrów — 2,213,241,664 wobec 11,959,730,224 — które odczyt karty specyfikacji postawiłby na pierwszym miejscu.

Intern-Decision-2B to środkowy z trzech punktów kontrolnych decyzyjnych, które InternLM wgrał na Hugging Face 26 września 2026 r. bez zapowiedzi, dostrojony na bazie Qwen/Qwen3.5-2B i licencjonowany na Apache-2.0, z zachowanymi obok warunkami Qwen. Gemma 4 12B Unified to pozbawiony enkodera model multimodalny Google DeepMind z maja 2026 r., system typu any-to-any przyjmujący tekst, obraz, dźwięk i wideo oraz generujący tekst w oknie 256 000 tokenów w ponad 140 językach. Jeden z nich to model oceniający. Drugi to generalista, który przypadkiem potrafi oceniać słabo, jeśli starannie napiszesz mu prompt. Wybór między nimi to w mniejszym stopniu kwestia benchmarku, a w większym — pytanie o to, jaki kształt już ma twoja odpowiedź.

Tam, gdzie te dwa tak naprawdę nie są porównywalne

Warto powiedzieć to wprost, zanim przejdziemy do liczb, ponieważ to starcie sugeruje fałszywą symetrię.

Intern-Decision-2B nie generuje żadnych tokenów. Przyjmuje stan, od jednego do szesnastu nazwanych pytań, z maksymalnie 62 opcjami każde, oraz opcjonalnie do ośmiu obrazów; renderuje szkielet JSON asystenta z jednym symbolem zastępczym <decision> na pole; wykonuje pojedynczy przyczynowy przebieg w przód; odczytuje logity na pozycji bezpośrednio przed każdym symbolem zastępczym; wykonuje operację softmax tylko po dozwolonych symbolach danego pola; i stosuje dopasowaną temperaturę 2,100509348278. Wynikiem jest skalibrowany rozkład i argmax dla każdego pola. Karta wprost podaje zaprzeczenie: „To API wykonuje ustrukturyzowane ocenianie kandydatów. Nie wywołuje generate() ani nie próbkuje swobodnego tekstu.”

Gemma 4 12B generuje. Wszystko, co robi — rozumowanie z konfigurowalnym myśleniem, wywoływanie funkcji, OCR, rozumienie wykresów, rozpoznawanie mowy, obsługa 140 języków — działa przez pętlę dekodowania po słowniku o 262 144 wpisach. Poproś ją o decyzję routingu z prawdopodobieństwami, a otrzymasz tekst zawierający liczbę, a ta liczba będzie tym, co wygenerował sampler, a nie softmaxem po twoim zestawie opcji.

Zatem praktyczne pytanie nie brzmi: „które jest dokładniejsze”. Brzmi: „czy moja odpowiedź jest już zbiorem zamkniętym?”. Jeśli tak, 12B to marnotrawny sposób wybierania z listy. Jeśli nie, Intern-Decision-2B nie może ci w ogóle pomóc, niezależnie od dokładności.

Pułap wejściowy to najostrzejsza linia między nimi.

Oto wymiar, który należy rozważyć ponad wszystkie inne, ponieważ powoduje twarde awarie, a nie tylko pogorszenie działania.

• Długość wejścia — Intern-Decision-2B przyjmuje 8 192 tokeny i odrzuca wszystko dłuższe, i to głośno; Gemma 4 12B przyjmuje 256 000 tokenów, a na własnej karcie Google uzyskuje 43,4% w MRCR v2 eight-needle przy 128k.

• Obrazy — do ośmiu dla Intern-Decision-2B, i wliczają się w ten sam budżet 8,192 tokenów; zmienny współczynnik proporcji i rozdzielczość dla Gemma 4 12B, z przeplatanym tekstem i obrazem wejściowym w dowolnej kolejności.

• Modalności wejściowe — tekst i obraz w jednym przypadku; tekst, obraz, audio i wideo w drugim.

• Język — nigdzie w dokumentacji Intern-Decision nie pojawia się twierdzenie o wielojęzyczności; Gemma 4 obejmuje ponad 140 wstępnie wytrenowanych języków z oceną wielojęzyczną wynoszącą 83,4 w MMMLU dla wersji 12B.

• Dane wyjściowe — rozkład odpowiedzi w typowanym JSON-ie dla jednego; wygenerowany tekst dla drugiego.

Limit 8192 nie jest arbitralny i właśnie dlatego trudno go obejść. Cel decyzyjny odczytuje logit na stałej pozycji dla każdego pola, więc prompt musi zawierać stan, schemat i pełny szkielet w jednym przebiegu; nie ma takiej strategii dzielenia na fragmenty, która zachowywałaby kontrakt. Zgłoszenie, e-mail, krótki stan JSON, zrzut ekranu lub dwa — to jest centrum projektu. Dokument wymagający wyszukiwania to dokument, dla którego ten model nie jest przeznaczony.

Ile cię kosztuje każde z nich, uczciwie policzone

Intern-Decision-2B nie ma hostowanego endpointu ani dostawcy. Strona modelu w OrcaRouter zwraca 404, a nic w tym artykule nie stanowi twierdzenia o dostępności. Wywołanie go oznacza pobranie około 4,46 GB repozytorium — 3,76 GB sharda językowego, 612,5 MB wieży wizyjnej, 50,3 MB projektora — i uruchomienie inference.py obok wag w środowisku Python 3.12 z torch 2.9.1 i transformers 5.14.1, na GPU, za które płacisz niezależnie od tego, czy ocenia decyzje.

Nie w każdym przypadku jest to wadą, a warto to policzyć, zamiast zakładać. Przy średnio 33,28 ms na żądanie na pojedynczym RTX 4090, według własnego pomiaru InternLM, lokalnie hostowany Intern-Decision-2B nie nalicza żadnych opłat za decyzję. Hostowany generalista rozlicza się za token, w tym za tokeny, które zużywa na myślenie przed udzieleniem odpowiedzi. Przy dużej skali posiadany już scorer jest tańszym narzędziem — kosztem jest GPU i inżynieria, a nie wywołanie.

Gemma 4 12B Unified również nie ma w naszym katalogu; jeśli chcesz go mieć, pobierasz 11,96 miliarda parametrów BF16 i uruchamiasz go samodzielnie. Tam, gdzie nasz katalog rzeczywiście oferuje prawdziwe trasy Gemma 4, są to dwa pozostałe rozmiary i są tanie: Gemma 4 26B A4B za 0,06 USD za milion tokenów wejściowych i 0,33 USD za milion tokenów wyjściowych oraz Gemma 4 31B za 0,13 USD i 0,38 USD — oba wymienione z kontekstem 262 144 tokenów i P50 czasu do pierwszego tokenu, który katalog podaje na 1,73 sekundy. Jeśli twój problem okaże się ogólnym rozumowaniem, a nie decyzją w ramach zamkniętego zbioru, to właśnie to należy porównać z lokalnie uruchamianym scorerem — dwa kolejne modele na jednym kluczu, cena katalogowa dostawcy przekazywana bez narzutu oraz automatyczne przełączanie awaryjne, dzięki czemu model, który wciąż oceniasz, nigdy nie staje się pojedynczym punktem awarii w ścieżce produkcyjnej.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 input and $0.38 output per million tokens, and a P50 time to first token of 1.73 seconds.

Tablica wyników, z dołączonymi zastrzeżeniami

• Parametry — Intern-Decision-2B 2 213 241 664 w BF16 plus wieża wizyjna i projektor; Gemma 4 12B Unified 11 959 730 224 w BF16.

• Kontekst — 8 192 tokeny, odrzucone powyżej, wobec 256 000 tokenów.

• Wyjście — skalibrowane prawdopodobieństwa i argmax, bez tekstu; generowany tekst, po jednym tokenie naraz.

• Modalność — tekst plus do ośmiu obrazów w porównaniu z tekstem, obrazem, dźwiękiem i wideo na wejściu, tekst na wyjściu.

• Opublikowane dowody — tabela dostawcy dla siedmiu zestawów testów ze średnią 84,68, wynikiem Brier 0,437 i ECE 0,100, nieodtworzona przez nikogo poza laboratorium; karta ewaluacyjna Google z MMLU Pro 77,2%, GPQA Diamond 78,8%, AIME 2026 bez narzędzi 77,5% i LiveCodeBench v6 72,0, a także niezależny wpis w Artificial Analysis Intelligence Index na poziomie 14,2.

• Adopcja — jedno polubienie i zero pobrań w przypadku checkpointu 2B w porównaniu z rodziną, która jest w obiegu od maja, z kwantyzacjami, dostrojeniami i pochodnymi, których są setki.

Czytaj wiersze z dowodami asymetrycznie, bo właśnie takie są. Liczby Google zostały niezależnie zindeksowane i odtworzone przez strony trzecie; liczb InternLM nie uruchomił nikt spoza laboratorium, a zwłaszcza wartość kalibracyjną należy traktować jako dobrze udokumentowaną intencję, dopóki nie zetknie się z zagranicznym zbiorem testowym. Uczciwe podsumowanie nie brzmi: tabela dostawcy jest błędna. Brzmi: obie kolumny nie mają tej samej wagi dowodowej, a porównanie, które drukuje 84,68 obok 77,2, nie mówiąc o tym, wprowadza czytelnika w błąd.

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Gemma 4 12B'. The left column reads: Parameters 2.21B BF16 plus vision tower; Context 8,192 tokens, refused above; Output probabilities and an argmax, no text; Input text plus up to 8 images; Published evidence vendor table, unreproduced; Licence Apache 2.0 plus LICENSE-QWEN. The right column reads: Parameters 11.96B BF16; Context 256,000 tokens; Output generated text, token by token; Input text, image, audio and video; Published evidence Google card, AA Index 14.2; Licence Apache 2.0, Gemma 4 terms. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Gemma 4 12B figures come from Google's own card plus an independent Artificial Analysis index.

Co zrobić z tym

Wybierz Intern-Decision-2B, gdy decyzja jest naprawdę zamknięta, stan mieści się wygodnie w ośmiu tysiącach tokenów, chcesz prawdopodobieństwo, które możesz progować, a nie akapit, który musisz parsować, oraz masz sprzęt i apetyt, by obsługiwać checkpoint, którego nikt jeszcze nie wspiera. Właśnie środkowy rozmiar ma najsłabszą opublikowaną kalibrację spośród trzech wypuszczonych przez InternLM — ECE 0,100 wobec 0,066 dla modelu o połowę mniejszego i 0,065 dla tego niemal dwa razy większego — więc jeśli wybierasz w obrębie tej rodziny, 2B jest tym, na którym należy dopasować własną temperaturę, a nie tym, któremu można zaufać od razu po wyjęciu z pudełka.

Wybierz Gemma 4 12B — a bardziej praktycznie jeden z dwóch rozmiarów Gemma 4, które faktycznie routujemy — gdy dane wejściowe są dłuższe niż strona, gdy w grę wchodzi audio, wideo lub język inny niż angielski, gdy odpowiedź trzeba wyjaśnić, a nie tylko wybrać, albo gdy nie chcesz utrzymywać stosu wnioskowania. 12B to najmniejszy z modeli Gemma 4 z natywnym audio; 26B A4B aktywuje około czterech miliardów parametrów na token i jest najtańszym sposobem wejścia do rodziny.

A jeśli to, co faktycznie masz, to problem z punktacją z dołączonym długim dokumentem, żadne z tych narzędzi nie jest właściwym instrumentem: to problem z wyszukiwaniem przebrany w szaty artykułu porównawczego.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.