
Intern-Decision-2B vs Gemma 4 12B: limit 8 192 tokenów wobec okna 256K
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 584 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 187 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Załóżmy, że rzeczą, którą trzeba ocenić, jest czterdziestostronicowa dokumentacja roszczenia ubezpieczeniowego. internlm/Intern-Decision-2B odrzuci go. Nie obetnie go, nie streści go — odrzuci go, ponieważ dołączony silnik wnioskowania deklaruje DecisionEngine(max_length=8192), a karta modelu mówi wprost, że zbyt duże dane wejściowe są „odrzucane bez obcinania”. google/gemma-4-12B-it — Gemma 4 12B Unified — weźmie ten sam dokument, plus zeskanowane zdjęcia przypięte do niego, plus nagraną rozmowę telefoniczną, i napisze ci odpowiedź. Ten kontrast to całe porównanie i prawie nie ma nic wspólnego z liczbami parametrów — 2,213,241,664 wobec 11,959,730,224 — które odczyt karty specyfikacji postawiłby na pierwszym miejscu.
Intern-Decision-2B to środkowy z trzech punktów kontrolnych decyzyjnych, które InternLM wgrał na Hugging Face 26 września 2026 r. bez zapowiedzi, dostrojony na bazie Qwen/Qwen3.5-2B i licencjonowany na Apache-2.0, z zachowanymi obok warunkami Qwen. Gemma 4 12B Unified to pozbawiony enkodera model multimodalny Google DeepMind z maja 2026 r., system typu any-to-any przyjmujący tekst, obraz, dźwięk i wideo oraz generujący tekst w oknie 256 000 tokenów w ponad 140 językach. Jeden z nich to model oceniający. Drugi to generalista, który przypadkiem potrafi oceniać słabo, jeśli starannie napiszesz mu prompt. Wybór między nimi to w mniejszym stopniu kwestia benchmarku, a w większym — pytanie o to, jaki kształt już ma twoja odpowiedź.
Tam, gdzie te dwa tak naprawdę nie są porównywalne
Warto powiedzieć to wprost, zanim przejdziemy do liczb, ponieważ to starcie sugeruje fałszywą symetrię.
Intern-Decision-2B nie generuje żadnych tokenów. Przyjmuje stan, od jednego do szesnastu nazwanych pytań, z maksymalnie 62 opcjami każde, oraz opcjonalnie do ośmiu obrazów; renderuje szkielet JSON asystenta z jednym symbolem zastępczym <decision> na pole; wykonuje pojedynczy przyczynowy przebieg w przód; odczytuje logity na pozycji bezpośrednio przed każdym symbolem zastępczym; wykonuje operację softmax tylko po dozwolonych symbolach danego pola; i stosuje dopasowaną temperaturę 2,100509348278. Wynikiem jest skalibrowany rozkład i argmax dla każdego pola. Karta wprost podaje zaprzeczenie: „To API wykonuje ustrukturyzowane ocenianie kandydatów. Nie wywołuje generate() ani nie próbkuje swobodnego tekstu.”
Gemma 4 12B generuje. Wszystko, co robi — rozumowanie z konfigurowalnym myśleniem, wywoływanie funkcji, OCR, rozumienie wykresów, rozpoznawanie mowy, obsługa 140 języków — działa przez pętlę dekodowania po słowniku o 262 144 wpisach. Poproś ją o decyzję routingu z prawdopodobieństwami, a otrzymasz tekst zawierający liczbę, a ta liczba będzie tym, co wygenerował sampler, a nie softmaxem po twoim zestawie opcji.
Zatem praktyczne pytanie nie brzmi: „które jest dokładniejsze”. Brzmi: „czy moja odpowiedź jest już zbiorem zamkniętym?”. Jeśli tak, 12B to marnotrawny sposób wybierania z listy. Jeśli nie, Intern-Decision-2B nie może ci w ogóle pomóc, niezależnie od dokładności.
Pułap wejściowy to najostrzejsza linia między nimi.
Oto wymiar, który należy rozważyć ponad wszystkie inne, ponieważ powoduje twarde awarie, a nie tylko pogorszenie działania.
• Długość wejścia — Intern-Decision-2B przyjmuje 8 192 tokeny i odrzuca wszystko dłuższe, i to głośno; Gemma 4 12B przyjmuje 256 000 tokenów, a na własnej karcie Google uzyskuje 43,4% w MRCR v2 eight-needle przy 128k.
• Obrazy — do ośmiu dla Intern-Decision-2B, i wliczają się w ten sam budżet 8,192 tokenów; zmienny współczynnik proporcji i rozdzielczość dla Gemma 4 12B, z przeplatanym tekstem i obrazem wejściowym w dowolnej kolejności.
• Modalności wejściowe — tekst i obraz w jednym przypadku; tekst, obraz, audio i wideo w drugim.
• Język — nigdzie w dokumentacji Intern-Decision nie pojawia się twierdzenie o wielojęzyczności; Gemma 4 obejmuje ponad 140 wstępnie wytrenowanych języków z oceną wielojęzyczną wynoszącą 83,4 w MMMLU dla wersji 12B.
• Dane wyjściowe — rozkład odpowiedzi w typowanym JSON-ie dla jednego; wygenerowany tekst dla drugiego.
Limit 8192 nie jest arbitralny i właśnie dlatego trudno go obejść. Cel decyzyjny odczytuje logit na stałej pozycji dla każdego pola, więc prompt musi zawierać stan, schemat i pełny szkielet w jednym przebiegu; nie ma takiej strategii dzielenia na fragmenty, która zachowywałaby kontrakt. Zgłoszenie, e-mail, krótki stan JSON, zrzut ekranu lub dwa — to jest centrum projektu. Dokument wymagający wyszukiwania to dokument, dla którego ten model nie jest przeznaczony.
Ile cię kosztuje każde z nich, uczciwie policzone
Intern-Decision-2B nie ma hostowanego endpointu ani dostawcy. Strona modelu w OrcaRouter zwraca 404, a nic w tym artykule nie stanowi twierdzenia o dostępności. Wywołanie go oznacza pobranie około 4,46 GB repozytorium — 3,76 GB sharda językowego, 612,5 MB wieży wizyjnej, 50,3 MB projektora — i uruchomienie inference.py obok wag w środowisku Python 3.12 z torch 2.9.1 i transformers 5.14.1, na GPU, za które płacisz niezależnie od tego, czy ocenia decyzje.
Nie w każdym przypadku jest to wadą, a warto to policzyć, zamiast zakładać. Przy średnio 33,28 ms na żądanie na pojedynczym RTX 4090, według własnego pomiaru InternLM, lokalnie hostowany Intern-Decision-2B nie nalicza żadnych opłat za decyzję. Hostowany generalista rozlicza się za token, w tym za tokeny, które zużywa na myślenie przed udzieleniem odpowiedzi. Przy dużej skali posiadany już scorer jest tańszym narzędziem — kosztem jest GPU i inżynieria, a nie wywołanie.
Gemma 4 12B Unified również nie ma w naszym katalogu; jeśli chcesz go mieć, pobierasz 11,96 miliarda parametrów BF16 i uruchamiasz go samodzielnie. Tam, gdzie nasz katalog rzeczywiście oferuje prawdziwe trasy Gemma 4, są to dwa pozostałe rozmiary i są tanie: Gemma 4 26B A4B za 0,06 USD za milion tokenów wejściowych i 0,33 USD za milion tokenów wyjściowych oraz Gemma 4 31B za 0,13 USD i 0,38 USD — oba wymienione z kontekstem 262 144 tokenów i P50 czasu do pierwszego tokenu, który katalog podaje na 1,73 sekundy. Jeśli twój problem okaże się ogólnym rozumowaniem, a nie decyzją w ramach zamkniętego zbioru, to właśnie to należy porównać z lokalnie uruchamianym scorerem — dwa kolejne modele na jednym kluczu, cena katalogowa dostawcy przekazywana bez narzutu oraz automatyczne przełączanie awaryjne, dzięki czemu model, który wciąż oceniasz, nigdy nie staje się pojedynczym punktem awarii w ścieżce produkcyjnej.

Tablica wyników, z dołączonymi zastrzeżeniami
• Parametry — Intern-Decision-2B 2 213 241 664 w BF16 plus wieża wizyjna i projektor; Gemma 4 12B Unified 11 959 730 224 w BF16.
• Kontekst — 8 192 tokeny, odrzucone powyżej, wobec 256 000 tokenów.
• Wyjście — skalibrowane prawdopodobieństwa i argmax, bez tekstu; generowany tekst, po jednym tokenie naraz.
• Modalność — tekst plus do ośmiu obrazów w porównaniu z tekstem, obrazem, dźwiękiem i wideo na wejściu, tekst na wyjściu.
• Opublikowane dowody — tabela dostawcy dla siedmiu zestawów testów ze średnią 84,68, wynikiem Brier 0,437 i ECE 0,100, nieodtworzona przez nikogo poza laboratorium; karta ewaluacyjna Google z MMLU Pro 77,2%, GPQA Diamond 78,8%, AIME 2026 bez narzędzi 77,5% i LiveCodeBench v6 72,0, a także niezależny wpis w Artificial Analysis Intelligence Index na poziomie 14,2.
• Adopcja — jedno polubienie i zero pobrań w przypadku checkpointu 2B w porównaniu z rodziną, która jest w obiegu od maja, z kwantyzacjami, dostrojeniami i pochodnymi, których są setki.
Czytaj wiersze z dowodami asymetrycznie, bo właśnie takie są. Liczby Google zostały niezależnie zindeksowane i odtworzone przez strony trzecie; liczb InternLM nie uruchomił nikt spoza laboratorium, a zwłaszcza wartość kalibracyjną należy traktować jako dobrze udokumentowaną intencję, dopóki nie zetknie się z zagranicznym zbiorem testowym. Uczciwe podsumowanie nie brzmi: tabela dostawcy jest błędna. Brzmi: obie kolumny nie mają tej samej wagi dowodowej, a porównanie, które drukuje 84,68 obok 77,2, nie mówiąc o tym, wprowadza czytelnika w błąd.

Co zrobić z tym
Wybierz Intern-Decision-2B, gdy decyzja jest naprawdę zamknięta, stan mieści się wygodnie w ośmiu tysiącach tokenów, chcesz prawdopodobieństwo, które możesz progować, a nie akapit, który musisz parsować, oraz masz sprzęt i apetyt, by obsługiwać checkpoint, którego nikt jeszcze nie wspiera. Właśnie środkowy rozmiar ma najsłabszą opublikowaną kalibrację spośród trzech wypuszczonych przez InternLM — ECE 0,100 wobec 0,066 dla modelu o połowę mniejszego i 0,065 dla tego niemal dwa razy większego — więc jeśli wybierasz w obrębie tej rodziny, 2B jest tym, na którym należy dopasować własną temperaturę, a nie tym, któremu można zaufać od razu po wyjęciu z pudełka.
Wybierz Gemma 4 12B — a bardziej praktycznie jeden z dwóch rozmiarów Gemma 4, które faktycznie routujemy — gdy dane wejściowe są dłuższe niż strona, gdy w grę wchodzi audio, wideo lub język inny niż angielski, gdy odpowiedź trzeba wyjaśnić, a nie tylko wybrać, albo gdy nie chcesz utrzymywać stosu wnioskowania. 12B to najmniejszy z modeli Gemma 4 z natywnym audio; 26B A4B aktywuje około czterech miliardów parametrów na token i jest najtańszym sposobem wejścia do rodziny.
A jeśli to, co faktycznie masz, to problem z punktacją z dołączonym długim dokumentem, żadne z tych narzędzi nie jest właściwym instrumentem: to problem z wyszukiwaniem przebrany w szaty artykułu porównawczego.

