Ett genererat titelkort med texten ”Intern-Decision-2B vs Gemma 4 12B”, med undertexten ”8 192 tokens mot 256 000”, med märkena ”en poängsättare som vägrar” och ”en generalist som skriver”, med OrcaRouter-logotypen komponerad i hörnet.
Guides & Insights

Intern-Decision-2B vs Gemma 4 12B: Ett tak på 8 192 token mot ett fönster på 256K

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Anta att det du behöver få bedömt är en fyrtiosidig akt i ett försäkringsärende. internlm/Intern-Decision-2B kommer att avvisa den. Inte trunkera den, inte sammanfatta den – avvisa den, eftersom den medföljande inferensmotorn deklarerar DecisionEngine(max_length=8192) och modellkortet säger i klartext att för stora indata "avvisas utan trunkering". google/gemma-4-12B-it – Gemma 4 12B Unified – kommer att ta samma dokument, plus de skannade fotografierna som är häftade vid det, plus det inspelade telefonsamtalet, och skriva ett svar till dig. Den kontrasten är hela jämförelsen, och den har nästan ingenting att göra med parameterantalen – 2 213 241 664 mot 11 959 730 224 – som en läsning av specifikationsbladet skulle sätta först.

Intern-Decision-2B är den mellersta av tre beslutscheckpunkter som InternLM laddade upp till Hugging Face den 26 september 2026 utan tillkännagivande, finjusterad från Qwen/Qwen3.5-2B och licensierad under Apache-2.0 med Qwen-villkoren bevarade vid sidan om. Gemma 4 12B Unified är Google DeepMinds encoderfria multimodala modell från maj 2026, ett any-to-any-system som tar text, bild, ljud och video och genererar text över ett fönster på 256 000 tokens på över 140 språk. En av dessa är en scorer. Den andra är en generalist som råkar kunna scora dåligt om man promptar den noggrant. Att välja mellan dem är mindre en benchmarkfråga än en fråga om vilken form ditt svar redan har.

Där de två egentligen inte är jämförbara

Det är värt att vara rakt på sak om detta innan siffrorna, eftersom matchningen inbjuder till en falsk symmetri.

Intern-Decision-2B genererar inga tokens. Den tar ett tillstånd, en till sexton namngivna frågor med upp till 62 alternativ vardera, och valfritt upp till åtta bilder; renderar ett assistent-JSON-skelett med en <decision>-platshållare per fält; kör en enda kausal framåtpassning; läser logits vid positionen omedelbart före varje platshållare; softmaxar endast över det fältets tillåtna symboler; och tillämpar en anpassad temperatur på 2.100509348278. Utdata är en kalibrerad fördelning och ett argmax per fält. Kortet säger det negativa rakt ut: "Detta API utför strukturerad kandidatpoängsättning. Det anropar inte generate() eller samplar fritext."

Gemma 4 12B genererar. Allt den gör – resonemang med konfigurerbart tänkande, funktionsanrop, OCR, diagramförståelse, taligenkänning, stöd för 140 språk – körs genom en avkodningsloop över ett ordförråd med 262 144 poster. Be den om ett routingbeslut med sannolikheter och du får prosa som innehåller ett tal, och talet blir det som samplern producerade, inte en softmax över dina alternativ.

Så den praktiska frågan är inte ”vilken är mer exakt”. Den är ”är mitt svar redan en sluten mängd?” Om det är det, är 12B ett slösaktigt sätt att välja från en lista. Om det inte är det, kan Intern-Decision-2B inte hjälpa dig till någon noggrannhet alls.

Inmatningstaket är den skarpaste gränslinjen mellan dem

Här är den dimension som väger tyngst av alla, eftersom den orsakar hårda fel snarare än degraderade.

• Indatalängd – Intern-Decision-2B accepterar 8 192 token och avvisar allt längre, med besked; Gemma 4 12B accepterar 256 000 token och får, enligt Googles eget kort, 43,4 % på MRCR v2 eight-needle vid 128k.

• Bilder – upp till åtta för Intern-Decision-2B, och de räknas mot samma budget på 8 192 token; variabelt bildförhållande och upplösning för Gemma 4 12B, med interfolierade text- och bildindata i valfri ordning.

• Indatamodaliteter — text och bild för den ena; text, bild, ljud och video för den andra.

• Språk — inget flerspråkigt påstående görs någonstans i Intern-Decision-dokumentationen; Gemma 4 täcker 140+ förtränade språk med en utvärderad flerspråkig poäng på 83,4 på MMMLU för 12B.

• Utdata — en typad JSON-svarsfördelning för den ena; genererad text för den andra.

Gränsen på 8 192 är inte godtycklig, och det är just det som gör den svår att kringgå. Beslutsmålet läser en logit på en fast position per fält, så prompten måste innehålla tillståndet, schemat och hela skelettet i en enda omgång; det finns ingen chunkningsstrategi som bevarar kontraktet. En ticket, ett e-postmeddelande, ett kort JSON-tillstånd, en skärmbild eller två – det är designcentrumet. Ett dokument som kräver hämtning är ett dokument som den här modellen inte är till för.

Vad var och en kostar dig, ärligt räknat

Intern-Decision-2B har ingen hostad slutpunkt och ingen leverantör. OrcaRouters modellsida för den returnerar en 404, och inget i den här artikeln är ett påstående om tillgänglighet. Att anropa den innebär att ladda ner ungefär 4,46 GB av repositoryt — en språkdel på 3,76 GB, ett visionstorn på 612,5 MB, en projektor på 50,3 MB — och köra inference.py bredvid vikterna i en Python 3.12-miljö med torch 2.9.1 och transformers 5.14.1, på en GPU som du betalar för oavsett om den poängsätter beslut eller inte.

Det är inte en nackdel i alla lägen, och det är värt att räkna på saken i stället för att anta. Vid 33,28 ms i genomsnitt per begäran på ett enda RTX 4090, enligt InternLMs egen mätning, fakturerar en lokalt hostad Intern-Decision-2B ingenting per beslut. En hostad generalist tar betalt per token, inklusive för de tokens den lägger på att tänka innan den svarar. Vid stora volymer är en scorer du redan äger det billigare instrumentet – kostnaden är GPU:n och ingenjörsarbetet, inte anropet.

Gemma 4 12B Unified finns inte heller i vår katalog; om du vill ha den hämtar du 11,96 miljarder BF16-parametrar och kör den själv. Där vår katalog faktiskt har riktiga Gemma 4-vägar är de andra två storlekarna, och de är billiga: Gemma 4 26B A4B till 0,06 USD per miljon indatatoken och 0,33 USD per miljon utdatatoken, och Gemma 4 31B till 0,13 USD och 0,38 USD, båda listade med kontexter på 262 144 token och en P50-tid till första token som katalogen anger till 1,73 sekunder. Om det visar sig att ditt problem är generell resonemangsförmåga snarare än ett beslut i en sluten uppsättning, är det detta du bör jämföra med en lokalt körd scorer – ytterligare två modeller på en och samma nyckel, leverantörens listpris vidarebefordrat utan påslag och automatisk failover så att en modell som du fortfarande utvärderar aldrig blir en enda felpunkt i en produktionsväg.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 input and $0.38 output per million tokens, and a P50 time to first token of 1.73 seconds.

Resultattavla, med bifogade förbehåll

• Parametrar — Intern-Decision-2B 2 199 000 000 i BF16 plus ett {{1}}visionstorn{{/1}} och en projektor; Gemma 4 12B Unified 11 959 730 224 i BF16.

• Kontext — 8 192 tokens, avvisades ovan, mot 256 000 tokens.

• Utdata — kalibrerade sannolikheter och en argmax, ingen text; genererad text, en token i taget.

• Modalitet – text plus upp till åtta bilder jämfört med text, bild, ljud och video som indata, text som utdata.

• Publicerade bevis – en leverantörstabell med sju sviter med ett genomsnitt på 84,68, en Brier-poäng på 0,437 och ECE 0,100, som ingen utanför labbet har kunnat reproducera; ett utvärderingskort från Google med MMLU Pro 77,2 %, GPQA Diamond 78,8 %, AIME 2026 utan verktyg 77,5 % och LiveCodeBench v6 72,0, plus en oberoende listning med Artificial Analysis Intelligence Index på 14,2.

• Adoption – en gillamarkering och noll nedladdningar på 2B-checkpointen jämfört med en familj som har varit i omlopp sedan maj med kvantiseringar, finjusteringar och derivat som räknas i hundratal.

Läs bevisraderna asymmetriskt, för det är vad de är. Googles siffror har oberoende indexerats och reproducerats av tredje part; InternLMs har inte körts av någon utanför labbet, och särskilt kalibreringssiffran bör behandlas som en väldokumenterad avsikt tills den möter en extern testuppsättning. Den ärliga sammanfattningen är inte att leverantörens tabell är fel. Det är att de två kolumnerna inte bär samma bevisvärde, och en jämförelse som skriver ut 84,68 bredvid 77,2 utan att säga det vilseleder sin läsare.

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Gemma 4 12B'. The left column reads: Parameters 2.21B BF16 plus vision tower; Context 8,192 tokens, refused above; Output probabilities and an argmax, no text; Input text plus up to 8 images; Published evidence vendor table, unreproduced; Licence Apache 2.0 plus LICENSE-QWEN. The right column reads: Parameters 11.96B BF16; Context 256,000 tokens; Output generated text, token by token; Input text, image, audio and video; Published evidence Google card, AA Index 14.2; Licence Apache 2.0, Gemma 4 terms. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Gemma 4 12B figures come from Google's own card plus an independent Artificial Analysis index.

Vad ska man göra med detta

Välj Intern-Decision-2B när beslutet verkligen är avgjort, tillståndet ryms bekvämt inom åttatusen tokens, du vill ha en sannolikhet som du kan sätta ett tröskelvärde för i stället för ett stycke du måste tolka, och du har hårdvaran och aptiten att köra en checkpoint som ingen stöder ännu. Det är just mellanstorleken som har den svagaste publicerade kalibreringen av de tre som InternLM har släppt – ECE 0,100 mot 0,066 för modellen som är hälften så stor och 0,065 för den som är nästan dubbelt så stor – så om du väljer inom den här familjen är 2B den du bör anpassa din egen temperatur till, inte den du bör lita på direkt ur lådan.

Välj Gemma 4 12B – eller, mer praktiskt, en av de två Gemma 4-storlekar som vi faktiskt routar – när indata är längre än en sida, när det är fråga om ljud eller video eller ett annat språk än engelska, när svaret måste förklaras i stället för att bara väljas, eller när du inte vill äga inferensstacken. 12B är den minsta av Gemma 4-modellerna med inbyggt ljud; 26B A4B aktiverar omkring fyra miljarder parametrar per token och är det billigaste sättet in i familjen.

Och om det du faktiskt har är ett poängsättningsproblem med ett långt dokument bifogat, är ingen av dessa rätt instrument: det är ett sökproblem klätt i en jämförelseartikels kläder.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.