
Intern-Decision-2B vs Gemma 4 12B: Een 8.192-tokenplafond tegenover een 256K-venster
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 584 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 187 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Stel dat het ding dat je moet beoordelen een verzekeringsclaimdossier van veertig pagina's is. internlm/Intern-Decision-2B zal het weigeren. Niet afkappen, niet samenvatten — weigeren, omdat de meegeleverde inference-engine DecisionEngine(max_length=8192) declareert en de modelkaart in duidelijke taal zegt dat te grote inputs "zonder truncatie worden afgewezen." google/gemma-4-12B-it — Gemma 4 12B Unified — zal hetzelfde document nemen, plus de eraan vastgeniete gescande foto's, plus het opgenomen telefoongesprek, en je een antwoord schrijven. Dat contrast is de hele vergelijking, en het heeft bijna niets te maken met de parameteraantallen — 2.213.241.664 tegen 11.959.730.224 — die een specificatieblad-lezing voorop zou stellen.
Intern-Decision-2B is het middelste van drie beslissingscheckpoints die InternLM op 26 september 2026 zonder aankondiging naar Hugging Face uploadde, fine-tuned op basis van Qwen/Qwen3.5-2B en gelicentieerd onder Apache-2.0, waarbij de Qwen-voorwaarden daarnaast behouden bleven. Gemma 4 12B Unified is het encoderloze multimodale model van Google DeepMind uit mei 2026, een any-to-any-systeem dat tekst, beeld, audio en video aanneemt en tekst genereert binnen een venster van 256.000 tokens in meer dan 140 talen. Een van deze twee is een scorer. De andere is een generalist die toevallig slecht kan scoren als je hem zorgvuldig prompt. De keuze tussen deze twee is minder een benchmarkvraag dan een vraag over welke vorm je antwoord al heeft.
Waar de twee eigenlijk niet vergelijkbaar zijn
Het is de moeite waard hier ronduit over te zijn voordat de cijfers komen, want de confrontatie nodigt uit tot een valse symmetrie.
Intern-Decision-2B produceert geen tokens. Het neemt een toestand, één tot zestien benoemde vragen met elk maximaal 62 opties, en optioneel maximaal acht afbeeldingen; genereert een assistant-JSON-skelet met één <decision>-placeholder per veld; voert één causale forward pass uit; leest logits op de positie direct vóór elke placeholder; past softmax alleen toe over de legale symbolen van dat veld; en past een gefitte temperatuur van 2.100509348278 toe. De uitvoer is een gekalibreerde distributie en een argmax per veld. De kaart stelt het negatieve ronduit: "Deze API voert gestructureerde kandidaatscoring uit. Deze roept generate() niet aan en samplet geen vrije tekst."
Gemma 4 12B genereert. Alles wat het doet — redeneren met een configureerbare denkmodus, functieaanroepen, OCR, grafiekbegrip, spraakherkenning, ondersteuning voor 140 talen — verloopt via een decoderingslus over een vocabulaire van 262.144 entries. Vraag het om een routeringsbeslissing met waarschijnlijkheden en je krijgt proza met daarin een getal, en dat getal is wat de sampler heeft geproduceerd, niet een softmax over je optieset.
Dus de praktische vraag is niet "welke is nauwkeuriger." Het is "is mijn antwoord al een gesloten set?" Als dat zo is, is de 12B een verspillende manier om uit een lijst te kiezen. Als dat niet zo is, kan Intern-Decision-2B je bij geen enkele nauwkeurigheid helpen.
Het inputplafond is de scherpste grens tussen hen.
Dit is de dimensie die boven alle andere moet worden gewogen, omdat deze harde fouten veroorzaakt in plaats van gedegradeerde.
Invoerlengte — Intern-Decision-2B accepteert 8.192 tokens en weigert alles wat langer is, luidruchtig; Gemma 4 12B accepteert 256.000 tokens en scoort, op Googles eigen kaart, 43,4% op MRCR v2 eight-needle bij 128k.
• Afbeeldingen — maximaal acht voor Intern-Decision-2B, en ze tellen mee in hetzelfde budget van 8.192 tokens; variabele beeldverhouding en resolutie voor Gemma 4 12B, met afwisselende tekst- en afbeeldingsinvoer in willekeurige volgorde.
• Modaliteiten in — tekst en afbeelding voor de ene; tekst, afbeelding, audio en video voor de andere.
• Taal — in de Intern-Decision-documentatie wordt nergens een meertalige claim gedaan; Gemma 4 dekt 140+ vooraf getrainde talen met een geëvalueerde meertalige score van 83,4 op MMMLU voor de 12B.
• Uitvoer — een getypeerde JSON-antwoorddistributie voor de ene; gegenereerde tekst voor de andere.
De limiet van 8.192 is niet willekeurig, en dat is wat het moeilijk maakt om eromheen te werken. De beslissingsdoelstelling leest een logit op een vaste positie per veld, dus de prompt moet de toestand, het schema en het volledige skelet in één keer bevatten; er is geen chunkingstrategie die het contract behoudt. Een ticket, een e-mail, een korte JSON-toestand, een screenshot of twee — dat is het middelpunt van het ontwerp. Een document dat retrieval vereist, is een document waarvoor dit model niet bedoeld is.
Wat elk ervan je kost, eerlijk gerekend
Intern-Decision-2B heeft geen gehost endpoint en geen provider. De modelpagina van OrcaRouter ervoor geeft een 404, en niets in dit artikel is een bewering over beschikbaarheid. Het aanroepen ervan betekent ongeveer 4,46 GB aan repository downloaden — een taalshard van 3,76 GB, een vision tower van 612,5 MB, een projector van 50,3 MB — en inference.py naast de weights uitvoeren in een Python 3.12-omgeving met torch 2.9.1 en transformers 5.14.1, op een GPU die je betaalt, of die nu beslissingen scoort of niet.
Dat is niet in elk geval een nadeel, en het is de moeite waard de rekensom te maken in plaats van aan te nemen. Bij een gemiddelde van 33,28 ms per verzoek op één RTX 4090, in de eigen meting van InternLM, brengt een lokaal gehoste Intern-Decision-2B niets in rekening per beslissing. Een gehoste generalist rekent per token af, ook voor de tokens die hij besteedt aan nadenken voordat hij antwoordt. Op schaal is een scorer die je al bezit het goedkopere instrument — de kosten zijn de GPU en de engineering, niet de aanroep.
Gemma 4 12B Unified staat evenmin in onze catalogus; als u het wilt, haalt u 11,96 miljard BF16-parameters op en serveert u het zelf. Wat onze catalogus wél aan echte Gemma 4-routes heeft, zijn de andere twee groottes, en die zijn goedkoop: Gemma 4 26B A4B voor $0,06 per miljoen invoertokens en $0,33 per miljoen uitvoertokens, en Gemma 4 31B voor $0,13 en $0,38, beide vermeld met contexten van 262.144 tokens en een P50 time-to-first-token die de catalogus op 1,73 seconden toont. Als uw probleem algemeen redeneren blijkt te zijn in plaats van een beslissing binnen een gesloten set, is dat hetgeen u moet vergelijken met een lokaal uitgevoerde scorer — twee extra modellen op één sleutel, provider-lijstprijs doorberekend zonder opslag, en automatische failover zodat een model dat u nog aan het evalueren bent nooit een single point of failure wordt in een productiepad.

Scorebord, met de bijbehorende kanttekeningen.
• Parameters — Intern-Decision-2B 2.213.241.664 in BF16 plus een visiontoren en projector; Gemma 4 12B Unified 11.959.730.224 in BF16.
• Context — 8.192 tokens, hierboven geweigerd, tegenover 256.000 tokens.
• Uitvoer — gekalibreerde waarschijnlijkheden en een argmax, geen tekst; gegenereerde tekst, één token per keer.
• Modaliteit — tekst plus maximaal acht afbeeldingen versus tekst, afbeelding, audio en video in, tekst uit.
• Gepubliceerd bewijs — een leverancierstabel met zeven suites, met een gemiddelde van 84,68, een Brier-score van 0,437 en ECE 0,100, niet gereproduceerd door iemand buiten het lab; een Google-evaluatiekaart met MMLU Pro 77,2%, GPQA Diamond 78,8%, AIME 2026 zonder tools 77,5% en LiveCodeBench v6 72,0, plus een onafhankelijke vermelding met een Artificial Analysis Intelligence Index van 14,2.
• Adoptie — één like en nul downloads op het 2B-checkpoint, tegenover een familie die sinds mei in omloop is met kwantisaties, fine-tunes en derivaten die in de honderden lopen.
Lees de rijen met bewijs asymmetrisch, want dat zijn ze. De cijfers van Google zijn onafhankelijk geïndexeerd en gereproduceerd door derden; die van InternLM zijn door niemand buiten het lab uitgevoerd, en vooral het kalibratiecijfer moet als een goed gedocumenteerde intentie worden beschouwd totdat het een externe testset tegenkomt. De eerlijke samenvatting is niet dat de leverancierstabel onjuist is. Het is dat de twee kolommen niet dezelfde bewijskracht hebben, en een vergelijking die 84,68 naast 77,2 afdrukt zonder dat te vermelden, misleidt de lezer.

Wat te doen met dit
Kies Intern-Decision-2B wanneer de beslissing echt gesloten is, de toestand comfortabel binnen achtduizend tokens past, je een waarschijnlijkheid wilt waarop je een drempel kunt toepassen in plaats van een paragraaf die je moet ontleden, en je de hardware en de zin hebt om een checkpoint te draaien dat nog door niemand wordt ondersteund. De middelste maat heeft specifiek de zwakste gepubliceerde kalibratie van de drie die InternLM heeft uitgebracht — ECE 0,100 tegen 0,066 voor het model dat half zo groot is en 0,065 voor het model dat bijna twee keer zo groot is — dus als je binnen deze familie kiest, is de 2B degene waarop je je eigen temperatuur moet fitten, niet degene die je out of the box moet vertrouwen.
Kies Gemma 4 12B — of praktischer gezegd, een van de twee Gemma 4-formaten die we daadwerkelijk routeren — wanneer de invoer langer is dan een pagina, wanneer er audio of video of een andere taal dan Engels in het spel is, wanneer het antwoord moet worden uitgelegd in plaats van alleen gekozen, of wanneer je de inferentiestack niet zelf wilt beheren. De 12B is het kleinste van de Gemma 4-modellen met native audio; de 26B A4B activeert ongeveer vier miljard parameters per token en is de goedkoopste instap in de familie.
En als wat je eigenlijk hebt een scoringsprobleem met een lang document eraan vast is, dan is geen van beide het juiste instrument: dat is een retrievalprobleem in de kleren van een vergelijkingsartikel.

