
Intern-Decision-0.8B vs Gemma 4 12B: Een scoring-head tegen een multimodale generalist
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 592 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 187 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
De goedkoopste manier om te zien wat Intern-Decision-0.8B is — en wat het niet is — is om het naast Gemma 4 12B te leggen, en dan te merken dat de vergelijking bijna volledig gaat over wat elk model doet met zijn outputlaag. Gemma 4 12B, DeepMinds encoder-vrije multimodale model met 11,95 miljard parameters dat op 3 juni 2026 onder Apache 2.0 werd uitgebracht, is een generatieve generalist: je geeft het tekst, afbeeldingen, audio of video, en het schrijft een antwoord. Intern-Decision-0.8B, dat op 26 september 2026 stilletjes door InternLM op Hugging Face werd geüpload zonder aankondiging, is een fine-tune van het veel kleinere Qwen3.5-0.8B dat helemaal geen tekst produceert — het neemt een toestand, een schema van benoemde vragen en maximaal acht afbeeldingen, en retourneert na één forward pass een gekalibreerde kansverdeling voor elke vraag. De een schrijft. De ander scoort. Alles hieronder volgt daaruit.
Dat maakt dit een vreemde confrontatie om als een wedstrijd te presenteren, en het is goed om het ronduit te zeggen vóór de specificatierijen: deze twee zijn geen vervangers van elkaar, en wie tussen hen kiest, heeft het probleem al verkeerd geformuleerd. Gemma 4 12B beantwoordt de vraag "wat moet het antwoord zijn." Intern-Decision-0.8B beantwoordt de vraag "welke van deze zestien opties is het, en hoe zeker ben je" — en beantwoordt die zonder decoderlus, en daar komen de verschillen in latentie en kosten vandaan. De nuttige vergelijking gaat daarom over hoe je elk in één workflow zou inpassen, niet over welke wint.
Het allergrootste verschil is de outputzijde van de factuur.
Gemma 4 12B wordt gefactureerd zoals elk generatief model: zowel inputtokens als outputtokens. Wanneer je er gestructureerde JSON van vraagt, wordt elk van die tokens gegenereerd, gesampled en gefactureerd, en hoe langer en dieper genest je schema is, hoe meer tokens er zijn. Dat is geen kritiek op het model — het is wat een decoder doet — maar het is de factuurregel die decision heads moeten wegnemen. Intern-Decision-0.8B heeft geen outputtokens. De modelkaart ervan legt expliciet uit waarom: het inferentiepad roept nooit generate(), en leest logits op de posities direct vóór elke <decision> placeholder in een vooraf gerenderd skelet en neemt een softmax over alleen de toegestane kandidaatsymbolen voor dat veld. De teller voor het gebruik, genaamd output_tokens telt gescoorde velden, geen tekst.
Het gevolg versterkt zich op schaal. Een pipeline die tienduizend records labelt met Gemma 4 12B betaalt voor tienduizend JSON-documenten; dezelfde pipeline op Intern-Decision-0.8B betaalt voor de prompts en verder niets. Of het absolute aantal groot is, hangt volledig af van je volume en schema, en iedereen met een budget per token kan het in tien minuten in een spreadsheet uitrekenen. Maar de richting staat niet ter discussie, en dat is de reden dat er überhaupt een categorie kleine beslissingsmodellen is ontstaan.
Latentie, en waarom de parameterkloof misleidend is
• Throughput-model — Intern-Decision-0.8B: één forward pass, geen decoderingslus. Gemma 4 12B: autoregressieve generatie, telkens één token.
Gemeten latentie — Intern-Decision-0.8B: 33,98 ms gemiddeld / 37,50 ms p95 op een enkele RTX 4090 via de lokale Hugging Face-route, volgens de eigen meting van InternLM. Gemma 4 12B: er bestaat geen vergelijkbaar cijfer voor één enkele doorgang, omdat er geen enkele doorgang is om te meten.
• Voetafdruk — Intern-Decision-0.8B: ongeveer 1,73 GB aan repositoryopslag, 852.985.920 parameters verdeeld over een taalshard van 1,50 GB, een visionshard van 176 MB en een projector van 25 MB. Gemma 4 12B: in het lanceringsmateriaal van Google wordt het gesteld op 16 GB VRAM of unified memory.
• Determinisme van de uitvoer — Intern-Decision-0.8B: argmax over de logits van de kandidaten, dus dezelfde invoer levert elke keer hetzelfde label op. Gemma 4 12B: sampling, tenzij je de temperatuur op nul vastzet, en zelfs dan komt het label aan als tekst die je moet parsen.
Het parameter-verschil van 14x tussen deze twee modellen vertaalt zich niet in iets als een 14x runtime-verschil bij een beslissingstaak, omdat het werk wezenlijk anders is. Intern-Decision-0.8B besteedt zijn ene pass aan het lezen van de prompt — de status, het schema, de beschrijvingen van de opties — en stopt dan. Gemma 4 12B besteedt diezelfde prompt-lezing en voegt daar vervolgens elk token van het antwoord bovenop toe. Voor een schema met zestien velden en beschrijvende optielabels is het generatiegedeelte geen afrondingsfout; het vormt het grootste deel van de kloktijd. De eigen tabel van InternLM maakt het punt per ongeluk: het 2B-broertje noteert een gemiddelde van 33,28 ms, marginaal sneller dan de 33,98 ms van de 0,8B. Wanneer de promptverwerking domineert, is het aantal parameters niet langer de hefboom. img src="2.png">

Waar Gemma 4 12B gewoon in een andere categorie zit
Het zou oneerlijk zijn om het specificatieblad bij de beslissingstaak-framing te laten, want buiten die framing is Gemma 4 12B niet alleen voorop — het speelt een andere sport.
Intern-Decision-0.8B accepteert tekst plus maximaal acht afbeeldingen, en dat is het volledige invoeroppervlak. De standaard invoerlimiet is 8.192 tokens, die worden geweigerd in plaats van afgekapt, wat ruim onder de 262.144 maximale positie-embedding ligt die de configuratie vermeldt — de limiet, niet de architectuur, is het praktische venster. Gemma 4 12B verwerkt tekst, afbeelding, audio en video native via een encoderloos ontwerp dat ruwe patches en golfvormen rechtstreeks in de embeddingruimte projecteert, heeft een contextvenster van 256K en geeft tekst terug. Op de gepubliceerde modelkaart van Google behaalt het 77,2% op MMLU Pro, 77,5% op AIME 2026 zonder tools, 72,0% op LiveCodeBench v6, 78,8% op GPQA Diamond, 69,1% op MMMU Pro en 79,7% op MATH-Vision. Dat zijn leverancierscijfers van de eigen evaluatiekaart van Google, en anders dan de tabel van Intern-Decision-0.8B hebben ze een jaar van gebruik door derden achter zich, omdat Gemma 4 op dag één in een ecosysteem verscheen — LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, Unsloth.
De releases lijken ook in niets op elkaar, en het contrast is leerzaam. Gemma 4 12B had op de dag dat het verscheen een lanceringsblog, een technisch rapport op arXiv, een familiepagina voor vijf modellen, een evaluatiekaart en een downloadlink. Intern-Decision-0.8B had een modelkaart met een GitHub-URL die 404 retourneert en een demo-Space die 401 retourneert, en het verscheen binnen veertig seconden van twee grotere modellen uit dezelfde familie die eveneens ongedocumenteerd zijn. Een van deze is een product. De andere is een checkpoint dat iemand besloot op het internet te zetten.
Beide zijn Apache 2.0, en dat is geen triviale gedeelde rij.
De enige dimensie waarop de twee elkaar echt ontmoeten, is licentiëring, en dat is een paragraaf waard, want dit is waar de beslissing voor commerciële gebruikers verandert. Beide zijn Apache 2.0. Gemma 4 12B wordt geleverd onder de Gemma 4-licentievoorwaarden die bij Google worden gehost, die de modelkaart als Apache 2.0 aanmerkt; Intern-Decision-0.8B draagt Apache-2.0 naast een tweede LICENSE-QWEN/-bestand, wat de correcte behandeling is voor een model dat is afgeleid van Qwen-gewichten en een signaal dat InternLM het papierwerk heeft gedaan, zelfs voor een release die het niet heeft aangekondigd.
Dat onderscheidt beide van de LFM2.5-familie van Liquid AI, waarvan de LFM Open License v1.0 de commerciële rechten afhankelijk stelt van het feit dat uw juridische entiteit onder een jaarlijkse omzetdrempel van $10 miljoen blijft — een echte beperking die een koper van beslissingsmodellen die opties vergelijkt zou moeten lezen voordat hij aanneemt dat "open weights" overal hetzelfde betekent. Als uw gebruiksscenario commercieel is en uw omzet die grens overschrijdt, zijn Apache 2.0 en de LFM-licentie niet uitwisselbaar, en noch Gemma 4 12B noch Intern-Decision-0.8B heeft die beperking.
Het eerlijke grootboek over de cijfers van Intern-Decision-0.8B
Elke prestatie-indicator voor Intern-Decision-0.8B is door de leverancier opgegeven en niet gereproduceerd. Dat is geen formaliteit — het is de huidige stand van het bewijs, en het zou moeten bepalen hoeveel gewicht de tabel krijgt. InternLM koos de benchmarks, koos de concurrenten, voerde de evaluaties uit en publiceerde de resultaten, en er bestaat geen enkele onafhankelijke run op welk publiek leaderboard dan ook. Een zoekopdracht bij Artificial Analysis voor het model levert helemaal niets op. img src="3.png">

Met dat label eraan is de vorm van het resultaat nog steeds informatief. De 0.8B scoort 77,35 op TypeSafe's Typed Decision-benchmark tegenover 73,35 voor Jev 1.13 — het model waarnaar de benchmark is vernoemd — en 94,52 op ToolACE tegenover 91,29. Het gemiddelde over de suite is 79,38, met zijn eigen 2B- en 4B-siblings op 84,68 en 90,02. De kolom die een koper aan het denken zou moeten zetten, is WildJailBreak, waar het 64,48 scoort tegenover Jev's 96,29: een verschil in weigeringsrobuustheid van die omvang is een eigenschap van de fine-tune, en of het voortkomt uit de Qwen3.5-0.8B-basis, de decision-tuning-doelstelling of het aantal parameters, staat nergens gedocumenteerd. Zijn kalibratieprofiel is het interessantere om te lezen — een Brier van 0,530 en een verwachte kalibratiefout van 0,066, tegenover Jev's 0,358 en 0,095 — wat betekent dat het overall minder accuraat is, maar dat zijn opgegeven confidencewaarden zijn accuraatheid nauwer volgen. Voor een op drempels gebaseerde workflow is dat onderscheid belangrijker dan ruwe accuraatheid, en het is precies het soort ding dat InternLM geen enkele stimulans had om te publiceren.
Daartegenover staat dat de evaluatiekaart van Gemma 4 12B ook door de leverancier is gerapporteerd — Google heeft die benchmarks ook uitgevoerd — maar die bestaat sinds juni, is via elke belangrijke lokale runtime uitgerold, en elke discrepantie zou aan het licht zijn gekomen. Het gat in bewijskracht tussen "een week lang niet gereproduceerd" en "vier maanden niet gereproduceerd en niemand heeft het tegengesproken" is het werkelijke verschil tussen deze twee kolommen.
Hoe je ze daadwerkelijk zou combineren
Het patroon dat logisch is, is geen keuze. Een decision head behandelt de gestructureerde aanroepen — routering, triage, classificatie, scoren aan de hand van een rubric — waarbij de antwoordset gesloten is, latentie belangrijk is en outputtokens pure overhead zijn. Een generalist behandelt alles wat proza, code, synthese of een lange context vereist: de escalatiesamenvatting, de uitleg waarom het ticket naar billing ging, het concept dat een mens bewerkt.
Als je wilt uitzoeken waar de grens ligt, is het goedkoopste experiment beide helften achter één endpoint te zetten. OrcaRouter routeert 200+ modellen via één OpenAI-compatibele API, met automatische failover en de lijstprijs van de provider doorgegeven zonder opslag, wat betekent dat het testen van een gehost beslissingsmodel en een gehoste generalist in hetzelfde script één sleutel en één middag kost. Het is de moeite waard om hier precies te zijn over één grens: Intern-Decision-0.8B is niet een van onze modellen — het is een Apache-2.0-checkpoint die je zelf downloadt en draait, en de hele reden om een model van 1,73 GB te kiezen, is dat het zich bevindt waar je data al staan. De generatieve helft van het patroon is het deel dat nog maar één regel verwijderd is. Wat Gemma 4 12B specifiek betreft, die staat ook niet in onze catalogus; de Gemma 4-formaten die wij wel routeren zijn 31B en 26B A4B, en de 12B is een lokale download. img src="4.png">

Het oordeel is dan ook geen winnaar. Intern-Decision-0.8B is een goedkope, snelle, deterministische scoring-head van een lab dat er nog geen uitleg over heeft gegeven, met een benchmarktabel die niemand heeft gereproduceerd en een kolom voor weigeringsrobuustheid die getest zou moeten worden voordat hij in de buurt van niet-vertrouwde input komt. Gemma 4 12B is een volwassen open-weights multimodale generalist met een gepubliceerde modelkaart, een technisch rapport en veertien keer zoveel parameters, en het is het verkeerde hulpmiddel voor een classificatieaanroep met zestien velden — niet omdat het slechter is, maar omdat het genereren van een antwoord op een vraag waarvan je de antwoordset al hebt opgeschreven een dure manier is om een label te krijgen.
