
Intern-Decision-0.8B vs Gemma 4 12B: Ett poängsättningshuvud mot en multimodal generalist
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 592 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 187 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Det billigaste sättet att se vad Intern-Decision-0.8B är – och vad det inte är – är att ställa den bredvid Gemma 4 12B och sedan lägga märke till att jämförelsen nästan helt handlar om vad varje modell gör med sitt utdatalager. Gemma 4 12B, DeepMinds encoderfria multimodala modell med 11,95 miljarder parametrar som släpptes den 3 juni 2026 under Apache 2.0, är en generativ generalist: du ger den text, bilder, ljud eller video, och den skriver ett svar. Intern-Decision-0.8B, som tyst laddades upp av InternLM till Hugging Face den 26 september 2026 utan tillkännagivande, är en finjustering av den mycket mindre Qwen3.5-0.8B som inte producerar någon text alls – den tar ett tillstånd, ett schema med namngivna frågor och upp till åtta bilder, och returnerar en kalibrerad sannolikhetsfördelning för varje fråga efter en enda forward-pass. Den ena skriver. Den andra poängsätter. Allt nedan följer av detta.
Det gör den här matchningen märklig att rama in som en tävling, och värt att säga rakt ut före specraderna: dessa två är inte utbytbara, och den som väljer mellan dem har redan formulerat problemet fel. Gemma 4 12B svarar på frågan "vad ska svaret vara". Intern-Decision-0.8B svarar på frågan "vilket av dessa sexton alternativ är det, och hur säker är du" – och svarar på det utan en avkodningsslinga, vilket är där skillnaderna i latens och kostnad kommer ifrån. Den användbara jämförelsen handlar därför om hur du skulle koppla in vardera i ett och samma arbetsflöde, inte om vilken som vinner.
Den enskilt största skillnaden är utdatasidan på räkningen
Gemma 4 12B debiteras som vilken generativ modell som helst: både indatatokens och utdatatokens. När du ber den om strukturerad JSON genereras, samplas och debiteras var och en av dessa tokens, och ju längre och mer nästlade ditt schema är, desto fler av dem finns det. Det är inte en kritik av modellen – det är vad en avkodare gör – men det är den radpost som beslutsheadar finns för att ta bort. Intern-Decision-0.8B har inga utdatatokens. Dess modellkort säger uttryckligen varför: inferensvägen anropar aldrig generate()/, läser logits vid positionerna omedelbart före varje <decision>/ platshållare i ett förrenderat skelett och tar en softmax över endast de tillåtna kandidatsymbolerna för det fältet. Användningsräknaren som kallas output_tokens/ räknar poängsatta fält, inte text.
Konsekvensen förstärks i skala. En pipeline som etiketterar tiotusen poster med Gemma 4 12B betalar för tiotusen JSON-dokument; samma pipeline på Intern-Decision-0.8B betalar för promptarna och inget annat. Om det absoluta antalet är stort beror helt och hållet på din volym och ditt schema, och den som har en budget per token kan räkna ut det i ett kalkylblad på tio minuter. Men riktningen är inte omtvistad, och det är anledningen till att en kategori av små beslutsmodeller överhuvudtaget har uppstått.
Latens, och varför parameterklyftan är missvisande
• Genomströmningsmodell — Intern-Decision-0.8B: ett framåtpass, ingen avkodningsloop. Gemma 4 12B: autoregressiv generering, en token i taget.
• Uppmätt latens – Intern-Decision-0.8B: 33,98 ms medelvärde / 37,50 ms p95 på ett enda RTX 4090 via den lokala Hugging Face-vägen, enligt InternLM:s egen mätning. Gemma 4 12B: det finns ingen jämförbar siffra för ett enskilt pass, eftersom det inte finns något enskilt pass att mäta.
• Fotavtryck — Intern-Decision-0.8B: cirka 1,73 GB lagringsutrymme i repositoriet, 852 985 920 parametrar fördelade över en språkdel på 1,50 GB, en visionsdel på 176 MB och en projektor på 25 MB. Gemma 4 12B: Googles lanseringsmaterial anger 16 GB VRAM eller enhetligt minne.
• Determinism i utdata – Intern-Decision-0.8B: argmax över kandidatlogits, så samma indata ger samma etikett varje gång. Gemma 4 12B: sampling om du inte låser temperaturen till noll, och även då kommer etiketten som text som du måste tolka.
Parametergapet på 14x mellan dessa två modeller översätts inte till något som liknar ett 14x körtidsgap på en beslutsuppgift, eftersom arbetet är av en annan art. Intern-Decision-0.8B lägger sitt enda pass på att läsa prompten – tillståndet, schemat, alternativbeskrivningarna – och stannar sedan. Gemma 4 12B lägger samma promptläsning och adderar sedan varje token i svaret ovanpå. För ett schema med sexton fält och beskrivande alternativetiketter är genereringsetappen inte ett avrundningsfel; det utgör större delen av väggklockstiden. InternLMs egen tabell understryker poängen av misstag: dess 2B-syskon uppvisar ett medelvärde på 33,28 ms, marginellt snabbare än 0.8B:ans 33,98 ms. När promptbearbetningen dominerar slutar antalet parametrar att vara hävstången. img src="2.png">

Där Gemma 4 12B helt enkelt är i en annan kategori
Det vore ohederligt att låta specifikationsbladet stanna vid beslutsuppgiftsinramningen, för utanför den inramningen är Gemma 4 12B inte bara före — den spelar en annan sport.
Intern-Decision-0.8B tar emot text plus upp till åtta bilder, och det är hela dess ingångsyta. Dess standardtak för indata är 8 192 tokens, som avvisas i stället för att trunkeras, vilket ligger väl under den maximala positionsinbäddning på 262 144 som dess konfiguration anger – taket, inte arkitekturen, är det praktiska fönstret. Gemma 4 12B tar nativt emot text, bild, ljud och video genom en design utan encoder som projicerar råa patchar och vågformer direkt in i inbäddningsrymden, har ett kontextfönster på 256K och returnerar text. Googles publicerade kort ger den 77,2 % på MMLU Pro, 77,5 % på AIME 2026 utan verktyg, 72,0 % på LiveCodeBench v6, 78,8 % på GPQA Diamond, 69,1 % på MMMU Pro och 79,7 % på MATH-Vision. Detta är leverantörssiffror från Googles eget utvärderingskort, och till skillnad från tabellen för Intern-Decision-0.8B har de ett års tredjepartsanvändning bakom sig, eftersom Gemma 4 släpptes in i ett ekosystem – LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, Unsloth – från dag ett.
Släppen ser inte heller alls likadana ut, och kontrasten är lärorik. Gemma 4 12B hade en lanseringsblogg, en teknisk rapport på arXiv, en familjesida för fem modeller, ett utvärderingskort och en nedladdningslänk samma dag som den dök upp. Intern-Decision-0.8B hade ett modellkort med en GitHub-URL som returnerar 404 och en demo-Space som returnerar 401, och den dök upp inom fyrtio sekunder från två större syskon som är lika odokumenterade. Ett av dessa är en produkt. Det andra är en checkpoint som någon bestämde sig för att lägga ut på internet.
Båda är Apache 2.0, och det är inte en trivial gemensam rad
Den enda dimensionen där de två verkligen möts är licensiering, och det är värt ett stycke eftersom det är där beslutet förändras för kommersiella användare. Båda är Apache 2.0. Gemma 4 12B levereras under Gemma 4-licensvillkoren som finns hos Google, vilka modellkortet identifierar som Apache 2.0; Intern-Decision-0.8B har Apache-2.0 vid sidan av en andra LICENSE-QWEN/ fil, vilket är korrekt hantering för en modell som härstammar från Qwen-vikter och en signal om att InternLM skötte pappersarbetet även för en utgåva som de inte tillkännagav.
Det skiljer båda från Liquid AI:s LFM2.5-familj, vars LFM Open License v1.0 villkorar kommersiella rättigheter med att din juridiska person håller sig under en årlig intäktströskel på 10 miljoner dollar – en verklig begränsning som en köpare av beslutsmodeller som jämför alternativ bör läsa innan man antar att ”öppna vikter” betyder samma sak överallt. Om ditt användningsfall är kommersiellt och dina intäkter passerar den gränsen är Apache 2.0 och LFM-licensen inte utbytbara mot varandra, och varken Gemma 4 12B eller Intern-Decision-0.8B har den begränsningen.
Den ärliga redovisningen av Intern-Decision-0.8B:s siffror
Alla prestandasiffror för Intern-Decision-0.8B är leverantörsrapporterade och ej reproducerade. Det är inte en formalitet – det är det nuvarande evidensläget, och det bör styra hur mycket vikt tabellen tillmäts. InternLM valde ut benchmarks, valde ut konkurrenterna, körde utvärderingarna och publicerade resultaten, och det finns ingen oberoende körning på någon offentlig leaderboard. En sökning på Artificial Analysis för modellen ger inte något alls. img src="3.png">

Med den etiketten fäst är formen på resultatet fortfarande informativ. 0.8B-modellen får 77,35 på TypeSafes Typed Decision-benchmark mot 73,35 för Jev 1.13 – modellen som benchmarken är uppkallad efter – och 94,52 på ToolACE mot 91,29. Den ligger i genomsnitt på 79,38 över hela sviten, med sina egna 2B- och 4B-syskon på 84,68 och 90,02. Kolumnen som borde få en köpare att tveka är WildJailBreak, där den får 64,48 mot Jevs 96,29: ett gap i vägransrobusthet av den storleken är en egenskap hos finjusteringen, och det dokumenteras ingenstans huruvida det kommer från Qwen3.5-0.8B-basen, målet för beslutsfinjusteringen eller parameterantalet. Dess kalibreringsprofil är den mer intressanta läsningen – en Brier på 0,530 och ett förväntat kalibreringsfel på 0,066, mot Jevs 0,358 och 0,095 – vilket innebär att den är mindre noggrann totalt sett, men att dess angivna konfidenser följer dess noggrannhet närmare. För ett tröskelbaserat arbetsflöde spelar den distinktionen större roll än rå noggrannhet, och det är den typen av sak som InternLM inte hade något incitament att publicera.
Å andra sidan är Gemma 4 12B:s utvärderingskort också leverantörsrapporterat – Google körde också de benchmarkarna – men det har funnits ute sedan juni, har distribuerats via alla större lokala runtime-miljöer, och en eventuell avvikelse skulle ha kommit fram. Bevisgapet mellan ”icke reproducerad i en vecka” och ”icke reproducerad i fyra månader och ingen har motsagt det” är den verkliga skillnaden mellan dessa två kolumner.
Hur du faktiskt skulle kombinera dem
Det mönster som är vettigt är inte ett val. Ett beslutshuvud hanterar de strukturerade anropen – routing, triage, klassificering, poängsättning mot en rubric – där svarsmängden är sluten, latens spelar roll och utdatatokens är ren overhead. En generalist hanterar allt som kräver prosa, kod, syntes eller lång kontext: escalationssammanfattningen, förklaringen till varför ärendet gick till fakturering, utkastet som en människa redigerar.
Om du försöker lista ut var gränsen går, är det billigaste experimentet att lägga båda halvorna bakom en och samma endpoint. OrcaRouter dirigerar 200+ modeller genom ett enda OpenAI-kompatibelt API med automatisk failover och leverantörens listpris som förs vidare utan påslag, vilket innebär att testa en hostad beslutsmodell och en hostad generalist i samma skript kostar en nyckel och en eftermiddag. Det är värt att vara precis om en gräns här: Intern-Decision-0.8B är inte en av våra — det är en Apache-2.0-checkpoint som du laddar ner och kör själv, och hela anledningen till att välja en modell på 1,73 GB är att den ligger där dina data redan finns. Den generativa halvan av mönstret är den del som är en rad bort. När det gäller Gemma 4 12B specifikt finns den inte i vår katalog heller; de Gemma 4-storlekar som vi faktiskt dirigerar är 31B och 26B A4B, och 12B är en lokal nedladdning. img src="4.png">

Domen är alltså inte en vinnare. Intern-Decision-0.8B är ett billigt, snabbt, deterministiskt scoring-huvud från ett labb som ännu inte har förklarat det, med en benchmark-tabell som ingen har reproducerat och en kolumn för vägransrobusthet som bör testas innan den kommer i närheten av obetroget indata. Gemma 4 12B är en mogen multimodal generalist med öppna vikter, ett publicerat modellkort, en teknisk rapport och fjorton gånger så många parametrar, och den är fel verktyg för ett klassificeringsanrop med sexton fält – inte för att den är sämre, utan för att generera ett svar på en fråga vars svarsmängd du redan har skrivit ned är ett dyrt sätt att få en etikett.
