Een gegenereerde titelkaart voor Microsoft-Decision-1 vs Gemma 4 12B met als ondertitel 'een scorer zonder outputtokens tegenover een schrijver zonder gesloten set', met chips met de labels waarschijnlijkheden versus proza, 32.768-tokencontext versus 256.000, alleen tekst versus tekst, afbeelding, audio en video, en gehoste API versus open gewichten.
Guides & Insights

Microsoft-Decision-1 vs Gemma 4 12B: De een kiest uit jouw lijst, de ander schrijft een nieuwe voor je.

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zet Microsoft-Decision-1 en Gemma 4 12B naast elkaar en het verschil dat alles bepaalt, is niet grootte, nauwkeurigheid of licentie — het is wat er gebeurt nadat het model je invoer heeft gelezen. Gemma 4 12B, het encoderloze multimodale model van DeepMind met 11,96 miljard parameters, uitgebracht op 3 juni 2026 onder Apache 2.0, leest tekst, afbeeldingen, audio of video en schrijft je vervolgens een antwoord, token voor token, over een contextvenster van 256.000 tokens en in meer dan 140 talen. Microsoft-Decision-1 werd algemeen beschikbaar op Microsoft Foundry op 8 oktober 2026 als een scorer voor uitsluitend tekst, post-getraind op Qwen3.5-9B: je geeft het een toestand en een vraag waarvan je de antwoorden al hebt opgesomd, en het retourneert een gekalibreerde waarschijnlijkheid voor elke optie in één enkele pass over maximaal 32.768 tokens, zonder iets te genereren. Het ene model vertelt je welke van je opties de juiste is. Het andere vertelt je wat de opties hadden moeten zijn — en factureert je voor elk woord daarvan.

Dit als een wedstrijd framen zou een categoriefout zijn, en het is de moeite waard om dat vóór de specificatieregels te zeggen in plaats van erna. Deze twee zijn geen vervangers van elkaar; ze bevinden zich aan tegenovergestelde uiteinden van een workflow. De nuttige vraag is welk uiteinde je daadwerkelijk aan het bouwen bent, want het antwoord bepaalt of je een beoordelaar of een schrijver koopt.

De rekening is waar het verschil ophoudt filosofisch te zijn

Gemma 4 12B wordt gefactureerd zoals elk generatief model: inputtokens en outputtokens, beide. Wanneer je het om gestructureerde JSON vraagt, wordt elk teken van die JSON gegenereerd, gesampeld en betaald — en hoe dieper je schema genest is, hoe langer het antwoord en hoe groter die kostenpost. Dat is geen defect van het model. Het is wat een decoder doet, en het is precies de kostenpost die besluitvormers moeten schrappen.

Microsoft-Decision-1 heeft geen uitvoerzijde om te factureren. Het voert één enkele forward pass uit over je toestand, je vraag en je optieset, leest een score voor elke kandidaat en retourneert. Het effect neemt toe met het volume, niet met de promptgrootte: een pipeline die tienduizend records labelt met Gemma 4 12B produceert tienduizend JSON-documenten, en dezelfde pipeline op een beslissingsscorer produceert tienduizend prompts en niets anders. Of de absolute besparing groot is, hangt volledig af van je volume en de vetheid van je schema, en iedereen met een budget per token kan het in een spreadsheet uitrekenen. De richting staat niet ter discussie.

Er is een tweede, kleinere asymmetrie: Microsoft vermeldt geen tarief op de modelpagina van Microsoft-Decision-1. De prijsstelling linkt door naar Microsofts eigen prijsomgeving, dus de kosten per beslissing lees je af van Azure en niet van de kaart. Wat de pagina wel vaststelt, is dat 0% van de aanroep uit outputtokens bestaat, en dat batch-inferentie is uitgeschakeld — je kunt een bulk-scoringsrun niet via een batchkanaal amortiseren zoals je dat bij een generatief model zou doen.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Gemma 4 12B. Left column Microsoft-Decision-1 rows read: parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; output probabilities with zero output tokens; modalities in text only; weights hosted, not distributed. Right column Gemma 4 12B rows read: parameters 11.96B encoder-free multimodal; context 256,000 tokens; output generated text billed per token; modalities in text, image, audio, video; weights Apache 2.0 and self-serve. A footer line reads that the Gemma 4 12B figures are Google-reported and Microsoft-Decision-1 has published no benchmark figures.

Dezelfde input, twee verschillende antwoorden

Geef beide modellen een klantenserviceticket en een vraag. Microsoft-Decision-1 retourneert iets als 0,83 voor "facturering", 0,11 voor "technisch", 0,04 voor "annulering", 0,02 voor "kan het niet zeggen". Je hebt een benoembaar label, een getal waartegen je een drempel kunt instellen, en een pad voor onthouding — Microsoft documenteert dat een optie in de trant van "kan het niet zeggen" wordt ondersteund wanneer het aangeleverde bewijs onvoldoende is, wat de escalatielogica laat werken. Wat je niet krijgt, is een reden.

Geef het ticket aan Gemma 4 12B en je krijgt een alinea. Het kan met configureerbaar denken over het verzoek redeneren, functies aanroepen, een gescande factuur lezen die aan het ticket is toegevoegd, de voicemail transcriberen die eraan is vastgemaakt, en antwoorden in de taal van de klant zelf. Elk daarvan is iets wat Decision-1 met geen enkele nauwkeurigheid kan: het invoeroppervlak is tekst en niets anders, en het is expliciet niet ontworpen voor open vraagbeantwoording, gesprek, vertaling of samenvatting.

Geen enkele output van Gemma 4 12B is een waarschijnlijkheid. Vraag het om een routeringsbeslissing met confidence en je krijgt proza met een getal erin, en dat getal is wat de sampler ook heeft geproduceerd, in plaats van een softmax over de optieset die je hebt aangeleverd. Als een downstreamdrempel ervan afhangt dat dat getal iets betekent, heb je een kalibratieproject in handen, geen scorer.

Of je vraag een gesloten set heeft, is de hele beslissing

Dit is de test die je vóór alles moet toepassen, en hij duurt ongeveer tien minuten met een whiteboard.

• Als je antwoord afkomstig is uit een lijst die je vooraf kunt opsommen — een label, een beoordeling, een ja/nee, een rubricscore, een route — dan is Microsoft-Decision-1 het juiste instrument, en Gemma 4 12B is een verspillende en minder betrouwbare manier om uit die lijst te kiezen. Je zou een decoder betalen om te gokken naar een getal dat je al hebt afgebakend.

• Als je antwoord geen gesloten verzameling is — vat dit samen, leg dat uit, schrijf het antwoord, beschrijf de grafiek — kan Microsoft-Decision-1 voor geen enkele prijs helpen. Het heeft geen pad naar proza, geen motiveringsveld en geen mechanisme om iets te produceren dat je niet als optie hebt opgesomd.

• Als het beide is, heb je een pijplijn met twee modellen in plaats van een keuze, en de interessante ontwerpvraag wordt welke van de twee de escalatiedrempel beheert. De scorer stelt die in; de schrijver vult in wat er boven en onder gebeurt.

Waar Gemma 4 12B simpelweg een andere sport is

Buiten het besluitvormingskader staat Gemma 4 12B niet vooraan in de rij — het speelt een ander spel, en doen alsof dat niet zo is, zou oneerlijk zijn.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.

• Modaliteiten — Microsoft-Decision-1 heeft alleen tekst als invoer en numerieke uitvoer. Gemma 4 12B verwerkt tekst, afbeeldingen, audio en video native via een encoder-vrij ontwerp dat ruwe patches en golfvormen rechtstreeks in de embeddingruimte projecteert, met verweven invoer in willekeurige volgorde.

• Context — 32.768 tokens voor Microsoft-Decision-1 tegenover 256.000 voor Gemma 4 12B, dat 43,4% scoort op MRCR v2 eight-needle bij 128k op de eigen kaart van Google.

• Taal — 25 ondersteunde talen voor Microsoft-Decision-1, waarbij Microsoft waarschuwt dat dekking, kwaliteit en kalibratie "per taal kunnen variëren" en niet-Engelstalige talen met weinig hulpbronnen als zwakke plek noemt; 140+ voor Gemma 4 12B, met een geëvalueerde MMMLU-score van 83,4 voor deze omvang.

• Gepubliceerde prestaties — het tabblad Benchmarks van Microsoft-Decision-1 bevat een methodologie en geen cijfers; Google heeft 77,2% MMLU Pro, 77,5% AIME 2026 zonder tools, 72,0% LiveCodeBench v6, 78,8% GPQA Diamond, 69,1% MMMU Pro en 79,7% MATH-Vision voor Gemma 4 12B.

• Distributie — Microsoft-Decision-1 is een alleen via Foundry gehoste API zonder gewichten, zonder download en zonder fine-tuningpad. Gemma 4 12B bestaat uit Apache 2.0-gewichten die op dag één al in een ecosysteem van LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang en Unsloth verschenen.

• Runtime — beslissingsscoring gebeurt in één enkele doorgang zonder decoderingslus, dus de latentie schaalt met de prompt in plaats van met de lengte van het antwoord; Gemma 4 12B genereert token voor token, en de introductiematerialen van Google plaatsen het op 16 GB VRAM of unified memory.

De benchmarkrij is degene waar het de moeite loont even bij stil te staan, in de richting die Microsoft het minst flatteert. De cijfers van Gemma 4 12B zijn ook door de leverancier opgegeven — maar daar zitten maanden van gebruik door derden achter, in openbare testharnassen, op hardware die anderen bezitten. Microsofts inzending in deze categorie is de nieuwste en de minst verifieerbare van de twee, ondanks dat die van het grotere bedrijf afkomstig is.

Wat elk je kost om daadwerkelijk te bellen

Gemma 4 12B staat in zijn 12B-vorm niet in onze catalogus — als dat het formaat is dat u wilt, haalt u 11,96 miljard BF16-parameters op en serveert u het zelf. Wat onze catalogus wél bevat, is de rest van de Gemma 4-lijn, en die is goedkoop: Gemma 4 26B A4B voor $0,06 per miljoen inputtokens en $0,33 per miljoen outputtokens, en Gemma 4 31B voor $0,13 en $0,38, beide vermeld met contexten van 262.144 tokens. Dat zijn leverancierslijstprijzen die worden doorgegeven zonder dat wij er een opslag aan toevoegen, achter één OpenAI-compatibele sleutel naast meer dan 200 andere modellen. Als uw probleem algemeen redeneren blijkt te zijn in plaats van een beslissing uit een gesloten set, is een van die twee formaten de goedkope optie om af te meten tegen een scorer die u zelf beheert — en als u zich liever niet aan één enkele writer vastlegt, houdt automatische failover het generatiegedeelte van een scoringslus in leven wanneer één provider degradeert.

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

Microsoft-Decision-1 is een Foundry-implementatie die u zelf inricht, en deze is niet via ons beschikbaar. Niets in dit artikel is een beschikbaarheidsclaim ervoor, aan geen van beide zijden van de aanroep.

Kortom

Microsoft-Decision-1 werd op 8 oktober 2026 algemeen beschikbaar op Microsoft Foundry: een alleen-tekstscorer met 32.768 tokens op een Qwen3.5-9B-basis die gekalibreerde waarschijnlijkheden retourneert over opties die je opsomt, met nul uitvoertokens, geen gewichten en geen gepubliceerde benchmarkcijfers. Gemma 4 12B is een encoderloze multimodale generalist met 11,96 miljard parameters, uitgebracht op 3 juni 2026 onder Apache 2.0, die redeneert, afbeeldingen en audio leest en antwoorden schrijft over 256.000 tokens. Kies op basis van de vorm van je antwoord, niet op basis van de parameteraantallen: een gesloten set hoort bij de scorer, een open set bij de schrijver, en een decoder betalen om te kiezen uit een lijst die je al hebt geschreven, is de meest voorkomende manier waarop teams tien keer zoveel uitgeven als een beslissing kost.

Wat onze catalogus wél bevat, is de rest van de Gemma 4-lijn, en die is voordelig: Gemma 4 26B A4B voor $0,06 per miljoen inputtokens en $0,33 per miljoen output, en Gemma 4 31B voor $0,13 en $0,38.