Ett genererat titelkort för Microsoft-Decision-1 mot Gemma 4 12B med undertexten "en scorer utan utdatatokens mot en skribent utan sluten mängd", med chips som anger sannolikheter kontra prosa, kontext på 32 768 tokens kontra 256 000, endast text kontra text, bild, ljud och video, och hostat API kontra öppna vikter.
Guides & Insights

Microsoft-Decision-1 vs Gemma 4 12B: Den ena väljer från din lista, den andra skriver en ny åt dig

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ställ Microsoft-Decision-1 och Gemma 4 12B sida vid sida och skillnaden som avgör allt är inte storlek, träffsäkerhet eller licens — det är vad som händer efter att modellen har läst din indata. Gemma 4 12B, DeepMinds encodernfria multimodala modell med 11,96 miljarder parametrar som släpptes den 3 juni 2026 under Apache 2.0, läser text, bilder, ljud eller video och skriver sedan ett svar till dig, token för token, över ett fönster på 256 000 token och fler än 140 språk. Microsoft-Decision-1 blev allmänt tillgänglig på Microsoft Foundry den 8 oktober 2026 som en poängsättare för enbart text, eftertränad på Qwen3.5-9B: du ger den ett tillstånd och en fråga vars svar du redan har räknat upp, och den returnerar en kalibrerad sannolikhet för varje alternativ i en enda genomkörning över upp till 32 768 token, utan att generera något. Den ena modellen säger vilket av dina alternativ som är rätt. Den andra säger vad alternativen borde ha varit — och fakturerar dig för varje ord av det.

Att rama in detta som en tävling vore ett kategorimisstag, och det är värt att säga det före spec-raderna snarare än efter dem. Dessa två är inte utbytbara; de befinner sig i varsin ände av ett arbetsflöde. Den användbara frågan är vilken ände du faktiskt bygger, eftersom svaret avgör om du köper en domare eller en skribent.

Notan är där skillnaden slutar vara filosofisk.

Gemma 4 12B faktureras på samma sätt som varje generativ modell: både indatatoken och utdatatoken. När du ber den om strukturerad JSON genereras, samplas och betalas varje tecken i den JSON:en – och ju mer nästlad ditt schema är, desto längre blir svaret och desto större blir radposten. Det är inte en defekt hos modellen. Det är vad en dekoder gör, och det är precis den radpost som beslutsfattare finns till för att ta bort.

Microsoft-Decision-1 har ingen utdatasida att fakturera. Den kör en enda framåtpassning över ditt tillstånd, din fråga och din uppsättning alternativ, läser av en poäng för varje kandidat och returnerar. Konsekvensen växer med volymen snarare än med promptstorleken: en pipeline som märker tiotusen poster med Gemma 4 12B producerar tiotusen JSON-dokument, och samma pipeline med en beslutsbedömare producerar tiotusen prompter och inget annat. Huruvida den absoluta besparingen är stor beror helt och hållet på din volym och hur fett ditt schema är, och alla med en budget per token kan avgöra det i ett kalkylblad. Riktningen är inte omtvistad.

Det finns en andra, mindre asymmetri: Microsoft trycker ingen taxa på modellsidan för Microsoft-Decision-1. Prissättningen länkar ut till Microsofts egen prissättningsyta, så kostnaden per beslut är något man läser av i Azure snarare än från kortet. Vad sidan däremot fastställer är att 0 % av anropet utgörs av utdatatokens, och att batchinferens är inaktiverad – man kan inte amortera en bulk-körning för scoring via en batchkanal på samma sätt som med en generativ modell.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Gemma 4 12B. Left column Microsoft-Decision-1 rows read: parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; output probabilities with zero output tokens; modalities in text only; weights hosted, not distributed. Right column Gemma 4 12B rows read: parameters 11.96B encoder-free multimodal; context 256,000 tokens; output generated text billed per token; modalities in text, image, audio, video; weights Apache 2.0 and self-serve. A footer line reads that the Gemma 4 12B figures are Google-reported and Microsoft-Decision-1 has published no benchmark figures.

Samma indata, två olika svar

Ge båda modellerna ett kundsupportärende och en fråga. Microsoft-Decision-1 returnerar något i stil med 0,83 för "billing", 0,11 för "technical", 0,04 för "cancellation", 0,02 för "cannot tell". Du har en etikett som går att namnge, ett tal som du kan sätta en tröskel mot, och en avståendeväg — Microsoft dokumenterar att ett alternativ av typen "cannot tell" stöds när det angivna underlaget är otillräckligt, vilket är det som gör att eskaleringslogiken fungerar. Det du inte får är en motivering.

Ge ärendet till Gemma 4 12B och du får ett stycke. Den kan resonera kring begäran med konfigurerbart tänkande, anropa funktioner, läsa en skannad faktura som bifogats ärendet, transkribera röstmeddelandet som häftats fast vid det och svara på kundens eget språk. Vart och ett av dessa är något som Decision-1 inte kan göra med någon som helst noggrannhet: dess indatayta är text och inget annat, och den är uttryckligen inte utformad för öppen frågebesvarande, konversation, översättning eller sammanfattning.

Inget av Gemma 4 12B:s utdata är en sannolikhet. Be den om ett routingbeslut med konfidens och du får prosa som innehåller ett tal, och det talet är vad samplern producerade snarare än en softmax över den uppsättning alternativ du angav. Om ett nedströms tröskelvärde är beroende av att det talet betyder något, har du ett kalibreringsprojekt framför dig, inte en poängsättare.

Huruvida din fråga har en sluten mängd är hela beslutet

Detta är testet som ska tillämpas före allt annat, och det tar ungefär tio minuter med en whiteboard.

• Om ditt svar hämtas från en lista som du kan räkna upp i förväg – en etikett, ett betyg, ett ja/nej, en bedömningspoäng, en rutt – är Microsoft-Decision-1 rätt instrument, och Gemma 4 12B är ett slösaktigt och mindre tillförlitligt sätt att välja från den listan. Du skulle betala en avkodare för att gissa ett nummer som du redan känner till.

• Om ditt svar inte är en sluten mängd – sammanfatta detta, förklara det där, skriv svaret, beskriv diagrammet – kan Microsoft-Decision-1 inte hjälpa till oavsett pris. Den har ingen väg till prosa, inget motiveringsfält och ingen mekanism för att producera något som du inte har räknat upp som ett alternativ.

• Om det är både och har du en pipeline med två modeller snarare än ett val, och den intressanta designfrågan blir vilken av dem som äger eskaleringströskeln. Poängsättaren sätter den; skribenten fyller i vad som händer ovanför och nedanför den.

Där Gemma 4 12B helt enkelt är en annan sport

Utanför beslutsramen är Gemma 4 12B inte före på en linje — den spelar ett annat spel, och att låtsas något annat vore oärligt.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.

• Modaliteter – Microsoft-Decision-1 har endast text som indata och numeriska data som utdata. Gemma 4 12B tar emot text, bild, ljud och video nativt genom en design utan encoder som projicerar råa patchar och vågformer direkt in i inbäddningsrymden, med interfolierad indata i valfri ordning.

• Kontext — 32 768 tokens för Microsoft-Decision-1 mot 256 000 för Gemma 4 12B, som uppnår 43,4 % på MRCR v2 eight-needle vid 128k enligt Googles eget modellkort.

• Språk — 25 språk som stöds för Microsoft-Decision-1, med Microsofts varning om att täckning, kvalitet och kalibrering ”kan variera beroende på språk” och att de pekar ut resurssvaga icke-engelska språk som en svag punkt; 140+ för Gemma 4 12B, med ett utvärderat MMMLU-värde på 83,4 för denna storlek.

• Publicerad prestanda — Microsoft-Decision-1:s fliken Benchmarks innehåller en metodbeskrivning och inga siffror; Google publicerar 77,2 % MMLU Pro, 77,5 % AIME 2026 utan verktyg, 72,0 % LiveCodeBench v6, 78,8 % GPQA Diamond, 69,1 % MMMU Pro och 79,7 % MATH-Vision för Gemma 4 12B.

• Distribution — Microsoft-Decision-1 är ett Foundry-exklusivt hostat API utan vikter, ingen nedladdning och ingen väg för finjustering. Gemma 4 12B är Apache 2.0-vikter som släpptes in i ett ekosystem från dag ett bestående av LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang och Unsloth.

• Körtid — beslutspoängsättning sker i en enda omgång utan avkodningsslinga, så latensen skalar med prompten snarare än med svarets längd; Gemma 4 12B genererar token för token, och Googles lanseringsmaterial anger 16 GB VRAM eller enhetligt minne.

Benchmarkraden är den som är värd att stanna upp vid, i den riktning som smickrar Microsoft minst. Även Gemma 4 12B:s siffror är leverantörsrapporterade – men de har månader av tredjepartsanvändning bakom sig, i offentliga testramverk, på hårdvara som andra äger. Microsofts bidrag i den här kategorin är det nyaste och det minst verifierbara av de två, trots att det kommer från det större företaget.

Vad var och en kostar dig att faktiskt ringa

Gemma 4 12B i sin 12B-form finns inte i vår katalog – om det är den storleken du vill ha får du hämta 11,96 miljarder parametrar i BF16 och köra den själv. Det vår katalog däremot har är resten av Gemma 4-serien, och den är billig: Gemma 4 26B A4B för $0.06 per miljon indatatokens och $0.33 per miljon utdatatokens, och Gemma 4 31B för $0.13 och $0.38, båda listade med kontextfönster på 262 144 tokens. Det är leverantörens listpriser som förs vidare utan påslag från vår sida, bakom en enda OpenAI-kompatibel nyckel tillsammans med över 200 andra modeller. Om ditt problem visar sig handla om allmän resonemangsförmåga snarare än ett beslut ur en sluten mängd, är en av de två storlekarna det billiga valet att mäta mot en egen driftad scorer – och om du helst inte vill låsa dig vid en enda skribent håller automatisk failover generationsdelen av en scorer-loop vid liv när en leverantör försämras.

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

Microsoft-Decision-1 är en Foundry-distribution som du själv provisionerar, och den är inte tillgänglig via oss. Ingenting i den här artikeln är ett tillgänglighetsanspråk för den, från någondera sidan i samtalet.

Slutsats

Microsoft-Decision-1 blev allmänt tillgänglig på Microsoft Foundry den 8 oktober 2026: en enbart textbaserad scorer för 32 768 tokens på en Qwen3.5-9B-bas som returnerar kalibrerade sannolikheter över alternativ du räknar upp, med noll utdatatokens, inga vikter och inga publicerade benchmark-siffror. Gemma 4 12B är en encoder-fri multimodal generalist på 11,96B som släpptes den 3 juni 2026 under Apache 2.0 och som resonerar, läser bilder och ljud och skriver svar över 256 000 tokens. Välj utifrån formen på ditt svar, inte utifrån parameterantalet: en sluten mängd tillhör scorern, en öppen tillhör skrivaren, och att betala en avkodare för att välja ur en lista du redan har skrivit är det vanligaste sättet som team spenderar tio gånger så mycket som ett beslut kostar.

Det vår katalog däremot har är resten av Gemma 4-serien, och den är billig: Gemma 4 26B A4B för $0.06 per miljon input-tokens och $0.33 per miljon output, och Gemma 4 31B för $0.13 och $0.38.