
Microsoft-Decision-1 vs Gemma 4 12B: Den ena väljer från din lista, den andra skriver en ny åt dig
- OrcaNYOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M tokens · 69 tok/s
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 367 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
Ställ Microsoft-Decision-1 och Gemma 4 12B sida vid sida och skillnaden som avgör allt är inte storlek, träffsäkerhet eller licens — det är vad som händer efter att modellen har läst din indata. Gemma 4 12B, DeepMinds encodernfria multimodala modell med 11,96 miljarder parametrar som släpptes den 3 juni 2026 under Apache 2.0, läser text, bilder, ljud eller video och skriver sedan ett svar till dig, token för token, över ett fönster på 256 000 token och fler än 140 språk. Microsoft-Decision-1 blev allmänt tillgänglig på Microsoft Foundry den 8 oktober 2026 som en poängsättare för enbart text, eftertränad på Qwen3.5-9B: du ger den ett tillstånd och en fråga vars svar du redan har räknat upp, och den returnerar en kalibrerad sannolikhet för varje alternativ i en enda genomkörning över upp till 32 768 token, utan att generera något. Den ena modellen säger vilket av dina alternativ som är rätt. Den andra säger vad alternativen borde ha varit — och fakturerar dig för varje ord av det.
Att rama in detta som en tävling vore ett kategorimisstag, och det är värt att säga det före spec-raderna snarare än efter dem. Dessa två är inte utbytbara; de befinner sig i varsin ände av ett arbetsflöde. Den användbara frågan är vilken ände du faktiskt bygger, eftersom svaret avgör om du köper en domare eller en skribent.
Notan är där skillnaden slutar vara filosofisk.
Gemma 4 12B faktureras på samma sätt som varje generativ modell: både indatatoken och utdatatoken. När du ber den om strukturerad JSON genereras, samplas och betalas varje tecken i den JSON:en – och ju mer nästlad ditt schema är, desto längre blir svaret och desto större blir radposten. Det är inte en defekt hos modellen. Det är vad en dekoder gör, och det är precis den radpost som beslutsfattare finns till för att ta bort.
Microsoft-Decision-1 har ingen utdatasida att fakturera. Den kör en enda framåtpassning över ditt tillstånd, din fråga och din uppsättning alternativ, läser av en poäng för varje kandidat och returnerar. Konsekvensen växer med volymen snarare än med promptstorleken: en pipeline som märker tiotusen poster med Gemma 4 12B producerar tiotusen JSON-dokument, och samma pipeline med en beslutsbedömare producerar tiotusen prompter och inget annat. Huruvida den absoluta besparingen är stor beror helt och hållet på din volym och hur fett ditt schema är, och alla med en budget per token kan avgöra det i ett kalkylblad. Riktningen är inte omtvistad.
Det finns en andra, mindre asymmetri: Microsoft trycker ingen taxa på modellsidan för Microsoft-Decision-1. Prissättningen länkar ut till Microsofts egen prissättningsyta, så kostnaden per beslut är något man läser av i Azure snarare än från kortet. Vad sidan däremot fastställer är att 0 % av anropet utgörs av utdatatokens, och att batchinferens är inaktiverad – man kan inte amortera en bulk-körning för scoring via en batchkanal på samma sätt som med en generativ modell.

Samma indata, två olika svar
Ge båda modellerna ett kundsupportärende och en fråga. Microsoft-Decision-1 returnerar något i stil med 0,83 för "billing", 0,11 för "technical", 0,04 för "cancellation", 0,02 för "cannot tell". Du har en etikett som går att namnge, ett tal som du kan sätta en tröskel mot, och en avståendeväg — Microsoft dokumenterar att ett alternativ av typen "cannot tell" stöds när det angivna underlaget är otillräckligt, vilket är det som gör att eskaleringslogiken fungerar. Det du inte får är en motivering.
Ge ärendet till Gemma 4 12B och du får ett stycke. Den kan resonera kring begäran med konfigurerbart tänkande, anropa funktioner, läsa en skannad faktura som bifogats ärendet, transkribera röstmeddelandet som häftats fast vid det och svara på kundens eget språk. Vart och ett av dessa är något som Decision-1 inte kan göra med någon som helst noggrannhet: dess indatayta är text och inget annat, och den är uttryckligen inte utformad för öppen frågebesvarande, konversation, översättning eller sammanfattning.
Inget av Gemma 4 12B:s utdata är en sannolikhet. Be den om ett routingbeslut med konfidens och du får prosa som innehåller ett tal, och det talet är vad samplern producerade snarare än en softmax över den uppsättning alternativ du angav. Om ett nedströms tröskelvärde är beroende av att det talet betyder något, har du ett kalibreringsprojekt framför dig, inte en poängsättare.
Huruvida din fråga har en sluten mängd är hela beslutet
Detta är testet som ska tillämpas före allt annat, och det tar ungefär tio minuter med en whiteboard.
• Om ditt svar hämtas från en lista som du kan räkna upp i förväg – en etikett, ett betyg, ett ja/nej, en bedömningspoäng, en rutt – är Microsoft-Decision-1 rätt instrument, och Gemma 4 12B är ett slösaktigt och mindre tillförlitligt sätt att välja från den listan. Du skulle betala en avkodare för att gissa ett nummer som du redan känner till.
• Om ditt svar inte är en sluten mängd – sammanfatta detta, förklara det där, skriv svaret, beskriv diagrammet – kan Microsoft-Decision-1 inte hjälpa till oavsett pris. Den har ingen väg till prosa, inget motiveringsfält och ingen mekanism för att producera något som du inte har räknat upp som ett alternativ.
• Om det är både och har du en pipeline med två modeller snarare än ett val, och den intressanta designfrågan blir vilken av dem som äger eskaleringströskeln. Poängsättaren sätter den; skribenten fyller i vad som händer ovanför och nedanför den.
Där Gemma 4 12B helt enkelt är en annan sport
Utanför beslutsramen är Gemma 4 12B inte före på en linje — den spelar ett annat spel, och att låtsas något annat vore oärligt.

• Modaliteter – Microsoft-Decision-1 har endast text som indata och numeriska data som utdata. Gemma 4 12B tar emot text, bild, ljud och video nativt genom en design utan encoder som projicerar råa patchar och vågformer direkt in i inbäddningsrymden, med interfolierad indata i valfri ordning.
• Kontext — 32 768 tokens för Microsoft-Decision-1 mot 256 000 för Gemma 4 12B, som uppnår 43,4 % på MRCR v2 eight-needle vid 128k enligt Googles eget modellkort.
• Språk — 25 språk som stöds för Microsoft-Decision-1, med Microsofts varning om att täckning, kvalitet och kalibrering ”kan variera beroende på språk” och att de pekar ut resurssvaga icke-engelska språk som en svag punkt; 140+ för Gemma 4 12B, med ett utvärderat MMMLU-värde på 83,4 för denna storlek.
• Publicerad prestanda — Microsoft-Decision-1:s fliken Benchmarks innehåller en metodbeskrivning och inga siffror; Google publicerar 77,2 % MMLU Pro, 77,5 % AIME 2026 utan verktyg, 72,0 % LiveCodeBench v6, 78,8 % GPQA Diamond, 69,1 % MMMU Pro och 79,7 % MATH-Vision för Gemma 4 12B.
• Distribution — Microsoft-Decision-1 är ett Foundry-exklusivt hostat API utan vikter, ingen nedladdning och ingen väg för finjustering. Gemma 4 12B är Apache 2.0-vikter som släpptes in i ett ekosystem från dag ett bestående av LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang och Unsloth.
• Körtid — beslutspoängsättning sker i en enda omgång utan avkodningsslinga, så latensen skalar med prompten snarare än med svarets längd; Gemma 4 12B genererar token för token, och Googles lanseringsmaterial anger 16 GB VRAM eller enhetligt minne.
Benchmarkraden är den som är värd att stanna upp vid, i den riktning som smickrar Microsoft minst. Även Gemma 4 12B:s siffror är leverantörsrapporterade – men de har månader av tredjepartsanvändning bakom sig, i offentliga testramverk, på hårdvara som andra äger. Microsofts bidrag i den här kategorin är det nyaste och det minst verifierbara av de två, trots att det kommer från det större företaget.
Vad var och en kostar dig att faktiskt ringa
Gemma 4 12B i sin 12B-form finns inte i vår katalog – om det är den storleken du vill ha får du hämta 11,96 miljarder parametrar i BF16 och köra den själv. Det vår katalog däremot har är resten av Gemma 4-serien, och den är billig: Gemma 4 26B A4B för $0.06 per miljon indatatokens och $0.33 per miljon utdatatokens, och Gemma 4 31B för $0.13 och $0.38, båda listade med kontextfönster på 262 144 tokens. Det är leverantörens listpriser som förs vidare utan påslag från vår sida, bakom en enda OpenAI-kompatibel nyckel tillsammans med över 200 andra modeller. Om ditt problem visar sig handla om allmän resonemangsförmåga snarare än ett beslut ur en sluten mängd, är en av de två storlekarna det billiga valet att mäta mot en egen driftad scorer – och om du helst inte vill låsa dig vid en enda skribent håller automatisk failover generationsdelen av en scorer-loop vid liv när en leverantör försämras.

Microsoft-Decision-1 är en Foundry-distribution som du själv provisionerar, och den är inte tillgänglig via oss. Ingenting i den här artikeln är ett tillgänglighetsanspråk för den, från någondera sidan i samtalet.
Slutsats
Microsoft-Decision-1 blev allmänt tillgänglig på Microsoft Foundry den 8 oktober 2026: en enbart textbaserad scorer för 32 768 tokens på en Qwen3.5-9B-bas som returnerar kalibrerade sannolikheter över alternativ du räknar upp, med noll utdatatokens, inga vikter och inga publicerade benchmark-siffror. Gemma 4 12B är en encoder-fri multimodal generalist på 11,96B som släpptes den 3 juni 2026 under Apache 2.0 och som resonerar, läser bilder och ljud och skriver svar över 256 000 tokens. Välj utifrån formen på ditt svar, inte utifrån parameterantalet: en sluten mängd tillhör scorern, en öppen tillhör skrivaren, och att betala en avkodare för att välja ur en lista du redan har skrivit är det vanligaste sättet som team spenderar tio gånger så mycket som ett beslut kostar.
Det vår katalog däremot har är resten av Gemma 4-serien, och den är billig: Gemma 4 26B A4B för $0.06 per miljon input-tokens och $0.33 per miljon output, och Gemma 4 31B för $0.13 och $0.38.
