Eine generierte Titelkarte für Microsoft-Decision-1 vs. Gemma 4 12B mit dem Untertitel „ein Scorer ohne Ausgabe-Tokens gegen einen Schreiber ohne geschlossene Menge“, mit Chips mit der Aufschrift Wahrscheinlichkeiten versus Prosa, 32.768-Token-Kontext versus 256.000, nur Text versus Text, Bild, Audio und Video sowie gehostete API versus offene Gewichte.
Guides & Insights

Microsoft-Decision-1 vs. Gemma 4 12B: Der eine wählt aus Ihrer Liste, der andere schreibt Ihnen eine neue.

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Stell Microsoft-Decision-1 und Gemma 4 12B nebeneinander, und der Unterschied, der alles entscheidet, ist nicht Größe, Genauigkeit oder Lizenz – es ist das, was passiert, nachdem das Modell deine Eingabe gelesen hat. Gemma 4 12B, DeepMinds encoderfreies multimodales Modell mit 11,96 Milliarden Parametern, das am 3. Juni 2026 unter Apache 2.0 veröffentlicht wurde, liest Text, Bilder, Audio oder Video und schreibt dir dann eine Antwort, Token für Token, über ein 256.000-Token-Fenster und mehr als 140 Sprachen hinweg. Microsoft-Decision-1 wurde auf Microsoft Foundry allgemein verfügbar am 8. Oktober 2026 als ein reiner Text-Scorer, nachtrainiert auf Qwen3.5-9B: du übergibst ihm einen Zustand und eine Frage, deren Antworten du bereits aufgelistet hast, und es gibt eine kalibrierte Wahrscheinlichkeit für jede Option in einem einzigen Durchlauf über bis zu 32.768 Token zurück, wobei es nichts generiert. Das eine Modell sagt dir, welche deiner Optionen richtig ist. Das andere sagt dir, welche die Optionen hätten sein sollen – und stellt dir jedes Wort davon in Rechnung.

Dies als Wettbewerb zu framen, wäre ein Kategorienfehler, und es lohnt sich, das vor den Spezifikationszeilen zu sagen statt danach. Diese beiden sind kein Ersatz füreinander; sie liegen an entgegengesetzten Enden eines Workflows. Die nützliche Frage ist, welches Ende du tatsächlich baust, denn die Antwort bestimmt, ob du einen Richter oder einen Schreiber kaufst.

Die Rechnung ist der Punkt, an dem der Unterschied aufhört, philosophisch zu sein.

Gemma 4 12B wird so abgerechnet, wie jedes generative Modell abgerechnet wird: Eingabe-Tokens und Ausgabe-Tokens, beides. Wenn man es um strukturiertes JSON bittet, wird jedes Zeichen dieses JSON generiert, gesampelt und bezahlt – und je verschachtelter das Schema, desto länger die Antwort und desto größer dieser Posten. Das ist kein Defekt des Modells. Es ist das, was ein Decoder tut, und genau der Posten, den zu streichen Decision Heads da sind.

Microsoft-Decision-1 hat keine Ausgabeseite, die abgerechnet werden müsste. Es führt einen einzigen Forward-Pass über deinen Zustand, deine Frage und deine Optionsmenge aus, liest für jeden Kandidaten einen Score und gibt zurück. Die Konsequenz summiert sich mit dem Volumen statt mit der Prompt-Größe: Eine Pipeline, die zehntausend Datensätze mit Gemma 4 12B labelt, erzeugt zehntausend JSON-Dokumente, und dieselbe Pipeline mit einem Decision-Scorer erzeugt zehntausend Prompts und sonst nichts. Ob die absolute Ersparnis groß ist, hängt vollständig von deinem Volumen und der Fülle deines Schemas ab, und wer ein Budget pro Token hat, kann das in einer Tabellenkalkulation klären. Die Richtung ist unstrittig.

Es gibt eine zweite, kleinere Asymmetrie: Microsoft gibt auf der Modellseite von Microsoft-Decision-1 keinen Preis an. Die Preisgestaltung verlinkt auf Microsofts eigene Preisübersicht, sodass die Kosten pro Entscheidung etwas sind, das man von Azure abliest statt von der Modellkarte. Was die Seite jedoch festhält, ist, dass 0 % des Aufrufs Ausgabe-Tokens sind und dass Batch-Inferenz deaktiviert ist – man kann einen Massen-Scoring-Lauf nicht über einen Batch-Kanal amortisieren, wie man es bei einem generativen Modell tun würde.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Gemma 4 12B. Left column Microsoft-Decision-1 rows read: parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; output probabilities with zero output tokens; modalities in text only; weights hosted, not distributed. Right column Gemma 4 12B rows read: parameters 11.96B encoder-free multimodal; context 256,000 tokens; output generated text billed per token; modalities in text, image, audio, video; weights Apache 2.0 and self-serve. A footer line reads that the Gemma 4 12B figures are Google-reported and Microsoft-Decision-1 has published no benchmark figures.

Gleiche Eingabe, zwei unterschiedliche Antworten.

Geben Sie beiden Modellen ein Kundensupport-Ticket und eine Frage. Microsoft-Decision-1 liefert ungefähr 0,83 für „Abrechnung“, 0,11 für „Technisch“, 0,04 für „Kündigung“, 0,02 für „Kann nicht sagen“. Sie haben ein benennbares Label, eine Zahl, gegen die Sie einen Schwellenwert setzen können, und einen Enthaltungspfad – Microsoft dokumentiert, dass eine Option im Stil von „Kann nicht sagen“ unterstützt wird, wenn die gelieferten Belege unzureichend sind, was die Eskalationslogik erst funktionieren lässt. Was Sie nicht bekommen, ist eine Begründung.

Geben Sie das Ticket an Gemma 4 12B, bekommen Sie einen Absatz. Es kann mit konfigurierbarem Denken über die Anfrage schlussfolgern, Funktionen aufrufen, eine an das Ticket angehängte gescannte Rechnung lesen, die daran angeheftete Voicemail transkribieren und in der eigenen Sprache des Kunden antworten. Jede einzelne davon kann Decision-1 mit keinerlei Genauigkeit bewältigen: Seine Eingabeoberfläche ist Text und sonst nichts, und es ist ausdrücklich nicht für offene Fragebeantwortung, Konversation, Übersetzung oder Zusammenfassung ausgelegt.

Keine der Ausgaben von Gemma 4 12B ist eine Wahrscheinlichkeit. Bitten Sie es um eine Routing-Entscheidung mit Konfidenz, erhalten Sie Prosa, die eine Zahl enthält, und diese Zahl ist das, was der Sampler erzeugt hat, statt ein Softmax über die von Ihnen vorgegebene Optionsmenge. Wenn eine nachgelagerte Schwelle davon abhängt, dass diese Zahl etwas bedeutet, haben Sie ein Kalibrierungsprojekt vor sich, keinen Scorer.

Ob deine Frage eine geschlossene Menge hat, ist die ganze Entscheidung

Dies ist der Test, der vor allem anderen angewendet werden sollte, und er dauert etwa zehn Minuten mit einem Whiteboard.

• Wenn Ihre Antwort aus einer Liste stammt, die Sie im Voraus aufzählen können – ein Label, eine Bewertung, ein Ja/Nein, eine Punktzahl nach Bewertungsraster, eine Route –, ist Microsoft-Decision-1 das richtige Instrument, und Gemma 4 12B ist eine verschwenderische und weniger zuverlässige Möglichkeit, aus dieser Liste auszuwählen. Sie würden einen Decoder dafür bezahlen, eine Zahl zu erraten, die Sie bereits eingegrenzt haben.

• Wenn Ihre Antwort keine geschlossene Menge ist – fassen Sie dies zusammen, erklären Sie jenes, schreiben Sie die Antwort, beschreiben Sie das Diagramm –, kann Microsoft-Decision-1 um keinen Preis helfen. Es hat keinen Weg zur Prosa, kein Begründungsfeld und keinen Mechanismus, um etwas zu erzeugen, das Sie nicht als Option aufgezählt haben.

• Wenn es beides ist, hat man eher eine Pipeline aus zwei Modellen als eine Wahl, und die interessante Designfrage wird, welches von beiden die Eskalationsschwelle besitzt. Der Scorer legt sie fest; der Writer füllt aus, was oberhalb und unterhalb davon passiert.

Wo Gemma 4 12B einfach eine andere Liga ist

Außerhalb des Entscheidungsrahmens liegt Gemma 4 12B nicht auf einer Linie vorn – es spielt ein anderes Spiel, und etwas anderes vorzugeben wäre unehrlich.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.

• Modalitäten — Microsoft-Decision-1 nimmt nur Text entgegen und gibt numerische Werte aus. Gemma 4 12B verarbeitet Text, Bild, Audio und Video nativ durch ein Encoder-freies Design, das rohe Patches und Wellenformen direkt in den Embedding-Raum projiziert, mit verschachtelter Eingabe in beliebiger Reihenfolge.

• Kontext — 32.768 Token für Microsoft-Decision-1 gegenüber 256.000 für Gemma 4 12B, das bei MRCR v2 Eight-Needle mit 128k auf Googles eigener Modellkarte 43,4 % erzielt.

• Sprache — 25 unterstützte Sprachen für Microsoft-Decision-1, wobei Microsoft davor warnt, dass Abdeckung, Qualität und Kalibrierung „je nach Sprache variieren können“, und ressourcenärmere nicht-englischsprachige Sprachen als Schwachpunkt nennt; 140+ für Gemma 4 12B, mit einem bewerteten MMMLU-Wert von 83,4 für diese Größe.

• Veröffentlichte Leistung — Microsoft-Decision-1's Benchmarks enthält eine Methodik und keine Zahlen, Google veröffentlicht 77,2 % MMLU Pro, 77,5 % AIME 2026 ohne Tools, 72,0 % LiveCodeBench v6, 78,8 % GPQA Diamond, 69,1 % MMMU Pro und 79,7 % MATH-Vision für Gemma 4 12B.

• Distribution — Microsoft-Decision-1 ist eine ausschließlich in Foundry gehostete API ohne Gewichte, ohne Download und ohne Fine-Tuning-Pfad. Gemma 4 12B sind Apache-2.0-Gewichte, die in ein Ökosystem ab dem ersten Tag mit LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang und Unsloth ausgeliefert wurden.

• Laufzeit — das Entscheidungs-Scoring erfolgt in einem einzigen Durchlauf ohne Decodierungsschleife, sodass die Latenz mit dem Prompt statt mit der Antwortlänge skaliert; Gemma 4 12B generiert Token für Token, und Googles Launch-Materialien verorten es bei 16 GB VRAM oder Unified Memory.

Die Benchmark-Zeile ist diejenige, bei der es sich lohnt innezuhalten – und zwar in der Richtung, die Microsoft am wenigsten schmeichelt. Die Zahlen von Gemma 4 12B sind ebenfalls vom Anbieter gemeldet – aber hinter ihnen liegen Monate der Nutzung durch Dritte, in öffentlichen Testumgebungen, auf Hardware, die andere Leute besitzen. Microsofts Eintrag in dieser Kategorie ist der neueste und der am wenigsten überprüfbare der beiden, obwohl er vom größeren Unternehmen stammt.

Was es Sie jeweils kostet, tatsächlich anzurufen

Gemma 4 12B in seiner 12B-Variante ist nicht in unserem Katalog – wenn Sie genau diese Größe wollen, laden Sie 11,96 Milliarden Parameter in BF16 herunter und betreiben das Modell selbst. Was unser Katalog dagegen führt, ist der Rest der Gemma-4-Reihe, und der ist günstig: Gemma 4 26B A4B zu 0,06 $ pro Million Eingabe-Tokens und 0,33 $ pro Million Ausgabe, und Gemma 4 31B zu 0,13 $ und 0,38 $, beide mit Kontextfenstern von 262.144 Tokens gelistet. Das sind Hersteller-Listenpreise, die ohne Aufschlag unsererseits weitergegeben werden, hinter einem einzigen OpenAI-kompatiblen Schlüssel, zusammen mit mehr als 200 weiteren Modellen. Wenn sich herausstellt, dass Ihr Problem allgemeines Reasoning und nicht eine Entscheidung aus einer geschlossenen Menge ist, ist eine dieser beiden Größen das Günstige, woran Sie sich gegen einen selbst betriebenen Scorer messen können – und wenn Sie sich lieber nicht auf einen einzigen Anbieter festlegen möchten, hält automatisches Failover den Generierungsteil einer Scoring-Schleife am Leben, wenn ein Anbieter ausfällt.

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

Microsoft-Decision-1 ist ein Foundry-Deployment, das Sie selbst bereitstellen, und es ist nicht über uns verfügbar. Nichts in diesem Artikel ist eine Verfügbarkeitsaussage dafür, auf keiner Seite des Aufrufs.

Fazit

Microsoft-Decision-1 wurde am 8. Oktober 2026 auf Microsoft Foundry allgemein verfügbar: ein reiner Text-Scorer mit 32.768 Token auf einer Qwen3.5-9B-Basis, der kalibrierte Wahrscheinlichkeiten für von Ihnen aufgeführte Optionen zurückgibt – mit null Ausgabe-Token, ohne Gewichte und ohne veröffentlichte Benchmark-Werte. Gemma 4 12B ist ein 11,96B großer encoderfreier multimodaler Generalist, veröffentlicht am 3. Juni 2026 unter Apache 2.0, der schlussfolgert, Bilder und Audio liest und Antworten über 256.000 Token hinweg schreibt. Wählen Sie nach der Form Ihrer Antwort, nicht nach den Parameterzahlen: Eine geschlossene Menge gehört zum Scorer, eine offene zum Schreiber, und einen Decoder dafür zu bezahlen, aus einer Liste auszuwählen, die Sie bereits geschrieben haben, ist die häufigste Art und Weise, wie Teams das Zehnfache dessen ausgeben, was eine Entscheidung kostet.

Was unser Katalog sehr wohl führt, ist der Rest der Gemma 4-Reihe, und das ist günstig: Gemma 4 26B A4B für 0,06 $ pro Million Input-Tokens und 0,33 $ pro Million Output-Tokens, sowie Gemma 4 31B für 0,13 $ und 0,38 $.