
Microsoft-Decision-1 vs Gemma 4 12B : l'un choisit dans votre liste, l'autre vous en écrit une nouvelle
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 par million de tokens · 69 tok/s
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 367 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
Placez Microsoft-Decision-1 et Gemma 4 12B côte à côte, et la différence qui décide de tout n'est ni la taille, ni la précision, ni la licence — c'est ce qui se produit une fois que le modèle a lu votre entrée. Gemma 4 12B, le modèle multimodal sans encodeur de DeepMind à 11,96 milliards de paramètres, publié le 3 juin 2026 sous Apache 2.0, lit du texte, des images, de l'audio ou de la vidéo, puis vous écrit une réponse, token par token, sur une fenêtre de 256 000 tokens et plus de 140 langues. Microsoft-Decision-1 est passé en disponibilité générale sur Microsoft Foundry le 8 octobre 2026 en tant que modèle de scoring texte uniquement post-entraîné sur Qwen3.5-9B : vous lui soumettez un état et une question dont vous avez déjà énuméré les réponses, et il renvoie une probabilité calibrée pour chaque option en une seule passe sur jusqu'à 32 768 tokens, sans rien générer. Un modèle vous dit laquelle de vos options est la bonne. L'autre vous dit ce qu'auraient dû être les options — et vous facture chaque mot de cela.
Présenter cela comme un concours serait une erreur de catégorie, et il vaut la peine de le dire avant les lignes de spécification plutôt qu’après. Ces deux-là ne sont pas des substituts ; ils se situent aux extrémités opposées d’un flux de travail. La question utile est de savoir à quelle extrémité vous construisez réellement, car la réponse détermine si vous achetez un juge ou un rédacteur.
La facture, c’est là que la différence cesse d’être philosophique.
Gemma 4 12B est facturé comme l'est tout modèle génératif : des tokens d'entrée et des tokens de sortie, les deux. Lorsque vous lui demandez du JSON structuré, chaque caractère de ce JSON est généré, échantillonné et facturé — et plus votre schéma est imbriqué, plus la réponse est longue et plus ce poste de facturation est élevé. Ce n'est pas un défaut du modèle. C'est ce que fait un décodeur, et c'est précisément le poste que les décideurs ont pour mission de supprimer.
Microsoft-Decision-1 n’a pas de côté de sortie à facturer. Il exécute une seule passe avant sur votre état, votre question et votre ensemble d’options, lit un score pour chaque candidat, puis renvoie. La conséquence s’amplifie avec le volume plutôt qu’avec la taille du prompt : un pipeline qui étiquette dix mille enregistrements avec Gemma 4 12B produit dix mille documents JSON, et le même pipeline sur un évaluateur de décision produit dix mille prompts et rien d’autre. Que l’économie absolue soit importante dépend entièrement de votre volume et de la lourdeur de votre schéma, et quiconque dispose d’un budget par jeton peut trancher la question dans un tableur. La direction ne fait aucun doute.
Il existe une seconde asymétrie, plus petite : Microsoft n’affiche pas de tarif sur la page du modèle Microsoft-Decision-1. La tarification renvoie vers sa propre interface de tarification, de sorte que le coût par décision est une donnée que l’on lit sur Azure plutôt que sur la fiche. Ce que la page établit, en revanche, c’est que 0 % de l’appel correspond à des tokens de sortie, et que l’inférence par lots est désactivée — vous ne pouvez pas amortir une exécution de scoring en masse via un canal par lots comme vous le feriez avec un modèle génératif.

Même entrée, deux réponses différentes
Donnez aux deux modèles un ticket de support client et une question. Microsoft-Decision-1 renvoie quelque chose comme 0,83 pour « facturation », 0,11 pour « technique », 0,04 pour « annulation », 0,02 pour « impossible à dire ». Vous disposez d'une étiquette nommable, d'un nombre par rapport auquel vous pouvez définir un seuil, et d'un chemin d'abstention — Microsoft documente qu'une option de style « impossible à dire » est prise en charge lorsque les preuves fournies sont insuffisantes, ce qui fait fonctionner la logique d'escalade. Ce que vous n'obtenez pas, c'est une raison.
Confiez le ticket à Gemma 4 12B et vous obtenez un paragraphe. Il peut raisonner sur la demande avec une réflexion configurable, appeler des fonctions, lire une facture numérisée jointe au ticket, transcrire le message vocal qui y est rattaché et répondre dans la langue du client. Chacune de ces choses est quelque chose que Decision-1 ne peut faire avec une quelconque précision : sa surface d'entrée est du texte et rien d'autre, et il n'est explicitement pas conçu pour répondre à des questions ouvertes, converser, traduire ou résumer.
Aucune sortie de Gemma 4 12B n’est une probabilité. Demandez-lui une décision de routage avec un niveau de confiance et vous obtiendrez de la prose contenant un nombre, et ce nombre est celui produit par l’échantillonneur plutôt qu’un softmax sur l’ensemble d’options que vous avez fourni. Si un seuil en aval dépend du fait que ce nombre signifie quelque chose, vous avez un projet de calibration sur les bras, pas un scoreur.
Savoir si votre question comporte un ensemble fermé constitue toute la décision
C’est le test à appliquer avant toute autre chose, et il faut environ dix minutes avec un tableau blanc.
• Si votre réponse est tirée d’une liste que vous pouvez énumérer à l’avance — une étiquette, une note, un oui/non, un score de grille d’évaluation, un itinéraire —, Microsoft-Decision-1 est l’instrument adapté, et Gemma 4 12B est un moyen gaspilleur et moins fiable de faire un choix dans cette liste. Vous paieriez un décodeur pour deviner un nombre que vous avez déjà borné.
• Si votre réponse n'est pas un ensemble fermé — résumez ceci, expliquez cela, rédigez la réponse, décrivez le graphique — Microsoft-Decision-1 ne peut pas aider à aucun prix. Il n'a aucun chemin vers la prose, aucun champ de justification, et aucun mécanisme pour produire quoi que ce soit que vous n'ayez pas énuméré comme option.
• S’il s’agit des deux à la fois, vous avez un pipeline à deux modèles plutôt qu’un choix, et l’intéressante question de conception devient de savoir lequel des deux détient le seuil d’escalade. Le scoreur le fixe ; le rédacteur précise ce qui se passe au-dessus et en dessous.
Là où Gemma 4 12B est simplement un autre sport
En dehors du cadre décisionnel, Gemma 4 12B n’est pas en tête sur une ligne — il joue à un autre jeu, et prétendre le contraire serait malhonnête.

• Modalités — Microsoft-Decision-1 fonctionne uniquement en texte en entrée et en numérique en sortie. Gemma 4 12B prend nativement en charge le texte, l'image, l'audio et la vidéo grâce à une conception sans encodeur qui projette directement les patchs bruts et les formes d'onde dans l'espace d'embedding, avec des entrées entrelacées dans n'importe quel ordre.
• Contexte — 32 768 jetons pour Microsoft-Decision-1 contre 256 000 pour Gemma 4 12B, qui obtient 43,4 % sur MRCR v2 eight-needle à 128 k sur la fiche officielle de Google.
• Langue — 25 langues prises en charge pour Microsoft-Decision-1, Microsoft avertissant que la couverture, la qualité et la calibration « peuvent varier selon la langue » et désignant les langues non anglaises à faibles ressources comme un point faible ; plus de 140 pour Gemma 4 12B, avec un chiffre MMMLU évalué de 83,4 pour cette taille.
• Performances publiées — l’onglet Benchmarks de Microsoft-Decision-1 présente une méthodologie et aucun chiffre ; Google publie 77,2 % sur MMLU Pro, 77,5 % sur AIME 2026 sans outils, 72,0 % sur LiveCodeBench v6, 78,8 % sur GPQA Diamond, 69,1 % sur MMMU Pro et 79,7 % sur MATH-Vision pour Gemma 4 12B.
• Distribution — Brand-1 est une API hébergée exclusivement sur Foundry, sans poids, sans téléchargement et sans possibilité de fine-tuning. Gemini 4 12B est constitué de poids Apache 2.0 qui sont arrivés avec un écosystème disponible dès le premier jour : LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang et Unsloth.
• Runtime — le calcul du score de décision se fait en une seule passe, sans boucle de décodage ; la latence dépend donc du prompt plutôt que de la longueur de la réponse. Gemma 4 12B génère token par token, et les documents de lancement de Google le positionnent à 16 Go de VRAM ou de mémoire unifiée.
La ligne des benchmarks est celle sur laquelle il vaut la peine de s’attarder, dans le sens qui flatte le moins Microsoft. Les chiffres de Gemma 4 12B sont eux aussi déclarés par le fournisseur — mais ils ont derrière eux des mois d’utilisation par des tiers, dans des harnais publics, sur du matériel que d’autres possèdent. L’entrée de Microsoft dans cette catégorie est la plus récente et la moins vérifiable des deux, bien qu’elle vienne de l’entreprise la plus grande.
Ce que chacun vous coûte réellement pour appeler
Gemma 4 12B, dans sa version 12B, ne figure pas dans notre catalogue — si c'est la taille que vous voulez, vous récupérez 11,96 milliards de paramètres en BF16 et vous l'hébergez vous-même. Ce que notre catalogue propose, c'est le reste de la gamme Gemma 4, et ce n'est pas cher : Gemma 4 26B A4B à 0,06 $ par million de tokens d'entrée et 0,33 $ par million de tokens de sortie, et Gemma 4 31B à 0,13 $ et 0,38 $, tous deux annoncés avec des contextes de 262 144 tokens. Ce sont là des prix catalogue de fournisseurs transmis sans marge ajoutée de notre côté, derrière une seule clé compatible OpenAI, aux côtés de plus de 200 autres modèles. Si votre problème relève en fin de compte du raisonnement général plutôt que d'une décision à ensemble fermé, l'une de ces deux tailles est le moyen peu coûteux de vous mesurer à un évaluateur auto-hébergé — et si vous préférez ne pas vous engager sur un seul rédacteur, le basculement automatique en cas de défaillance maintient en vie la partie génération d'une boucle d'évaluation lorsqu'un fournisseur se dégrade.

Microsoft-Decision-1 est un déploiement Foundry que vous provisionnez vous-même, et il n'est pas disponible par notre intermédiaire. Rien dans cet article ne constitue une affirmation de disponibilité pour celui-ci, ni d'un côté ni de l'autre de l'appel.
L'essentiel
Microsoft-Decision-1 est passé en disponibilité générale sur Microsoft Foundry le 8 octobre 2026 : un évaluateur texte uniquement, de 32 768 tokens, sur une base Qwen3.5-9B qui renvoie des probabilités calibrées sur les options que vous énumérez, avec zéro token de sortie, aucun poids et aucun chiffre de benchmark publié. Gemma 4 12B est un généraliste multimodal sans encodeur de 11,96 B, publié le 3 juin 2026 sous Apache 2.0, qui raisonne, lit des images et de l’audio et rédige des réponses sur 256 000 tokens. Choisissez selon la forme de votre réponse, pas selon les nombres de paramètres : un ensemble fermé revient à l’évaluateur, un ensemble ouvert revient au rédacteur, et payer un décodeur pour sélectionner dans une liste que vous avez déjà écrite est la manière la plus courante pour les équipes de dépenser dix fois ce que coûte une décision.
Ce que notre catalogue propose, c'est le reste de la gamme Gemma 4, et c'est peu coûteux : Gemma 4 26B A4B à 0,06 $ par million de jetons d'entrée et 0,33 $ par million de jetons de sortie, et Gemma 4 31B à 0,13 $ et 0,38 $.
