Carte de titre générée pour la comparaison de Decision 3.0 et Microsoft-Decision-1, avec le sous-titre « même socle Qwen3.5-9B, façons opposées de l'acheter », des pastilles indiquant « poids Apache-2.0 vs hébergé uniquement », « images et vidéo vs texte uniquement », « publié le 10 oct. vs GA le 8 oct. », et un pied de page indiquant « les chiffres de Decision 3.0 sont ceux de vLLM-SR ; les chiffres de Microsoft-Decision-1 sont ceux de Microsoft ; ni les uns ni les autres ne sont reproduits de manière indépendante. » Le logo OrcaRouter est intégré dans le coin inférieur droit.
Engineering & Research

Decision 3.0 vs Microsoft-Decision-1 : l'un est un téléchargement, l'autre est une référence SKU

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le palier 9B de Decision 3.0 et Microsoft-Decision-1 sont, sur le papier, le même produit. Les deux post-entraînent Qwen3.5-9B en un évaluateur qui répond à un ensemble fixe de réponses candidates avec une probabilité calibrée pour chacune, sans jamais générer un token. Les deux visent les mêmes tâches — router une requête, évaluer une sortie par rapport à une grille d'évaluation, autoriser ou bloquer une action d'agent, trier une file d'attente. Les deux sont sortis à une semaine d'intervalle : Microsoft-Decision-1 est devenu disponible en général sur Microsoft Foundry le 8 octobre 2026 et a été annoncé le lendemain, et d3-flash a été poussé sur Hugging Face à 17:23 UTC le 10 octobre 2026.

La différence ne tient pas au modèle. Elle tient à ce que vous êtes autorisé à en faire. d3-flash est un checkpoint Apache-2.0 de 8,39 milliards de paramètres que vous téléchargez et exécutez, troisième membre d'une famille qui commence à 0,59 B et culmine à 26,09 B. Microsoft-Decision-1 est un point de terminaison hébergé sur Foundry, dont les poids ne sont pas distribués du tout, dans une gamme que Microsoft dit vouloir rebaser plus tard sur ses propres modèles MAI. L'un des deux est un artefact ; l'autre est un service. Presque toutes les questions pratiques que l'on peut se poser sur ce duo découlent de ce seul fait, y compris celles qui semblent porter sur les benchmarks.

Deux décisions sur ce à quoi sert un modèle de décision

Le post de Microsoft est explicite quant à la portée d’une manière que les fiches de modèle sont rarement. Les formes de questions prises en charge sont oui/non, le choix multiple, la notation, la classification et l’évaluation par grille critériée. Les exclusions sont listées tout aussi clairement : non conçu pour la génération de texte, la réponse à des questions ouvertes, la conversation, la traduction ou le résumé, et non destiné aux tâches exigeant des connaissances absentes de l’entrée. Il effectue une seule passe sur jusqu’à 32 768 jetons et émet zéro jeton de sortie, car il n’y a pas de boucle de décodage. Microsoft prend également en charge une option d’abstention telle que « impossible de dire » lorsque les preuves fournies sont insuffisantes, ce qui est le détail qui rend le seuillage sur la sortie réellement pertinent.

d3-flash s'inscrit dans le même cadre conceptuel — questions Choice, Noul (oui/non) et Score, une passe avant par question, une probabilité par option, aucune génération — puis élargit le côté entrée. Là où Microsoft-Decision-1 est uniquement textuel par conception, d3-flash accepte du texte ou du JSON, plusieurs images par requête jusqu'à 1,6 mégapixel chacune, et plusieurs vidéos lues à 2 images par seconde. Chaque question d'une requête voit chaque image et vidéo qui lui sont attachées. C'est un modèle plus petit qui fait plus avec l'entrée qu'on lui fournit.

C'est la première véritable fracture, et ce n'est pas une question de goût. Si la décision que vous devez prendre porte sur une capture d'écran, un reçu, un graphique ou une séquence filmée par une caméra, Microsoft-Decision-1 ne peut pas la prendre. C'est une limite de capacité, pas un écart de qualité, et aucun travail sur la précision ne la comble.

Ce que chacun publie, et comment

Ici, les deux versions apportent des preuves de nature véritablement différente, et il vaut la peine de les distinguer plutôt que d'aligner des chiffres.

Microsoft a mené une comparaison de 36 benchmarks portant sur près de 150 000 questions tenues à l'aveugle par rapport à l'entraînement, couvrant le routage, le classement, le contexte long, les tâches multilingues et hors distribution, le raisonnement et la sécurité, et affirme que son modèle est arrivé en tête sur tous ces ensembles. Il rapporte la latence sous forme de ratio plutôt que de chiffre — p50 environ 35 fois plus rapide que GPT-6 Sol, et 2,5 fois plus rapide que H2O-Lightning-4B v1.1, qu'il désigne comme le deuxième. Il documente la robustesse comme une procédure : la même requête perturbée de huit façons, un taux moyen de basculement de décision de 1,3 %, et aucun basculement lorsque les descriptions d'options sont paraphrasées ou que les options sont inversées ou mélangées. Il a testé la sécurité sur 5 250 requêtes réparties sur 11 benchmarks couvrant les contenus nuisibles, le jailbreaking et l'injection de prompts. Il énonce la norme de calibration à laquelle il se tient — une prédiction à 90 % devrait être correcte environ neuf fois sur dix sur des cas représentatifs.

vLLM-SR a publié un indice. Le Jev Decision Index 0.3.1 place d3 à 64,7, avec d3-flash à 57,79 sur la suite publique, un gain revendiqué de 11,0 par rapport au modèle 9B de Decision 2.0 à 46,76. Il affirme aussi que les 140 178 requêtes publiques ont toutes reçu une réponse, aucune n'étant non prise en charge, ce qui est une déclaration de couverture plutôt qu'une déclaration d'exactitude. La fiche indique que la ligne de d3 elle-même est une évaluation interne, tandis que les lignes de comparaison à côté — Perplexity Decider v1.1, Fastino GLiDE, Jev, Torchcast Decision 27B — sont des données de classement en direct. Et du côté multimodal, les modèles de la famille d3 rapportent des scores au Perception Test sur les 19 140 questions de validation, avec d3-flash à 73,3 contre un seuil de hasard à trois options de 33,3.

Donc : Microsoft publie une revendication d’étendue avec une méthode documentée et un chiffre de robustesse, mais aucune donnée de calibration par point de contrôle. vLLM-SR publie une position dans un classement avec un écart de provenance déclaré entre sa propre ligne et les autres, plus un résultat vidéo, et aucune donnée de calibration non plus. Aucune des deux cartes ne comporte de score de Brier ni de chiffre d’erreur de calibration attendue pour le modèle qu’elle décrit. Pour deux produits dont toute la proposition de valeur repose sur le fait que le nombre renvoyé signifie quelque chose, c’est là le trou commun, et c’est la chose la plus utile que l’un ou l’autre fournisseur pourrait livrer ensuite.

A generated two-column scoreboard headed 'Decision 3.0 d3-flash vs Microsoft-Decision-1 - the scoreboard'. The left column for d3-flash reads: base model Qwen3.5-9B fine-tuned, 8.39B parameters; distribution Apache-2.0 weights on Hugging Face from 10 October 2026; input text, images and video; context budget not stated on the card; reported accuracy Jev Decision Index 0.3 public suite 57.79, an internal evaluation; latency median 19.1 ms text, 149.4 ms image and 407.6 ms video. The right column for Microsoft-Decision-1 reads: base model Qwen3.5-9B post-trained, weights not distributed; distribution hosted on Microsoft Foundry, generally available 8 October 2026; input text only; context budget 32,768 tokens; reported accuracy best of 36 benchmarks covering nearly 150,000 blind questions; latency p50 around 35 times faster than GPT-6 Sol. A footer reads 'd3-flash figures are vLLM-SR's own internal evaluation; Microsoft-Decision-1 figures are Microsoft's own; neither is independently reproduced.'

La distribution pèse plus lourd que la fiche technique

C'est ici que la comparaison cesse de porter sur les modèles.

Avec d3-flash, vous obtenez les poids, un decision_config.json qui fixe la révision de base, un manifeste SHA-256 par fichier, du code de modélisation personnalisé, une tête de lecture, et un ensemble de dépendances documenté qui inclut transformers==5.17.0 et un paquet de noyaux CUDA optionnel pour les couches d'attention linéaire. Vous pouvez l'exécuter sur votre propre matériel, l'affiner, le quantifier, l'isoler en air-gap. Vous assumez également le travail opérationnel : une classe Python n'est pas un point de terminaison, et la fiche n'indique pas de budget de tokens pour l'état, les questions et les descriptions des candidats — max_length est null dans la configuration livrée, donc ce plafond, c'est à vous de le découvrir.

Avec Microsoft-Decision-1vous obtenez un point de terminaison au sein d’un compte cloud existant, avec l’authentification, la disponibilité régionale et les contrôles de provisionnement qui l’accompagnent, et vous n’avez aucun travail opérationnel. Vous n’avez pas non plus le contrôle. Il n’y a aucun dépôt à télécharger, aucun parcours de fine-tuning et aucune option d’auto-hébergement ; le cycle de vie du modèle est celui de Microsoft, pas le vôtre, et un avis de dépréciation ou une réimplantation sur un autre backbone est un changement que vous subissez plutôt qu’un changement que vous planifiez. Microsoft a annoncé qu’une réimplantation sur ses propres modèles MAI était à venir, ce qui constitue une feuille de route raisonnable pour un modèle dont tout l’intérêt est un scoring rapide en une seule passe, et signifie aussi que le checkpoint précis que vous avez évalué n’est pas nécessairement celui que vous appellerez dans un an.

L'histoire de la latence mérite aussi d'être lue attentivement. Le chiffre phare de Microsoft est un ratio par rapport à un modèle généraliste bien plus grand, ce qui est la comparaison correcte pour son argument : le rôle d'un modèle de décision est de remplacer un appel génératif coûteux par un appel de notation bon marché, et 35x face à GPT-6 Sol au p50, voilà à quoi ressemble cet argument lorsqu'il fait mouche. Les chiffres de vLLM-SR sont absolus, pour une requête unique et un seul GPU, et ils montrent clairement la taxe liée à la modalité : sur un AMD Instinct MI325X, une requête texte adressée à d3-flash prend une médiane de 19,1 ms, la même requête avec une image prend 149,4 ms, et avec une vidéo de dix secondes, 407,6 ms. Les deux séries de chiffres sont déclarées par le fournisseur, sur du matériel différent, et aucune des deux n'a été reproduite en dehors du laboratoire qui les a produites.

A screenshot of the vllm-sr/d3 model card on Hugging Face, the flagship checkpoint of the Decision 3.0 family that d3-flash belongs to. The header shows 18 likes, the vLLM Semantic Router organisation, and tags for Transformers, Safetensors, qwen3_5, feature-extraction, decision-model, classification, system-one, multimodal, vision, video, custom_code and an Apache-2.0 licence, with the model size listed as 26B parameters in BF16. The card graphic reads 'Decision 3.0 / d3 27B'. A specification panel gives Parameters as 26.09B including the 0.46B vision encoder, Inputs as 'Text or JSON, plus images and videos (several per request)', Decision types as 'Choice - Yes / No - Score' and License as Apache-2.0. The sidebar shows 130 downloads last month, the model tree pinned to Qwen/Qwen3.8-27B, and a collection entry listing 6 items.

Comment choisir

La règle de décision est courte, ce qui est bon signe : les deux produits ne sont pas réellement en concurrence pour le même créneau.

Prenez Microsoft-Decision-1 si la décision est purement textuelle, si vous tournez déjà sur Foundry et si le fait qu'il s'agisse d'un appel plutôt que d'un déploiement est tout l'intérêt — pas de GPU à acheter, pas de conteneur à exploiter, pas de cycle de vie de modèle à gérer. La documentation d'accompagnement de Microsoft est aussi la plus exploitable des deux pour une équipe plateforme : les perturbations, le nombre de tests de sûreté et l'affirmation qu'une option d'abstention est prise en charge sont les éléments dont vous avez besoin pour rédiger une politique de seuil, et le plafond de 32 768 jetons est indiqué plutôt que laissé vide.

Choisissez Decision 3.0 — concrètement d3-flash ou d3-mini — si une partie de la décision dépend d'une image ou d'un clip, si vous devez l'exécuter à un endroit inaccessible à une API hébergée, ou si vous voulez affiner le scorer sur vos propres cas étiquetés. La licence Apache-2.0 et le manifeste de hachage au niveau des fichiers font de cette option un choix bien réel plutôt que théorique. Ce que vous acceptez en échange, c'est un budget d'entrée non déclaré, aucune calibration publiée, et le fait que la famille n'a que quelques jours et ne s'appuie sur pratiquement aucun usage extérieur.

Si vous avez besoin des deux — un scorer hébergé pour le chemin texte de routine et un scorer auto-hébergé pour les cas multimodaux ou isolés du réseau (air-gapped), appelés via la même interface —, alors la position honnête est qu'aucun fournisseur ne vous offre cela aujourd'hui, et les deux formats de requête sont suffisamment proches pour être unifiés, mais pas identiques.

Où OrcaRouter se situe, et où il ne se situe pas

typesafe/jev-1.13 est le modèle de décision de notre catalogue, servi via POST /v1/systemone avec le même contrat d'état et de questions nommées que les deux modèles ci-dessus implémentent : texte en entrée, JSON structuré en sortie, jusqu'à environ 64K jetons en entrée, sans streaming, 0,042 $ par million de jetons d'entrée, sans frais de complétion puisqu'il n'en produit jamais. À noter que la question du budget de jetons de type Android, à laquelle aucune des deux fiches ci-dessus ne répond entièrement, trouve ici sa réponse.

Nous ne proposons aucun des deux modèles de cette comparaison. Les checkpoints de Decision 3.0 sont fournis sous forme de chemin d’inférence local dans un dépôt Hugging Face plutôt que de point de terminaison routable, et Microsoft-Decision-1 est distribué via la plateforme de Microsoft elle-même et plusieurs plateformes tierces — pas via nous. Rien ici ne doit être interprété comme une affirmation de disponibilité pour l’un ou l’autre.

Ce que la couche de routage apporte réellement à cette décision se joue dans l'autre moitié de la boucle. Un scorer coûte peu par construction ; le modèle qui agit sur sa sortie, lui, ne coûte pas peu, et associer un modèle de décision à un modèle génératif implique normalement deux intégrations, deux relations de facturation et deux modes de défaillance. Appeler les deux avec une seule clé parmi plus de 200 modèles — avec bascule automatique en cas de défaillance d'un fournisseur, et le prix catalogue du fournisseur répercuté à 0 % de marge, de sorte qu'un changement de tarif d'un fournisseur soit pris en compte le jour même — signifie que vous pouvez remplacer le scorer sans toucher au point d'appel. Cela compte plus que d'habitude ici, car ces deux modèles sont suffisamment récents pour que la décision que vous prenez cette semaine soit une décision que vous devriez pouvoir inverser le mois prochain.

A screenshot of the OrcaRouter models catalogue, headed 'Models - 207 models - 16 providers - one API key, one bill'. Filter tabs read All 207, Text 172, Image 10, Embeddings 5, Video 10 and TTS 10. A panel titled 'How to call any model' lists three steps - copy the model ID from any card, paste it into the model field, POST to our OpenAI-compatible endpoint - beside a code block showing POST https://api.orcarouter.ai/v1/chat/completions. Model cards below include OpenAI: GPT-6.1 Sol and Anthropic: Claude Sonnet 5.5 at $2.00 per million input tokens and $10.00 output, and TypeSafe: Jev 1.13 at 65K context with $0.042 per million input tokens and $0.042 per million output tokens. A credit panel above shows monthly plans from $50 to $1,000.

La question qui décidera de cela dans six mois

Deux équipes ont post-entraîné le même point de contrôle de base pour en faire un produit de même forme la même semaine et en ont tiré des conclusions opposées sur la manière dont il devrait parvenir à un client. Ce n'est pas tant une coïncidence de calendrier qu'une bifurcation dans la façon dont la catégorie se vend : comme des poids ou comme un service, comme une chose que l'on possède ou une chose que l'on appelle.

Surveillez trois signaux. Que le rebasage de Microsoft sur MAI ou sur ses propres modèles modifie la précision et le comportement que Microsoft vend actuellement — et l'ampleur du préavis accordé aux clients. Que vLLM-SR publie un budget d'entrée et un chiffre de calibration pour Decision 3.0, comblant ainsi l'écart qui empêche son indice d'être exploitable. Et que quelqu'un en dehors de l'un ou l'autre laboratoire exécute la suite publique sur les poids d3 publiés, car pour l'instant le seul chiffre qui trancherait cette comparaison est celui qu'aucun des deux fournisseurs n'a produit.