Carte de titre générée pour Microsoft-Decision-1 vs Liquid AI d1-3B, sous-titrée « les deux seuls modèles de décision qui s'accordent sur la fenêtre de contexte », avec des puces indiquant 32 768 tokens pour les deux, texte uniquement vs texte, images et audio, 25 langues vs 16, API hébergée vs poids lfm1.0, et un pied de page précisant que les chiffres des deux fournisseurs sont auto-déclarés et non vérifiés.
Guides & Insights

Microsoft-Decision-1 vs Liquid AI d1-3B : même fenêtre de 32K, deux sens différents

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Pour une fois, la spécification concorde. Microsoft-Decision-1, en disponibilité générale sur Microsoft Foundry depuis le 8 octobre 2026, utilise 32 768 jetons de contexte. Il en va de même pour Liquid AI d1-3B, téléversé sur Hugging Face le 5 octobre 2026 et annoncé par Liquid AI deux jours plus tard. Tous deux acceptent un état plus un ensemble de questions typées — oui/non, choix parmi des options nommées, une position sur une échelle ordonnée — et tous deux répondent en une seule passe avant avec une distribution de probabilité au lieu de texte généré ; Laya, Intern-Decision-4B, Kev et le reste de cette niche ne sont pas d'accord entre eux sur la longueur du contexte, donc c'est le seul appariement où cette dimension disparaît et où la comparaison doit être argumentée sur autre chose.

L’autre élément s’avère être le canal d’entrée. Le modèle de Microsoft est strictement textuel, et ce de manière explicite : il « n’accepte ni ne produit de contenu image, audio ou vidéo ». Celui de Liquid AI embarque un encodeur visuel SigLIP2 NaFlex de 400 millions de paramètres sur une base linguistique de 2,6 milliards de paramètres et atteint 3,12 milliards de paramètres au total, et il a été conçu exactement pour ce que Microsoft a écarté — l’évaluation d’une capture d’écran, d’un formulaire numérisé ou d’une image de caméra par rapport à une question fixe. Ce clivage, ajouté à une différence de licence qui n’a rien à voir avec la capacité, constitue toute la confrontation.

Là où les deux sont d’accord, ce qui est plus qu’on ne pourrait s’y attendre.

•Fenêtre de contexte — 32 768 jetons pour Microsoft-Decision-1 et Lavie AI d-3B.

• Forme de sortie — probabilités calibrées sur les options fournies ; ni l'un ni l'autre ne génère de texte, et le compteur d'utilisation de Liquid AI rapporte le fait comme output_tokens: 0.

• Types de questions — à la fois le choix de document, le score ordonné et le oui/non binaire, et tous deux vous permettent de définir l’ensemble d’options par requête plutôt que de réentraîner une tête de vocabulaire.

• Abstention — Microsoft documente des options d'abstention explicites telles que « cannot tell » ; le schéma Decision Index de Liquid AI prend en charge cette même possibilité via son ensemble d'options.

• Inférence en un seul passage — un seul appel par décision des deux côtés, ce qui rend chacune d'elles viable au volume d'un pipeline.

Que deux modèles s’accordent sur les deux contraintes les plus difficiles de ce créneau mérite que l’on s’y attarde. Une fenêtre de 32K est ce qui rend un évaluateur de décisions utilisable sur un contrat complet, une politique de plusieurs pages ou un long fil d’assistance ; ce n’est pas le cas du checkpoint English Laya à 512 tokens ni des limites de questions par appel d’Intern-Decision-4B. Si votre entrée est courte, la plupart des options de ce domaine sont interchangeables et la décision porte sur l’hébergement. Si votre entrée est longue, le champ se réduit à ces deux-là.

Le sentiment que seul l'un d'eux a

Liquid AI d1-3B est multimodal, et l'arbre des modèles rend la filiation évidente : LFM2.5-2.6B-Base, puis LFM2.5-VL-3B, puis d1-3B post-entraîné pour des décisions calibrées en une seule passe. Les images entrent via l'encodeur SigLIP2 NaFlex, et la fiche indique une moyenne de 74,1 sur onze benchmarks publics d'images, contre 73,9 pour le modèle de vision de base — le réglage décisionnel ne lui a donc pas coûté en qualité de vision. Elle rapporte aussi l'expérience inverse : retirez les images et les mêmes questions chutent à 45,1, ce qui constitue la preuve la plus nette que le canal de perception est porteur et non décoratif.

Microsoft-Decision-1 n'a pas d'équivalent, et cette omission est délibérée plutôt que le signe d'un travail inachevé. La fiche de Microsoft répertorie les usages hors périmètre comme la génération de texte, la réponse à des questions ouvertes, la conversation, la traduction et le résumé, et indique séparément que le modèle est uniquement textuel. Pour un pipeline qui doit évaluer la capture d'écran d'un formulaire par rapport à une grille d'évaluation, ou déterminer si une image de caméra contient un événement de sécurité, c'est un arrêt net — aucune ingénierie de prompt ne peut récupérer une modalité qui n'a jamais été fournie au modèle.

Les décomptes de langues vont dans l’autre sens, et c’est la deuxième véritable fracture. Microsoft-Decision-1 répertorie 25 langues prises en charge, et l’entreprise reconnaît ouvertement que la couverture, la qualité et la calibration « peuvent varier selon la langue », citant les langues autres que l’anglais, et surtout les langues à faibles ressources, comme un domaine de sous-performance. Liquid AI d1-3B annonce 16 langues. Sur l’étendue, Microsoft est en tête sur le papier ; sur l’honnêteté quant à ce que signifie cette étendue, les deux fournisseurs tiennent un discours similaire, et aucun n’a publié de calibration par langue.

A generated two-column scoreboard for Microsoft-Decision-1 and Liquid AI d1-3B across six shared dimensions: context window 32,768 tokens for both; modality text-only versus text, images and audio through a 400M SigLIP2 NaFlex encoder on a 3.12B model; languages 25 versus 16; published scores none versus a vendor-scored value of 48.57 on Liquid AI's own Decision Index; weights not distributed versus lfm1.0 weights on Hugging Face; and latency not published versus 8 ms per decision on an RTX 4090 and 30 ms on an Apple M5 Pro. A footer notes both vendors' figures are self-reported and unreproduced.

Encore l'onglet benchmark

La page Foundry de Microsoft-Decision-1 comporte un onglet Benchmarks avec une section méthodologie et aucun chiffre : des benchmarks de décision publics et communautaires, ainsi que des ensembles internes tenus à l'écart, des métriques couvrant l'exactitude et l'erreur de calibration, l'ordre des options variant, des tests statistiques appariés, et une affirmation selon laquelle le modèle « affiche des performances équivalentes à celles des principaux modèles de décision et supérieures à celles des autres modèles de décision ouverts évalués selon la même méthodologie ». Rien à vérifier, rien à reproduire.

Liquid AI d1-3B affiche 48,57 sur Decision Index 0.2.1 — et la nuance compte plus que le chiffre, car Decision Index est l'indice propre de Liquid AI et d1-3B est le modèle propre de Liquid AI. C'est un résultat noté par le fournisseur sur un benchmark rédigé par le fournisseur, présenté par l'entreprise comme le meilleur parmi les modèles de décision de moins de 10B et devant un modèle de 35B sur la même échelle. Considérez 48,57 comme une affirmation indicative, et non comme un chiffre audité. À côté de cela, la fiche indique des évaluations internes de format de décision à une moyenne de 77,1, SQuAD 2.0 à 85,3, PAWS-X à 76,9 et DecisionBench 71,8 — toutes auto-déclarées, et la formulation « moins de 10B » est une véritable nuance plutôt qu'une échappatoire, puisque le modèle fait 3,12B.

Donc, la question de la calibration se résout de la même manière que dans l’ensemble de ce domaine : Liquid AI vous donne un chiffre produit selon sa propre échelle, Microsoft vous donne une méthodologie et aucun chiffre, et ni l’un ni l’autre ne vous donne une mesure indépendante réalisée par un tiers. Le seul chiffre de calibration qui comptera pour votre déploiement est celui que vous calculez sur vos propres données étiquetées.

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text describes a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, with quick facts listing publisher Microsoft, lifecycle Generally available (GA), context window 32768 and a Pricing field that links out rather than printing a rate.

Le service, les licences et ce que vous achetez réellement

La latence de d1-3B est publiée et c’est la raison d’être du modèle. Huit millisecondes par décision sur une RTX 4090, neuf sur une AMD MI325X, avec un débit en mode packed de 475 et 1 106 par seconde à 64 états. Sur matériel edge : 30 ms sur un Apple M5 Pro, 16 ms sur un Jetson AGX Thor, 26 ms sur un Jetson AGX Orin 64 GB, 50 ms sur un Jetson AGX Orin Nano. Microsoft-Decision-1 ne publie aucun chiffre de latence du tout, et ses options intégrées dès la conception — une API Foundry hébergée en paiement à l’usage ou en débit provisionné réservé, avec l’inférence par lots désactivée — impliquent que vous la mesurez via votre propre déploiement. Ce n’est pas un écart négligeable pour un modèle dont toute la raison d’être est d’être appelé une fois par document récupéré ou par action proposée.

La licence est le point où les deux divergent d'une manière qui surprend. Liquid AI d1-3B est étiqueté lfm1.0, et non Apache 2.0 — la même licence de famille que le reste de la gamme LFM de Liquid, qui comporte des conditions d'utilisation qu'une licence permissive ne comporte pas. Si votre service juridique comprend cela comme « compatible OpenAI, sans aucune contrainte », ce n'est pas le cas ici, et il vaut mieux le lire avant que le modèle ne soit livré plutôt qu'après. Microsoft-Decision-1 n'a aucun poids du tout : c'est un point de terminaison hébergé dans le portefeuille Direct from Azure, avec authentification Azure, facturation unifiée, aucun téléchargement, et la question de la licence remplacée par un accord de service. Aucun des deux modèles ne peut être affiné par les voies documentées par les fournisseurs, ce qui constitue la limitation la plus marquante pour un modèle de décision — un scoreur que vous ne pouvez pas adapter à vos propres étiquettes est un scoreur dont vous ne pouvez pas corriger les modes d'erreur, seulement contourner.

Le routage autour d’eux est là où OrcaRouter a sa place dans ce schéma, et uniquement d’un seul côté de celui-ci. Nous n’hébergeons ni Microsoft-Decision-1 ni Liquid AI d1-3B : aucun des deux ne renvoie de texte, aucun des deux ne figure dans notre catalogue, et un point de terminaison de notation de probabilité n’est pas une cible de complétions de chat. Ce que nous prenons en charge, c’est la moitié génératrice de la boucle — le modèle qui rédige la réponse que votre évaluateur notera, extrait les champs que votre évaluateur jugera, ou propose l’action que votre évaluateur approuvera. Cela représente plus de 200 modèles derrière une seule clé compatible OpenAI au prix catalogue du fournisseur, répercuté avec 0 % de marge, donc un changement de prix d’un fournisseur est effectif de notre côté le jour même, et le basculement automatique couvre l’appel de génération dans une boucle qui n’a aucune latence disponible pour en réessayer un.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

Deux choix nets, et un qui ne l’est pas du tout.

Choisissez Liquid AI d1-3B si l’un des éléments de votre pipeline est une image. Tri de captures d’écran, extraction de formulaires, routage d’assurance qualité visuelle, un modérateur qui note des images de caméra — Microsoft-Decision-1 ne peut pas être amené à faire cela, et d1-3B a été conçu pour cela, avec les benchmarks de vision publiés à l’appui de cette affirmation. Choisissez-le aussi si vous avez besoin d’une inférence en périphérie mesurée en dizaines de millisecondes sur un Jetson ou un ordinateur portable, si vous voulez le modèle sur votre propre matériel, ou si une licence que vous pouvez lire suffit à vos conseillers juridiques.

Choisissez Microsoft-Decision-1 si votre entrée est du texte, que vos documents sont longs, que votre validation passe par les achats — authentification Azure, facturation unifiée, une évaluation d’IA responsable, un fournisseur à qui escalader — ou que votre trafic couvre plus des 16 langues répertoriées par d1-3B. Acceptez que l’absence de chiffre de latence et de tableau de référence signifie que vos deux premières semaines avec lui relèvent de la mesure, et non de l’intégration.

Le seul cas qui ne prête pas à discussion est le travail multimodal : là, le choix a été fait lorsque Microsoft a inscrit « text-only » dans la fiche du modèle.