
Microsoft-Decision-1 vs Liquid AI d1-3B : même fenêtre de 32K, deux sens différents
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 par million de tokens
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
Pour une fois, la spécification concorde. Microsoft-Decision-1, en disponibilité générale sur Microsoft Foundry depuis le 8 octobre 2026, utilise 32 768 jetons de contexte. Il en va de même pour Liquid AI d1-3B, téléversé sur Hugging Face le 5 octobre 2026 et annoncé par Liquid AI deux jours plus tard. Tous deux acceptent un état plus un ensemble de questions typées — oui/non, choix parmi des options nommées, une position sur une échelle ordonnée — et tous deux répondent en une seule passe avant avec une distribution de probabilité au lieu de texte généré ; Laya, Intern-Decision-4B, Kev et le reste de cette niche ne sont pas d'accord entre eux sur la longueur du contexte, donc c'est le seul appariement où cette dimension disparaît et où la comparaison doit être argumentée sur autre chose.
L’autre élément s’avère être le canal d’entrée. Le modèle de Microsoft est strictement textuel, et ce de manière explicite : il « n’accepte ni ne produit de contenu image, audio ou vidéo ». Celui de Liquid AI embarque un encodeur visuel SigLIP2 NaFlex de 400 millions de paramètres sur une base linguistique de 2,6 milliards de paramètres et atteint 3,12 milliards de paramètres au total, et il a été conçu exactement pour ce que Microsoft a écarté — l’évaluation d’une capture d’écran, d’un formulaire numérisé ou d’une image de caméra par rapport à une question fixe. Ce clivage, ajouté à une différence de licence qui n’a rien à voir avec la capacité, constitue toute la confrontation.
Là où les deux sont d’accord, ce qui est plus qu’on ne pourrait s’y attendre.
•Fenêtre de contexte — 32 768 jetons pour Microsoft-Decision-1 et Lavie AI d-3B.
• Forme de sortie — probabilités calibrées sur les options fournies ; ni l'un ni l'autre ne génère de texte, et le compteur d'utilisation de Liquid AI rapporte le fait comme output_tokens: 0.
• Types de questions — à la fois le choix de document, le score ordonné et le oui/non binaire, et tous deux vous permettent de définir l’ensemble d’options par requête plutôt que de réentraîner une tête de vocabulaire.
• Abstention — Microsoft documente des options d'abstention explicites telles que « cannot tell » ; le schéma Decision Index de Liquid AI prend en charge cette même possibilité via son ensemble d'options.
• Inférence en un seul passage — un seul appel par décision des deux côtés, ce qui rend chacune d'elles viable au volume d'un pipeline.
Que deux modèles s’accordent sur les deux contraintes les plus difficiles de ce créneau mérite que l’on s’y attarde. Une fenêtre de 32K est ce qui rend un évaluateur de décisions utilisable sur un contrat complet, une politique de plusieurs pages ou un long fil d’assistance ; ce n’est pas le cas du checkpoint English Laya à 512 tokens ni des limites de questions par appel d’Intern-Decision-4B. Si votre entrée est courte, la plupart des options de ce domaine sont interchangeables et la décision porte sur l’hébergement. Si votre entrée est longue, le champ se réduit à ces deux-là.
Le sentiment que seul l'un d'eux a
Liquid AI d1-3B est multimodal, et l'arbre des modèles rend la filiation évidente : LFM2.5-2.6B-Base, puis LFM2.5-VL-3B, puis d1-3B post-entraîné pour des décisions calibrées en une seule passe. Les images entrent via l'encodeur SigLIP2 NaFlex, et la fiche indique une moyenne de 74,1 sur onze benchmarks publics d'images, contre 73,9 pour le modèle de vision de base — le réglage décisionnel ne lui a donc pas coûté en qualité de vision. Elle rapporte aussi l'expérience inverse : retirez les images et les mêmes questions chutent à 45,1, ce qui constitue la preuve la plus nette que le canal de perception est porteur et non décoratif.
Microsoft-Decision-1 n'a pas d'équivalent, et cette omission est délibérée plutôt que le signe d'un travail inachevé. La fiche de Microsoft répertorie les usages hors périmètre comme la génération de texte, la réponse à des questions ouvertes, la conversation, la traduction et le résumé, et indique séparément que le modèle est uniquement textuel. Pour un pipeline qui doit évaluer la capture d'écran d'un formulaire par rapport à une grille d'évaluation, ou déterminer si une image de caméra contient un événement de sécurité, c'est un arrêt net — aucune ingénierie de prompt ne peut récupérer une modalité qui n'a jamais été fournie au modèle.
Les décomptes de langues vont dans l’autre sens, et c’est la deuxième véritable fracture. Microsoft-Decision-1 répertorie 25 langues prises en charge, et l’entreprise reconnaît ouvertement que la couverture, la qualité et la calibration « peuvent varier selon la langue », citant les langues autres que l’anglais, et surtout les langues à faibles ressources, comme un domaine de sous-performance. Liquid AI d1-3B annonce 16 langues. Sur l’étendue, Microsoft est en tête sur le papier ; sur l’honnêteté quant à ce que signifie cette étendue, les deux fournisseurs tiennent un discours similaire, et aucun n’a publié de calibration par langue.

Encore l'onglet benchmark
La page Foundry de Microsoft-Decision-1 comporte un onglet Benchmarks avec une section méthodologie et aucun chiffre : des benchmarks de décision publics et communautaires, ainsi que des ensembles internes tenus à l'écart, des métriques couvrant l'exactitude et l'erreur de calibration, l'ordre des options variant, des tests statistiques appariés, et une affirmation selon laquelle le modèle « affiche des performances équivalentes à celles des principaux modèles de décision et supérieures à celles des autres modèles de décision ouverts évalués selon la même méthodologie ». Rien à vérifier, rien à reproduire.
Liquid AI d1-3B affiche 48,57 sur Decision Index 0.2.1 — et la nuance compte plus que le chiffre, car Decision Index est l'indice propre de Liquid AI et d1-3B est le modèle propre de Liquid AI. C'est un résultat noté par le fournisseur sur un benchmark rédigé par le fournisseur, présenté par l'entreprise comme le meilleur parmi les modèles de décision de moins de 10B et devant un modèle de 35B sur la même échelle. Considérez 48,57 comme une affirmation indicative, et non comme un chiffre audité. À côté de cela, la fiche indique des évaluations internes de format de décision à une moyenne de 77,1, SQuAD 2.0 à 85,3, PAWS-X à 76,9 et DecisionBench 71,8 — toutes auto-déclarées, et la formulation « moins de 10B » est une véritable nuance plutôt qu'une échappatoire, puisque le modèle fait 3,12B.
Donc, la question de la calibration se résout de la même manière que dans l’ensemble de ce domaine : Liquid AI vous donne un chiffre produit selon sa propre échelle, Microsoft vous donne une méthodologie et aucun chiffre, et ni l’un ni l’autre ne vous donne une mesure indépendante réalisée par un tiers. Le seul chiffre de calibration qui comptera pour votre déploiement est celui que vous calculez sur vos propres données étiquetées.

Le service, les licences et ce que vous achetez réellement
La latence de d1-3B est publiée et c’est la raison d’être du modèle. Huit millisecondes par décision sur une RTX 4090, neuf sur une AMD MI325X, avec un débit en mode packed de 475 et 1 106 par seconde à 64 états. Sur matériel edge : 30 ms sur un Apple M5 Pro, 16 ms sur un Jetson AGX Thor, 26 ms sur un Jetson AGX Orin 64 GB, 50 ms sur un Jetson AGX Orin Nano. Microsoft-Decision-1 ne publie aucun chiffre de latence du tout, et ses options intégrées dès la conception — une API Foundry hébergée en paiement à l’usage ou en débit provisionné réservé, avec l’inférence par lots désactivée — impliquent que vous la mesurez via votre propre déploiement. Ce n’est pas un écart négligeable pour un modèle dont toute la raison d’être est d’être appelé une fois par document récupéré ou par action proposée.
La licence est le point où les deux divergent d'une manière qui surprend. Liquid AI d1-3B est étiqueté lfm1.0, et non Apache 2.0 — la même licence de famille que le reste de la gamme LFM de Liquid, qui comporte des conditions d'utilisation qu'une licence permissive ne comporte pas. Si votre service juridique comprend cela comme « compatible OpenAI, sans aucune contrainte », ce n'est pas le cas ici, et il vaut mieux le lire avant que le modèle ne soit livré plutôt qu'après. Microsoft-Decision-1 n'a aucun poids du tout : c'est un point de terminaison hébergé dans le portefeuille Direct from Azure, avec authentification Azure, facturation unifiée, aucun téléchargement, et la question de la licence remplacée par un accord de service. Aucun des deux modèles ne peut être affiné par les voies documentées par les fournisseurs, ce qui constitue la limitation la plus marquante pour un modèle de décision — un scoreur que vous ne pouvez pas adapter à vos propres étiquettes est un scoreur dont vous ne pouvez pas corriger les modes d'erreur, seulement contourner.
Le routage autour d’eux est là où OrcaRouter a sa place dans ce schéma, et uniquement d’un seul côté de celui-ci. Nous n’hébergeons ni Microsoft-Decision-1 ni Liquid AI d1-3B : aucun des deux ne renvoie de texte, aucun des deux ne figure dans notre catalogue, et un point de terminaison de notation de probabilité n’est pas une cible de complétions de chat. Ce que nous prenons en charge, c’est la moitié génératrice de la boucle — le modèle qui rédige la réponse que votre évaluateur notera, extrait les champs que votre évaluateur jugera, ou propose l’action que votre évaluateur approuvera. Cela représente plus de 200 modèles derrière une seule clé compatible OpenAI au prix catalogue du fournisseur, répercuté avec 0 % de marge, donc un changement de prix d’un fournisseur est effectif de notre côté le jour même, et le basculement automatique couvre l’appel de génération dans une boucle qui n’a aucune latence disponible pour en réessayer un.

Deux choix nets, et un qui ne l’est pas du tout.
Choisissez Liquid AI d1-3B si l’un des éléments de votre pipeline est une image. Tri de captures d’écran, extraction de formulaires, routage d’assurance qualité visuelle, un modérateur qui note des images de caméra — Microsoft-Decision-1 ne peut pas être amené à faire cela, et d1-3B a été conçu pour cela, avec les benchmarks de vision publiés à l’appui de cette affirmation. Choisissez-le aussi si vous avez besoin d’une inférence en périphérie mesurée en dizaines de millisecondes sur un Jetson ou un ordinateur portable, si vous voulez le modèle sur votre propre matériel, ou si une licence que vous pouvez lire suffit à vos conseillers juridiques.
Choisissez Microsoft-Decision-1 si votre entrée est du texte, que vos documents sont longs, que votre validation passe par les achats — authentification Azure, facturation unifiée, une évaluation d’IA responsable, un fournisseur à qui escalader — ou que votre trafic couvre plus des 16 langues répertoriées par d1-3B. Acceptez que l’absence de chiffre de latence et de tableau de référence signifie que vos deux premières semaines avec lui relèvent de la mesure, et non de l’intégration.
Le seul cas qui ne prête pas à discussion est le travail multimodal : là, le choix a été fait lorsque Microsoft a inscrit « text-only » dans la fiche du modèle.
