Une carte de titre générée pour Microsoft-Decision-1 vs Liquid AI d1-omni-600M, sous-titrée « la plus large surface de capteurs de la catégorie face à la liste d'entrées la plus étroite », avec des puces affichant 587 M de paramètres avec vision et audio, une API Foundry texte uniquement, 30 secondes de parole contre 32 768 jetons de texte, un encodeur bidirectionnel contre un décodeur post-entraîné, et aucune calibration publiée d'un côté comme de l'autre.
Engineering & Research

Microsoft-Decision-1 vs Liquid AI d1-omni-600M : un évaluateur qui écoute contre un évaluateur qui ne fait que lire

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Vous traitez des sinistres à un guichet d’assurance, et le dossier arrive sous forme de trois éléments : un PDF, une photographie d’une porte cabossée et un appel téléphonique de quatre-vingt-dix secondes. Liquid AI d1-omni-600M peut lire le document, examiner la photo et écouter l’appel, puis répondre à une série de questions que vous avez rédigées à l’avance — est-ce couvert, quelle catégorie, quelle gravité, sur une échelle de deux à dix — en une seule passe, sans générer de texte et sans rien à analyser. Microsoft-Decision-1 peut lire le document. Il est passé en disponibilité générale sur Microsoft Foundry le 8 octobre 2026 en tant que scoreur hébergé, uniquement textuel, post-entraîné sur Qwen3.5-9B avec une fenêtre de 32 768 jetons, et sa surface d’entrée s’arrête là : ni image, ni audio, ni vidéo. Tous deux renvoient des probabilités calibrées sur les options que vous fournissez, tous deux émettent zéro jeton de sortie, et aucun des deux n’a publié de chiffre de calibration.

Cette dernière phrase commune est la partie inconfortable de cette comparaison. Les deux sont les modèles de décision à capteur le plus large et à capteur le plus étroit à être livrés ce mois-ci, et malgré toute la distance architecturale qui les sépare, ils ont abouti exactement à la même position probatoire : de vrais poids ou un véritable point de terminaison, des contrats documentés, et aucun chiffre que quiconque en dehors du fournisseur puisse citer quand on demande si les probabilités sont dignes de confiance.

Deux ascendances, pas deux tailles.

Le chiffre de 587 M invite à voir Liquid AI d1-omni-600M comme un parent réduit des modèles dont ce blog a parlé auparavant. Ce n’est pas le cas. Le modèle est entraîné à partir de LFM2.5-Encoder-350M, un encodeur bidirectionnel, avec un tronc partagé et une tête de décision de 381 M, un encodeur visuel de 94 M issu de la gamme LFM2.5-VL-450M et un FastConformer à 17 couches pour l’audio. Microsoft-Decision-1 relève d’une tout autre lignée : un décodeur Qwen3.5-9B, post-entraîné par Microsoft, hébergé sur Foundry, poids non distribués et aucune voie de fine-tuning proposée.

L’opposition entre bidirectionnel et décodeur est le fait architectural qui détermine le comportement de chacun, et c’est aussi pourquoi le décompte des paramètres est une diversion. Un encodeur bidirectionnel lit l’ensemble de l’état d’un seul coup, ce qui correspond à la forme requise pour porter un jugement sur une entrée fixe ; un décodeur post-entraîné abandonne la voie de la génération, mais conserve le tokeniseur, la fenêtre et le packaging d’entreprise qui accompagnent un déploiement dans une fonderie. Ni l’un ni l’autre n’est une version mise à l’échelle de l’autre, et ils ne peuvent pas être interchangeés, quelle que soit la manière dont on lit un tableau de benchmarks.

Ce que la liste d'entrée vous apporte réellement

C'est ici que le d1-omni-600M se démarque le plus radicalement de tout le reste de la catégorie, et où une affirmation doit être lue avec attention.

• Parole — Liquid AI d1-omni-600M accepte du texte ainsi que jusqu’à 30 secondes de parole et rend une décision à ce sujet, ce qu’aucun évaluateur purement textuel ne peut faire, à quelque niveau de précision que ce soit. Les modalités non textuelles de Microsoft-Decision-1 n’existent pas.

• Exclusion mutuelle — le d1-omni-600M lève une ValueError si des images et de l’audio arrivent dans la même requête. La surface de capteurs la plus large de la catégorie reste encore une seule modalité non textuelle à la fois, ce qui constitue une contrainte réelle pour ce bureau des réclamations.

• Troncature — sa fiche indique 16 384 positions combinées de texte, d’image et d’audio, et précise que, lorsque des images sont présentes, le texte d’état et de question est réduit à 896 tokens pour correspondre à l’entraînement. Quel que soit le document auquel vous joignez une photo, il entre en concurrence avec cette troncature. Les 32 768 tokens de Microsoft-Decision-1 sont tous du texte et ne sont pas tronqués.

• Formats — le d1-omni-600M dispose de trois types de questions : noul pour une décision binaire renvoyant P(oui) entre 0 et 1, choice pour une étiquette provenant d'un ensemble que vous nommez avec une confiance et une probabilité par option, et score pour une position sur une échelle ordonnée de deux à dix niveaux avec sa distribution. Plusieurs questions dépendent d'un seul état et sont lues en une seule passe, et le compteur d'utilisation indique output_tokens: 0. Microsoft documente les formes oui/non, choix multiple, évaluation, classification et rubrique, ainsi qu'une option d'abstention explicitement prise en charge telle que « impossible de dire » lorsque les preuves sont insuffisantes — le seul détail de conception de la page Microsoft sans équivalent direct ici.

• Exécution — le d1-omni-600M embarque du code personnalisé, nécessite trust_remote_code=True, et sa fiche recommande le float16 sur GPU tout en avertissant que le bfloat16 a modifié la meilleure réponse sur certaines lignes. Il s'agit d'une sensibilité au moment du service, documentée par le fournisseur, et non d'un défaut. Microsoft-Decision-1 est un point de terminaison géré où la forme du déploiement constitue votre seule variable d'exécution, et il convient de noter que l'inférence par lots est désactivée : il n'existe aucun canal hors ligne permettant d'amortir une campagne de scoring en masse.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Liquid AI d1-omni-600M. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; base post-trained Qwen3.5-9B decoder; inputs text only; context 32,768 tokens of text, untrimmed; weights not distributed; calibration not published. Right column Liquid AI d1-omni-600M rows read: availability uploaded October 7, 2026; base LFM2.5-Encoder-350M bidirectional encoder with 587M total; inputs text, images, or 30 seconds of speech, one non-text modality at a time; context 16,384 positions with text trimmed to 896 tokens when images are present; weights open under lfm1.0; calibration not published. A footer line reads that neither vendor has published an accuracy or calibration benchmark for these models.

Le déficit de preuves, dans les deux sens

Liquid AI a publié la famille ouverte d1, y compris d1-omni-600M, le 7 octobre 2026, avec un article de publication et un ensemble de documentation. Ce qui n’est pas publié, c’est le nombre qui rendrait concrète l’affirmation multimodale. Il n’existe aucun benchmark de précision propre à sa capacité phare — la qualité de décision en vision et audio qui justifie les encodeurs 94M et 112M — et le volet vision est absent du matériel d’évaluation publié. Aucun chiffre de latence n’est non plus publié, le débit du modèle est donc quelque chose que vous découvrez sur votre propre matériel.

La position de Microsoft est structurellement identique, et même un cran plus loin. Son onglet Benchmarks nomme les métriques — exactitude, erreur de calibration, rappel de sécurité, taux de faux positifs, cohérence d'équité —, indique que l'évaluation a été menée sur des benchmarks de décision publics et communautaires ainsi que sur des ensembles de test internes mis de côté et non utilisés pour l'entraînement, que l'ordre des options a été varié, que des tests statistiques appariés ont été appliqués, et que le modèle « est au niveau des autres modèles de décision et devant les autres modèles de décision ouverts évalués selon la même méthodologie ». Il n'en publie aucun résultat. Vingt-cinq langues sont répertoriées, dont le japonais, le coréen, l'arabe, le vietnamien, le thaï, le turc, le bengali, le swahili, le persan et l'ukrainien, avec l'avertissement qui s'impose : la couverture, la qualité et la calibration « peuvent varier selon la langue » et les langues non anglaises, à faibles ressources, sont un point faible. Le tarif ne figure pas non plus sur la page du modèle ; un lien renvoie vers la page de tarification de Microsoft.

Ainsi, la comparaison entre ces deux-là n’oppose pas des preuves à des preuves. C’est un choix entre deux types de chiffre manquant. Liquid AI a livré la surface de capteur et laissé l’exactitude de cette surface non mesurée publiquement. Microsoft a livré le parcours d’approvisionnement — authentification Azure, gouvernance, une évaluation d’IA responsable, une méthodologie documentée — et laissé la calibration d’un produit probabiliste non quantifiée.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as released that day, d1-3B's 48.57 Decision Index v0.2.1 score, and its 8 ms, 16 ms and 26 ms latencies on an RTX 4090, a Jetson AGX Thor and a Jetson AGX Orin.

La question de calibration à laquelle aucun des deux ne répond

Pour un modèle de décision, la probabilité est le produit. Tout ce qui se trouve en aval est un seuil : 0,7 déclenche une escalade, 0,95 accepte automatiquement, et le coût d'un mauvais tracé de cette ligne se paie en mauvaises décisions automatisées plutôt qu'en tokens. Dans cette catégorie, il existe au moins une famille qui publie les chiffres — les checkpoints Intern-Decision d'InternLM affichent les nombres de Brier et d'erreur de calibration attendue sur leurs fiches de modèle — et aucun des deux modèles de cet article ne le fait. Cette asymétrie est la raison pratique de garder le champ large plutôt que de s'engager sur la seule architecture.

La bonne nouvelle, c’est que le test est bon marché et ne nécessite pas la coopération du fournisseur. Rassemblez quelques centaines de cas étiquetés qui ressemblent à votre trafic réel, rédigez le schéma de question que votre application enverrait réellement, exécutez les deux modèles dessus, et calculez la calibration attendue sur la sortie. Vous saurez alors deux choses que personne en dehors des deux fournisseurs ne sait actuellement : dans quelle mesure les probabilités de Microsoft-Decision-1 suivent son exactitude sur votre distribution, et si les chemins d’image du d1-omni-600M valent les encodeurs qu’ils embarquent. Les recommandations de Microsoft vont dans le même sens — validez sur des données représentatives, fixez les seuils en fonction du coût de vos erreurs, incluez toujours une option d’abstention, randomisez l’ordre des options, gardez un humain dans la boucle pour les décisions lourdes de conséquences.

Là où chacun a sa place, et là où OrcaRouter a la sienne.

Microsoft-Decision-1 convient partout où la matière décisive est du texte et où le blocage vient des achats : un long document, un passage récupéré, un appel d'outil proposé, une réponse générée évaluée par rapport à une grille, avec authentification Azure, facturation unifiée et évaluation du fournisseur exigées avant toute mise en production. C'est l'instrument le plus étroit et le plus facile à faire approuver.

Liquid AI d1-omni-600M est à sa place partout où l'élément décisif n'est pas du texte — une photo jointe à un formulaire, un court enregistrement d'appel, une capture d'écran — et partout où vous voulez des poids lfm1.0 que vous pouvez exécuter et affiner à l'intérieur d'un périmètre que vous contrôlez. C'est l'instrument le plus large et le plus difficile à valider, car l'affirmation multimodale est exactement la partie qui n'a aucun benchmark publié derrière elle.

A capture of Liquid AI's documentation site showing the left navigation (Liquid Foundation Models with Text, Vision, Audio, Decision Models and Liquid Nanos entries, plus Fine-tuning, Edge Inference and llama.cpp), the 'New: Open d1' banner, and the opening description of Liquid Foundation Models as a class of multimodal architectures built for fast inference and on-device deployment.

Ni l'un ni l'autre ne figure dans notre catalogue, et rien ici ne constitue une affirmation de disponibilité pour l'un ou l'autre. Un modèle qui renvoie des probabilités au lieu de texte n'est pas ce vers quoi on achemine des complétions de chat, et rester à l'écart du siège de notation est tout le dessein de l'instrument. Ce qu'OrcaRouter porte, c'est le versant génératif de la même boucle : les plus de 200 modèles derrière une seule clé compatible OpenAI qui rédigent la grille d'évaluation sur laquelle votre évaluateur s'appuie, transcrivent ou résument la matière avant qu'elle ne devienne un état, et émettent l'appel d'outil que votre évaluateur approuve avant son exécution. Le prix catalogue du fournisseur est répercuté à 0 % de marge, si bien qu'une baisse de prix d'un fournisseur côté génération est effective chez nous le jour même. Le basculement automatique maintient ce côté en vie lorsqu'un fournisseur unique se dégrade — ce qu'un pipeline qui note chaque document récupéré remarque immédiatement — et si vous voulez que plusieurs rédacteurs soient jugés plutôt qu'un seul, le DSL de routage les compose en un seul appel et la fusion de modèles rapporte leur concordance comme un champ que votre évaluateur peut lire comme n'importe quel autre.

L'essentiel

Microsoft-Decision-1 a atteint la disponibilité générale sur Microsoft Foundry le 8 octobre 2026 : texte uniquement, 32 768 jetons, construit sur un Qwen3.5-9B post-entraîné, hébergé sans poids, aucun prix sur la page du modèle, aucun chiffre de latence et une section d’évaluations qui décrit sa méthodologie sans publier de résultat. Liquid AI d1-omni-600M a été mis en ligne le 7 octobre 2026 sous la forme d’un modèle de décision à encodeur bidirectionnel de 587 M qui lit du texte, des images ou 30 secondes de parole — une modalité non textuelle à la fois, avec le texte tronqué à 896 jetons lorsque des images sont présentes — sous la licence lfm1.0, sans benchmark de précision pour sa capacité phare, sans ventilation vision et sans latence publiée. Choisissez en fonction de la modalité et du contrôle plutôt que des scores, car les scores n’existent pas : si votre matériel est une photographie ou un appel téléphonique, un seul de ces modèles peut répondre, et s’il s’agit d’un document de quarante pages accompagné d’un examen des achats, seul l’autre peut être déployé.

Ce qu'OrcaRouter porte, c'est le versant génératif de la même boucle : les plus de 200 modèles derrière une seule clé compatible OpenAI qui rédigent la grille d'évaluation sur laquelle votre évaluateur se base, transcrivent ou résument la matière avant qu'elle ne devienne un état, et émettent l'appel d'outil que votre évaluateur approuve avant son exécution.