
Microsoft-Decision-1 vs Laya : 25 langues derrière une API, plus de 100 derrière un téléchargement de 322 Mo
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 par million de tokens
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
Comptez les langues et la comparaison semble déjà tranchée. Microsoft-Decision-1, généralement disponible sur Microsoft Foundry depuis le 8 octobre 2026, répertorie 25 langues prises en charge et déclare sans détour que la couverture, la qualité et la calibration « peuvent varier selon la langue », citant les langues non anglophones et en particulier les langues à faibles ressources comme un domaine de sous-performance. Laya, publié par Convai Innovations le 18 septembre 2026 sous Apache 2.0, se décrit comme multilingue, couvrant plus de 100 langues, et rapporte que 45 des 51 langues testées restent utilisables avec le routage, contre 23 sur 51 pour son homologue uniquement anglophone. L'un est un modèle 9B derrière un point de terminaison Azure avec un contexte de 32 768 jetons ; l'autre est un classifieur de 421 millions de paramètres fonctionnant à 32,8 millisecondes par décision sur un seul Tesla T4, gratuitement. Les deux refusent d'écrire un jeton et renvoient tous deux des probabilités sur les options que vous définissez.
Mais lisez les deux fiches de modèle en entier, et le nombre de langues cesse d’être le chiffre intéressant. C’est l’histoire de calibration qui se cache derrière, et les deux projets la racontent dans des directions opposées.
Laya publie le chiffre qui rend son propre marketing embarrassant
La fiche de modèle Laya indique, dans sa propre section de limites, que les checkpoints de base obtiennent 0,362 en zéro-shot sur le benchmark typed-decisions — en dessous de la baseline de la classe majoritaire de 0,461. C'est une fiche qui vous dit que son modèle est pire que de deviner « la réponse la plus fréquente » à ce test. Elle indique aussi que les checkpoints de base sont proches du hasard en zéro-shot, que le chiffre phare de 0,766 pour typed-decisions nécessite un fine-tuning sur la propre partition de ce benchmark, que les questions à score ordinal sont la primitive la plus faible (SST-5 0,372), que les questions à choix de forte cardinalité souffrent parce que 77 options ne laissent qu'environ trois ou quatre tokens chacune, que noul peut suivre ses propres étiquettes, et que le champ action.act_probability « ne porte encore aucun signal exploitable » à AUROC 0,30. La phrase de résumé de Convai elle-même est celle à retenir pour toute évaluation : Laya est une base rapide à spécialiser, pas un moteur de décision zéro-shot.
Cette franchise est plus précieuse qu'elle n'en a l'air, car elle vous dit exactement à quoi sert Laya. C'est un encodeur que l'on fine-tune sur ses propres étiquettes : toute l'architecture est conçue pour que de nouveaux schémas n'aient besoin d'aucun réentraînement, mais pour bien performer sur une tâche, il en faut un. Utilisé ainsi, les chiffres publiés sont solides : 0,766 contre 0,727 pour Jev sur les décisions typées après fine-tuning, 0,950 contre 0,910 sur AG News, 0,595 contre 0,480 sur DAIR Emotion, et l'ECE à 0,081 contre 0,246 pour Jev — avec la note honnête qu'il est livré trop confiant et nécessite un réajustement de la température, ce qui fait passer l'ECE moyen de 0,466 à 0,081.
Microsoft publie la méthodologie et garde le résultat secret
La page Foundry de Microsoft-Decision-1 effectue le même exercice en sens inverse. Elle décrit l’évaluation en détail — des benchmarks de décision publics et communautaires ainsi que des ensembles internes tenus à l’écart, des métriques incluant l’exactitude et l’erreur de calibration, la variation de l’ordre des options, des tests statistiques appariés, un harnais identique pour les modèles comparés — et rapporte que le modèle « affiche des performances comparables à celles des modèles de décision de premier plan et devance les autres modèles de décision ouverts évalués selon la même méthodologie ». Elle nomme ses points forts (raisonnement, application de règles, robustesse au formatage des prompts) et ses points faibles (connaissances spécialisées du domaine, langues autres que l’anglais).
Et puis il n'affiche rien. Aucun chiffre de précision, aucune erreur de calibration, aucun tableau par benchmark. Les limitations auto-déclarées sont réelles et utiles — les scores changent avec la formulation et l'ordre des options, une question mal formulée renvoie quand même un score, la calibration est la plus forte sur les types de tâches familiers, aucune explication n'est produite — mais une liste de limitations n'est pas une mesure. Le compromis est donc inhabituellement net : Laya vous donne des chiffres que vous pouvez tenter de falsifier sur vos propres données, et Microsoft vous donne une posture de conformité et un contexte de 32K dans lequel vous pouvez mettre un long document.

Ce que la différence de taille apporte réellement
La compacité de Laya n'est pas ici un compromis, c'est le design. Parce que chaque option est évaluée sur son propre [MASK] token et passée au softmax sur les options de cette question, l'espace de réponses est assemblé au moment de la requête plutôt que codé en dur dans une tête de vocabulaire — ce qui explique pourquoi un schéma que vous inventez cet après-midi n'a besoin d'aucun réentraînement, et pourquoi le modèle tient dans 322 à 421 millions de paramètres. Le checkpoint multilingue s'exécute environ 2,2 fois plus vite que celui en anglais, le routeur détecte l'écriture en moins d'une demi-milliseconde, et le débit par lots atteint 103 à 332 questions par seconde sur un seul T4. Pour une charge de travail qui évalue chaque ticket, chaque document récupéré ou chaque action proposée, ce débit est l'atout, pas le nombre de paramètres.
Les coûts de cette conception sont tout aussi précis et méritent d’être énoncés face à l’alternative de Microsoft. Le checkpoint anglais utilise une fenêtre de 512 tokens ; celui multilingue, de 1 024, extensible vers 8K. Microsoft-Decision-1 utilise 32 768. Un long fil d’assistance, un contrat complet ou un document de politique de plusieurs pages ne rentre pas du tout dans la fenêtre de Laya, et aucun gain de vitesse ne compense la troncature. Laya répond à un ensemble de questions par passe avant, avec un budget de tokens documenté par option ; Microsoft documente une invocation unique sur jusqu’à 32K tokens, sans plafond par question. Et le point faible concurrentiel de Laya en tant que classificateur mérite d’être connu : il obtient 0,425 sur Banking77 contre les 0,870 de Jev, ce qui est le type de problème d’intention finement granulaire et à forte cardinalité où une passe de spécialisation compte le plus.

La comparaison des coûts qui n'est pas par token
Laya est gratuit au moment de l'utilisation — auto-hébergé, Apache 2.0, répertorié à un coût d'auto-hébergement de « $0 » — et son vrai prix, c'est la session de fine-tuning que vous lui devez avant qu'il ne soit performant sur votre tâche. Microsoft-Decision-1 est une API Foundry hébergée dont le tarif par token n'est pas indiqué sur la page du modèle, sans poids à télécharger, sans voie de fine-tuning, et avec l'inférence par lots désactivée. L'un est un projet initial d'étiquetage de données, l'autre est un appel facturé à l'usage. Lequel est le moins cher dépend entièrement du volume, et le point de bascule est élevé : un encodeur de 421 M traitant 300 éléments par seconde sur un T4 loué est très difficile à battre par décision une fois qu'il a été entraîné.
C'est ici qu'OrcaRouter gagne sa place dans un pipeline construit sur l'un ou l'autre modèle, et uniquement du côté génératif. Nous n'hébergeons ni Microsoft-Decision-1 ni Laya : les deux renvoient des probabilités plutôt que du texte, aucun des deux n'est dans notre catalogue, et un point de terminaison d'évaluation n'est pas une cible de chat-completions. Ce que nous proposons, c'est le modèle qui produit l'élément à évaluer — la réponse brouillon, l'appel d'outil proposé, la réponse candidate que la tête affinée de Laya juge ensuite. Cela représente plus de 200 modèles derrière une seule clé compatible avec OpenAI au prix catalogue du fournisseur, répercuté avec 0 % de marge, avec basculement automatique lorsqu'un chemin de service se dégrade. Dans une boucle qui évalue tout ce qu'elle génère, l'appel de génération est la partie qui peut tomber en panne, et le basculement est ce qui maintient la file d'évaluation alimentée.

Lequel choisir
Prenez Laya si vos décisions arrivent dans de nombreuses langues, si votre volume est suffisamment élevé pour que la tarification par token compte, si vous disposez de labels et d'une semaine pour affiner, ou si vous devez exécuter le scoring sur du matériel situé à l'intérieur de votre propre périmètre. Acceptez la fenêtre de 512 à 1 024 tokens et le fait que le checkpoint de base sera proche du hasard jusqu'à ce que vous le spécialisiez, et vous obtenez un modèle de décision qui reconnaît honnêtement n'être qu'un point de départ.
Choisissez Microsoft-Decision-1 si vos entrées sont de longs documents plutôt que des tickets, si votre condition de déploiement est l’authentification Azure, la facturation unifiée et un package Responsible AI plutôt qu’un téléchargement, si 25 langues couvrent votre trafic, ou si vous préférez ne pas posséder le modèle du tout. Acceptez que vous tracerez vous-même sa première courbe de calibration, et prévoyez un après-midi sur un échantillon étiqueté pour le faire — car contrairement à Laya, celui-ci ne vous remettra pas un nombre ECE avec lequel argumenter.
