Une carte de titre générée pour Microsoft-Decision-1 vs Intern-Decision-2B, sous-titrée « le checkpoint intermédiaire qui répond le plus vite et qui est le plus mauvais pour dire à quel point il est sûr », avec des pastilles affichant 2 213 241 664 paramètres, une température de 2,100509348278, ECE 0,100, 33,28 ms sur une 4090, et un plafond de 8 192 tokens.
Engineering & Research

Microsoft-Decision-1 vs Intern-Decision-2B : neuf millisecondes plus rapide et mesurablement moins bien calibré

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Il y a un chiffre dans le propre tableau d'InternLM qui ne devrait pas exister, et c'est la raison pour laquelle cette comparaison vaut plus que la fiche technique. Intern-Decision-2B — 2 213 241 664 paramètres, affiné à partir de Qwen/Qwen3.5-2B, téléversé sur Hugging Face le 26 septembre 2026 à 05:36:19 UTC sans annonce — affiche une 33,28 ms de latence moyenne par requête sur un seul RTX 4090, ce qui est légèrement plus rapide que son propre frère de 852 millions de paramètres, à 33,98 ms. Il affiche aussi la pire calibration de sa famille : une erreur de calibration attendue de 0,100 contre 0,066 pour le 0,8B, avec une température ajustée de 2,100509348278 contre 2,747760550703 pour le 0,8B. Pendant ce temps, Microsoft-Decision-1, disponible en général sur Microsoft Foundry depuis le 8 octobre 2026, ne publie ni chiffre de latence ni erreur de calibration — seulement un paragraphe de méthodologie décrivant comment les deux ont été mesurés. La question que pose réellement cette confrontation n'est donc pas de savoir lequel des deux est le meilleur. C'est ce que vous achetez lorsque vous achetez la taille intermédiaire de n'importe quoi.

Les deux modèles sont des évaluateurs de décision : un état en entrée, un ensemble borné de questions en entrée, des probabilités calibrées en sortie, aucun texte généré et aucun jeton à analyser. C’est ce contrat commun qui rend les différences lisibles. Microsoft-Decision-1 est une API Foundry hébergée, en mode texte uniquement, basée sur Qwen3.5-9B, avec une fenêtre de 32 768 jetons, sans poids distribués ni voie de fine-tuning. Intern-Decision-2B est un checkpoint Apache-2.0 avec la licence Qwen amont conservée sous LICENSE-QWEN, environ 4,46 Go de dépôt, un code d’inférence personnalisé et aucun point de terminaison hébergé où que ce soit.

À quoi sert réellement la taille moyenne

InternLM a publié trois checkpoints en quarante secondes : le 0,8B à 05:35:57, celui-ci à 05:36:19, le 4B à 05:36:37. Sur la moyenne des sept suites du fournisseur lui-même, la famille grimpe dans l'ordre que l'on espère — 79,38, 84,68, 90,02 —, le seul endroit où le 2B ressemble à un achat judicieux. Partout ailleurs, il ressemble à la taille que personne n'aurait choisie volontairement.

Le traitement du prompt domine un appel de décision, et c'est là l'explication mécanique de l'inversion de latence, non un mystère. Un scorer effectue exactement une seule passe avant sur un prompt dont la longueur est déterminée par l'état, le schéma et les descriptions d'options — jamais par quoi que ce soit que le modèle écrit, puisqu'il n'écrit rien. Dans ce régime, le nombre de paramètres est un coût de second ordre, si bien que la raison habituelle de se tourner vers le plus petit checkpoint ne s'applique pas : vous ne gagnez pas du temps, vous gagnez de la mémoire. Le dépôt entier du 0,8B pèse environ 1,73 Go contre 4,46 Go pour ce modèle, et c'est la raison honnête de le préférer. Le seul véritable atout du 2B, c'est qu'il se trouve être le plus rapide des rapides, avec une marge assez faible pour relever du bruit.

Comparé à Microsoft-Decision-1, cet argument est presque dénué de pertinence, car les deux modèles ne se situent pas dans le même régime de latence. La vitesse d'un point de terminaison hébergé est fonction de la forme de votre déploiement — serverless ou débit provisionné sur le même SKU standard — avant d'être fonction du modèle, et Microsoft ne publie aucun chiffre par appel auquel se comparer. Ce que Microsoft publie, en revanche, c'est une contrainte opérationnelle stricte qui joue en sens inverse : l'inférence par lots est désactivée. Il n'existe aucun canal hors ligne permettant d'amortir une exécution de notation en masse, de sorte qu'un pipeline Microsoft-Decision-1 paie le coût interactif de chaque décision, tandis qu'un checkpoint auto-hébergé paie en heures GPU, qu'il effectue des notations ou non.

La colonne de calibration, où le milieu perd

Lisez les trois fiches Intern-Decision ensemble et la famille cesse de se comporter de manière prévisible. L’exactitude est monotone selon la taille ; la calibration ne l’est pas. Le 2B présente un ECE de 0,100 — le plus faible des trois — et une température ajustée de 2,100509348278, bien inférieure à celle du 0,8B, 2,747760550703. La fiche vous indique d’utiliser le module d’inférence fourni avec la taille que vous avez téléchargée, car les calibrations par défaut sont propres à chaque checkpoint ; quiconque copie un wrapper d’un modèle frère à un autre applique silencieusement la mauvaise température.

La transformation elle-même mérite d'être comprise avant de considérer ce 0,100 comme un verdict sur les poids. Il s'agit d'un softmax sur les logits candidats du champ, suivi d'un second softmax sur le log de cette distribution divisé par la température. Elle s'exécute après le premier softmax et préserve l'ordre, elle ne peut pas du tout changer l'argmax. Elle déplace la confiance, la probabilité du oui et la valeur attendue d'une question de score, et elle pointe vers l'identique. Si votre pipeline effectue de l'étiquetage, la température est sans effet et l'ECE est une curiosité. Si votre pipeline lit des probabilités — les seuille, les classe, les injecte dans un calcul de valeur attendue — alors un ECE de 0,100 est la différence entre un seuil qui signifie ce que vous avez écrit et un qui ne le signifie pas. La bonne approche est d'ajuster votre propre température sur vos propres cas, et non de conclure que les poids sont en cause.

Microsoft-Decision-1 exige exactement le même travail, avec moins d’éléments au départ. Son onglet Benchmarks indique que l’exactitude, l’erreur de calibration, le rappel de sécurité, les taux de faux positifs et la cohérence d’équité ont été mesurés sur des benchmarks de décision publics et communautaires ainsi que sur des ensembles de test internes réservés, que l’ordre des options a été varié, que des tests statistiques appariés ont été appliqués, et que le modèle « affiche des performances comparables à celles des principaux modèles de décision et devance les autres modèles de décision ouverts évalués selon la même méthodologie ». Pas d’ECE. Pas de Brier. Pas de température. Pas de tableau d’exactitude. Le modèle dont toute la proposition de valeur est une probabilité fiable est celui qui, dans cette comparaison, n’a absolument aucun chiffre de calibration publié.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Intern-Decision-2B. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; context 32,768 tokens; modalities text only; batch inference disabled; calibration error not published; latency not published. Right column Intern-Decision-2B rows read: availability uploaded September 26, 2026; context 8,192 tokens with oversize input rejected; modalities text plus up to eight images; batch inference not applicable, self-hosted; ECE 0.100, the worst of its three siblings; 33.28 ms mean on a single RTX 4090, the fastest of the three. A footer line reads that the InternLM figures are vendor-reported and the 2B's fitted temperature is 2.100509348278.

Limites du contrat : quatre choses que le modèle hébergé ne fera pas

Les deux modèles traitent ce qui ressemble au même appel, et les divergences se nichent à ses marges.

• Modalité — Microsoft-Decision-1 est explicitement limité au texte et n'accepte ni image, ni audio, ni vidéo. Intern-Decision-2B accepte jusqu'à huit images en plus de l'état, ce qui en fait un candidat pour le tri des captures d'écran et les vérifications de mise en page que l'API hébergée ne peut assurer avec une quelconque précision.

• Plafond d'entrée et mode de défaillance — Microsoft-Decision-1 exécute une seule invocation sur un maximum de 32 768 jetons. Intern-Decision-2B déclare DecisionEngine(max_length=8192) et rejette une entrée surdimensionnée au lieu de la tronquer, ce qui est un comportement correct pour un système de notation et constitue aussi une barrière infranchissable, car l'état, le schéma et le squelette doivent tous être présents en une seule passe ; aucune stratégie de découpage ne préserve le contrat.

• Forme des questions — InternLM documente entre une et seize questions par appel avec jusqu'à 62 options réparties sur trois types de champs (choice, score, noul), noul est un oui binaire renvoyant score renvoie une valeur attendue pondérée par les probabilités sur une échelle que vous nommez. InternLM documente les formats — oui, choix multiple, notation, classification, grille d'évaluation — ainsi qu'une option d'abstention explicitement prise en charge telle que « impossible de dire » lorsque les preuves sont insuffisantes, ce qui est la ligne la plus utile sur la pour quiconque la lit.

• Tarif — la page du modèle Microsoft-Decision-1 n'affiche pas de tarif ; les informations de prix renvoient vers la page de tarification de Microsoft, si bien que le coût par décision est quelque chose que l'on relève sur Azure ou sur une facture, avec 0 % attribuable aux jetons de sortie, puisqu'il n'y en a aucun. Intern-Decision-2B ne coûte rien par appel et tout en temps GPU, et il n'a pas de fournisseur hébergé. Son stockage représente environ 4,46 Go, répartis entre un shard de langage de 3,76 Go, une tour de vision de 612,5 Mo et un projecteur de 50,3 Mo.

Qu'est-ce qui est confirmé, et qu'est-ce qui ne relève que du discours du fournisseur ?

Garder ces deux catégories distinctes est toute la discipline avec cette famille. Confirmé par une liste de fichiers ou une réponse HTTP : le nombre de paramètres, la carte des shards, la paire de licences, le modèle de base, l'architecture sous-jacente — un Qwen3_5ForConditionalGeneration avec 24 couches, une taille cachée de 2 048, 8 têtes de requête contre 2 têtes clé-valeur, une dimension de tête de 256, un motif répétitif de trois couches d'attention linéaire pour une couche d'attention complète, une couche de prédiction multi-token conservée et un plafond d'embedding de 262 144 positions que le plafond du moteur de 8 192 tokens rend pratiquement sans importance.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, and the opening description of Intern-Decision-2B as a multimodal structured decision model fine-tuned from Qwen3.5-2B that accepts a shared state, a schema of named questions and optional images.

Rapportés par le fournisseur et non reproduits : chaque chiffre de précision, chaque chiffre de latence et la température. Il n'y a pas d'article, pas d'entrée arXiv, pas d'annonce de lancement, pas de journal des modifications et pas d'évaluation indépendante. Le Space de démo renvoie 401, ce qui signifie qu'il n'est pas public plutôt qu'en panne. Le dépôt GitHub apparu après le modèle — trois commits, du code d'entraînement, deux backends d'inférence, un ensemble d'évaluation avec 10 751 lignes de test, un benchmark de calibration de 96 cas et un guide de reproduction — représente plus de documentation que n'en reçoivent la plupart des sorties discrètes, et il ne fournit ni poids, ni données d'entraînement, ni licence de code. Microsoft est dans une position différente mais voisine : sa méthodologie est réelle et son affirmation est qualitative, et aucune des deux entreprises n'est actuellement en mesure de faire vérifier son chiffre central par personne d'autre que vous.

Où se situe OrcaRouter dans un pipeline comme celui-ci

Aucun des deux modèles ne figure dans notre catalogue, et rien ici ne doit être interprété comme une affirmation de disponibilité. Un modèle qui renvoie des probabilités plutôt que du texte n'est pas ce vers quoi on achemine des complétions de chat, et c'est vrai pour ces deux-là. Ce que nous proposons, c'est la moitié générative de la boucle que ces évaluateurs servent : les plus de 200 modèles derrière une seule clé compatible OpenAI qui rédigent la grille d'évaluation, ébauchent les réponses candidates et émettent l'appel d'outil qu'un évaluateur note ensuite avant son exécution. Le prix catalogue du fournisseur est répercuté à 0 % de marge, ainsi une baisse de prix d'un fournisseur côté génération est effective chez nous le jour même, et si vous préférez ne pas parier votre seuil sur un seul juge, le DSL de routage compose plusieurs modèles en un seul appel et la fusion de modèles rapporte leur concordance dans un champ que vous pouvez évaluer. Le basculement automatique maintient ce côté en vie lorsqu'un fournisseur donné se dégrade, ce qui compte davantage dans une boucle qui note tout ce qu'elle voit que dans une qui répond à un utilisateur de temps à autre.

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

L'essentiel

Microsoft-Decision-1 est généralement disponible sur Microsoft Foundry depuis le 8 octobre 2026 : hébergé, texte uniquement, 32 768 tokens, une base Qwen3.5-9B post-entraînée par Microsoft, aucun poids distribué, et une section de benchmarks qui documente sa méthodologie sans publier de chiffre — y compris aucune latence, avec l'inférence par lots désactivée. Intern-Decision-2B est un checkpoint Apache-2.0 de 2 213 241 664 paramètres daté du 26 septembre 2026, qui est le plus rapide de ses trois frères et sœurs à 33,28 ms sur une 4090 et le moins bien calibré avec un ECE de 0,100, avec une température ajustée de 2,100509348278 qui ne peut pas changer une étiquette mais changera toutes les confiances sur lesquelles vous fixez un seuil. Si vous voulez la taille intermédiaire, l'argument honnête en sa faveur est mince : payez les 2,7 Go supplémentaires pour la précision du 4B ou acceptez l'empreinte du 0,8B, et dans un cas comme dans l'autre, ajustez votre propre calibration avant qu'un seuil ne s'approche de la production.

Ce que nous fournissons, en revanche, c'est la moitié générative de la boucle que ces évaluateurs ont pour vocation de servir : les plus de 200 modèles derrière une clé compatible OpenAI qui rédigent la grille d'évaluation, élaborent les réponses candidates et émettent l'appel d'outil qu'un évaluateur note ensuite avant son exécution.