
Microsoft-Decision-1 vs Intern-Decision-4B : l'un publie sa calibration, l'autre publie sa méthodologie
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 par million de tokens
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
Placez Microsoft-Decision-1 à côté d’Intern-Decision-4B et vous obtenez une comparaison qui se décide moins par la capacité que par ce que chaque fournisseur était prêt à publier. Le modèle de Microsoft est arrivé en disponibilité générale sur Microsoft Foundry le 8 octobre 2026 : une base Qwen3.5-9B, post-entraînée par Microsoft, texte uniquement, contexte de 32 768 tokens, poids non distribués, une méthodologie d’évaluation décrivant l’exactitude, l’erreur de calibration et des tests statistiques appariés — et pas un seul résultat. Intern-Decision-4B d’InternLM a été mis en ligne sur Hugging Face le 26 septembre 2026 à 05:36:37 UTC sans la moindre annonce, est affiné à partir de Qwen3.5-4B, accepte les images ainsi que le texte, s’exécute en 44 millisecondes sur une seule RTX 4090, et affiche un tableau complet des chiffres de Brier et d’erreur de calibration attendue. Les deux renvoient une distribution de probabilités sur les options que vous fournissez. Un seul d’entre eux vous dit à quel point il le fait bien.
Cette inversion — le modèle plus grand et mieux financé étant celui qui est opaque — constitue toute la configuration de cette confrontation, et elle détermine le choix de la plupart des équipes plus vite que n’importe quelle ligne de spécifications.
Le seul chiffre qui les sépare
InternLM rapporte Brier 0,347 et ECE 0,065 pour Intern-Decision-4B sur sa suite de benchmarks, avec un score moyen de 90,02 sur Jevbench-Easy (100,00), Jevbench-Original (98,61), Jevbench-Hard (73,87), Typed Decision (80,55), ToolACE (96,45), AG News (90,82) et WildJailBreak (89,86). Ce sont des chiffres rapportés par le fournisseur sur son propre harnais d’évaluation, et les lignes Jevbench en particulier relèvent de la propre famille de benchmarks du projet — à les interpréter comme une auto-évaluation, et non comme une vérification indépendante. Mais ce sont des chiffres avec une échelle déclarée, et l’ECE en particulier est le chiffre qui vous indique si un 0,8 renvoyé mérite que l’on agisse en conséquence.
Microsoft ne publie aucun équivalent. L’onglet Benchmarks de la page catalogue de Microsoft-Decision-1 décrit ce qui a été mesuré et affirme que le modèle « affiche des performances comparables à celles des principaux modèles de décision et supérieures à celles d’autres modèles de décision ouverts évalués selon la même méthodologie », les domaines les plus forts cités étant le raisonnement, l’application de règles et la robustesse au format des invites, et le plus faible la connaissance de domaines spécialisés. Aucun Brier, aucun ECE, aucun tableau d’exactitude. Si votre décision d’adoption nécessite un chiffre de calibration avant que vous puissiez dimensionner un seuil d’escalade, l’un de ces deux modèles vous le fournit et l’autre vous demande de le mesurer vous-même.

Là où les deux contrats diffèrent réellement
À première vue, ces modèles acceptent le même appel. Vous fournissez un état, un schéma de questions nommées et un ensemble fixe d’options ; vous récupérez une probabilité par option sans un seul token de texte généré. Les différences apparaissent aux limites de ce contrat.
• Modalité — Microsoft-Decision-1 est explicitement limité au texte et n'accepte ni ne produit de contenu image, audio ou vidéo. Intern-Decision-4B accepte des images facultatives en complément de l'état, jusqu'à huit par appel, ce qui en fait un candidat pour le tri des captures d'écran, les vérifications de mise en page de documents et le routage d'assurance qualité visuelle.
• Cardinalité des questions — InternLM documente de 1 à 16 questions par appel, jusqu’à 62 options chacune, sur trois types de champs (choix, score, noul). Microsoft documente les formats — oui/non, choix multiple, évaluation, classification, grille d’évaluation — et une invocation unique sur jusqu’à 32K jetons, mais pas de plafond de questions par appel.
• Contexte — Microsoft indique 32 768 jetons. La fiche d'Intern-Decision-4B exprime ses limites en questions, options et images plutôt qu'en un seul nombre de contexte, de sorte que vous ne pouvez pas aligner les deux sur un seul chiffre.
• Distribution — Microsoft-Decision-1 est une API Foundry hébergée ; les poids du modèle ne sont pas distribués et il n'y a pas de téléchargement. Intern-Decision-4B est sous Apache-2.0 sur Hugging Face, avec la licence Qwen en amont conservée sous la forme de LICENSE-QWEN, ce qui signifie conserver cette licence et les mentions en amont si vous le redistribuez.
• Profil de coût — Les poids d'InternLM ne coûtent rien à exécuter et sont annoncés à 44,16 ms en moyenne, 44,60 ms en P95, sur une seule RTX 4090. Le prix par token de Microsoft n'est pas indiqué du tout sur la page du modèle.
• Gouvernance — Microsoft fournit une évaluation d'IA responsable, des pratiques de déploiement documentées et des exclusions explicites (pas pour la génération de texte, les questions-réponses ouvertes, la conversation, la traduction ou le résumé ; pas pour être le seul décideur automatisé dans des décisions importantes concernant des personnes). InternLM fournit une fiche de modèle qui est franche sur la provenance — des poids « modified by decision tuning » — et rien qui ressemble à un ensemble de conformité.

Deux raisons très différentes pour lesquelles les chiffres de latence sont difficiles à comparer
Microsoft-Decision-1 ne publie aucun chiffre de latence, il n'y a donc rien à mettre en regard des 44,16 ms de moyenne d'InternLM. Ce n'est pas un oubli anodin pour cette charge de travail. Ces modèles existent pour être appelés de nombreuses fois au sein d'un pipeline — une fois par document récupéré, une fois par appel d'outil proposé, une fois par réponse évaluée — et la différence entre quatre décisions par seconde et quarante est la différence entre noter un échantillon et tout noter. Le chiffre d'InternLM est atteignable aujourd'hui sur du matériel que vous pouvez louer à l'heure ; celui de Microsoft doit être mesuré via votre propre déploiement Foundry, et la forme de déploiement que vous choisissez (pay-as-you-go serverless versus provisioned throughput) le fera varier plus que le modèle lui-même.
C'est également ici que la moitié du motif d'OrcaRouter devient pertinente, et il s'agit uniquement de la moitié générative. Nous n'hébergeons pas Microsoft-Decision-1 ni Intern-Decision-4B — un modèle qui renvoie des probabilités au lieu de texte n'est pas quelque chose vers lequel on achemine des complétions de chat, et aucun des deux n'apparaît dans notre catalogue. Ce qui se trouve derrière notre clé unique compatible OpenAI, c'est le pool de plus de 200 modèles qui assure la rédaction : le prompt de juge rédigé par un modèle, les réponses candidates produites par deux autres, l'appel d'outil qui est noté avant son exécution. Le prix catalogue du fournisseur est répercuté avec 0 % de marge, donc une baisse de prix sur un générateur est effective de notre côté le jour même, et le basculement automatique maintient en vie le côté génération d'une boucle de notation lorsqu'un fournisseur unique se dégrade — ce qui compte plus que d'habitude ici, car un pipeline qui note tout ce qu'il voit n'a aucune marge pour réessayer un appel bloqué.

Qui devrait prendre lequel
Prenez Intern-Decision-4B si l'une de ces conditions est vraie : vous devez évaluer des images ainsi que du texte, vous avez besoin d'un chiffre de calibration avant de pouvoir livrer, vous voulez l'option d'exécuter le modèle sur votre propre matériel à l'intérieur d'un périmètre que vous contrôlez, ou vous voulez le fine-tuner. Le dernier point mérite d'être souligné — un modèle de scoring 4B à poids ouverts avec un wrapper documenté est un modèle que vous pouvez adapter à vos propres étiquettes, et Microsoft-Decision-1 est une API hébergée sans voie de fine-tuning et sans poids à adapter.
Choisissez Microsoft-Decision-1 si le blocage relève des achats plutôt que des performances : vous avez besoin de l’authentification Azure, d’une facturation unifiée, de la gouvernance et d’une évaluation Responsible AI du fournisseur avant que quoi que ce soit n’atteigne la production, et vous avez besoin d’un contexte de 32K pour les documents longs, ce que les limites par appel du 4B compliquent. L’absence de benchmarks publiés représente un coût réel, mais c’est un coût que vous pouvez éliminer en un après-midi en faisant passer votre propre ensemble annoté dans les deux modèles et en comparant l’ECE — ce que vous feriez de toute façon avant de faire confiance au tableau de l’un ou l’autre fournisseur.
La réponse inconfortable est que les deux sont assez bon marché à tester pour que la vérité n’ait guère d’importance. Intern-Decision-4B a besoin d’un GPU que vous avez déjà. Foundry-Decision-1 a besoin d’un échantillon de vos propres données étiquetées. Faites passer vos données dans les deux à titre de calibration sur le sous-ensemble qui compte pour vous, et laissez les chiffres décider — ce qui est, en fait, exactement à quoi ils servent.
