
Microsoft-Decision-1 vs Intern-Decision-0.8B : une demi-once de problèmes de jailbreak contre un blanc hébergé
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 par million de tokens · 55 tok/s
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
Commençons par la colonne qu'un billet de lancement aurait laissée de côté. Intern-Decision-0.8B — le modèle de décision d'InternLM à 852 985 920 paramètres, affiné à partir de Qwen3.5-0.8B et mis en ligne sur Hugging Face le 26 septembre 2026 sans annonce, sans article et avec un lien GitHub qui renvoie toujours une erreur 404 — est mesuré à 64,48 sur WildJailBreak contre une référence de 96,29 pour Jev 1.13 de TypeSafe. Ce n'est pas une simple différence d'arrondi. C'est un effondrement de la robustesse au refus dans un modèle dont le métier tout entier consiste à juger des entrées, publié sur la fiche du fournisseur lui-même, dans un tableau dont le benchmark appartient à un concurrent. Mettez cela à côté de Microsoft-Decision-1, passé en disponibilité générale sur Microsoft Foundry le 8 octobre 2026 en tant que scoreur texte uniquement post-entraîné sur Qwen3.5-9B, avec une méthodologie d'évaluation documentée et pas un seul résultat imprimé en dessous, et vous obtenez la véritable physionomie de cette confrontation. L'un de ces modèles vous donnera un chiffre qui le fait mal paraître. L'autre vous dit quelles métriques il aurait utilisées.
Cette inversion vaut plus que la fiche technique. Les deux modèles prennent un état et un ensemble de questions délimité et renvoient des probabilités sur vos options — aucun ne génère de texte, et sur cet axe, ils sont le même type d'instrument. Les différences qui comptent sont qui l'exploite, sa taille, dans quelle mesure vous pouvez vérifier, et une colonne de sécurité que le modèle plus petit, plus discret et entièrement téléchargeable a choisi de publier quand même.
Ce que chacun renvoie réellement
Microsoft-Decision-1 est une API hébergée, et c'est là la première différence structurelle. Les poids ne sont pas distribués — pas de téléchargement, pas de dépôt, pas de chemin d'affinage — et l'intégration suppose un déploiement Foundry avec authentification, facturation et gouvernance Azure associées. Il effectue une seule passe sur jusqu'à 32 768 jetons, prend en charge les questions de type oui/non, à choix multiples, de notation, de classification et de grille d'évaluation, et accepte uniquement du texte en entrée pour produire du numérique en sortie. Il prend explicitement en charge une option d'abstention telle que « cannot tell » lorsque les éléments de preuve sont insuffisants, ce qui donne tout son sens à un seuil.
Intern-Decision-0.8B est la disposition inverse. Ce sont des poids Apache 2.0 avec la licence Qwen d'origine conservée à côté d'eux sous le nom de LICENSE-QWEN, environ 1,73 Go de dépôt réparti sur trois fragments — un fragment de langage de 1,50 Go, un fragment de vision de 176 Mo et un projecteur de 25 Mo — qui tient sur un seul GPU grand public ou un ordinateur portable bien équipé. Il accepte un état, un schéma de une à seize questions nommées avec jusqu'à 62 options chacune, et éventuellement jusqu'à huit images, et son inference.py fourni documente le contrat plus en détail que la plupart des modèles lancés ne prennent la peine de le faire : les options sont mappées sur des symboles à un seul token A–Z, puis a–z, puis 0–9 ; les logits sont lus à la position immédiatement avant chaque <decision> placeholder dans un squelette pré-rendu ; un softmax est pris uniquement sur les candidats légaux de ce champ ; une température ajustée est appliquée.
Les deux licences ne constituent pas le même achat. Microsoft-Decision-1 vous offre un point de terminaison géré et aucun artefact que vous possédez. Intern-Decision-0.8B vous offre un artefact que vous possédez, sans point de terminaison, sans contrat de support et sans documentation en dehors du dépôt lui-même.

Le plafond, et la calibration que vous pouvez auditer
Deux nombres décident de la plupart des intégrations réelles, et tous deux appartiennent au petit modèle.
Le premier est de 8 192 jetons. Le moteur d'inférence d'Intern-Decision-0.8B refuse les entrées surdimensionnées plutôt que de les tronquer, ce qui est le comportement attendu pour un scoreur et aussi un mur infranchissable : aucun découpage ne permet de préserver le contrat, car l'état, le schéma et le schéma doivent tous tenir en une seule passe. Le plafond de Microsoft-Decision-1 est quatre fois plus élevé, à 32 768, et il s'agit d'une limite d'hébergement que vous pouvez augmenter en modifiant le provisionnement plutôt que d'une constante dans un fichier Python.
La seconde est la calibration, et ici la direction s'inverse. InternLM publie une température ajustée de 2.747760550703 pour le 0.8B, sélectionnée par minimisation de la NLL sur 1 728 cas de calibration désignés avec 1 693 retenus pour la validation, la fiche précisant explicitement que les étiquettes de la suite de tests n'ont pas été utilisées pour la sélectionner. La transformation appliquée est un softmax sur les logits candidats du champ suivi d'un second softmax sur le logarithme de cette distribution divisé par la température. Comme la transformation s'exécute après le premier softmax et préserve l'ordre, elle ne peut pas modifier l'argmax du tout — elle déplace la confiance, la probabilité de « oui » et la valeur attendue d'une question de score, et laisse l'étiquette identique. Si votre pipeline lit l'étiquette, la température est sans effet. S'il lit la probabilité, la compare à un seuil ou l'injecte dans un calcul de valeur attendue, la température est la différence entre un nombre qui a un sens et un qui n'en a pas. Passer temperature=1 renvoie la distribution non calibrée si vous préférez ajuster la vôtre.
Microsoft-Decision-1 n’a pas d’artefact équivalent. Son onglet Benchmarks indique que l’exactitude, l’erreur de calibration, le rappel de sécurité, les taux de faux positifs et la cohérence d’équité ont été mesurés sur des benchmarks de décision publics et communautaires, ainsi que sur des ensembles de tests internes tenus à l’écart, que l’ordre des options a été varié, que des tests statistiques appariés ont été appliqués, et que le modèle « performe au niveau des principaux modèles de décision et devant les autres modèles de décision ouverts évalués selon la même méthodologie ». Aucune erreur de calibration n’est affichée, aucune température à inspecter, et aucun découpage de validation n’est décrit. La seule propriété qui rend une probabilité utile — savoir si 0,8 signifie 0,8 — est affirmée et non quantifiée.
Lisez ces deux paragraphes en les mettant en regard l’un de l’autre, et la comparaison cesse de porter sur la taille. Un checkpoint de 0,8 milliard de paramètres dont on peut inspecter la calibration et dont on peut exécuter le logiciel est, pour une équipe d’évaluation, un objet plus maniable qu’une API hébergée dont la calibration tient en une phrase. Le petit modèle a aussi un chiffre de latence consigné — 33,98 ms en moyenne, 33,44 ms en médiane, 37,50 ms en p95 par requête sur une seule RTX 4090 via le chemin local Hugging Face, d’après la propre mesure d’InternLM — tandis que celui de Microsoft est quelque chose que vous mesurez via votre propre déploiement, où le choix entre serverless et débit provisionné fera davantage bouger le chiffre que le modèle lui-même.

Là où le petit modèle perd
Aucune des options ci-dessus ne fait d'Intern-Decision-0.8B le choix sûr, et le même tableau publié explique pourquoi. WildJailBreak à 64.48 contre les 96,29 de Jev, c'est un écart de robustesse des refus de trente points dans la catégorie exacte où un évaluateur rencontre des entrées non fiables. Un modèle de décision est souvent le composant qui décide si une action proposée est autorisée ; un modèle qu'il est facile de contourner par des arguments est un handicap à ce poste. Que le déficit vienne de la base Qwen3.5-0.8B, de l'objectif d'ajustement décisionnel ou du faible nombre de paramètres, le dépôt ne vous le dit pas, et il n'existe ni article, ni recette d'entraînement, ni divulgation de données qui le ferait.
Le reste du tableau d’InternLM lui-même est plus flatteur que cette colonne, et demeure modeste. La moyenne sur sept suites est de 79,38 pour le 0,8B, contre 84,68 pour son propre frère 2B et 90,02 pour le 4B — la famille progresse fortement avec la taille, ce qui est un léger signal que le tableau n’a pas été rétro-conçu pour flatter le modèle phare. AG News se situe à 88,61 contre 89,57 pour Jev, soit pratiquement à égalité sur la classification thématique à quatre classes. En matière de calibration, le 0,8B rapporte un Brier de 0,530 et une erreur de calibration attendue de 0,066, contre 0,358 et 0,095 pour Jev — un meilleur ECE, mais une précision nettement moins bonne. C’est un profil plausible pour un petit modèle avec une température délibérément ajustée, et ce n’est pas une combinaison qu’une équipe marketing choisirait de publier par accident.
Il n'y a pas non plus de date de sortie, ni d'annonce, ni de collection regroupant les trois checkpoints, ni de point de terminaison hébergé nulle part, et aucune évaluation indépendante d'aucune sorte. Le Space de démo répond 401. La description correcte d'Intern-Decision-0.8B est un checkpoint publié avec des affirmations non auditées — ce qui est une meilleure situation qu'une API en liste d'attente, car vous pouvez le mesurer en un après-midi, mais cela signifie que la charge de validation vous incombe entièrement.
Choisir, et où se situe OrcaRouter
Choisissez Microsoft-Decision-1 si l'obstacle tient à l'approvisionnement ou à la mise à l'échelle : vous avez besoin de l'authentification Azure, d'une facturation unifiée et d'une évaluation Responsible AI avant toute mise en production ; vous avez besoin d'un contexte de 32K ; vous avez besoin d'un point de terminaison que vous n'exploitez pas ; ou vous avez besoin que le chemin d'abstention soit conçu d'emblée plutôt que développé artisanalement. Acceptez en échange que vous ne pouvez pas l'exécuter, ne pouvez pas le fine-tuner, ne pouvez pas inspecter sa calibration, et devrez mesurer vous-même sa revendication centrale.
Choisissez Intern-Decision-0.8B si le blocage tient au coût, à la mémoire ou au contrôle : vous voulez un scoreur Apache-2.0 qui tient dans 1,73 Go, tourne sur du matériel que vous possédez déjà, produit la même étiquette à chaque fois et peut être remplacé par son homologue 2B ou 4B en changeant un chemin de point de contrôle. Acceptez en échange le mur des 8 192 tokens, la colonne WildJailBreak et le fait que personne en dehors d’InternLM n’ait reproduit quoi que ce soit sur la fiche.
La recommandation honnête est de faire les deux, car ils sont assez bon marché pour que le débat ne vaille guère la peine. L'appel de scoring lui-même n'est pas quelque chose que nous routons — un modèle qui renvoie des probabilités au lieu de texte n'est pas une complétion de chat, et ni l'un ni l'autre ne figure dans notre catalogue. Ce qu'OrcaRouter prend en charge, c'est l'autre moitié de la boucle : plus de 200 modèles derrière une seule clé compatible OpenAI qui rédigent la grille d'évaluation, génèrent les réponses candidates ou émettent l'appel d'outil que votre évaluateur s'apprête à noter, au prix catalogue du fournisseur répercuté avec 0 % de marge, de sorte qu'une baisse de prix d'un fournisseur sur un générateur soit effective de notre côté le jour même. Le basculement automatique compte plus que d'habitude ici, car un pipeline qui note tout ce qu'il voit n'a aucune marge de manœuvre pour réessayer un appel bloqué, et le DSL de routage vous permet d'envoyer un même prompt de juge à plusieurs rédacteurs et de fusionner leur accord plutôt que de faire confiance à un seul.

L'essentiel
Microsoft-Decision-1 a atteint la disponibilité générale sur Microsoft Foundry le 8 octobre 2026 : hébergé, texte uniquement, 32 768 jetons, construit sur Qwen3.5-9B, avec un paragraphe de méthodologie à la place d'un tableau de benchmarks. Intern-Decision-0.8B est un checkpoint Apache-2.0 de 1,73 Go mis en ligne le 26 septembre 2026 qui publie un Brier de 0,530, un ECE de 0,066, une température ajustée de 2,747760550703, 33,98 ms sur une 4090 — et un score WildJailBreak de 64,48 que personne ne lui a demandé d'afficher. Si vous ne pouvez valider qu'une seule chose avant d'adopter l'un ou l'autre, validez la calibration sur vos propres cas étiquetés ; c'est le chiffre que les deux fournisseurs vous ont laissé le soin de trouver.
