
Intern-Decision-4B : InternLM a livré un modèle de décision qui répond sans écrire un seul token
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 592 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 187 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Trois dépôts de modèles sont apparus sur la page Hugging Face d'InternLM en quarante secondes le 26 septembre 2026 : Intern-Decision-0.8B à 05:35:57 UTC, Intern-Decision-2B à 05:36:19, et internlm/Intern-Decision-4B à 05:36:37. Le 4B est le plus intéressant. Il s'agit d'un fine-tune de Qwen3.5-4B qui accepte un état partagé, un schéma de questions nommées et des images facultatives, et renvoie une distribution de réponses calibrée pour chaque question en une seule passe avant. Il ne génère jamais de texte. Ses propres notes de version le disent sans détour : « Cette API effectue une notation structurée des candidats. Elle n'appelle pas generate() ou échantillonne du texte libre. » Quarante secondes de téléversements et pas une ligne d'annonce nulle part — aucun article de blog, aucun tweet, aucun journal des modifications, aucune page de lancement. Ce qui existe, c'est une fiche de modèle, un inference.py, et quatre shards safetensors.

Ce qui a été livré, et ce qui ne l’a pas été
La famille est la première chose à bien faire, car la fiche du 4B la porte discrètement. Son tableau de benchmarks publie des lignes pour Intern-Decision-0.8B et Intern-Decision-2B aux côtés des siennes, et les trois checkpoints sont arrivés sur le hub dans la même minute. Le dépôt 2B n'est jamais lié depuis la fiche du 4B — il faut le trouver via le fil des téléversements de l'organisation.
Ce qui n'a pas été livré, c'est presque tout ce qu'une version apporte normalement :
• Aucune annonce — aucune couverture web, aucune déclaration du fournisseur dans quelque langue que nous ayons pu trouver.
• Pas de démo — la fiche renvoie vers un Space à huggingface.co/spaces/internlm/intern-decision; ce point de terminaison répond HTTP 401, ce qui signifie qu’il n’est pas public, et non qu’il est cassé.
• Aucune collection — la collection de modèles annoncée sur huggingface.co/collections/internlm/intern-decision renvoie également 401.
• Aucun dépôt de code — le lien GitHub de la carte, github.com/internlm/Intern-Decision, renvoie une erreur 404, et la liste des dépôts de l'organisation InternLM ne contient aucun projet de ce type.
• Aucune adoption — au moment d'écrire ces lignes, le 4B affiche un like et zéro téléchargement.
C'est toute la surface connaissable. Considérez chaque chiffre ci-dessous comme étant ceux du fournisseur, car personne d'autre n'a encore fait tourner ce truc.

Le contrat d’inférence est le produit
La majeure partie de la carte est consacrée à une procédure en 62 étapes, qui vous indique où la carte se dirige ensuite. Les questions et les options conservent leur ordre. Les options de chaque question sont mappées sur des symboles à un seul token — A à Z, puis a à z, puis 0 à 9. Cela fait 62 symboles, et c'est exactement pourquoi la carte limite une question à 62 options. La carte est ensuite écrite, et immédiatement après la complétion de la question, une passe avant distincte est exécutée. Cette passe alimente deux choses : le prompt système d'origine, l'état, le schéma de décision et un squelette JSON complet avec une paire <decision> par champ, en conservant le template de chat du checkpoint et un bloc de réflexion vide. Ensuite, une passe avant causale. Les logits sont lus à la position immédiatement avant chaque placeholder, un softmax s'exécute uniquement sur l'ensemble des candidats autorisés de ce champ, la distribution résultante sur les symboles est remappée vers les valeurs de vos options.
La conséquence est une forme fixe : pas de boucle de décodage, pas d’échantillonnage, pas de parseur, pas de surface d’hallucination, et un plafond strict d’une décision par question et par passe. Trois types de questions sont pris en charge — choix avec une table de critères ordonnée, score avec une liste ou une table à clés numériques, et noul, un binaire non/oui.
Le détail de la fiche technique qui compte le plus
La fiche indique explicitement que les entrées sont « rejetées sans troncature » au-delà de DecisionEngine(max_length=8192). Lisez cela en regard de la configuration, et un détail étrange apparaît : la tour de texte sous-jacente déclare max_position_embeddings de 262 144. Le backbone peut adresser un quart de million de tokens ; le wrapper publié refuse tout ce qui dépasse 8 192. Ce n’est pas un modèle à long contexte avec une valeur par défaut prudente — c’est un modèle de scoring de décision dont le propre harnais plafonne les preuves que vous pouvez lui fournir. Si votre question de routage dépend de plus d’environ huit mille tokens d’état, ce checkpoint tel qu’il est livré n’y répondra pas, et il refusera plutôt que de tronquer votre entrée.
Jusqu’à huit images sont autorisées, et la carte indique que les jetons d’image sont comptabilisés dans cette même limite de 8 192.

À l'intérieur des poids
Quatre shards, 4,54 milliards de paramètres BF16, et une configuration qui explique le nom lié à la taille : il y a une tour de texte, une tour de vision d'environ deux douzaines de couches avec une taille de patch de 16 pixels, et un projecteur entre les deux. Le côté texte compte 32 couches avec une taille cachée de 2 560, avec 16 têtes d'attention pour 4 têtes clé/valeur, un vocabulaire de 248 320 tokens et des embeddings liés. Les types de couches alternent selon un intervalle fixe — trois couches d'attention linéaire, puis une couche d'attention complète, et ainsi de suite. Seules les couches d'attention complète portent une attention globale, et l'embedding rotatif est partiel avec un facteur de 0,25. Son chargement nécessite Python 3.12 ou plus récent, PyTorch 2.9.1 et Transformers 5.14.1, et la liste de fichiers contient toujours le tokenizer, les merges et les fichiers de vocabulaire plutôt que de s'appuyer sur un tokenizer côté hub.
Les chiffres, et qui les a produits
Tout dans cette section a été mesuré par InternLM et publié sur la fiche du modèle. Rien de tout cela n'a été reproduit par un tiers, et il n'existe nulle part d'entrée Artificial Analysis, de note d'arène ni de ligne de classement pour ce modèle.
Sur sept jeux d’évaluation, le 4B obtient une moyenne de 90,02, avec un score de Brier de 0,347 et une erreur de calibration attendue de 0,065. Le même tableau indique Intern-Decision-0.8B à 79,38 et Intern-Decision-2B à 84,68, donc la famille suit une courbe ascendante avec la taille — 4,7 points de 0,8B à 2B, puis 5,3 de plus jusqu’au 4B. Le tableau comporte également cinq lignes que le fournisseur n’a pas entraînées : Jev à 88,74, JevK5 à 85,16, SemIf à 84,23, Kev à 79,56 et Laya à 57,77. Celles-ci ont été exécutées par InternLM sur le harnais d’InternLM, contre le checkpoint d’InternLM. Ce ne sont pas les chiffres propres à ces projets, et les lire comme tels est l’erreur la plus facile à commettre ici.
La latence est mesurée sur une seule RTX 4090 via le chemin Hugging Face local, et la carte signale que ces valeurs dépendent de la charge de travail et du matériel. Le modèle 4B atteint 44,16 ms en moyenne, 44,03 ms en médiane et 44,60 ms au P95 — un écart largement inférieur à la milliseconde entre la médiane et la queue de distribution, ce qui correspond à ce à quoi ressemble une passe avant à forme fixe. Les deux points de contrôle plus petits tournent tous deux autour de 33 ms, le 2B se situant légèrement devant le 0,8B en moyenne et en médiane, ce qu'il vaut la peine de relever plutôt que de lisser : ces deux modèles sont suffisamment proches pour que l'écart entre eux se situe dans le bruit de mesure.
Calibration, et les mises en garde honnêtes qu’elle contient
Le checkpoint est livré avec une température par défaut de 1,99241824, ajustée séparément pour ce modèle par minimisation de la log-vraisemblance négative sur 1 728 cas de calibration désignés, avec 1 693 mis de côté pour la validation. La fiche indique que les étiquettes de la suite de tests n'ont pas été utilisées pour la choisir. L'implémentation est une calibration des probabilités de candidats, et non une température d'échantillonnage : elle modifie la confiance, la probabilité binaire et le score attendu tout en laissant la décision argmax inchangée.
Un diagnostic distinct portant sur 96 cas rapporte ensuite l'effet. Dans les propres colonnes avant-après d'InternLM, le Brier global et l'ECE du 4B passent de 0,628 / 0,213 à 0,550 / 0,089, contre 0,595 / 0,130 pour Jev. Deux lectures honnêtes de ce tableau : la calibration fonctionne manifestement, et la colonne « avant » ne correspond à ce qu'aucun utilisateur ne verrait jamais, puisque la valeur par défaut livrée est la température ajustée. À signaler également : deux des six catégories du diagnostic sont moins bonnes pour le 4B que pour Jev, et la pire d'entre elles, les preuves quotidiennes et le biais d'observation, s'améliore à 0,575 / 0,210 tout en restant en deçà des 0,603 / 0,114 de Jev. Sur ce sous-ensemble, la calibration réduit l'écart sans le combler.
Là où un routeur convient, et là où ce n'est pas encore le cas
L'obstacle pratique à l'utilisation de ce modèle n'est pas la précision, c'est le packaging. La version publiée fournit une classe Python que vous importez après avoir téléchargé quatre shards, et non un point de terminaison HTTP que vous pouvez appeler. C'est précisément le fossé qu'une couche de routage existe pour combler — une seule clé pour plus de 200 modèles, le prix catalogue du fournisseur répercuté avec 0 % de marge, et un basculement automatique lorsqu'un fournisseur vacille — mais soyons francs : OrcaRouter ne propose actuellement pas Intern-Decision-4B ni aucun modèle de ce type. Notre catalogue ne le référence pas, et rien ici ne doit être interprété comme une affirmation de disponibilité. Ce que nous pouvons offrir, c'est la décision la plus économique : si vous souhaitez essayer un évaluateur de décision de 4,5 milliards de paramètres en amont d'un chemin de production, vous pouvez l'intégrer dans un routeur avec un repli vers un modèle général, afin qu'une mauvaise journée de calibration ne vous coûte qu'une nouvelle tentative plutôt qu'une panne.
Qu'est-ce qui changerait la donne
Trois choses, par ordre d'importance. Quelqu'un en dehors d'InternLM doit reproduire la moyenne de 90,02 et l'erreur de calibration attendue de 0,065 — des affirmations de calibration qui n'ont jamais été confrontées à un jeu de test externe sont les chiffres les moins transférables de l'apprentissage automatique. L'empreinte propre à la fiche doit apparaître : le Space, la collection, le dépôt GitHub. Et le fournisseur doit dire s'il s'agit d'un produit ou d'un artefact de publication, car une licence de recherche uniquement et une licence Apache-2.0 ne représentent pas le même engagement, et le 4B a choisi Apache-2.0 avec la licence Qwen conservée à ses côtés. D'ici là, le cadrage correct est celui que suggère l'upload lui-même : il s'agit d'un véritable checkpoint avec un véritable contrat d'inférence et une fiche de scores totalement non vérifiée, publié sans que personne n'en ait été informé.
Pour l’instant, le résumé honnête est étroit et utile. Si votre problème est « choisir l’une de cinq étiquettes de routage et me dire à quel point vous êtes sûr », un modèle 4,5 B qui émet 62 logits et pas de prose est une forme défendable à évaluer. Si votre problème implique un document long, plus de huit images, ou le besoin d’expliquer la réponse en mots, ce checkpoint tel qu’il est livré est le mauvais outil, et aucun peaufinage de benchmark fournisseur ne changera cela.
