Une carte de titre pour un article comparatif intitulé Intern-Decision-4B vs Qwen 3.8, sous-titré Une passe avant de 44 millisecondes face à 2,4 billions de paramètres, avec trois icônes plates au trait suggérant un petit évaluateur rapide, un grand modèle de raisonnement et une comparaison des coûts.
Engineering & Research

Intern-Decision-4B vs Qwen 3.8 : une passe avant de 44 millions face à 2,4 billions de paramètres

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

InternLM a publié Intern-Decision-4B sur Hugging Face le matin du 26 septembre 2026 — aucun billet de lancement, aucune entrée de blog, un lien GitHub sur sa propre fiche de modèle qui renvoie un 404 et un Space de démo qui renvoie un 401. Les poids sont réels et téléchargeables ; l'annonce, elle, est absente. Et le modèle qui les sous-tend est un fine-tune de Qwen3.5-4B, ce qui rend la comparaison avec le modèle phare hébergé plus intéressante qu'une fiche technique. Ces deux-là ne sont pas des rivaux. Ils sont les deux extrémités d'un même pipeline, et toute la question est de savoir où se situe la frontière entre eux. Le cœur sous-jacent est le modèle à 2,4 billions de paramètres que le fournisseur a publié en août et sert désormais sous le nom de Qwen3.8-Max, facturé 2,00 $ et 6,00 $ par million de jetons ; Intern-Decision-4B est une reconstruction de 4,54 milliards de paramètres de ce modèle de base vieux de sept mois, qui n'émet aucun jeton, répond à jusqu'à seize questions typées en une seule passe avant, et ne coûte rien par appel puisqu'il n'y a pas de sortie à facturer.

La réponse en une ligne : si votre tâche est une décision avec un ensemble fermé de réponses, Intern-Decision-4B est environ cinquante fois plus rapide par décision et structurellement moins coûteux, et aucun modèle de pointe ne le battra sur cet axe étroit. Si votre tâche est autre chose — raisonnement, contexte long, utilisation d’outils, tout ce où la réponse n’est pas déjà énumérée dans votre prompt — Qwen 3.8 n’est pas simplement meilleur, c’est le seul des deux qui puisse faire le travail tout court. Tout ce qui suit vise à trouver cette ligne avec précision.

Qu’est-ce qui est réellement confirmé, et qu’est-ce qui ne l’est pas ?

Commençons par les preuves, car le cadrage compte. Il n'y a aucune annonce de fournisseur pour Intern-Decision-4B. Aucun communiqué de presse, aucun article, aucune description de dépôt à lire. Ce qui existe aujourd'hui est un dépôt Hugging Face publié ce matin sous l'internlm organisation — Intern Large Models, le groupe Shanghai AI Laboratory — portant la licence Apache 2.0 avec la licence Qwen amont conservée à côté sous le nom de LICENSE-QWEN. Deux checkpoints frères sont apparus à quarante secondes d'intervalle : Intern-Decision-0.8B avec 853 millions de paramètres et Intern-Decision-2B avec 2,21 milliards. Tous les trois portent les mêmes tags — prise de décision, multimodal, prédiction structurée — et tous les trois se trouvent sous une collection de modèles qui ne se résout pas encore publiquement.

Ce qui n’est pas confirmé : s’il s’agit de la version finale ou d’une publication anticipée. Le dépôt a été créé à 05:36 UTC et modifié de nouveau avant 08:00 UTC le même jour, et d’autres activités publiques sur les checkpoints frères se sont poursuivies après 09:00. InternLM n’a pas dit quel était le scénario de déploiement envisagé, n’a pas publié le dépôt vers lequel il renvoie, et n’a pas dit si un endpoint hébergé allait arriver. Considérez chaque chiffre de benchmark dans cet article comme rapporté par le fournisseur et non reproduit — car au moment où j’écris ces lignes, absolument rien d’autre n’a été écrit sur ce modèle, où que ce soit. Trois recherches distinctes ne renvoient rien sur ce nom.

Screenshot of the Hugging Face model card for internlm/Intern-Decision-4B, showing the internlm organization, the image-text-to-text and transformers tags, 5B params, and the model card opening line describing a multimodal structured decision model fine-tuned from Qwen3.5-4B.

Le pari architectural : un scoreur, pas un générateur

La phrase la plus importante dans la documentation propre à Intern-Decision-4B est une négation : le chemin d'inférence « n'appelle pas generate() et n'échantillonne pas de texte libre ». Ce n'est pas un détail d'implémentation, c'est tout le design, et c'est ce qui le distingue d'un appel à Qwen3.8-Max avec un schéma JSON en espérant que l'accolade se ferme.

Voici le mécanisme, tel que la carte le décrit. Vous fournissez au modèle un état partagé, un schéma de questions nommées et, éventuellement, jusqu’à huit images. Chaque question est de l’un des trois types : choice (choisir l’une d’un ensemble ordonné d’options), score (évaluation sur une échelle ordinale, renvoyée sous forme de valeur attendue pondérée par les probabilités), ou noul (un binaire non/oui). Le prompt système, l’état, le schéma et un squelette JSON complet d’assistant sont rendus avec un espace réservé par champ. Ensuite — et c’est là l’astuce — le modèle effectue une seule passe avant causale, et les logits sont lus à la position immédiatement avant chaque espace réservé. Un softmax est calculé uniquement sur les symboles candidats autorisés de ce champ, la calibration du checkpoint est appliquée, et les symboles sont remappés vers vos valeurs d’option d’origine.

Les conséquences sont concrètes. Comme l’espace de réponse de chaque champ est assemblé à chaque requête plutôt qu’intégré dans une tête de vocabulaire, un schéma que vous inventez cet après-midi ne nécessite aucun réentraînement — ajoutez une question, et les options deviennent des symboles candidats pour ce champ. Comme il n’y a pas de boucle de décodage, il n’y a pas de token de sortie, pas d’accolade à oublier, ni de logique de nouvelle tentative autour d’un JSON mal formé. Et comme toutes les questions sont évaluées à partir de la même lecture de l’état, seize questions coûtent une seule passe avant, et non seize.

Les limites sont tout aussi concrètes, et la fiche les énonce sans hésitation. De une à seize questions, jusqu'à 62 options par question, jusqu'à huit images. Un maximum par défaut de 8 192 tokens — et les entrées qui le dépassent sont rejetées sans troncature. Cette dernière clause est une décision de conception qui mérite qu'on s'y attarde : la troncature silencieuse est la manière dont un classificateur se met discrètement à répondre à une autre question que celle que vous avez posée, et InternLM a choisi d'échouer bruyamment plutôt que cela. C'est le bon choix, et c'est aussi un piège opérationnel, car un long fil de tickets, plus un schéma, plus des images, dépassera les 8 192 bien plus vite que vous ne l'imaginez, et il n'existe aucune voie élégante — vous obtenez une erreur.

Là où Intern-Decision-4B l'emporte, et de loin

Deux axes, et tous deux sont structurels plutôt qu'incrémentaux.

• Latence par décision — 44,16 ms en moyenne, 44,03 ms en médiane, 44,60 ms au p95, mesurée sur une seule RTX 4090 via le chemin local Hugging Face. Face à Qwen3.8-Max, dont la fenêtre glissante de sept jours en direct sur notre propre playground affiche un p50 de 2 474 ms et un p95 de 9 789 ms à 55,4 jetons de sortie par seconde. Cela représente environ 56× à la médiane, et la comparaison n’est pas tant inéquitable qu’elle oppose deux opérations différentes : un modèle classe, l’autre raisonne puis écrit. L’écart est réel, et sa raison l’est tout autant.

• Coût par décision — et ici, il s’agit d’arithmétique, pas d’opinion. Prenons un appel réaliste de triage du support : 800 jetons d’entrée pour l’état et le schéma, et 150 jetons de sortie pour un JSON structuré. Sur Qwen3.8-Max, cela représente 800 × 2,00 $/M plus 150 × 6,00 $/M, soit environ 0,0025 $ par décision, avant même un seul jeton de raisonnement — et Qwen3.8-Max est un modèle de raisonnement, donc l’estimation de la sortie est optimiste, c’est-à-dire basse. Un million de décisions coûte environ 2 500 $. Ce même million de décisions sur Intern-Decision-4B coûte zéro jeton et environ 12,3 heures de temps de RTX 4090. Intern-Decision-4B n’a pas de prix de sortie parce qu’il n’a pas de sortie.

Le compromis est honnête et évident : le 4B a besoin d’un GPU que vous possédez ou louez, il occupe ce GPU, et il ne pourra jamais faire qu’une seule chose. Mais si cette seule chose est ce que votre produit fait des millions de fois par jour, le calcul ci-dessus constitue toute la justification économique, et aucune capacité de modèle de pointe, aussi grande soit-elle, n’y change quoi que ce soit.

Le nombre que Qwen 3.8 ne publie pas : calibration

C'est le différenciateur discret, et c'est celui que la plupart des comparaisons laisseront échapper parce qu'il ne ressemble pas à un benchmark.

Intern-Decision-4B renvoie une distribution sur les valeurs de vos options, pas seulement une étiquette — ainsi qu’un niveau de confiance, et pour noul questions, la probabilité calibrée de « oui ». InternLM rapporte un score de Brier de 0,347 et une erreur de calibration attendue de 0,065 sur sa propre suite, et fournit la température ajustée dans le checkpoint : 1,99241824, ajustée séparément pour cette taille par minimisation de la log-vraisemblance négative sur 1 728 cas de calibration désignés, avec 1 693 cas de validation mis de côté. Les étiquettes de la suite de tests n’ont pas été utilisées pour la sélectionner. Il existe un second diagnostic indépendant de 96 cas dans la carte, utilisant des distributions de référence exactes plutôt que des étiquettes échantillonnées, et il montre que le Brier/ECE global passe de 0,628 / 0,213 avant calibration à 0,550 / 0,089 après — l’étape de calibration réduisant l’erreur attendue de bien plus de la moitié.

Cherchez maintenant le même chiffre du côté de Qwen 3.8. Il n’y est pas. Alibaba publie les scores de l’Artificial Analysis Index, GPQA Diamond, terminal-bench, SciCode, tau-banking et le rappel en contexte long — toutes des mesures de capacités. Il ne publie aucune métrique de calibration pour quelque membre que ce soit de la famille Qwen 3.8, car la confiance d’un modèle génératif n’est pas une quantité que le fournisseur livre. Si votre système a besoin d’une probabilité sur laquelle appliquer un seuil ou effectuer un routage plutôt que d’une réponse à laquelle il doit se fier, cette différence n’est pas une question de degré. Un modèle vous donne un nombre accompagné d’un taux d’erreur documenté ; l’autre vous donne du texte, et vous construisez votre propre estimation de confiance autour de lui.

Là où Qwen 3.8 l'emporte, et ce n'est pas serré non plus

Mettez les deux côte à côte sur ce qu’on peut leur demander de faire, et les limites cessent d’être subtiles.

• Contexte — Qwen3.8-Max dispose d'une fenêtre de 1 000 000 de tokens. Intern-Decision-4B rejette tout ce qui dépasse 8 192. Cela représente un facteur de 122, et il n'existe aucune solution de contournement, car le plafond d'entrée est imposé plutôt que tronqué.

• Modalité d'entrée — Qwen3.8-Max accepte le texte, l'image et la vidéo. Intern-Decision-4B accepte le texte et les images, jusqu'à huit, et les jetons d'image sont comptabilisés dans le même budget de 8 192.

• Raisonnement et outils — Qwen3.8-Max intègre l'utilisation d'outils, le mode JSON et le raisonnement parmi ses capacités déclarées, et affiche un Artificial Analysis Intelligence Index de 45,4, au quinzième rang sur 145 modèles indexés, avec un score AA Coding de 76,2, au neuvième rang sur 138. Ce sont des chiffres indépendants publiés par Artificial Analysis, et non des affirmations de fournisseur. Intern-Decision-4B n'a aucune entrée dans Artificial Analysis, aucun score indépendant d'aucune sorte, et aucune capacité de raisonner, de planifier ou d'appeler quoi que ce soit.

• Production ouverte — Qwen3.8-Max rédige. Intern-Decision-4B ne peut produire ni un paragraphe, ni une justification, ni un plan. Il peut seulement noter les options que vous avez déjà pensé à énumérer.

À noter aussi du côté des poids ouverts : si vous voulez le cœur de Qwen 3.8 lui-même et non la voie hébergée, Qwen3.8-27B est le pendant dense — 27,8 milliards de paramètres, Apache 2.0, un contexte de 262 144 tokens, et environ 0,33 $ / 2,40 $ par million de tokens là où il est servi. Il obtient 33,7 sur l’AA Intelligence Index. Il reste d’un ordre de grandeur plus grand qu’Intern-Decision-4B, reste génératif, et reste le mauvais outil pour une décision à ensemble fermé à grande échelle — mais c’est l’option intermédiaire honnête, et la seule des trois à être à la fois vraiment bon marché et vraiment capable.

Screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the on-page navigation for code samples, pricing, performance, public benchmarks, community buzz, how it compares and FAQ, with the model name and vendor breadcrumb at the top.

Lire honnêtement le propre tableau de benchmarks d’InternLM

La fiche d'Intern-Decision-4B comporte un tableau comparatif, et ce qui est absent de celui-ci est plus instructif que ce qu'il contient. Les lignes sont Jev, Laya, SemIf, Kev, JevK5, et les propres 0,8B et 2B d'InternLM. Chacun d'eux est une autre entrée System One ou de modèle de décision — Jev de TypeSafe AI, Laya de Convai Innovations, et trois autres. Chaque chiffre est déclaré par le fournisseur sur les propres harnais d'InternLM. Il n'y a aucun modèle de pointe dans le tableau.

Ce n'est pas un oubli. C'est la portée honnête de l'affirmation. La moyenne principale d'Intern-Decision-4B de 90,02 sur sept suites — Jevbench-Easy 100,00, Jevbench-Original 98,61, Jevbench-Hard 73,87, Typed Decision 80,55, ToolACE 96,45, AG News 90,82, WildJailBreak 89,86 — est une revendication de leadership dans la catégorie des modèles de décision, ce qui se vérifie sur ce tableau, battant les 88,74 de Jev et les 57,77 de Laya. Ce n'est pas une revendication de concurrence avec Qwen 3.8, et InternLM ne fait cette revendication nulle part. La fiche du modèle se limite à sa propre catégorie, et interpréter une victoire dans une catégorie comme une victoire de capacité est l'erreur que cette section vise à prévenir.

Deux autres mises en garde. Les chiffres de latence — 44 ms en moyenne sur une 4090 — sont mesurés par le fournisseur, dépendent de la charge de travail et du matériel, et une passe avant sur un seul GPU ne constitue pas la même mesure qu'un appel à une API hébergée, qui inclut l'aller-retour réseau et la mise en file d'attente. Et le pilote de calibration porte sur 96 cas : c'est un diagnostic, pas un benchmark, et la fiche le précise.

La question du déploiement, qui est la véritable bifurcation

Oubliez un instant les benchmarks et demandez-vous ce que chacun vous demande sur le plan opérationnel.

Intern-Decision-4B occupe environ 9,1 Go sur disque en bf16 — deux shards linguistiques de 4,26 Go et 4,15 Go, une tour de vision de 612 Mo et un projecteur de 54 Mo. Il se charge via un fichier de 16 Ko, inference.py, livré dans le dépôt lui-même, avec une classe DecisionEngine que vous instanciez une fois et réutilisez. Un dict Python en entrée, un dict de réponse en sortie, avec une exigence de Python 3.12+. Il tourne en 44 ms sur une 4090, et le frère de 0,8B est assez petit pour qu’on puisse raisonner à son sujet avec bien moins de ressources. Mais le module est l’interface — il n’y a pas de serveur, pas de point de terminaison compatible OpenAI, et pas d’API hébergée. Vous construisez le service autour, et si vous en avez besoin de deux pour le basculement, vous construisez aussi cela.

Le volet génératif du même pipeline est une décision entièrement différente, et c'est précisément celle à laquelle un routeur est destiné. Qwen3.8-Max et Qwen3.8-27B sont tous deux appelables sur OrcaRouter derrière la même clé compatible OpenAI, à prix catalogue du fournisseur avec 0 % de marge ajoutée — donc quand Alibaba modifie le prix d'un Qwen, il est effectif de notre côté le jour même plutôt qu'au cycle de facturation suivant. Intern-Decision-4B ne fait pas partie de nos routes et n'en fera pas partie tant qu'InternLM ne l'hébergera pas quelque part ; nous n'allons pas prétendre le contraire. Ce que nous couvrons, c'est la moitié de ce pipeline qui est un appel réseau : une clé pour plus de 200 modèles, un basculement automatique si Qwen3.8-Max se dégrade — son taux d'erreur en direct sur sept jours est de 1,78 % — et la possibilité de comparer en A/B les deux niveaux de Qwen 3.8 l'un contre l'autre dans le même chemin de requête avant de vous engager sur l'un ou l'autre.

Voilà le schéma qu’il vaut la peine de retenir. Exécutez le scorer en local, car il est bon marché, rapide et fait bien une seule chose précise. Routez l’étape de raisonnement, car c’est là que se produisent réellement le churn des fournisseurs, les baisses de prix et les pannes.

A two-column comparison scoreboard titled Intern-Decision-4B vs Qwen 3.8 — the scoreboard, contrasting 44 ms per decision, about $0 in tokens per million decisions, an 8,192-token context, text plus 8 images, a published Brier of 0.347 and no open-ended output on the left against 2,474 ms p50 hosted, about $2,500 per million, a 1,000,000-token context, text, image and video, no published calibration and open-ended reasoning on the right.

Lequel vous devriez réellement choisir

Choisissez Intern-Decision-4B si votre décision est à ensemble fermé, si vos réponses sont énumérables dans un prompt, si vous exécutez la même décision à grande échelle et si la probabilité vous importe autant que l’étiquette. Routage de tickets, modération de contenu selon une taxonomie fixe, extraction structurée vers un schéma que vous contrôlez, grilles d’évaluation, portes binaires — tout ce pour quoi un humain aurait pu rédiger la liste d’options à l’avance. Les 4,54 milliards de paramètres sont honnêtes sur le plafond : la fiche elle-même indique le 4B à 73,87 sur Jevbench-Hard contre 100,00 sur Easy, donc plus la forme de la décision est difficile, plus le petit modèle renonce.

Choisissez Qwen 3.8 — c’est-à-dire Qwen3.8-Max si vous voulez le cœur hébergé, Qwen3.8-27B si vous voulez des poids que vous pouvez conserver — si la réponse ne peut pas être énumérée à l’avance, si l’entrée fait plus de 8 192 tokens, si vous avez besoin d’une justification que vous pouvez montrer à un humain, si vous avez besoin d’appels d’outils, ou si vous avez besoin de vidéo. Choisissez-le aussi si vous ne voulez tout simplement pas exploiter un GPU : 12,3 heures de temps de 4090 par million de décisions n’est bon marché que si vous avez déjà la 4090 et autre chose à en faire les 363 autres jours.

Choisissez les deux si votre pipeline a la forme que la plupart des pipelines ont en réalité — un classifieur économique à ensemble fermé en amont, un modèle de pointe derrière lui pour les cas où le classifieur a un doute. C’est la configuration pour laquelle la confiance calibrée d’Intern-Decision-4B a été conçue, et c’est la raison pour laquelle le chiffre ECE ci-dessus compte davantage que la moyenne mise en avant.

Que regarder

Trois questions ouvertes, toutes susceptibles d’être résolues en quelques jours. InternLM publie-t-il le dépôt GitHub vers lequel sa propre fiche renvoie — actuellement une 404 — et, avec lui, une description de l’entraînement ? Une annonce suit-elle la publication des poids, transformant une mise en ligne discrète en une version documentée ? Et une source indépendante reproduit-elle la moyenne de 90,02, ou le score de Brier de 0,347, sur du matériel qui n’est pas celui d’InternLM ?

Il y a une petite incohérence à signaler pendant que vous attendez, car c’est le genre de chose qui compte lorsqu’on dimensionne un déploiement. Le modèle s’appelle 4B. Le nombre de paramètres est de 4 539 265 536 — 4,54 milliard. Le petit frère 0.8B compte 853 millions et le frère 2B, 2,21 milliards, tous deux arrondis à un cheveu près, vers le haut ou vers le bas. Seul le 4B est arrondi vers le bas de plus d’un demi-milliard. Ce n’est pas un problème. C’est un rappel que, dans une version non annoncée, la doc est la spécification dont vous disposez, et même la doc est encore en cours de modification.