Une carte de titre pour un article comparatif intitulé Intern-Decision-0.8B vs Qwen 3.8, sous-titré 853 millions de paramètres, 1,71 Go, et un ensemble fermé de réponses, avec trois cartes à ligne plate indiquant Sujet : Intern-Decision-0.8B publié le 26 septembre 2026 sans annonce, Adversaire : Qwen 3.8, un cœur sparse de 2,4 T avec Qwen3.8-Max à 2,00 $ et 6,00 $, et Constat clé : le modèle frère 2B est plus rapide et plus précis, alors que seule l'empreinte favorise le 0.8B.
Engineering & Research

Intern-Decision-0.8B vs Qwen 3.8 : 853 millions de paramètres et un ensemble fermé de réponses

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Intern-Decision-0.8B est le plus petit des trois modèles de décision qu'InternLM a mis en ligne sur Hugging Face le matin du 26 septembre 2026, et ce n'est pas le plus rapide des trois. C'est la première chose à savoir. D'après les propres mesures du laboratoire, son homologue 2B tourne légèrement plus vite — 33,28 ms contre 33,98 ms — et obtient six points de plus sur la même moyenne de sept suites, si bien que la raison habituelle de se tourner vers un checkpoint de moins d'un milliard de paramètres, la vitesse brute, ne s'applique pas ici. Ce qui s'applique, c'est la taille : 852 985 920 paramètres, 1,71 Go de poids en bf16, assez petit pour tenir en permanence en marge d'une machine qui a autre chose à faire. Face à Qwen3.8-Max — la version hébergée du cœur à mélange d'experts épars de 2 400 milliards de paramètres que l'éditeur a publié en août, facturé 2,00 $ et 6,00 $ par million de tokens — les deux ne sont pas en concurrence pour le même usage. L'un renvoie une distribution de probabilités sur les options que vous avez fournies à l'avance. L'autre écrit.

La réponse courte : Intern-Decision-0.8B vaut la peine d'être adopté si vous avez besoin d'un score de décision à ensemble fermé exécuté sur du matériel que vous possédez déjà, et si 1,71 Go au lieu de 4,43 Go fait la différence entre livrer et ne pas livrer. Il ne vaut pas la peine si vous voulez le petit évaluateur le plus précis qu'InternLM ait livré cette semaine — c'est le 4B — ou si votre réponse n'est pas déjà énumérée dans votre invite, auquel cas ni l'un ni l'autre de ces deux modèles n'est l'outil adéquat et Qwen 3.8 est le seul des deux à pouvoir faire le travail, ne serait-ce que du tout.

Ce que dit le dépôt, et ce que rien d'autre ne fait

Commençons par les preuves, car il y en a très peu. InternLM n'a fait aucune annonce pour ce modèle. Aucune publication de lancement, aucun article, aucune description de dépôt. La fiche Hugging Face renvoie vers un Space de démonstration et un dépôt GitHub, et, au moment où j'écris, le Space renvoie 401 et le lien GitHub renvoie 404 — les deux endroits vers lesquels la fiche vous oriente pour plus d'informations sont fermés. Trois checkpoints sont apparus en l'espace de quarante secondes, vers 05:36 UTC le 26 septembre : Intern-Decision-0.8B, Intern-Decision-2B et Intern-Decision-4B, tous portant les mêmes tags — prise de décision, multimodal, prédiction structurée — et tous des fine-tunes de checkpoints Qwen, en l'occurrence Qwen3.5-0.8B.

Ce que l'on peut savoir à partir du dépôt est d'une précision inhabituelle pour une version non annoncée, parce que le laboratoire a livré son propre module d'inférence aux côtés des poids. Le 0.8B se charge via un inference.py de 16 KB dans le répertoire du modèle, nécessite Python 3.12 ou plus récent et torch 2.9.1 avec transformers 5.14.1, et expose une classe DecisionEngine que vous instanciez une fois et réutilisez. Un dictionnaire Python en entrée, un dictionnaire de réponse en sortie. Ce que l'on ne peut pas savoir : s'il s'agit d'une version finalisée ou d'une publication anticipée, si un point de terminaison hébergé est prévu, et si les deux checkpoints entre lesquels il se situe sont censés être le même produit à des tailles différentes ou trois produits différents qui se trouvent partager un nom. Personne en dehors d'InternLM n'en a exécuté aucun.

The Hugging Face model card for InternLM's Intern-Decision-0.8B, showing the internlm organisation, a 0.9B params label, tags for image-text-to-text, transformers, safetensors, qwen3_5, decision-making, multimodal, structured-prediction and conversational, an opening line stating the model is a multimodal structured decision model fine-tuned from Qwen3.5-0.8B, and a Checkpoint and docs section that also reports 0.9B params.

Le problème du frère : le 2B est plus rapide et meilleur

Voici la partie du tableau publié par InternLM lui-même qui rend le 0.8B difficile à situer. En lisant les trois tailles de haut en bas dans les mêmes sept suites :

• Vitesse — 0,8B : 33,98 ms en moyenne, 33,44 ms en médiane, 37,50 ms au p95. 2B : 33,28 ms, 33,15 ms, 33,55 ms. 4B : 44,16 ms, 44,03 ms, 44,60 ms. Toutes mesurées par requête sur une seule RTX 4090 via le chemin local Hugging Face.

• Moyenne sur sept suites — 0,8B : 79,38. 2B : 84,68. 4B : 90,02.

• Calibration — 0,8B : Brier 0,530, ECE 0,066. 2B : Brier 0,437, ECE 0,100. 4B : Brier 0,347, ECE 0,065.

• Empreinte sur disque en bf16 — 0,8 B : 1,71 Go. 2 B : 4,43 Go. 4 B : 9,08 Go.

Le 2B est plus rapide en moyenne, nettement plus resserré dans la queue de distribution, et plus précis, tout à la fois. Donc « plus petit signifie plus rapide » est faux au sein de cette famille — et même à double titre, puisque le 4B est plus lent que les deux. Le seul axe sur lequel le 0,8B l'emporte nettement est celui que personne ne mesure : 1,71 Go contre 4,43 Go pour le 2B et 9,08 Go pour le 4B. Si vous devez loger un modèle d'évaluation dans un budget mémoire fixe — une petite machine toujours en fonctionnement, un GPU mutualisé, un nœud en périphérie dont la carte est déjà occupée en majeure partie par un modèle de langage —, c'est là tout l'argument, et c'est un argument qui tient.

Le reste du tableau est une étude de l'endroit où les petits modèles craquent de façon inégale. Le score Typed Decision du 0.8B est de 77,35 contre 80,55 pour le 4B — trois points d'écart pour un cinquième du nombre de paramètres. Mais Jevbench-Original chute de 98,61 à 80,56 et WildJailBreak s'effondre de 89,86 à 64,48. Quoi que mesurent ces deux suites — la fiche ne le dit pas, et la fiche ne donne aucune définition des suites — ce sont elles qui pénalisent le plus durement le petit checkpoint. Un modèle qui tient le coup sur un axe et chute brutalement sur deux autres n'est pas un modèle uniformément plus faible. C'est un modèle avec une frontière de compétence spécifique, et vous voudriez savoir où se situe votre charge de travail avant d'y engager la flotte.

Une mise en garde de plus concernant la ligne de calibration. L’ECE de 0,066 du 0.8B est son meilleur chiffre — meilleur que le 0,095 de Jev sur la même suite — tandis que son score de Brier de 0,530 est pire que le 0,358 de Jev. L’erreur calibrée et l’erreur quadratique moyenne des probabilités ne sont pas la même mesure, et un tableau qui montre l’une comme forte et l’autre comme faible vous dit que la distribution est bien formée près de ses pics de confiance et plus épaisse qu’elle ne devrait l’être entre les deux. Si votre système applique un seuil sur la confiance, cette distinction compte davantage que la moyenne.

Ce que 1,71 Go permet vraiment d’acheter

Le chemin d'inférence dans ce modèle est un scoreur, et non un générateur, et la différence de coût est structurelle plutôt qu'incrémentale. Vous lui fournissez un état partagé, un schéma de questions nommées et, éventuellement, jusqu'à huit images. Chaque question est de l'un des trois types : choix (l'un d'un ensemble ordonné d'options), score (une échelle ordinale, renvoyée sous forme de valeur attendue pondérée par les probabilités), ou noul (binaire non/oui). L'état, le schéma et un squelette JSON complet d'assistant sont rendus avec un espace réservé par champ, le modèle effectue une seule passe avant causale, et les logits sont lus à la position immédiatement avant chaque espace réservé. Un softmax est appliqué uniquement sur les symboles candidats autorisés de ce champ, la calibration ajustée du checkpoint est appliquée, les symboles sont mappés vers vos valeurs d'option.

Trois conséquences en découlent. Il n'y a pas de token de sortie, donc pas de prix de sortie — un million de décisions ne coûtent rien en tokens. Il n'y a pas de boucle de décodage ni d'accolade à oublier, de sorte qu'un JSON malformé n'est pas un mode de défaillance. Et comme l'espace de réponse de chaque champ est assemblé à chaque requête, un schéma que vous inventez cet après-midi n'exige aucun réentraînement : ajoutez une question et ses options deviennent des symboles candidats pour ce champ.

Les limites sont énoncées tout aussi simplement. De un à seize questions, jusqu’à 62 options chacune, jusqu’à huit images, et un plafond par défaut de 8 192 jetons — les entrées qui le dépassent sont rejetées plutôt que tronquées. Cette dernière clause est une décision de conception qui mérite qu’on s’y attarde, car la troncature silencieuse est ce qui fait qu’un classifieur se met discrètement à répondre à une autre question que celle que vous avez posée. InternLM échoue bruyamment au lieu de cela, ce qui est correct et constitue aussi un piège opérationnel : un long fil de tickets, plus un schéma, plus des images, dépasseront les 8 192 plus vite que vous ne le pensez, et il n’existe aucune voie élégante lorsque cela se produit.

Et les 1,71 Go achètent une économie d'exécution que vous pouvez calculer. À 33,98 ms par décision, un million de décisions représente 9,44 heures sur une seule RTX 4090. Le 4B a besoin de 12,3 heures pour le même million, et abandonne dix points et demi de précision en échange des 7,37 Go que vous n'aviez pas. Aucun de ces chiffres n'inclut le coût de la machine, et aucun n'inclut la partie que les gens oublient : vous exploitez un service, et il n'y a pas de serveur dans le dépôt.

The OrcaRouter model page for Qwen3.8 Max, showing the model name, family and tier badges, a 1,000,000-token context window, pricing of $2.00 per million input tokens and $6.00 per million output tokens, an output speed of 63.71 tokens per second, an error rate of 0.69 percent, an Artificial Analysis index of 45.4 at rank 15 of 145, and a side panel listing Qwen 3.8 27B at an Artificial Analysis intelligence index of 33.65 with $0.33 and $2.40 per million tokens.

Qwen 3.8 n'est pas un seul modèle, et c'est l'entrée de gamme qui mérite l'attention

Qwen 3.8, pris comme nom autonome, est Qwen3.8-2.4T-A95B : le cœur à mélange d’experts creux de 2,4 billions de paramètres qu’Alibaba a publié sous forme de poids ouverts le 12 août 2026, avec environ 95 milliards de paramètres actifs par token et une licence personnalisée plutôt qu’Apache 2.0. La version hébergée de ce même cœur est Qwen3.8-Max, généralement disponible sur une API payante depuis le 3 août et actualisée sous la forme d’un instantané daté du 2 septembre. Il s’agit d’un seul cerveau vendu de deux manières, et c’est la seconde version que la plupart des gens appelleront réellement.

D'après des chiffres indépendants, Artificial Analysis mesure l'instantané de septembre de Qwen3.8-Max à un Intelligence Index de 45,4 — quinzième sur 145 modèles indexés — avec un score AA Coding de 76,2, au neuvième rang sur 138, GPQA Diamond à 92,8, Humanity's Last Exam à 43,1 et un score de rappel en contexte long de 80,3. Le checkpoint ouvert est en retrait, à 39,9, par rapport à l'API dont il a été distillé. Sur notre propre fenêtre de test de sept jours, Qwen3.8-Max affiche un p50 de 2 578 ms et un p95 de 9 539 ms à 55,5 jetons de sortie par seconde, avec un taux d'erreur de 1,57 %. Qwen3.8-Max est appelable sur OrcaRouter au prix catalogue du fournisseur, avec 0 % de marge ajoutée, de sorte qu'un changement de prix d'Alibaba est répercuté chez nous le jour même plutôt qu'au cycle de facturation suivant.

Le frère dense est toutefois celui qu'il faut comparer à un point de contrôle local de 1,71 Go, car c'est la façon la moins chère d'acquérir une capacité générale dans cette famille. Qwen3.8-27B est sous licence Apache 2.0, dispose d'un contexte natif de 262 144 tokens, et Qwen3.8-27B est proposé à 0,33 $ et 2,40 $ par million de tokens dans notre catalogue. Son Artificial Analysis Intelligence Index est de 33,7. Il compte environ trente-deux fois le nombre de paramètres d'Intern-Decision-0.8B, reste génératif, et reste le mauvais outil pour une décision à ensemble fermé en volume — mais c'est l'option intermédiaire honnête, et le seul membre de cette comparaison qui soit à la fois véritablement bon marché et véritablement généraliste.

Scorer par rapport au générateur, en termes simples

• Contexte — Qwen3.8-Max dispose d'une fenêtre de 1 000 000 de tokens. Intern-Decision-0.8B rejette tout ce qui dépasse 8 192. Un facteur de 122, imposé plutôt que tronqué.

• Entrée — Qwen3.8-Max accepte du texte, des images et de la vidéo. Intern-Decision-0.8B accepte du texte et jusqu’à huit images, et les tokens d’image sont décomptés du même budget de 8 192.

• Sortie — Qwen3.8-Max écrit, raisonne, appelle des outils et émet du JSON sur demande. Intern-Decision-0.8B ne peut pas produire un paragraphe, une justification ou un plan. Il peut seulement noter les options que vous avez déjà pensé à lister.

• Coût par appel — un appel de triage réaliste de 800 tokens d'entrée et 150 tokens de sortie coûte environ 0,0025 $ sur Qwen3.8-Max, avant tout token de raisonnement, et son volume de sortie est évalué de manière optimiste, car il s'agit d'un modèle de raisonnement. Un million de tels appels représente environ 2 500 $. Intern-Decision-0.8B n'a aucun prix au token : un million de décisions représente 9,44 heures d'une 4090 que vous possédez ou louez.

• Latence — 2 578 ms en médiane sur Qwen3.8-Max au cours des sept derniers jours, réseau et file d’attente compris. Les 33,98 ms d’Intern-Decision-0.8B correspondent à une simple passe avant sur une carte locale et ne constituent pas la même mesure ; la comparaison honnête est d’un ordre de grandeur, pas de quatre-vingts fois.

• Preuves — chaque chiffre d’Intern-Decision-0.8B ici est rapporté par le fournisseur sur les propres bancs d’essai d’InternLM et n’est reproduit par personne, y compris la latence. Chaque chiffre de Qwen 3.8 est soit une donnée propre à Alibaba, soit une mesure d’Artificial Analysis, et ils sont étiquetés séparément ci-dessus.

• Score indépendant — Qwen3.8-Max en a un. Intern-Decision-0.8B n’en a aucun, d’aucune sorte, et aucun fournisseur d’inférence ne le déploie.

A two-column scoreboard comparing Intern-Decision-0.8B and Qwen 3.8. The Intern-Decision-0.8B column reads Parameters 853M, Seven-suite average 79.38, Context 8,192 tokens, Output scores only no text, Cost no token price 1.71 GB local, Latency 33.98 ms local pass. The Qwen 3.8 Max column reads Parameters 2.4T sparse, AA Intelligence Index 45.4, Context 1,000,000 tokens, Output text image video tools, Cost $2.00 and $6.00 per million, Latency 2,578 ms p50 hosted. A footer reads Intern-Decision-0.8B figures are vendor-reported and unreproduced; Qwen3.8-Max figures per Artificial Analysis and our own seven-day window.

Deux façons d’exécuter ce pipeline

La bifurcation opérationnelle est plus tranchée que la bifurcation des benchmarks. Intern-Decision-0.8B est un module, pas un service. Il n'existe pas de point de terminaison compatible OpenAI, pas de serveur de traitement par lots, pas de contrôle de santé, pas de politique de nouvelle tentative, et pas de second réplica à moins que vous n'en construisiez un. Il se charge dans un seul processus et répond à un dict à la fois, et si vous avez besoin de basculement, c'est vous le basculement. C'est une description juste d'un point de contrôle de recherche de 853 millions de paramètres publié sans note de lancement, et il convient d'en tenir compte dans la décision en conséquence.

La moitié générative du même pipeline est un appel réseau, et un appel réseau, c'est précisément à cela que sert un routeur. Qwen3.8-Max et Qwen3.8-27B sont tous deux accessibles derrière une seule clé compatible OpenAI, et le basculement automatique garantit qu'un amont dégradé ne devient pas votre incident — cela vaut la peine d'être signalé ici, car le taux d'erreur en direct sur sept jours de Qwen3.8-Max de notre côté est de 1,57 %, ce qui est faible jusqu'à ce que ce soit votre requête. Le schéma qui a du sens est celui que ce duo décrit discrètement depuis le début : exécuter localement le scorer à ensemble fermé peu coûteux, car il est rapide et ne coûte rien par appel, et router l'étape de raisonnement, car c'est là que se produisent réellement les baisses de prix, le renouvellement des modèles et les pannes.

Deux choses que nous n’affirmerons pas. Intern-Decision-0.8B ne fait pas partie de nos routes et n’en fera pas partie tant qu’InternLM ne l’hébergera pas quelque part — nous n’allons pas laisser entendre le contraire. Et nous n’hébergeons aujourd’hui aucun modèle InternLM, donc rien dans cet article n’est un argument pour faire tourner le sujet chez nous.

Qu’est-ce qui changerait la réponse ?

Trois questions ouvertes, toutes susceptibles de recevoir une réponse en quelques jours. InternLM publie-t-il le dépôt GitHub vers lequel sa propre carte renvoie, et avec lui une description de la manière dont ces poids ont été ajustés ? Un billet de lancement suit-il les checkpoints, transformant une publication discrète en une version documentée avec un récit de déploiement explicite ? Et quelqu’un d’indépendant reproduit-il la moyenne de 79,38 ou l’erreur de calibration de 0,066 sur un matériel qui n’est pas celui d’InternLM ?

Jusqu'à ce que l'un de ces éléments voie le jour, la lecture honnête d'Intern-Decision-0.8B est étroite et précise : c'est le scorer à ensemble fermé le moins cher d'une famille de trois, sur une empreinte qui passe là où son propre frère, plus rapide et plus précis, ne passe pas, publié sans annonce et sans l'unique artefact qui vous dirait sur quoi il a été ajusté. Si votre décision porte sur un ensemble fermé, que vos réponses sont énumérables dans un prompt, et que 1,71 Go est le chiffre dont votre déploiement dépend réellement, c'est le bon choix et rien d'autre n'existe à cette taille. Si votre réponse n'est pas énumérable à l'avance, ou si votre état dépasse 8 192 tokens, ou si vous avez besoin d'une justification que vous pouvez montrer à un humain, alors la comparaison n'a jamais été serrée — et le modèle que vous voulez n'a jamais été celui à 853 millions de paramètres.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement