
Intern-Decision-2B vs Qwen 3.8 : un seul backbone, deux tâches très différentes
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 584 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 187 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Ouvrez la configuration de internlm/Intern-Decision-2B et celle de Qwen/Qwen3.5-2B côte à côte et presque rien ne diffère. Mêmes 24 couches, même taille cachée de 2 048, mêmes 8 têtes de requête contre 2 têtes clé-valeur, même dimension de tête de 256, même plafond d'embedding de 262 144 positions, même vocabulaire de 248 320 tokens, même schéma répétitif de trois couches d'attention linéaire pour une couche d'attention complète. Intern-Decision-2B n'est pas une nouvelle architecture. C'est ce squelette auquel on a retiré sa capacité à générer du texte et dont on a calibré la confiance — et cette unique soustraction est ce qui fait que la comparaison avec Qwen3.8-Max, le vaisseau amiral de 2,4 billions de paramètres auquel renvoie tout le nom de famille « Qwe n 3.8 » en haut de gamme, vaut plus qu'un simple décompte de paramètres.
Les deux ne sont pas concurrents et l’opposition n’est pas un concours. Intern-Decision-2B est un fine-tune de Qwen3.5-2B à 2 213 241 664 paramètres, téléversé sur Hugging Face à 05:36 UTC le 26 septembre 2026 parmi trois modèles frères non annoncés, et il n’émet aucun token : il prend un état et des questions typées, exécute une seule passe avant causale, lit les logits à des positions de placeholder fixes, et renvoie une distribution calibrée par champ. Qwen3.8-Max est le modèle phare hébergé d’Alibaba, un modèle à mélange d’experts creux avec environ 95 milliards de paramètres actifs par token, une fenêtre de contexte multimodale d’un million de tokens et un tarif catalogue de 2,00 $ par million de tokens d’entrée et de 6,00 $ par million de tokens de sortie. L’un est un composant. L’autre est un service. La question utile est de savoir où se situe la couture entre eux dans un pipeline pour lequel vous payez déjà.
La soustraction, précisément
Ce que le réglage des décisions a changé mérite d’être énoncé avec précision, car cela clarifie ce que le modèle de base portait déjà.
La tâche est nommée dans le dépôt « autoregressive masked language modelling ». L'entrée de l'assistant contient un squelette JSON complet avec un jeton <decision> par champ ; les symboles de réponse de référence n'apparaissent que dans les étiquettes, jamais dans l'entrée. L'entraînement utilise l'alignement causal ordinaire du jeton suivant, où le logit immédiatement avant un marqueur prédit la réponse de ce champ, et tous les champs partagent une seule passe avant. À l'inférence, les logits sont restreints aux symboles de réponse légaux à un seul jeton — A–Z, a–z, 0–9, d'où provient le plafond de 62 options — puis passés au softmax et reconvertis vers vos étiquettes.
Ainsi, le mécanisme de prédiction du jeton suivant du modèle de base est intact et non modifié. Ce qui a été entraîné, c'est une préférence pour occuper l'une d'une poignée de positions de réponse plutôt que de continuer une phrase, ainsi qu'une température propre au checkpoint de 2,100509348278 ajustée par log-vraisemblance négative sur 1 728 cas de calibration désignés, avec 1 693 en réserve. La fiche est sans ambiguïté : la génération est exclue : l'API « effectue une notation structurée des candidats. Elle n'appelle pas generate() et n'échantillonne pas de texte libre. »
Le dépôt consigne également ce que le réglage n'a pas touché : il « affine le backbone linguistique de Qwen3.5 tout en gelant la tour de vision et le projecteur ». Le fragment de vision de 612 517 440 octets sur le 2B a le même nombre d'octets que sur le point de contrôle de décision 4B, ce qui correspond à des composants hérités plutôt qu'entraînés. Le chemin d'image fonctionne ; ce n'est simplement pas ce sur quoi la passe de décision a dépensé son budget.

Ce que 2,2 milliards de paramètres ne peuvent pas faire, et ce que les 2 400 milliards font à la place
Tout se joue sur un seul axe : votre réponse existe-t-elle déjà sous forme de liste ?
Intern-Decision-2B répond à un ensemble fermé. De une à seize questions, jusqu'à 62 options chacune, jusqu'à huit images, le tout dans un budget de 8 192 tokens que le moteur refuse plutôt que de tronquer. Renvoyées sous forme de probabilités. À 33,28 ms en moyenne par requête sur une seule RTX 4090 avec un P95 de 33,55 ms, et rien de facturé par appel car il n'y a pas de sortie à facturer.
Qwen3.8-Max écrit. Un contexte d'un million de tokens, une entrée texte, image et vidéo, un raisonnement avec un mode de réflexion, un appel d'outils natif, des sorties structurées, jusqu'à 131 000 tokens de sortie sur le build daté du 0902. Il peut aussi, en principe, prendre la même décision de routage qu'Intern-Decision-2B — vous pouvez lui demander de choisir parmi des options et de renvoyer du JSON. Trois choses tournent mal lorsque vous le faites. Vous payez les tokens qu'il dépense à décider. Vous obtenez une chaîne dont l'analyse peut réussir ou échouer. Et le nombre à l'intérieur de cette chaîne est ce que le sampler a produit, pas un softmax que vous pouvez seuiller à 0,8 et sur lequel agir.
Les deux versions sont vraies et ni l’une ni l’autre n’annule l’autre. Le modèle phare à 2,4 billions de paramètres existe parce que la plupart des problèmes ne sont pas des ensembles fermés. Le scoreur à 2,2 milliards de paramètres existe parce que le sous-ensemble qui l’est mérite un instrument moins coûteux.
Tableau d'affichage

• Paramètres — Intern-Decision-2B : 2 213 241 664 en BF16, plus une tour de vision et un projecteur, environ 4,46 Go sur disque ; Qwen3.8-Max : environ 2 400 milliards au total, dont environ 95 milliards par token, servi et non téléchargé.
• Contexte — 8 192 tokens, rejeté au-delà ; 1 000 000 de tokens avec 131 000 de sortie maximale sur le 0902.
• Sortie — probabilités calibrées et un argmax, aucun texte généré ; texte généré incluant une trace de raisonnement.
• Modalités d'entrée — texte plus jusqu'à huit images ; texte, image et vidéo.
• Coût — aucun frais par appel, et vous possédez le GPU ; 2,00 $ par million de tokens d'entrée, 6,00 $ par million de tokens de sortie, avec les lectures du cache à 0,25 $ et les écritures du cache à 2,50 $.
• Données publiées — un tableau fournisseur à sept suites affichant une moyenne de 84,68, un Brier de 0,437 et un ECE de 0,100 sur 10 751 lignes de test, que personne en dehors d’InternLM n’a reproduit, sur un checkpoint avec un like et zéro téléchargement ; un Artificial Analysis Intelligence Index de 45,4 au rang 15 sur 145 et un AA Coding index de 76,2 au rang 9 sur 138, tous deux mesurés indépendamment.
• Latence — 33,28 ms en moyenne par requête sur un seul RTX 4090, diminuant à mesure que le batching est ajouté ; 2,655 secondes P50 jusqu’au premier token, comme le rapporte le catalogue, augmentant avec la charge.
Les lignes de preuves ne sont pas équivalentes et ne devraient pas être présentées comme si elles l'étaient. Le modèle phare d'Alibaba s'appuie sur un score d'indice indépendant. Le checkpoint d'InternLM dispose d'un tableau produit par ses propres auteurs, et le chiffre de calibration en particulier doit se lire comme une intention bien documentée tant qu'il n'a pas été confronté aux données de quelqu'un d'autre — d'autant plus ici que cette taille particulière affiche la pire erreur de calibration attendue des trois versions livrées par InternLM, 0,100 contre 0,066 pour le modèle deux fois plus petit et 0,065 pour celui qui fait presque le double.
La couture, et comment l'exécuter
Le pipeline qui a du sens n’est pas un choix entre ces deux options, mais une répartition : le scorer gère les décisions énumérées, et un modèle de frontière gère tout ce dont la réponse n’est pas une liste. Un triage de support qui oriente vers l’une de six équipes et évalue l’urgence sur une échelle à trois niveaux n’a pas besoin de 95 milliards de paramètres actifs ; il a besoin d’une probabilité et d’un seuil. Le chemin d’escalade qui finit par rédiger une réponse au client, lui, en a besoin.
Cette séparation a une forme opérationnelle. Intern-Decision-2B n'est pas disponible sur OrcaRouter — notre page de modèle pour celui-ci renvoie 404 et nous n'avons trouvé aucune route hébergée nulle part — il tourne donc sur votre propre matériel, ce qui signifie qu'il s'agit d'un composant que vous exploitez et surveillez. Qwen3.8-Max est une route : une clé pour plus de 200 modèles, le prix catalogue du fournisseur transmis sans marge, ce qui signifie qu'un changement de prix du fournisseur sur le modèle phare se répercute sur votre facture le jour même où il survient. Placer la partie hébergée du pipeline derrière cette surface unique, c'est ce qui permet à la partie la moins chère de le rester : le scorer maintient le volume d'appels bas, et le modèle de pointe n'est sollicité que pour les cas qui en ont réellement besoin.

Si vous êtes encore en train d'évaluer quel scoreur doit occuper cet emplacement — celui-ci n'a fait l'objet d'aucune évaluation indépendante, et sa calibration est la plus faible de sa propre famille — basculement automatique entre fournisseurs est la façon de l'essayer dans un chemin qui dispose déjà d'une alternative fonctionnelle derrière lui plutôt que de remplacer cette alternative purement et simplement.
Le verdict honnête
Si votre problème est une décision portant sur un ensemble de réponses que vous pouvez énumérer, et que l’état tient dans huit mille tokens, Intern-Decision-2B le fera en trente-trois millisecondes, gratuitement à chaque appel, et aucun modèle de pointe ne le battra sur cet axe, quel que soit le nombre de paramètres que vous louez. Faites votre propre calibration dessus avant de dépendre de la confiance qu’il rapporte.
Si votre problème est autre chose — raisonnement, contexte long, utilisation d'outils, vidéo, un document d'un million de jetons, ou simplement une réponse qui n'a pas encore été écrite — Qwen3.8-Max n'est pas simplement. C'est le seul des deux qui puisse faire le travail, tout simplement.
Et si vous ne pouvez pas encore dire lequel de ces deux vous avez, la réponse est probablement que vous avez les deux, dans le même pipeline, ce qui est l’architecture que les nombres de paramètres vous indiquaient discrètement depuis le début.
