
Intern-Decision-4B vs ContextPilot-8B : un modèle qui réduit le contexte face à un modèle qui le gère
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 592 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 187 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Choisissez votre poison : internlm/Intern-Decision-4B refuse de lire plus de 8 192 tokens, et tencent/ContextPilot-8B existe spécifiquement pour survivre à des contextes qui croissent sans limite. Ils appartiennent à la même classe de taille, sont tous deux des fine-tunes d’une base Qwen, et tous deux ont été publiés sur le Hub sans annonce de fournisseur ni évaluation indépendante d’aucune sorte — ContextPilot-8B le 27 août 2026, Intern-Decision-4B le 26 septembre 2026 — et ils résolvent des problèmes opposés. Intern-Decision-4B est un modèle de décision structuré de 4,5 milliards de paramètres qui effectue une seule passe avant, lit les logits et renvoie une probabilité calibrée pour chaque question que vous avez posée ; il n’écrit jamais le moindre token. ContextPilot-8B est un générateur de texte de 8,19 milliards de paramètres entraîné à planifier, à mémoriser et à décharger son propre contexte de travail pendant une longue exécution d’agent. Les comparer n’est pas vraiment une question de benchmark. C’est une question de savoir quelle moitié de votre problème vous préférez que le modèle avale.
D'abord, la chose qu'ils partagent véritablement
Aucun des deux modèles ne dispose d’un seul chiffre que quelqu’un en dehors de son propre laboratoire ait vérifié. C’est suffisamment inhabituel pour qu’on le précise avant toute autre chose, car la plupart des comparaisons sur ce blog peuvent au moins s’appuyer sur un classement indépendant pour l’un des côtés.
Intern-Decision-4B publie un tableau d’évaluation complet sur sa fiche — une moyenne de 90,02 sur sept ensembles, un score de Brier de 0,347 et une erreur de calibration attendue de 0,065 — le tout mesuré par InternLM sur le harnais d’InternLM. ContextPilot-8B ne publie aucun tableau. Sa fiche indique que le framework « surpassent systématiquement [surpasse] les baselines existantes sur divers modèles de base et benchmarks » et renvoie à un article et à un pipeline d’évaluation pour les détails. Donc, pour cette confrontation, la ligne de sourçage honnête est brève : un côté est rapporté par le fournisseur et non reproduit, l’autre est revendiqué par le fournisseur et non publié, et rien sur cette page n’est indépendant.

Les deux paris, énoncés simplement
Le pari d'Intern-Decision-4B, c'est que la partie difficile d'une décision n'est pas le raisonnement, mais l'engagement. Donnez-lui un état, un schéma de questions nommées et jusqu'à huit images, et il renvoie une distribution sur vos propres chaînes d'options. La procédure d'inférence est déterministe et de forme figée : faire correspondre les options à des symboles d'un seul token, produire un squelette JSON d'assistant avec un espace réservé par champ, exécuter une seule passe avant causale, lire les logits juste avant chaque espace réservé, appliquer un softmax uniquement sur les candidats de ce champ, appliquer la température ajustée. Il n'y a pas de boucle de décodage, donc pas de parseur ni de surface d'hallucination en texte libre. Le prix de ce pari est un plafond d'entrée strict — la fiche indique que les entrées au-dessus de DecisionEngine(max_length=8192) sont « rejetées sans troncature ».
Le pari de ContextPilot-8B est l’image miroir : garder l’agent en train d’écrire des tokens, mais lui apprendre à modifier ce qu’il transporte. Il ajoute la planification, une mémoire à long terme structurée, la récupération et le déport souple du contexte à la boîte à outils de l’agent, puis entraîne le checkpoint avec une recette RL qui échantillonne des branches autour des décisions de modification du contexte qui comptent et attribue le crédit au niveau de l’action plutôt qu’au niveau de la trajectoire. La fiche est franche sur la conséquence en matière d’empaquetage : charger le checkpoint ne vous donne pas la gestion du contexte. Les définitions d’outils, l’environnement d’exécution de l’agent et le pipeline d’évaluation se trouvent ailleurs et doivent être apportés avec.
Tableau des scores, dimension par dimension
• Sortie — Intern-Decision-4B n'émet aucun texte du tout, seulement des probabilités sur les valeurs de vos options ; ContextPilot-8B génère normalement et ses réponses sont de la prose et des appels d'outils que vous devez analyser.
• Plafond d'entrée — Intern-Decision-4B refuse tout ce qui dépasse 8 192 tokens ; ContextPilot-8B hérite de la limite de position de 40 960 tokens de Qwen3-8B et est conçu pour continuer à fonctionner à mesure que le contexte effectif s'accroît.
• Paramètres — 4,54 B BF16 pour Intern-Decision-4B, répartis entre une tour de texte, une tour de vision et un projecteur ; 8,19 B BF16 pour ContextPilot-8B, un simple modèle de langage causal dense Qwen3.
• Latence — Intern-Decision-4B affiche une moyenne de 44,16 ms et 44,60 ms au P95 sur une seule RTX 4090, d’après sa propre fiche ; ContextPilot-8B ne publie aucun chiffre de latence, et son coût est fondamentalement différent, car il génère des tokens plutôt que de les évaluer.
• Images — Intern-Decision-4B en accepte jusqu’à huit, et les tokens d’image sont décomptés du plafond de 8 192 ; la fiche de ContextPilot-8B décrit un checkpoint de génération de texte sans voie multimodale.
• Licence — Intern-Decision-4B est sous Apache-2.0, avec la licence Qwen en amont conservée à côté ; la licence de ContextPilot-8B s'ouvre par la Section 0 : « mise à disposition uniquement à des fins de recherche et développement scientifiques. Vous ne devez pas l'utiliser à d'autres fins. »
• Preuves publiées — un tableau à sept ensembles comportant des diagnostics de calibration d'un côté ; un résumé d'article et un lien vers un dépôt d'évaluation de l'autre.
• Bilan — les deux discrets. Intern-Decision-4B affiche un like et zéro téléchargement depuis le 26 septembre 2026 ; ContextPilot-8B a 11 likes et environ un millier de téléchargements depuis le 27 août 2026, ce qui représente plus d'attention mais toujours aucune évaluation tierce.

Où chacun casse réellement
Le mode de défaillance d’Intern-Decision-4B est structurel, et il vaut la peine d’être concret à ce sujet. Si les preuves à l’appui d’une décision ne tiennent pas dans 8 192 tokens, le modèle ne se dégrade pas gracieusement — il rejette la requête. C’est un choix d’ingénierie défendable et une très mauvaise adéquation avec exactement la charge de travail pour laquelle ContextPilot-8B a été conçu. La configuration de la fiche elle-même accentue la tension : la tour de texte sous le wrapper déclare une limite de position de 262 144 tokens. Le backbone peut adresser un quart de million de tokens et le wrapper publié n’acceptera pas plus de huit mille.
Le mode de défaillance de ContextPilot-8B est qu'il n'est pas un remplacement direct de quoi que ce soit. C'est un checkpoint au sein d'un framework, et c'est dans le framework que réside le comportement. Récupérez les poids sans les définitions d'outils ni le runtime de l'agent, et vous obtenez un modèle affiné de Qwen3-8B dont la capacité distinctive est inerte. Ajoutez à cela la section 0 de la licence, et la réponse pratique pour un déploiement commercial est que vous ne pouvez pas l'utiliser du tout tel que livré — ce qui signifie aussi que ce n'est pas une voie candidate pour nous, ni maintenant ni bientôt.
Déployer chacun, si vous comptiez le faire
Intern-Decision-4B veut un petit GPU et aucune pile de serving digne de ce nom : installer PyTorch 2.9.1 et Transformers 5.14.1 sous Python 3.12, charger les quatre shards une fois, garder le moteur résident, et calculer les scores. Comme la passe avant est de forme fixe, P50 et P95 se situent à moins de six dixièmes de milliseconde l'un de l'autre, donc la planification de capacité porte sur la concurrence plutôt que sur la latence de queue. La partie délicate, c'est qu'il est livré sous forme de classe Python importable plutôt que de service HTTP, donc le mettre devant un appelant de production implique de l'encapsuler vous-même.
ContextPilot-8B exige le traitement inverse : un véritable chemin de service, un exécuteur d’outils, des stockages de mémoire et un environnement de déploiement capable de gérer des branches si vous envisagez un jour de le réentraîner ou de l’évaluer tel qu’il a été conçu. Ce n’est pas un modèle que l’on teste en un après-midi ; c’est un cadre de recherche que l’on adopte.
Un routeur est-il utile ici ?
En partie, et la version honnête est plus étroite que d'ordinaire. OrcaRouter ne répertorie ni Intern-Decision-4B, ni ContextPilot-8B, ni aucun checkpoint comparable de scoring de décision dans son catalogue — nos pages de modèles renvoient une erreur 404 pour les deux, et rien dans cet article ne doit être interprété comme une affirmation de disponibilité. Ce qu'un point de terminaison unifié vous apporte réellement, c'est la possibilité de placer une expérience ratée derrière une solution de repli : une seule clé pour plus de 200 modèles, le prix catalogue du fournisseur répercuté avec 0 % de marge, et un basculement automatique afin qu'un évaluateur que vous êtes encore en train de tester ne devienne jamais un point de défaillance unique. C'est un avantage réel pour le volet Intern-Decision de cette comparaison, où le modèle s'exécute réellement à moindre coût et en local. Pour ContextPilot-8B, la question ne se pose même pas, car une licence limitée à la recherche et au développement exclut toute voie commerciale, quel que soit ce que prend en charge un routeur.
Lequel, alors
Si votre question a un ensemble fermé de réponses, arrive avec les preuves jointes, et nécessite une probabilité plutôt qu'une explication, Intern-Decision-4B est l'objet le plus intéressant — bon marché, de forme fixe, calibré par construction, et honnête sur l'entrée qu'il n'acceptera pas. Si votre problème est que les preuves ne cessent d'arriver, aucun évaluateur de décision ne vous aidera et ContextPilot-8B vise la bonne cible, avec la réserve que vous adoptez un cadre et une licence de recherche plutôt qu'un modèle.
Ce qui trancherait la question, c'est un test qu'aucun des deux fournisseurs n'a exécuté : soumettre aux deux la même décision courte et structurée, dont la réponse est calculable à partir de l'état, et voir si la moyenne de 90,02 du scorer tient en dehors de son propre harnais. Tant que personne ne le fait, la bonne lecture de cette confrontation est que les deux modèles ne sont pas du tout en concurrence pour le même créneau.

