Une carte de titre générée « Intern-Decision-4B vs ContextPilot-8B », sous-titrée « l'un refuse le contexte long, l'autre le gère », avec trois pastilles indiquant « aucune évaluation indépendante pour l'un ou l'autre », « tous deux publiés sans annonce » et « aucun des deux n'est routable aujourd'hui ». Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Engineering & Research

Intern-Decision-4B vs ContextPilot-8B : un modèle qui réduit le contexte face à un modèle qui le gère

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Choisissez votre poison : internlm/Intern-Decision-4B refuse de lire plus de 8 192 tokens, et tencent/ContextPilot-8B existe spécifiquement pour survivre à des contextes qui croissent sans limite. Ils appartiennent à la même classe de taille, sont tous deux des fine-tunes d’une base Qwe​n, et tous deux ont été publiés sur le Hub sans annonce de fournisseur ni évaluation indépendante d’aucune sorte — ContextPilot-8B le 27 août 2026, Intern-Decision-4B le 26 septembre 2026 — et ils résolvent des problèmes opposés. Intern-Decision-4B est un modèle de décision structuré de 4,5 milliards de paramètres qui effectue une seule passe avant, lit les logits et renvoie une probabilité calibrée pour chaque question que vous avez posée ; il n’écrit jamais le moindre token. ContextPilot-8B est un générateur de texte de 8,19 milliards de paramètres entraîné à planifier, à mémoriser et à décharger son propre contexte de travail pendant une longue exécution d’agent. Les comparer n’est pas vraiment une question de benchmark. C’est une question de savoir quelle moitié de votre problème vous préférez que le modèle avale.

D'abord, la chose qu'ils partagent véritablement

Aucun des deux modèles ne dispose d’un seul chiffre que quelqu’un en dehors de son propre laboratoire ait vérifié. C’est suffisamment inhabituel pour qu’on le précise avant toute autre chose, car la plupart des comparaisons sur ce blog peuvent au moins s’appuyer sur un classement indépendant pour l’un des côtés.

Intern-Decision-4B publie un tableau d’évaluation complet sur sa fiche — une moyenne de 90,02 sur sept ensembles, un score de Brier de 0,347 et une erreur de calibration attendue de 0,065 — le tout mesuré par InternLM sur le harnais d’InternLM. ContextPilot-8B ne publie aucun tableau. Sa fiche indique que le framework « surpassent systématiquement [surpasse] les baselines existantes sur divers modèles de base et benchmarks » et renvoie à un article et à un pipeline d’évaluation pour les détails. Donc, pour cette confrontation, la ligne de sourçage honnête est brève : un côté est rapporté par le fournisseur et non reproduit, l’autre est revendiqué par le fournisseur et non publié, et rien sur cette page n’est indépendant.

A screenshot of the tencent/ContextPilot-8B model card on Hugging Face, showing the paper, live demo, GitHub and models badges, the description of ContextPilot as a proactive context-management framework built on Qwen3-8B, the three listed components, and the loading snippet alongside the note that loading the checkpoint alone does not execute the context-management tools and that the tool definitions and agent runtime are provided separately.

Les deux paris, énoncés simplement

Le pari d'Intern-Decision-4B, c'est que la partie difficile d'une décision n'est pas le raisonnement, mais l'engagement. Donnez-lui un état, un schéma de questions nommées et jusqu'à huit images, et il renvoie une distribution sur vos propres chaînes d'options. La procédure d'inférence est déterministe et de forme figée : faire correspondre les options à des symboles d'un seul token, produire un squelette JSON d'assistant avec un espace réservé par champ, exécuter une seule passe avant causale, lire les logits juste avant chaque espace réservé, appliquer un softmax uniquement sur les candidats de ce champ, appliquer la température ajustée. Il n'y a pas de boucle de décodage, donc pas de parseur ni de surface d'hallucination en texte libre. Le prix de ce pari est un plafond d'entrée strict — la fiche indique que les entrées au-dessus de DecisionEngine(max_length=8192) sont « rejetées sans troncature ».

Le pari de ContextPilot-8B est l’image miroir : garder l’agent en train d’écrire des tokens, mais lui apprendre à modifier ce qu’il transporte. Il ajoute la planification, une mémoire à long terme structurée, la récupération et le déport souple du contexte à la boîte à outils de l’agent, puis entraîne le checkpoint avec une recette RL qui échantillonne des branches autour des décisions de modification du contexte qui comptent et attribue le crédit au niveau de l’action plutôt qu’au niveau de la trajectoire. La fiche est franche sur la conséquence en matière d’empaquetage : charger le checkpoint ne vous donne pas la gestion du contexte. Les définitions d’outils, l’environnement d’exécution de l’agent et le pipeline d’évaluation se trouvent ailleurs et doivent être apportés avec.

Tableau des scores, dimension par dimension

• Sortie — Intern-Decision-4B n'émet aucun texte du tout, seulement des probabilités sur les valeurs de vos options ; ContextPilot-8B génère normalement et ses réponses sont de la prose et des appels d'outils que vous devez analyser.

• Plafond d'entrée — Intern-Decision-4B refuse tout ce qui dépasse 8 192 tokens ; ContextPilot-8B hérite de la limite de position de 40 960 tokens de Qwen3-8B et est conçu pour continuer à fonctionner à mesure que le contexte effectif s'accroît.

• Paramètres — 4,54 B BF16 pour Intern-Decision-4B, répartis entre une tour de texte, une tour de vision et un projecteur ; 8,19 B BF16 pour ContextPilot-8B, un simple modèle de langage causal dense Qwen3.

• Latence — Intern-Decision-4B affiche une moyenne de 44,16 ms et 44,60 ms au P95 sur une seule RTX 4090, d’après sa propre fiche ; ContextPilot-8B ne publie aucun chiffre de latence, et son coût est fondamentalement différent, car il génère des tokens plutôt que de les évaluer.

• Images — Intern-Decision-4B en accepte jusqu’à huit, et les tokens d’image sont décomptés du plafond de 8 192 ; la fiche de ContextPilot-8B décrit un checkpoint de génération de texte sans voie multimodale.

• Licence — Intern-Decision-4B est sous Apache-2.0, avec la licence Qwen en amont conservée à côté ; la licence de ContextPilot-8B s'ouvre par la Section 0 : « mise à disposition uniquement à des fins de recherche et développement scientifiques. Vous ne devez pas l'utiliser à d'autres fins. »

• Preuves publiées — un tableau à sept ensembles comportant des diagnostics de calibration d'un côté ; un résumé d'article et un lien vers un dépôt d'évaluation de l'autre.

• Bilan — les deux discrets. Intern-Decision-4B affiche un like et zéro téléchargement depuis le 26 septembre 2026 ; ContextPilot-8B a 11 likes et environ un millier de téléchargements depuis le 27 août 2026, ce qui représente plus d'attention mais toujours aucune évaluation tierce.

A two-column comparison scoreboard titled 'Intern-Decision-4B vs ContextPilot-8B'. The left column reads: Output: no text, probabilities only; Input ceiling: 8,192 tokens, rejected not truncated; Parameters: 4.54B BF16; Latency: 44.16 ms mean on one RTX 4090; Images: up to eight; License: Apache-2.0. The right column reads: Output: generated text and tool calls; Input ceiling: 40,960-token position limit; Parameters: 8.19B BF16; Latency: not published; Images: none; License: research and development only. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.

Où chacun casse réellement

Le mode de défaillance d’Intern-Decision-4B est structurel, et il vaut la peine d’être concret à ce sujet. Si les preuves à l’appui d’une décision ne tiennent pas dans 8 192 tokens, le modèle ne se dégrade pas gracieusement — il rejette la requête. C’est un choix d’ingénierie défendable et une très mauvaise adéquation avec exactement la charge de travail pour laquelle ContextPilot-8B a été conçu. La configuration de la fiche elle-même accentue la tension : la tour de texte sous le wrapper déclare une limite de position de 262 144 tokens. Le backbone peut adresser un quart de million de tokens et le wrapper publié n’acceptera pas plus de huit mille.

Le mode de défaillance de ContextPilot-8B est qu'il n'est pas un remplacement direct de quoi que ce soit. C'est un checkpoint au sein d'un framework, et c'est dans le framework que réside le comportement. Récupérez les poids sans les définitions d'outils ni le runtime de l'agent, et vous obtenez un modèle affiné de Qwen3-8B dont la capacité distinctive est inerte. Ajoutez à cela la section 0 de la licence, et la réponse pratique pour un déploiement commercial est que vous ne pouvez pas l'utiliser du tout tel que livré — ce qui signifie aussi que ce n'est pas une voie candidate pour nous, ni maintenant ni bientôt.

Déployer chacun, si vous comptiez le faire

Intern-Decision-4B veut un petit GPU et aucune pile de serving digne de ce nom : installer PyTorch 2.9.1 et Transformers 5.14.1 sous Python 3.12, charger les quatre shards une fois, garder le moteur résident, et calculer les scores. Comme la passe avant est de forme fixe, P50 et P95 se situent à moins de six dixièmes de milliseconde l'un de l'autre, donc la planification de capacité porte sur la concurrence plutôt que sur la latence de queue. La partie délicate, c'est qu'il est livré sous forme de classe Python importable plutôt que de service HTTP, donc le mettre devant un appelant de production implique de l'encapsuler vous-même.

ContextPilot-8B exige le traitement inverse : un véritable chemin de service, un exécuteur d’outils, des stockages de mémoire et un environnement de déploiement capable de gérer des branches si vous envisagez un jour de le réentraîner ou de l’évaluer tel qu’il a été conçu. Ce n’est pas un modèle que l’on teste en un après-midi ; c’est un cadre de recherche que l’on adopte.

Un routeur est-il utile ici ?

En partie, et la version honnête est plus étroite que d'ordinaire. OrcaRouter ne répertorie ni Intern-Decision-4B, ni ContextPilot-8B, ni aucun checkpoint comparable de scoring de décision dans son catalogue — nos pages de modèles renvoient une erreur 404 pour les deux, et rien dans cet article ne doit être interprété comme une affirmation de disponibilité. Ce qu'un point de terminaison unifié vous apporte réellement, c'est la possibilité de placer une expérience ratée derrière une solution de repli : une seule clé pour plus de 200 modèles, le prix catalogue du fournisseur répercuté avec 0 % de marge, et un basculement automatique afin qu'un évaluateur que vous êtes encore en train de tester ne devienne jamais un point de défaillance unique. C'est un avantage réel pour le volet Intern-Decision de cette comparaison, où le modèle s'exécute réellement à moindre coût et en local. Pour ContextPilot-8B, la question ne se pose même pas, car une licence limitée à la recherche et au développement exclut toute voie commerciale, quel que soit ce que prend en charge un routeur.

Lequel, alors

Si votre question a un ensemble fermé de réponses, arrive avec les preuves jointes, et nécessite une probabilité plutôt qu'une explication, Intern-Decision-4B est l'objet le plus intéressant — bon marché, de forme fixe, calibré par construction, et honnête sur l'entrée qu'il n'acceptera pas. Si votre problème est que les preuves ne cessent d'arriver, aucun évaluateur de décision ne vous aidera et ContextPilot-8B vise la bonne cible, avec la réserve que vous adoptez un cadre et une licence de recherche plutôt qu'un modèle.

Ce qui trancherait la question, c'est un test qu'aucun des deux fournisseurs n'a exécuté : soumettre aux deux la même décision courte et structurée, dont la réponse est calculable à partir de l'état, et voir si la moyenne de 90,02 du scorer tient en dehors de son propre harnais. Tant que personne ne le fait, la bonne lecture de cette confrontation est que les deux modèles ne sont pas du tout en concurrence pour le même créneau.

A generated two-bet card titled 'Same size class, opposite bets'. The left card, 'Intern-Decision-4B — shrink the answer', lists: input ceiling 8,192 tokens, rejected not truncated; output probabilities over your option values; one forward pass, 44.16 ms mean on one RTX 4090; no text, so nothing to parse. The right card, 'ContextPilot-8B — manage the growing context', lists: inherits Qwen3-8B's 40,960-token position limit; generates text and tool calls; context planned, remembered and offloaded during the run; needs the tool definitions and agent runtime to work at all. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.