
ContextPilot-14B est l'agent open-weight discret de Tencent qui gère son propre contexte
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
tencent/ContextPilot-14B est un ajustement fin open-weights de 15 milliards de paramètres de Qwen3-14B, apparu sur Hugging Face le 27 août 2026 sans aucune annonce. Les poids ont été mis en ligne ; l'article, « ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL » (arXiv 2608.28476, accepté à EMNLP 2026), est arrivé le lendemain ; le code d'entraînement et d'évaluation a suivi sur GitHub. C'est tout le lancement. Il s'agit du fleuron d'une famille de trois checkpoints — ContextPilot-14B, ContextPilot-8B et ContextPilot-E4B — conçue pour faire ce que la plupart des modèles open-weights ne tentent pas : décider, tour après tour, de ce que le modèle doit conserver, mémoriser et expulser de son propre contexte de travail pendant qu'il raisonne et appelle des outils.
{{1}}Une mise en garde avant toute chose : une recherche de « ContextPilot » affiche en tête des résultats un projet différent et sans rapport — un système d'optimisation d'inférence à long contexte de l'Université d'Édimbourg, également nommé ContextPilot, qui réutilise le contexte mis en cache entre les appels pour réduire le coût de préremplissage. Même nom, mais une chose entièrement différente.{{/1}} {{2}}Cet article porte sur le framework d'entraînement d'agents de Tencent ; confondre les deux vous mènerait vers le mauvais dépôt, le mauvais article et le mauvais ensemble d'affirmations.{{/2}}
Ce qui a été livré, et ce que l'on sait à l'heure actuelle.
La publication comprend trois dépôts Hugging Face sous l'organisation tencent, tous créés à un jour d'intervalle. Le produit phare, tencent/ContextPilot-14B, est un checkpoint BF16 d'environ 15 milliards de paramètres construit à partir de Qwen/Qwen3-14B ; tencent/ContextPilot-8B est la version Qwen3-8B ; tencent/ContextPilot-E4B est le membre compact, construit sur la base de Gemma4-E4B-it. La fiche modèle du 14B est explicite quant à la division du travail : charger le checkpoint seul ne fait rien — « les définitions d'outils, l'environnement d'exécution de l'agent et le pipeline d'évaluation sont fournis dans le dépôt ContextPilot » — les poids ne deviennent donc un agent que lorsqu'on les exécute avec le code.

La page du dépôt ci-dessus constitue actuellement toute la surface publique de la version : une fiche de modèle, un fichier de licence et un lien vers l'article et le code. Il n'y a ni article de blog de lancement, ni communiqué de presse, ni page de tarification sur le site du fournisseur au moment de la rédaction.
C'est dans ce dépôt GitHub, Tencent/ContextPilot, que réside la substance. Il contient un répertoire train avec l'implémentation d'apprentissage par renforcement construite sur verl — avec des recettes pour les checkpoints Qwen3-8B et Qwen3-14B — et un répertoire infer avec des scripts d'évaluation et des chargeurs de données pour quatre benchmarks de long contexte : InfBench, NovelQA, LongMemEval et BrowseComp+. On y trouve aussi une URL de démo en direct sur la fiche du modèle. Au moment où j'écris ces lignes, le dépôt a deux jours, une poignée d'étoiles et zéro fork : tout ce qui le concerne doit donc être lu comme fraîchement créé plutôt que rodé.
Ce que ContextPilot enseigne à un agent à faire
L'énoncé du problème de l'article est le mode de défaillance central des agents à long horizon : sur de nombreux tours de récupération, d'appels d'outils et de raisonnement, le contexte de travail d'un agent croît sans limite, le coût de préremplissage augmente, et le modèle se noie dans son propre historique. Les tentatives précédentes donnaient aux modèles quelques outils d'édition — recherche, suppression, résumé — qui, selon l'article, sont trop faibles : pas de plan global, pas de mémoire qui survit au tour, aucun moyen de compresser plutôt que de détruire.
La réponse de ContextPilot est une boîte à outils comportant trois ajouts : un outil de planification qui décide quoi conserver avant que l’agent n’agisse ; une mémoire à long terme qui persiste les informations au-delà du contexte de travail ; et un mécanisme de déchargement progressif qui sort les contextes les moins utiles de la fenêtre active au lieu de les supprimer, afin de pouvoir les rappeler en cas de besoin. Côté entraînement, l’article apporte deux techniques d’apprentissage par renforcement spécifiques à l’édition de contexte : le déroulement partiel contextuel (context-aware partial rollout), qui ne fait bifurquer une trajectoire qu’aux moments où une édition a réellement modifié l’état, et l’attribution de crédit à granularité fine, qui attribue la récompense à l’action d’édition spécifique qui a compté plutôt que d’étaler la récompense finale sur chaque édition. Ces deux approches tentent de résoudre le même problème sous-jacent : les éditions de contexte ont des impacts hétérogènes, et les traiter uniformément gaspille le signal RL.
L'affirmation principale est « de meilleures performances avec un contexte de travail plus compact ». Les chiffres d'évaluation soutiennent au moins la seconde partie : les modèles ContextPilot s'exécutent dans une fenêtre de contexte de 32K tandis que le backbone Qwen3-14B non ajusté est évalué à 128K, et les checkpoints ContextPilot obtiennent tout de même des scores plus élevés sur la suite long-contexte de l'article.
Le tableau d'affichage, honnêtement étiqueté
Chaque chiffre de cette section est rapporté par le vendeur à partir de l'article (arXiv 2608.28476) et n'a pas été reproduit de manière indépendante — aucun tiers n'a exécuté tencent/ContextPilot-14B via un banc d'essai public, et le code d'évaluation ne date que de quelques jours. L'article rapporte des moyennes sur trois exécutions pour quatre benchmarks : NovelQA, ∞Bench (questions à choix multiples en anglais), LongMemEval-S et BrowseComp+.
• tencent/ContextPilot-14B (après SFT) : 84.28 / 79.04 / 65.93 / 53.13 — moyenne de 70.60.
• tencent/ContextPilot-14B (+ RL) : 84.81 / 81.08 / 67.40 / 55.50 — 72.20 en moyenne. Le passage RL vaut environ 1.6 point en moyenne, et ses plus grands gains se situent sur le benchmark le plus difficile, BrowseComp+ (+2.4).
La comparaison qui donne un sens à ces chiffres : le Qwen3-14B non ajusté, sans outils de contexte, évalué à 128K de contexte, obtient une moyenne de 53,26 — soit près de 19 points de moins que le modèle ajusté par RL qui fonctionne dans un quart du contexte. StateLM-14B-RL, la référence la plus solide en matière de gestion de contexte, obtient une moyenne de 70,11, donc ContextPilot-14B-RL le devance d'environ 2,1 points.
• Deep search est une seconde évaluation, distincte. Sur WebExplorer-8B, l'agent de ContextPilot atteint une moyenne de 50,10 sur BrowseComp, BrowseComp-ZH, GAIA et xBench-DeepSearch, contre 49,09 pour la solide baseline SUPO ; sur WebSailor-7B, il obtient 38,32 contre 36,31 pour SUPO.
• L'affirmation d'efficacité est la plus intéressante et la plus difficile à vérifier : sur BrowseComp, l'entrée de l'agent de référence croît presque linéairement vers environ 30K tokens, tandis que l'agent ContextPilot-8B se stabilise autour de 8K–10K tokens par tour. Un contexte de travail compact est toute la thèse de l'article, et cette figure en est la preuve directe.

La carte ci-dessus présente côte à côte les moyennes rapportées des trois points de contrôle. Traitez chaque chiffre comme une affirmation de l'article, et non comme un résultat audité.
La licence est la partie qui change vos plans.
Voici le fait que la plupart des articles enterreront — et que vous ne devriez pas. Les poids sont « ouverts », mais la licence n'est pas Apache-2.0 : c'est une « License Terms of ContextPilot-14B » personnalisée, qui reproduit le texte Apache et ajoute une section 0 stipulant que le modèle est « mis à disposition uniquement à des fins de recherche et de développement scientifiques » et « ne doit pas » être utilisé à toute autre fin. Il s'agit donc d'une licence réservée à la recherche, en langage clair : vous pouvez affiner le modèle et l'étudier, mais vous ne pouvez pas le déployer dans un produit, l'exploiter commercialement ni l'utiliser comme moteur d'un service payant sans un accord séparé avec Tencent. Le modèle de base, Qwen3-14B, est sous licence Apache-2.0 ; le fine-tuning ContextPilot superpose la restriction. Les modèles frères 8B et E4B portent leurs propres fichiers de licence et doivent être lus selon leurs propres conditions.
La licence réservée à la recherche explique également l'absence de solution hébergée. Aucun fournisseur d'inférence ne propose tencent/ContextPilot-14B en tant qu'API aujourd'hui, et une licence réservée à la recherche est une raison solide pour qu'aucun routeur commercial — OrcaRouter inclus — ne le référence tant que Tencent n'aura pas modifié les conditions. Pour quiconque souhaite l'exécuter maintenant, cela signifie un auto-hébergement pour la recherche : le modèle affiné est servi via vLLM ou SGLang avec un endpoint compatible OpenAI, ce qui correspond exactement à la manière dont le pipeline d'inférence du papier le pilote.
Ce qui est confirmé, et ce qui ne l'est pas
Confirmé depuis les dépôts eux-mêmes : les trois checkpoints existent et se téléchargent ; l'article existe, est daté du 28 août 2026 et porte une acceptation de la piste principale d'EMNLP 2026 ; les recettes d'entraînement sont réelles et spécifiques (verl, Qwen3-8B et Qwen3-14B) ; le pipeline d'évaluation couvre les quatre benchmarks nommés ; et le texte de la licence est limité à la recherche.
Pas encore confirmé : toute annonce ou publication de lancement de Tencent (aucune n'existe à l'heure actuelle) ; tout prix ou API hébergée ; toute exécution de benchmark indépendante ; toute reproduction des chiffres de deep-search ou de long-context par un tiers ; et le nombre exact de paramètres et le budget d'entraînement pour la variante E4B, que l'article décrit comme le membre compact construit sur Gemma4-E4B-it. La suite de benchmarks mérite également une lecture sceptique — BrowseComp+ avec une moyenne de 552K tokens d'entrée est un test de stress très différent de NovelQA (moyenne de 119K), et la moyenne de l'article aplatit une large dispersion.

La page de destination de l'article ci-dessus est la source canonique de toute affirmation du tableau de bord — et l'absence de toute citation tierce est elle-même la colonne « pas encore confirmé ».
Que regarder ensuite
Trois évolutions changeraient la donne, par ordre d'importance. Premièrement, une licence commerciale ou une annonce officielle — c'est la différence entre un artefact de recherche et un modèle déployable, et cela ne dépend entièrement que de Tencent. Deuxièmement, une première évaluation indépendante : la suite long-contexte et les chiffres du deep-search sont tous deux reproductibles à partir du code et des poids publics, donc un test tiers devrait aboutir en quelques semaines si les résultats se confirment. Troisièmement, tout signe que l'approche s'infiltre dans les modèles de production de Tencent — la gamme Hunyuan étant le candidat évident — ce qui vous indiquerait si la gestion proactive du contexte est un créneau de recherche ou une direction que l'industrie s'apprête à copier.
Pour les développeurs, la position honnête à court terme est : regardez-le, évaluez-le, et ne construisez pas encore de produit dessus. Un checkpoint destiné uniquement à la recherche, publié sans annonce ni vérification indépendante, est exactement le genre de chose que l'on veut diriger vers un chemin de test plutôt que vers un chemin de production. Lorsque la licence et la vérification seront toutes deux en place, l'histoire du routage devient triviale — la même clé OrcaRouter qui dessert plus de 200 modèles hébergés au prix catalogue du fournisseur avec 0% de marge ajouterait celui-ci le jour où un fournisseur le référencera, avec un basculement automatique pour qu'un checkpoint d'agent vieux de quelques jours qui se bloque n'entraîne jamais une charge de travail réelle avec lui. En attendant, les poids constituent un artefact de recherche très intéressant avec une recette d'entraînement véritablement novatrice — et un mur juridique autour, que vous devriez lire avant de faire quoi que ce soit avec.
