
AstaBrief 8B vs ContextPilot 8B : deux réponses au même modèle de base 8B
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 220 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 113 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Mettez AstaBrief 8B et ContextPilot 8B sur une même fiche technique et les six premières lignes sont identiques. Tous deux sont des checkpoints denses de 8B affinés à partir de Qwen/Qwen3-8B. Tous deux héritent de la même architecture — 36 couches, une taille cachée de 4096, 32 têtes d'attention avec 8 têtes clé-valeur, un vocabulaire de 151 936 tokens, et le plafond de position de 40 960 tokens du modèle de base. Ni l'un ni l'autre n'est une nouvelle architecture, et ni l'un ni l'autre ne cherche à l'être. Ce sont deux laboratoires qui prennent les mêmes poids de base figés et leur enseignent deux tâches différentes, et ces tâches se situent aux extrémités opposées d'un agent de recherche à long terme : AstaBrief 8B rédige le rapport final cité, et ContextPilot 8B empêche le contexte de travail de l'agent de s'effondrer pendant qu'il rassemble la documentation.
C’est toute la comparaison en une ligne, et c’est aussi pourquoi ce n’est pas un duel qu’il faut lire comme un match où le gagnant rafle tout. En matière de licences, de preuves et d’exigences d’exécution, les deux modèles divergent complètement, et cette divergence est plus instructive que n’importe quel score publié par l’un ou l’autre laboratoire.
La même géométrie de checkpoint, deux héritages différents
Partons de ce qui est réellement partagé, car c’est ce qui délimite tout le reste. AstaBrief 8B d’Ai2 et ContextPilot 8B de Tencent déclarent tous deux Qwen3-8B comme base, et tous deux arrondissent à environ 8 milliards de paramètres. Le dépôt de ContextPilot 8B enregistre 16,38 GB de poids BF16 répartis sur quatre shards safetensors, ce qui correspond au poids d’un modèle dense de 8B. Le plafond de contexte est celui de la base, inchangé dans les deux cas : 40 960 positions dans la configuration, entraîné à 32K et extensible avec YaRN. Aucun des deux modèles n’est un modèle à long contexte. AstaBrief 8B n’a pas besoin de l’être, car on lui fournit des extraits plutôt qu’un corpus. ContextPilot 8B ne l’est délibérément pas, car sa thèse consiste à faire travailler plus dur une petite fenêtre.
Ce que chaque laboratoire a modifié, c’est l’objectif d’entraînement, et ces objectifs ne pourraient guère être plus différents.
• Méthode de post-entraînement — AstaBrief 8B : fine-tuning supervisé puis optimisation directe des préférences hors ligne, 47K exemples SFT et environ 6K paires de préférences, sur huit H100.
• Méthode de post-entraînement — ContextPilot 8B : apprentissage par renforcement sur un cadre de gestion proactive du contexte, avec une fusion de vecteurs de tâche de plusieurs exécutions SFT spécialisées superposées au modèle de base.
• La tâche — AstaBrief 8B : rédiger un rapport à plusieurs sections avec des citations intégrées à partir d’une question et d’extraits de littérature récupérés, en une seule passe.
• Le travail — ContextPilot 8B : planifier, conserver une mémoire à long terme, récupérer depuis un index et décharger le contexte dont l’agent n’a pas besoin actuellement, tout en continuant à raisonner et à appeler des outils.
• Runtime — AstaBrief 8B : service standard vLLM ou Transformers, ainsi que le format de prompt recommandé du jeu de données AstaBrief_prompts.
• Runtime — ContextPilot 8B : le runtime d’agent Tencent, les définitions d’outils et le pipeline d’évaluation du dépôt Tencent/ContextPilot. Le checkpoint seul ne constitue pas un agent fonctionnel.
• Licence — AstaBrief 8B : Apache-2.0. ContextPilot 8B : texte Apache-2.0 personnalisé avec une Section 0 ajoutée restreignant l’utilisation à la recherche et au développement.
• Preuves — AstaBrief 8B : tableaux de benchmark rapportés par le fournisseur, ainsi que les premiers chiffres d'utilisation en production de la plateforme Asta d'Ai2. ContextPilot 8B : des affirmations dans un article arXiv accepté au track principal d'EMNLP 2026 ; la fiche du modèle n'affiche aucun chiffre et aucun tiers ne les a reproduites.
Deux lignes de cette liste font plus de travail que les autres. La ligne relative à la licence détermine si vous pouvez intégrer le modèle dans un produit tout court : les termes Apache-2.0 d'AstaBrief 8B autorisent l'usage commercial, et la clause ajoutée de ContextPilot 8B ne l'autorise pas. La ligne relative au runtime détermine quelle part du laboratoire vous devez adopter en même temps que les poids. AstaBrief 8B est un checkpoint que vous pouvez intégrer tel quel dans une pile de service existante. ContextPilot 8B est un composant d'un framework, et les éléments qui font fonctionner ce framework — le contrat d'outillage, la logique de déploiement progressif, l'attribution des crédits — résident dans le code de Tencent, et non dans les shards que vous téléchargez.

Là où chacun mérite véritablement sa place
La manière utile de les comparer consiste à les considérer comme des sous-agents adjacents dans un pipeline vers lequel les deux laboratoires convergent depuis des directions opposées.
Un agent de synthèse de littérature comporte une couche de récupération, une couche de contexte et une couche de génération. ContextPilot 8B s’attaque à la couche de contexte : il dote l’agent de planification, d’une mémoire structurée à long terme avec des notes d’écriture/mise à jour/lecture, de récupération sur un index et d’un délestage souple du contexte, afin qu’une fenêtre modeste reste exploitable tout au long d’une longue trajectoire. L’argument de l’article est que les modèles antérieurs d’édition du contexte partageaient trois faiblesses, et que le cadre les traite ensemble — un ensemble d’outils plus large, un rollout partiel sensible au contexte qui concentre l’exploration sur les modifications qui changent réellement la trajectoire, et une attribution fine du crédit. Les cibles d’évaluation sont le QA à long contexte et la recherche approfondie : InfBench, NovelQA, LongMemEval, BrowseComp+, d’après notre lecture antérieure du dépôt.
AstaBrief 8B s'attaque à la couche de génération, et il part du principe que le problème du contexte a déjà été résolu en amont. Il ne récupère rien, ne résume pas d'extraits, ne regroupe pas les thèmes et ne décide pas quelles preuves conserver. Ai2 a retiré tout cela des tâches du modèle et l'a entraîné à rédiger le rapport en une seule passe à partir d'extraits choisis par quelqu'un d'autre. Le pari est que l'échafaudage coûteux n'était pas là où résidait la qualité : Ai2 rapporte que la réécriture en une seule passe égalait le pipeline multi-étapes propulsé par Claude sur ses métriques suivies, tout en réduisant le temps de génération du pipeline complet de 178,5 secondes à 51,1 secondes.
Pris ensemble, les deux modèles décrivent une division du travail que l’un ou l’autre laboratoire aurait pu concevoir. L’un maintient l’ensemble de travail réduit et les preuves en circulation. L’autre transforme les preuves restantes en prose, citations à l’appui. Les modes de défaillance se complètent plutôt qu’ils ne se chevauchent : un gestionnaire de contexte qui écarte le mauvais extrait empoisonne un bon rédacteur, et un bon rédacteur à qui l’on remet de mauvais extraits produit un rapport fluide sur la mauvaise chose.
Cette complémentarité plaide pour que chacun soit traité comme un composant interchangeable plutôt que comme un engagement. Si vous construisez la moitié « contexte » avec ContextPilot 8B, la moitié « génération de rapport » doit se trouver derrière une interface qui ne se soucie pas du modèle qui se trouve derrière elle — AstaBrief 8B auto-hébergé d’un côté, un modèle de pointe hébergé de l’autre, et la possibilité de passer de l’un à l’autre sans réécrire le pipeline. Faire passer les deux volets par un même point de terminaison, c’est ce qui transforme cela en un changement de configuration plutôt qu’en une migration : une API unique pour plus de 200 modèles, avec le prix catalogue du fournisseur répercuté à 0 % de marge, basculement automatique en cas de dégradation d’un fournisseur, et un DSL de routage lorsque vous voulez composer plusieurs modèles en un seul appel. Le rédacteur auto-hébergé reste auto-hébergé parce que c’est la pièce qui porte l’enjeu de sensibilité des données ; tout ce qui l’entoure reste routable parce que c’est là que la flexibilité coûte peu.

L'état honnête des preuves
Aucun des deux modèles ne dispose d’un tableau de bord indépendant, et les deux laboratoires ne mesurent même pas la même chose.
• AstaBrief 8B, moyenne SQABench-CS2 (rapportée par le fournisseur) : 87,0 sur l’ensemble de test, contre 83,7 pour son propre point de contrôle SFT et 77,3 pour le Qwen3-8B de base.
• AstaBrief 8B, DeepScholarBench (rapporté par le fournisseur) : 53,50, derrière l'Asta ScholarQA d'Ai2 lui-même à 60,25 et DR-Tulu-8B à 56,26.
• AstaBrief 8B, taux de victoire en comparaison par paires face au pipeline d’Ai2 propulsé par Claude (rapporté par le fournisseur) : 55 % sur le dev de SQABench-CS2, 72 % sur le test.
• ContextPilot 8B : les chiffres ne figurent que dans l'article, sur les benchmarks de questions-réponses à long contexte et de recherche approfondie ; aucun chiffre dans la fiche de modèle et aucune reproduction par des tiers.
Une réserve s'applique à l'ensemble de la chronique AstaBrief, et Ai2 le précise dans le blog lui-même : l'essentiel de l'entraînement et de l'évaluation a été réalisé en 2025, de sorte que les modèles de comparaison reflètent l'état de la frontière à cette époque, et le laboratoire n'a pas relancé l'évaluation face aux modèles de frontière actuels. Il faut lire ces pourcentages comme des éléments de preuve concernant un choix de conception à un moment donné, et non comme un classement actuel. Les chiffres de ContextPilot 8B comportent la réserve habituelle des articles scientifiques : suite de benchmarks auto-sélectionnée, harnais d'évaluation exécuté en interne, aucune reproduction en dehors de Tencent.
Une deuxième mise en garde est propre à AstaBrief 8B et facile de s’y faire prendre en pratique. Sa fiche avertit que le checkpoint a été affiné sur un seul format de prompt, publié sous forme de fichier de jeu de données, et que d’autres formats peuvent dégrader le comportement. Si vous l’évaluez avec un harnais de chat générique, vous mesurez autant votre harnais que le modèle.
Lequel veux-tu ?
Choisissez AstaBrief 8B lorsque le livrable est le document. Il est sous Apache-2.0, il tourne sur un seul GPU dans la classe 8B BF16, il n’a besoin d’aucun framework d’agent autour de lui, et il est entraîné spécifiquement pour une seule sortie : un rapport cité assemblé à partir de preuves récupérées par quelqu’un d’autre. La licence commerciale est le facteur décisif pour la plupart des équipes, et la posture de référentiel ouvert d’Ai2 elle-même — les poids, le mélange SFT, le mélange DPO et le format de prompt tous publiés — est ce qui le rend auditable plutôt que simplement gratuit.
Choisissez ContextPilot 8B lorsque le livrable est une trajectoire fonctionnelle et que votre problème est que l'agent oublie ou se noie. La licence à usage de recherche uniquement l'exclut de toute considération pour la production dans la plupart des entreprises, et l'exigence d'environnement d'exécution signifie que vous adoptez le framework de Tencent, pas seulement un modèle. Si vous étudiez la gestion proactive du contexte en tant que technique, c'est un point de départ bien documenté. Si vous devez livrer, ce n'est pas le bon choix.
Et si vous avez besoin des deux capacités, la réponse n’est ni l’un ni l’autre modèle pris seul — c’est la paire, câblée de façon à ce que chacun puisse être remplacé. La seule chose que cette comparaison ne doit pas produire, c’est un vainqueur unique, car les deux points de contrôle ne sont pas en concurrence pour le même emplacement dans le système.
