
AstaBrief 8B vs ContextPilot 8B: Twee antwoorden op hetzelfde 8B-basismodel
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 220 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 113 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Zet AstaBrief 8B en ContextPilot 8B op één specificatieblad en de eerste zes rijen zijn identiek. Beide zijn dense 8B-checkpoints die zijn fijngetuned vanaf Qwen/Qwen3-8B. Beide erven dezelfde architectuur — 36 lagen, hidden size 4096, 32 attention-heads met 8 key-value-heads, een vocabulaire van 151.936 tokens en het positieplafond van 40.960 tokens van het basismodel. Geen van beide is een nieuwe architectuur, en geen van beide probeert dat te zijn. Het zijn twee labs die dezelfde bevroren basisgewichten nemen en ze twee verschillende taken leren, en die taken wijzen naar tegenovergestelde uiteinden van een langetermijnonderzoeksagent: AstaBrief 8B schrijft het voltooide rapport met bronvermelding, en ContextPilot 8B voorkomt dat de werkcontext van de agent instort terwijl die het materiaal verzamelt.
Dat is de hele vergelijking in één zin, en dat is ook waarom dit geen rechtstreekse confrontatie is die je als een winnaar-neemt-alles-uitkomst moet lezen. Wat betreft licenties, bewijs en runtime-eisen lopen de twee modellen volledig uiteen, en die divergentie is informatiever dan welke score dan ook die een van beide labs heeft gepubliceerd.
Dezelfde checkpoint-geometrie, twee verschillende overervingen
Begin bij wat echt gedeeld is, want dat begrenst al het andere. Ai2's AstaBrief 8B en Tencent's ContextPilot 8B geven beide Qwen3-8B op als hun basis, en beide komen uit op ruwweg 8 miljard parameters. De repository van ContextPilot 8B vermeldt 16,38 GB aan BF16-gewichten verdeeld over vier safetensors-shards, wat is wat een 8B dense model weegt. Het contextplafond is dat van de basis, in beide ongewijzigd: 40.960 posities in de configuratie, getraind op 32K en uitbreidbaar met YaRN. Geen van beide modellen is een long-contextmodel. AstaBrief 8B hoeft dat niet te zijn, omdat het fragmenten krijgt aangereikt in plaats van een corpus. ContextPilot 8B is dat bewust niet, omdat zijn these is om een klein venster harder te laten werken.
Wat elk lab veranderde, is de trainingsdoelstelling, en de doelstellingen konden nauwelijks meer van elkaar verschillen.
• Post-trainingsmethode — AstaBrief 8B: gesuperviseerde fine-tuning, gevolgd door offline directe voorkeursoptimalisatie, 47K SFT-voorbeelden en ongeveer 6K voorkeursparen, op acht H100's.
• Post-trainingsmethode — ContextPilot 8B: reinforcement learning op een proactief framework voor contextbeheer, met een task-vectorfusie van drie gespecialiseerde SFT-runs bovenop de standaardbasis.
• De taak — AstaBrief 8B: schrijf in één keer een rapport met meerdere secties en inline-citaties op basis van een vraag plus opgehaalde literatuurfragmenten.
• De taak — ContextPilot 8B: plannen, langetermijngeheugen bijhouden, uit een index ophalen en context afstoten die de agent op dat moment niet nodig heeft, terwijl hij blijft redeneren en tools aanroept.
• Runtime — AstaBrief 8B: standaard vLLM- of Transformers-serving, plus het aanbevolen promptformaat uit de AstaBrief_prompts-dataset.
• Runtime — ContextPilot 8B: de Tencent-agentruntime, tooldefinities en evaluatiepijplijn uit de Tencent/ContextPilot-repository. Alleen de checkpoint is geen werkende agent.
• Licentie — AstaBrief 8B: Apache-2.0. ContextPilot 8B: aangepaste Apache-2.0-tekst met een toegevoegde Sectie 0 die het gebruik beperkt tot onderzoek en ontwikkeling.
• Bewijs — AstaBrief 8B: door de leverancier gerapporteerde benchmarktabellen plus vroege gebruikscijfers uit productie van het Asta-platform van Ai2. ContextPilot 8B: beweringen in een arXiv-paper dat is geaccepteerd voor de hoofdtrack van EMNLP 2026; de modelkaart bevat geen cijfers en geen enkele derde partij heeft ze gereproduceerd.
Twee rijen in die lijst doen meer werk dan de rest. De licentierij bepaalt of je het model überhaupt in een product kunt opnemen: de Apache-2.0-voorwaarden van AstaBrief 8B staan commercieel gebruik toe, en de toegevoegde clausule van ContextPilot 8B niet. De runtime-rij bepaalt hoeveel van het lab je samen met de gewichten moet overnemen. AstaBrief 8B is een checkpoint dat je in een bestaande serving-stack kunt droppen. ContextPilot 8B is een component van een framework, en de onderdelen die het framework laten werken — het toolcontract, de rollout-logica, de credit assignment — zitten in Tencent's code, niet in de shards die je downloadt.

Waar elk ervan daadwerkelijk zijn plek verdient
De nuttige manier om ze te vergelijken is als aangrenzende sub-agenten in een pijplijn waar beide labs vanuit tegengestelde richtingen naartoe convergeren.
Een agent voor literatuursynthese heeft een retrieval-laag, een contextlaag en een generatielaag. ContextPilot 8B pakt de contextlaag aan: het geeft de agent planning, een gestructureerd langetermijngeheugen met schrijf-, update- en leesnotities, retrieval over een index en soft context-offloading, zodat een bescheiden contextvenster werkbaar blijft gedurende een lang traject. De these van het artikel is dat eerdere contextbewerkingsmodellen drie zwakheden deelden, en het raamwerk pakt ze gezamenlijk aan — een bredere toolset, contextbewuste gedeeltelijke rollout die exploratie concentreert op de bewerkingen die het traject daadwerkelijk veranderen, en fijnmazige credit assignment. De evaluatiedoelen zijn long-context-QA en deep search: InfBench, NovelQA, LongMemEval, BrowseComp+, zoals we eerder in de repository lazen.
AstaBrief 8B valt de generatielaag aan en gaat ervan uit dat het contextprobleem al eerder in de keten is opgelost. Het haalt niets op, vat geen fragmenten samen, clustert geen thema's en bepaalt niet welk bewijs behouden moet blijven. Ai2 haalde dat allemaal uit de taak van het model en trainde het om het rapport in één doorgang te schrijven op basis van fragmenten die iemand anders had uitgekozen. De gok is dat de dure scaffolding niet de bron van de kwaliteit was: Ai2 meldt dat de herschrijving in één doorgang de meerstaps, door Claude aangedreven pipeline evenaarde op de door Ai2 bijgehouden metrieken, terwijl de generatietijd van de volledige pipeline werd teruggebracht van 178,5 seconden naar 51,1 seconden.
Samengenomen beschrijven de twee modellen een arbeidsverdeling die elk lab had kunnen bedenken. Het ene houdt de werkset klein en het bewijs stromend. Het andere zet het overgebleven bewijs om in proza met bijgevoegde citaten. De faalmodi zijn complementair in plaats van overlappend: een contextmanager die het verkeerde fragment weglaat, vergiftigt een goede schrijver, en een goede schrijver die slechte fragmenten krijgt, produceert een vloeiend rapport over het verkeerde onderwerp.
Die complementariteit is een argument om elk als een uitwisselbare component te behandelen in plaats van als een verbintenis. Als je de contexthelft met ContextPilot 8B bouwt, hoort de rapportgeneratiehelft achter een interface te zitten die er niet om geeft welk model erachter zit — zelfgehoste AstaBrief 8B aan de ene kant, een gehost frontier-model aan de andere, en de mogelijkheid om tussen beide te wisselen zonder de pipeline te herschrijven. Beide armen via één endpoint laten lopen, maakt daar een configuratiewijziging van in plaats van een migratie: één API voor meer dan 200 modellen, waarbij de lijstprijs van de provider tegen 0% opslag wordt doorgegeven, automatische failover wanneer een provider verslechtert, en een routing-DSL wanneer je meerdere modellen in één aanroep wilt samenbrengen. De zelfgehoste schrijver blijft zelfgehost, want dat is het onderdeel waar de datagevoeligheid speelt; alles eromheen blijft routeerbaar, want daar is flexibiliteit goedkoop.

De eerlijke stand van het bewijs
Geen van beide modellen heeft een onafhankelijk scorebord, en de twee labs meten niet eens hetzelfde.
• AstaBrief 8B, SQABench-CS2-gemiddelde (door de leverancier gerapporteerd): 87,0 op de test-split, tegenover 83,7 voor zijn eigen SFT-checkpoint en 77,3 voor base Qwen3-8B.
• AstaBrief 8B, DeepScholarBench (volgens opgave van de leverancier): 53,50, achter Ai2's eigen Asta ScholarQA met 60,25 en DR-Tulu-8B met 56,26.
• AstaBrief 8B, paarsgewijs winstpercentage tegen de door Claude aangedreven pipeline van Ai2 (volgens de leverancier): 55% op SQABench-CS2 dev, 72% op test.
• ContextPilot 8B: cijfers staan alleen in het artikel, op long-context-QA- en deep-search-benchmarks; geen getallen op de modelkaart en geen reproductie door derden.
Eén voorbehoud geldt voor de hele AstaBrief-column, en Ai2 vermeldt het in de blog zelf: het grootste deel van de training en evaluatie werd in 2025 afgerond, dus de vergelijkingsmodellen weerspiegelen de frontier van dat moment, en het lab heeft de evaluatie niet opnieuw uitgevoerd tegen de huidige frontiermodellen. Lees die percentages als bewijs voor een ontwerpkeuze op een bepaald moment, niet als een huidige rangschikking. De cijfers van ContextPilot 8B dragen het gebruikelijke papervoorbehoud: zelf geselecteerde benchmarksuite, zelf uitgevoerde harness, geen reproductie buiten Tencent.
Een tweede voorbehoud is specifiek voor AstaBrief 8B en je struikelt er in de praktijk gemakkelijk over. De modelkaart waarschuwt dat de checkpoint is fijngetuned op één promptformaat, dat als datasetbestand is gepubliceerd, en dat andere formaten het gedrag kunnen verslechteren. Als je het benchmarkt met een generieke chattestopstelling, meet je je testopstelling net zoveel als het model.
Welke wil je?
Kies AstaBrief 8B wanneer het document het eindproduct is. Het is Apache-2.0, het draait op één GPU in de 8B BF16-klasse, het heeft geen agentframework eromheen nodig, en het is speciaal getraind voor precies één output: een rapport met bronvermeldingen, samengesteld uit bewijsmateriaal dat iemand anders heeft opgehaald. De commerciële licentie is voor de meeste teams de beslissende factor, en de open-repo-houding van Ai2 zelf — gewichten, SFT-mix, DPO-mix en promptformaat allemaal gepubliceerd — is wat het echt open maakt in plaats van louter gratis.
Kies ContextPilot 8B wanneer het op te leveren resultaat een werkende trajectorie is en je probleem is dat de agent vergeet of erin verdrinkt. De licentie voor alleen onderzoek haalt het voor de meeste bedrijven uit de productieoverweging, en de runtime-vereiste betekent dat je het framework van Tencent overneemt, niet alleen een model. Als je proactief contextbeheer als techniek onderzoekt, is het een goed gedocumenteerd startpunt. Als je moet opleveren, is het dat niet.
En als je beide capaciteiten nodig hebt, is het antwoord geen van beide modellen alleen — het is het paar, zodanig met elkaar verbonden dat elk kan worden vervangen. Het enige wat deze vergelijking niet zou moeten opleveren, is één enkele winnaar, want de twee checkpoints concurreren niet om dezelfde plek in het systeem.
