Ett hero-titelkort för ContextPilot-14B med underrubriken 'Tencents tysta agent med öppna vikter som hanterar sin egen kontext', piller-badges 'Qwen3-14B fine-tune', 'Tre checkpoints släppta' och 'Forskningslicens', samt en sidfot 'Vikter 27 aug. · Paper 28 aug. · Inget tillkännagivande', med OrcaRouter-logotypen i det nedre högra hörnet.
Guides & Insights

ContextPilot-14B är Tencents tysta open-weight-agent som hanterar sin egen kontext

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

tencent/ContextPilot-14B är en 15-miljarders-parameter open-weights-fintuning av Qwen3-14B som dök upp på Hugging Face den 27 augusti 2026 utan något tillkännagivande av något slag. Vikterna lades upp; papperet, "ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL" (arXiv 2608.28476, accepterat till EMNLP 2026), kom nästa dag; tränings- och utvärderingskoden följde på GitHub. Det är hela lanseringen. Det är flaggskeppet i en familj med tre checkpointar — ContextPilot-14B, ContextPilot-8B och ContextPilot-E4B — byggda för att göra något som de flesta open-weights-modeller inte försöker: besluta, tur för tur, vad modellen ska behålla, komma ihåg och trycka ut ur sin egen arbetskontext medan den resonerar och anropar verktyg.

En varning innan allt annat: sök på "ContextPilot" så beskriver de främsta sökresultaten ett annat, orelaterat projekt — ett system för optimering av inferens med lång kontext från University of Edinburgh, också kallat ContextPilot, som återanvänder cachad kontext mellan anrop för att sänka prefill-kostnaden. Samma namn, helt annan sak. Den här artikeln handlar om Tencents ramverk för agentträning, och att blanda ihop de två skulle skicka dig till fel repo, fel paper och fel uppsättning påståenden.

Vad som levererades, och vad som går att veta just nu.

The release surface is three Hugging Face repositories under the tencent organization, all created within a day of each other. The flagship, tencent/ContextPilot-14B, is a BF16 checkpoint of roughly 15B parameters built from Qwen/Qwen3-14B; tencent/ContextPilot-8B is the Qwen3-8B version; tencent/ContextPilot-E4B is the compact member, built from the Gemma4-E4B-it backbone. The model card for the 14B is explicit about the division of labor: loading the checkpoint alone does nothing — "the tool definitions, agent runtime, and evaluation pipeline are provided in the ContextPilot repository," so the weights only become an agent when you run them with the code.

A screenshot of the Hugging Face model card for tencent/ContextPilot-14B (captured August 31, 2026), showing the model summary 'ContextPilot-14B is the Qwen3-14B checkpoint of ContextPilot, a proactive context-management framework for long-horizon language-model agents', the tags 'Context Management', 'Context-Aware Partial Rollout', and 'Fine-Grained Credit Assignment', and 'License: other'.

Repository-sidan ovan är hela den offentliga ytan av releasen just nu: ett modellkort, en licensfil och en pekare till uppsatsen och koden. Det finns inget blogginlägg om lanseringen, ingen pressrelease och ingen prissida någonstans på leverantörens webbplats i skrivande stund.

Det GitHub-repositoriet, Tencent/ContextPilot, är där substansen finns. Det innehåller en train-katalog med reinforcement-learning-implementeringen byggd på verl — med recept för både Qwen3-8B- och Qwen3-14B-checkpoints — och en infer-katalog med utvärderingsskript och dataladdare för fyra långkontext-riktmärken: InfBench, NovelQA, LongMemEval och BrowseComp+. Det finns också en live-demo-URL på modellkortet. När detta skrivs är repot två dagar gammalt med en handfull stjärnor och noll forks, så allt om det bör läsas som nypressat snarare än stridstestat.

Vad ContextPilot lär en agent att göra

Artikelns problemformulering är den långsiktiga agentens centrala feltillstånd: över många omgångar av hämtning, verktygsanrop och resonemang växer en agents arbetskontext utan gräns, förfyllnadskostnaden stiger, och modellen drunknar i sin egen historik. Tidigare försök gav modeller ett fåtal redigeringsverktyg — sökning, radering, sammanfattning — som enligt artikeln är för svaga: ingen global plan, inget minne som överlever omgången, inget sätt att komprimera snarare än förstöra.

ContextPilots svar är en verktygssats med tre tillägg: ett planeringsverktyg som bestämmer vad som ska behållas innan agenten agerar; ett långtidsminneslager som bevarar information över den aktiva kontexten; och en mjuk avlastningsmekanism som flyttar mindre användbar kontext ut ur det aktiva fönstret istället för att radera den, så att den kan hämtas tillbaka när det behövs. På träningssidan bidrar papperet med två RL-tekniker specifika för kontextredigering: kontextmedveten partiell rollout, som förgrenar en bana endast vid de tillfällen där en redigering faktiskt ändrade tillståndet, och finkornig kreditfördelning, som tillskriver belöning till den specifika redigeringsåtgärd som spelade roll snarare än att smeta ut den slutliga belöningen över varje redigering. Båda är försök att lösa samma underliggande problem — kontextredigeringar är heterogena i sin påverkan, och att behandla dem enhetligt slösar bort RL-signalen.

Huvudpåståendet är "starkare prestanda med en mer kompakt arbetskontext." Utvärderingssiffrorna stödjer åtminstone den andra delen: ContextPilot-modeller körs i ett 32K-kontextfönster medan den ojusterade Qwen3-14B-grundmodellen utvärderas vid 128K, och ContextPilot-kontrollpunkterna får fortfarande högre poäng på artikelns egen långkontextsvit.

Resultattavlan, ärligt märkt.

Varje nummer i detta avsnitt är leverantörsrapporterat från artikeln (arXiv 2608.28476) och har inte oberoende reproducerats — ingen tredje part har kört tencent/ContextPilot-14B genom en offentlig testmiljö, och utvärderingskoden är bara några dagar gammal. Artikeln rapporterar medelvärden från tre körningar på fyra benchmarks: NovelQA, ∞Bench (engelska flervalsfrågor), LongMemEval-S och BrowseComp+.

• tencent/ContextPilot-14B (efter SFT): 84.28 / 79.04 / 65.93 / 53.13 — 70.60 genomsnitt.

• tencent/ContextPilot-14B (+ RL): 84.81 / 81.08 / 67.40 / 55.50 — 72.20 i genomsnitt. RL-passet är värt ungefär 1.6 poäng i genomsnitt, och dess största vinster hamnar på det svåraste riktmärket, BrowseComp+ (+2.4).

• Jämförelsen som ger dessa siffror mening: den ojusterade Qwen3-14B utan kontextverktyg, utvärderad vid 128K kontext, ligger i genomsnitt på 53,26 — nästan 19 poäng under den RL-justerade modellen som körs i en fjärdedel av kontexten. StateLM-14B-RL, den starkaste tidigare baslinjen för kontexthantering, ligger i genomsnitt på 70,11, så ContextPilot-14B-RL leder med cirka 2,1 poäng.

• Djup sökning är en andra, separat utvärdering. På WebExplorer-8B når ContextPilots agent ett genomsnitt på 50,10 över BrowseComp, BrowseComp-ZH, GAIA och xBench-DeepSearch jämfört med 49,09 för den starka SUPO-baslinjen; på WebSailor-7B får den 38,32 mot SUPO:s 36,31.

• Effektivitetspåståendet är det mest intressanta och det svåraste att verifiera: på BrowseComp växer baslinjeagentens indata nästan linjärt mot ungefär 30K tokens, medan ContextPilot-8B-agenten stabiliserar sig runt 8K–10K tokens per tur. Kompakt arbetskontext är hela artikelns tes, och den här figuren är det direkta beviset för det.

A single-column scoreboard card titled 'ContextPilot-14B — the scoreboard' with rows 'Checkpoints: 14B, 8B, E4B', 'Base: Qwen3-14B (dense)', 'Working context: 32K vs 128K base', 'Headline: 72.20 avg (vendor)', 'License: research-only', and 'Status: no announcement, no API', with footer 'All figures vendor-reported; no independent scores yet.', and the OrcaRouter logo in the bottom-right corner.

Kortet ovan ställer de tre kontrollpunkternas rapporterade genomsnitt sida vid sida. Behandla varje siffra som ett påstående från artikeln, inte som ett granskat resultat.

Licensen är den del som ändrar dina planer.

Här är det faktum som de flesta artiklar kommer att sopa under mattan, men som du inte bör. Vikterna är ”öppna”, men licensen är inte Apache-2.0 – det är en anpassad ”License Terms of ContextPilot-14B”, som återger Apache-texten och lägger till en paragraf 0 som anger att modellen ”görs tillgänglig enbart för vetenskaplig forskning och utveckling” och ”får inte” användas för något annat ändamål. Det är en ren forskningslicens i klartext: du kan finjustera och studera den, men du kan inte distribuera den i en produkt, erbjuda den kommersiellt eller använda den som motor i en betald tjänst utan ett separat avtal med Tencent. Basmodellen, Qwen3-14B, är Apache-2.0; ContextPilot-finfjusteringen lägger begränsningen ovanpå. 8B- och E4B-modellerna har egna licensfiler och bör läsas på sina egna villkor.

Den forsknings-exklusiva licensen förklarar också frånvaron av en värdbaserad rutt. Ingen inferensleverantör erbjuder idag tencent/ContextPilot-14B som ett API, och en forsknings-exklusiv licens är en stark anledning till att ingen kommersiell router — inklusive OrcaRouter — kommer att lista den innan Tencent ändrar villkoren. För den som vill köra den nu innebär det självvärd för forskning: den finjusterade modellen serveras genom vLLM eller SGLang med en OpenAI-kompatibel slutpunkt, vilket är exakt hur artikelns egen inferens-pipeline driver den.

Vad är bekräftat, och vad är inte

Bekräftat från själva repositoryerna: de tre checkpointarna finns och kan laddas ner; artikeln finns, är daterad 28 augusti 2026 och har accepterats i huvudspåret för EMNLP 2026; träningsrecepten är verkliga och specifika (verl, Qwen3-8B och Qwen3-14B); utvärderingspipelinen täcker de fyra namngivna benchmarkarna; och licenstexten är endast för forskning.

Ännu inte bekräftat: något tillkännagivande eller lanseringsinlägg från Tencent (inget finns i skrivande stund); någon prissättning eller värdbaserat API; någon oberoende benchmarkkörning; någon tredjepartsreproduktion av deep-search- eller långkontextsiffrorna; samt det exakta antalet parametrar och träningsbudgeten för E4B-varianten, som artikeln beskriver som den kompakta medlemmen byggd på Gemma4-E4B-it. Benchmark-sviten är också värd att läsa med skepsis — BrowseComp+ med genomsnittligt 552 000 inmatade tokens är ett mycket annorlunda stresstest jämfört med NovelQA med ett genomsnitt på 119 000, och artikelns genomsnitt döljer en stor spridning.

A screenshot of the arXiv abstract page for 'ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL' (arXiv 2608.28476, captured August 31, 2026), showing 'Submitted on 28 Aug 2026', the author list, the abstract, and 'accepted to EMNLP 2026 (Main Track)'.

Artikelns landningssida ovan är den kanoniska källan för varje påstående i resultattavlan – och avsaknaden av tredjepartscitat är i sig själv kolumnen "ännu inte bekräftat".

Vad du ska titta på härnäst

Tre utvecklingar skulle förändra bilden, {{1}}i prioritetsordning{{/1}}. För det första: en kommersiell licens eller ett officiellt tillkännagivande — det är skillnaden mellan en forskningsartefakt och en distributionsklar modell, och det är helt och hållet Tencents beslut. För det andra: en första oberoende utvärdering — {{2}}långkontextsviten och deep-search-siffrorna går båda att reproducera från offentlig kod och offentliga vikter{{/2}}, så en tredjepartskörning borde vara klar inom några veckor om resultaten håller. För det tredje: {{3}}alla tecken på att angreppssättet läcker in i Tencents produktionsmodeller{{/3}} — Hunyuan-serien är den självklara kandidaten — {{4}}vilket skulle visa dig om proaktiv kontexthantering är en forskningsnisch eller en riktning som branschen är på väg att kopiera{{/4}}.

För byggare är den ärliga kortsiktiga positionen: bevaka den, utvärdera den, och bygg ännu inte en produkt på den. En ren forsknings-checkpoint som levereras utan tillkännagivande och utan oberoende verifiering är precis den typ av sak du vill peka på en testväg snarare än en produktionsväg. När både licensen och verifieringen väl har landat blir routinghistorien trivial — samma OrcaRouter-nyckel som ligger framför 200+ värdmodeller till leverantörens listpris med 0% påslag skulle lägga till den här samma dag som en leverantör listar den, med automatisk failover så att en några dagar gammal agent-checkpoint som fastnar aldrig tar med sig en riktig arbetsbelastning ned. Tills dess är vikterna en mycket intressant forskningsartefakt med ett genuint nytt träningsrecept — och en juridisk mur runt dem som du bör läsa innan du gör något med dem.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube