Karta tytułowa hero dla ContextPilot-14B z podtytułem 'Cichy agent Tencenta z otwartymi wagami, który zarządza własnym kontekstem', plakietkami 'Dostrojenie Qwen3-14B', 'Wydano trzy punkty kontrolne' i 'Licencja tylko do badań', stopką 'Wagi 27 sie · Artykuł 28 sie · Bez ogłoszenia' oraz logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

ContextPilot-14B to niepozorny agent Tencenta o otwartych wagach, który zarządza własnym kontekstem.

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

tencent/ContextPilot-14B to model o 15 miliardach parametrów i otwartych wagach, będący dostrojeniem Qwen3-14B, który pojawił się na Hugging Face 27 sierpnia 2026 roku bez żadnego ogłoszenia. Wagi zostały opublikowane; artykuł „ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL” (arXiv 2608.28476, przyjęty na EMNLP 2026) pojawił się następnego dnia; kod treningowy i ewaluacyjny trafił na GitHuba. To cała premiera. Jest to flagowy model rodziny trzech checkpointów — ContextPilot-14B, ContextPilot-8B i ContextPilot-E4B — zbudowanych do czegoś, czego większość modeli o otwartych wagach nie próbuje: decydowania tura po turze, co model powinien zachować, zapamiętać i wypchnąć ze swojego kontekstu roboczego podczas rozumowania i wywoływania narzędzi.

Na początek jedno ostrzeżenie: wyszukanie „ContextPilot" zwraca na górze wyników inny, niezwiązany projekt — system optymalizacji wnioskowania dla długich kontekstów z University of Edinburgh, również nazywany ContextPilot, który ponownie wykorzystuje buforowany kontekst między wywołaniami, aby obniżyć koszt prefilla. Ta sama nazwa, zupełnie inna rzecz. Ten artykuł dotyczy frameworka Tencent do trenowania agentów, a pomylenie tych dwóch projektów zaprowadzi cię do niewłaściwego repozytorium, niewłaściwej pracy naukowej i niewłaściwego zestawu twierdzeń.

Co wypuszczono, a co jest obecnie wiadome

Powierzchnia wydania obejmuje trzy repozytoria Hugging Face w organizacji tencent, wszystkie utworzone w odstępie jednego dnia od siebie. Sztandarowy model, tencent/ContextPilot-14B, to punkt kontrolny BF16 o około 15 miliardach parametrów zbudowany na bazie Qwen/Qwen3-14B; tencent/ContextPilot-8B to wersja oparta na Qwen3-8B; tencent/ContextPilot-E4B to kompaktowy członek rodziny, zbudowany na bazie Gemma4-E4B-it. Karta modelu 14B wprost określa podział zadań: samo wczytanie punktu kontrolnego nic nie daje — „definicje narzędzi, środowisko uruchomieniowe agenta i potok oceny znajdują się w repozytorium ContextPilot", więc wagi stają się agentem dopiero po uruchomieniu ich z kodem.

A screenshot of the Hugging Face model card for tencent/ContextPilot-14B (captured August 31, 2026), showing the model summary 'ContextPilot-14B is the Qwen3-14B checkpoint of ContextPilot, a proactive context-management framework for long-horizon language-model agents', the tags 'Context Management', 'Context-Aware Partial Rollout', and 'Fine-Grained Credit Assignment', and 'License: other'.

Powyższa strona repozytorium to obecnie całe publiczne oblicze wydania: karta modelu, plik licencji oraz odnośnik do artykułu i kodu. W chwili pisania tego tekstu na stronie dostawcy nie ma żadnego wpisu na blogu z okazji premiery, komunikatu prasowego ani strony z cennikiem.

{{1}}To właśnie w tym repozytorium GitHub, Tencent/ContextPilot, znajduje się sedno sprawy.{{/1}} {{2}}Zawiera katalog train z implementacją uczenia przez wzmacnianie opartą na verl — z konfiguracjami dla punktów kontrolnych Qwen3-8B i Qwen3-14B — oraz katalog infer ze skryptami ewaluacyjnymi i ładowaczami danych dla czterech benchmarków długiego kontekstu: InfBench, NovelQA, LongMemEval i BrowseComp+.{{/2}} {{3}}Na karcie modelu znajduje się również adres URL działającego demo.{{/3}} {{4}}W momencie pisania tego tekstu repozytorium ma dwa dni, zaledwie kilka gwiazdek i zero forków, więc wszystko, co o nim wiadomo, należy traktować jako świeżo wyprodukowane, a nie sprawdzone w boju.{{/4}}

Czego ContextPilot uczy agenta

The problem statement of the paper is {{1}}the long-horizon agent's core failure mode{{/1}}: over many turns of retrieval, tool calls, and reasoning, an agent's working context grows without bound, prefill cost rises, and the model drowns in its own history. Earlier attempts gave models a few editing tools — search, deletion, summarization — which the paper argues are {{2}}too weak{{/2}}: no global plan, no memory that survives the turn, no way to compress rather than destroy.

Odpowiedzią ContextPilota jest zestaw narzędzi składający się z trzech dodatków: narzędzia planowania, które decyduje, co zachować, zanim agent zadziała; magazynu pamięci długotrwałej, który utrzymuje informacje między kontekstami roboczymi; oraz mechanizmu miękkiego odciążania, który przenosi mniej przydatny kontekst poza aktywne okno zamiast go usuwać, aby można go było przywołać w razie potrzeby. Po stronie treningowej artykuł wnosi dwie techniki RL specyficzne dla edycji kontekstu: częściowy rollout uwzględniający kontekst, który rozgałęzia trajektorię tylko w momentach, w których edycja faktycznie zmieniła stan, oraz szczegółowe przypisywanie zasług, które przypisuje nagrodę konkretnej czynności edycyjnej, która miała znaczenie, zamiast rozmywać końcową nagrodę po wszystkich edycjach. Obie są próbami rozwiązania tego samego podstawowego problemu — edycje kontekstu są niejednorodne pod względem wpływu, a traktowanie ich jednolicie marnuje sygnał RL.

Główna teza brzmi: „lepsza wydajność przy bardziej zwartym kontekście roboczym”. Liczby z ewaluacji potwierdzają przynajmniej drugą część: modele ContextPilot działają w oknie kontekstowym 32K, podczas gdy nietunowany szkielet Qwen3-14B jest oceniany przy 128K, a punkty kontrolne ContextPilot wciąż osiągają wyższe wyniki w autorskim zestawie testów długiego kontekstu z artykułu.

Tablica wyników, uczciwie oznaczona

Każda liczba w tej sekcji jest raportowana przez dostawcę w artykule (arXiv 2608.28476) i nie została niezależnie odtworzona — żadna strona trzecia nie uruchomiła tencent/ContextPilot-14B w publicznym harnessie, a kod ewaluacyjny ma zaledwie kilka dni. Artykuł podaje średnie z trzech uruchomień dla czterech benchmarków: NovelQA, ∞Bench (angielskie pytania wielokrotnego wyboru), LongMemEval-S i BrowseComp+.

• tencent/ContextPilot-14B (po SFT): 84.28 / 79.04 / 65.93 / 53.13 — średnia 70.60.

• tencent/ContextPilot-14B (+ RL): 84.81 / 81.08 / 67.40 / 55.50 — średnia 72.20. Przejście RL jest warte średnio około 1.6 punktu, a jego największe zyski przypadają na najtrudniejszy benchmark, BrowseComp+ (+2.4).

• Porównanie, które nadaje znaczenie tym liczbom: niedostrojony Qwen3-14B bez narzędzi kontekstowych, oceniany przy kontekście 128K, osiąga średnio 53,26 — prawie 19 punktów poniżej modelu dostrojonego metodą RL, który działa w ćwiartce kontekstu. StateLM-14B-RL, najmocniejsza dotychczasowa linia bazowa zarządzania kontekstem, osiąga średnio 70,11, więc ContextPilot-14B-RL wyprzedza ją o około 2,1 punktu.

• Głębokie wyszukiwanie to druga, osobna ewaluacja. Na WebExplorer-8B agent ContextPilot osiąga średnią 50.10 w BrowseComp, BrowseComp-ZH, GAIA i xBench-DeepSearch wobec 49.09 dla mocnej linii bazowej SUPO; na WebSailor-7B uzyskuje 38.32 wobec 36.31 SUPO.

• Twierdzenie o wydajności jest najciekawsze i najtrudniejsze do zweryfikowania: w przypadku BrowseComp wejście agenta bazowego rośnie niemal liniowo do około 30K tokenów, podczas gdy agent ContextPilot-8B stabilizuje się na poziomie 8K–10K tokenów na turę. Zwarty kontekst roboczy stanowi całą tezę artykułu, a ten rysunek jest bezpośrednim tego dowodem.

A single-column scoreboard card titled 'ContextPilot-14B — the scoreboard' with rows 'Checkpoints: 14B, 8B, E4B', 'Base: Qwen3-14B (dense)', 'Working context: 32K vs 128K base', 'Headline: 72.20 avg (vendor)', 'License: research-only', and 'Status: no announcement, no API', with footer 'All figures vendor-reported; no independent scores yet.', and the OrcaRouter logo in the bottom-right corner.

Karta powyżej zestawia obok siebie średnie raportowane dla trzech punktów kontrolnych. Każdą wartość należy traktować jako twierdzenie pochodzące z artykułu, a nie jako zweryfikowany wynik.

Licencja to część, która zmienia twoje plany.

Oto fakt, który większość opisów przemilczy, a ty nie powinieneś. Wagi są „otwarte”, ale licencja nie jest Apache-2.0 — to niestandardowa „License Terms of ContextPilot-14B”, która powiela tekst Apache i dodaje Sekcję 0 stwierdzającą, że model jest „udostępniany wyłącznie w celu badań i rozwoju naukowego” i „nie może” być używany do żadnego innego celu. Mówiąc wprost, to licencja wyłącznie do celów badawczych: możesz go dostroić i badać, ale nie możesz wdrożyć go w produkcie, udostępniać komercyjnie ani używać jako silnika płatnej usługi bez odrębnego porozumienia z Tencent. Model bazowy, Qwen3-14B, jest na licencji Apache-2.0; dostrojenie ContextPilot nakłada na to ograniczenie. Modele 8B i E4B mają własne pliki licencyjne i należy je interpretować na ich własnych warunkach.

Licencja wyłącznie badawcza wyjaśnia również brak hostowanej trasy. Żaden dostawca inferencji nie oferuje dziś tencent/ContextPilot-14B jako API, a licencja wyłącznie badawcza jest mocnym powodem, dla którego żaden komercyjny router — w tym OrcaRouter — nie umieści go na liście, dopóki Tencent nie zmieni warunków. Dla każdego, kto chce uruchomić go teraz, oznacza to samodzielne hostowanie do celów badawczych: dostrojony model działa przez vLLM lub SGLang z punktem końcowym zgodnym z OpenAI, czyli dokładnie tak, jak napędza go własny potok wnioskowania z artykułu.

Co jest potwierdzone, a co nie

Potwierdzone z samych repozytoriów: trzy checkpointy istnieją i można je pobrać; artykuł istnieje, jest datowany na 28 sierpnia 2026 roku i ma akceptację na głównej ścieżce EMNLP 2026; przepisy treningowe są realne i konkretne (verl, Qwen3-8B i Qwen3-14B); potok ewaluacyjny obejmuje cztery wymienione benchmarki; a tekst licencji ogranicza użycie wyłącznie do celów badawczych.

Niepotwierdzone są nadal: jakiekolwiek ogłoszenie lub post o premierze od Tencent (na chwilę pisania nie istnieje żaden); jakiekolwiek ceny lub hostowane API; jakikolwiek niezależny test porównawczy; jakiekolwiek odtworzenie wyników deep-search lub długiego kontekstu przez stronę trzecią; oraz dokładna liczba parametrów i budżet treningowy dla wariantu E4B, który według artykułu jest kompaktowym członkiem zbudowanym na bazie Gemma4-E4B-it. Zestaw testów porównawczych również warto traktować ze sceptycyzmem — BrowseComp+ przy średnio 552K tokenów wejściowych to zupełnie inny test obciążeniowy niż NovelQA ze średnią 119K, a średnia z artykułu zaciera duży rozrzut wyników.

A screenshot of the arXiv abstract page for 'ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL' (arXiv 2608.28476, captured August 31, 2026), showing 'Submitted on 28 Aug 2026', the author list, the abstract, and 'accepted to EMNLP 2026 (Main Track)'.

Strona docelowa powyższego artykułu jest kanonicznym źródłem każdego twierdzenia w tabeli wyników — a brak jakiegokolwiek cytatu zewnętrznego sam w sobie stanowi kolumnę „jeszcze nie potwierdzono”.

Co obejrzeć dalej

Trzy wydarzenia mogłyby zmienić obraz sytuacji, w kolejności od najważniejszego. Po pierwsze, {{1}}licencja komercyjna lub oficjalne ogłoszenie{{/1}} — to różnica między artefaktem badawczym a modelem nadającym się do wdrożenia, i to wyłącznie decyzja Tencent. Po drugie, {{2}}pierwsza niezależna ewaluacja: zarówno zestaw testów długiego kontekstu, jak i wyniki deep-searchu są odtwarzalne z publicznego kodu i wag, więc niezależne uruchomienie powinno nastąpić w ciągu kilku tygodni, jeśli wyniki się potwierdzą{{/2}}. Po trzecie, {{3}}jakikolwiek sygnał, że podejście przenika do produkcyjnych modeli Tencent — linia Hunyuan jest oczywistym kandydatem{{/3}} — co powie ci, czy proaktywne zarządzanie kontekstem to nisza badawcza, czy kierunek, który branża zamierza skopiować.

Dla twórców uczciwe stanowisko w najbliższej perspektywie jest takie: obserwujcie to, oceniajcie to, ale nie budujcie jeszcze na tym produktu. Punkt kontrolny wyłącznie do badań, który pojawia się bez ogłoszenia i bez niezależnej weryfikacji, to dokładnie coś, co należy skierować na ścieżkę testową, a nie produkcyjną. Kiedy zarówno licencja, jak i weryfikacja się pojawią, kwestia routingu jest trywialna — ten sam klucz OrcaRouter, który obsługuje ponad 200 hostowanych modeli w cenie katalogowej dostawcy z 0% narzutu, dodałby ten model w dniu, w którym dostawca go udostępni, z automatycznym przełączaniem awaryjnym, tak aby kilkudniowy punkt kontrolny agenta, który się zawiesi, nigdy nie pociągnął za sobą prawdziwego obciążenia produkcyjnego. Do tego czasu wagi są bardzo interesującym artefaktem badawczym z naprawdę nowatorską receptą na trenowanie — oraz prawnym murem wokół nich, który należy przeczytać, zanim zrobi się z nimi cokolwiek.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube