
ContextPilot-14B — тихий агент Tencent с открытыми весами, который управляет собственным контекстом.
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
tencent/ContextPilot-14B — это дообученная модель с открытыми весами на 15 миллиардов параметров на основе Qwen3-14B, появившаяся на Hugging Face 27 августа 2026 года без какого-либо анонса. Сначала выложили веса; на следующий день появилась статья «ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL» (arXiv 2608.28476, принята на EMNLP 2026); затем на GitHub последовал код для обучения и оценки. Вот и весь запуск. Модель является флагманом семейства из трех чекпоинтов — ContextPilot-14B, ContextPilot-8B и ContextPilot-E4B, — созданных для того, что большинство моделей с открытыми весами не берутся делать: решать на каждом шаге, что модели сохранить, запомнить и вытеснить из собственного рабочего контекста, пока она рассуждает и вызывает инструменты.
Одно предостережение прежде всего: поиск по запросу «ContextPilot» в топе результатов выдаёт другой, не связанный с этим проект — систему оптимизации инференса для длинного контекста из Эдинбургского университета, также называемую ContextPilot, которая переиспользует кэшированный контекст между вызовами, чтобы сократить затраты на prefill. То же имя, совершенно другая вещь. Эта статья посвящена фреймворку Tencent для обучения агентов, и если перепутать эти два проекта, вы попадёте не в тот репозиторий, не в ту статью и не к тем утверждениям.
Что вышло, и что известно на данный момент
Область выпуска — три репозитория Hugging Face в организации tencent, созданных с разницей в день друг от друга. Флагман tencent/ContextPilot-14B — это чекпойнт в формате BF16 объёмом около 15 млрд параметров, построенный на основе Qwen/Qwen3-14B; tencent/ContextPilot-8B — версия на Qwen3-8B; tencent/ContextPilot-E4B — компактный представитель, построенный на базе Gemma4-E4B-it. В карточке модели для 14B чётко прописано разделение труда: загрузка чекпойнта сама по себе ничего не даёт — «определения инструментов, среда выполнения агента и конвейер оценки предоставляются в репозитории ContextPilot», поэтому веса становятся агентом только при запуске с кодом.

Приведённая выше страница репозитория — это вся публичная часть релиза на данный момент: карточка модели, файл лицензии и ссылка на статью и код. На момент написания на сайте вендора нет ни анонсирующего поста в блоге, ни пресс-релиза, ни страницы с ценами.
Основная суть — в репозитории GitHub Tencent/ContextPilot. Он содержит каталог train с реализацией обучения с подкреплением на базе verl — с рецептами для контрольных точек Qwen3-8B и Qwen3-14B — и каталог infer со скриптами оценки и загрузчиками данных для четырёх бенчмарков на длинный контекст: InfBench, NovelQA, LongMemEval и BrowseComp+. На карточке модели также есть URL с живым демо. На момент написания репозиторию всего два дня, у него горстка звёзд и ноль форков, поэтому воспринимать его следует как только что созданный, а не как проверенный в бою.
Чему ContextPilot учит агента
Постановка проблемы в статье — это основной режим отказа агента с длинным горизонтом: на протяжении множества раундов поиска, вызовов инструментов и рассуждений рабочий контекст агента растёт без ограничений, стоимость prefill возрастает, и модель тонет в собственной истории. Более ранние попытки давали моделям несколько инструментов редактирования — поиск, удаление, суммаризацию, — которые, как утверждается в статье, слишком слабы: нет глобального плана, нет памяти, сохраняющейся после раунда, нет способа сжать, а не уничтожить.
Ответ ContextPilot — это набор инструментов с тремя дополнениями: инструмент планирования, который решает, что сохранить, прежде чем агент действует; хранилище долговременной памяти, сохраняющее информацию в рабочем контексте; и механизм мягкой выгрузки, который перемещает менее полезный контекст из активного окна вместо удаления, чтобы его можно было вернуть при необходимости. Со стороны обучения статья предлагает два метода RL, специфичных для редактирования контекста: контекстно-зависимый частичный прогон, который разветвляет траекторию только в те моменты, когда редактирование действительно изменило состояние, и мелкозернистое распределение кредита, которое приписывает вознаграждение конкретному значимому действию редактирования, а не размазывает итоговое вознаграждение по всем правкам. Оба подхода пытаются решить одну и ту же основную проблему — правки контекста неоднородны по своему влиянию, и их единообразная обработка растрачивает сигнал RL.
Заявленный в заголовке тезис — «более высокая производительность при более компактном рабочем контексте». По крайней мере, данные оценки подтверждают вторую половину: модели ContextPilot работают в окне контекста 32K, тогда как нетюненная базисная модель Qwen3-14B оценивается на 128K, и при этом чекпоинты ContextPilot показывают более высокие результаты в собственной серии тестов на длинный контекст из статьи.
Табло, честно подписанное
Все числа в этом разделе предоставлены вендором из статьи (arXiv 2608.28476) и не были независимо воспроизведены — ни одна третья сторона не запускала tencent/ContextPilot-14B через публичный харнесс, а коду оценки всего несколько дней. В статье сообщается о средних значениях трёх прогонов по четырём бенчмаркам: NovelQA, ∞Bench (английский множественный выбор), LongMemEval-S и BrowseComp+.
• tencent/ContextPilot-14B (после SFT): 84.28 / 79.04 / 65.93 / 53.13 — 70.60 в среднем.
• tencent/ContextPilot-14B (+ RL): 84.81 / 81.08 / 67.40 / 55.50 — 72.20 в среднем. Проход RL дает в среднем около 1,6 балла, а наибольший прирост приходится на самый сложный бенчмарк, BrowseComp+ (+2,4).
• Сравнение, которое придаёт этим числам смысл: ненастроенная Qwen3-14B без контекстных инструментов, оценённая на контексте 128K, в среднем набирает 53.26 — почти на 19 баллов ниже модели с RL-настройкой, работающей в четверти контекста. StateLM-14B-RL, самый сильный предыдущий базовый метод управления контекстом, в среднем набирает 70.11, так что ContextPilot-14B-RL опережает его примерно на 2.1 балла.
Глубокий поиск — это вторая, отдельная оценка. На WebExplorer-8B агент ContextPilot достигает среднего результата 50.10 по BrowseComp, BrowseComp-ZH, GAIA и xBench-DeepSearch против 49.09 у сильной базовой модели SUPO; на WebSailor-7B он набирает 38.32 против 36.31 у SUPO.
• Утверждение об эффективности — самое интересное и самое сложное для проверки: на BrowseComp входные данные базового агента растут почти линейно до примерно 30K токенов, тогда как агент ContextPilot-8B стабилизируется в районе 8K–10K токенов за ход. Компактный рабочий контекст — это вся основная идея статьи, и данный показатель служит прямым доказательством этого.

Карточка выше сопоставляет заявленные средние значения трех контрольных точек. Относитесь к каждой цифре как к утверждению из статьи, а не как к проверенному результату.
Лицензия — это та часть, которая меняет ваши планы.
Вот факт, который большинство публикаций предпочтут замолчать, а вы не должны. Веса «открыты», но лицензия — не Apache-2.0; это собственная «License Terms of ContextPilot-14B», которая воспроизводит текст Apache и добавляет Раздел 0, где говорится, что модель «предоставляется исключительно для целей научных исследований и разработок» и «не должна» использоваться для любых других целей. Простыми словами, это лицензия только для исследований: вы можете дообучать и изучать модель, но не можете разворачивать её в продукте, использовать в коммерческих целях или применять в качестве ядра платного сервиса без отдельного соглашения с Tencent. Базовая модель Qwen3-14B распространяется под Apache-2.0; файн-тюн ContextPilot добавляет это ограничение поверх. Версии 8B и E4B имеют собственные файлы лицензий, и их следует оценивать на их собственных условиях.
Лицензия только для исследований также объясняет отсутствие размещённого маршрута. Ни один провайдер инференса сегодня не предлагает tencent/ContextPilot-14B в качестве API, и лицензия только для исследований — веская причина, по которой ни один коммерческий маршрутизатор, включая OrcaRouter, не включит его в список, пока Tencent не изменит условия. Для тех, кто хочет запустить его сейчас, это означает самостоятельный хостинг для исследований: дообученная модель обслуживается через vLLM или SGLang с конечной точкой, совместимой с OpenAI, — именно так собственный конвейер вывода из статьи запускает её.
Что подтверждено, а что нет
Подтверждено из самих репозиториев: три контрольные точки существуют и загружаются; статья существует, датирована 28 августа 2026 года и имеет статус принятой в основную программу EMNLP 2026; рецепты обучения реальны и конкретны (verl, Qwen3-8B и Qwen3-14B); конвейер оценки охватывает четыре названных бенчмарка; а текст лицензии допускает использование только в исследовательских целях.
Пока не подтверждено: какое-либо объявление или пост о запуске от Tencent (на момент написания его нет); какие-либо цены или размещённый API; какой-либо независимый прогон бенчмарков; какое-либо воспроизведение результатов глубокого поиска или длинного контекста третьей стороной; а также точное количество параметров и бюджет обучения для варианта E4B, который в статье описывается как компактная модель на базе Gemma4-E4B-it. Набор бенчмарков также стоит читать скептически — BrowseComp+ со средним входным размером 552K токенов представляет собой совершенно другой стресс-тест по сравнению с NovelQA со средним показателем 119K, и средние значения в статье скрывают большой разброс.

Приведенная выше целевая страница статьи является каноническим источником для каждого утверждения в таблице результатов — и отсутствие каких-либо сторонних цитат само по себе является столбцом «еще не подтверждено».
Что посмотреть дальше
Три события могли бы изменить картину, по убыванию важности. Во-первых, {{1}}коммерческая лицензия или официальное объявление{{/1}} — это разница между исследовательским артефактом и моделью, пригодной к развёртыванию, и решать здесь только Tencent. Во-вторых, {{2}}первая независимая оценка{{/2}}: набор тестов для длинного контекста и показатели глубокого поиска воспроизводимы из публичного кода и весов, так что сторонний прогон должен появиться в течение недель, если результаты подтвердятся. В-третьих, любой признак того, что подход проникает в производственные модели Tencent (очевидный кандидат — линейка Hunyuan), — {{3}}и это покажет, является ли упреждающее управление контекстом исследовательской нишей или направлением, которое индустрия вот-вот скопирует{{/3}}.
Для разработчиков честная позиция на ближайшее время такова: следите за ним, оценивайте его и пока не стройте на его основе продукт. Сугубо исследовательский чекпойнт, выпущенный без анонса и без независимой проверки, — это ровно то, что стоит направить по тестовому пути, а не по боевому. Когда появятся и лицензия, и независимая проверка, маршрутизация станет тривиальной: тот же ключ OrcaRouter, который обслуживает более 200 хостируемых моделей по прайс-листу провайдера с нулевой наценкой, добавил бы эту модель в тот же день, когда провайдер её опубликует, с автоматическим переключением при сбое, чтобы зависший агентный чекпойнт, созданный несколько дней назад, никогда не утянул за собой реальную нагрузку. А пока что веса — это очень интересный исследовательский артефакт с по-настоящему новым рецептом обучения, а вокруг него — юридическая стена, которую стоит прочитать, прежде чем что-либо с ними делать.
