
ContextPilot-8B: Tencent тихо выпустила агента Qwen3-8B, который управляет собственным контекстом
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
tencent/ContextPilot-8B появился на Hugging Face 27 августа 2026 года без каких-либо анонсов, журнала изменений и запускающего поста — и репозиторий всё ещё редактировался вплоть до 31 августа, через два дня после публикации сопутствующей научной статьи. Это дообученная версия модели Qwen/Qwen3-8B с 8 миллиардами параметров, которая учит агента планировать, запоминать и выгружать собственный рабочий контекст, продолжая при этом рассуждать. Она входит в тихо выпущенное семейство, в которое также входят ContextPilot-E4B и ContextPilot-14B. На сегодняшний день официального заявления от вендора так и нет: о релизе можно узнать только из карточки модели, конфигурационного файла, файла рецепта слияния и связанной статьи на arXiv. Это обзор того, что нам известно на данный момент: что собой представляет контрольная точка, которой всего четыре дня, что файлы репозитория раскрывают такого, чего нет в статье, и что лицензия research-only означает на практике.
Контрольная точка: шесть фактов
Всё, что приведено ниже, взято напрямую из репозитория, и ничто из этого не является бенчмарк-заявлением:
• Базовая модель — Qwen/Qwen3-8B, согласно карточке модели и тегу base_model в конфиге; веса являются её дообучением, а не моделью, созданной с нуля.
• Архитектура — Qwen3ForCausalLM, 36 слоёв, скрытый размер 4096, 32 головы внимания с 8 KV-головами, head_dim 128, словарь 151 936.
• Размер — 16.38 ГБ весов BF16 в четырёх шардах safetensors, что соответствует плотной модели с ~8B параметров.
• Потолок контекста — max_position_embeddings 40960 (40K), тот же потолок, который задаёт собственная конфигурация Qwen3-8B; обученное окно в 32K расширяется до ~131K через YaRN точно так же, как у базовой модели. Это не модель с более длинным контекстом — это модель управления контекстом.
• Конфигурация генерации — температура 0.6, top_p 0.95, top_k 20, сэмплирование включено; умеренный профиль, способствующий исследованию, для агентного прогона.
• Лицензия — модифицированный текст Apache-2.0 с добавленным Разделом 0: только для исследований и разработок, «Вы не должны использовать его ни для каких других целей».

Страница модели Hugging Face выше — это вся публичная поверхность релиза: тонкая карточка, шарды и ссылки на репозиторий GitHub и статью. Никаких цифр, никаких записей в лидербордах, никакого размещённого API.
Почему базовая модель — главная тема
Интересный факт о ContextPilot-8B заключается не в том, что Tencent дообучил Qwen3-8B — так поступает каждая лаборатория, — а в том, как мало тонкая настройка меняет в исходной модели, при этом кардинально меняя то, как её следует использовать. Чекпойнт сохраняет плотную архитектуру Qwen3-8B с 8B параметрами, гибридный режим мышления и 40K-потолок позиций, так что любые ваши интуитивные представления об обслуживании базовой модели переносятся и сюда: это модель уровня одной GPU, а не датацентра.
Что меняет тонкая настройка — так это контракт инструмента. В карточке модели прямо указано: загрузка контрольной точки сама по себе не даёт вам рабочего агента с управлением контекстом — определения инструментов, среда выполнения агента и конвейер оценки находятся в репозитории github.com/Tencent/ContextPilot, а живое демо на tencent.github.io/ContextPilot — самый быстрый способ увидеть, каким должно быть поведение. ContextPilot-8B — это компонент более крупной среды выполнения, что необычно для релиза с открытыми весами, и это первое, что нужно усвоить.
Также стоит знать, как устроено семейство, потому что 8B легко перепутать с флагманом, хотя на самом деле это модель со стандартным контекстом. Все три чекпоинта tencent/ были созданы в один день (2026-08-27), но появились под авторским аккаунтом panzs19 на несколько недель раньше — 8B и 14B (на базе Qwen3) с середины августа, E4B (на базе Gemma4-E4B) примерно с 20 августа. Именно E4B имеет потолок в 128K позиций и унаследованные визуальный и аудио-энкодеры; 8B и 14B — это текстовые варианты Qwen3 с потолком 40K. Один каркас, три разных контейнера.
Рецепт слияния — самый показательный файл в репозитории.
Большинство открытых релизов поставляют конфиг и README и на этом останавливаются. ContextPilot-8B также поставляет task_vectors.json, в котором точно записано, как был собран чекпоинт: это слияние task-векторов поверх стандартной базы Qwen3-8B, а не единичный сквозной файнтюн. Рецепт объединяет три взвешенных дельты — четырехзадачный SFT-прогон "joint recovery" с весом 0.5, специализированный SFT для успешного браузинга с весом 0.5 и восстановление InfBench в замкнутом цикле с весом 0.15 — добавленные к базовой модели по формуле base + Σ weight·(expert − base).
Прочитайте этот файл — в нём сказано об истории обучения, ведь имена путей содержат временные метки. Запуски SFT находятся в agentic_verl/saves/sft/Qwen3-8B/ с датами 20260731, 20260801 и 20260802 — Tencent обучал этих специалистов на своём агентном стеке на основе verl с последней недели июля по начало августа, за несколько недель до того, как хоть какие-то веса стали видны кому-либо за пределами компании. Структура слияния также объясняет, почему неанонсированный артефакт вышел настолько целостным: три эксперта (joint recovery, browse, InfBench) почти один в один соответствуют двум семействам оценок, заявленным в статье, — long-context QA и deep search.
Чему на самом деле учит RL
Статья, лежащая в основе чекпойнта — ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL (arXiv 2608.28476) — утверждает, что модели, которых до сих пор обучали редактировать собственный контекст, имеют три общие слабости, и фреймворк создан, чтобы устранить все три сразу.
• Более широкий набор инструментов. Помимо обычных операций поиска, удаления и обобщения, ContextPilot предоставляет агенту планирование, структурированную долговременную память (запись, обновление и чтение заметок), поиск по индексу и мягкую выгрузку контекста — откладывание контекста, который в данный момент не нужен, чтобы позже его можно было извлечь, а не удалять и восстанавливать заново.
• Частичный прогон с учетом контекста. Не каждое изменение контекста одинаково важно, и исследование RL тратится впустую, когда тривиальное удаление обрабатывается так же, как решение, меняющее всю траекторию. Метод использует вариацию контекста и энтропии, чтобы находить критические решения редактирования, и сосредоточивает выборку ветвей именно на них.
• Тонкозернистое распределение вклада. Вместо того чтобы присваивать каждому промежуточному изменению контекста финальную награду на уровне всей траектории, он оценивает преимущества на уровне действий по всем ветвящимся траекториям, проходящим через каждое действие редактирования, — так модель узнаёт, какие конкретные правки действительно помогли.
Эти три компонента и есть вклад. Чекпойнт — это лишь их воплощение на базе Qwen3-8B, поэтому семейство может охватывать три разные базы и оставаться одним проектом.
Бенчмарк заявляет, честно помеченный.

Табло выше — это сводка того, что заявляет сам репозиторий: единственные цифры на нём — это факты о конфигурации и даты, которые фиксирует репозиторий, а не показатели производительности. ContextPilot позиционируется для двух семейств задач: ответы на вопросы по длинному контексту на InfBench, NovelQA и LongMemEval, а также глубокий поиск на BrowseComp+ — более сложном преемнике BrowseComp, требующем реального просмотра веб-страниц. В статье сообщается о более высокой производительности с более компактным рабочим контекстом по сравнению с базовыми моделями на нескольких базовых моделях. Это утверждения авторов, сообщённые вендором и не воспроизведённые независимо; в карточке модели нет цифр, нет независимых оценок, и нет записи в лидерборде для этой контрольной точки нигде по состоянию на 2026-08-31.

Страница arXiv для 2608.28476 — самый полный публичный источник на сегодняшний день: статья была подана 28 августа 2026 года, уже с принятием в основную программу EMNLP 2026, и содержит аннотацию, цитируемую на протяжении всего этого материала.
Только для исследований, намеренно
Лицензия — это та часть, которая должна определять большинство решений, и она непростая. Опубликованные веса ограничены научными исследованиями и разработками — добавленный Раздел 0 полностью исключает коммерческое и производственное использование. Базовая модель Qwen/Qwen3-8B имеет лицензию Apache 2.0 и полностью пригодна для использования в продуктах; ограничение принадлежит самой Tencent и применяется к этой дообученной версии. Если ваш проект — опубликованная статья, диссертация или оценочное исследование, это приемлемо. Если это продукт — то это стоп уже сегодня, а не формальность, которую можно пропустить.
Что на самом деле нужно, чтобы запустить это
Даже для исследовательского использования закладывайте бюджет на полноценное развертывание, поскольку чекпоинт нельзя использовать как готовое решение. Руководство по инференсу требует Elasticsearch для инструментов поиска, OpenAI-совместимый эндпоинт-судью для оценок LongMemEval и BrowseComp+, vLLM для обслуживания чекпоинта и подготовки датасетов: ответы NovelQA требуют отдельного запроса на доступ, а BrowseComp+ поставляется в обфусцированном виде и должен быть расшифрован локально. Для обучения потребуется verl, скрипты запуска для 8B и 14B прилагаются. Это пайплайн исследовательского уровня, что соответствует лицензии.
Для контраста, в продакшене путь к агенту с длинным горизонтом по-прежнему пролегает через хостируемую модель с длинным контекстом за одним API. OrcaRouter маршрутизирует 200+ моделей через один ключ по прайс-листу провайдера с нулевой наценкой и автоматическим фейловером, поэтому снижение цены вендором доходит до нас в тот же день, когда оно появляется у вендора, — и сравнение исследовательского чекпойнта вроде ContextPilot-8B с устоявшимися хостируемыми моделями стоит изменения конфигурации, а не нового контракта. (Для ясности: мы не хостим ContextPilot-8B, и его лицензия на сегодняшний день исключает его использование в коммерческом роутере.)
Что пока неизвестно
По состоянию на 2026-08-31 открытыми остаются следующие вопросы: опубликует ли Tencent когда-либо официальное заявление; воспроизведут ли независимые группы результаты статьи на InfBench, NovelQA, LongMemEval или BrowseComp+; подтвердятся ли показатели по каждой базовой модели из полной версии статьи; и последует ли за исследовательской лицензией коммерческая. Единственное, что уже точно установлено, — это дата публикации, и всего через четыре дня после выхода каждый из этих вопросов остаётся по-настоящему актуальным.
Суть
ContextPilot-8B — это чекпойнт Qwen3-8B из самого интересного тихого релиза агента за месяц: слияние векторов задач трёх SFT-специалистов, которое обучает агента управлять собственным контекстом и подкреплено статьёй EMNLP 2026. Исследователям, работающим над агентами с длинным горизонтом, стоит прочитать рецепт слияния и инструкции по оценке, прежде чем принимать какие-либо решения. Продуктовые команды могут остановиться на лицензии. История прямо сейчас — это тишина — и то, что с ней сделают следующие две недели независимого тестирования.
