
Tencent UI-Mate-27B: Тихий GUI-агент с открытыми весами, занимающий топ-позицию в WindowsAgentArena
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
14 августа 2026 года Tencent HY Frontier Multimodal Agent Team загрузила три чекпойнта на Hugging Face в организацию tencent/ — UI-Mate-27B, меньшую модель UI-Mate-9B и управляемую демонстрациями UI-Mate-democua-27B. Через четыре дня так и нет никаких анонсов: ни поста о запуске, ни пресс-релиза, ни твита о продукте. Вместо этого выпущенный материал необычно полон для тихого релиза: страница проекта, GitHub-репозиторий с рабочим инструментарием и статья на arXiv, поданная два дня назад, в которой более крупная модель названа новой открытой моделью уровня SOTA в управлении графическим интерфейсом рабочего стола.
Всё в этом материале взято из карточек моделей, репозитория GitHub, страницы проекта и той статьи — пока ничего из этого не было независимо воспроизведено. На момент написания у чекпоинтов ноль загрузок на Hugging Face, а значит, мы, вероятно, одни из первых людей за пределами Tencent, кто воспринял их всерьёз на бумаге. Вот что действительно можно узнать из репозиториев, а что остаётся неподтверждённым, пока кто-нибудь ещё не запустит это.
Содержание
• Что было выпущено, а что не было анонсировано
• Что такое UI-Mate-27B на самом деле
• Отличительная особенность: выполнение на основе демонстрации
• Цифры — все они предоставлены вендором
• Где бы находились эти числа — если они остаются в силе
• Как это запустить
• Стек вокруг нового GUI-агента
• Что посмотреть дальше
• Часто задаваемые вопросы
Что уже выпущено, а что еще не анонсировано
Tencent опубликовал UI-Mate-27B (27 миллиардов параметров, Apache-2.0, safetensors в BF16) 14 августа 2026 года, наряду с родственной моделью на 9B и демонстрационным чекпойнтом UI-Mate-democua-27B. Оба чекпойнта на 27B построены на основе Qwen3.6-27B — сама по себе это мультимодальная модель с лицензией Apache-2.0, выпущенная в апреле 2026 года, — что означает, что весь стек, от базовой модели до тонкой настройки, можно использовать в коммерческих целях. В репозиториях стоят отметки о последнем изменении на этой неделе — демонстрационный чекпойнт изменялся в последний раз сегодня, — так что Tencent активно работает над ними.

Что уже известно публично:
• Веса UI-Mate-27B, UI-Mate-9B и UI-Mate-democua-27B на Hugging Face, каждый с карточкой модели, таблицами с результатами оценки и рецептом для запуска.
• Страница проекта на ui-mate.github.io с демонстрационным видео, руководством по использованию и приложением для macOS на Apple Silicon (DMG v0.2.4).
• Репозиторий GitHub (github.com/Tencent/UI-Mate), содержащий официальный промпт, парсер ответов и интерактивную обвязку — в карточке явно указано, что это «агентный чекпоинт, а не самостоятельная модель визуального чата», и для любых реальных задач рекомендуется использовать обвязку.
• Препринт arXiv (2608.15930), поданный 16 августа, под названием «UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations».
Что пока не публично: сама Tencent ничего не сказала — это в первую очередь публикация в репозитории, а не запуск продукта. Вариант, управляемый демонстрациями, который на странице проекта значился как ещё не публичный, теперь имеет доступные веса на Hugging Face: репозиторий tencent/UI-Mate-democua-27B, созданный в ходе той же загрузки от 14 августа, явно помечен как контрольная точка семейства, управляемая демонстрациями, — это отдельная модель, а не переименование 27B. Размещённого API по-прежнему нет нигде. Это важно: единственный способ запустить UI-Mate сегодня — скачать веса и развернуть их самостоятельно.
Что такое UI-Mate-27B на самом деле
UI-Mate-27B — это фундаментальный GUI-агент для «долгосрочной работы в приложениях и операционных системах». Он наблюдает за скриншотами в реальном времени, анализирует видимое состояние и генерирует структурированные действия клавиатуры и мыши для нативного взаимодействия с рабочим столом. Обучение представляет собой контролируемую тонкую настройку с последующим онлайн-обучением с подкреплением в исполняемых GUI-средах — модель училась, фактически управляя рабочими столами, а не только на основе статических скриншотов.
Пространство действий — это то, что будет важно разработчикам: мышь, клавиатура, прокрутка, ожидание, взаимодействие с пользователем и завершение задачи, с результатами, совместимыми с pyautogui. Модель рассуждает в нормализованном координатном пространстве 1000×1000, а эталонный агент пересчитывает её предсказания обратно в реальное разрешение скриншота, поэтому действия корректно работают при различиях в масштабировании дисплея между машинами. В собственном README модели рекомендуется запускать её через vLLM за конечной точкой, совместимой с OpenAI.
Отличительная особенность: выполнение на основе демонстраций
Большинство GUI-агентов принимают один вход: инструкцию. UI-Mate принимает второй, который действительно редко встречается в открытом чекпоинте, — демонстрацию. «Покажите рабочий процесс один раз. Пусть агент адаптирует его к текущей задаче», — как говорится на странице проекта.
Этот механизм — не видео-в-контексте и не фиксированный сценарий действий. Демонстрация записывает скриншоты непосредственно до и после каждого действия клавиатуры или указателя, а затем конвейер нормализует трассу в согласованное представление в виде пар «действие-кадр», аннотирует её наблюдениями, намерением, действиями и подтверждающими свидетельствами и сегментирует её на именованные подзадачи с критериями завершения. На этапе инференса это превращается в компактный рабочий процесс, внедряемый для активной подзадачи, — но живой скриншот остаётся главным источником истины на всём протяжении, поэтому, когда состояние приложения отличается от демонстрации, модель перепланирует, а не воспроизводит запись.
Tencent сделал чекпоинт, лежащий в основе этого пайплайна, своей публичной моделью: карточка UI-Mate-democua-27B сопоставляет результаты режима «только инструкция» и режима «с одним демонстрационным примером» на одних и тех же эвалах, а её схема инструментов добавляет действие subtask_complete — тот самый механизм, который стоит за именованными подзадачами. На подмножестве OSWorkerBench self-demo один демонстрационный пример поднимает строгий показатель успеха с 17.17 до 35.35, а прогресс — с 67.85 до 81.14; на подмножестве OSWorld прогресс вырастает с 40.27 до 65.75; на наборе эвалов GameDev средний балл поднимается с 76.76 до 81.15, при этом средняя длина траектории сокращается с 303.6 до 253.1 шагов — демонстрация не только улучшает выполнение задачи, но и укорачивает её. В карточке сообщается, что демонстрация улучшила результаты 28 из 33 задач self-demo и решила четыре задачи, которые без подсказки дают ноль. Оговорка здесь та же, что проходит через всю эту статью: это собственные парные эвалы команды, усреднённые по трём–пяти прогонам, и никто их не воспроизводил.
Цифры — все они указаны вендором.
Выполнение только по инструкции, прямо из карточки модели:
• Средний балл OSWorld-Verified — 77.0
• Средний балл WindowsAgentArena — 66.2
• OSWorkerBench строгий успех — 41.00
• Прогресс OSWorkerBench — 76.86

OSWorkerBench сам по себе является одним из трёх вкладов в статье: новый бенчмарк из 100 долгосрочных офисных задач в 41 приложении, с подмножествами из 33 self-demo и 45 variant-demo. Это новая оценка, поэтому нет предыдущих работ, с которыми можно сравнить эти два показателя. По сравнению со своей собственной базовой моделью, UI-Mate-27B, как утверждается, превосходит Qwen3.6-27B на 17,7 пункта строгого успеха и 24,5 пункта прогресса в OSWorkerBench — что является самым чистым показателем «яблоки к яблокам» во всём релизе, поскольку обе модели проходят через один и тот же конвейер.
Все цифры выше — собственная оценка команды. Независимых оценок пока нет, сторонних повторных прогонов нет, а при нулевом количестве загрузок нет и воспроизведений сообществом. Относитесь к каждому числу здесь как к утверждению, а не как к факту.
Где бы эти числа находились — если они держатся.
WindowsAgentArena — вот это действительно была бы громкая новость. Лучшие публично заявленные результаты WAA в начале 2026 года группировались около 61.0 (модульная система под названием VLAA-GUI, апрель 2026); открытая по весам EvoCUA-32B от Meituan находилась на уровне 56.5, а закрытая UI-TARS-2 от ByteDance — в диапазоне низких-средних 50-х на той же таблице. Результат 66.2 на собственном eval UI-Mate-27B поставил бы его выше всего, что было заявлено по этому бенчмарку в этом году — и открытого, и закрытого. Это сильное утверждение, и оно требует независимого повторного прогона.
OSWorld-Verified с результатом 77.0 — это сильный показатель, но не новый рекорд среди моделей с открытыми весами на публичном лидерборде. На срезе лидерборда OSWorld-Verified начала августа 2026 года открытая модель Holo3-35B-A3B указана с результатом 82.6, а выше неё находятся несколько передовых закрытых моделей (Qwen3.8 Max — 86.1, Claude Mythos 5 и Claude Fable 5 — 85.0, Claude Opus 4.8 — 83.4). Таким образом, фраза «state of the art» в статье — это утверждение о собственной методике оценки, а не установленный факт: разные харнессы, парсеры действий и дрейф самоотчётов делают сравнение 77.0 против 82.6 вопросом, который может решить только независимый повторный прогон. Для контекста: открытая модель на 27B с результатом 77.0 оказалась бы выше базового уровня эксперта-человека (~72.4) и выше нескольких более крупных передовых систем на том же лидерборде, включая Claude Opus 4.6 (72.7) и Kimi K2.6 (73.1).
Tencent не новичок в этой области — он выпустил POINTS-GUI-G, модель для GUI-grounding с 8B параметрами, в феврале 2026 года, запустил ассистента Marvis OS в мае, а в июне внёс вклад в проект GUICrafter по использованию компьютера. UI-Mate — это отдельная линейка, предназначенная специально для полного управления рабочим столом, и это первый GUI-агент Tencent, который выпускается как открытая фундаментальная модель, а не как компонент для привязки (grounding) или продукт.
Как это запустить
Модель предназначена для vLLM, и в карточке модели указана точная команда — `vllm serve tencent/UI-Mate-27B` с размером тензорного параллелизма 2 и совместимым с OpenAI шаблоном чата. Одна практическая деталь бросается в глаза: агент по умолчанию сохраняет в контексте пять скриншотов, поэтому сервер должен допускать как минимум шесть изображений на запрос, поскольку новый скриншот поступает до того, как самый старый будет свёрнут. Рекомендуемый флаг — `--limit-mm-per-prompt` с шестью изображениями и нулевым видео. Демонстрационно-управляемая контрольная точка обслуживается так же — в её карточке указаны vLLM и SGLang за конечной точкой, совместимой с OpenAI.

После запуска Python-класс агента (UIMateAgent) принимает скриншот и инструкцию и возвращает ответ вместе со структурированными действиями, пересчитывая координаты 1000×1000 обратно в ваше разрешение. На странице проекта также доступно приложение для macOS на Apple Silicon для режима с демонстрационной подсказкой — это самый простой способ опробовать рабочий процесс «покажи один раз», не создавая обвязку самостоятельно. Весь проект лицензирован под Apache-2.0, так что локальное использование, дообучение и коммерческая интеграция полностью разрешены.
Любой инструкции «как запустить» для агента, использующего компьютер, должны сопутствовать два предупреждения, и оба взяты из самой карточки модели. Используйте изолированные или одноразовые среды. Требуйте подтверждения человеком перед любыми чувствительными действиями, отслеживайте траекторию и не считайте сообщение модели об успехе доказательством того, что намеченный результат действительно был достигнут. GUI-агенты кликают не туда, а промпт-инъекция через содержимое экрана — это реальная модель угроз, а не гипотеза.
Стек вокруг нового GUI-агента
Ни один из чекпоинтов UI-Mate пока нет на OrcaRouter — семейству всего несколько дней, ноль загрузок, и его базовая модель Qwen3.6-27B тоже отсутствует. Хостируемого API нет, так что если хотите запустить одну из них на этой неделе, придётся самим разворачивать vLLM. Для лаборатории это нормально, но для продакшена такая форма не подходит.
Продакшен-пайплайн использования компьютера редко сводится к {{1}}одной контрольной точке{{/1}}. Это модель-планировщик, определяющая следующее намерение, модель привязки или компьютерного зрения, читающая экран, сам GUI-агент и дешёвый запасной вариант при сбое подшага. И все эти компоненты — {{2}}серверные модели{{/2}}, даже когда GUI-агент локальный. Именно для такого сочетания и предназначен {{3}}слой маршрутизации{{/3}}: один API для 200+ размещённых моделей, цена по прайс-листу провайдера передаётся с {{4}}нулевой наценкой{{/4}}, и {{5}}автоматический фейловер{{/5}}, чтобы временный сбой одного провайдера не останавливал длительный прогон агента. DSL маршрутизации также позволяет {{6}}объединять несколько моделей в один вызов{{/6}} — планировщик в начале, дешёвый верификатор в конце — без необходимости вручную связывать провайдеров в своём коде. {{7}}Честный итог{{/7}} прост: агент, управляющий рабочим столом, работает локально, но модели, которые решают, что делать вокруг него, {{8}}маршрутизируемы{{/8}}, а безопасное опробование совершенно новых непроверенных контрольных точек — именно то, для чего нужен фейловер.
Что посмотреть дальше
Четыре вещи изменили бы картину для UI-Mate-27B, в порядке убывания важности:
• Независимый повторный прогон OSWorld-Verified и WindowsAgentArena. В частности, показатель WAA — это либо большое достижение, либо артефакт оценочного стенда, и только внешняя оценка может это определить.
• Официальный технический отчёт. Текущая ссылка является заглушкой, и полная статья, предположительно, раскроет детали механизма обработки данных, которые в аннотации лишь намечены.
• Собственное объявление Tencent. Подобный релиз в репозиторий в первую очередь обычно предшествует чему-то — интеграции с Marvis, хостинговому предложению или более широкому продвижению открытых моделей.
• Хостируемый API. Веса всех трёх контрольных точек теперь публичны, но нигде ничего не развёрнуто — ни эндпоинта Tencent, ни стороннего провайдера инференса, — поэтому самостоятельный хостинг остаётся единственным вариантом, и изменить это может только анонс Tencent или подключение провайдера.
Часто задаваемые вопросы
Что такое Tencent UI-Mate-27B?
UI-Mate-27B — это базовый GUI-агент с 27 миллиардами параметров под лицензией Apache-2.0 от команды HY Frontier Multimodal Agent Team из Tencent, дообученный на основе Qwen3.6-27B. Он анализирует живые скриншоты рабочего стола, рассуждает над ними и выдаёт совместимые с pyautogui действия мыши и клавиатуры. Он был тихо выпущен на Hugging Face 14 августа 2026 года — вместе с собратом на 9B и управляемым демонстрациями UI-Mate-democua-27B — без анонса, и его бенчмарки пока полностью основаны на данных вендора.
Чем выполнение под руководством демонстрации отличается от воспроизведения сценария?
Вместо выполнения записанного макроса UI-Mate рассматривает демонстрацию как снабжённый подписями рабочий процесс, структурированный по подзадачам и внедряемый в качестве руководства. Живой скриншот остаётся основным источником истины, поэтому когда макет, содержимое или состояние приложения отличается от показанного, модель перепланирует действия, а не воспроизводит устаревшие координаты. Именно этот механизм лежит в основе заявленного скачка с 17,2 до 35,4 строгого успеха на подмножестве самодемонстраций — но это всё ещё заявление вендора, пока кто-то не воспроизведёт результат.
Действительно ли UI-Mate-27B является передовым решением среди открытых GUI-агентов?
Это полностью зависит от настройки оценивания. Его результат 66.2 в WindowsAgentArena превзошёл бы лучшие публично зарегистрированные результаты WAA начала 2026 года, но его же 77.0 в OSWorld-Verified уступает показателю 82.6 модели с открытыми весами Holo3-35B-A3B в публичной таблице лидеров. В статье его называют новым эталоном среди моделей с открытыми весами; единственный способ узнать это наверняка — независимый повторный прогон на единой платформе.
Могу ли я запустить UI-Mate-27B сегодня?
Да, если вы обслуживаете её сами: скачайте веса с Hugging Face — общий чекпойнт 27B, 9B или управляемый демонстрациями UI-Mate-democua-27B — запустите команду vLLM из карточки модели (размер тензорного параллелизма — 2, шесть изображений на запрос) и управляйте ей через Python-агента или приложение для macOS. Хостингованного API нет, и ни один из чекпойнтов пока не находится на OrcaRouter — что для таких новых и непроверенных моделей является разумной причиной держать их в изолированной среде.
Правильное прочтение UI-Mate-27B — не «победитель», а «за ним стоит понаблюдать». Открытая модель на 27B, заявляющая о лидерстве WAA и поставляющая one-shot демонстрационный workflow, — это значимый показатель в год, когда open-weight агенты для управления компьютером прошли путь от шутки до почти достижимого фронтира. Теперь, когда чекпоинт, обученный на демонстрациях, стал публичными весами, а не заглушкой на странице проекта, workflow «показать один раз» действительно можно запустить. Tencent и раньше был осторожен с релизами, и этот выглядит как опубликованная незавершённая работа. Запустите его в песочнице, перезапустите бенчмарки и продолжайте следить за анонсами — самое интересное в этой истории ещё впереди.
