Титульная карточка для сравнения «InternLumina-U2 против Tencent UI-Mate-27B» с подзаголовком «Десктопный агент, который можно запустить уже сейчас, против визуальной модели, о которой можно только читать» и тремя чипами со статистикой: «UI-Mate-27B: уже управляет рабочим столом», «InternLumina-U2: унифицированное зрение, веса не опубликованы», «Обе — Apache-2.0, обе не проверены». В правом нижнем углу — логотип OrcaRouter.
Guides & Insights

InternLumina-U2 против Tencent UI-Mate-27B: десктопный агент, который можно запустить уже сейчас, против унифицированной модели зрения, о которой можно только читать

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Tencent UI-Mate-27B и InternLumina-U2 — это два незаметных релиза под Apache-2.0 из китайских лабораторий, опубликованных с разницей в две недели, и они не конкуренты — именно поэтому их стоит сравнивать. Tencent UI-Mate-27B — это десктоп-агент, выпущенный с открытыми весами 14 августа 2026 года: он следит за экраном и генерирует действия мыши и клавиатуры. InternLumina-U2, опубликованная Шанхайской лабораторией искусственного интеллекта 1 сентября 2026 года в виде кода для инференса, претендует на роль унифицированной модели зрения: она утверждает, что понимает изображения, видео и 3D, а также генерирует и редактирует изображения. Первый действует на основе того, что видит; вторая, когда наконец появятся её веса, будет говорить и рисовать о том, что видит. Если ваша задача — работа с десктопом, только одна из этих двух моделей может справиться с этим сегодня — и это не та, у которой более навороченная архитектура.

Агент, который действует: Tencent UI-Mate-27B

UI-Mate-27B — это базовый GUI-агент с открытыми весами и 27 миллиардами параметров от мультимодальной агентной команды HY Frontier из Tencent, дообученный на базе Qwen3.6-27B. Он наблюдает за живыми скриншотами, рассуждает о текущем состоянии экрана и выдаёт структурированные действия клавиатуры и мыши в нормализованном координатном пространстве — результат модели, обученной работать с реальным рабочим столом, а не разговаривать о нём. Его отличительная особенность — исполнение на основе демонстрации: покажите ему процесс один раз, и он адаптирует записанную демонстрацию к текущей задаче, считая живой скриншот авторитетным источником, когда интерфейс отличается от записанного. Заявленные Tencent ключевые показатели — OSWorld-Verified 77.0 и WindowsAgentArena 66.2 — цифры, которые возглавили бы эти рейтинги 2026 года при независимом воспроизведении, — наряду с рядом значений OSWorkerBench. Веса настоящие и доступны для скачивания: двенадцать шардов safetensors на Hugging Face, разворачиваемые самостоятельно через vLLM или SGLang на паре GPU. В карточке модели есть важная оговорка: это агентный чекпоинт, а не самостоятельная визуально-диалоговая модель — отправьте ей запрос «опиши это изображение», и вы используете её неправильно.

Обещанные глаза: InternLumina-U2

InternLumina-U2 — это совершенно другой вид. Это разреженная диффузионная модель со смесью экспертов на 16 млрд параметров (1 млрд активных), которую лаборатория задумала как единую модель для универсального визуального понимания, генерации изображений и редактирования изображений — полностью дискретная архитектура с восемью кодовыми книгами, где единый базовый блок (backbone) одновременно считывает изображение, диаграмму, видео или 3D-объект и записывает новые пиксели. Если ваш мысленный образ — GUI-агент, то InternLumina-U2 — противоположный полюс: она не хочет ничего кликать, она хочет всё понимать и рисовать по запросу. Её опубликованный вид по состоянию на 1 сентября 2026 года — это инференс-код и архитектура: шесть точек входа для задач в репозитории GitHub, страница проекта с предварительной таблицей бенчмарков и пустая заглушка на Hugging Face — а её веса, обучающий код и технический отчёт всё ещё помечены как «скоро». Никто не может её запустить. Разрыв между двумя моделями — не в качестве; он в существовании.

Табло

Показатели UI-Mate-27B предоставлены Tencent и не воспроизводились независимо; показатели InternLumina-U2 — лабораторные, предварительные и частичные. Каждая строка содержит указание на источник.

• Задача — Tencent UI-Mate-27B: управление рабочим столом — чтение живых скриншотов, эмуляция действий мыши и клавиатуры. InternLumina-U2: восприятие и создание — понимание изображений/видео/3D, генерация и редактирование изображений.

• Веса — Tencent UI-Mate-27B: публично доступны с 14 августа 2026, двенадцать шардов safetensors, Apache-2.0. InternLumina-U2: не публичны — пустой репозиторий Hugging Face, веса «скоро появятся».

• Масштаб — 27B плотная модель, дообученная на основе Qwen3.6-27B, против разреженной диффузионной MoE-модели с 16B всего / 1B активных параметров.

• Выход — Tencent UI-Mate-27B: структурированные действия, совместимые с pyautogui, в нормализованном координатном пространстве. InternLumina-U2: заявляет о поддержке текста, генерации изображений по тексту до 1024×1024 и редактировании изображений по инструкциям.

• Ключевые цифры — Tencent UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2, прирост на OSWorkerBench от демонстраций (все данные — Tencent). InternLumina-U2: ChartQA 86.52, GenEval 0.81, MathVision 33.22 (по данным лаборатории, предварительно).

• Оговорка о происхождении — Tencent UI-Mate-27B: сама карточка предупреждает, что это чекпоинт агента, а не самостоятельная визуально-диалоговая модель. InternLumina-U2: страница проекта называет собственные результаты «предварительными, частичными».

• Реальность развертывания — Tencent UI-Mate-27B: можно развернуть локально через vLLM или SGLang на ~2 GPU; ни один облачный сервис инференса сейчас его не развертывает. InternLumina-U2: его невозможно обслужить — выпущенный драйвер ожидает контрольные точки, которых нет в репозитории.

A comparison scoreboard for InternLumina-U2 and Tencent UI-Mate-27B: InternLumina-U2 with Job perceive & create visuals, Weights not public 'soon', Output text/images/edits, Headline ChartQA 86.5 (reported), Caveat untestable no weights, Serving no one can run it; Tencent UI-Mate-27B with Job operate a desktop, Weights public since Aug 14 2026, Output mouse & keyboard actions, Headline OSWorld 77.0 WAA 66.2, Caveat agent not visual chat, Serving self-host vLLM ~2 GPUs, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

Два разных вкуса непроверенного

Обе модели непроверенные, однако в каждом из двух случаев это слово означает разное. Tencent UI-Mate-27B непроверена в обычном для новой модели смысле: её громкие показатели — собственные цифры вендора, независимо их никто не перепроверял, а число загрузок ничтожно по сравнению с заявленными результатами. Это обычная ситуация для чекпоинта, который, на первый взгляд, появился лишь четыре дня назад и с тех пор оброс скромным сообществом. Но её непроверенность проверяема: раз веса существуют, показатели 66,2 и 77,0 на этой неделе может проверить любой, у кого есть две видеокарты и тестовая среда Windows, а утверждения, подкреплённые демонстрациями, можно воспроизвести или опровергнуть на реальных задачах. InternLumina-U2 непроверена в более строгом смысле: она непроверяема. Её архитектура публична и доступна для чтения, а её цифры — нет: не существует артефакта, который мог бы их подтвердить, а собственная неполная таблица лаборатории уже показывает, что она отстаёт от названного конкурента как минимум на одном генеративном бенчмарке. Цифра вендора, стоящая за загружаемым файлом, — это утверждение, ожидающее рефери. Цифра вендора, стоящая за дорожной картой, — это надежда.

A screenshot of the Hugging Face model page for tencent/UI-Mate-27B (captured August 27 2026), showing the Qwen3.6-27B base model, the vendor-reported OSWorld and WindowsAgentArena benchmark tags, and the note that no inference provider currently deploys the model.

Карточка модели tencent/UI-Mate-27B на Hugging Face, зафиксированная 27 августа 2026 года — базовая модель Qwen3.6-27B, указанные вендором показатели OSWorld и WindowsAgentArena, а также примечание о том, что ни один инференс-провайдер в настоящее время её не разворачивает.

Естественное разделение труда: агент и его глаза

Сопоставив их бок о бок, можно увидеть, как две модели вместе очерчивают контур надёжного автоматизированного конвейера. Сложная проблема с GUI-агентами — не типичный случай; это когда агент тихо делает что-то не то на неожиданном состоянии экрана, и никто этого не замечает. Именно для этого и нужна дешёвая, надёжная модель зрения — проверять состояние экрана до и после каждого действия, подтверждать, что появившийся диалог — тот самый, который, по мнению агента, появился, и останавливать цикл, когда реальность и модель реальности в голове агента расходятся. Tencent UI-Mate-27B — исполнитель; унифицированная модель зрения, какой заявляет себя InternLumina-U2, — естественный верификатор, способный читать те же скриншоты, на основе которых действует агент. Когда — и только когда — веса InternLumina-U2 действительно появятся в открытом доступе, а её заявления о понимании пройдут независимое тестирование, тогда она сможет занять эту роль — работать вместе с агентом, а не против него. Эти две модели не соперники за одно место; это две половины одной задачи.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page and the per-task inference scripts, including the image-understanding entry point that would underpin a screen-state verifier.

Репозиторий InternLM/InternLumina-U2 на GitHub, снимок от 2 сентября 2026 года — страница репозитория с описанием скриптов инференса для каждой задачи, включая точку входа для понимания изображений, на основе которой можно было бы построить верификатор состояния экрана; весов, которые позволили бы запустить модель, в дереве репозитория нет.

Что даёт маршрутизирующий слой стеку «агент + зрение»

Ни одна из моделей не размещена на OrcaRouter, и мы не будем утверждать обратное: у Tencent UI-Mate-27B нет ни одного хостинг-провайдера, а у InternLumina-U2 нет весов, которые какой-либо провайдер мог бы разместить у себя. Применимый паттерн маршрутизации — это ровно тот, что соответствует данной архитектуре: агент, который действует, и модель компьютерного зрения, которая проверяет, объединённые так, чтобы дорогой или рискованный шаг выполнялся только после дешёвого и надёжного. DSL маршрутизации выражает это как единый логический вызов — действие, затем проверка, затем продолжение или остановка — вместо специальной связки между двумя провайдерами моделей, а автоматическое аварийное переключение закрывает реалистичный сценарий отказа: GUI-агент вроде UI-Mate-27B — это как раз та непроверенная контрольная точка, которую сначала прогоняют на тестовом пути, и в тот момент, когда новая модель начинает сбоить, вызов переходит на проверенную модель. Один API для более чем 200 размещённых моделей, цена провайдера по прайс-листу передаётся с нулевой наценкой, а непроверенные части стека остаются за защитными барьерами, пока не заслужат вашего доверия.

Суть

Если вы создаете что-то, что управляет рабочим столом, Tencent UI-Mate-27B — единственная из этих двух, которая существует в пригодном для использования виде: она уже сегодня может работать на ваших собственных GPU, и её впечатляющие, но пока не воспроизведённые результаты вы можете проверить сами. Если вы создаете что-то, что требует от модели понимания и зарисовки того, что она видит, InternLumina-U2 — это перспективная архитектура, ожидающая свои веса: её стоит прочитать уже сейчас, но как зависимость она ничего не стоит, пока не появятся safetensors. Следите за обеими до того дня, когда разделение труда станет возможным: актер на вашем рабочем столе, проверенные глаза, наблюдающие за ним, и маршрутизирующий слой, который держит их честными.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube