Сгенерированная титульная карточка в фирменном стиле OrcaRouter с надписью «PixelUMM vs UI-Mate-27B», с четырьмя статистическими плитками: «77.0» (заявленный средний балл UI-Mate-27B по OSWorld-Verified), «66.2» (его средний балл по WindowsAgentArena), «нет» (пространство действий PixelUMM) и «Apache-2.0» (лицензия UI-Mate-27B на код и веса, в отличие от некоммерческого чекпоинта PixelUMM). Нижняя строка гласит: «Оценки агентов по данным Tencent; показатели PixelUMM — из его препринта. Независимый повторный запуск не проводился.». Логотип OrcaRouter вкомпонован в полосу с отступами в правом нижнем углу.
Guides & Insights

PixelUMM против UI-Mate-27B: одна модель рисует то, что видит, другая — кликает по этому

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Tencent UI-Mate-27B и NVIDIA PixelUMM выглядят сопоставимо в спецификации — 27 миллиардов параметров против примерно 15,2 миллиарда, обе доступны для скачивания, обе построены на базе Qwen — и они совершенно несопоставимы. UI-Mate-27B — это фундаментальный GUI-агент: он наблюдает за скриншотами в реальном времени, планирует, исходя из того, что сейчас на экране, и выдаёт структурированные действия мышью и клавиатурой для настоящего рабочего стола. PixelUMM — это унифицированная мультимодальная модель без энкодера, которая читает изображения и видео в необработанном пиксельном пространстве и генерирует изображения и видео из текста — она воспринимает и создаёт, но у неё нет пространства действий, нет курсора и нет способа прикоснуться к экрану. Первый воздействует на мир. Второй описывает и изображает его. Всё нижеследующее следует из этого разделения, а разрыв в лицензировании между ними — второе, что вам нужно знать.

Обе лаборатории сообщают собственные цифры, и ни у одной нет независимой оценки. Обе обнародовали их тихо — и именно в способе обнародования сходство на самом деле заканчивается.

Деятель и воспринимающий

UI-Mate-27B выполняет задачу, исходя только из инструкции на естественном языке и живых скриншотов. Он рассуждает о видимом состоянии, перепланирует по мере изменения интерфейса и выдаёт рассуждения, краткое описание действия и структурированные вызовы инструментов компьютерного использования для мыши, клавиатуры, прокрутки, ожидания, взаимодействия с пользователем и завершения задачи. Его отличительная особенность — управляемое демонстрацией выполнение: покажите ему рабочий процесс один раз, и он адаптирует записанную демонстрацию к текущей задаче, считая текущий скриншот определяющим, когда интерфейс изменился. Он дообучен на основе Qwen3.6-27B с помощью управляемого обучения с учителем, за которым следует онлайн-обучение с подкреплением в исполняемых средах GUI, и обслуживается через vLLM с интерфейсом, совместимым с OpenAI.

• Заявленные результаты тестов — средний показатель OSWorld-Verified 77,0, средний WindowsAgentArena 66,2, строгий показатель успеха OSWorkerBench 41,00 и прогресс 76,86. Все данные заявлены Tencent и не воспроизведены.

• Пространство действий — мышь, клавиатура, прокрутка, ожидание, взаимодействие с пользователем, завершение задачи, в нормализованном координатном пространстве со структурированными вызовами, совместимыми с pyautogui.

• Аппаратная реальность — плотная модель на 27B, обслуживаемая с тензорным параллелизмом на двух GPU в собственном руководстве Tencent по быстрому запуску, под лицензией Apache-2.0.

• Важная оговорка в самой карточке модели — UI-Mate-27B — это агентский чекпоинт, а не самостоятельная модель для визуального чата. Tencent рекомендует использовать официальные промпт, парсер ответов и среду взаимодействия из его репозитория. Дайте ему запрос «опиши это изображение» — и вы используете не тот инструмент.

PixelUMM занимает противоположный полюс. Вся его архитектура — это аргумент о представлении: никакого VAE, никакого визуального энкодера, изображения в виде патчей 16×16 пикселей, а видео — в виде 4-кадровых пространственно-временных тублетов, напрямую в Transformer только с декодером через однослойные линейные проекции, с архитектурой Mixture-of-Transformers, сочетающей общее внимание с параметрами, специфичными для задачи. Понимание — это авторегрессионный текст; генерация — это flow matching в пиксельном пространстве. Поставляются четыре контрольные точки, S8-F22-R05 как вариант по умолчанию, охватывающий текст-в-изображение, текст-в-видео при 96 кадрах и 24 кадрах в секунду, а также оба направления понимания.

A headless-browser capture of the Hugging Face model card for the Tencent UI-Mate-27B repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

Две модели выпуска — это наглядный пример контраста.

UI-Mate-27B появился на Hugging Face 14 августа 2026 года вместе с карточкой модели, препринтом arXiv под номером 2608.15930, страницей проекта, репозиторием GitHub и документированным рецептом обслуживания. С тех пор и до начала октября он набрал примерно 780 загрузок и 93 лайка — скромно, но это обычный релиз исследовательского агента, у которого все документы в порядке.

След PixelUMM иного рода. Репозиторий GitHub был создан 4 сентября 2026 года; препринт arXiv датирован 29 сентября; репозиторий Hugging Face был создан в 21:40 UTC 1 октября 2026 года, через несколько минут после финального коммита репозитория. Для него не появилось ни поста в блоге NVIDIA, ни пресс-релиза, ни треда о запуске. URL-путь самой страницы проекта по-прежнему выглядит как pixelumm-project-page-preview. На момент написания его количество загрузок было нулевым.

Усматривать в этом намерение — ошибка: лаборатория может опубликовать исследовательский артефакт, а запуск запланировать на потом. То, что можно знать, оказывается более узким и более полезным: у одной модели есть официальный путь обслуживания и десять недель загрузок; у другой — статья, репозиторий и вообще никаких заявлений от вендора.

A generated scoreboard card titled “PixelUMM vs UI-Mate-27B — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: role, backbone, headline benchmarks, action space, deployment and licence. UI-Mate-27B's column shows a foundation GUI agent, a Qwen3.6-27B fine-tune, OSWorld-Verified 77.0 with WindowsAgentArena 66.2, mouse, keyboard, scrolling, waiting and task-completion calls, 27B dense across roughly two GPUs under vLLM, and Apache-2.0; PixelUMM's column shows an encoder-free perceiver and generator, about 15.2B total on a Qwen3-8B backbone, MMMU 41.67 with GenEval 0.83 and VBench Part 1 quality 84.10, no action space, about 30 GB of distributed-checkpoint shards behind a hidden index, and a noncommercial checkpoint licence. A footer notes the agent scores are Tencent-reported and the generation scores are from the PixelUMM preprint, with no independent rerun of either.

Табло, которые не перекрываются

Нет ни одного бенчмарка, по которому отчитывались бы обе модели, — и в этом-то и суть: они решают не одну и ту же задачу.

• Агентное использование компьютера — UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2. PixelUMM: отсутствует пространство действий, поэтому оценка невозможна.

• Понимание изображений — UI-Mate-27B: использует скриншоты в качестве входных данных агента, не оценивается как универсальная VLM. PixelUMM: MMMU 41.67, AI2D 80.12, DocVQA 90.42, ChartQA 82.96, OCRBench 78.00.

• Видео — UI-Mate-27B: нет. PixelUMM: MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, LVBench 40.41.

• Генерация — UI-Mate-27B: нет. PixelUMM: GenEval 0.83 с рерайтером промптов, DPG-Bench 85.74, качество VBench Part 1 84.10.

• Стоимость развёртывания — UI-Mate-27B: плотная модель на 27B, размещённая примерно на двух GPU через vLLM, плюс официальный харнесс. PixelUMM: около 30 ГБ шардов распределённого чекпоинта, CUDA 13 с FlashAttention, собранным из исходников, guardrail-модель с ограниченным доступом для видеотракта и второе окружение Python для неё.

• Лицензия — UI-Mate-27B: Apache-2.0, код и веса. PixelUMM: код Apache-2.0, NVIDIA One-Way Noncommercial License на чекпоинт.

• Масштаб — 27B dense против примерно 15,2B всего, что представлено как «8B MoT» в собственных таблицах статьи PixelUMM.

Единственное действительно сопоставимое утверждение касается происхождения данных, и оно относится к обоим: каждое число выше принадлежит самому поставщику, ни одно не было повторно проверено за пределами лаборатории, которая его получила, а одна из двух моделей явно помечает свои собственные результаты как предварительные.

Создание с ними, и почему вы могли бы использовать оба

Эти две системы лучше сочетаются, чем конкурируют. Стеку автоматизации рабочих столов нужен UI-Mate-27B для слоя действий и нечто, способное рассуждать о том, что оно увидело; пайплайну контента или инспекции нужны чтение и генерация от PixelUMM, а курсор ему без надобности. Пересечение находится на границе восприятия, где привязка к скриншотам у UI-Mate-27B специфична для задачи, а у PixelUMM — универсальна: одни и те же пиксели, две совершенно разные задачи.

Когда вы запускаете несколько моделей друг против друга — агента против универсальной VLM или новый исследовательский чекпойнт против того, что уже используется в продакшене, — стоимость сравнения обычно заключается в интеграции, а не в инференсе: две формы API, две схемы аутентификации, два контракта. Именно эту проблему призван устранить слой маршрутизации, и именно здесь дизайн OrcaRouter оправдывает себя: один ключ для 200+ моделей, цены провайдеров из прайс-листа передаются без наценки (0%), автоматическое переключение при сбое между провайдерами, а также DSL маршрутизации и слияние моделей, позволяющие объединять несколько моделей в один вызов. Ни PixelUMM, ни UI-Mate-27B сегодня не доступны ни на одном хостинговом эндпоинте, и OrcaRouter не маршрутизирует ни один из них — так что речь идет о рабочем процессе, когда они будут доступны, а не о заявлении о доступности сейчас.

Какой для какой работы?

Если задача завершается щелчком, нажатием клавиши или заполненной формой, здесь есть только один кандидат — UI-Mate-27B. Он распространяется под Apache-2.0, у него есть статья на arXiv и официальный тестовый стенд, а его заявленные результаты OSWorld и WindowsAgentArena — это как раз тот тип утверждений, который может проверить любой, у кого есть два графических процессора и тестовый образ Windows или Ubuntu, — и именно поэтому их стоит проверять, а не принимать на веру.

Если задача завершается ответом или изображением, именно PixelUMM способен с этим справиться, и прежде всего это исследовательский артефакт. В его статье необычно честно говорится о собственных ограничениях: признаётся, что из-за различий в обучающих данных его сравнение в бенчмарках «не позволяет установить, какая архитектура превосходит другую». Его чекпойнт некоммерческий. Его сильные стороны — архитектурная новизна и широта, а не передовые показатели, и его непосредственная ценность — для всех, кто изучает, работают ли унифицированные модели без энкодера в масштабе видео. Скачайте его, чтобы прочитать код и запустить демонстрации; не скачивайте его, чтобы выпустить функцию.

Двухстрочное резюме — то же самое, что дают свидетельства: одна модель может действовать и не может создавать, другая может создавать и не может действовать, и разрыв между ними в лицензировании и зрелости важнее любого числа параметров.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube