
PixelUMM против UI-Mate-27B: одна модель рисует то, что видит, другая — кликает по этому
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 223 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Tencent UI-Mate-27B и NVIDIA PixelUMM выглядят сопоставимо в спецификации — 27 миллиардов параметров против примерно 15,2 миллиарда, обе доступны для скачивания, обе построены на базе Qwen — и они совершенно несопоставимы. UI-Mate-27B — это фундаментальный GUI-агент: он наблюдает за скриншотами в реальном времени, планирует, исходя из того, что сейчас на экране, и выдаёт структурированные действия мышью и клавиатурой для настоящего рабочего стола. PixelUMM — это унифицированная мультимодальная модель без энкодера, которая читает изображения и видео в необработанном пиксельном пространстве и генерирует изображения и видео из текста — она воспринимает и создаёт, но у неё нет пространства действий, нет курсора и нет способа прикоснуться к экрану. Первый воздействует на мир. Второй описывает и изображает его. Всё нижеследующее следует из этого разделения, а разрыв в лицензировании между ними — второе, что вам нужно знать.
Обе лаборатории сообщают собственные цифры, и ни у одной нет независимой оценки. Обе обнародовали их тихо — и именно в способе обнародования сходство на самом деле заканчивается.
Деятель и воспринимающий
UI-Mate-27B выполняет задачу, исходя только из инструкции на естественном языке и живых скриншотов. Он рассуждает о видимом состоянии, перепланирует по мере изменения интерфейса и выдаёт рассуждения, краткое описание действия и структурированные вызовы инструментов компьютерного использования для мыши, клавиатуры, прокрутки, ожидания, взаимодействия с пользователем и завершения задачи. Его отличительная особенность — управляемое демонстрацией выполнение: покажите ему рабочий процесс один раз, и он адаптирует записанную демонстрацию к текущей задаче, считая текущий скриншот определяющим, когда интерфейс изменился. Он дообучен на основе Qwen3.6-27B с помощью управляемого обучения с учителем, за которым следует онлайн-обучение с подкреплением в исполняемых средах GUI, и обслуживается через vLLM с интерфейсом, совместимым с OpenAI.
• Заявленные результаты тестов — средний показатель OSWorld-Verified 77,0, средний WindowsAgentArena 66,2, строгий показатель успеха OSWorkerBench 41,00 и прогресс 76,86. Все данные заявлены Tencent и не воспроизведены.
• Пространство действий — мышь, клавиатура, прокрутка, ожидание, взаимодействие с пользователем, завершение задачи, в нормализованном координатном пространстве со структурированными вызовами, совместимыми с pyautogui.
• Аппаратная реальность — плотная модель на 27B, обслуживаемая с тензорным параллелизмом на двух GPU в собственном руководстве Tencent по быстрому запуску, под лицензией Apache-2.0.
• Важная оговорка в самой карточке модели — UI-Mate-27B — это агентский чекпоинт, а не самостоятельная модель для визуального чата. Tencent рекомендует использовать официальные промпт, парсер ответов и среду взаимодействия из его репозитория. Дайте ему запрос «опиши это изображение» — и вы используете не тот инструмент.
PixelUMM занимает противоположный полюс. Вся его архитектура — это аргумент о представлении: никакого VAE, никакого визуального энкодера, изображения в виде патчей 16×16 пикселей, а видео — в виде 4-кадровых пространственно-временных тублетов, напрямую в Transformer только с декодером через однослойные линейные проекции, с архитектурой Mixture-of-Transformers, сочетающей общее внимание с параметрами, специфичными для задачи. Понимание — это авторегрессионный текст; генерация — это flow matching в пиксельном пространстве. Поставляются четыре контрольные точки, S8-F22-R05 как вариант по умолчанию, охватывающий текст-в-изображение, текст-в-видео при 96 кадрах и 24 кадрах в секунду, а также оба направления понимания.

Две модели выпуска — это наглядный пример контраста.
UI-Mate-27B появился на Hugging Face 14 августа 2026 года вместе с карточкой модели, препринтом arXiv под номером 2608.15930, страницей проекта, репозиторием GitHub и документированным рецептом обслуживания. С тех пор и до начала октября он набрал примерно 780 загрузок и 93 лайка — скромно, но это обычный релиз исследовательского агента, у которого все документы в порядке.
След PixelUMM иного рода. Репозиторий GitHub был создан 4 сентября 2026 года; препринт arXiv датирован 29 сентября; репозиторий Hugging Face был создан в 21:40 UTC 1 октября 2026 года, через несколько минут после финального коммита репозитория. Для него не появилось ни поста в блоге NVIDIA, ни пресс-релиза, ни треда о запуске. URL-путь самой страницы проекта по-прежнему выглядит как pixelumm-project-page-preview. На момент написания его количество загрузок было нулевым.
Усматривать в этом намерение — ошибка: лаборатория может опубликовать исследовательский артефакт, а запуск запланировать на потом. То, что можно знать, оказывается более узким и более полезным: у одной модели есть официальный путь обслуживания и десять недель загрузок; у другой — статья, репозиторий и вообще никаких заявлений от вендора.

Табло, которые не перекрываются
Нет ни одного бенчмарка, по которому отчитывались бы обе модели, — и в этом-то и суть: они решают не одну и ту же задачу.
• Агентное использование компьютера — UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2. PixelUMM: отсутствует пространство действий, поэтому оценка невозможна.
• Понимание изображений — UI-Mate-27B: использует скриншоты в качестве входных данных агента, не оценивается как универсальная VLM. PixelUMM: MMMU 41.67, AI2D 80.12, DocVQA 90.42, ChartQA 82.96, OCRBench 78.00.
• Видео — UI-Mate-27B: нет. PixelUMM: MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, LVBench 40.41.
• Генерация — UI-Mate-27B: нет. PixelUMM: GenEval 0.83 с рерайтером промптов, DPG-Bench 85.74, качество VBench Part 1 84.10.
• Стоимость развёртывания — UI-Mate-27B: плотная модель на 27B, размещённая примерно на двух GPU через vLLM, плюс официальный харнесс. PixelUMM: около 30 ГБ шардов распределённого чекпоинта, CUDA 13 с FlashAttention, собранным из исходников, guardrail-модель с ограниченным доступом для видеотракта и второе окружение Python для неё.
• Лицензия — UI-Mate-27B: Apache-2.0, код и веса. PixelUMM: код Apache-2.0, NVIDIA One-Way Noncommercial License на чекпоинт.
• Масштаб — 27B dense против примерно 15,2B всего, что представлено как «8B MoT» в собственных таблицах статьи PixelUMM.
Единственное действительно сопоставимое утверждение касается происхождения данных, и оно относится к обоим: каждое число выше принадлежит самому поставщику, ни одно не было повторно проверено за пределами лаборатории, которая его получила, а одна из двух моделей явно помечает свои собственные результаты как предварительные.
Создание с ними, и почему вы могли бы использовать оба
Эти две системы лучше сочетаются, чем конкурируют. Стеку автоматизации рабочих столов нужен UI-Mate-27B для слоя действий и нечто, способное рассуждать о том, что оно увидело; пайплайну контента или инспекции нужны чтение и генерация от PixelUMM, а курсор ему без надобности. Пересечение находится на границе восприятия, где привязка к скриншотам у UI-Mate-27B специфична для задачи, а у PixelUMM — универсальна: одни и те же пиксели, две совершенно разные задачи.
Когда вы запускаете несколько моделей друг против друга — агента против универсальной VLM или новый исследовательский чекпойнт против того, что уже используется в продакшене, — стоимость сравнения обычно заключается в интеграции, а не в инференсе: две формы API, две схемы аутентификации, два контракта. Именно эту проблему призван устранить слой маршрутизации, и именно здесь дизайн OrcaRouter оправдывает себя: один ключ для 200+ моделей, цены провайдеров из прайс-листа передаются без наценки (0%), автоматическое переключение при сбое между провайдерами, а также DSL маршрутизации и слияние моделей, позволяющие объединять несколько моделей в один вызов. Ни PixelUMM, ни UI-Mate-27B сегодня не доступны ни на одном хостинговом эндпоинте, и OrcaRouter не маршрутизирует ни один из них — так что речь идет о рабочем процессе, когда они будут доступны, а не о заявлении о доступности сейчас.
Какой для какой работы?
Если задача завершается щелчком, нажатием клавиши или заполненной формой, здесь есть только один кандидат — UI-Mate-27B. Он распространяется под Apache-2.0, у него есть статья на arXiv и официальный тестовый стенд, а его заявленные результаты OSWorld и WindowsAgentArena — это как раз тот тип утверждений, который может проверить любой, у кого есть два графических процессора и тестовый образ Windows или Ubuntu, — и именно поэтому их стоит проверять, а не принимать на веру.
Если задача завершается ответом или изображением, именно PixelUMM способен с этим справиться, и прежде всего это исследовательский артефакт. В его статье необычно честно говорится о собственных ограничениях: признаётся, что из-за различий в обучающих данных его сравнение в бенчмарках «не позволяет установить, какая архитектура превосходит другую». Его чекпойнт некоммерческий. Его сильные стороны — архитектурная новизна и широта, а не передовые показатели, и его непосредственная ценность — для всех, кто изучает, работают ли унифицированные модели без энкодера в масштабе видео. Скачайте его, чтобы прочитать код и запустить демонстрации; не скачивайте его, чтобы выпустить функцию.
Двухстрочное резюме — то же самое, что дают свидетельства: одна модель может действовать и не может создавать, другая может создавать и не может действовать, и разрыв между ними в лицензировании и зрелости важнее любого числа параметров.
