Um card de título gerado no estilo da OrcaRouter com o texto “PixelUMM vs UI-Mate-27B”, com quatro blocos de estatística: “77.0” (média relatada do UI-Mate-27B no OSWorld-Verified), “66.2” (sua média no WindowsAgentArena), “nenhum” (espaço de ação do PixelUMM) e “Apache-2.0” (licença do UI-Mate-27B sobre código e pesos, em contraste com o checkpoint não comercial do PixelUMM). Uma linha de rodapé traz “Pontuações de agentes relatadas pela Tencent; números do PixelUMM provenientes de seu preprint. Nenhuma reexecução independente.”. O logotipo da OrcaRouter é composto na faixa com preenchimento no canto inferior direito.
Guides & Insights

PixelUMM vs UI-Mate-27B: Um Modelo Desenha o Que Vê, o Outro Clica Nele

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Tencen​t UI-Mate-27B e NVIDIA PixelUMM parecem comparáveis em uma ficha técnica — 27 bilhões de parâmetros contra aproximadamente 15,2 bilhões, ambos com download aberto, ambos construídos sobre backbones Qwe​n — e não são comparáveis de jeito nenhum. UI-Mate-27B é um agente GUI de fundação: ele observa capturas de tela ao vivo, planeja a partir do que está atualmente na tela e emite ações estruturadas de mouse e teclado para um desktop real. PixelUMM é um modelo multimodal unificado sem codificador que lê imagens e vídeo no espaço de pixels bruto e gera imagens e vídeo a partir de texto — ele percebe e cria, mas não tem espaço de ação, nem cursor, nem maneira de tocar numa tela. Um age sobre o mundo. O outro o descreve e o retrata. Tudo abaixo decorre dessa divisão, e a lacuna de licenciamento entre eles é a segunda coisa que você precisa saber.

Ambos os laboratórios divulgam seus próprios números e nenhum tem uma avaliação independente. Ambos divulgaram discretamente — o estilo de divulgação é onde a semelhança realmente termina.

Ator e perceptor

UI-Mate-27B executa uma tarefa a partir de uma instrução em linguagem natural e apenas capturas de tela ao vivo. Ele raciocina sobre o estado visível, replaneja à medida que a interface muda e produz raciocínio, uma descrição concisa da ação e chamadas de ferramentas estruturadas de uso do computador em mouse, teclado, rolagem, espera, interação do usuário e conclusão da tarefa. Sua característica distintiva é a execução guiada por demonstração: mostre-lhe um fluxo de trabalho uma vez e ele adapta a demonstração gravada à tarefa em questão, tratando a captura de tela atual como autoritativa quando a interface já mudou. Ele é ajustado a partir do Qwen3.6-27B com ajuste fino supervisionado seguido de aprendizado por reforço online em ambientes GUI executáveis, e é servido através do vLLM com uma interface compatível com OpenAI.

• Benchmarks reportados — média de 77.0 no OSWorld-Verified, média de 66.2 no WindowsAgentArena, sucesso estrito de 41.00 e progresso de 76.86 no OSWorkerBench. Todos reportados pela Tencent e não reproduzidos.

• Espaço de ação — mouse, teclado, rolagem, espera, interação do usuário, conclusão de tarefa, em um espaço de coordenadas normalizado com chamadas estruturadas compatíveis com o pyautogui.

• Realidade de hardware — 27B denso, servido com paralelismo tensorial em duas GPUs no próprio guia de início rápido da Tencent, sob Apache-2.0.

• Uma ressalva importante no próprio card — UI-Mate-27B é um checkpoint de agente, não um modelo independente de chat visual. A Tencent recomenda o prompt oficial, o parser de resposta e o harness de interação do repositório dela. Se você apontá-lo para "descreva esta imagem", está usando a ferramenta errada.

A PixelUMM ocupa o polo oposto. Toda a sua arquitetura é um argumento sobre representação: sem VAE, sem codificador de visão, imagens como patches de pixels 16×16 e vídeos como tubelets espaço-temporais de 4 quadros, diretamente para um Transformer somente decoder por meio de projeções lineares de camada única, com um design Mixture-of-Transformers que combina atenção compartilhada com parâmetros específicos da tarefa. A compreensão é texto autorregressivo; a geração é flow matching no espaço de pixels. Quatro checkpoints são disponibilizados, S8-F22-R05 como padrão, cobrindo texto-para-imagem, texto-para-vídeo com 96 quadros e 24 fps, e ambas as direções de compreensão.

A headless-browser capture of the Hugging Face model card for the Tencent UI-Mate-27B repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

Os dois padrões de lançamento são um estudo em contraste

O UI-Mate-27B surgiu no Hugging Face em 14 de agosto de 2026 com um model card, um preprint do arXiv numerado 2608.15930, uma página de projeto, um repositório no GitHub e uma receita de serving documentada. Entre essa data e o início de outubro, acumulou cerca de 780 downloads e 93 likes — modestos, mas típicos de um lançamento normal de agente de pesquisa com a papelada em ordem.

O rastro do PixelUMM é de natureza diferente. O repositório do GitHub foi criado em 4 de setembro de 2026; o preprint no arXiv é datado de 29 de setembro; o repositório no Hugging Face foi criado às 21:40 UTC de 1º de outubro de 2026, minutos após o commit final do repositório. Não apareceu nenhuma postagem no blog da NVIDIA, comunicado à imprensa ou thread de lançamento a respeito dele. O próprio caminho de URL da página do projeto ainda diz pixelumm-project-page-preview. Sua contagem de downloads era zero quando isto foi escrito.

Atribuir intenção a isso é um erro — um laboratório pode publicar um artefato de pesquisa e agendar um lançamento para mais tarde. O que dá para saber é mais restrito e mais útil: um modelo tem um caminho oficial de serving e dez semanas de downloads; o outro tem um artigo, um repositório e nenhuma declaração do fornecedor.

A generated scoreboard card titled “PixelUMM vs UI-Mate-27B — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: role, backbone, headline benchmarks, action space, deployment and licence. UI-Mate-27B's column shows a foundation GUI agent, a Qwen3.6-27B fine-tune, OSWorld-Verified 77.0 with WindowsAgentArena 66.2, mouse, keyboard, scrolling, waiting and task-completion calls, 27B dense across roughly two GPUs under vLLM, and Apache-2.0; PixelUMM's column shows an encoder-free perceiver and generator, about 15.2B total on a Qwen3-8B backbone, MMMU 41.67 with GenEval 0.83 and VBench Part 1 quality 84.10, no action space, about 30 GB of distributed-checkpoint shards behind a hidden index, and a noncommercial checkpoint licence. A footer notes the agent scores are Tencent-reported and the generation scores are from the PixelUMM preprint, with no independent rerun of either.

Placares que não se sobrepõem

Não há um benchmark que ambos os modelos reportem, o que é justamente o ponto: eles não estão resolvendo o mesmo problema.

• Uso agêntico de computador — UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2. PixelUMM: sem espaço de ação, portanto não é possível atribuir pontuação.

• Compreensão de imagens — UI-Mate-27B: consome capturas de ecrã como entrada do agente, não é avaliado como um VLM de uso geral. PixelUMM: MMMU 41,67, AI2D 80,12, DocVQA 90,42, ChartQA 82,96, OCRBench 78,00.

• Vídeo — UI-Mate-27B: nenhum. PixelUMM: MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, LVBench 40.41.

• Geração — UI-Mate-27B: nenhum. PixelUMM: GenEval 0,83 com um reescritor de prompt, DPG-Bench 85,74, VBench Parte 1 qualidade 84,10.

• Custo de implantação — UI-Mate-27B: 27B denso em aproximadamente duas GPUs via vLLM, além do harness oficial. PixelUMM: cerca de 30 GB de shards de checkpoint distribuído, CUDA 13 com FlashAttention compilado do código-fonte, um modelo de guardrail com acesso restrito para o caminho de vídeo e um segundo ambiente Python para ele.

• Licença — UI-Mate-27B: Apache-2.0, código e pesos. PixelUMM: código Apache-2.0, Licença Não Comercial One-Way da NVIDIA sobre o checkpoint.

• Escala — 27B denso versus cerca de 15,2B no total, apresentado como "8B MoT" nas próprias tabelas do artigo do PixelUMM.

A única afirmação genuinamente comparável é sobre proveniência, e ela se aplica a ambos: todos os números acima são do próprio fornecedor, nenhum foi reproduzido fora do laboratório que o produziu, e um dos dois modelos rotula explicitamente seus próprios resultados como preliminares.

Construir com eles e por que você pode querer usar ambos

Estes dois compõem melhor do que competem. Uma stack de automação de desktop quer o UI-Mate-27B para a camada de atuação e algo capaz de raciocinar sobre o que viu; um pipeline de conteúdo ou de inspeção quer a leitura e a geração do PixelUMM e não tem utilidade alguma para um cursor. A sobreposição está na fronteira da perceção, onde a fundamentação em capturas de ecrã do UI-Mate-27B é específica da tarefa e a do PixelUMM é geral — os mesmos píxeis, dois trabalhos completamente diferentes.

Quando você realmente coloca vários modelos uns contra os outros — o agente contra um VLM generalista, ou um novo checkpoint de pesquisa contra o que já está em produção — o custo da comparação normalmente é a integração, não a inferência: dois formatos de API, dois esquemas de autenticação, dois contratos. Esse é o problema que uma camada de roteamento existe para remover, e é aí que o design do OrcaRouter compensa: uma única chave para 200+ modelos, preços de tabela dos provedores repassados com 0% de acréscimo, failover automático entre provedores, e uma DSL de roteamento mais fusão de modelos para compor vários modelos em uma única chamada. Nem o PixelUMM nem o UI-Mate-27B estão em qualquer endpoint hospedado hoje, e o OrcaRouter não roteia nenhum dos dois — portanto, isto é sobre o fluxo de trabalho quando estiverem, não uma afirmação sobre a disponibilidade agora.

Qual para qual trabalho?

Se a tarefa termina com um clique, um pressionamento de tecla ou um formulário preenchido, só há um candidato aqui, e é o UI-Mate-27B. Ele tem licença Apache-2.0, tem um artigo no arXiv e um harness oficial, e as pontuações relatadas no OSWorld e no WindowsAgentArena são o tipo de alegação que qualquer pessoa com duas GPUs e uma imagem de teste do Windows ou do Ubuntu consegue verificar — o que é exatamente o que faz valer a pena verificar em vez de confiar.

Se a tarefa termina com uma resposta ou uma imagem, o PixelUMM é quem consegue fazer isso, e ele é, antes de tudo, um artefato de pesquisa. Seu artigo é incomumente honesto sobre seus próprios limites, admitindo que dados de treinamento diferentes fazem com que sua comparação de benchmarks "não possa estabelecer qual arquitetura é superior". Seu checkpoint é não comercial. Seus pontos fortes são a novidade arquitetural e a amplitude, não números de estado da arte, e seu valor imediato é para qualquer pessoa que estude se modelos unificados sem encoder funcionam em escala de vídeo. Baixe-o para ler o código e executar as demos; não o baixe para lançar um recurso.

O resumo em duas linhas é o mesmo que as evidências apresentam: um modelo pode agir e não pode criar, o outro pode criar e não pode agir, e a diferença de licenciamento e maturidade entre eles importa mais do que qualquer contagem de parâmetros.