
PixelUMM vs UI-Mate-27B: Um Modelo Desenha o Que Vê, o Outro Clica Nele
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Tencent UI-Mate-27B e NVIDIA PixelUMM parecem comparáveis em uma ficha técnica — 27 bilhões de parâmetros contra aproximadamente 15,2 bilhões, ambos com download aberto, ambos construídos sobre backbones Qwen — e não são comparáveis de jeito nenhum. UI-Mate-27B é um agente GUI de fundação: ele observa capturas de tela ao vivo, planeja a partir do que está atualmente na tela e emite ações estruturadas de mouse e teclado para um desktop real. PixelUMM é um modelo multimodal unificado sem codificador que lê imagens e vídeo no espaço de pixels bruto e gera imagens e vídeo a partir de texto — ele percebe e cria, mas não tem espaço de ação, nem cursor, nem maneira de tocar numa tela. Um age sobre o mundo. O outro o descreve e o retrata. Tudo abaixo decorre dessa divisão, e a lacuna de licenciamento entre eles é a segunda coisa que você precisa saber.
Ambos os laboratórios divulgam seus próprios números e nenhum tem uma avaliação independente. Ambos divulgaram discretamente — o estilo de divulgação é onde a semelhança realmente termina.
Ator e perceptor
UI-Mate-27B executa uma tarefa a partir de uma instrução em linguagem natural e apenas capturas de tela ao vivo. Ele raciocina sobre o estado visível, replaneja à medida que a interface muda e produz raciocínio, uma descrição concisa da ação e chamadas de ferramentas estruturadas de uso do computador em mouse, teclado, rolagem, espera, interação do usuário e conclusão da tarefa. Sua característica distintiva é a execução guiada por demonstração: mostre-lhe um fluxo de trabalho uma vez e ele adapta a demonstração gravada à tarefa em questão, tratando a captura de tela atual como autoritativa quando a interface já mudou. Ele é ajustado a partir do Qwen3.6-27B com ajuste fino supervisionado seguido de aprendizado por reforço online em ambientes GUI executáveis, e é servido através do vLLM com uma interface compatível com OpenAI.
• Benchmarks reportados — média de 77.0 no OSWorld-Verified, média de 66.2 no WindowsAgentArena, sucesso estrito de 41.00 e progresso de 76.86 no OSWorkerBench. Todos reportados pela Tencent e não reproduzidos.
• Espaço de ação — mouse, teclado, rolagem, espera, interação do usuário, conclusão de tarefa, em um espaço de coordenadas normalizado com chamadas estruturadas compatíveis com o pyautogui.
• Realidade de hardware — 27B denso, servido com paralelismo tensorial em duas GPUs no próprio guia de início rápido da Tencent, sob Apache-2.0.
• Uma ressalva importante no próprio card — UI-Mate-27B é um checkpoint de agente, não um modelo independente de chat visual. A Tencent recomenda o prompt oficial, o parser de resposta e o harness de interação do repositório dela. Se você apontá-lo para "descreva esta imagem", está usando a ferramenta errada.
A PixelUMM ocupa o polo oposto. Toda a sua arquitetura é um argumento sobre representação: sem VAE, sem codificador de visão, imagens como patches de pixels 16×16 e vídeos como tubelets espaço-temporais de 4 quadros, diretamente para um Transformer somente decoder por meio de projeções lineares de camada única, com um design Mixture-of-Transformers que combina atenção compartilhada com parâmetros específicos da tarefa. A compreensão é texto autorregressivo; a geração é flow matching no espaço de pixels. Quatro checkpoints são disponibilizados, S8-F22-R05 como padrão, cobrindo texto-para-imagem, texto-para-vídeo com 96 quadros e 24 fps, e ambas as direções de compreensão.

Os dois padrões de lançamento são um estudo em contraste
O UI-Mate-27B surgiu no Hugging Face em 14 de agosto de 2026 com um model card, um preprint do arXiv numerado 2608.15930, uma página de projeto, um repositório no GitHub e uma receita de serving documentada. Entre essa data e o início de outubro, acumulou cerca de 780 downloads e 93 likes — modestos, mas típicos de um lançamento normal de agente de pesquisa com a papelada em ordem.
O rastro do PixelUMM é de natureza diferente. O repositório do GitHub foi criado em 4 de setembro de 2026; o preprint no arXiv é datado de 29 de setembro; o repositório no Hugging Face foi criado às 21:40 UTC de 1º de outubro de 2026, minutos após o commit final do repositório. Não apareceu nenhuma postagem no blog da NVIDIA, comunicado à imprensa ou thread de lançamento a respeito dele. O próprio caminho de URL da página do projeto ainda diz pixelumm-project-page-preview. Sua contagem de downloads era zero quando isto foi escrito.
Atribuir intenção a isso é um erro — um laboratório pode publicar um artefato de pesquisa e agendar um lançamento para mais tarde. O que dá para saber é mais restrito e mais útil: um modelo tem um caminho oficial de serving e dez semanas de downloads; o outro tem um artigo, um repositório e nenhuma declaração do fornecedor.

Placares que não se sobrepõem
Não há um benchmark que ambos os modelos reportem, o que é justamente o ponto: eles não estão resolvendo o mesmo problema.
• Uso agêntico de computador — UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2. PixelUMM: sem espaço de ação, portanto não é possível atribuir pontuação.
• Compreensão de imagens — UI-Mate-27B: consome capturas de ecrã como entrada do agente, não é avaliado como um VLM de uso geral. PixelUMM: MMMU 41,67, AI2D 80,12, DocVQA 90,42, ChartQA 82,96, OCRBench 78,00.
• Vídeo — UI-Mate-27B: nenhum. PixelUMM: MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, LVBench 40.41.
• Geração — UI-Mate-27B: nenhum. PixelUMM: GenEval 0,83 com um reescritor de prompt, DPG-Bench 85,74, VBench Parte 1 qualidade 84,10.
• Custo de implantação — UI-Mate-27B: 27B denso em aproximadamente duas GPUs via vLLM, além do harness oficial. PixelUMM: cerca de 30 GB de shards de checkpoint distribuído, CUDA 13 com FlashAttention compilado do código-fonte, um modelo de guardrail com acesso restrito para o caminho de vídeo e um segundo ambiente Python para ele.
• Licença — UI-Mate-27B: Apache-2.0, código e pesos. PixelUMM: código Apache-2.0, Licença Não Comercial One-Way da NVIDIA sobre o checkpoint.
• Escala — 27B denso versus cerca de 15,2B no total, apresentado como "8B MoT" nas próprias tabelas do artigo do PixelUMM.
A única afirmação genuinamente comparável é sobre proveniência, e ela se aplica a ambos: todos os números acima são do próprio fornecedor, nenhum foi reproduzido fora do laboratório que o produziu, e um dos dois modelos rotula explicitamente seus próprios resultados como preliminares.
Construir com eles e por que você pode querer usar ambos
Estes dois compõem melhor do que competem. Uma stack de automação de desktop quer o UI-Mate-27B para a camada de atuação e algo capaz de raciocinar sobre o que viu; um pipeline de conteúdo ou de inspeção quer a leitura e a geração do PixelUMM e não tem utilidade alguma para um cursor. A sobreposição está na fronteira da perceção, onde a fundamentação em capturas de ecrã do UI-Mate-27B é específica da tarefa e a do PixelUMM é geral — os mesmos píxeis, dois trabalhos completamente diferentes.
Quando você realmente coloca vários modelos uns contra os outros — o agente contra um VLM generalista, ou um novo checkpoint de pesquisa contra o que já está em produção — o custo da comparação normalmente é a integração, não a inferência: dois formatos de API, dois esquemas de autenticação, dois contratos. Esse é o problema que uma camada de roteamento existe para remover, e é aí que o design do OrcaRouter compensa: uma única chave para 200+ modelos, preços de tabela dos provedores repassados com 0% de acréscimo, failover automático entre provedores, e uma DSL de roteamento mais fusão de modelos para compor vários modelos em uma única chamada. Nem o PixelUMM nem o UI-Mate-27B estão em qualquer endpoint hospedado hoje, e o OrcaRouter não roteia nenhum dos dois — portanto, isto é sobre o fluxo de trabalho quando estiverem, não uma afirmação sobre a disponibilidade agora.
Qual para qual trabalho?
Se a tarefa termina com um clique, um pressionamento de tecla ou um formulário preenchido, só há um candidato aqui, e é o UI-Mate-27B. Ele tem licença Apache-2.0, tem um artigo no arXiv e um harness oficial, e as pontuações relatadas no OSWorld e no WindowsAgentArena são o tipo de alegação que qualquer pessoa com duas GPUs e uma imagem de teste do Windows ou do Ubuntu consegue verificar — o que é exatamente o que faz valer a pena verificar em vez de confiar.
Se a tarefa termina com uma resposta ou uma imagem, o PixelUMM é quem consegue fazer isso, e ele é, antes de tudo, um artefato de pesquisa. Seu artigo é incomumente honesto sobre seus próprios limites, admitindo que dados de treinamento diferentes fazem com que sua comparação de benchmarks "não possa estabelecer qual arquitetura é superior". Seu checkpoint é não comercial. Seus pontos fortes são a novidade arquitetural e a amplitude, não números de estado da arte, e seu valor imediato é para qualquer pessoa que estude se modelos unificados sem encoder funcionam em escala de vídeo. Baixe-o para ler o código e executar as demos; não o baixe para lançar um recurso.
O resumo em duas linhas é o mesmo que as evidências apresentam: um modelo pode agir e não pode criar, o outro pode criar e não pode agir, e a diferença de licenciamento e maturidade entre eles importa mais do que qualquer contagem de parâmetros.
