
Tencent UI-Mate-27B: O Discreto Agente de GUI de Peso Aberto que Reivindica um Lugar no Topo do WindowsAgentArena
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
- grokxAI: Grok 4.52026-07-0856Inteligência72Código
Em 14 de agosto de 2026, a equipe HY Frontier Multimodal Agent da Tencent publicou {{1}}três checkpoints{{/1}} no Hugging Face sob a organização tencent/ — UI-Mate-27B, uma versão menor, a UI-Mate-9B, e a UI-Mate-democua-27B, guiada por demonstrações. Quatro dias depois, ainda não há anúncio em lugar nenhum: nenhum post de lançamento, nenhum comunicado à imprensa, nenhum tweet do produto. {{2}}O que foi publicado em vez disso é incomumente completo para um lançamento silencioso:{{/2}} uma página do projeto, um repositório no GitHub com uma estrutura de testes funcional e um artigo no arXiv submetido há dois dias que chama o modelo maior de novo estado da arte de pesos abertos em controle de GUI de desktop.
Tudo neste texto vem dos model cards, do repositório do GitHub, da página do projeto e daquele artigo — nada disso foi reproduzido de forma independente ainda. Os checkpoints têm zero downloads no Hugging Face até o momento em que escrevo, o que significa que provavelmente estamos entre as primeiras pessoas fora da Tencent a levá-los a sério no papel. Aqui está o que de fato é possível saber a partir dos repositórios, e o que permanece não confirmado até que outra pessoa os execute.
Conteúdo
• O que foi lançado e o que ainda não foi anunciado
O que realmente é o UI-Mate-27B
• O recurso que é diferente: execução guiada por demonstração
• Os números — todos eles reportados pelo fornecedor
• Onde esses números se situariam — se eles se mantiverem
• Como executá-lo
• A stack em torno de um novo agente de GUI
• O que assistir a seguir
• Perguntas Frequentes
O que foi lançado e o que ainda não foi anunciado
A Tencent publicou o UI-Mate-27B (27 bilhões de parâmetros, Apache-2.0, safetensors em BF16) em 14 de agosto de 2026, junto com o modelo irmão de 9B e o checkpoint guiado por demonstração UI-Mate-democua-27B. Os dois checkpoints de 27B são construídos sobre o Qwen3.6-27B — ele próprio um modelo multimodal Apache-2.0 lançado em abril de 2026 — o que significa que toda a pilha, base e fine-tune, é comercialmente utilizável. Os repositórios trazem carimbos de última modificação desta semana — o checkpoint guiado por demonstração foi modificado ainda hoje — então a Tencent tem trabalhado ativamente neles.

O que está público até agora:
• Os pesos dos modelos UI-Mate-27B, UI-Mate-9B e UI-Mate-democua-27B no Hugging Face, cada um com um card de modelo, tabelas de avaliação e uma receita de implantação.
• Uma página do projeto em ui-mate.github.io com vídeo de demonstração, guia de uso e um app macOS Apple Silicon (DMG v0.2.4).
• {{1}}O repositório GitHub (github.com/Tencent/UI-Mate) contendo o prompt oficial, o parser de respostas e o harness de interação{{/1}} — a ficha do modelo deixa explícito que isto é {{2}}"um checkpoint de agente em vez de um modelo independente de chat visual"{{/2}} e {{3}}o harness é recomendado para qualquer uso real{{/3}}.
• Um preprint do arXiv (2608.15930), submetido em 16 de agosto, intitulado "UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations."
O que ainda não é público: a própria Tencent não disse nada — isto é uma liberação primeiro no repositório, não um lançamento. A variante guiada por demonstração que a página do projeto listava como ainda não pública agora tem pesos disponíveis no Hugging Face: o repositório tencent/UI-Mate-democua-27B, criado no mesmo push de 14 de agosto, está explicitamente marcado como o checkpoint guiado por demonstração da família — um modelo distinto, não um rebranding do 27B. Ainda não há API hospedada em lugar nenhum. Isso importa: a única maneira de executar o UI-Mate hoje é baixar os pesos e servi-los você mesmo.
O que UI-Mate-27B realmente é
UI-Mate-27B é um agente de GUI fundamental para "trabalho de longo horizonte entre aplicativos e sistemas operacionais". Ele observa capturas de tela ao vivo, raciocina sobre o estado visível e emite ações estruturadas de teclado e mouse para interação nativa com a área de trabalho. O treinamento é um ajuste fino supervisionado seguido de aprendizado por reforço online em ambientes de GUI executáveis — o modelo aprendeu dirigindo desktops de verdade, e não apenas a partir de capturas de tela estáticas.
O espaço de ações é a parte que interessará aos desenvolvedores: mouse, teclado, rolagem, espera, interação do usuário e conclusão de tarefas, com saídas compatíveis com pyautogui. O modelo raciocina em um espaço de coordenadas normalizado de 1000×1000 e o agente de referência redimensiona suas previsões de volta para a resolução real da captura de tela, para que as ações sobrevivam a diferenças de escala de exibição entre máquinas. O próprio README do modelo recomenda servi-lo com vLLM atrás de um endpoint compatível com OpenAI.
O recurso que é diferente: execução guiada por demonstração
A maioria dos agentes de GUI recebe uma entrada: uma instrução. O UI-Mate recebe uma segunda que é genuinamente rara em um checkpoint aberto — uma demonstração. "Mostre o fluxo de trabalho uma vez. Deixe o agente adaptá-lo à tarefa em questão", como diz a página do projeto.
O mecanismo não é vídeo em contexto nem um script de ação fixo. Uma demonstração registra capturas de tela imediatamente antes e depois de cada ação de teclado ou ponteiro, e o pipeline então normaliza o rastro para uma representação consistente de ação e quadro, anota-o com observações, intenção, ações e evidências de verificação, e o segmenta em subtarefas nomeadas com critérios de conclusão. No momento da inferência, isso se torna um fluxo de trabalho compacto injetado para a subtarefa ativa — mas a captura de tela ao vivo permanece autoritativa durante todo o processo, de modo que, quando o estado do aplicativo difere da demonstração, o modelo replaneja em vez de reproduzir.
A Tencent transformou o checkpoint por trás deste fluxo de trabalho em seu próprio modelo público: a ficha do UI-Mate-democua-27B compara resultados apenas com instrução e com uma demonstração nas mesmas avaliações, e seu esquema de ferramentas adiciona uma ação subtask_complete — o mecanismo por trás dessas subtarefas nomeadas. No subconjunto self-demo do OSWorkerBench, uma demonstração eleva o sucesso estrito de 17,17 para 35,35 e o progresso de 67,85 para 81,14; no subconjunto OSWorld, o progresso vai de 40,27 para 65,75; no conjunto de avaliação GameDev, a pontuação média vai de 76,76 para 81,15, enquanto o comprimento médio da trajetória cai de 303,6 para 253,1 passos — a demonstração encurta a tarefa além de melhorá-la. A ficha relata que a demonstração melhorou 28 das 33 tarefas self-demo e resolveu quatro tarefas que pontuam zero sem orientação. A ressalva é a mesma que percorre todo este artigo: estas são avaliações pareadas da própria equipe, com média de três a cinco execuções, e ninguém as reproduziu.
Os números — todos eles relatados pelo fornecedor.
Execução somente por instrução, direto do cartão do modelo:
• Pontuação média verificada OSWorld — 77.0
• Pontuação média do WindowsAgentArena — 66.2
OSWorkerBench sucesso estrito — 41.00
• Progresso do OSWorkerBench — 76.86

O OSWorkerBench é, por si só, uma das três contribuições do artigo: um novo benchmark de 100 tarefas de escritório de longo horizonte em 41 aplicativos, com 33 subconjuntos de self-demo e 45 de variant-demo. É uma avaliação nova, portanto não há trabalhos anteriores com os quais comparar essas duas pontuações. Em comparação com o seu próprio modelo base, alega-se que o UI-Mate-27B supera o Qwen3.6-27B por 17,7 pontos de sucesso estrito e 24,5 pontos de progresso no OSWorkerBench — o que é a comparação mais justa de todo o lançamento, já que ambos os modelos rodariam no mesmo harness.
Cada figura acima é uma avaliação da própria equipe. Ainda não há pontuações independentes, nem reexecuções por terceiros e, com zero downloads, também não há reproduções pela comunidade. Trate cada número aqui como uma afirmação, não como um fato.
Onde esses números se situariam — se eles se mantiverem
WindowsAgentArena é o que seria uma manchete genuína. Os melhores resultados WAA reportados publicamente no início de 2026 se agrupavam em torno de 61,0 (um sistema modular chamado VLAA-GUI, abril de 2026); o EvoCUA-32B de pesos abertos da Meituan estava em 56,5, e o UI-TARS-2 fechado da ByteDance estava na faixa baixa a média dos 50 no mesmo ranking. Um 66,2 na avaliação do próprio UI-Mate-27B o colocaria acima de tudo que já foi reportado neste benchmark este ano — aberto ou fechado. Essa é uma afirmação forte, e precisa de uma reexecução independente.
OSWorld-Verified com 77,0 é forte, mas não é um novo recorde de pesos abertos no ranking público. No snapshot do leaderboard OSWorld-Verified do início de agosto de 2026, o modelo de pesos abertos Holo3-35B-A3B está listado com 82,6, com vários modelos fechados de fronteira acima dele (Qwen3.8 Max com 86,1, Claude Mythos 5 e Claude Fable 5 com 85,0, Claude Opus 4.8 com 83,4). Portanto, a expressão "state of the art" do artigo é uma afirmação sobre a própria configuração de avaliação, não um fato consolidado — diferentes harnesses, parsers de ação e a deriva dos autorrelatos fazem de 77,0 versus 82,6 uma questão que apenas uma reexecução independente pode resolver. Para contextualizar o que significa um modelo aberto de 27B atingir 77,0: ele ficaria acima da baseline de especialistas humanos de ~72,4 e acima de vários sistemas de fronteira maiores nesse mesmo ranking, incluindo Claude Opus 4.6 com 72,7 e Kimi K2.6 com 73,1.
Tencent não é novato neste território — lançou o POINTS-GUI-G, um modelo de grounding de GUI de 8B, em fevereiro de 2026, apresentou o assistente Marvis OS em maio e contribuiu para o projeto de uso de computador GUICrafter em junho. O UI-Mate é uma linha distinta voltada especificamente para o controle total da área de trabalho, sendo o primeiro dos agentes de GUI da Tencent a ser lançado como um modelo de fundação aberto, em vez de um componente de grounding ou um produto.
Como executá-lo
O modelo foi projetado para vLLM, e o card do modelo fornece o comando exato — `vllm serve tencent/UI-Mate-27B` com tamanho de tensor-parallel 2 e o template de chat compatível com OpenAI. Um detalhe prático se destaca: o agente retém cinco capturas de tela no contexto por padrão, então o servidor deve aceitar pelo menos seis imagens por prompt, pois a captura mais recente chega antes de a mais antiga ser recolhida. O sinalizador recomendado é `--limit-mm-per-prompt` com seis imagens e zero vídeo. O checkpoint guiado por demonstrações serve da mesma forma — seu card nomeia vLLM e SGLang por trás de um endpoint compatível com OpenAI.

Uma vez disponibilizado, uma classe de agente Python (UIMateAgent) recebe uma captura de tela e uma instrução e retorna a resposta juntamente com ações estruturadas, redimensionando as coordenadas de 1000×1000 de volta para a sua resolução. A página do projeto também oferece um aplicativo macOS Apple Silicon para o modo de demonstração guiada, que é a maneira mais fácil de experimentar o fluxo de trabalho "show it once" sem construir o harness você mesmo. O licenciamento é totalmente Apache-2.0, portanto, uso local, ajuste fino e integração comercial são todos permitidos.
Dois avisos devem acompanhar qualquer "como executar" para um agente de uso de computador, e ambos vêm da própria ficha do modelo. Use ambientes isolados ou descartáveis. Exija confirmação humana antes de qualquer coisa sensível, monitore a trajetória e não trate o sucesso relatado pelo modelo como prova de que o resultado pretendido realmente aconteceu. Agentes de GUI clicam errado, e a injeção de prompt por meio do conteúdo na tela é um modelo de ameaça real, não uma hipótese.
A stack em torno de um novo agente GUI.
Nenhum dos checkpoints do UI-Mate está no OrcaRouter ainda — a família tem apenas alguns dias, com zero downloads, e seu modelo base Qwen3.6-27B tampouco está. Não há API hospedada, então, se você quiser executar um deles esta semana, você mesmo terá que servir vLLM. Isso é aceitável para um laboratório, mas é o formato errado para produção.
Um pipeline de uso de computador em produção raramente é um único checkpoint. É um modelo de planejamento que decide a próxima intenção, um modelo de grounding ou visão que lê a tela, o próprio agente de GUI e um fallback barato quando uma subetapa falha — e todas essas peças são modelos servidos, mesmo quando o agente de GUI é local. Essa combinação é exatamente para o que serve uma camada de roteamento: uma API única para mais de 200 modelos hospedados, preço de tabela do provedor repassado com margem de 0% e failover automático para que uma indisponibilidade transitória em um provedor não trave uma execução longa do agente. O DSL de roteamento também permite compor vários modelos em uma única chamada — um planejador no início, um verificador barato no final — sem costurar provedores no seu próprio código. O resumo honesto é simples: o agente que opera o desktop é local, mas os modelos que decidem o que fazer ao redor dele são roteáveis, e testar com segurança checkpoints totalmente novos e não comprovados é exatamente para o que serve o failover.
O que assistir em seguida
Quatro coisas mudariam o cenário para o UI-Mate-27B, em ordem aproximada de importância:
• Uma re-execução independente de OSWorld-Verified e WindowsAgentArena. Em particular, a métrica da WAA é ou um grande feito ou um artefato do harness, e apenas uma avaliação externa resolve qual.
• O relatório técnico formal. A citação atual é um espaço reservado, e o artigo completo provavelmente revelará os detalhes do mecanismo de dados que o resumo apenas esboça.
• Anúncio da própria Tencent. Um lançamento repo-first como esse geralmente antecede algo — uma integração Marvis, uma oferta hospedada ou um impulso mais amplo de modelo aberto.
• Uma API hospedada. Os pesos dos três checkpoints agora são públicos, mas nada é servido em nenhum lugar — nenhum endpoint da Tencent, nenhum provedor de inferência terceirizado — então o self-hosting continua sendo o único caminho, e apenas um anúncio da Tencent ou a adoção por um provedor muda isso.
Perguntas Frequentes
O que é Tencent UI-Mate-27B?
UI-Mate-27B é um agente GUI fundamental de 27 bilhões de parâmetros, licenciado sob Apache-2.0, da Equipe de Agentes Multimodais HY Frontier da Tencent, ajustado a partir do Qwen3.6-27B. Ele observa capturas de tela da área de trabalho em tempo real, raciocina sobre elas e gera ações de mouse e teclado compatíveis com pyautogui. Foi lançado silenciosamente no Hugging Face em 14 de agosto de 2026 — juntamente com o irmão de 9B e o UI-Mate-democua-27B guiado por demonstrações — sem nenhum anúncio, e seus benchmarks são, até agora, inteiramente relatados pelo fornecedor.
Como a execução guiada por demonstração difere de reproduzir um script?
Em vez de executar uma macro gravada, o UI-Mate trata uma demonstração como um fluxo de trabalho legendado e estruturado em subtarefas, fornecido como orientação. A captura de tela ao vivo permanece autoritativa, de modo que, quando o layout, o conteúdo ou o estado do aplicativo difere do que foi mostrado, o modelo replaneja em vez de repetir coordenadas desatualizadas. Esse é o mecanismo por trás do salto alegado de 17.2 para 35.4 de sucesso estrito no subconjunto de autodemonstração — e ainda é uma alegação do fornecedor até que alguém a reproduza.
O UI-Mate-27B é realmente o estado da arte para agentes de GUI open-weight?
Isso depende inteiramente da configuração da avaliação. Seu 66.2 no WindowsAgentArena superaria os melhores resultados WAA reportados publicamente no início de 2026, mas seu 77.0 no OSWorld-Verified fica abaixo dos 82.6 do Holo3-35B-A3B de pesos abertos no ranking público. O artigo o chama de novo estado da arte de pesos abertos; uma re-execução independente em uma plataforma consistente é a única maneira de saber.
Posso rodar o UI-Mate-27B hoje?
Sim, se você mesmo o servir: baixe os pesos do Hugging Face — o checkpoint geral de 27B, o de 9B, ou o UI-Mate-democua-27B guiado por demonstração — execute o comando vLLM da ficha do modelo (tensor-parallel de tamanho 2, seis imagens por prompt) e use-o com o agente Python ou o aplicativo macOS. Não há API hospedada, e nenhum dos checkpoints está no OrcaRouter ainda — o que, para modelos tão novos e tão pouco verificados, é um motivo razoável para mantê-los em um ambiente isolado por enquanto.
A leitura certa do UI-Mate-27B não é {{1}}o vencedor{{/1}}, mas {{2}}algo que vale a pena acompanhar.{{/2}} Um modelo aberto de 27B que reivindica a liderança em WAA e entrega um fluxo de trabalho de demonstração one-shot é um dado significativo em um ano em que agentes de uso de computador com pesos abertos passaram de piada a algo ao alcance da fronteira. Agora que o checkpoint guiado por demonstração é composto por pesos públicos, em vez de um espaço reservado na página do projeto, o fluxo de trabalho {{3}}mostre uma vez{{/3}} é algo que você pode realmente executar. A Tencent já foi cautelosa com lançamentos no passado, e este tem a forma de um trabalho em andamento tornado público. Execute-o em um sandbox, rode novamente os benchmarks e continue de olho nos anúncios — a parte interessante desta história ainda está por vir.
