Um cartão de título herói para a comparação 'InternLumina-U2 vs Tencent UI-Mate-27B' com o subtítulo 'O agente de desktop que você pode executar agora vs o modelo de visão que você só pode ler' e três chips de estatística — 'UI-Mate-27B: opera um desktop hoje', 'InternLumina-U2: visão unificada, sem pesos', 'Ambos Apache-2.0, ambos não comprovados' — com o logotipo do OrcaRouter no canto inferior direito.
Guides & Insights

InternLumina-U2 vs Tencent UI-Mate-27B: O Agente de Desktop que Você Pode Executar Agora vs o Modelo de Visão Unificado que Você Só Pode Ler

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Tencent UI-Mate-27B e InternLumina-U2 são dois lançamentos discretos sob licença Apache-2.0 vindos de laboratórios chineses, publicados com duas semanas de diferença, e não são concorrentes — é exatamente por isso que vale a pena compará-los. O Tencent UI-Mate-27B, liberado com pesos abertos em 14 de agosto de 2026, é um agente de desktop: ele observa a tela e emite ações de mouse e teclado. O InternLumina-U2, publicado como código de inferência em 1º de setembro de 2026 pelo Shanghai AI Laboratory, é um pretenso modelo unificado de visão: afirma ler imagens, vídeo e 3D, além de gerar e editar imagens. Um age sobre o que vê; o outro, quando seus pesos finalmente existirem, falará e desenhará sobre o que vê. Se a sua tarefa é operar um desktop, apenas um desses dois pode fazê-lo hoje — e não é o que tem a arquitetura mais sofisticada.

O agente que atua: Tencent UI-Mate-27B

O UI-Mate-27B é um agente de GUI fundacional de pesos abertos com 27 bilhões de parâmetros, da equipe de agentes multimodais HY Frontier da Tencent, ajustado a partir do Qwen3.6-27B. Ele observa capturas de tela ao vivo, raciocina sobre o estado atual da tela e gera ações estruturadas de teclado e mouse em um espaço de coordenadas normalizado — o artefato de um modelo treinado para operar um desktop real, não para conversar a respeito de um. Sua característica distintiva é a execução guiada por demonstração: mostre a ele um fluxo de trabalho uma vez e ele adapta a demonstração gravada à tarefa em questão, tratando a captura de tela ao vivo como fonte autoritativa quando a interface difere do que foi registrado. Os principais números divulgados pela Tencent são OSWorld-Verified 77,0 e WindowsAgentArena 66,2 — números que liderariam esses rankings de 2026 se fossem reproduzidos de forma independente —, além de uma série de resultados do OSWorkerBench. Os pesos são reais e podem ser baixados: doze shards safetensors no Hugging Face, auto-hospedáveis via vLLM ou SGLang em um par de GPUs. A ficha do modelo traz uma ressalva importante: trata-se de um checkpoint de agente, e não de um modelo independente de chat visual — apontá-lo para “descreva esta imagem” é usá-lo de forma equivocada.

Os olhos prometidos: InternLumina-U2

InternLumina-U2 é uma espécie completamente diferente. É um modelo de difusão de mistura esparsa de especialistas com 16B de parâmetros (1B ativo) que o laboratório pretende como um único modelo para compreensão omni-visual, geração de imagens e edição de imagens — um design totalmente discreto de oito codebooks onde um único backbone tanto lê uma imagem, gráfico, vídeo ou ativo 3D quanto escreve novos pixels. Se o seu modelo mental é um agente de GUI, InternLumina-U2 é o polo oposto: não quer clicar em nada, quer entender tudo e desenhar sob demanda. Sua forma publicada em 1º de setembro de 2026 é código de inferência e uma arquitetura — seis pontos de entrada de tarefas em um repositório GitHub, uma página de projeto com uma tabela preliminar de benchmarks, um stub vazio do Hugging Face — e seus pesos, código de treinamento e relatório técnico ainda estão todos marcados como "em breve". Ninguém pode executá-lo. A diferença entre os dois modelos não é qualidade; é existência.

O placar

Os números da UI-Mate-27B são reportados pela Tencent e não reproduzidos; os da InternLumina-U2 são reportados em laboratório, preliminares e parciais. Cada linha traz sua procedência.

• Tarefa — Tencent UI-Mate-27B: operar uma área de trabalho — ler capturas de tela ao vivo, emitir ações de mouse e teclado. InternLumina-U2: perceber e criar — compreender imagens/vídeo/3D, gerar e editar imagens.

• Pesos — Tencent UI-Mate-27B: público desde 14 de agosto de 2026, doze shards safetensors, Apache-2.0. InternLumina-U2: não público — repositório Hugging Face vazio, pesos "em breve."

• Escala — modelo denso de 27B, ajustado a partir do Qwen3.6-27B, vs. modelo de difusão MoE esparso com total de 16B / 1B ativos.

• Saída — Tencent UI-Mate-27B: ações estruturadas compatíveis com pyautogui em um espaço de coordenadas normalizado. InternLumina-U2: afirma suportar texto, conversão de texto em imagem de até 1024×1024 e edição de imagens baseada em instruções.

• Números das manchetes — Tencent UI-Mate-27B: OSWorld-Verified 77,0, WindowsAgentArena 66,2, ganhos do OSWorkerBench a partir de demonstrações (todos informados pela Tencent). InternLumina-U2: ChartQA 86,52, GenEval 0,81, MathVision 33,22 (informados pelo laboratório, preliminares).

• Ressalva de procedência — Tencent UI-Mate-27B: o próprio card alerta que é um checkpoint de agente, não um modelo independente de chat visual. InternLumina-U2: a página do projeto rotula seus próprios resultados como "preliminares, parciais".

• Realidade do serviço — Tencent UI-Mate-27B: auto-hospedagem via vLLM ou SGLang em ~2 GPUs; nenhum provedor de inferência hospedada o implanta atualmente. InternLumina-U2: não pode ser servido por ninguém — o driver lançado espera checkpoints que não estão no repositório.

A comparison scoreboard for InternLumina-U2 and Tencent UI-Mate-27B: InternLumina-U2 with Job perceive & create visuals, Weights not public 'soon', Output text/images/edits, Headline ChartQA 86.5 (reported), Caveat untestable no weights, Serving no one can run it; Tencent UI-Mate-27B with Job operate a desktop, Weights public since Aug 14 2026, Output mouse & keyboard actions, Headline OSWorld 77.0 WAA 66.2, Caveat agent not visual chat, Serving self-host vLLM ~2 GPUs, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

Duas variações diferentes de algo não comprovado

Ambos os modelos não estão comprovados, e a palavra não significa a mesma coisa duas vezes. O Tencent UI-Mate-27B não está comprovado no sentido comum de um modelo novo: suas pontuações de destaque são do próprio fornecedor, ninguém as reproduziu de forma independente, e sua contagem de downloads é minúscula perto das alegações — a postura típica de um checkpoint que, à primeira vista, tinha quatro dias de existência e que desde então cultivou uma comunidade modesta. Mas ele não está comprovado de uma maneira testável. Como os pesos existem, os 66,2 e os 77,0 podem ser verificados esta semana por qualquer pessoa com duas GPUs e um ambiente de teste Windows, e as alegações baseadas em demonstrações podem ser reproduzidas ou refutadas em fluxos de trabalho reais. O InternLumina-U2 não está comprovado em um sentido mais estrito: não é testável. Sua arquitetura é pública e legível, seus números não são — não há artefato que possa confirmá-los, e a própria tabela parcial do laboratório já o mostra atrás de um rival nomeado em pelo menos um benchmark de geração. Um número de fornecedor anexado a um arquivo baixável é uma alegação à espera de um árbitro. Um número de fornecedor anexado a um roteiro é uma esperança.

A screenshot of the Hugging Face model page for tencent/UI-Mate-27B (captured August 27 2026), showing the Qwen3.6-27B base model, the vendor-reported OSWorld and WindowsAgentArena benchmark tags, and the note that no inference provider currently deploys the model.

O cartão Hugging Face do tencent/UI-Mate-27B, capturado em 27 de agosto de 2026 — a base Qwen3.6-27B, as pontuações OSWorld e WindowsAgentArena relatadas pelo fornecedor, e a nota de que nenhum provedor de inferência o implanta atualmente.

A divisão natural do trabalho: um ator e seus olhos

Postos lado a lado, os dois modelos esboçam o formato de um pipeline de automação confiável. O problema difícil com agentes de GUI não é o caso médio; é o agente que, silenciosamente, faz a coisa errada em um estado de tela inesperado e ninguém percebe. É exatamente para esse trabalho que existe um modelo de visão barato e confiável — verificar o estado da tela antes e depois de cada ação, confirmar que o diálogo que apareceu é o diálogo que o agente acha que apareceu, e interromper o ciclo quando a realidade e o modelo da realidade do agente divergem. O Tencent UI-Mate-27B é o ator; um modelo de visão unificado do tipo que a InternLumina-U2 afirma ser é o verificador natural, capaz de ler as mesmas capturas de tela em que o agente age. Quando — e somente quando — os pesos da InternLumina-U2 realmente chegarem e suas alegações de compreensão sobreviverem a testes independentes, esse é o papel que ela poderia desempenhar ao lado de um agente, em vez de contra ele. Os dois não são rivais por um trabalho; são as duas metades de um trabalho.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page and the per-task inference scripts, including the image-understanding entry point that would underpin a screen-state verifier.

O repositório GitHub InternLM/InternLumina-U2, capturado em 2 de setembro de 2026 — a página inicial do repositório mostrando os scripts de inferência por tarefa, incluindo o ponto de entrada de compreensão de imagem a partir do qual um verificador de estado de tela seria construído; os pesos que o tornariam executável não estão na árvore.

O que uma camada de roteamento faz por uma stack agente + olhos

Nenhum dos dois modelos está hospedado no OrcaRouter, e não vamos dar a entender o contrário — não há provedor algum que hospede o Tencent UI-Mate-27B, e o InternLumina-U2 não tem pesos que permitam a qualquer provedor hospedá-lo. O padrão de roteamento que se aplica é exatamente o desta arquitetura: um agente que age e um modelo de visão que verifica, compostos de modo que a etapa cara ou arriscada seja liberada pela etapa barata e confiável. A DSL de roteamento expressa isso como uma única chamada lógica — agir, verificar e então prosseguir ou parar — em vez de código de integração sob medida entre dois provedores de modelos, e o failover automático cobre o modo de falha realista: um agente de GUI como o UI-Mate-27B é exatamente o tipo de checkpoint não comprovado que você testa primeiro em um caminho de teste, com a chamada caindo para um modelo comprovado no momento em que o novo modelo se comporta mal. Uma única API para mais de 200 modelos hospedados, preço de tabela do provedor repassado com markup de 0%, e as partes não comprovadas da pilha mantidas atrás de barreiras de segurança enquanto conquistam sua confiança.

O resultado final

Se você está construindo algo que opera um desktop, o Tencent UI-Mate-27B é o único desses dois que existe em um sentido utilizável — executável hoje em suas próprias GPUs, com pontuações impressionantes, mas não reproduzidas, que você pode realmente ir testar. Se você está construindo algo que precisa de um modelo para entender e desenhar sobre o que vê, o InternLumina-U2 é uma arquitetura promissora aguardando seus pesos — vale a pena ler agora, vale nada como dependência até que os safetensors apareçam. Fique de olho nos dois para o dia em que a divisão de trabalho se tornar possível: um ator no seu desktop, um conjunto de olhos verificados observando-o e uma camada de roteamento mantendo-os honestos.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube