
InternLumina-U2 vs Tencent UI-Mate-27B: O Agente de Desktop que Você Pode Executar Agora vs o Modelo de Visão Unificado que Você Só Pode Ler
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
Tencent UI-Mate-27B e InternLumina-U2 são dois lançamentos discretos sob licença Apache-2.0 vindos de laboratórios chineses, publicados com duas semanas de diferença, e não são concorrentes — é exatamente por isso que vale a pena compará-los. O Tencent UI-Mate-27B, liberado com pesos abertos em 14 de agosto de 2026, é um agente de desktop: ele observa a tela e emite ações de mouse e teclado. O InternLumina-U2, publicado como código de inferência em 1º de setembro de 2026 pelo Shanghai AI Laboratory, é um pretenso modelo unificado de visão: afirma ler imagens, vídeo e 3D, além de gerar e editar imagens. Um age sobre o que vê; o outro, quando seus pesos finalmente existirem, falará e desenhará sobre o que vê. Se a sua tarefa é operar um desktop, apenas um desses dois pode fazê-lo hoje — e não é o que tem a arquitetura mais sofisticada.
O agente que atua: Tencent UI-Mate-27B
O UI-Mate-27B é um agente de GUI fundacional de pesos abertos com 27 bilhões de parâmetros, da equipe de agentes multimodais HY Frontier da Tencent, ajustado a partir do Qwen3.6-27B. Ele observa capturas de tela ao vivo, raciocina sobre o estado atual da tela e gera ações estruturadas de teclado e mouse em um espaço de coordenadas normalizado — o artefato de um modelo treinado para operar um desktop real, não para conversar a respeito de um. Sua característica distintiva é a execução guiada por demonstração: mostre a ele um fluxo de trabalho uma vez e ele adapta a demonstração gravada à tarefa em questão, tratando a captura de tela ao vivo como fonte autoritativa quando a interface difere do que foi registrado. Os principais números divulgados pela Tencent são OSWorld-Verified 77,0 e WindowsAgentArena 66,2 — números que liderariam esses rankings de 2026 se fossem reproduzidos de forma independente —, além de uma série de resultados do OSWorkerBench. Os pesos são reais e podem ser baixados: doze shards safetensors no Hugging Face, auto-hospedáveis via vLLM ou SGLang em um par de GPUs. A ficha do modelo traz uma ressalva importante: trata-se de um checkpoint de agente, e não de um modelo independente de chat visual — apontá-lo para “descreva esta imagem” é usá-lo de forma equivocada.
Os olhos prometidos: InternLumina-U2
InternLumina-U2 é uma espécie completamente diferente. É um modelo de difusão de mistura esparsa de especialistas com 16B de parâmetros (1B ativo) que o laboratório pretende como um único modelo para compreensão omni-visual, geração de imagens e edição de imagens — um design totalmente discreto de oito codebooks onde um único backbone tanto lê uma imagem, gráfico, vídeo ou ativo 3D quanto escreve novos pixels. Se o seu modelo mental é um agente de GUI, InternLumina-U2 é o polo oposto: não quer clicar em nada, quer entender tudo e desenhar sob demanda. Sua forma publicada em 1º de setembro de 2026 é código de inferência e uma arquitetura — seis pontos de entrada de tarefas em um repositório GitHub, uma página de projeto com uma tabela preliminar de benchmarks, um stub vazio do Hugging Face — e seus pesos, código de treinamento e relatório técnico ainda estão todos marcados como "em breve". Ninguém pode executá-lo. A diferença entre os dois modelos não é qualidade; é existência.
O placar
Os números da UI-Mate-27B são reportados pela Tencent e não reproduzidos; os da InternLumina-U2 são reportados em laboratório, preliminares e parciais. Cada linha traz sua procedência.
• Tarefa — Tencent UI-Mate-27B: operar uma área de trabalho — ler capturas de tela ao vivo, emitir ações de mouse e teclado. InternLumina-U2: perceber e criar — compreender imagens/vídeo/3D, gerar e editar imagens.
• Pesos — Tencent UI-Mate-27B: público desde 14 de agosto de 2026, doze shards safetensors, Apache-2.0. InternLumina-U2: não público — repositório Hugging Face vazio, pesos "em breve."
• Escala — modelo denso de 27B, ajustado a partir do Qwen3.6-27B, vs. modelo de difusão MoE esparso com total de 16B / 1B ativos.
• Saída — Tencent UI-Mate-27B: ações estruturadas compatíveis com pyautogui em um espaço de coordenadas normalizado. InternLumina-U2: afirma suportar texto, conversão de texto em imagem de até 1024×1024 e edição de imagens baseada em instruções.
• Números das manchetes — Tencent UI-Mate-27B: OSWorld-Verified 77,0, WindowsAgentArena 66,2, ganhos do OSWorkerBench a partir de demonstrações (todos informados pela Tencent). InternLumina-U2: ChartQA 86,52, GenEval 0,81, MathVision 33,22 (informados pelo laboratório, preliminares).
• Ressalva de procedência — Tencent UI-Mate-27B: o próprio card alerta que é um checkpoint de agente, não um modelo independente de chat visual. InternLumina-U2: a página do projeto rotula seus próprios resultados como "preliminares, parciais".
• Realidade do serviço — Tencent UI-Mate-27B: auto-hospedagem via vLLM ou SGLang em ~2 GPUs; nenhum provedor de inferência hospedada o implanta atualmente. InternLumina-U2: não pode ser servido por ninguém — o driver lançado espera checkpoints que não estão no repositório.

Duas variações diferentes de algo não comprovado
Ambos os modelos não estão comprovados, e a palavra não significa a mesma coisa duas vezes. O Tencent UI-Mate-27B não está comprovado no sentido comum de um modelo novo: suas pontuações de destaque são do próprio fornecedor, ninguém as reproduziu de forma independente, e sua contagem de downloads é minúscula perto das alegações — a postura típica de um checkpoint que, à primeira vista, tinha quatro dias de existência e que desde então cultivou uma comunidade modesta. Mas ele não está comprovado de uma maneira testável. Como os pesos existem, os 66,2 e os 77,0 podem ser verificados esta semana por qualquer pessoa com duas GPUs e um ambiente de teste Windows, e as alegações baseadas em demonstrações podem ser reproduzidas ou refutadas em fluxos de trabalho reais. O InternLumina-U2 não está comprovado em um sentido mais estrito: não é testável. Sua arquitetura é pública e legível, seus números não são — não há artefato que possa confirmá-los, e a própria tabela parcial do laboratório já o mostra atrás de um rival nomeado em pelo menos um benchmark de geração. Um número de fornecedor anexado a um arquivo baixável é uma alegação à espera de um árbitro. Um número de fornecedor anexado a um roteiro é uma esperança.

O cartão Hugging Face do tencent/UI-Mate-27B, capturado em 27 de agosto de 2026 — a base Qwen3.6-27B, as pontuações OSWorld e WindowsAgentArena relatadas pelo fornecedor, e a nota de que nenhum provedor de inferência o implanta atualmente.
A divisão natural do trabalho: um ator e seus olhos
Postos lado a lado, os dois modelos esboçam o formato de um pipeline de automação confiável. O problema difícil com agentes de GUI não é o caso médio; é o agente que, silenciosamente, faz a coisa errada em um estado de tela inesperado e ninguém percebe. É exatamente para esse trabalho que existe um modelo de visão barato e confiável — verificar o estado da tela antes e depois de cada ação, confirmar que o diálogo que apareceu é o diálogo que o agente acha que apareceu, e interromper o ciclo quando a realidade e o modelo da realidade do agente divergem. O Tencent UI-Mate-27B é o ator; um modelo de visão unificado do tipo que a InternLumina-U2 afirma ser é o verificador natural, capaz de ler as mesmas capturas de tela em que o agente age. Quando — e somente quando — os pesos da InternLumina-U2 realmente chegarem e suas alegações de compreensão sobreviverem a testes independentes, esse é o papel que ela poderia desempenhar ao lado de um agente, em vez de contra ele. Os dois não são rivais por um trabalho; são as duas metades de um trabalho.

O repositório GitHub InternLM/InternLumina-U2, capturado em 2 de setembro de 2026 — a página inicial do repositório mostrando os scripts de inferência por tarefa, incluindo o ponto de entrada de compreensão de imagem a partir do qual um verificador de estado de tela seria construído; os pesos que o tornariam executável não estão na árvore.
O que uma camada de roteamento faz por uma stack agente + olhos
Nenhum dos dois modelos está hospedado no OrcaRouter, e não vamos dar a entender o contrário — não há provedor algum que hospede o Tencent UI-Mate-27B, e o InternLumina-U2 não tem pesos que permitam a qualquer provedor hospedá-lo. O padrão de roteamento que se aplica é exatamente o desta arquitetura: um agente que age e um modelo de visão que verifica, compostos de modo que a etapa cara ou arriscada seja liberada pela etapa barata e confiável. A DSL de roteamento expressa isso como uma única chamada lógica — agir, verificar e então prosseguir ou parar — em vez de código de integração sob medida entre dois provedores de modelos, e o failover automático cobre o modo de falha realista: um agente de GUI como o UI-Mate-27B é exatamente o tipo de checkpoint não comprovado que você testa primeiro em um caminho de teste, com a chamada caindo para um modelo comprovado no momento em que o novo modelo se comporta mal. Uma única API para mais de 200 modelos hospedados, preço de tabela do provedor repassado com markup de 0%, e as partes não comprovadas da pilha mantidas atrás de barreiras de segurança enquanto conquistam sua confiança.
O resultado final
Se você está construindo algo que opera um desktop, o Tencent UI-Mate-27B é o único desses dois que existe em um sentido utilizável — executável hoje em suas próprias GPUs, com pontuações impressionantes, mas não reproduzidas, que você pode realmente ir testar. Se você está construindo algo que precisa de um modelo para entender e desenhar sobre o que vê, o InternLumina-U2 é uma arquitetura promissora aguardando seus pesos — vale a pena ler agora, vale nada como dependência até que os safetensors apareçam. Fique de olho nos dois para o dia em que a divisão de trabalho se tornar possível: um ator no seu desktop, um conjunto de olhos verificados observando-o e uma camada de roteamento mantendo-os honestos.
