Um cartão de título hero para 'UI-Venus-2-9B vs Microsoft Mage-VL' com o subtítulo 'O agente de screenshots vs o observador do stream de codec', mostrando um selo azul '9B · AGENTE DE SCREENSHOT' com uma pílula 'age' e um selo ciano '4B · OBSERVADOR DE STREAM' com uma pílula 'descreve', e o logotipo OrcaRouter no canto inferior direito.
Guides & Insights

UI-Venus-2-9B vs Microsoft Mage-VL: O Agente de Captura de Tela vs o Observador de Fluxo de Codec

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

{{1}}UI-Venus-2-9B e Microsoft Mage-VL foram ambos lançados silenciosamente com um mês de diferença entre si — o repositório do Mage-VL apareceu em 26 de julho de 2026, e o do UI-Venus-2-9B em 26 de agosto de 2026 — ambos com pesos abertos sob licença Apache-2.0 e construídos sobre backbones da família Qwen.{{/1}} {{2}}É aproximadamente aí que terminam as semelhanças, e a diferença não é uma questão de grau, mas de qual lado da tela cada modelo habita.{{/2}} {{3}}O Microsoft Mage-VL é um modelo de percepção em streaming nativo de codec: observa vídeo comprimido, permanece em silêncio diante de cenas rotineiras e emite texto quando um evento é concluído.{{/3}} {{4}}O UI-Venus-2-9B é um agente de GUI: consome uma captura de tela estática, raciocina sobre o estado e emite uma ação estruturada.{{/4}} {{5}}Um observa a tela e a descreve; o outro observa a tela e a opera.{{/5}} {{6}}Escolher entre eles não é uma decisão de benchmark, porque eles não compartilham nenhum benchmark — é uma decisão sobre se a sua automação termina em uma resposta ou em uma ação.{{/6}}

O que cada modelo realmente é

Microsoft Mage-VL, lançado no repositório microsoft/Mage-VL sem anúncio, é um modelo multimodal de aproximadamente 4B de parâmetros construído a partir de um decodificador de linguagem Qwen3-4B-Instruct-2507, um codificador visual criado do zero chamado Mage-ViT e um gate de streaming separado de ~0.5B. Seu design é nativo de codec de vídeo: em vez de amostrar quadros uniformemente, ele mantém os quadros-âncora (I) completos e retém apenas os patches com saliência de movimento dos quadros previstos (P), o que, segundo a Microsoft, reduz o consumo de tokens visuais em mais de 75% e proporciona até 3.5× de aceleração de inferência em tempo de relógio em comparação com a amostragem uniforme. Um design de dois processos — o gate de cognição do Sistema 1 monitora cada janela deslizante do codec, e o VLM do Sistema 2 só é acionado quando um evento merece resposta — torna-o um observador de vídeo sempre ativo, que é barato justamente porque permanece em silêncio na maior parte do tempo.

UI-Venus-2-9B, lançado pela inclusionAI (o laboratório do Grupo Ant da equipe Venus), é um agente de GUI de propósito geral de 9B inicializado a partir do Qwen3.5-9B. Ele observa uma interface, raciocina sobre o estado da tarefa, executa uma ação e incorpora feedback — um loop fechado de observar–raciocinar–agir–feedback — e sua ficha técnica afirma cobertura de treinamento sobre aplicativos móveis, plataformas web e sistemas operacionais de desktop em um único checkpoint. Em sua própria ficha técnica, ele relata AndroidWorld 80.2, OSWorld-Verified 70.8, WebVoyager 90.8 e ScreenSpot-Pro 73.0, todos relatados pelo fornecedor e nenhum reproduzido de forma independente.

A lacuna de entrada: pixels que você captura vs um fluxo que você mantém

A diferença mais instrutiva é o que cada modelo consome. O UI-Venus-2-9B é um agente de capturas de tela: sua entrada é a tela atual, um frame por vez, e sua janela de contexto de 256 mil tokens é como ele mantém um histórico desses frames ao longo de uma tarefa longa. O Mage-VL é um agente de streaming: sua entrada é vídeo comprimido, e sua eficiência vem de tratar o movimento entre frames como dados — vetores de movimento e energia residual para codecs tradicionais, mapas de taxa aprendidos para os neurais. Essa é a diferença entre um modelo que vê momentos e um modelo que vê uma linha do tempo contínua. Um agente de capturas de tela é estruturalmente cego aos 100 milissegundos entre capturas — o spinner, a transição de carregamento, o estado de hover que só existe na tela por um breve momento. Um observador de stream vive dentro desse intervalo. Isso não é uma falha em nenhum dos dois designs; é por isso que um agente de GUI que precisa agir em uma tela ao vivo e um modelo de percepção que precisa resumir um feed são produtos diferentes com contratos de entrada diferentes.

A generated two-column scoreboard for 'UI-Venus-2-9B vs Microsoft Mage-VL': left column UI-Venus-2-9B — Job GUI agent acts on screens, Input still screenshots, Output structured actions, Size 9B, Serving vLLM OpenAI-compatible, Context 256K; right column Microsoft Mage-VL — Job stream watcher describes screens, Input compressed video codec streams, Output event-gated text, Size ~4B + 0.5B gate, Serving trust_remote_code custom, Context rolling codec window; footer 'Both vendor-reported; no shared benchmark.'

O hiato do produto: ações versus comentários

O lado da saída é onde os dois deixam de ser comparáveis. A saída do UI-Venus-2-9B é uma ação estruturada em um espaço de ação definido — mouse, teclado, rolagem, navegação — que ele emite após tokens de raciocínio no estilo Qwen3, e seu treinamento é construído em torno de tarefas de ancoragem e CAPTCHA que recompensam a localização precisa de elementos sob desordem visual. A saída do Mage-VL é texto: comentários controlados por eventos sobre o que ele vê. Ele não tem espaço de ação, nem chamada de função, nem loop de agente. Leia os dois cartões de modelo lado a lado e você estará olhando para lados opostos da linha percepção–ação — Mage-VL termina em uma descrição, UI-Venus-2-9B termina em um clique.

Trabalho — UI-Venus-2-9B: agente de GUI, opera a interface. Microsoft Mage-VL: percepção em streaming, descreve a interface.

Entrada — UI-Venus-2-9B: capturas de tela estáticas, histórico de 256K tokens. Microsoft Mage-VL: fluxos de codec de vídeo compactados, esparsidade de tokens com saliência de movimento.

Saída — UI-Venus-2-9B: ações estruturadas de mouse/teclado/navegação. Microsoft Mage-VL: comentários de texto controlados por eventos.

Tamanho — UI-Venus-2-9B: 9B. Microsoft Mage-VL: ~4B + ~0.5B streaming gate.

Backbone — UI-Venus-2-9B: Qwen3.5-9B. Microsoft Mage-VL: Qwen3-4B-Instruct-2507 mais Mage-ViT criado do zero.

Licença — ambos Apache-2.0 (as notas do card do Mage-VL indicam uso apenas para fins de pesquisa em seu repositório).

A lacuna de serviço

Aqui, o modelo mais novo e maior é o mais fácil de executar. O UI-Venus-2-9B documenta um único comando vLLM com uma janela de contexto de 256K e uma API padrão compatível com OpenAI. O Mage-VL exige trust_remote_code para executar o Python personalizado da Microsoft, além de FFmpeg, um caminho de neural-codec para vídeo e dependências como mamba-ssm, e ainda não tem uma stack de serving vLLM ou SGLang — sem paged attention, sem caminho de produção. A Microsoft relata cerca de 10,6 GB de parâmetros BF16 no total, o que significa que uma GPU de 16 GB é um piso realista para trabalhos com imagem e 24 GB+ para vídeo longo. Para uma equipe que quer colocar algo em produção hoje, o UI-Venus-2-9B tem a rampa de entrada mais limpa; para uma equipe que está construindo um pipeline de monitoramento ou sumarização sempre ativo, a stack de serving do Mage-VL é o que você está assumindo de qualquer forma, Python personalizado e tudo mais.

Um placar que não existe.

Não há um benchmark compartilhado entre esses dois modelos, e inventar um seria desonesto. Os números do UI-Venus-2-9B estão nos leaderboards de grounding em GUI, mobile, web e uso de computador (ScreenSpot-Pro 73.0, AndroidWorld 80.2, WebVoyager 90.8, OSWorld-Verified 70.8, todos relatados pelo fornecedor). Os números do Mage-VL estão nos leaderboards de compreensão de vídeo e espacial (Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, VSI-Bench +11.0 em relação ao Qwen3-VL-4B, todos relatados pelo fornecedor). A maneira correta de ler o confronto é como uma bifurcação na estrada: se a tarefa é "entender o que está acontecendo nesta tela ao longo do tempo", o Mage-VL é a ferramenta relevante e o UI-Venus-2-9B não foi feito para isso; se a tarefa é "fazer com que esta tela faça algo", o inverso é verdadeiro.

Onde os dois compõem

A versão interessante dessa comparação não é uma questão de ou/ou. Um agente de GUI operando um aplicativo em execução tem um ponto cego genuíno — o tempo entre capturas de tela e qualquer mudança de estado que nunca se estabiliza em um quadro estático — e um observador de stream nativo de codec é exatamente o tipo de modelo que poderia atuar como uma camada de percepção nessa lacuna, detectando que uma página terminou de carregar ou que um modal terminou de animar antes da próxima passada de grounding do agente. A Microsoft não construiu o Mage-VL para essa função, e o Ant Group não construiu o UI-Venus-2-9B para ser orientado por um segundo modelo, mas o encaixe é real. Para as partes dessa stack que já são de nível de produção — o LLM planejador que decompõe uma tarefa, o modelo de visão que verifica o estado de uma tela, o modelo de transcrição que registra a sessão de um agente — uma API com preço de repasse e failover automático é o que torna o experimento barato, e é para isso que serve um roteador. Nem o UI-Venus-2-9B nem o Microsoft Mage-VL são servidos hoje por meio do OrcaRouter; ambos são projetos auto-hospedados de pesos abertos, e ambos seriam oferecidos pelo preço de tabela do provedor se algum dia chegassem a um provedor roteado.

A screenshot of the Hugging Face model page for inclusionAI/UI-Venus-2-9B (captured August 27 2026) showing the model header with one like, the tags image-text-to-text, Transformers, Safetensors, qwen3_5, multimodal, gui, and the opening of the UI-Venus-2 model card.A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured August 27 2026) showing the model header, the tags image-text-to-text, Transformers, Safetensors, mage_vl, multimodal, vision-language-model, and the opening of the Mage-VL model card.

Quem deve escolher qual

Choose Microsoft Mage-VL when your problem is continuous perception — a camera feed, a screen recording, a stream you need summarized or monitored in real time, cheaply enough to keep running. Choose UI-Venus-2-9B when your problem is control — a task that ends in a completed action, a filled form, a navigated flow, an operated application. And if your automation genuinely needs both — perceive the stream, then act on the still — run them as a pair and treat the stream watcher as the event detector feeding a screenshot agent the moments worth acting on. They are two halves of the same screen, not competitors for the same job.