Um card de título hero gerado para 'MiniCPM-V 4.7 vs UI-Venus 2.9B' com o subtítulo 'Um modelo de visão generalista contra um agente GUI criado especificamente', um card à esquerda com o texto 'UI-Venus 2.9B: grounding, CAPTCHA, mobile, web, uso de computador', um card à direita com o texto 'MiniCPM-V 4.7: 35.2B sparse, sem card, sem benchmarks' e uma pílula com o texto 'Um especialista contra um generalista não medido', com o logo da OrcaRouter no canto inferior direito.
Guides & Insights

MiniCPM-V 4.7 vs UI-Venus 2.9B: um modelo de visão geral contra um agente GUI criado para fins específicos

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

MiniCPM-V 4.7 e UI-Venus 2.9B são ambos modelos de visão-linguagem que olham para uma captura de tela e produzem texto, e aí termina a semelhança — porque um deles foi criado exatamente para essa tarefa. O UI-Venus 2.9B é um agente GUI de uso geral da inclusionAI, lançado em 26 de agosto de 2026, cujo design inteiro se concentra em observar uma interface, raciocinar sobre o estado da tarefa, emitir uma ação e incorporar o feedback resultante; ele vem acompanhado de um relatório técnico, tabelas de benchmark em tarefas de grounding de GUI, mobile, web, computer-use e CAPTCHA, e uma avaliação explícita de com que frequência é possível convencê-lo a executar uma ação perigosa. O MiniCPM-V 4.7 é um checkpoint de mistura de especialistas esparsa com 35,2 bilhões de parâmetros enviado pela OpenBMB em 6 de outubro de 2026, sem cartão de modelo, sem licença e sem benchmark. Comparar um especialista com um generalista não medido é um exercício um tanto incomum, e esta página é explícita sobre onde a comparação se sustenta e onde não.

Dois tipos de lançamento muito diferentes

UI-Venus 2.9B é inclusionAI/UI-Venus-2-9B, um modelo de 9B parâmetros inicializado a partir do Qwen3.5-9B e pós-treinado especificamente como um agente de GUI. A ficha descreve um ciclo fechado — observar a interface, raciocinar sobre o estado da tarefa, executar uma ação, incorporar o feedback na próxima decisão — treinado em três estágios: treinamento intermediário multimodal em trajetórias simuladas de mobile, web e desktop em larga escala; aprendizado por reforço offline dividido em cinco famílias de tarefas; e destilação on-policy com múltiplos professores que consolida professores especializados por domínio em uma única política. Ele é avaliado em benchmarks de grounding de GUI, mobile, web, uso de computador e CAPTCHA, e separadamente em segurança de ações consequenciais: a ficha relata uma taxa de sucesso de ataque de 11,3% no OSHarm e 48,8% no OSBlind contra 25,3% e 79,4% para sua base Qwen3.5-9B. O irmão da própria OpenBMB, aliás, analisou terreno semelhante: a organização MiniCPM tem um projeto AgentCPM-GUI de janeiro de 2026, então este é um nicho em que ambos os laboratórios entraram.

O MiniCPM-V 4.7 é openbmb/MiniCPM-V-4.7-35B-A3B, com 35.212.875.824 parâmetros BF16 em 70,4 GB e dezesseis fragmentos, enviado em 6 de outubro de 2026.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs UI-Venus 2.9B — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Purpose general vision, Grounding not documented, Safety ASR not evaluated, Context 256K, Evidence config file only. Right column 'UI-Venus 2.9B' lists Parameters 9.4B dense, Purpose GUI agent, Grounding core training task, Safety ASR 11.3% OSHarm, Context 256K served, Evidence technical report. The footer reads 'UI-Venus figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

Backbone de texto MoE esparso com a tag qwen3_5_moe_text — 256 especialistas, 8 por token — mais de 40 camadas com um padrão de atenção de três lineares para uma completa, uma torre de visão interna de 27 camadas com subamostragem de 16× e até nove fatias de imagem, e uma janela de contexto de 256K. Sem README, portanto sem licença e sem benchmarks. Três curtidas, zero downloads, discussões vazias.

A comparação, com as lacunas deixadas em aberto

• Finalidade — UI-Venus 2.9B: um agente de GUI, treinado de ponta a ponta para interação com interfaces. MiniCPM-V 4.7: um modelo geral de visão-linguagem; não é indicado para que é otimizado.

• Parâmetros — UI-Venus 2.9B: 9,41B, denso. MiniCPM-V 4.7: 35,2B no total, esparso, 8 de 256 especialistas por token.

• Modelo base — UI-Venus 2.9B: inicializado a partir do Qwen3.5-9B, uma pilha de texto Qwen densa. MiniCPM-V 4.7: uma pilha de texto MoE derivada do Qwen3.5, classe qwen3_5_moe_text. Ramos diferentes da mesma árvore genealógica.

• Grounding de interface — UI-Venus 2.9B: a competência central, com famílias de tarefas dedicadas de grounding e CAPTCHA no treinamento e um sistema de verificação baseado em pontos-chave usando votação multi-modelo. MiniCPM-V 4.7: nenhuma alegação específica de grounding e nenhum formato de saída de coordenadas documentado.

• Avaliação de segurança — UI-Venus 2.9B: relata ASR de 11,3% no OSHarm e 48,8% no OSBlind. MiniCPM-V 4.7: nenhum.

• Evidência — UI-Venus 2.9B: um relatório técnico no arXiv, uma página do projeto, um repositório do GitHub e tabelas de benchmark. MiniCPM-V 4.7: um arquivo de configuração.

• Ferramentas — UI-Venus 2.9B: início rápido com vLLM com uma flag de parser de raciocínio, além de conversões GGUF da comunidade. MiniCPM-V 4.7: nada ainda.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

Por que um agente GUI não é apenas "um VLM que olha para telas"

A diferença entre estes dois modelos não está principalmente na contagem de parâmetros, e vale a pena explicitá-la, porque é isso que torna o confronto interessante, em vez de meramente desequilibrado.

Uma tarefa de captura de ecrã tem uma propriedade que a maioria dos benchmarks de visão não tem: a saída tem de ser executável. Quando se pede ao UI-Venus 2.9B para tocar num botão, ele tem de emitir uma coordenada ou uma ação estruturada que o ambiente consiga realmente aplicar, e um pequeno erro de ancoragem não é uma resposta errada numa tabela de classificação, é uma tarefa falhada e um estado corrompido. É por isso que o cartão do UI-Venus 2 dedica tanto da sua extensão à verificação: a conclusão da tarefa é avaliada com base em pontos-chave visuais relevantes para a tarefa, em vez de um olhar holístico ao ecrã final, e juízes heterogéneos votam para reduzir o viés de um único juiz. O objetivo dessa maquinaria é tornar o sinal de recompensa da aprendizagem por reforço robusto ao reward hacking — um modelo que aprende a satisfazer um verificador preguiçoso em vez de concluir a tarefa.

Também explica a seção de segurança.

A screenshot of the Hugging Face model page for inclusionAI/UI-Venus-2-9B (captured 7 October 2026) showing the model header, the qwen3_5, multimodal, gui and agent tags, and the opening of the UI-Venus-2 card describing a general-purpose foundation GUI agent that operates across mobile applications, web platforms and desktop operating systems.

Um agente capaz de operar um telefone ou um desktop tem uma superfície de ataque que um modelo de legendas não tem, e relatar uma taxa de sucesso de ataque é o mínimo que um laboratório deveria fazer quando possui um. O UI-Venus 2.9B relata 11,3% no OSHarm e 48,8% no OSBlind — o segundo número é alto em termos absolutos, e o enquadramento do cartão é uma comparação com seu modelo base, e não uma alegação absoluta de robustez. Leia isso como "significativamente melhor do que onde começou", não como "seguro".

A arquitetura do MiniCPM-V 4.7 não tem nada a dizer sobre nada disso. A atenção linear sobre um contexto longo ajudaria um agente que precisa se lembrar de um histórico de interação longo, e o MoE esparso ajudaria na vazão se você estiver executando muitos episódios. Mas uma arquitetura que seria útil para um agente não é um agente, e nenhuma parte do artefato divulgado documenta a saída de ações, a precisão de grounding ou o comportamento de segurança.

A avaliação honesta do lado do MiniCPM

É tentador preencher esta secção com os números do 4.6. Resista a isso. O MiniCPM-V 4.6 é um modelo denso de 1,3B sobre um backbone Qwen3.5-0.8B com um esquema de compressão visual comutável de 4x/16x, e os seus resultados anunciados — uma pontuação de 13 no Artificial Analysis Intelligence Index, relatada pelo fornecedor, a uma fração do custo de tokens de modelos pequenos comparáveis — descrevem esse modelo. O MiniCPM-V 4.7 muda o backbone, muda o padrão de atenção e muda a compressão visual predefinida. Nenhuma das medições do 4.6 é transferível, e nenhuma delas descreve um agente GUI em primeiro lugar.

O que se pode dizer honestamente sobre o MiniCPM-V 4.7 é limitado e factual: os pesos existem, o formato é incomum para a família, a janela de contexto é longa e o lançamento está incompleto. A ausência de uma licença é o obstáculo prático; a ausência de benchmarks é o obstáculo avaliativo. E há um motivo modesto para interesse em vez de indiferença — a OpenBMB desenvolve ferramentas de GUI, entre elas o AgentCPM-GUI, então um modelo de visão MoE esparso de contexto longo desse laboratório não é implausível como futura espinha dorsal de agentes. Isso é uma hipótese sobre intenção, e o repositório não a confirma.

O que você escolheria, e quando

Para qualquer coisa que envolva uma captura de tela e uma ação — tocar, digitar, rolar, navegar em um app ou site, extrair dados de uma UI —, o UI-Venus 2.9B é o único dos dois que aborda a tarefa. Ele tem o treinamento, o mecanismo de verificação, os números de segurança reportados e ferramentas suficientes para subi-lo no vLLM hoje. Nada no MiniCPM-V 4.7 sugere que ele esteja competindo nesse espaço, e sem um card você não consegue nem verificar se ele emite coordenadas.

Para trabalho multimodal geral — descrever imagens, ler documentos, análise de contexto longo sobre material com muitas imagens —, a comparação ainda não é decidível, porque um dos lados não tem evidências de qualidade publicadas. Se você precisa disso hoje, o UI-Venus 2.9B é pelo menos mensurável, embora tenha sido ajustado para interfaces em vez de raciocínio sobre documentos e também não seja uma escolha óbvia para essa tarefa.

O padrão nos dois casos é o mesmo: um modelo auto-hospedado que cuida do trabalho rotineiro e um modelo de fronteira hospedado para os casos difíceis que ele repassa. É nesse repasse que um roteador justifica seu lugar — uma única chave para mais de 200 modelos hospedados, cada um repassado pelo preço de tabela do provedor, sem nenhuma margem nossa, com failover automático quando um provedor apresenta degradação. Nem o UI-Venus 2.9B nem o MiniCPM-V 4.7 são hospedados no OrcaRouter; ambos são pesos que você mesmo executa. O roteador é com quem seu agente conversa quando decide que o modelo local não é suficiente.

Onde isso te deixa

Isto não é uma decisão apertada, e a razão é estrutural e não um juízo sobre a qualidade. O UI-Venus 2.9B é um especialista com um relatório, uma licença, tabelas de benchmark, avaliação de segurança e uma receita de serving. O MiniCPM-V 4.7 é um generalista com um arquivo de configuração. Um deles é um produto e o outro é uma promessa, e a única forma responsável de os comparar é dizer isso. Fique de olho no repositório: se a OpenBMB publicar um card que mostre interface grounding e saída de ações, então um MoE esparso com contexto de 256K contra um agente destilado de 9B torna-se uma questão genuinamente interessante. Até então, a resposta a "qual devo usar" é a que existe.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente