Una tarjeta de título principal generada para «MiniCPM-V 4.7 vs UI-Venus 2.9B» con el subtítulo «Un modelo de visión general frente a un agente GUI creado a propósito», una tarjeta izquierda que dice «UI-Venus 2.9B: grounding, CAPTCHA, móvil, web, uso de computadora», una tarjeta derecha que dice «MiniCPM-V 4.7: 35.2B disperso, sin tarjeta, sin benchmarks» y una píldora que dice «Un especialista frente a un generalista no medido», con el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

MiniCPM-V 4.7 vs UI-Venus 2.9B: un modelo de visión general frente a un agente GUI de propósito específico

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

MiniCPM-V 4.7 y UI-Venus 2.9B son ambos modelos de visión-lenguaje que observan una captura de pantalla y producen texto, y ahí termina el parecido — porque uno de ellos fue construido exactamente para esa tarea. UI-Venus 2.9B es un agente GUI de propósito general de inclusionAI, publicado el 26 de agosto de 2026, cuyo diseño completo se centra en observar una interfaz, razonar sobre el estado de la tarea, emitir una acción e incorporar la retroalimentación resultante; incluye un informe técnico, tablas de benchmark de tareas de grounding de GUI, móviles, web, uso de computadora y CAPTCHA, y una evaluación explícita de con qué frecuencia se puede convencer para que realice una acción peligrosa. MiniCPM-V 4.7 es un checkpoint de mezcla dispersa de expertos de 35,2 mil millones de parámetros subido por OpenBMB el 6 de octubre de 2026, sin tarjeta de modelo, sin licencia y sin benchmark. Comparar a un especialista con un generalista no medido es un ejercicio algo inusual, y esta página es explícita sobre dónde se sostiene la comparación y dónde no.

Dos tipos de lanzamiento muy diferentes

UI-Venus 2.9B es inclusionAI/UI-Venus-2-9B, un modelo de 9B parámetros inicializado a partir de Qwen3.5-9B y post-entrenado específicamente como agente GUI. La tarjeta describe un bucle cerrado — observar la interfaz, razonar sobre el estado de la tarea, ejecutar una acción, incorporar la retroalimentación en la siguiente decisión — entrenado en tres etapas: entrenamiento intermedio multimodal sobre trayectorias simuladas a gran escala de móvil, web y escritorio; aprendizaje por refuerzo offline dividido en cinco familias de tareas; y destilación on-policy con múltiples maestros que consolida maestros especializados en dominios en una única política. Se evalúa en benchmarks de grounding de GUI, móvil, web, uso de computadora y CAPTCHA, y por separado en seguridad de acciones consecuentes: la tarjeta reporta una tasa de éxito de ataque del 11,3% en OSHarm y del 48,8% en OSBlind frente al 25,3% y 79,4% de su base Qwen3.5-9B. El propio proyecto hermano de OpenBMB, por cierto, examinó un terreno similar: la organización MiniCPM tiene un proyecto AgentCPM-GUI de enero de 2026, por lo que este es un carril en el que ambos laboratorios han entrado.

MiniCPM-V 4.7 es openbmb/MiniCPM-V-4.7-35B-A3B, 35.212.875.824 parámetros BF16 repartidos en 70,4 GB y dieciséis fragmentos, subido el 6 de octubre de 2026.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs UI-Venus 2.9B — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Purpose general vision, Grounding not documented, Safety ASR not evaluated, Context 256K, Evidence config file only. Right column 'UI-Venus 2.9B' lists Parameters 9.4B dense, Purpose GUI agent, Grounding core training task, Safety ASR 11.3% OSHarm, Context 256K served, Evidence technical report. The footer reads 'UI-Venus figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

Backbone de texto MoE disperso etiquetado como qwen3_5_moe_text — 256 expertos, 8 por token — más de 40 capas con un patrón de atención de tres lineales a una completa, una torre de visión propia de 27 capas con submuestreo de 16× y hasta nueve fragmentos de imagen, y una ventana de contexto de 256K. Sin README, por lo tanto, sin licencia y sin benchmarks. Tres me gusta, cero descargas, discusiones vacías.

La comparación, con los huecos dejados abiertos

• Propósito — UI-Venus 2.9B: un agente de GUI, entrenado de extremo a extremo para la interacción con interfaces. MiniCPM-V 4.7: un modelo general de visión-lenguaje; no se indica para qué está optimizado.

• Parámetros — UI-Venus 2.9B: 9.41B, denso. MiniCPM-V 4.7: 35.2B en total, disperso, 8 de 256 expertos por token.

• Modelo base — UI-Venus 2.9B: inicializado a partir de Qwen3.5-9B, un stack de texto denso de Qwen. MiniCPM-V 4.7: un stack de texto MoE derivado de Qwen3.5, clase qwen3_5_moe_text. Diferentes ramas del mismo árbol genealógico.

• Anclaje de interfaz — UI-Venus 2.9B: la competencia central, con familias de tareas dedicadas de anclaje y CAPTCHA en el entrenamiento y un sistema de verificación anclado en puntos clave que utiliza votación multi-modelo. MiniCPM-V 4.7: ninguna afirmación específica de anclaje, y ningún formato de salida de coordenadas documentado.

• Evaluación de seguridad — UI-Venus 2.9B: reporta un ASR del 11,3 % en OSHarm y del 48,8 % en OSBlind. MiniCPM-V 4.7: ninguno.

• Evidencia — UI-Venus 2.9B: un informe técnico en arXiv, una página de proyecto, un repositorio de GitHub y tablas de benchmarks. MiniCPM-V 4.7: un archivo de configuración.

• Herramientas — UI-Venus 2.9B: inicio rápido con vLLM mediante un flag de analizador de razonamiento, además de conversiones GGUF de la comunidad. MiniCPM-V 4.7: todavía nada.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

Por qué un agente GUI no es solo «un VLM que mira pantallas»

La diferencia entre estos dos modelos no radica principalmente en el número de parámetros, y vale la pena explicarlo con claridad porque es lo que hace que el enfrentamiento sea interesante en lugar de meramente desigual.

Una tarea de captura de pantalla tiene una propiedad que la mayoría de los benchmarks de visión no tiene: la salida tiene que ser ejecutable. Cuando a UI-Venus 2.9B se le pide que toque un botón, tiene que emitir una coordenada o una acción estructurada que el entorno pueda aplicar realmente, y un pequeño error de anclaje no es una respuesta incorrecta en una tabla de clasificación, sino una tarea fallida y un estado corrupto. Por eso la tarjeta de UI-Venus 2 dedica buena parte de su extensión a la verificación: la finalización de la tarea se juzga según puntos clave visuales relevantes para la tarea en lugar de un vistazo holístico a la pantalla final, y jueces heterogéneos votan para reducir el sesgo de un único juez. El propósito de ese mecanismo es hacer que la señal de recompensa del aprendizaje por refuerzo sea robusta frente al reward hacking —un modelo que aprende a satisfacer a un verificador perezoso en lugar de completar la tarea.

También explica la sección de seguridad.

A screenshot of the Hugging Face model page for inclusionAI/UI-Venus-2-9B (captured 7 October 2026) showing the model header, the qwen3_5, multimodal, gui and agent tags, and the opening of the UI-Venus-2 card describing a general-purpose foundation GUI agent that operates across mobile applications, web platforms and desktop operating systems.

Un agente capaz de operar un teléfono o una computadora de escritorio tiene una superficie de ataque que un modelo de subtitulado no tiene, e informar una tasa de éxito de ataques es lo mínimo que un laboratorio debería hacer al lanzar uno. UI-Venus 2.9B reporta 11,3 % en OSHarm y 48,8 % en OSBlind —la segunda cifra es alta en términos absolutos, y el enfoque de la ficha es una comparación con su modelo base en lugar de una afirmación absoluta de robustez. Léelo como “significativamente mejor que donde empezó”, no como “seguro”.

La arquitectura de MiniCPM-V 4.7 no tiene nada que decir sobre nada de esto. La atención lineal sobre un contexto largo ayudaría a un agente que tiene que recordar un historial de interacción extenso, y el MoE disperso ayudaría al rendimiento si se ejecutan muchos episodios. Pero una arquitectura que sería útil para un agente no es un agente, y ninguna parte del artefacto publicado documenta la salida de acciones, la precisión del anclaje ni el comportamiento de seguridad.

La evaluación honesta del lado de MiniCPM

Es tentador llenar esta sección con las cifras de 4.6. Resístete. MiniCPM-V 4.6 es un modelo denso de 1.3B sobre un backbone Qwen3.5-0.8B con un esquema de compresión visual conmutable 4x/16x, y sus resultados anunciados —una puntuación de 13 en el Artificial Analysis Intelligence Index, reportada por el proveedor, a una fracción del coste en tokens de modelos pequeños comparables— describen a ese modelo. MiniCPM-V 4.7 cambia el backbone, cambia el patrón de atención y cambia la compresión visual predeterminada. Ninguna de las mediciones de 4.6 es transferible, y ninguna de ellas describe a un agente de GUI en primer lugar.

Lo que honestamente se puede decir sobre MiniCPM-V 4.7 es limitado y fáctico: los pesos existen, la forma es inusual para la familia, la ventana de contexto es larga y la publicación está incompleta. La ausencia de una licencia es el obstáculo práctico; la ausencia de benchmarks es el evaluativo. Y hay una modesta razón para el interés en lugar de la indiferencia: OpenBMB desarrolla herramientas de GUI, entre ellas AgentCPM-GUI, así que un modelo de visión MoE disperso de contexto largo de ese laboratorio no es inverosímil como futura columna vertebral de agentes. Esa es una hipótesis sobre la intención, y el repositorio no la confirma.

Qué elegirías, y cuándo

Para cualquier cosa que implique una captura de pantalla y una acción —tocar, escribir, desplazarse, navegar por una aplicación o un sitio web, extraer datos de una interfaz de usuario—, UI-Venus 2.9B es el único de los dos que aborda la tarea. Tiene el entrenamiento, la maquinaria de verificación, las cifras de seguridad reportadas y suficientes herramientas para ponerlo en marcha en vLLM hoy mismo. Nada en MiniCPM-V 4.7 sugiere que compita ahí, y sin una tarjeta ni siquiera puedes comprobar si emite coordenadas.

Para el trabajo multimodal general —describir imágenes, leer documentos, análisis de contexto largo sobre material con muchas imágenes—, la comparación aún no es decidible, porque una de las partes no tiene evidencia de calidad publicada. Si lo necesitas hoy, UI-Venus 2.9B al menos es medible, aunque fue ajustado para interfaces en lugar de para razonamiento sobre documentos y tampoco es una primera opción obvia para esa tarea.

El patrón en ambos casos es el mismo: un modelo autoalojado que se encarga del trabajo rutinario, y un modelo frontera alojado para los casos difíciles que le pasa. Ese traspaso es donde un enrutador se gana su lugar — una clave para más de 200 modelos alojados, cada uno pasado al precio de lista del proveedor sin margen nuestro, con conmutación por error automática cuando un proveedor se degrada. Ni UI-Venus 2.9B ni MiniCPM-V 4.7 están alojados en OrcaRouter; ambos son pesos que ejecutas tú mismo. El enrutador es con quien habla tu agente cuando decide que el modelo local no es suficiente.

Dónde te deja esto

Esto no es una decisión reñida, y la razón es estructural en lugar de un juicio sobre la calidad. UI-Venus 2.9B es un especialista con un informe, una licencia, tablas de benchmark, evaluación de seguridad y una receta de servicio. MiniCPM-V 4.7 es un generalista con un archivo de configuración. Uno de ellos es un producto y el otro es una promesa, y la única forma responsable de compararlos es decirlo. Vigila el repositorio: si OpenBMB publica una tarjeta que muestre grounding de interfaz y salida de acciones, entonces un MoE disperso con contexto de 256K frente a un agente destilado de 9B se convierte en una pregunta verdaderamente interesante. Hasta entonces, la respuesta a «cuál debería usar» es la que existe.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario