
MiniCPM-V 4.7 vs UI-Venus 2.9B: un modelo de visión general frente a un agente GUI de propósito específico
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
MiniCPM-V 4.7 y UI-Venus 2.9B son ambos modelos de visión-lenguaje que observan una captura de pantalla y producen texto, y ahí termina el parecido — porque uno de ellos fue construido exactamente para esa tarea. UI-Venus 2.9B es un agente GUI de propósito general de inclusionAI, publicado el 26 de agosto de 2026, cuyo diseño completo se centra en observar una interfaz, razonar sobre el estado de la tarea, emitir una acción e incorporar la retroalimentación resultante; incluye un informe técnico, tablas de benchmark de tareas de grounding de GUI, móviles, web, uso de computadora y CAPTCHA, y una evaluación explícita de con qué frecuencia se puede convencer para que realice una acción peligrosa. MiniCPM-V 4.7 es un checkpoint de mezcla dispersa de expertos de 35,2 mil millones de parámetros subido por OpenBMB el 6 de octubre de 2026, sin tarjeta de modelo, sin licencia y sin benchmark. Comparar a un especialista con un generalista no medido es un ejercicio algo inusual, y esta página es explícita sobre dónde se sostiene la comparación y dónde no.
Dos tipos de lanzamiento muy diferentes
UI-Venus 2.9B es inclusionAI/UI-Venus-2-9B, un modelo de 9B parámetros inicializado a partir de Qwen3.5-9B y post-entrenado específicamente como agente GUI. La tarjeta describe un bucle cerrado — observar la interfaz, razonar sobre el estado de la tarea, ejecutar una acción, incorporar la retroalimentación en la siguiente decisión — entrenado en tres etapas: entrenamiento intermedio multimodal sobre trayectorias simuladas a gran escala de móvil, web y escritorio; aprendizaje por refuerzo offline dividido en cinco familias de tareas; y destilación on-policy con múltiples maestros que consolida maestros especializados en dominios en una única política. Se evalúa en benchmarks de grounding de GUI, móvil, web, uso de computadora y CAPTCHA, y por separado en seguridad de acciones consecuentes: la tarjeta reporta una tasa de éxito de ataque del 11,3% en OSHarm y del 48,8% en OSBlind frente al 25,3% y 79,4% de su base Qwen3.5-9B. El propio proyecto hermano de OpenBMB, por cierto, examinó un terreno similar: la organización MiniCPM tiene un proyecto AgentCPM-GUI de enero de 2026, por lo que este es un carril en el que ambos laboratorios han entrado.
MiniCPM-V 4.7 es openbmb/MiniCPM-V-4.7-35B-A3B, 35.212.875.824 parámetros BF16 repartidos en 70,4 GB y dieciséis fragmentos, subido el 6 de octubre de 2026.

Backbone de texto MoE disperso etiquetado como qwen3_5_moe_text — 256 expertos, 8 por token — más de 40 capas con un patrón de atención de tres lineales a una completa, una torre de visión propia de 27 capas con submuestreo de 16× y hasta nueve fragmentos de imagen, y una ventana de contexto de 256K. Sin README, por lo tanto, sin licencia y sin benchmarks. Tres me gusta, cero descargas, discusiones vacías.
La comparación, con los huecos dejados abiertos
• Propósito — UI-Venus 2.9B: un agente de GUI, entrenado de extremo a extremo para la interacción con interfaces. MiniCPM-V 4.7: un modelo general de visión-lenguaje; no se indica para qué está optimizado.
• Parámetros — UI-Venus 2.9B: 9.41B, denso. MiniCPM-V 4.7: 35.2B en total, disperso, 8 de 256 expertos por token.
• Modelo base — UI-Venus 2.9B: inicializado a partir de Qwen3.5-9B, un stack de texto denso de Qwen. MiniCPM-V 4.7: un stack de texto MoE derivado de Qwen3.5, clase qwen3_5_moe_text. Diferentes ramas del mismo árbol genealógico.
• Anclaje de interfaz — UI-Venus 2.9B: la competencia central, con familias de tareas dedicadas de anclaje y CAPTCHA en el entrenamiento y un sistema de verificación anclado en puntos clave que utiliza votación multi-modelo. MiniCPM-V 4.7: ninguna afirmación específica de anclaje, y ningún formato de salida de coordenadas documentado.
• Evaluación de seguridad — UI-Venus 2.9B: reporta un ASR del 11,3 % en OSHarm y del 48,8 % en OSBlind. MiniCPM-V 4.7: ninguno.
• Evidencia — UI-Venus 2.9B: un informe técnico en arXiv, una página de proyecto, un repositorio de GitHub y tablas de benchmarks. MiniCPM-V 4.7: un archivo de configuración.
• Herramientas — UI-Venus 2.9B: inicio rápido con vLLM mediante un flag de analizador de razonamiento, además de conversiones GGUF de la comunidad. MiniCPM-V 4.7: todavía nada.

Por qué un agente GUI no es solo «un VLM que mira pantallas»
La diferencia entre estos dos modelos no radica principalmente en el número de parámetros, y vale la pena explicarlo con claridad porque es lo que hace que el enfrentamiento sea interesante en lugar de meramente desigual.
Una tarea de captura de pantalla tiene una propiedad que la mayoría de los benchmarks de visión no tiene: la salida tiene que ser ejecutable. Cuando a UI-Venus 2.9B se le pide que toque un botón, tiene que emitir una coordenada o una acción estructurada que el entorno pueda aplicar realmente, y un pequeño error de anclaje no es una respuesta incorrecta en una tabla de clasificación, sino una tarea fallida y un estado corrupto. Por eso la tarjeta de UI-Venus 2 dedica buena parte de su extensión a la verificación: la finalización de la tarea se juzga según puntos clave visuales relevantes para la tarea en lugar de un vistazo holístico a la pantalla final, y jueces heterogéneos votan para reducir el sesgo de un único juez. El propósito de ese mecanismo es hacer que la señal de recompensa del aprendizaje por refuerzo sea robusta frente al reward hacking —un modelo que aprende a satisfacer a un verificador perezoso en lugar de completar la tarea.
También explica la sección de seguridad.

Un agente capaz de operar un teléfono o una computadora de escritorio tiene una superficie de ataque que un modelo de subtitulado no tiene, e informar una tasa de éxito de ataques es lo mínimo que un laboratorio debería hacer al lanzar uno. UI-Venus 2.9B reporta 11,3 % en OSHarm y 48,8 % en OSBlind —la segunda cifra es alta en términos absolutos, y el enfoque de la ficha es una comparación con su modelo base en lugar de una afirmación absoluta de robustez. Léelo como “significativamente mejor que donde empezó”, no como “seguro”.
La arquitectura de MiniCPM-V 4.7 no tiene nada que decir sobre nada de esto. La atención lineal sobre un contexto largo ayudaría a un agente que tiene que recordar un historial de interacción extenso, y el MoE disperso ayudaría al rendimiento si se ejecutan muchos episodios. Pero una arquitectura que sería útil para un agente no es un agente, y ninguna parte del artefacto publicado documenta la salida de acciones, la precisión del anclaje ni el comportamiento de seguridad.
La evaluación honesta del lado de MiniCPM
Es tentador llenar esta sección con las cifras de 4.6. Resístete. MiniCPM-V 4.6 es un modelo denso de 1.3B sobre un backbone Qwen3.5-0.8B con un esquema de compresión visual conmutable 4x/16x, y sus resultados anunciados —una puntuación de 13 en el Artificial Analysis Intelligence Index, reportada por el proveedor, a una fracción del coste en tokens de modelos pequeños comparables— describen a ese modelo. MiniCPM-V 4.7 cambia el backbone, cambia el patrón de atención y cambia la compresión visual predeterminada. Ninguna de las mediciones de 4.6 es transferible, y ninguna de ellas describe a un agente de GUI en primer lugar.
Lo que honestamente se puede decir sobre MiniCPM-V 4.7 es limitado y fáctico: los pesos existen, la forma es inusual para la familia, la ventana de contexto es larga y la publicación está incompleta. La ausencia de una licencia es el obstáculo práctico; la ausencia de benchmarks es el evaluativo. Y hay una modesta razón para el interés en lugar de la indiferencia: OpenBMB desarrolla herramientas de GUI, entre ellas AgentCPM-GUI, así que un modelo de visión MoE disperso de contexto largo de ese laboratorio no es inverosímil como futura columna vertebral de agentes. Esa es una hipótesis sobre la intención, y el repositorio no la confirma.
Qué elegirías, y cuándo
Para cualquier cosa que implique una captura de pantalla y una acción —tocar, escribir, desplazarse, navegar por una aplicación o un sitio web, extraer datos de una interfaz de usuario—, UI-Venus 2.9B es el único de los dos que aborda la tarea. Tiene el entrenamiento, la maquinaria de verificación, las cifras de seguridad reportadas y suficientes herramientas para ponerlo en marcha en vLLM hoy mismo. Nada en MiniCPM-V 4.7 sugiere que compita ahí, y sin una tarjeta ni siquiera puedes comprobar si emite coordenadas.
Para el trabajo multimodal general —describir imágenes, leer documentos, análisis de contexto largo sobre material con muchas imágenes—, la comparación aún no es decidible, porque una de las partes no tiene evidencia de calidad publicada. Si lo necesitas hoy, UI-Venus 2.9B al menos es medible, aunque fue ajustado para interfaces en lugar de para razonamiento sobre documentos y tampoco es una primera opción obvia para esa tarea.
El patrón en ambos casos es el mismo: un modelo autoalojado que se encarga del trabajo rutinario, y un modelo frontera alojado para los casos difíciles que le pasa. Ese traspaso es donde un enrutador se gana su lugar — una clave para más de 200 modelos alojados, cada uno pasado al precio de lista del proveedor sin margen nuestro, con conmutación por error automática cuando un proveedor se degrada. Ni UI-Venus 2.9B ni MiniCPM-V 4.7 están alojados en OrcaRouter; ambos son pesos que ejecutas tú mismo. El enrutador es con quien habla tu agente cuando decide que el modelo local no es suficiente.
Dónde te deja esto
Esto no es una decisión reñida, y la razón es estructural en lugar de un juicio sobre la calidad. UI-Venus 2.9B es un especialista con un informe, una licencia, tablas de benchmark, evaluación de seguridad y una receta de servicio. MiniCPM-V 4.7 es un generalista con un archivo de configuración. Uno de ellos es un producto y el otro es una promesa, y la única forma responsable de compararlos es decirlo. Vigila el repositorio: si OpenBMB publica una tarjeta que muestre grounding de interfaz y salida de acciones, entonces un MoE disperso con contexto de 256K frente a un agente destilado de 9B se convierte en una pregunta verdaderamente interesante. Hasta entonces, la respuesta a «cuál debería usar» es la que existe.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
