
UI-Venus-2-9B vs Microsoft Mage-VL: El Agente de Capturas de Pantalla vs el Observador de Flujos de Códec
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Tanto UI-Venus-2-9B como Microsoft Mage-VL se lanzaron discretamente con menos de un mes de diferencia: el repositorio de Mage-VL apareció el 26 de julio de 2026, y el de UI-Venus-2-9B el 26 de agosto de 2026. Ambos tienen pesos abiertos bajo Apache-2.0 y ambos se basan en backbones de la familia Qwen. Ahí es más o menos donde terminan las similitudes, y la diferencia no es de grado, sino de qué lado de la pantalla habita cada modelo. Microsoft Mage-VL es un modelo de percepción en streaming nativo de códec: observa vídeo comprimido, permanece en silencio durante las imágenes rutinarias y emite texto cuando un evento se completa. UI-Venus-2-9B es un agente de interfaz gráfica (GUI): consume una captura de pantalla estática, razona sobre el estado y emite una acción estructurada. Uno mira la pantalla y la describe; el otro mira la pantalla y la opera. Elegir entre ellos no es una decisión de benchmarks, porque no comparten un solo benchmark: es una decisión sobre si tu automatización termina en una respuesta o en una acción.
Lo que cada modelo realmente es
Microsoft Mage-VL, publicado en el repositorio microsoft/Mage-VL sin ningún anuncio, es un modelo multimodal de aproximadamente 4 mil millones de parámetros construido a partir de un decodificador de lenguaje Qwen3-4B-Instruct-2507, un codificador visual desarrollado desde cero llamado Mage-ViT y una puerta de transmisión independiente de ~0.5B. Su diseño es nativo de códec de video: en lugar de muestrear fotogramas de manera uniforme, conserva los fotogramas ancla (I) completos y retiene solo los parches con movimiento relevante de los fotogramas predichos (P), lo que, según Microsoft, reduce el consumo de tokens visuales en más de un 75 % y ofrece una aceleración de inferencia de hasta 3.5× en tiempo de reloj en comparación con el muestreo uniforme. Un diseño de dos procesos —la puerta de cognición del Sistema 1 supervisa cada ventana de códec deslizante, y el VLM del Sistema 2 solo se activa cuando un evento merece una respuesta— lo convierte en un vigilante de video siempre activo que resulta económico precisamente porque permanece en silencio la mayor parte del tiempo.
UI-Venus-2-9B, publicado por inclusionAI (el laboratorio del equipo Venus del grupo Ant), es un agente GUI de propósito general de 9B inicializado a partir de Qwen3.5-9B. Observa una interfaz, razona sobre el estado de la tarea, ejecuta una acción e incorpora retroalimentación — un ciclo cerrado de observar–razonar–actuar–retroalimentar — y su ficha técnica afirma cobertura de entrenamiento sobre aplicaciones móviles, plataformas web y sistemas operativos de escritorio en un solo checkpoint. En su propia ficha técnica reporta AndroidWorld 80.2, OSWorld-Verified 70.8, WebVoyager 90.8 y ScreenSpot-Pro 73.0, todos reportados por el proveedor y ninguno reproducido de forma independiente.
La brecha de entrada: píxeles que capturas frente a una transmisión que conservas.
La diferencia más instructiva es qué come cada modelo. UI-Venus-2-9B es un agente de capturas de pantalla: su entrada es la pantalla actual, un fotograma a la vez, y su ventana de contexto de 256K tokens es cómo mantiene un historial de esos fotogramas a lo largo de una tarea larga. Mage-VL es un agente de flujo: su entrada es video comprimido, y su eficiencia proviene de tratar el movimiento entre fotogramas como datos — vectores de movimiento y energía residual para códecs tradicionales, mapas de tasa aprendidos para los neuronales. Esta es la diferencia entre un modelo que ve momentos y un modelo que ve una línea temporal continua. Un agente de capturas es estructuralmente ciego a los 100 milisegundos entre capturas — el indicador de carga, la transición de carga, el estado de hover que solo existe brevemente en pantalla. Un observador de flujo vive dentro de ese hueco. Eso no es un defecto en ninguno de los dos diseños; es por lo que un agente de GUI que necesita actuar sobre una pantalla en vivo y un modelo de percepción que necesita resumir un feed son productos diferentes con contratos de entrada diferentes.

La brecha de producción: acciones versus comentarios
El lado de la salida es donde los dos dejan de ser comparables. La salida de UI-Venus-2-9B es una acción estructurada en un espacio de acciones definido — ratón, teclado, desplazamiento, navegación — que emite tras tokens de razonamiento estilo Qwen3, y su entrenamiento se construye en torno a tareas de grounding y CAPTCHA que recompensan la localización precisa de elementos bajo desorden visual. La salida de Mage-VL es texto: comentario activado por eventos sobre lo que ve. No tiene espacio de acciones, ni llamadas a funciones, ni bucle de agente. Lee las dos fichas de modelo una al lado de la otra y estás viendo los lados opuestos de la línea percepción–acción: Mage-VL termina en una descripción, UI-Venus-2-9B termina en un clic.
• Trabajo — UI-Venus-2-9B: agente de GUI, opera la interfaz. Microsoft Mage-VL: percepción en streaming, describe la interfaz.
• Entrada — UI-Venus-2-9B: capturas de pantalla estáticas, historial de 256K tokens. Microsoft Mage-VL: flujos de códec de video comprimido, dispersión de tokens por relevancia de movimiento.
• Salida — UI-Venus-2-9B: acciones estructuradas de mouse/teclado/navegación. Microsoft Mage-VL: comentario de texto activado por eventos.
• Tamaño — UI-Venus-2-9B: 9B. Microsoft Mage-VL: ~4B + ~0.5B streaming gate.
• Backbone — UI-Venus-2-9B: Qwen3.5-9B. Microsoft Mage-VL: Qwen3-4B-Instruct-2507 más Mage-ViT desde cero.
• Licencia — ambos Apache-2.0 (las notas de la ficha de Mage-VL indican solo fines de investigación en su repositorio).
La brecha de servicio
Aquí el modelo más nuevo y grande es el más fácil de ejecutar. UI-Venus-2-9B documenta un único comando de vLLM con una ventana de contexto de 256K y una API estándar compatible con OpenAI. Mage-VL requiere trust_remote_code para ejecutar el Python personalizado de Microsoft, además de FFmpeg, una ruta de neural-codec para video y dependencias como mamba-ssm, y todavía no tiene una pila de servicio de vLLM o SGLang: sin atención paginada, sin ruta de servicio de producción. Microsoft reporta alrededor de 10.6 GB de parámetros BF16 en total, lo que significa que una GPU de 16 GB es un mínimo realista para trabajo con imágenes y 24 GB+ para video largo. Para un equipo que quiera poner algo en producción hoy, UI-Venus-2-9B tiene la rampa de entrada más limpia; para un equipo que construye un pipeline de monitoreo o resumen siempre activo, la pila de servicio de Mage-VL es lo que aceptas de todos modos, Python personalizado y todo.
Un marcador que no existe
No existe un benchmark compartido entre estos dos modelos, e inventar uno sería deshonesto. Los números de UI-Venus-2-9B viven en tableros de grounding de GUI, móvil, web y uso de computadora (ScreenSpot-Pro 73.0, AndroidWorld 80.2, WebVoyager 90.8, OSWorld-Verified 70.8, todos reportados por el proveedor). Los números de Mage-VL viven en tableros de comprensión de video y espaciales (Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, VSI-Bench +11.0 sobre Qwen3-VL-4B, todos reportados por el proveedor). La forma correcta de leer el enfrentamiento es como una bifurcación en el camino: si la tarea es "entender qué está sucediendo en esta pantalla a lo largo del tiempo", Mage-VL es la herramienta relevante y UI-Venus-2-9B no está construido para eso; si la tarea es "hacer que esta pantalla haga algo", ocurre lo contrario.
Donde los dos componen
La versión interesante de esta comparación no es una disyuntiva. Un agente de interfaz gráfica que opera una aplicación en vivo tiene un punto ciego genuino: el tiempo entre capturas de pantalla y cualquier cambio de estado que nunca se estabiliza en un fotograma estático; y un observador de flujos nativo de códec es exactamente el tipo de modelo que podría actuar como capa de percepción en esa brecha, detectando que una página terminó de cargar o que un modal terminó de animarse antes de la siguiente pasada de anclaje del agente. Microsoft no construyó Mage-VL para esa tarea, y Ant Group no construyó UI-Venus-2-9B para ser dirigido por un segundo modelo, pero el encaje es real. Para las partes de esa pila que ya están listas para producción — el LLM planificador que descompone una tarea, el modelo de visión que verifica el estado de una pantalla, el modelo de transcripción que registra la sesión de un agente — una API con precios de traspaso y conmutación automática ante fallos es lo que abarata el experimento, y para eso sirve un enrutador. Ni UI-Venus-2-9B ni Microsoft Mage-VL se sirven hoy a través de OrcaRouter; ambos son proyectos autoalojados de pesos abiertos, y ambos aparecerían al precio de lista del proveedor si alguna vez llegaran a un proveedor enrutado.


Quién debería elegir cuál
Elige Microsoft Mage-VL cuando tu problema sea la percepción continua: una transmisión de cámara, una grabación de pantalla, una secuencia que necesites resumir o monitorear en tiempo real, con un costo suficientemente bajo para mantenerla en funcionamiento. Elige UI-Venus-2-9B cuando tu problema sea el control: una tarea que termina en una acción completada, un formulario llenado, un flujo navegado, una aplicación operada. Y si tu automatización realmente necesita ambas cosas (percibir la transmisión y luego actuar sobre la imagen fija), ejecútalas como un par y trata al vigilante de la transmisión como el detector de eventos que alimenta a un agente de capturas de pantalla con los momentos que vale la pena aprovechar. Son dos mitades de la misma pantalla, no competidoras por el mismo trabajo.
