Una tarjeta de título generada en el estilo corporativo de OrcaRouter que dice “PixelUMM vs UI-Mate-27B”, con cuatro tarjetas de estadísticas: “77.0” (el promedio reportado de UI-Mate-27B en OSWorld-Verified), “66.2” (su promedio en WindowsAgentArena), “ninguno” (el espacio de acciones de PixelUMM) y “Apache-2.0” (la licencia de UI-Mate-27B sobre código y pesos, frente al checkpoint no comercial de PixelUMM). Una línea de pie de página dice “Puntuaciones de agentes reportadas por Tencent; las cifras de PixelUMM provienen de su preprint. Sin reejecución independiente.”. El logotipo de OrcaRouter está integrado en la franja con relleno de la esquina inferior derecha.
Guides & Insights

PixelUMM vs. UI-Mate-27B: un modelo dibuja lo que ve, el otro hace clic en ello

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Tencent UI-Mate-27B y NVIDIA PixelUMM parecen comparables sobre el papel — 27 mil millones de parámetros frente a unos 15,2 mil millones, ambos de descarga abierta, ambos construidos sobre bases Qwen — y no son comparables en absoluto. UI-Mate-27B es un agente GUI fundacional: observa capturas de pantalla en vivo, planifica a partir de lo que hay en pantalla en ese momento y emite acciones estructuradas de ratón y teclado para un escritorio real. PixelUMM es un modelo multimodal unificado sin codificador que lee imágenes y vídeo en el espacio de píxeles en bruto y genera imágenes y vídeo a partir de texto: percibe y crea, pero no tiene espacio de acción, ni cursor, ni forma alguna de tocar una pantalla. Uno actúa sobre el mundo. El otro lo describe y lo representa. Todo lo que sigue se deriva de esa división, y la brecha de licencias entre ambos es lo segundo que hay que saber.

Ambos laboratorios reportan sus propias cifras y ninguno cuenta con una evaluación independiente. Ambos se publicaron discretamente — el estilo de la publicación es donde en realidad termina el parecido.

Actor y perceptor

UI-Mate-27B ejecuta una tarea a partir de una instrucción en lenguaje natural y capturas de pantalla en vivo por sí solas. Razona sobre el estado visible, replanifica a medida que la interfaz cambia y genera razonamiento, una descripción concisa de la acción y llamadas estructuradas a herramientas de uso de computadora que abarcan ratón, teclado, desplazamiento, espera, interacción con el usuario y finalización de tareas. Su característica distintiva es la ejecución guiada por demostración: muéstrale un flujo de trabajo una vez y adapta la demostración grabada a la tarea en cuestión, tratando la captura de pantalla actual como autoritativa cuando la interfaz ha avanzado. Se ajusta finamente a partir de Qwen3.6-27B con ajuste fino supervisado seguido de aprendizaje por refuerzo en línea en entornos GUI ejecutables, y se sirve a través de vLLM con una interfaz compatible con OpenAI.

• Benchmarks reportados — promedio de 77.0 en OSWorld-Verified, promedio de 66.2 en WindowsAgentArena, éxito estricto de 41.00 y progreso de 76.86 en OSWorkerBench. Todos reportados por Tencent y sin reproducir.

• Espacio de acción — ratón, teclado, desplazamiento, espera, interacción del usuario, finalización de tareas, en un espacio de coordenadas normalizado con llamadas estructuradas compatibles con pyautogui.

• Realidad del hardware — 27B denso, servido con paralelismo de tensores en dos GPU en el propio inicio rápido de Tencent, bajo Apache-2.0.

• Una advertencia importante sobre la propia tarjeta — UI-Mate-27B es un checkpoint de agente en lugar de un modelo de chat visual independiente. Tencent recomienda el prompt oficial, el analizador de respuestas y el arnés de interacción de su repositorio. Si lo apuntas a “describe esta imagen”, estás usando la herramienta equivocada.

PixelUMM ocupa el polo opuesto. Toda su arquitectura es un argumento sobre la representación: sin VAE, sin codificador de visión, imágenes como parches de píxeles de 16×16 y videos como tublets espaciotemporales de 4 fotogramas, directamente en un Transformer solo decodificador mediante proyecciones lineales de una sola capa, con un diseño de Mixture-of-Transformers que combina atención compartida con parámetros específicos de la tarea. La comprensión es texto autorregresivo; la generación es flow matching en el espacio de píxeles. Se lanzan cuatro checkpoints, S8-F22-R05 como el predeterminado que cubre texto a imagen, texto a video a 96 fotogramas y 24 fps, y ambas direcciones de comprensión.

A headless-browser capture of the Hugging Face model card for the Tencent UI-Mate-27B repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

Los dos patrones de lanzamiento son un estudio en contrastes.

UI-Mate-27B apareció en Hugging Face el 14 de agosto de 2026 con una tarjeta del modelo, una preimpresión de arXiv numerada 2608.15930, una página del proyecto, un repositorio de GitHub y una receta de servicio documentada. Entre entonces y principios de octubre acumuló aproximadamente 780 descargas y 93 me gusta: modesto, pero un lanzamiento normal de agente de investigación con la documentación en regla.

La huella de PixelUMM es de distinta naturaleza. El repositorio de GitHub se creó el 4 de septiembre de 2026; la prepublicación de arXiv está fechada el 29 de septiembre; el repositorio de Hugging Face se creó a las 21:40 UTC del 1 de octubre de 2026, minutos después del commit final del repositorio. No apareció ninguna entrada de blog, comunicado de prensa ni hilo de lanzamiento de NVIDIA al respecto. La propia ruta URL de la página del proyecto todavía dice pixelumm-project-page-preview. Su recuento de descargas era cero cuando se escribió esto.

Atribuirle intención a eso es un error: un laboratorio puede publicar un artefacto de investigación y programar un lanzamiento para más adelante. Lo que se puede saber es más limitado y más útil: un modelo tiene una ruta oficial de servicio y diez semanas de descargas; el otro tiene un artículo, un repositorio y ninguna declaración del proveedor en absoluto.

A generated scoreboard card titled “PixelUMM vs UI-Mate-27B — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: role, backbone, headline benchmarks, action space, deployment and licence. UI-Mate-27B's column shows a foundation GUI agent, a Qwen3.6-27B fine-tune, OSWorld-Verified 77.0 with WindowsAgentArena 66.2, mouse, keyboard, scrolling, waiting and task-completion calls, 27B dense across roughly two GPUs under vLLM, and Apache-2.0; PixelUMM's column shows an encoder-free perceiver and generator, about 15.2B total on a Qwen3-8B backbone, MMMU 41.67 with GenEval 0.83 and VBench Part 1 quality 84.10, no action space, about 30 GB of distributed-checkpoint shards behind a hidden index, and a noncommercial checkpoint licence. A footer notes the agent scores are Tencent-reported and the generation scores are from the PixelUMM preprint, with no independent rerun of either.

Marcadores que no se superponen

No hay ningún benchmark que ambos modelos reporten, lo cual es en sí mismo el punto: no están resolviendo el mismo problema.

• Uso agéntico de la computadora — UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2. PixelUMM: sin espacio de acción, por lo que no es posible obtener puntuación.

• Comprensión de imágenes — UI-Mate-27B: consume capturas de pantalla como entrada del agente, no se evalúa como un VLM general. PixelUMM: MMMU 41.67, AI2D 80.12, DocVQA 90.42, ChartQA 82.96, OCRBench 78.00.

• Vídeo — UI-Mate-27B: ninguno. PixelUMM: MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, LVBench 40.41.

• Generación — UI-Mate-27B: ninguno. PixelUMM: GenEval 0,83 con un reescritor de prompts, DPG-Bench 85,74, VBench Parte 1 calidad 84,10.

• Costo de despliegue — UI-Mate-27B: 27B denso repartido entre aproximadamente dos GPU mediante vLLM, más el harness oficial. PixelUMM: unos 30 GB de fragmentos de checkpoint distribuido, CUDA 13 con FlashAttention compilado desde el código fuente, un modelo de salvaguarda con acceso restringido para la ruta de video y un segundo entorno de Python para ello.

• Licencia — UI-Mate-27B: Apache-2.0, código y pesos. PixelUMM: código Apache-2.0, licencia NVIDIA One-Way Noncommercial sobre el checkpoint.

• Escala — 27B densos frente a unos 15,2B en total, representado como «8B MoT» en las propias tablas del artículo de PixelUMM.

La única afirmación genuinamente comparable es sobre la procedencia, y se aplica a ambos: cada número anterior es del propio proveedor, ninguno se ha vuelto a ejecutar fuera del laboratorio que lo produjo, y uno de los dos modelos etiqueta explícitamente sus propios resultados como preliminares.

Construir con ellos, y por qué podrías usar ambos

Estos dos se complementan mejor de lo que compiten. Una pila de automatización de escritorio quiere UI-Mate-27B para la capa de actuación y algo que pueda razonar sobre lo que vio; una canalización de contenido o inspección quiere la lectura y generación de PixelUMM y no tiene uso para un cursor. La superposición está en el límite de percepción, donde la fundamentación de capturas de pantalla de UI-Mate-27B es específica de la tarea y la de PixelUMM es general — los mismos píxeles, dos trabajos completamente diferentes.

Cuando comparas varios modelos entre sí — el agente frente a un VLM generalista, o un nuevo checkpoint de investigación frente al que ya está en producción — el coste de la comparación normalmente es la integración, no la inferencia: dos formas de API, dos esquemas de autenticación, dos contratos. Ese es el problema que una capa de enrutamiento existe para eliminar, y es donde el diseño de OrcaRouter da sus frutos: una sola clave para más de 200 modelos, precios de lista de los proveedores traspasados sin margen alguno (0 % de recargo), conmutación automática entre proveedores ante fallos, y un DSL de enrutamiento más fusión de modelos para componer varios modelos en una sola llamada. Ni PixelUMM ni UI-Mate-27B están hoy en ningún endpoint alojado, y OrcaRouter no enruta ninguno de los dos — así que esto va del flujo de trabajo para cuando lo estén, no es una afirmación sobre su disponibilidad actual.

¿Cuál para qué trabajo?

Si la tarea termina con un clic, una pulsación de tecla o un formulario rellenado, aquí solo hay un candidato y es UI-Mate-27B. Es Apache-2.0, tiene un artículo en arXiv y un harness oficial, y sus puntuaciones reportadas en OSWorld y WindowsAgentArena son el tipo de afirmación que cualquiera con dos GPU y una imagen de prueba de Windows o Ubuntu puede verificar, que es exactamente lo que hace que merezca la pena comprobarlo en lugar de confiar en él.

Si la tarea termina con una respuesta o una imagen, PixelUMM es el que puede hacerlo, y ante todo es un artefacto de investigación. Su artículo es inusualmente honesto sobre sus propios límites, al admitir que los distintos datos de entrenamiento hacen que su comparación de benchmarks "no pueda establecer qué arquitectura es superior". Su checkpoint no es comercial. Sus fortalezas son la novedad arquitectónica y la amplitud, no las cifras de vanguardia, y su valor inmediato es para cualquiera que estudie si los modelos unificados sin codificador funcionan a escala de vídeo. Descárgalo para leer el código y ejecutar las demos; no lo descargues para lanzar una funcionalidad.

El resumen de dos líneas es el mismo que ofrecen las pruebas: un modelo puede actuar y no puede crear, el otro puede crear y no puede actuar, y la brecha de licencias y madurez entre ambos importa más que cualquier recuento de parámetros.